AI 對嘴,適用於任何影片

上傳影片和你想要的語音。AI 對嘴會重繪嘴部,讓每個字都對上,適合配音、改台詞和 AI 角色。

  • 嘴型對上每個字
  • MP4/MOV→MP4
  • 任何人聲音軌
  • 按秒計費

你會得到一個帶有新語音和吻合嘴型的 MP4。大多數短片需要 2–3 分鐘。

AI 對嘴範例

這是我們自己的一次完整測試。打開聲音,在無聲原片和對嘴結果之間切換比較。

他用英文說了這句台詞:「嗨,你好。一分鐘前這段影片還是無聲的,現在我說的每個字都對得上嘴型。」

這段影片是怎麼做出來的

  1. 用作第一個影格的 AI 生成肖像
    01免費

    一張 AI 肖像

    一張不存在的人物照片:正對鏡頭、嘴巴閉合、光線均勻。

  2. 0230 點數

    做成一段無聲影片

    用 Veo 3.1 Lite 從這張照片生成 8 秒影片,人物會眨眼並輕微轉頭。

  3. 0364 點數

    為一句台詞對嘴

    AI 對嘴為每個字重繪了他的嘴部,畫面其餘部分維持原樣。

什麼是 AI 對嘴?

AI 對嘴是一種修改影片中嘴部動作、讓它與新音軌吻合的工具。你提供一段人物影片和想要的語音,它會逐格重繪嘴唇、下顎和牙齒,直到台詞和嘴型完全對上。

它能省下一次重拍。配音廣告、更正的產品名稱、需要聲音的 AI 角色,過去都代表要重新拍攝或手工製作動畫。AI 對嘴用你手上現有的影片就能完成。

AI 對嘴的原理

模型先聽音訊,把它拆成音素,也就是語音中的各個發音。每個發音對應一種嘴型,稱為視素:發 M 時雙唇閉合,發 A 時張大,發 O 時呈圓形。接著模型在每一格畫面中重新繪製下半張臉,準時做出這些嘴型,並與周圍的皮膚和光線融為一體。

/h//a//i//th//e//r/

保留的部分

構圖、背景、光線、頭部動作和臉部其他區域都維持原樣,只重繪嘴部區域。

改變的部分

嘴唇、牙齒和下顎會跟著新的語音動,新音訊會取代影片原本的聲音。

3 步驟替影片對嘴

整個 AI 對嘴流程都在瀏覽器中完成,不需要剪輯軟體,也不需要外掛程式。

01

上傳影片

拖入一段 2 到 60 秒的 MP4 或 MOV。畫面中只有一個人面對鏡頭、嘴部清楚可見時,效果最好。

02

加入語音

上傳 10 MB 以內的 MP3、WAV、M4A 或 AAC 音訊。可以用手機錄音、從語音工具匯出,或使用一段配音。

MP4
03

同步並下載

勾選同意確認框,然後點擊「開始同步」。大多數短片兩到三分鐘就能產出 MP4。

什麼樣的來源影片效果好

AI 對嘴只能重繪它找得到的嘴。以下五點決定它能不能找到。

01

臉朝向鏡頭

正臉或稍微側臉效果最好。完全側臉會擋住一半的嘴唇。

原因

模型需要看到兩側嘴角,才能放準每個嘴型。

02

720p 或更清晰

特寫鏡頭至少使用 720p。臉部太小或模糊,嘴唇會發糊、暈成一片。

原因

嘴部周圍的像素越多,可重繪的細節就越多。

03

畫面中只有一位說話者

鏡頭裡只保留一張清楚的臉。人多時,對嘴可能會套到錯的人身上。

原因

這個工具每段影片只驅動一張臉。

04

嘴部沒有遮擋

手、麥克風、口罩和濃密的鬍子擋住嘴唇都會造成干擾。

原因

嘴部被遮住的部分會重繪得很差,或者完全無法重繪。

05

光線穩定、少模糊

快速轉頭和閃爍的光線會讓嘴部很難逐格追蹤。

原因

動態模糊會遮住模型要修改的嘴型。

音訊和影片長度不一致時

結果會維持影片的長度,費用也依影片秒數計算。以下是兩個檔案長度不一致時的情況。

你的檔案得到的結果建議
音訊與影片一樣長整段影片嘴巴都在動配音的理想情況
音訊比影片短音訊結束後,說話者就停止說話先把影片剪到和音訊一樣長,計費秒數會更少
音訊比影片長音訊會在影片結束處被截斷加快台詞語速,或改用更長的影片

工具會在同步前顯示兩者的長度,長度不一致不會讓你措手不及。

對嘴、照片說話與原生語音影片比較

要取得一段某人說出你台詞的影片,有三種方法。選哪一種取決於你手上有什麼。

AI 對嘴

起點
一段真實或生成的影片,加上音訊
最適合
配音、修改台詞、保留特定鏡頭或演員
注意事項
素材中需要有清楚的臉

Imgveo 價格

5 秒影片 40 點數

照片說話

起點
一張照片,加上音訊
最適合
沒有影片素材時製作虛擬人物、主持人和角色
注意事項
需要兩步驟:先讓照片動起來,再對嘴

Imgveo 價格

30 + 64 = 94 點數(8 秒)

原生語音影片

起點
寫有台詞的文字提示詞
最適合
由模型同時生成畫面和聲音的新場景
注意事項
無法精確掌控聲音和長相

Imgveo 價格

8 秒有聲影片 30 點數起

價格讀取自我們的即時價目表。照片說話這一列正是我們製作上方範例時用的流程。

AI 配音:一段影片,多種語言

AI 對嘴是配音的最後一步。同一段素材不必重拍,就能說西班牙語、日語或德語。

  1. 1

    寫好翻譯後的台詞

    翻譯台詞並大聲念一遍,盡量貼近原句的長度。

  2. 2

    錄製或生成語音

    請母語人士錄音,或從語音工具把台詞匯出為 MP3 或 WAV。

  3. 3

    對齊時間

    剪掉開頭和結尾的靜音,讓語音填滿整段影片。

  4. 4

    執行 AI 對嘴

    上傳原始影片和新音訊。每種語言重複一次。

配合另一種語言的語速

有些語言表達同樣的意思需要更多音節。如果德語台詞偏長,請精簡用字,而不是加快語速,否則聽起來會很趕。AI 對嘴會跟著音訊本身的節奏走。

AI 對嘴應用情境

只要畫面上的人需要說出拍攝當天沒說過的話,就用得上。

01

廣告和產品介紹

修改價格、產品名稱或行動呼籲,不必再約主持人。

試試這樣做

保留一條主持人看著鏡頭的乾淨素材,方便日後修改。

02

配音和在地化

一段影片發布多種語言版本,每種語言的嘴型都對得上。

試試這樣做

先做最重要的市場,確認效果後再做其他語言。

03

AI 角色和虛擬人物

替生成的角色配上聲音,以及一句符合劇情的台詞。

試試這樣做

生成角色時讓它面向鏡頭、嘴巴閉合,就像我們的範例一樣。

04

修正單句台詞

替換演講、課程或社群短片裡說錯的一個字,不必重拍。

試試這樣做

只剪出那一句,對好嘴型,再接回你的剪輯中。

AI 對嘴解決不了的問題

我們用自己的影片測試了它的極限。以下是你可以預期的情況。

一名揮劍的戰士,臉被動作遮住:一段被對嘴拒絕的影片
我們的第一次測試:揮劍的動作遮住了臉,所以沒有偵測到人臉。任務已停止,沒有扣除任何點數。

沒有清楚的臉

如果臉背對鏡頭、太小或因動作而模糊,同步會停止,點數會退還給你。

多人說話

每段影片只同步一張臉。如果是對話,請把每位說話者剪成各自的影片。

聲音和情緒

AI 對嘴對上的是嘴型,不是表演。平淡的錄音聽起來依然平淡。

格式、限制和價格

AI 對嘴支援什麼、輸出什麼、價格多少。

輸入

影片:MP4 或 MOV,2 到 60 秒,最大 100 MB,至少 360p。音訊:MP3、WAV、M4A 或 AAC,最大 10 MB。

輸出

與原始影片等長的 MP4,以新語音作為音軌,嘴型與之吻合。

價格

依影片長度每秒 8 點數,以整秒計算。僅限付費方案。失敗的任務會退還點數。

依長度計價

影片長度點數
5 秒40
10 秒80
30 秒240
60 秒480

同意與負責任的使用

AI 對嘴可以讓人「說出」沒說過的話,所以我們會先徵求許可。每次執行前,你都需要確認自己有權使用影片中的臉和聲音。

  • 使用你自己的臉、已同意的人,或你生成的角色。
  • 不要讓公眾人物、未成年人或一般人看起來說了他們從未說過的話。
  • 在平台要求時,為經過編輯或配音的影片加上標示。

AI 對嘴常見問題

想在一個地方用上所有 AI 模型?

打開 Imgveo Studio,在一個工作台裡用同一套點數執行本工具以及所有其他 AI 影片和圖像模型。

在工作台中開啟

更多影片工具

先做出影片,再替它配上聲音。

替你的影片換上新聲音

上傳影片和你想要的語音,剩下的交給 AI 對嘴,幾分鐘就能完成。