AI 照片說話生成器
上傳一張人像和你想說的話。AI 照片說話生成器會把它變成一支影片,讓這張臉說出每一個字。
- 一張照片就夠
- 任何人聲音軌
- 最高 1080p
- 按秒計費
你會得到一個與音訊等長的 MP4。大多數短片需要 3–5 分鐘。
AI 照片說話範例
這是我們自己的一次測試:一張人像加上一句語音,變成了一支說話影片。請打開聲音。

他用英文說的台詞:「Hi there. A minute ago this clip was silent. Now every word I say matches my lips.」
標準 · 6.5 秒語音 · 56 點數 · 約 3.5 分鐘
同一張照片、同一句台詞,兩種做法
我們讓同一位男士把同一句台詞說了兩次:一次用 AI 照片說話,一次先讓照片動起來再對嘴。
AI 照片說話
1 步輸入照片和音訊,輸出一支說話影片。一個步驟完成,頭部和臉部會跟著語音一起動。
56 點數
先動起來,再對嘴
2 步先用照片生成一段 8 秒的無聲影片,再依台詞重繪嘴部。需要兩個步驟,但第一步可以自己挑動作。
30 + 64 = 94 點數
如果只需要一張會說話的人像,AI 照片說話更便宜也更簡單。如果需要特定動作、更長的鏡頭或臉部周圍的場景,就先讓照片動起來。
什麼是 AI 照片說話?
AI 照片說話是用一張靜態圖片和一段音軌生成的影片:照片裡的臉會隨著語音張嘴、眨眼和轉頭。你提供一張人像和一段錄音,它就會算繪出這個人說話的每一格畫面。
不用攝影機,就能替聲音配上一張臉。產品介紹、課程開場、家族照片或 AI 角色,幾分鐘就能開口說話,不必花一整天拍攝。
AI 照片說話的原理
模型會讀取音訊,算出每個發音對應的嘴型,以及說話時自然帶出的小動作:重音處點一下頭,提問時揚起眉毛,句子之間眨眼。接著它根據你的照片繪製每一格畫面,在表情變化的同時維持臉、頭髮和衣服不變。
保留的部分
人物的身分、髮型、穿著、背景,以及照片的構圖。
增加的部分
與台詞吻合的嘴唇動作、自然的眨眼、輕微的頭部和肩膀動作,並以你的音訊作為音軌。
3 步驟讓照片開口說話
整個 AI 照片說話流程都在瀏覽器中完成,不需要攝影機,也不需要剪輯軟體。
上傳人像
一張 JPG 或 PNG,畫面中有一張面向鏡頭的臉,每邊至少 300 像素。
加入語音
一段 MP3、WAV、M4A 或 AAC 錄音。標準和高畫質最長 15 秒,電影級最長 30 秒。
選擇等級並生成
選擇畫質,勾選同意確認框,然後點擊「開始生成」。大多數短片三到五分鐘就能完成。
標準、高畫質還是電影級:該選哪一個
每個等級使用的照片和音訊都一樣,差別在於清晰度、語音可以多長,以及動作有多逼真。
標準
每秒 8 點數
- 輸出
- 720p
- 最長音訊
- 15 秒
社群貼文、草稿和快速測試。上方範例用的就是標準。
高畫質
每秒 16 點數
- 輸出
- 1080p
- 最長音訊
- 15 秒
主持人影片、廣告,以及任何要在電腦上全螢幕播放的內容。
電影級
每秒 27 點數
- 輸出
- 1080p
- 最長音訊
- 30 秒
較長的談話、富有表現力的演繹,以及最逼真的頭部和身體動作。
什麼樣的照片效果好
AI 照片說話只能讓它看得到的部分動起來。下面五點影響最大。
臉朝向鏡頭
正臉或略微側臉。完全側臉只看得到半張嘴。
原因
模型需要看到兩側嘴角,才能做出每個字的嘴型。
嘴巴閉合、放鬆
自然表情或淺淺的微笑,能給模型留出自然張嘴的空間。
原因
照片裡咧嘴大笑或張著嘴,會和每個字的嘴型衝突。
清晰、光線充足
臉部光線均勻,沒有濃重陰影,每邊至少 300 像素。
原因
眼睛和嘴唇周圍的細節,決定了動作是否可信。
只有一個人
把合照裁切到你想讓他說話的那張臉。
原因
有多張臉時,可能會讓錯的人開口。
臉前沒有遮擋
不要有手、麥克風、太陽眼鏡或頭髮擋住嘴巴。
原因
被遮擋的部位會畫得很差,甚至完全畫不出來。
如何準備音訊
影片的長度與音訊完全相同,你也依這些秒數付費。稍微準備一下就能省下點數。
- 1
剪掉靜音
剪掉開頭和結尾的安靜片段。它們和語音的價格一樣。
- 2
一個清楚的聲音
在安靜的房間裡、靠近麥克風錄音。背景音樂或第二個人聲可能會讓嘴唇跟著錯誤的聲音動。
- 3
自然的停頓有幫助
句子之間的短暫停頓讓臉有時間眨眼和復位,看起來更像真人。
- 4
任何語言都可以
嘴型跟著的是發音而不是文字,所以任何口說語言或口音都沒問題。
AI 數位人、對嘴還是原生語音影片?
要讓一個人在螢幕上說出你的台詞,有三種方法。選哪一種取決於你手上有什麼。
AI 照片說話
- 起點
- 一張照片,加上音訊
- 最適合
- 沒有影片素材時製作主持人、數位人和角色
- 注意事項
- 只有頭部和肩膀會動,背景維持靜止
Imgveo 價格
標準 5 秒 40 點數
AI 對嘴
- 起點
- 一段影片,加上音訊
- 最適合
- 替現有的影片配音或修改台詞
- 注意事項
- 影片中需要有清楚的臉
Imgveo 價格
5 秒影片 40 點數
原生語音影片
- 起點
- 寫有台詞的文字提示詞
- 最適合
- 由模型同時生成畫面和聲音的新場景
- 注意事項
- 無法自己指定確切的長相和聲音
Imgveo 價格
8 秒有聲影片 30 點數起
價格讀取自我們的即時價目表。
AI 照片說話應用情境
凡是一張臉比投影片上的文字更能說清楚的地方,都用得上。
主持人和介紹影片
替產品頁、課程或新手引導配上一張親切、會說話的臉。
試試這樣做
每支影片都用同一張人像,讓觀眾認得這位主持人。
AI 角色
讓生成的角色自我介紹、說故事或回覆粉絲。
試試這樣做
生成角色時讓它面向鏡頭、嘴巴閉合,就像我們的範例一樣。
家族照片
讓一張老照片配上親人錄製的話,重新活起來。
試試這樣做
上傳前把照片掃描清楚,並裁切到只剩一張臉。
多語言訊息
用幾種語言錄製同一段話,全部使用同一張人像。
試試這樣做
每段錄音的長度盡量接近,讓幾支影片保持一致。
AI 照片說話做不到的事
誠實說明限制,讓你在花點數之前心裡有數。
全身動作
只有臉、頭部和肩膀會動。走路、手勢和運鏡需要改用影片模型。
側臉和被遮住的嘴
如果半張嘴被擋住,動作會看起來不對。請使用正臉照片。
很長的談話
標準和高畫質最長 15 秒,電影級最長 30 秒。更長的稿子請拆成幾段。
他人的肖像
你需要有權使用這張臉和這個聲音。違反我們規則的內容會被封鎖。
格式、限制和價格
AI 照片說話支援什麼、輸出什麼、價格多少。
輸入
照片:JPG 或 PNG,最大 10 MB,至少 300 px,長寬比不超過 2.5 比 1。音訊:MP3、WAV、M4A 或 AAC,最大 10 MB。
輸出
與音訊等長的 MP4,以你的語音作為音軌,標準為 720p,高畫質和電影級為 1080p。
價格
依音訊長度每秒 8、16 或 27 點數,以整秒計算。僅限付費方案。失敗的任務會退還點數。
依長度計價
| 音訊長度 | 標準 | 高畫質 | 電影級 |
|---|---|---|---|
| 5 秒 | 40 | 80 | 135 |
| 10 秒 | 80 | 160 | 270 |
| 15 秒 | 120 | 240 | 405 |
| 30 秒 | — | — | 810 |
同意與負責任的使用
照片說話可以讓任何人看起來說出任何話,所以我們會先徵求許可。每次執行前,你都需要確認自己有權使用這張臉和這個聲音,而且每張照片都會經過審核。
- 使用你自己的臉、已同意的人,或你生成的角色。
- 不要讓公眾人物、未成年人或一般人看起來說了他們從未說過的話。
- 在平台要求時,把照片說話影片標示為 AI 生成。
AI 照片說話常見問題
想在一個地方用上所有 AI 模型?
打開 Imgveo Studio,在一個工作台裡用同一套點數執行本工具以及所有其他 AI 影片和圖像模型。
更多影片工具
先替它配上聲音,再做得更進一步。
讓你的照片開口說話
上傳一張人像和一段語音,剩下的交給 AI 照片說話生成器,幾分鐘就能完成。