AI 照片说话生成器
上传一张人像和你想说的话。AI 照片说话生成器会把它变成一段视频,让这张脸说出每一个字。
- 一张照片就够
- 任意人声音轨
- 最高 1080p
- 按秒计费
你会得到一个与音频等长的 MP4。大多数短视频需要 3–5 分钟。
AI 照片说话示例
这是我们自己的一次测试:一张人像加一句语音,变成了一段说话视频。请打开声音。

他用英语说的台词:“Hi there. A minute ago this clip was silent. Now every word I say matches my lips.”
标准档 · 6.5 秒语音 · 56 积分 · 约 3.5 分钟
同一张照片、同一句台词,两种做法
我们让同一个男人把同一句台词说了两次:一次用 AI 照片说话,一次先让照片动起来再对口型。
AI 照片说话
1 步输入照片和音频,输出一段说话视频。一步完成,头部和脸部会跟着语音一起动。
56 积分
先动起来,再对口型
2 步先用照片生成一段 8 秒的无声视频,再按台词重绘嘴部。需要两步,但第一步可以自己选动作。
30 + 64 = 94 积分
如果只要一张会说话的人像,AI 照片说话更便宜也更简单。如果需要特定动作、更长的镜头或脸部周围的场景,就先让照片动起来。
什么是 AI 照片说话?
AI 照片说话是用一张静态图片和一段音轨生成的视频:照片里的脸会随着语音张嘴、眨眼和转头。你提供一张人像和一段录音,它就会渲染出这个人说话的每一帧画面。
不用摄像机,就能给声音配上一张脸。产品讲解、课程开场、家庭照片或 AI 角色,几分钟就能开口说话,不用花一整天拍摄。
AI 照片说话的原理
模型会读取音频,算出每个发音对应的嘴型,以及说话时自然带出的小动作:重读时点一下头,提问时扬起眉毛,句子之间眨眼。然后它根据你的照片绘制每一帧,在表情变化的同时保持脸、头发和衣服不变。
保留的部分
人物的身份、发型、衣着、背景,以及照片的构图。
增加的部分
与台词匹配的嘴唇动作、自然的眨眼、轻微的头部和肩部动作,并以你的音频作为音轨。
3 步让照片开口说话
整个 AI 照片说话流程都在浏览器中完成,无需摄像机,也无需剪辑软件。
上传人像
一张 JPG 或 PNG,画面中有一张面向镜头的脸,每边至少 300 像素。
添加语音
一段 MP3、WAV、M4A 或 AAC 录音。标准和高清最长 15 秒,电影级最长 30 秒。
选择档位并生成
选择画质,勾选授权确认框,然后点击“开始生成”。大多数短视频三到五分钟即可完成。
标准、高清还是电影级:该选哪一档
每一档使用的照片和音频都一样,区别在于清晰度、语音能有多长,以及动作有多逼真。
标准
每秒 8 积分
- 输出
- 720p
- 最长音频
- 15 秒
社媒帖子、草稿和快速测试。上面的示例用的就是标准档。
高清
每秒 16 积分
- 输出
- 1080p
- 最长音频
- 15 秒
主持人视频、广告,以及任何要在电脑上全屏播放的内容。
电影级
每秒 27 积分
- 输出
- 1080p
- 最长音频
- 30 秒
较长的讲话、富有表现力的演绎,以及最逼真的头部和身体动作。
什么样的照片效果好
AI 照片说话只能让它看得见的部分动起来。下面五点影响最大。
脸朝向镜头
正脸或略微侧脸。完全侧脸只能看到半张嘴。
原因
模型需要看到两侧嘴角,才能做出每个字的嘴型。
嘴巴闭合、放松
自然表情或浅浅的微笑,能给模型留出自然张嘴的空间。
原因
照片里咧嘴大笑或张着嘴,会和每个字的嘴型冲突。
清晰、光线充足
脸部光线均匀,没有浓重阴影,每边至少 300 像素。
原因
眼睛和嘴唇周围的细节,决定了动作是否可信。
只有一个人
把合照裁剪到你想让他说话的那张脸。
原因
有多张脸时,可能会让错误的人开口。
脸前没有遮挡
不要有手、麦克风、墨镜或头发挡住嘴巴。
原因
被遮挡的部位会画得很差,甚至完全画不出来。
如何准备音频
视频的长度与音频完全相同,你也按这些秒数付费。稍作准备就能省下积分。
- 1
剪掉静音
剪掉开头和结尾的安静片段。它们和语音的价格一样。
- 2
一个清晰的声音
在安静的房间里、靠近麦克风录音。背景音乐或第二个人声可能会让嘴唇跟着错误的声音动。
- 3
自然的停顿有帮助
句子之间的短暂停顿让脸有时间眨眼和复位,看起来更像真人。
- 4
任何语言都可以
嘴型跟随的是发音而不是文字,所以任何口语语言或口音都没问题。
AI 数字人、对口型还是原生语音视频?
要让一个人在屏幕上说出你的台词,有三种方法。选哪种取决于你手上有什么。
AI 照片说话
- 起点
- 一张照片,加上音频
- 最适合
- 没有视频素材时制作主持人、数字人和角色
- 注意事项
- 只有头部和肩部会动,背景保持静止
Imgveo 价格
标准档 5 秒 40 积分
AI 对口型
- 起点
- 一段视频,加上音频
- 最适合
- 给已有的视频配音或修改台词
- 注意事项
- 视频中需要有清晰的脸
Imgveo 价格
5 秒视频 40 积分
原生语音视频
- 起点
- 写有台词的文字提示词
- 最适合
- 由模型同时生成画面和声音的新场景
- 注意事项
- 无法自己指定确切的长相和声音
Imgveo 价格
8 秒带声音视频 30 积分起
价格读取自我们的实时价目表。
AI 照片说话应用场景
凡是一张脸比幻灯片上的文字更能说清楚的地方,都用得上。
主持人和讲解视频
给产品页、课程或新手引导配上一张亲切、会说话的脸。
试试这样做
每个视频都用同一张人像,让观众记住这位主持人。
AI 角色
让生成的角色做自我介绍、讲故事或回复粉丝。
试试这样做
生成角色时让它面向镜头、嘴巴闭合,就像我们的示例一样。
家庭照片
让一张老照片配上亲人录制的话,重新活起来。
试试这样做
上传前把照片扫描清晰,并裁剪到只剩一张脸。
多语言消息
用几种语言录制同一段话,全部使用同一张人像。
试试这样做
每段录音的长度尽量接近,让几个视频保持一致。
AI 照片说话做不到的事
如实说明限制,让你在花积分之前心里有数。
全身动作
只有脸、头部和肩部会动。走路、手势和运镜需要改用视频模型。
侧脸和被遮住的嘴
如果半张嘴被挡住,动作会显得不对。请使用正脸照片。
很长的讲话
标准和高清最长 15 秒,电影级最长 30 秒。更长的稿子请拆成几段。
他人的肖像
你需要有权使用这张脸和这个声音。违反我们规则的内容会被拦截。
格式、限制和价格
AI 照片说话支持什么、输出什么、价格多少。
输入
照片:JPG 或 PNG,最大 10 MB,至少 300 px,长宽比不超过 2.5 比 1。音频:MP3、WAV、M4A 或 AAC,最大 10 MB。
输出
与音频等长的 MP4,以你的语音作为音轨,标准档为 720p,高清和电影级为 1080p。
价格
按音频时长每秒 8、16 或 27 积分,按整秒取整。仅限付费套餐。失败的任务会退还积分。
按时长计价
| 音频时长 | 标准 | 高清 | 电影级 |
|---|---|---|---|
| 5 秒 | 40 | 80 | 135 |
| 10 秒 | 80 | 160 | 270 |
| 15 秒 | 120 | 240 | 405 |
| 30 秒 | — | — | 810 |
授权与负责任的使用
照片说话可以让任何人看起来说出任何话,所以我们会先征求许可。每次运行前,你都需要确认自己有权使用这张脸和这个声音,而且每张照片都会经过审核。
- 使用你自己的脸、已同意的人,或你生成的角色。
- 不要让公众人物、未成年人或普通人看起来说了他们从未说过的话。
- 在平台要求时,把照片说话视频标注为 AI 生成。
AI 照片说话常见问题
想在一个地方用上所有 AI 模型?
打开 Imgveo Studio,在一个工作台里用同一套积分运行本工具以及所有其他 AI 视频和图像模型。
更多视频工具
先给它配上声音,再做得更进一步。
让你的照片开口说话
上传一张人像和一段语音,剩下的交给 AI 照片说话生成器,几分钟即可完成。