AI 对口型,适用于任何视频

上传视频和你想要的语音。AI 对口型会重绘嘴部,让每个字都对上,适合配音、改台词和 AI 角色。

  • 嘴型对上每个字
  • MP4/MOV→MP4
  • 任意人声音轨
  • 按秒计费

你会得到一个带有新语音和匹配嘴型的 MP4。大多数短视频需要 2–3 分钟。

AI 对口型示例

这是我们自己的一次完整测试。打开声音,在无声原片和对口型结果之间切换对比。

他用英语说了这句台词:“嗨,你好。一分钟前这段视频还是无声的,现在我说的每个字都对得上嘴型。”

这段视频是怎么做出来的

  1. 用作首帧的 AI 生成肖像
    01免费

    一张 AI 肖像

    一张并不存在的人物照片:正对镜头、嘴巴闭合、光线均匀。

  2. 0230 积分

    做成一段无声视频

    用 Veo 3.1 Lite 从这张照片生成 8 秒视频,人物会眨眼并轻微转头。

  3. 0364 积分

    为一句台词对口型

    AI 对口型为每个字重绘了他的嘴部,画面其余部分保持原样。

什么是 AI 对口型?

AI 对口型是一种修改视频中嘴部动作、使其与新音轨匹配的工具。你提供一段人物视频和想要的语音,它会逐帧重绘嘴唇、下颌和牙齿,直到台词和嘴型完全对上。

它能省下一次重拍。配音广告、改正的产品名称、需要声音的 AI 角色,过去都意味着重新拍摄或手工制作动画。AI 对口型用你现有的视频就能完成。

AI 对口型的原理

模型先听音频,把它拆分成音素,也就是语音中的各个发音。每个发音对应一种嘴型,称为视素:发 M 时双唇闭合,发 A 时张大,发 O 时呈圆形。然后模型在每一帧中重新绘制下半张脸,准时做出这些嘴型,并与周围的皮肤和光线融为一体。

/h//a//i//th//e//r/

保留的部分

构图、背景、光线、头部动作和脸部其他区域都保持原样,只重绘嘴部区域。

改变的部分

嘴唇、牙齿和下颌跟随新的语音运动,新音频会替换视频原有的声音。

3 步给视频对口型

整个 AI 对口型流程都在浏览器中完成,无需剪辑软件,也无需插件。

01

上传视频

拖入一段 2 到 60 秒的 MP4 或 MOV。画面中只有一个人面对镜头、嘴部清晰可见时,效果最好。

02

添加语音

上传 10 MB 以内的 MP3、WAV、M4A 或 AAC 音频。可以用手机录制、从配音工具导出,或使用一段配音。

MP4
03

同步并下载

勾选授权确认框,然后点击“开始同步”。大多数短视频两到三分钟即可生成 MP4。

什么样的源视频效果好

AI 对口型只能重绘它找得到的嘴。下面五点决定它能不能找到。

01

脸朝向镜头

正脸或略微侧脸效果最好。完全侧脸会挡住一半嘴唇。

原因

模型需要看到两侧嘴角,才能放准每个嘴型。

02

720p 或更清晰

特写镜头至少使用 720p。脸部太小或模糊,嘴唇会发虚、糊成一片。

原因

嘴部周围像素越多,可重绘的细节就越多。

03

画面中只有一位说话者

镜头里只保留一张清晰的脸。人多时,口型可能会对到错误的人身上。

原因

这个工具每段视频只驱动一张脸。

04

嘴部没有遮挡

手、麦克风、口罩和浓密的胡须挡住嘴唇都会造成干扰。

原因

嘴部被遮挡的部分会重绘得很差,或者根本无法重绘。

05

光线稳定、少模糊

快速转头和闪烁的光线会让嘴部很难逐帧追踪。

原因

运动模糊会遮住模型要修改的嘴型。

音频和视频时长不一致时

结果会保持视频的时长,费用也按视频秒数计算。下面是两个文件时长不一致时的情况。

你的文件得到的结果建议
音频与视频一样长整段视频嘴部都在动配音的理想情况
音频比视频短音频结束后,说话者停止说话先把视频剪到和音频一样长,计费秒数更少
音频比视频长音频在视频结束处被截断加快台词语速,或换一段更长的视频

工具会在同步前显示两者的时长,时长不一致不会让你措手不及。

对口型、照片说话与原生语音视频对比

要得到一段某人说出你台词的视频,有三种方法。选哪种取决于你手上有什么。

AI 对口型

起点
一段真实或生成的视频,加上音频
最适合
配音、修改台词、保留特定镜头或演员
注意事项
素材中需要有清晰的脸

Imgveo 价格

5 秒视频 40 积分

照片说话

起点
一张照片,加上音频
最适合
没有视频素材时制作虚拟形象、主持人和角色
注意事项
需要两步:先让照片动起来,再对口型

Imgveo 价格

30 + 64 = 94 积分(8 秒)

原生语音视频

起点
写有台词的文字提示词
最适合
由模型同时生成画面和声音的新场景
注意事项
无法精确控制声音和长相

Imgveo 价格

8 秒带声音视频 30 积分起

价格读取自我们的实时价目表。照片说话这一行正是我们制作上方示例时用的流程。

AI 配音:一段视频,多种语言

AI 对口型是配音的最后一步。同一段素材无需重拍,就能说西班牙语、日语或德语。

  1. 1

    写好翻译后的台词

    翻译台词并大声读一遍,尽量接近原句的长度。

  2. 2

    录制或生成配音

    请母语者录音,或从配音工具中把台词导出为 MP3 或 WAV。

  3. 3

    对齐时间

    剪掉开头和结尾的静音,让语音填满整段视频。

  4. 4

    运行 AI 对口型

    上传原视频和新音频。每种语言重复一次。

适应另一种语言的语速

有些语言表达同样的意思需要更多音节。如果德语台词偏长,请精简措辞,而不是加快语速,否则听起来会很赶。AI 对口型会跟随音频本身的节奏。

AI 对口型应用场景

只要屏幕上的人需要说出拍摄当天没说过的话,就能用上。

01

广告和产品讲解

修改价格、产品名称或行动号召,无需再约主持人。

试试这样做

保留一条主持人看着镜头的干净素材,方便以后修改。

02

配音和本地化

一段视频发布多种语言版本,每种语言的嘴型都对得上。

试试这样做

先做最重要的市场,确认效果后再做其他语言。

03

AI 角色和虚拟形象

给生成的角色配上声音,以及一句符合剧情的台词。

试试这样做

生成角色时让它面向镜头、嘴巴闭合,就像我们的示例一样。

04

修正单句台词

替换演讲、课程或短视频里说错的一个词,无需重拍。

试试这样做

只剪出那一句,对好口型,再拼回你的剪辑中。

AI 对口型解决不了的问题

我们用自己的视频测试了它的极限。以下是你可以预期的情况。

一名挥剑的战士,脸被动作遮住:一段被对口型拒绝的视频
我们的第一次测试:挥剑的动作遮住了脸,所以没有检测到人脸。任务已停止,没有扣除任何积分。

没有清晰的脸

如果脸背对镜头、太小或因运动而模糊,同步会停止,积分会退还给你。

多人说话

每段视频只同步一张脸。如果是对话,请把每位说话者剪成单独的视频。

声音和情绪

AI 对口型匹配的是嘴型,不是表演。平淡的录音听起来依然平淡。

格式、限制和价格

AI 对口型支持什么、输出什么、价格多少。

输入

视频:MP4 或 MOV,2 到 60 秒,最大 100 MB,至少 360p。音频:MP3、WAV、M4A 或 AAC,最大 10 MB。

输出

与原视频等长的 MP4,以新语音作为音轨,嘴型与之匹配。

价格

按视频时长每秒 8 积分,按整秒取整。仅限付费套餐。失败的任务会退还积分。

按时长计价

视频时长积分
5 秒40
10 秒80
30 秒240
60 秒480

授权与负责任的使用

AI 对口型可以让人“说出”没说过的话,所以我们会先征求许可。每次运行前,你都需要确认自己有权使用视频中的脸和声音。

  • 使用你自己的脸、已同意的人,或你生成的角色。
  • 不要让公众人物、未成年人或普通人看起来说了他们从未说过的话。
  • 在平台要求时,为经过编辑或配音的视频添加标注。

AI 对口型常见问题

想在一个地方用上所有 AI 模型?

打开 Imgveo Studio,在一个工作台里用同一套积分运行本工具以及所有其他 AI 视频和图像模型。

在工作台中打开

更多视频工具

先做出视频,再给它配上声音。

给你的视频换一个新声音

上传视频和你想要的语音,剩下的交给 AI 对口型,几分钟即可完成。