どんな動画にもAIリップシンク

動画と音声をアップロード。AIリップシンクが一語ずつ口元を合わせ、吹き替えやAIキャラクターのセリフに使えます。

  • 一語ずつ口元が一致
  • MP4・MOV→MP4
  • どんな音声トラックも
  • 秒単位の料金

新しい音声と口の動きが合ったMP4が手に入ります。短いクリップならたいてい2〜3分です。

AIリップシンクの実例

私たち自身のテストを最初から最後まで紹介します。音声をオンにして、無音のクリップとリップシンク後の結果を切り替えてみてください。

彼が英語で話すセリフ:「やあ。ついさっきまで、このクリップは無音でした。今は、話す言葉がすべて唇の動きと合っています。」

このクリップの作り方

  1. 最初のフレームに使ったAI生成ポートレート
    01無料

    AIポートレート

    実在しない人物の写真。カメラ正面、口を閉じ、光は均一です。

  2. 0230クレジット

    無音のクリップに

    写真からVeo 3.1 Liteで生成した8秒間の映像。まばたきと小さな頭の動きがあります。

  3. 0364クレジット

    ひとことのセリフにリップシンク

    AIリップシンクが一語ごとに彼の口元を描き直しました。それ以外の部分は元のままです。

AIリップシンクとは?

AIリップシンクは、動画の中の口の動きを変えて、新しい音声トラックに合わせるツールです。人物の映像と話させたい音声を渡すと、言葉と口がぴったり合うまで、唇・あご・歯を1フレームずつ描き直します。

撮り直しが不要になります。吹き替えた広告、商品名の修正、声が必要なAIキャラクター。これまでは撮影し直すか、手作業でアニメーションを作るしかありませんでした。AIリップシンクなら手元のクリップだけで済みます。

AIリップシンクの仕組み

モデルは音声を聞き取り、音素(発話を構成する音)に分解します。それぞれの音は、ビゼームと呼ばれる口の形に対応します。Mでは唇を閉じ、Aでは大きく開き、Oでは丸くなります。モデルはすべてのフレームで顔の下半分を描き直してタイミングよくその形を作り、周囲の肌や光になじませます。

/h//a//i//th//e//r/

変わらないもの

構図、背景、照明、頭の動き、顔のほかの部分はそのままです。描き直すのは口元だけです。

変わるもの

唇・歯・あごが新しい音声に合わせて動き、新しい音声がクリップの元の音に置き換わります。

3ステップで動画をリップシンクする方法

AIリップシンクはすべてブラウザで完結します。編集ソフトもプラグインも不要です。

01

動画をアップロード

2〜60秒のMP4またはMOVをドロップします。カメラを向いた1人の人物で、口元がはっきり見える映像が最適です。

02

音声を追加

10 MBまでのMP3、WAV、M4A、AACの音声をアップロードします。スマホで録音しても、音声ツールから書き出しても、吹き替え音声を使ってもかまいません。

MP4
03

同期してダウンロード

同意のチェックボックスにチェックを入れ、「同期する」を押します。短いクリップならたいてい2〜3分でMP4が完成します。

良い元動画の条件

AIリップシンクが描き直せるのは、見つけられた口だけです。見つけられるかどうかは、次の5つで決まります。

01

顔がカメラを向いている

正面か少し斜めが最適です。真横を向くと唇の半分が隠れます。

理由

それぞれの口の形を正しく置くには、口の両端が見えている必要があります。

02

720p以上の画質

アップの映像には720p以上を使ってください。顔が小さすぎたりぼやけたりしていると、唇が甘くにじんだ仕上がりになります。

理由

口元のピクセルが多いほど、描き直せるディテールも増えます。

03

画面に話し手は1人

はっきり映る顔を1つだけにしてください。大勢が映っていると、別の人に同期されることがあります。

理由

このツールが動かす顔は、1クリップにつき1つです。

04

口元を遮るものがない

手、マイク、マスク、濃いひげが唇にかかると邪魔になります。

理由

口を覆っている部分は、うまく描き直せないか、まったく描き直せません。

05

安定した光と少ないブレ

素早く頭を振ったり、光がちらついたりすると、フレームごとに口元を追うのが難しくなります。

理由

モーションブラーは、モデルが変えようとしている口の形を隠してしまいます。

音声と動画の長さが違うとき

結果は動画の長さのまま出力され、料金も動画の秒数で決まります。2つのファイルの長さが合わない場合はこうなります。

あなたのファイル結果ヒント
音声と動画が同じ長さクリップ全体で唇が動く吹き替えに理想的なケース
音声が動画より短い音声が終わると話し手が話すのをやめる先に動画を音声の長さにカットすれば、支払う秒数も減ります
音声が動画より長い動画が終わる位置で音声が切れるセリフを速めるか、もっと長いクリップを使いましょう

同期の前に両方の長さが表示されるので、長さの違いで驚くことはありません。

リップシンク vs トーキングフォト vs ネイティブ音声動画

誰かにあなたの言葉を話させる動画を作る方法は3つあります。どれが合うかは、手元に何があるかで決まります。

AIリップシンク

用意するもの
実写または生成した動画+音声
向いている用途
吹き替え、セリフの修正、特定のカットや俳優を残したいとき
注意点
映像にはっきりした顔が必要

Imgveoでの料金

5秒のクリップで40クレジット

トーキングフォト

用意するもの
写真1枚+音声
向いている用途
映像がないときのアバター、プレゼンター、キャラクター
注意点
2ステップ:写真を動かしてから、リップシンクする

Imgveoでの料金

30 + 64 = 8秒で94クレジット

ネイティブ音声動画

用意するもの
セリフを含むテキストプロンプト
向いている用途
モデルが映像と声を一緒に作る新しいシーン
注意点
声や顔を正確にコントロールすることはできない

Imgveoでの料金

音声付き8秒クリップで30クレジットから

料金は最新の料金表から読み込んでいます。トーキングフォトの行は、上の実例で実際に使った手順そのものです。

AI吹き替え:1本のクリップを多言語に

AIリップシンクは吹き替えの最後のステップです。撮り直しなしで、同じ映像にスペイン語、日本語、ドイツ語を話させられます。

  1. 1

    翻訳した台本を書く

    セリフを翻訳して声に出して読みます。元の長さに近づけてください。

  2. 2

    音声を録音または生成する

    ネイティブスピーカーに録音してもらうか、音声ツールからMP3またはWAVで書き出します。

  3. 3

    タイミングを合わせる

    最初と最後の無音をカットして、音声がクリップいっぱいに収まるようにします。

  4. 4

    AIリップシンクを実行する

    元の動画と新しい音声をアップロードします。言語ごとに繰り返してください。

ほかの言語のテンポに合わせる

同じ内容でも、言語によってはより多くの音節が必要です。ドイツ語のセリフが長くなるなら、声を速めるより言い回しを短くしてください。速めると慌ただしく聞こえます。AIリップシンクは、音声のテンポがどうであれそれに合わせます。

AIリップシンクの活用例

画面の中の人に、撮影当日には言っていないことを言わせたい場面ならどこでも。

01

広告と商品紹介

価格、商品名、CTAの文言を、出演者を再手配せずに変更できます。

試してみよう

今後の修正に備えて、出演者がレンズを見ているクリーンなテイクを残しておきましょう。

02

吹き替えとローカライズ

1本の動画を複数の言語で公開し、言語ごとに口元を合わせます。

試してみよう

最も重要な市場から始めて、結果を確認してからほかの言語に進みましょう。

03

AIキャラクターとアバター

生成したキャラクターに声と、ストーリーに合うセリフを与えます。

試してみよう

実例と同じように、カメラを向いて口を閉じたキャラクターを生成しましょう。

04

セリフ1つの修正

講演、講座、SNSクリップの言い間違いを1語だけ、撮り直しなしで差し替えます。

試してみよう

その一文だけを切り出してリップシンクし、編集に戻してつなぎましょう。

AIリップシンクで直せないこと

自分たちのクリップで限界を試しました。期待できることは次のとおりです。

剣を振る戦士。動きで顔が隠れており、リップシンクで受け付けられなかったクリップ
最初のテスト:剣を振る動きで顔が隠れ、顔が検出されませんでした。処理は停止し、クレジットは一切消費されていません。

はっきりした顔がない

顔がそっぽを向いている、小さすぎる、動きでぼやけている場合は同期が止まり、クレジットは返金されます。

複数人が話している

同期される顔は1クリップにつき1つです。会話の場合は、話し手ごとにクリップを分けてください。

声と感情

AIリップシンクが合わせるのは口の動きで、話し方ではありません。平板な録音は平板なままです。

対応形式・制限・料金

AIリップシンクが受け付けるもの、出力するもの、かかる料金をまとめました。

入力

動画:MP4またはMOV、2〜60秒、100 MBまで、360p以上。音声:MP3、WAV、M4A、AAC、10 MBまで。

出力

元の動画と同じ長さのMP4。新しい音声がサウンドトラックになり、口元がそれに合わせて動きます。

料金

動画1秒あたり8クレジットで、秒単位に丸められます。有料プラン限定です。失敗した処理のクレジットは返金されます。

長さ別の料金

動画の長さクレジット
5秒40
10秒80
30秒240
60秒480

同意と責任ある利用

AIリップシンクを使えば、人に言っていないことを言わせられます。そのため、まず許可を確認します。毎回の実行前に、その顔と声を使う権利があることを確認していただきます。

  • 自分の顔、同意を得た人、または自分で生成したキャラクターを使ってください。
  • 公人、未成年者、一般の人が、言っていないことを言ったように見せないでください。
  • プラットフォームが求める場合は、編集や吹き替えをした動画であることを明記してください。

AIリップシンクのよくある質問

すべてのAIモデルを1か所で使いたいですか?

Imgveo Studioを開けば、このツールも含めたすべてのAI動画・画像モデルを、1つのワークスペースと共通のクレジットで使えます。

Studioで開く

そのほかの動画ツール

クリップを作ってから、声を与えましょう。

動画に新しい声を

クリップと話させたい音声をアップロードすれば、あとはAIリップシンクが数分で仕上げます。