AIトーキングフォト作成

ポートレート1枚と話させたい音声をアップロード。AIトーキングフォトが、その顔が一語ずつ話す動画にします。

  • 写真1枚でOK
  • どんな音声でも
  • 最大1080p
  • 秒単位の料金
720p · 8/秒

音声と同じ長さのMP4が手に入ります。短いクリップならたいてい3〜5分です。

AIトーキングフォトの実例

私たち自身のテストです。ポートレート1枚とひとことの音声から、話す動画を作りました。音声をオンにしてご覧ください。

トーキングフォトの元になったAI生成ポートレート
元の写真
トーキングフォト

彼が英語で話すセリフ:「Hi there. A minute ago this clip was silent. Now every word I say matches my lips.」

スタンダード · 音声6.5秒 · 56クレジット · 約3.5分

同じ写真、同じセリフ、2つの方法

同じ男性に同じセリフを2回話させました。1回はAIトーキングフォトで、もう1回は写真を動かしてからリップシンクしました。

AIトーキングフォト

1 ステップ

写真と音声を入れると、話す動画が出てきます。1ステップで、頭と顔が話に合わせて動きます。

56クレジット

動かしてからリップシンク

2 ステップ

まず写真から8秒の無音クリップを作り、次にセリフに合わせて口元を描き直します。2ステップですが、1つ目で動きを選べます。

30 + 64 = 94クレジット

話すポートレートが1本ほしいだけなら、AIトーキングフォトのほうが安くて簡単です。特定の動き、長めのショット、顔のまわりのシーンが必要なら、先に写真を動かしましょう。

AIトーキングフォトとは?

AIトーキングフォトとは、静止画1枚と音声トラックから作る動画です。写真の顔が、話に合わせて口を開き、まばたきし、頭を動かします。ポートレートと録音した声を渡せば、その人が話している全フレームを描き出します。

カメラなしで、声に顔を与えられます。商品説明、講座のイントロ、家族写真、AIキャラクターも、撮影に丸1日かけずに数分で話し始めます。

AIトーキングフォトの仕組み

モデルは音声を読み取り、音ごとの口の形と、話すときに自然に出る小さな動きを割り出します。強調した言葉でうなずく、質問で眉を上げる、フレーズの合間にまばたきする、といった動きです。そのうえで写真から1フレームずつ描き、表情を変えながら顔、髪、服はそのまま保ちます。

保たれるもの

人物の見た目、髪型、服装、背景、写真の構図。

加わるもの

言葉に合った唇の動き、自然なまばたき、頭と肩の小さな動き、そしてサウンドトラックとしてのあなたの音声。

3ステップで写真をしゃべらせる方法

AIトーキングフォトはすべてブラウザで完結します。カメラも編集ソフトも不要です。

01

ポートレートをアップロード

カメラを向いた顔が1つ写ったJPGまたはPNG。各辺300ピクセル以上。

02

音声を追加

MP3、WAV、M4A、AACの録音。スタンダードとHDは15秒まで、シネマティックは30秒まで。

MP4
03

画質を選んで生成

画質を選び、同意のチェックボックスにチェックを入れて「生成する」を押します。短いクリップならたいてい3〜5分で完成します。

スタンダード、HD、シネマティック:どれを選ぶ?

どの画質でも使う写真と音声は同じです。違いは、鮮明さ、話せる長さ、動きのリアルさです。

スタンダード

1秒あたり8クレジット

出力
720p
音声の最大長
15秒

SNS投稿、下書き、手早いテストに。上の実例はスタンダードです。

HD

1秒あたり16クレジット

出力
1080p
音声の最大長
15秒

プレゼンター、広告、パソコンで全画面表示するものに。

シネマティック

1秒あたり27クレジット

出力
1080p
音声の最大長
30秒

長めのスピーチ、表情豊かな話し方、最もリアルな頭と体の動きに。

うまくいく写真の条件

AIトーキングフォトが動かせるのは、写っている部分だけです。差が大きく出るのは次の5点です。

01

顔をカメラに向ける

正面か、少し横を向いた程度に。真横からの写真では口が半分しか写りません。

理由

一語ずつ口の形を作るには、唇の両端が必要です。

02

口を閉じてリラックス

自然な表情か軽い笑顔なら、モデルが口を自然に開く余地があります。

理由

写真の満面の笑みや開いた口は、すべての言葉とぶつかります。

03

シャープで明るい

顔に均一な光が当たり、濃い影がなく、各辺300ピクセル以上。

理由

目と唇まわりの細部が、動きの説得力を決めます。

04

1人だけ

集合写真は、話させたい1人の顔だけにトリミングしてください。

理由

顔が複数あると、違う人が話し始めることがあります。

05

顔の前に何もない

手、マイク、サングラス、髪が口にかからないようにしてください。

理由

隠れた部分はうまく描き直せないか、まったく描かれません。

音声の準備方法

動画の長さは音声とまったく同じで、その秒数分の料金がかかります。少し準備するだけでクレジットを節約できます。

  1. 1

    無音をカット

    冒頭と最後の静かな部分をカットしましょう。話している部分と同じ料金がかかります。

  2. 2

    はっきりした声を1つ

    静かな部屋で、マイクの近くで録音しましょう。BGMや別の人の声があると、唇が違う音に合ってしまうことがあります。

  3. 3

    自然な間が効く

    文と文の間に短い間があると、顔がまばたきして元に戻る時間ができ、より人間らしく見えます。

  4. 4

    どの言語でもOK

    口は言葉ではなく音に合わせて動くので、どの話し言葉やアクセントでも大丈夫です。

AIアバター、リップシンク、ネイティブ音声動画のどれを選ぶ?

画面の人物にあなたの言葉を話させる方法は3つあります。手元にあるもので選びましょう。

AIトーキングフォト

用意するもの
写真1枚+音声
向いている用途
映像がないときのプレゼンター、アバター、キャラクター
注意点
動くのは頭と肩だけで、背景は静止したまま

Imgveoでの料金

スタンダードで5秒40クレジット

AIリップシンク

用意するもの
動画+音声
向いている用途
手持ちの映像の吹き替えやセリフの修正
注意点
映像にはっきりした顔が必要

Imgveoでの料金

5秒のクリップで40クレジット

ネイティブ音声動画

用意するもの
セリフを含むテキストプロンプト
向いている用途
映像と声を一緒に生成する新しいシーン
注意点
顔や声を正確に選ぶことはできない

Imgveoでの料金

音声付き8秒クリップで30クレジットから

料金は最新の料金表から読み込んでいます。

AIトーキングフォトの活用例

スライドの文字より、顔が話したほうが伝わる場面ならどこでも。

01

プレゼンターと解説動画

商品ページ、講座、オンボーディングに、話しかける親しみやすい顔を。

試してみよう

すべての動画で同じポートレートを使うと、視聴者がプレゼンターを覚えてくれます。

02

AIキャラクター

生成したキャラクターに、自己紹介、物語、ファンへの返事をさせましょう。

試してみよう

実例と同じように、カメラを向いて口を閉じたキャラクターを生成しましょう。

03

家族写真

家族が録音したメッセージで、古いポートレートに命を吹き込みます。

試してみよう

写真をくっきりスキャンし、アップロード前に顔1つにトリミングしましょう。

04

多言語メッセージ

同じメッセージを複数の言語で録音し、すべてに1枚のポートレートを使います。

試してみよう

録音の長さをそろえると、動画どうしの統一感が出ます。

AIトーキングフォトにできないこと

クレジットを使う前にわかるよう、限界を正直にお伝えします。

全身の動き

動くのは顔、頭、肩です。歩く動き、身ぶり、カメラワークには動画モデルを使ってください。

横顔と隠れた口

口が半分隠れていると、動きが不自然になります。正面を向いた写真を使ってください。

とても長いスピーチ

スタンダードとHDは15秒まで、シネマティックは30秒までです。長い原稿は複数のクリップに分けてください。

他人の肖像

その顔と声を使う権利が必要です。ルールに反するコンテンツはブロックします。

対応形式・制限・料金

AIトーキングフォトが受け付けるもの、出力するもの、かかる料金をまとめました。

入力

写真:JPGまたはPNG、10 MBまで、300 px以上、縦横比は2.5対1以内。音声:MP3、WAV、M4A、AAC、10 MBまで。

出力

音声と同じ長さのMP4。あなたの音声がサウンドトラックになり、スタンダードは720p、HDとシネマティックは1080pです。

料金

音声1秒あたり8、16、27クレジットで、秒単位に丸められます。有料プラン限定です。失敗した処理のクレジットは返金されます。

長さ別の料金

音声の長さスタンダードHDシネマティック
5秒4080135
10秒80160270
15秒120240405
30秒——810

同意と責任ある利用

トーキングフォトを使えば、誰にでも何でも言わせているように見せられます。そのため、まず許可を確認します。毎回の実行前に、その顔と声を使う権利があることを確認していただき、すべての写真を審査します。

  • 自分の顔、同意を得た人、または自分で生成したキャラクターを使ってください。
  • 公人、未成年者、一般の人が、言っていないことを言ったように見せないでください。
  • プラットフォームが求める場合は、トーキングフォトの動画がAI生成であることを明記してください。

AIトーキングフォトのよくある質問

すべてのAIモデルを1か所で使いたいですか?

Imgveo Studioを開けば、このツールも含めたすべてのAI動画・画像モデルを、1つのワークスペースと共通のクレジットで使えます。

Studioで開く

そのほかの動画ツール

声を与えたら、さらに先へ。

あなたの写真をしゃべらせよう

ポートレートと音声をアップロードすれば、あとはAIトーキングフォトが数分で仕上げます。