Sprechendes Foto mit KI

Laden Sie ein Porträt und die gewünschte Sprache hoch. Ein sprechendes Foto mit KI lässt dieses Gesicht jedes Wort sagen.

  • Ein Foto genügt
  • Jede Sprachaufnahme
  • Bis zu 1080p
  • Preis pro Sekunde
720p · 8/s

Du erhältst eine MP4 in der Länge deines Audios. Die meisten kurzen Clips dauern 3–5 Minuten.

Beispiel für ein sprechendes Foto mit KI

Einer unserer eigenen Tests: ein einzelnes Porträt und ein gesprochener Satz, verwandelt in ein sprechendes Video. Schalten Sie den Ton ein.

Das KI-generierte Porträt, aus dem das sprechende Foto entstand
Das Foto
Das sprechende Foto

Der Satz, den er auf Englisch sagt: „Hi there. A minute ago this clip was silent. Now every word I say matches my lips.“

Stufe Standard · 6,5 s Sprache · 56 Credits · etwa 3,5 Minuten

Ein Foto, ein Satz, zwei Wege

Wir haben denselben Mann denselben Satz zweimal sagen lassen: einmal als sprechendes Foto mit KI, einmal durch Animieren des Fotos mit anschließender Lippensynchronisation.

Sprechendes Foto mit KI

1 Schritt

Foto und Audio rein, sprechendes Video raus. Ein Schritt, und Kopf und Gesicht bewegen sich mit der Sprache.

56 Credits

Animieren, dann lippensynchronisieren

2 Schritte

Erst ein stummer 8-Sekunden-Clip aus dem Foto, dann wird der Mund passend zum Satz neu gezeichnet. Zwei Schritte, und im ersten wählen Sie die Bewegung.

30 + 64 = 94 Credits

Für ein einzelnes sprechendes Porträt ist ein sprechendes Foto mit KI günstiger und einfacher. Animieren Sie zuerst, wenn Sie eine bestimmte Bewegung, eine längere Einstellung oder eine Szene rund um das Gesicht brauchen.

Was ist ein sprechendes Foto mit KI?

Ein sprechendes Foto mit KI ist ein Video aus einem einzigen Standbild und einer Tonspur: Das Gesicht auf dem Foto öffnet den Mund, blinzelt und bewegt den Kopf im Takt der Sprache. Sie geben ein Porträt und eine Sprachaufnahme vor, und das Tool zeichnet jedes Frame, in dem diese Person spricht.

Es gibt einer Stimme ein Gesicht, ganz ohne Kamera. Ein Produkterklärvideo, eine Kurseinführung, ein Familienfoto oder eine KI-Figur kann in Minuten sprechen statt nach einem Drehtag.

So funktioniert ein sprechendes Foto mit KI

Das Modell liest das Audio und bestimmt für jeden Laut die Mundform, dazu die kleinen Bewegungen, die zum Sprechen gehören: ein Nicken bei einem betonten Wort, gehobene Brauen bei einer Frage, ein Blinzeln zwischen den Sätzen. Dann zeichnet es jedes Frame aus Ihrem Foto und hält Gesicht, Haare und Kleidung gleich, während sich der Ausdruck ändert.

Was bleibt

Die Identität der Person, Frisur, Kleidung, Hintergrund und der Bildausschnitt Ihres Fotos.

Was hinzukommt

Lippenbewegungen passend zu den Worten, natürliches Blinzeln, leichte Kopf- und Schulterbewegungen und Ihr Audio als Tonspur.

Ein Foto in 3 Schritten zum Sprechen bringen

Ihr sprechendes Foto mit KI entsteht komplett im Browser. Keine Kamera, keine Schnittsoftware.

01

Porträt hochladen

Ein JPG oder PNG mit einem Gesicht, das in die Kamera blickt, mindestens 300 Pixel auf jeder Seite.

02

Sprache hinzufügen

Eine Aufnahme als MP3, WAV, M4A oder AAC. Bis zu 15 Sekunden bei Standard und HD, 30 Sekunden bei Cinematic.

MP4
03

Stufe wählen und animieren

Wählen Sie die Qualität, setzen Sie das Häkchen bei der Einwilligung und klicken Sie auf „Animieren“. Die meisten kurzen Clips sind in drei bis fünf Minuten fertig.

Standard, HD oder Cinematic: Welche Stufe passt

Jede Stufe nutzt dasselbe Foto und Audio. Sie unterscheiden sich in der Schärfe, in der maximalen Länge der Sprache und darin, wie lebensecht die Bewegung wirkt.

Standard

8 Credits pro Sekunde

Ausgabe
720p
Längstes Audio
15 s

Social-Media-Posts, Entwürfe und schnelle Tests. Unser Beispiel oben ist Standard.

HD

16 Credits pro Sekunde

Ausgabe
1080p
Längstes Audio
15 s

Moderatoren, Werbung und alles, was am Desktop im Vollbild läuft.

Cinematic

27 Credits pro Sekunde

Ausgabe
1080p
Längstes Audio
30 s

Längere Reden, ausdrucksstarker Vortrag und die lebensechteste Kopf- und Körperbewegung.

Was ein gutes Foto ausmacht

Ein sprechendes Foto mit KI kann nur animieren, was im Bild zu sehen ist. Diese fünf Punkte machen den größten Unterschied.

01

Gesicht zur Kamera

Frontal oder leicht gedreht. Ein Seitenprofil zeigt nur den halben Mund.

Warum das wichtig ist

Das Modell braucht beide Mundwinkel, um jedes Wort zu formen.

02

Mund geschlossen und entspannt

Ein neutraler Ausdruck oder ein leichtes Lächeln lässt dem Modell Raum, den Mund natürlich zu öffnen.

Warum das wichtig ist

Ein breites Grinsen oder ein offener Mund auf dem Foto arbeitet gegen jedes Wort.

03

Scharf und gut ausgeleuchtet

Gleichmäßiges Licht im Gesicht, keine harten Schatten und mindestens 300 Pixel auf jeder Seite.

Warum das wichtig ist

Die Details um Augen und Lippen machen die Bewegung glaubwürdig.

04

Eine Person

Schneiden Sie Gruppenfotos auf das eine Gesicht zu, das sprechen soll.

Warum das wichtig ist

Bei mehreren Gesichtern kann das falsche zu sprechen beginnen.

05

Nichts vor dem Gesicht

Keine Hände, Mikrofone, Sonnenbrillen oder Haare über dem Mund.

Warum das wichtig ist

Verdeckte Gesichtspartien werden schlecht oder gar nicht neu gezeichnet.

So bereiten Sie das Audio vor

Das Video ist genau so lang wie Ihr Audio, und Sie zahlen für diese Sekunden. Ein wenig Vorbereitung spart Credits.

  1. 1

    Stille wegschneiden

    Schneiden Sie stille Sekunden am Anfang und am Ende weg. Sie kosten so viel wie Sprache.

  2. 2

    Eine klare Stimme

    Nehmen Sie in einem ruhigen Raum nah am Mikrofon auf. Hintergrundmusik oder eine zweite Stimme können die Lippen dem falschen Laut folgen lassen.

  3. 3

    Natürliche Pausen helfen

    Kurze Pausen zwischen den Sätzen geben dem Gesicht Zeit zum Blinzeln und Neuansetzen. Das wirkt menschlicher.

  4. 4

    Jede Sprache funktioniert

    Der Mund folgt den Lauten, nicht den Wörtern, daher passt jede gesprochene Sprache und jeder Akzent.

Sprechender KI-Avatar, Lippensynchronisation oder Video mit nativer Sprache?

Drei Wege, eine Person auf den Bildschirm zu bringen, die Ihre Worte sagt. Wählen Sie danach, womit Sie beginnen.

Sprechendes Foto mit KI

Sie beginnen mit
Ein Foto plus Audio
Ideal für
Moderatoren, Avatare und Figuren, wenn Sie kein Filmmaterial haben
Darauf achten
Nur Kopf und Schultern bewegen sich, der Hintergrund bleibt still

Preis auf Imgveo

40 Credits für 5 s mit Standard

KI-Lippensynchronisation

Sie beginnen mit
Ein Video plus Audio
Ideal für
Synchronfassungen und Korrekturen an Material, das Sie bereits haben
Darauf achten
Braucht ein klares Gesicht im Video

Preis auf Imgveo

40 Credits für einen 5-Sekunden-Clip

Video mit nativer Sprache

Sie beginnen mit
Ein Text-Prompt mit dem Dialog
Ideal für
Neue Szenen, in denen Bild und Stimme zusammen erzeugt werden
Darauf achten
Sie bestimmen weder das genaue Gesicht noch die genaue Stimme

Preis auf Imgveo

Ab 30 Credits für einen 8-Sekunden-Clip mit Ton

Die Preise stammen aus unserer aktuellen Preisliste.

Wofür sich ein sprechendes Foto mit KI eignet

Überall, wo ein Gesicht etwas besser sagt als Text auf einer Folie.

01

Moderatoren und Erklärvideos

Geben Sie einer Produktseite, einem Kurs oder einem Onboarding ein freundliches Gesicht, das spricht.

Tipp

Verwenden Sie für jedes Video dasselbe Porträt, damit Zuschauer den Moderator wiedererkennen.

02

KI-Figuren

Lassen Sie eine generierte Figur sich vorstellen, eine Geschichte erzählen oder einem Fan antworten.

Tipp

Generieren Sie die Figur frontal zur Kamera mit geschlossenem Mund, wie in unserem Beispiel.

03

Familienfotos

Erwecken Sie ein altes Porträt mit einer Botschaft zum Leben, die ein Verwandter aufgenommen hat.

Tipp

Scannen Sie das Foto scharf und schneiden Sie es vor dem Hochladen auf ein Gesicht zu.

04

Mehrsprachige Botschaften

Nehmen Sie dieselbe Botschaft in mehreren Sprachen auf und verwenden Sie für alle ein einziges Porträt.

Tipp

Halten Sie die Aufnahmen etwa gleich lang, damit die Videos einheitlich wirken.

Was ein sprechendes Foto mit KI nicht kann

Ehrliche Grenzen, damit Sie wissen, was Sie erwartet, bevor Sie Credits ausgeben.

Ganzkörperbewegung

Gesicht, Kopf und Schultern bewegen sich. Gehen, Gesten und Kamerafahrten brauchen stattdessen ein Videomodell.

Seitenprofile und verdeckte Münder

Ist der halbe Mund verdeckt, wirkt die Bewegung falsch. Verwenden Sie ein frontales Foto.

Sehr lange Reden

Standard und HD nehmen bis zu 15 Sekunden, Cinematic bis zu 30. Teilen Sie längere Skripte auf mehrere Clips auf.

Fremde Gesichter und Stimmen

Sie brauchen das Recht, das Gesicht und die Stimme zu verwenden. Wir blockieren Inhalte, die gegen unsere Regeln verstoßen.

Formate, Grenzen und Preise

Was Sie für ein sprechendes Foto mit KI hochladen, was Sie erhalten und was es kostet.

Eingabe

Foto: JPG oder PNG bis 10 MB, mindestens 300 px, Seitenverhältnis höchstens 2,5 zu 1. Audio: MP3, WAV, M4A oder AAC bis 10 MB.

Ausgabe

Eine MP4 in der Länge Ihres Audios, mit Ihrer Sprache als Tonspur, in 720p bei Standard und 1080p bei HD und Cinematic.

Preis

8, 16 oder 27 Credits pro Sekunde Audio, auf ganze Sekunden gerundet. Nur in kostenpflichtigen Plänen. Fehlgeschlagene Durchgänge werden erstattet.

Preis nach Länge

AudiolängeStandardHDCinematic
5 s4080135
10 s80160270
15 s120240405
30 s——810

Einwilligung und verantwortungsvolle Nutzung

Mit einem sprechenden Foto lässt sich jedem alles in den Mund legen, deshalb fragen wir zuerst nach der Erlaubnis. Vor jedem Durchgang bestätigen Sie, dass Sie das Recht haben, das Gesicht und die Stimme zu verwenden, und jedes Foto wird geprüft.

  • Verwenden Sie Ihr eigenes Gesicht, eine Person, die zugestimmt hat, oder eine Figur, die Sie generiert haben.
  • Lassen Sie keine Personen des öffentlichen Lebens, Minderjährige oder Privatpersonen Dinge sagen, die sie nie gesagt haben.
  • Kennzeichnen Sie Videos aus sprechenden Fotos als KI-generiert, wo Ihre Plattform es verlangt.

FAQ: Sprechendes Foto mit KI

Alle KI-Modelle an einem Ort?

Öffne Imgveo Studio, um dieses und jedes andere KI-Video- und Bildmodell aus einem Arbeitsbereich mit einem Credit-Guthaben zu nutzen.

In Studio öffnen

Weitere Video-Tools

Erst eine Stimme geben, dann weitergehen.

Bringen Sie Ihr Foto zum Sprechen

Laden Sie ein Porträt und eine Sprachaufnahme hoch, und Ihr sprechendes Foto mit KI ist in wenigen Minuten fertig.