Sprechendes Foto mit KI
Laden Sie ein Porträt und die gewünschte Sprache hoch. Ein sprechendes Foto mit KI lässt dieses Gesicht jedes Wort sagen.
- Ein Foto genügt
- Jede Sprachaufnahme
- Bis zu 1080p
- Preis pro Sekunde
Du erhältst eine MP4 in der Länge deines Audios. Die meisten kurzen Clips dauern 3–5 Minuten.
Beispiel für ein sprechendes Foto mit KI
Einer unserer eigenen Tests: ein einzelnes Porträt und ein gesprochener Satz, verwandelt in ein sprechendes Video. Schalten Sie den Ton ein.

Der Satz, den er auf Englisch sagt: „Hi there. A minute ago this clip was silent. Now every word I say matches my lips.“
Stufe Standard · 6,5 s Sprache · 56 Credits · etwa 3,5 Minuten
Ein Foto, ein Satz, zwei Wege
Wir haben denselben Mann denselben Satz zweimal sagen lassen: einmal als sprechendes Foto mit KI, einmal durch Animieren des Fotos mit anschließender Lippensynchronisation.
Sprechendes Foto mit KI
1 SchrittFoto und Audio rein, sprechendes Video raus. Ein Schritt, und Kopf und Gesicht bewegen sich mit der Sprache.
56 Credits
Animieren, dann lippensynchronisieren
2 SchritteErst ein stummer 8-Sekunden-Clip aus dem Foto, dann wird der Mund passend zum Satz neu gezeichnet. Zwei Schritte, und im ersten wählen Sie die Bewegung.
30 + 64 = 94 Credits
Für ein einzelnes sprechendes Porträt ist ein sprechendes Foto mit KI günstiger und einfacher. Animieren Sie zuerst, wenn Sie eine bestimmte Bewegung, eine längere Einstellung oder eine Szene rund um das Gesicht brauchen.
Was ist ein sprechendes Foto mit KI?
Ein sprechendes Foto mit KI ist ein Video aus einem einzigen Standbild und einer Tonspur: Das Gesicht auf dem Foto öffnet den Mund, blinzelt und bewegt den Kopf im Takt der Sprache. Sie geben ein Porträt und eine Sprachaufnahme vor, und das Tool zeichnet jedes Frame, in dem diese Person spricht.
Es gibt einer Stimme ein Gesicht, ganz ohne Kamera. Ein Produkterklärvideo, eine Kurseinführung, ein Familienfoto oder eine KI-Figur kann in Minuten sprechen statt nach einem Drehtag.
So funktioniert ein sprechendes Foto mit KI
Das Modell liest das Audio und bestimmt für jeden Laut die Mundform, dazu die kleinen Bewegungen, die zum Sprechen gehören: ein Nicken bei einem betonten Wort, gehobene Brauen bei einer Frage, ein Blinzeln zwischen den Sätzen. Dann zeichnet es jedes Frame aus Ihrem Foto und hält Gesicht, Haare und Kleidung gleich, während sich der Ausdruck ändert.
Was bleibt
Die Identität der Person, Frisur, Kleidung, Hintergrund und der Bildausschnitt Ihres Fotos.
Was hinzukommt
Lippenbewegungen passend zu den Worten, natürliches Blinzeln, leichte Kopf- und Schulterbewegungen und Ihr Audio als Tonspur.
Ein Foto in 3 Schritten zum Sprechen bringen
Ihr sprechendes Foto mit KI entsteht komplett im Browser. Keine Kamera, keine Schnittsoftware.
Porträt hochladen
Ein JPG oder PNG mit einem Gesicht, das in die Kamera blickt, mindestens 300 Pixel auf jeder Seite.
Sprache hinzufügen
Eine Aufnahme als MP3, WAV, M4A oder AAC. Bis zu 15 Sekunden bei Standard und HD, 30 Sekunden bei Cinematic.
Stufe wählen und animieren
Wählen Sie die Qualität, setzen Sie das Häkchen bei der Einwilligung und klicken Sie auf „Animieren“. Die meisten kurzen Clips sind in drei bis fünf Minuten fertig.
Standard, HD oder Cinematic: Welche Stufe passt
Jede Stufe nutzt dasselbe Foto und Audio. Sie unterscheiden sich in der Schärfe, in der maximalen Länge der Sprache und darin, wie lebensecht die Bewegung wirkt.
Standard
8 Credits pro Sekunde
- Ausgabe
- 720p
- Längstes Audio
- 15 s
Social-Media-Posts, Entwürfe und schnelle Tests. Unser Beispiel oben ist Standard.
HD
16 Credits pro Sekunde
- Ausgabe
- 1080p
- Längstes Audio
- 15 s
Moderatoren, Werbung und alles, was am Desktop im Vollbild läuft.
Cinematic
27 Credits pro Sekunde
- Ausgabe
- 1080p
- Längstes Audio
- 30 s
Längere Reden, ausdrucksstarker Vortrag und die lebensechteste Kopf- und Körperbewegung.
Was ein gutes Foto ausmacht
Ein sprechendes Foto mit KI kann nur animieren, was im Bild zu sehen ist. Diese fünf Punkte machen den größten Unterschied.
Gesicht zur Kamera
Frontal oder leicht gedreht. Ein Seitenprofil zeigt nur den halben Mund.
Warum das wichtig ist
Das Modell braucht beide Mundwinkel, um jedes Wort zu formen.
Mund geschlossen und entspannt
Ein neutraler Ausdruck oder ein leichtes Lächeln lässt dem Modell Raum, den Mund natürlich zu öffnen.
Warum das wichtig ist
Ein breites Grinsen oder ein offener Mund auf dem Foto arbeitet gegen jedes Wort.
Scharf und gut ausgeleuchtet
Gleichmäßiges Licht im Gesicht, keine harten Schatten und mindestens 300 Pixel auf jeder Seite.
Warum das wichtig ist
Die Details um Augen und Lippen machen die Bewegung glaubwürdig.
Eine Person
Schneiden Sie Gruppenfotos auf das eine Gesicht zu, das sprechen soll.
Warum das wichtig ist
Bei mehreren Gesichtern kann das falsche zu sprechen beginnen.
Nichts vor dem Gesicht
Keine Hände, Mikrofone, Sonnenbrillen oder Haare über dem Mund.
Warum das wichtig ist
Verdeckte Gesichtspartien werden schlecht oder gar nicht neu gezeichnet.
So bereiten Sie das Audio vor
Das Video ist genau so lang wie Ihr Audio, und Sie zahlen für diese Sekunden. Ein wenig Vorbereitung spart Credits.
- 1
Stille wegschneiden
Schneiden Sie stille Sekunden am Anfang und am Ende weg. Sie kosten so viel wie Sprache.
- 2
Eine klare Stimme
Nehmen Sie in einem ruhigen Raum nah am Mikrofon auf. Hintergrundmusik oder eine zweite Stimme können die Lippen dem falschen Laut folgen lassen.
- 3
Natürliche Pausen helfen
Kurze Pausen zwischen den Sätzen geben dem Gesicht Zeit zum Blinzeln und Neuansetzen. Das wirkt menschlicher.
- 4
Jede Sprache funktioniert
Der Mund folgt den Lauten, nicht den Wörtern, daher passt jede gesprochene Sprache und jeder Akzent.
Sprechender KI-Avatar, Lippensynchronisation oder Video mit nativer Sprache?
Drei Wege, eine Person auf den Bildschirm zu bringen, die Ihre Worte sagt. Wählen Sie danach, womit Sie beginnen.
Sprechendes Foto mit KI
- Sie beginnen mit
- Ein Foto plus Audio
- Ideal für
- Moderatoren, Avatare und Figuren, wenn Sie kein Filmmaterial haben
- Darauf achten
- Nur Kopf und Schultern bewegen sich, der Hintergrund bleibt still
Preis auf Imgveo
40 Credits für 5 s mit Standard
KI-Lippensynchronisation
- Sie beginnen mit
- Ein Video plus Audio
- Ideal für
- Synchronfassungen und Korrekturen an Material, das Sie bereits haben
- Darauf achten
- Braucht ein klares Gesicht im Video
Preis auf Imgveo
40 Credits für einen 5-Sekunden-Clip
Video mit nativer Sprache
- Sie beginnen mit
- Ein Text-Prompt mit dem Dialog
- Ideal für
- Neue Szenen, in denen Bild und Stimme zusammen erzeugt werden
- Darauf achten
- Sie bestimmen weder das genaue Gesicht noch die genaue Stimme
Preis auf Imgveo
Ab 30 Credits für einen 8-Sekunden-Clip mit Ton
Die Preise stammen aus unserer aktuellen Preisliste.
Wofür sich ein sprechendes Foto mit KI eignet
Überall, wo ein Gesicht etwas besser sagt als Text auf einer Folie.
Moderatoren und Erklärvideos
Geben Sie einer Produktseite, einem Kurs oder einem Onboarding ein freundliches Gesicht, das spricht.
Tipp
Verwenden Sie für jedes Video dasselbe Porträt, damit Zuschauer den Moderator wiedererkennen.
KI-Figuren
Lassen Sie eine generierte Figur sich vorstellen, eine Geschichte erzählen oder einem Fan antworten.
Tipp
Generieren Sie die Figur frontal zur Kamera mit geschlossenem Mund, wie in unserem Beispiel.
Familienfotos
Erwecken Sie ein altes Porträt mit einer Botschaft zum Leben, die ein Verwandter aufgenommen hat.
Tipp
Scannen Sie das Foto scharf und schneiden Sie es vor dem Hochladen auf ein Gesicht zu.
Mehrsprachige Botschaften
Nehmen Sie dieselbe Botschaft in mehreren Sprachen auf und verwenden Sie für alle ein einziges Porträt.
Tipp
Halten Sie die Aufnahmen etwa gleich lang, damit die Videos einheitlich wirken.
Was ein sprechendes Foto mit KI nicht kann
Ehrliche Grenzen, damit Sie wissen, was Sie erwartet, bevor Sie Credits ausgeben.
Ganzkörperbewegung
Gesicht, Kopf und Schultern bewegen sich. Gehen, Gesten und Kamerafahrten brauchen stattdessen ein Videomodell.
Seitenprofile und verdeckte Münder
Ist der halbe Mund verdeckt, wirkt die Bewegung falsch. Verwenden Sie ein frontales Foto.
Sehr lange Reden
Standard und HD nehmen bis zu 15 Sekunden, Cinematic bis zu 30. Teilen Sie längere Skripte auf mehrere Clips auf.
Fremde Gesichter und Stimmen
Sie brauchen das Recht, das Gesicht und die Stimme zu verwenden. Wir blockieren Inhalte, die gegen unsere Regeln verstoßen.
Formate, Grenzen und Preise
Was Sie für ein sprechendes Foto mit KI hochladen, was Sie erhalten und was es kostet.
Eingabe
Foto: JPG oder PNG bis 10 MB, mindestens 300 px, Seitenverhältnis höchstens 2,5 zu 1. Audio: MP3, WAV, M4A oder AAC bis 10 MB.
Ausgabe
Eine MP4 in der Länge Ihres Audios, mit Ihrer Sprache als Tonspur, in 720p bei Standard und 1080p bei HD und Cinematic.
Preis
8, 16 oder 27 Credits pro Sekunde Audio, auf ganze Sekunden gerundet. Nur in kostenpflichtigen Plänen. Fehlgeschlagene Durchgänge werden erstattet.
Preis nach Länge
| Audiolänge | Standard | HD | Cinematic |
|---|---|---|---|
| 5 s | 40 | 80 | 135 |
| 10 s | 80 | 160 | 270 |
| 15 s | 120 | 240 | 405 |
| 30 s | — | — | 810 |
Einwilligung und verantwortungsvolle Nutzung
Mit einem sprechenden Foto lässt sich jedem alles in den Mund legen, deshalb fragen wir zuerst nach der Erlaubnis. Vor jedem Durchgang bestätigen Sie, dass Sie das Recht haben, das Gesicht und die Stimme zu verwenden, und jedes Foto wird geprüft.
- Verwenden Sie Ihr eigenes Gesicht, eine Person, die zugestimmt hat, oder eine Figur, die Sie generiert haben.
- Lassen Sie keine Personen des öffentlichen Lebens, Minderjährige oder Privatpersonen Dinge sagen, die sie nie gesagt haben.
- Kennzeichnen Sie Videos aus sprechenden Fotos als KI-generiert, wo Ihre Plattform es verlangt.
FAQ: Sprechendes Foto mit KI
Alle KI-Modelle an einem Ort?
Öffne Imgveo Studio, um dieses und jedes andere KI-Video- und Bildmodell aus einem Arbeitsbereich mit einem Credit-Guthaben zu nutzen.
Weitere Video-Tools
Erst eine Stimme geben, dann weitergehen.
KI-Lippensynchronisation
Sie haben schon ein Video? Synchronisieren Sie stattdessen dessen Mund mit neuer Sprache.
Video lippensynchronisierenBild zu Video
Animieren Sie ein Foto mit Kamerabewegungen und einer Szene drumherum.
Foto animierenKI-Video-Upscaler
Bringen Sie Ihr sprechendes Foto für große Bildschirme auf 2K oder 4K.
Video hochskalierenVeo 3.1
Generieren Sie neue Szenen mit eingebautem Dialog und Ton.
Veo 3.1 testenBringen Sie Ihr Foto zum Sprechen
Laden Sie ein Porträt und eine Sprachaufnahme hoch, und Ihr sprechendes Foto mit KI ist in wenigen Minuten fertig.