Laden Sie einen Clip und die Sprachspur hoch. Die KI zeichnet den Mund für jedes Wort neu, für Dubs, neue Sätze und KI-Figuren.
Lippen treffen jedes Wort
Aus MP4 oder MOV wird MP4
Jede Sprachaufnahme
Preis pro Sekunde
Du erhältst eine MP4 mit der neuen Sprache und passenden Lippen. Die meisten kurzen Clips dauern 2–3 Minuten.
/m/
Beispiel für KI-Lippensynchronisation
Einer unserer eigenen Tests, von Anfang bis Ende. Wechseln Sie mit Ton zwischen dem stummen Clip und dem lippensynchronen Ergebnis.
Der Satz, den er auf Englisch sagt: „Hi there. A minute ago this clip was silent. Now every word I say matches my lips.“
So haben wir diesen Clip erstellt
01Kostenlos
Ein KI-Porträt
Das Foto einer Person, die es nicht gibt: Gesicht zur Kamera, Mund geschlossen, gleichmäßiges Licht.
0230 Credits
Zu einem stummen Clip animiert
Acht Sekunden Blinzeln und kleine Kopfbewegungen, mit Veo 3.1 Lite aus dem Foto generiert.
0364 Credits
Lippensynchron zu einem Satz
Die KI-Lippensynchronisation hat seinen Mund für jedes Wort neu gezeichnet. Der Rest des Bildes blieb, wie er war.
/a/
Was ist KI-Lippensynchronisation?
KI-Lippensynchronisation ist ein Tool, das die Mundbewegungen in einem Video so verändert, dass sie zu einer neuen Tonspur passen. Sie geben ihm Aufnahmen einer Person und die gewünschte Sprache, und es zeichnet Lippen, Kiefer und Zähne Frame für Frame neu, bis Worte und Mund übereinstimmen.
Sie erspart einen Neudreh. Eine synchronisierte Werbung, ein korrigierter Produktname oder eine KI-Figur, die eine Stimme braucht, bedeutete früher einen neuen Dreh oder Animation von Hand. Die KI-Lippensynchronisation erledigt das mit dem Clip, den Sie bereits haben.
So funktioniert KI-Lippensynchronisation
Das Modell hört die Tonspur und zerlegt sie in Phoneme, die Laute der Sprache. Jeder Laut entspricht einer Mundform, einem sogenannten Visem: Lippen geschlossen bei M, weit offen bei A, rund bei O. Dann malt das Modell die untere Gesichtshälfte in jedem Frame neu, damit es diese Formen im richtigen Moment trifft, und fügt sie in Haut und Licht der Umgebung ein.
Was bleibt
Bildausschnitt, Hintergrund, Licht, Kopfbewegung und der Rest des Gesichts bleiben, wie sie waren. Nur der Mundbereich wird neu gezeichnet.
Was sich ändert
Lippen, Zähne und Kiefer folgen der neuen Sprache, und die neue Tonspur ersetzt den Originalton des Clips.
/e/
Video in 3 Schritten lippensynchron machen
Die gesamte KI-Lippensynchronisation läuft in Ihrem Browser. Keine Schnittsoftware und kein Plug-in.
01
Video hochladen
Ziehen Sie eine MP4 oder MOV mit 2 bis 60 Sekunden in das Tool. Eine Person, die mit sichtbarem Mund in die Kamera blickt, liefert das beste Ergebnis.
02
Sprache hinzufügen
Laden Sie Audio als MP3, WAV, M4A oder AAC bis 10 MB hoch. Nehmen Sie es mit dem Handy auf, exportieren Sie es aus einem Sprach-Tool oder nutzen Sie eine Synchronfassung.
MP4
03
Synchronisieren und herunterladen
Setzen Sie das Häkchen bei der Einwilligung und klicken Sie auf „Sync starten“. Die meisten kurzen Clips sind in zwei bis drei Minuten als MP4 fertig.
/i/
Was ein gutes Ausgangsvideo ausmacht
Die KI-Lippensynchronisation kann nur einen Mund neu zeichnen, den sie findet. Diese fünf Punkte entscheiden, ob sie einen findet.
01
Ein Gesicht zur Kamera
Frontal oder leicht gedreht funktioniert am besten. Ein reines Seitenprofil verdeckt die halben Lippen.
Warum das wichtig ist
Das Modell braucht beide Mundwinkel, um jede Form zu setzen.
02
720p oder schärfer
Nutzen Sie für Nahaufnahmen mindestens 720p. Sehr kleine oder unscharfe Gesichter ergeben weiche, verschmierte Lippen.
Warum das wichtig ist
Mehr Pixel um den Mund bedeuten mehr Details zum Neuzeichnen.
03
Eine sprechende Person im Bild
Halten Sie ein klares Gesicht im Bild. Bei mehreren Personen kann die Synchronisation die falsche treffen.
Warum das wichtig ist
Das Tool steuert ein einziges Gesicht pro Clip.
04
Nichts vor dem Mund
Hände, Mikrofone, Masken und dichte Bärte vor den Lippen stören.
Warum das wichtig ist
Alles, was den Mund verdeckt, wird schlecht oder gar nicht neu gezeichnet.
05
Ruhiges Licht und wenig Unschärfe
Schnelle Kopfdrehungen und flackerndes Licht machen es schwer, den Mund von Frame zu Frame zu verfolgen.
Warum das wichtig ist
Bewegungsunschärfe verdeckt genau die Form, die das Modell verändern will.
/o/
Wenn Audio und Video unterschiedlich lang sind
Das Ergebnis behält die Länge Ihres Videos, und Sie zahlen für die Sekunden des Videos. So läuft es, wenn die beiden Dateien nicht gleich lang sind.
Ihre Dateien
Was Sie erhalten
Tipp
Audio so lang wie das Video
Die Lippen bewegen sich im ganzen Clip
Der Idealfall für Synchronfassungen
Audio kürzer als das Video
Die Person hört auf zu sprechen, wenn das Audio endet
Kürzen Sie das Video vorher auf die Audiolänge und zahlen Sie für weniger Sekunden
Audio länger als das Video
Das Audio wird dort abgeschnitten, wo das Video endet
Sprechen Sie den Satz schneller oder nutzen Sie einen längeren Clip
Das Tool zeigt beide Längen vor der Synchronisation an, sodass ein Unterschied nie überrascht.
/u/
Lippensynchronisation vs. sprechendes Foto vs. Video mit nativer Sprache
Es gibt drei Wege zu einem Video, in dem jemand Ihre Worte sagt. Welcher passt, hängt davon ab, womit Sie beginnen.
KI-Lippensynchronisation
Sie beginnen mit
Ein echtes oder generiertes Video plus Audio
Ideal für
Synchronfassungen, einen Satz korrigieren, eine bestimmte Aufnahme oder Person behalten
Darauf achten
Braucht ein klares Gesicht im Material
Preis auf Imgveo
40 Credits für einen 5-Sekunden-Clip
Sprechendes Foto
Sie beginnen mit
Ein einzelnes Foto plus Audio
Ideal für
Avatare, Moderatoren und Figuren, wenn Sie kein Filmmaterial haben
Darauf achten
Zwei Schritte: das Foto animieren, dann lippensynchronisieren
Preis auf Imgveo
30 + 64 = 94 Credits für 8 s
Video mit nativer Sprache
Sie beginnen mit
Ein Text-Prompt mit dem Dialog darin
Ideal für
Neue Szenen, in denen das Modell Bild und Stimme zusammen erzeugt
Darauf achten
Sie bestimmen weder die genaue Stimme noch das genaue Gesicht
Preis auf Imgveo
Ab 30 Credits für einen 8-Sekunden-Clip mit Ton
Die Preise stammen aus unserer aktuellen Preisliste. Die Zeile „Sprechendes Foto“ ist genau der Weg, den wir für das Beispiel oben genutzt haben.
/f/
KI-Synchronisation: Ein Clip, viele Sprachen
Die KI-Lippensynchronisation ist der letzte Schritt einer Synchronfassung. Dieselben Aufnahmen können Spanisch, Japanisch oder Deutsch sprechen, ohne neuen Dreh.
1
Das übersetzte Skript schreiben
Übersetzen Sie den Satz und lesen Sie ihn laut vor. Halten Sie ihn nah an der Originallänge.
2
Die Stimme aufnehmen oder generieren
Nehmen Sie einen Muttersprachler auf oder exportieren Sie den Satz aus einem Sprach-Tool als MP3 oder WAV.
3
Das Timing abstimmen
Schneiden Sie Stille am Anfang und am Ende weg, damit die Sprache den Clip füllt.
4
Die KI-Lippensynchronisation starten
Laden Sie das Originalvideo mit dem neuen Audio hoch. Wiederholen Sie das für jede Sprache.
Das Tempo einer anderen Sprache treffen
Manche Sprachen brauchen für denselben Gedanken mehr Silben. Wird ein deutscher Satz zu lang, kürzen Sie lieber den Wortlaut, statt die Stimme zu beschleunigen, denn das klingt gehetzt. Die KI-Lippensynchronisation folgt jedem Tempo, das das Audio hat.
/th/
Einsatzbereiche der KI-Lippensynchronisation
Überall, wo ein Gesicht auf dem Bildschirm etwas sagen soll, das es am Drehtag nicht gesagt hat.
01
Werbung und Produkterklärungen
Ändern Sie einen Preis, einen Produktnamen oder einen Call-to-Action, ohne den Moderator erneut zu buchen.
Tipp
Bewahren Sie für spätere Änderungen einen sauberen Take auf, in dem der Moderator in die Linse blickt.
02
Synchronisation und Lokalisierung
Veröffentlichen Sie ein Video in mehreren Sprachen, mit Mundbewegungen, die zu jeder passen.
Tipp
Beginnen Sie mit dem wichtigsten Markt und prüfen Sie das Ergebnis, bevor Sie den Rest angehen.
03
KI-Figuren und Avatare
Geben Sie einer generierten Figur eine Stimme und einen Dialogsatz, der zu Ihrer Geschichte passt.
Tipp
Generieren Sie die Figur frontal zur Kamera mit geschlossenem Mund, wie in unserem Beispiel.
04
Einen einzelnen Satz korrigieren
Tauschen Sie ein falsches Wort in einem Vortrag, einem Kurs oder einem Social-Clip aus, ohne neu zu drehen.
Tipp
Schneiden Sie nur den Satz heraus, synchronisieren Sie ihn und fügen Sie ihn wieder in Ihren Schnitt ein.
/l/
Was KI-Lippensynchronisation nicht reparieren kann
Wir haben die Grenzen an unseren eigenen Clips getestet. Darauf können Sie sich einstellen.
Unser erster Test: Das Gesicht ist durch einen Schwerthieb verdeckt, daher wurde kein Gesicht gefunden. Der Auftrag wurde gestoppt, und es wurde nichts berechnet.
Kein klares Gesicht
Ist das Gesicht abgewandt, winzig oder durch Bewegung verschwommen, stoppt die Synchronisation, und Sie erhalten Ihre Credits zurück.
Mehrere Sprecher
Pro Clip wird ein Gesicht synchronisiert. Schneiden Sie bei einem Gespräch jede sprechende Person in einen eigenen Clip.
Stimme und Emotion
Die KI-Lippensynchronisation passt den Mund an, nicht den Vortrag. Eine flache Aufnahme klingt weiterhin flach.
/w/
Formate, Grenzen und Preise
Was die KI-Lippensynchronisation annimmt, was sie liefert und was sie kostet.
Eingabe
Video: MP4 oder MOV, 2 bis 60 Sekunden, bis 100 MB, mindestens 360p. Audio: MP3, WAV, M4A oder AAC bis 10 MB.
Ausgabe
Eine MP4 in der Länge des Videos, mit der neuen Sprache als Tonspur und dem Mund passend dazu.
Preis
8 Credits pro Sekunde Video, auf ganze Sekunden gerundet. Nur in kostenpflichtigen Plänen. Fehlgeschlagene Durchgänge werden erstattet.
KI-Lippensynchronisation kann jemandem Worte in den Mund legen, deshalb fragen wir zuerst nach der Erlaubnis. Vor jedem Durchgang bestätigen Sie, dass Sie das Recht haben, das Gesicht und die Stimme zu verwenden.
Verwenden Sie Ihr eigenes Gesicht, eine Person, die zugestimmt hat, oder eine Figur, die Sie generiert haben.
Lassen Sie keine Personen des öffentlichen Lebens, Minderjährige oder Privatpersonen Dinge sagen, die sie nie gesagt haben.
Kennzeichnen Sie bearbeitete oder synchronisierte Videos, wo Ihre Plattform es verlangt.
/r/
FAQ zur KI-Lippensynchronisation
Alle KI-Modelle an einem Ort?
Öffne Imgveo Studio, um dieses und jedes andere KI-Video- und Bildmodell aus einem Arbeitsbereich mit einem Credit-Guthaben zu nutzen.