KI-Lippensynchronisation

Laden Sie einen Clip und die Sprachspur hoch. Die KI zeichnet den Mund für jedes Wort neu, für Dubs, neue Sätze und KI-Figuren.

  • Lippen treffen jedes Wort
  • Aus MP4 oder MOV wird MP4
  • Jede Sprachaufnahme
  • Preis pro Sekunde

Du erhältst eine MP4 mit der neuen Sprache und passenden Lippen. Die meisten kurzen Clips dauern 2–3 Minuten.

Beispiel für KI-Lippensynchronisation

Einer unserer eigenen Tests, von Anfang bis Ende. Wechseln Sie mit Ton zwischen dem stummen Clip und dem lippensynchronen Ergebnis.

Der Satz, den er auf Englisch sagt: „Hi there. A minute ago this clip was silent. Now every word I say matches my lips.“

So haben wir diesen Clip erstellt

  1. Das KI-generierte Porträt, das als erster Frame diente
    01Kostenlos

    Ein KI-Porträt

    Das Foto einer Person, die es nicht gibt: Gesicht zur Kamera, Mund geschlossen, gleichmäßiges Licht.

  2. 0230 Credits

    Zu einem stummen Clip animiert

    Acht Sekunden Blinzeln und kleine Kopfbewegungen, mit Veo 3.1 Lite aus dem Foto generiert.

  3. 0364 Credits

    Lippensynchron zu einem Satz

    Die KI-Lippensynchronisation hat seinen Mund für jedes Wort neu gezeichnet. Der Rest des Bildes blieb, wie er war.

Was ist KI-Lippensynchronisation?

KI-Lippensynchronisation ist ein Tool, das die Mundbewegungen in einem Video so verändert, dass sie zu einer neuen Tonspur passen. Sie geben ihm Aufnahmen einer Person und die gewünschte Sprache, und es zeichnet Lippen, Kiefer und Zähne Frame für Frame neu, bis Worte und Mund übereinstimmen.

Sie erspart einen Neudreh. Eine synchronisierte Werbung, ein korrigierter Produktname oder eine KI-Figur, die eine Stimme braucht, bedeutete früher einen neuen Dreh oder Animation von Hand. Die KI-Lippensynchronisation erledigt das mit dem Clip, den Sie bereits haben.

So funktioniert KI-Lippensynchronisation

Das Modell hört die Tonspur und zerlegt sie in Phoneme, die Laute der Sprache. Jeder Laut entspricht einer Mundform, einem sogenannten Visem: Lippen geschlossen bei M, weit offen bei A, rund bei O. Dann malt das Modell die untere Gesichtshälfte in jedem Frame neu, damit es diese Formen im richtigen Moment trifft, und fügt sie in Haut und Licht der Umgebung ein.

/h//a//i//th//e//r/

Was bleibt

Bildausschnitt, Hintergrund, Licht, Kopfbewegung und der Rest des Gesichts bleiben, wie sie waren. Nur der Mundbereich wird neu gezeichnet.

Was sich ändert

Lippen, Zähne und Kiefer folgen der neuen Sprache, und die neue Tonspur ersetzt den Originalton des Clips.

Video in 3 Schritten lippensynchron machen

Die gesamte KI-Lippensynchronisation läuft in Ihrem Browser. Keine Schnittsoftware und kein Plug-in.

01

Video hochladen

Ziehen Sie eine MP4 oder MOV mit 2 bis 60 Sekunden in das Tool. Eine Person, die mit sichtbarem Mund in die Kamera blickt, liefert das beste Ergebnis.

02

Sprache hinzufügen

Laden Sie Audio als MP3, WAV, M4A oder AAC bis 10 MB hoch. Nehmen Sie es mit dem Handy auf, exportieren Sie es aus einem Sprach-Tool oder nutzen Sie eine Synchronfassung.

MP4
03

Synchronisieren und herunterladen

Setzen Sie das Häkchen bei der Einwilligung und klicken Sie auf „Sync starten“. Die meisten kurzen Clips sind in zwei bis drei Minuten als MP4 fertig.

Was ein gutes Ausgangsvideo ausmacht

Die KI-Lippensynchronisation kann nur einen Mund neu zeichnen, den sie findet. Diese fünf Punkte entscheiden, ob sie einen findet.

01

Ein Gesicht zur Kamera

Frontal oder leicht gedreht funktioniert am besten. Ein reines Seitenprofil verdeckt die halben Lippen.

Warum das wichtig ist

Das Modell braucht beide Mundwinkel, um jede Form zu setzen.

02

720p oder schärfer

Nutzen Sie für Nahaufnahmen mindestens 720p. Sehr kleine oder unscharfe Gesichter ergeben weiche, verschmierte Lippen.

Warum das wichtig ist

Mehr Pixel um den Mund bedeuten mehr Details zum Neuzeichnen.

03

Eine sprechende Person im Bild

Halten Sie ein klares Gesicht im Bild. Bei mehreren Personen kann die Synchronisation die falsche treffen.

Warum das wichtig ist

Das Tool steuert ein einziges Gesicht pro Clip.

04

Nichts vor dem Mund

Hände, Mikrofone, Masken und dichte Bärte vor den Lippen stören.

Warum das wichtig ist

Alles, was den Mund verdeckt, wird schlecht oder gar nicht neu gezeichnet.

05

Ruhiges Licht und wenig Unschärfe

Schnelle Kopfdrehungen und flackerndes Licht machen es schwer, den Mund von Frame zu Frame zu verfolgen.

Warum das wichtig ist

Bewegungsunschärfe verdeckt genau die Form, die das Modell verändern will.

Wenn Audio und Video unterschiedlich lang sind

Das Ergebnis behält die Länge Ihres Videos, und Sie zahlen für die Sekunden des Videos. So läuft es, wenn die beiden Dateien nicht gleich lang sind.

Ihre DateienWas Sie erhaltenTipp
Audio so lang wie das VideoDie Lippen bewegen sich im ganzen ClipDer Idealfall für Synchronfassungen
Audio kürzer als das VideoDie Person hört auf zu sprechen, wenn das Audio endetKürzen Sie das Video vorher auf die Audiolänge und zahlen Sie für weniger Sekunden
Audio länger als das VideoDas Audio wird dort abgeschnitten, wo das Video endetSprechen Sie den Satz schneller oder nutzen Sie einen längeren Clip

Das Tool zeigt beide Längen vor der Synchronisation an, sodass ein Unterschied nie überrascht.

Lippensynchronisation vs. sprechendes Foto vs. Video mit nativer Sprache

Es gibt drei Wege zu einem Video, in dem jemand Ihre Worte sagt. Welcher passt, hängt davon ab, womit Sie beginnen.

KI-Lippensynchronisation

Sie beginnen mit
Ein echtes oder generiertes Video plus Audio
Ideal für
Synchronfassungen, einen Satz korrigieren, eine bestimmte Aufnahme oder Person behalten
Darauf achten
Braucht ein klares Gesicht im Material

Preis auf Imgveo

40 Credits für einen 5-Sekunden-Clip

Sprechendes Foto

Sie beginnen mit
Ein einzelnes Foto plus Audio
Ideal für
Avatare, Moderatoren und Figuren, wenn Sie kein Filmmaterial haben
Darauf achten
Zwei Schritte: das Foto animieren, dann lippensynchronisieren

Preis auf Imgveo

30 + 64 = 94 Credits für 8 s

Video mit nativer Sprache

Sie beginnen mit
Ein Text-Prompt mit dem Dialog darin
Ideal für
Neue Szenen, in denen das Modell Bild und Stimme zusammen erzeugt
Darauf achten
Sie bestimmen weder die genaue Stimme noch das genaue Gesicht

Preis auf Imgveo

Ab 30 Credits für einen 8-Sekunden-Clip mit Ton

Die Preise stammen aus unserer aktuellen Preisliste. Die Zeile „Sprechendes Foto“ ist genau der Weg, den wir für das Beispiel oben genutzt haben.

KI-Synchronisation: Ein Clip, viele Sprachen

Die KI-Lippensynchronisation ist der letzte Schritt einer Synchronfassung. Dieselben Aufnahmen können Spanisch, Japanisch oder Deutsch sprechen, ohne neuen Dreh.

  1. 1

    Das übersetzte Skript schreiben

    Übersetzen Sie den Satz und lesen Sie ihn laut vor. Halten Sie ihn nah an der Originallänge.

  2. 2

    Die Stimme aufnehmen oder generieren

    Nehmen Sie einen Muttersprachler auf oder exportieren Sie den Satz aus einem Sprach-Tool als MP3 oder WAV.

  3. 3

    Das Timing abstimmen

    Schneiden Sie Stille am Anfang und am Ende weg, damit die Sprache den Clip füllt.

  4. 4

    Die KI-Lippensynchronisation starten

    Laden Sie das Originalvideo mit dem neuen Audio hoch. Wiederholen Sie das für jede Sprache.

Das Tempo einer anderen Sprache treffen

Manche Sprachen brauchen für denselben Gedanken mehr Silben. Wird ein deutscher Satz zu lang, kürzen Sie lieber den Wortlaut, statt die Stimme zu beschleunigen, denn das klingt gehetzt. Die KI-Lippensynchronisation folgt jedem Tempo, das das Audio hat.

Einsatzbereiche der KI-Lippensynchronisation

Überall, wo ein Gesicht auf dem Bildschirm etwas sagen soll, das es am Drehtag nicht gesagt hat.

01

Werbung und Produkterklärungen

Ändern Sie einen Preis, einen Produktnamen oder einen Call-to-Action, ohne den Moderator erneut zu buchen.

Tipp

Bewahren Sie für spätere Änderungen einen sauberen Take auf, in dem der Moderator in die Linse blickt.

02

Synchronisation und Lokalisierung

Veröffentlichen Sie ein Video in mehreren Sprachen, mit Mundbewegungen, die zu jeder passen.

Tipp

Beginnen Sie mit dem wichtigsten Markt und prüfen Sie das Ergebnis, bevor Sie den Rest angehen.

03

KI-Figuren und Avatare

Geben Sie einer generierten Figur eine Stimme und einen Dialogsatz, der zu Ihrer Geschichte passt.

Tipp

Generieren Sie die Figur frontal zur Kamera mit geschlossenem Mund, wie in unserem Beispiel.

04

Einen einzelnen Satz korrigieren

Tauschen Sie ein falsches Wort in einem Vortrag, einem Kurs oder einem Social-Clip aus, ohne neu zu drehen.

Tipp

Schneiden Sie nur den Satz heraus, synchronisieren Sie ihn und fügen Sie ihn wieder in Ihren Schnitt ein.

Was KI-Lippensynchronisation nicht reparieren kann

Wir haben die Grenzen an unseren eigenen Clips getestet. Darauf können Sie sich einstellen.

Ein Kämpfer schwingt ein Schwert, sein Gesicht ist durch die Bewegung verdeckt: ein Clip, den die Lippensynchronisation abgelehnt hat
Unser erster Test: Das Gesicht ist durch einen Schwerthieb verdeckt, daher wurde kein Gesicht gefunden. Der Auftrag wurde gestoppt, und es wurde nichts berechnet.

Kein klares Gesicht

Ist das Gesicht abgewandt, winzig oder durch Bewegung verschwommen, stoppt die Synchronisation, und Sie erhalten Ihre Credits zurück.

Mehrere Sprecher

Pro Clip wird ein Gesicht synchronisiert. Schneiden Sie bei einem Gespräch jede sprechende Person in einen eigenen Clip.

Stimme und Emotion

Die KI-Lippensynchronisation passt den Mund an, nicht den Vortrag. Eine flache Aufnahme klingt weiterhin flach.

Formate, Grenzen und Preise

Was die KI-Lippensynchronisation annimmt, was sie liefert und was sie kostet.

Eingabe

Video: MP4 oder MOV, 2 bis 60 Sekunden, bis 100 MB, mindestens 360p. Audio: MP3, WAV, M4A oder AAC bis 10 MB.

Ausgabe

Eine MP4 in der Länge des Videos, mit der neuen Sprache als Tonspur und dem Mund passend dazu.

Preis

8 Credits pro Sekunde Video, auf ganze Sekunden gerundet. Nur in kostenpflichtigen Plänen. Fehlgeschlagene Durchgänge werden erstattet.

Preis nach Länge

VideolängeCredits
5 s40
10 s80
30 s240
60 s480

Einwilligung und verantwortungsvolle Nutzung

KI-Lippensynchronisation kann jemandem Worte in den Mund legen, deshalb fragen wir zuerst nach der Erlaubnis. Vor jedem Durchgang bestätigen Sie, dass Sie das Recht haben, das Gesicht und die Stimme zu verwenden.

  • Verwenden Sie Ihr eigenes Gesicht, eine Person, die zugestimmt hat, oder eine Figur, die Sie generiert haben.
  • Lassen Sie keine Personen des öffentlichen Lebens, Minderjährige oder Privatpersonen Dinge sagen, die sie nie gesagt haben.
  • Kennzeichnen Sie bearbeitete oder synchronisierte Videos, wo Ihre Plattform es verlangt.

FAQ zur KI-Lippensynchronisation

Alle KI-Modelle an einem Ort?

Öffne Imgveo Studio, um dieses und jedes andere KI-Video- und Bildmodell aus einem Arbeitsbereich mit einem Credit-Guthaben zu nutzen.

In Studio öffnen

Weitere Video-Tools

Erst den Clip erstellen, dann ihm eine Stimme geben.

Geben Sie Ihrem Video eine neue Stimme

Laden Sie einen Clip und die gewünschte Sprachaufnahme hoch, und die KI-Lippensynchronisation erledigt den Rest in wenigen Minuten.