مزامنة الشفاه بالذكاء الاصطناعي

ارفع مقطعًا والكلام الذي تريده. يعيد الذكاء الاصطناعي رسم الفم لتتطابق كل كلمة، للدبلجة والجمل الجديدة والشخصيات المولّدة.

  • شفاه تطابق كل كلمة
  • إدخال MP4 أو MOV، إخراج MP4
  • أي مقطع صوتي
  • الدفع حسب الثانية

تحصل على ملف MP4 بالكلام الجديد وشفاه مطابقة له. تستغرق معظم المقاطع القصيرة 2–3 دقائق.

مثال على مزامنة الشفاه بالذكاء الاصطناعي

أحد اختباراتنا الخاصة من البداية إلى النهاية. بدّل بين المقطع الصامت والنتيجة بعد مزامنة الشفاه، مع تشغيل الصوت.

الجملة التي يقولها بالإنجليزية: «Hi there. A minute ago this clip was silent. Now every word I say matches my lips.»

كيف صنعنا هذا المقطع

  1. الصورة الشخصية المولّدة بالذكاء الاصطناعي المستخدمة كإطار أول
    01مجاني

    صورة شخصية بالذكاء الاصطناعي

    صورة لشخص غير موجود: الوجه نحو الكاميرا، والفم مغلق، والإضاءة متساوية.

  2. 0230 رصيد

    تحريكها إلى مقطع صامت

    ثماني ثوانٍ من الرمش وحركات الرأس الخفيفة، وُلّدت من الصورة باستخدام Veo 3.1 Lite.

  3. 0364 رصيد

    مزامنة الشفاه مع جملة واحدة

    أعادت مزامنة الشفاه بالذكاء الاصطناعي رسم فمه لكل كلمة، وبقي باقي الإطار كما هو.

ما هي مزامنة الشفاه بالذكاء الاصطناعي؟

مزامنة الشفاه بالذكاء الاصطناعي أداة تغيّر حركات الفم في الفيديو لتطابق مسارًا صوتيًا جديدًا. تعطيها لقطات لشخص والكلام الذي تريده، فتعيد رسم الشفاه والفك والأسنان إطارًا بإطار حتى تتطابق الكلمات مع الفم.

إنها توفّر عليك إعادة التصوير. فالإعلان المدبلج، أو اسم المنتج المصحَّح، أو الشخصية المولّدة التي تحتاج إلى صوت، كانت تعني في السابق تصويرًا جديدًا أو تحريكًا يدويًا. أما مزامنة الشفاه بالذكاء الاصطناعي فتنجز ذلك من المقطع الذي لديك بالفعل.

كيف تعمل مزامنة الشفاه بالذكاء الاصطناعي

يستمع النموذج إلى الصوت ويقسّمه إلى فونيمات، أي أصوات الكلام. يقابل كل صوت شكلًا للفم يُسمّى «فيزيم»: شفتان مغلقتان لحرف M، وفم مفتوح على اتساعه لحرف A، ومستدير لحرف O. ثم يعيد النموذج رسم الجزء السفلي من الوجه في كل إطار ليبلغ هذه الأشكال في توقيتها، ويدمجها مع البشرة والإضاءة المحيطة.

/h//a//i//th//e//r/

ما يحتفظ به

يبقى التأطير والخلفية والإضاءة وحركة الرأس وبقية الوجه كما كانت. لا يُعاد رسم سوى منطقة الفم.

ما يغيّره

تتبع الشفاه والأسنان والفك الكلام الجديد، ويحلّ الصوت الجديد محل الصوت الأصلي للمقطع.

كيف تزامن الشفاه في فيديو في 3 خطوات

تعمل مزامنة الشفاه بالذكاء الاصطناعي بالكامل في متصفحك. لا برامج مونتاج ولا إضافات.

01

ارفع الفيديو

أفلت ملف MP4 أو MOV مدته من 2 إلى 60 ثانية. أفضل نتيجة تأتي من شخص واحد يواجه الكاميرا وفمه ظاهر.

02

أضف الكلام

ارفع ملفًا صوتيًا بصيغة MP3 أو WAV أو M4A أو AAC حتى 10 MB. سجّله بهاتفك، أو صدّره من أداة صوتية، أو استخدم دبلجة جاهزة.

MP4
03

زامن ونزّل

ضع علامة في مربع الموافقة واضغط «مزامنة». تجهز معظم المقاطع القصيرة كملف MP4 خلال دقيقتين إلى ثلاث دقائق.

ما الذي يجعل الفيديو المصدر جيدًا

لا تستطيع مزامنة الشفاه بالذكاء الاصطناعي إعادة رسم فم لا تجده. هذه الأمور الخمسة تحدد ما إذا كانت ستجده.

01

وجه متجه نحو الكاميرا

الوجه الأمامي أو المائل قليلًا هو الأفضل. أما الجانب الكامل فيخفي نصف الشفاه.

لماذا يهم ذلك

يحتاج النموذج إلى زاويتي الفم كلتيهما ليضع كل شكل.

02

720p أو أوضح

استخدم 720p على الأقل في اللقطات القريبة. الوجوه الصغيرة جدًا أو الضبابية تعطي شفاهًا باهتة وملطخة.

لماذا يهم ذلك

مزيد من البكسلات حول الفم يعني مزيدًا من التفاصيل لإعادة رسمها.

03

متحدث واحد في الإطار

أبقِ وجهًا واحدًا واضحًا في اللقطة. مع وجود عدة أشخاص قد تقع المزامنة على الشخص الخطأ.

لماذا يهم ذلك

تحرّك الأداة وجهًا واحدًا في كل مقطع.

04

لا شيء يغطي الفم

الأيدي والميكروفونات والكمامات واللحى الكثيفة فوق الشفاه تعيق العملية.

لماذا يهم ذلك

أي شيء يغطي الفم يُعاد رسمه بشكل سيئ أو لا يُعاد رسمه إطلاقًا.

05

إضاءة ثابتة وضبابية قليلة

الالتفاتات السريعة للرأس والإضاءة المتذبذبة تجعل تتبع الفم من إطار إلى آخر صعبًا.

لماذا يهم ذلك

ضبابية الحركة تخفي الشكل الذي يحاول النموذج تغييره.

عندما تختلف مدة الصوت عن مدة الفيديو

تحتفظ النتيجة بمدة الفيديو، وتدفع مقابل ثواني الفيديو. إليك ما يحدث عندما لا يتطابق الملفان.

ملفاتكما تحصل عليهنصيحة
الصوت بطول الفيديوتتحرك الشفاه طوال المقطعالحالة المثالية للدبلجة
الصوت أقصر من الفيديويتوقف المتحدث عن الكلام عندما ينتهي الصوتقصّ الفيديو أولًا على طول الصوت وادفع مقابل ثوانٍ أقل
الصوت أطول من الفيديويُقطع الصوت عند نهاية الفيديوسرّع الجملة أو استخدم مقطعًا أطول

تعرض الأداة المدتين قبل المزامنة، فلا يفاجئك أي اختلاف أبدًا.

مزامنة الشفاه مقابل الصورة الناطقة مقابل الفيديو بالكلام الأصلي

هناك ثلاث طرق للحصول على فيديو لشخص يقول كلماتك. الطريقة المناسبة تعتمد على ما تبدأ به.

مزامنة الشفاه بالذكاء الاصطناعي

تبدأ بـ
فيديو حقيقي أو مولّد، مع صوت
الأنسب لـ
الدبلجة، وتصحيح جملة، والحفاظ على لقطة أو ممثل بعينه
انتبه إلى
تحتاج إلى وجه واضح في اللقطات

السعر على Imgveo

40 رصيد لمقطع مدته 5 ثوانٍ

الصورة الناطقة

تبدأ بـ
صورة واحدة، مع صوت
الأنسب لـ
الأفاتارات والمقدّمون والشخصيات عندما لا تملك لقطات فيديو
انتبه إلى
خطوتان: حرّك الصورة، ثم زامن الشفاه

السعر على Imgveo

30 + 64 = 94 رصيد لـ 8 ثوانٍ

الصورة الناطقة بالذكاء الاصطناعي

الفيديو بالكلام الأصلي

تبدأ بـ
وصف نصي يتضمن الحوار
الأنسب لـ
مشاهد جديدة يكتب فيها النموذج الصورة والصوت معًا
انتبه إلى
لا تتحكم في الصوت بدقة ولا في الوجه بدقة

السعر على Imgveo

من 30 رصيد لمقطع مدته 8 ثوانٍ مع الصوت

الأسعار مأخوذة من قائمة أسعارنا الحالية. صف الصورة الناطقة هو المسار نفسه الذي استخدمناه في المثال أعلاه.

الدبلجة بالذكاء الاصطناعي: مقطع واحد بلغات عديدة

مزامنة الشفاه بالذكاء الاصطناعي هي الخطوة الأخيرة في الدبلجة. يمكن للقطات نفسها أن تتحدث بالإسبانية أو اليابانية أو الألمانية دون تصوير جديد.

  1. 1

    اكتب النص المترجم

    ترجم الجملة واقرأها بصوت عالٍ. اجعلها قريبة من طول الأصل.

  2. 2

    سجّل الصوت أو ولّده

    سجّل متحدثًا أصليًا باللغة، أو صدّر الجملة من أداة صوتية بصيغة MP3 أو WAV.

  3. 3

    طابق التوقيت

    احذف الصمت في البداية والنهاية ليملأ الكلام المقطع.

  4. 4

    شغّل مزامنة الشفاه بالذكاء الاصطناعي

    ارفع الفيديو الأصلي مع الصوت الجديد. كرّر ذلك لكل لغة.

مجاراة إيقاع لغة أخرى

تحتاج بعض اللغات إلى مقاطع لفظية أكثر للتعبير عن الفكرة نفسها. إذا طالت جملة بالألمانية، فاختصر الصياغة بدلًا من تسريع الصوت الذي يبدو متعجلًا. تتبع مزامنة الشفاه بالذكاء الاصطناعي أي إيقاع في الصوت.

استخدامات مزامنة الشفاه بالذكاء الاصطناعي

في كل مكان يحتاج فيه وجه على الشاشة إلى قول شيء لم يقله يوم التصوير.

01

الإعلانات وشروحات المنتجات

غيّر سعرًا أو اسم منتج أو دعوة إلى إجراء دون حجز المقدّم من جديد.

جرّب هذا

احتفظ بلقطة نظيفة للمقدّم وهو ينظر إلى العدسة لتعديلات المستقبل.

02

الدبلجة والتوطين

انشر فيديو واحدًا بعدة لغات بحركات فم تطابق كل لغة.

جرّب هذا

ابدأ بأهم سوق وتحقق من النتيجة قبل البقية.

03

شخصيات الذكاء الاصطناعي والأفاتارات

امنح شخصية مولّدة صوتًا وجملة حوار تناسب قصتك.

جرّب هذا

ولّد الشخصية وهي تواجه الكاميرا بفم مغلق، كما في مثالنا.

04

تصحيح جملة واحدة

استبدل كلمة خاطئة واحدة في محاضرة أو دورة أو مقطع لمنصات التواصل دون إعادة التصوير.

جرّب هذا

اقتطع الجملة وحدها، وزامنها، ثم أعدها إلى مونتاجك.

ما لا تستطيع مزامنة الشفاه بالذكاء الاصطناعي إصلاحه

اختبرنا الحدود على مقاطعنا الخاصة. إليك ما تتوقعه.

مقاتل يلوّح بسيف ووجهه محجوب بالحركة: مقطع رفضته مزامنة الشفاه
اختبارنا الأول: الوجه محجوب بضربة سيف، فلم يُعثر على أي وجه. توقفت المهمة ولم يُخصم أي رصيد.

لا يوجد وجه واضح

إذا كان الوجه مُشاحًا أو صغيرًا جدًا أو ضبابيًا بسبب الحركة، تتوقف المزامنة ويُعاد إليك رصيدك.

عدة أشخاص يتحدثون

يُزامَن وجه واحد في كل مقطع. للمحادثة، اقطع كل متحدث في مقطع خاص به.

الصوت والمشاعر

تطابق مزامنة الشفاه بالذكاء الاصطناعي الفم، لا طريقة الإلقاء. التسجيل الرتيب يبقى رتيبًا.

الصيغ والحدود والأسعار

ما تقبله مزامنة الشفاه بالذكاء الاصطناعي، وما تعيده، وكم تكلّف.

الإدخال

الفيديو: MP4 أو MOV، من 2 إلى 60 ثانية، حتى 100 MB، بدقة 360p على الأقل. الصوت: MP3 أو WAV أو M4A أو AAC حتى 10 MB.

الإخراج

ملف MP4 بمدة الفيديو نفسها، مع الكلام الجديد مسارًا صوتيًا والفم مطابق له.

السعر

8 رصيد لكل ثانية من الفيديو، مع التقريب إلى ثوانٍ كاملة. للخطط المدفوعة فقط. تُعاد أرصدة العمليات الفاشلة.

السعر حسب المدة

مدة الفيديوالرصيد
5 ثانية40
10 ثانية80
30 ثانية240
60 ثانية480

الموافقة والاستخدام المسؤول

يمكن لمزامنة الشفاه بالذكاء الاصطناعي أن تضع كلمات في فم شخص ما، لذلك نطلب الإذن أولًا. قبل كل عملية تؤكد أن لديك الحق في استخدام الوجه والصوت.

  • استخدم وجهك أنت، أو شخصًا موافقًا، أو شخصية ولّدتها بنفسك.
  • لا تجعل الشخصيات العامة أو القاصرين أو الأفراد العاديين يبدون وكأنهم يقولون ما لم يقولوه قط.
  • ضع علامة على الفيديوهات المعدّلة أو المدبلجة حيث تطلب منصتك ذلك.

الأسئلة الشائعة حول مزامنة الشفاه بالذكاء الاصطناعي

تريد كل نماذج الذكاء الاصطناعي في مكان واحد؟

افتح Imgveo Studio لتشغيل هذه الأداة وكل نماذج فيديو وصور الذكاء الاصطناعي الأخرى من مساحة عمل واحدة، برصيد نقاط واحد.

افتح في Studio

المزيد من أدوات الفيديو

اصنع المقطع، ثم امنحه صوتًا.

امنح الفيديو صوتًا جديدًا

ارفع مقطعًا والكلام الذي تريده، وستتولى مزامنة الشفاه بالذكاء الاصطناعي الباقي خلال دقائق.