ارفع مقطعًا والكلام الذي تريده. يعيد الذكاء الاصطناعي رسم الفم لتتطابق كل كلمة، للدبلجة والجمل الجديدة والشخصيات المولّدة.
شفاه تطابق كل كلمة
إدخال MP4 أو MOV، إخراج MP4
أي مقطع صوتي
الدفع حسب الثانية
تحصل على ملف MP4 بالكلام الجديد وشفاه مطابقة له. تستغرق معظم المقاطع القصيرة 2–3 دقائق.
/m/
مثال على مزامنة الشفاه بالذكاء الاصطناعي
أحد اختباراتنا الخاصة من البداية إلى النهاية. بدّل بين المقطع الصامت والنتيجة بعد مزامنة الشفاه، مع تشغيل الصوت.
الجملة التي يقولها بالإنجليزية: «Hi there. A minute ago this clip was silent. Now every word I say matches my lips.»
كيف صنعنا هذا المقطع
01مجاني
صورة شخصية بالذكاء الاصطناعي
صورة لشخص غير موجود: الوجه نحو الكاميرا، والفم مغلق، والإضاءة متساوية.
0230 رصيد
تحريكها إلى مقطع صامت
ثماني ثوانٍ من الرمش وحركات الرأس الخفيفة، وُلّدت من الصورة باستخدام Veo 3.1 Lite.
0364 رصيد
مزامنة الشفاه مع جملة واحدة
أعادت مزامنة الشفاه بالذكاء الاصطناعي رسم فمه لكل كلمة، وبقي باقي الإطار كما هو.
/a/
ما هي مزامنة الشفاه بالذكاء الاصطناعي؟
مزامنة الشفاه بالذكاء الاصطناعي أداة تغيّر حركات الفم في الفيديو لتطابق مسارًا صوتيًا جديدًا. تعطيها لقطات لشخص والكلام الذي تريده، فتعيد رسم الشفاه والفك والأسنان إطارًا بإطار حتى تتطابق الكلمات مع الفم.
إنها توفّر عليك إعادة التصوير. فالإعلان المدبلج، أو اسم المنتج المصحَّح، أو الشخصية المولّدة التي تحتاج إلى صوت، كانت تعني في السابق تصويرًا جديدًا أو تحريكًا يدويًا. أما مزامنة الشفاه بالذكاء الاصطناعي فتنجز ذلك من المقطع الذي لديك بالفعل.
كيف تعمل مزامنة الشفاه بالذكاء الاصطناعي
يستمع النموذج إلى الصوت ويقسّمه إلى فونيمات، أي أصوات الكلام. يقابل كل صوت شكلًا للفم يُسمّى «فيزيم»: شفتان مغلقتان لحرف M، وفم مفتوح على اتساعه لحرف A، ومستدير لحرف O. ثم يعيد النموذج رسم الجزء السفلي من الوجه في كل إطار ليبلغ هذه الأشكال في توقيتها، ويدمجها مع البشرة والإضاءة المحيطة.
ما يحتفظ به
يبقى التأطير والخلفية والإضاءة وحركة الرأس وبقية الوجه كما كانت. لا يُعاد رسم سوى منطقة الفم.
ما يغيّره
تتبع الشفاه والأسنان والفك الكلام الجديد، ويحلّ الصوت الجديد محل الصوت الأصلي للمقطع.
/e/
كيف تزامن الشفاه في فيديو في 3 خطوات
تعمل مزامنة الشفاه بالذكاء الاصطناعي بالكامل في متصفحك. لا برامج مونتاج ولا إضافات.
01
ارفع الفيديو
أفلت ملف MP4 أو MOV مدته من 2 إلى 60 ثانية. أفضل نتيجة تأتي من شخص واحد يواجه الكاميرا وفمه ظاهر.
02
أضف الكلام
ارفع ملفًا صوتيًا بصيغة MP3 أو WAV أو M4A أو AAC حتى 10 MB. سجّله بهاتفك، أو صدّره من أداة صوتية، أو استخدم دبلجة جاهزة.
MP4
03
زامن ونزّل
ضع علامة في مربع الموافقة واضغط «مزامنة». تجهز معظم المقاطع القصيرة كملف MP4 خلال دقيقتين إلى ثلاث دقائق.
/i/
ما الذي يجعل الفيديو المصدر جيدًا
لا تستطيع مزامنة الشفاه بالذكاء الاصطناعي إعادة رسم فم لا تجده. هذه الأمور الخمسة تحدد ما إذا كانت ستجده.
01
وجه متجه نحو الكاميرا
الوجه الأمامي أو المائل قليلًا هو الأفضل. أما الجانب الكامل فيخفي نصف الشفاه.
لماذا يهم ذلك
يحتاج النموذج إلى زاويتي الفم كلتيهما ليضع كل شكل.
02
720p أو أوضح
استخدم 720p على الأقل في اللقطات القريبة. الوجوه الصغيرة جدًا أو الضبابية تعطي شفاهًا باهتة وملطخة.
لماذا يهم ذلك
مزيد من البكسلات حول الفم يعني مزيدًا من التفاصيل لإعادة رسمها.
03
متحدث واحد في الإطار
أبقِ وجهًا واحدًا واضحًا في اللقطة. مع وجود عدة أشخاص قد تقع المزامنة على الشخص الخطأ.
لماذا يهم ذلك
تحرّك الأداة وجهًا واحدًا في كل مقطع.
04
لا شيء يغطي الفم
الأيدي والميكروفونات والكمامات واللحى الكثيفة فوق الشفاه تعيق العملية.
لماذا يهم ذلك
أي شيء يغطي الفم يُعاد رسمه بشكل سيئ أو لا يُعاد رسمه إطلاقًا.
05
إضاءة ثابتة وضبابية قليلة
الالتفاتات السريعة للرأس والإضاءة المتذبذبة تجعل تتبع الفم من إطار إلى آخر صعبًا.
لماذا يهم ذلك
ضبابية الحركة تخفي الشكل الذي يحاول النموذج تغييره.
/o/
عندما تختلف مدة الصوت عن مدة الفيديو
تحتفظ النتيجة بمدة الفيديو، وتدفع مقابل ثواني الفيديو. إليك ما يحدث عندما لا يتطابق الملفان.
ملفاتك
ما تحصل عليه
نصيحة
الصوت بطول الفيديو
تتحرك الشفاه طوال المقطع
الحالة المثالية للدبلجة
الصوت أقصر من الفيديو
يتوقف المتحدث عن الكلام عندما ينتهي الصوت
قصّ الفيديو أولًا على طول الصوت وادفع مقابل ثوانٍ أقل
الصوت أطول من الفيديو
يُقطع الصوت عند نهاية الفيديو
سرّع الجملة أو استخدم مقطعًا أطول
تعرض الأداة المدتين قبل المزامنة، فلا يفاجئك أي اختلاف أبدًا.
/u/
مزامنة الشفاه مقابل الصورة الناطقة مقابل الفيديو بالكلام الأصلي
هناك ثلاث طرق للحصول على فيديو لشخص يقول كلماتك. الطريقة المناسبة تعتمد على ما تبدأ به.
مزامنة الشفاه بالذكاء الاصطناعي
تبدأ بـ
فيديو حقيقي أو مولّد، مع صوت
الأنسب لـ
الدبلجة، وتصحيح جملة، والحفاظ على لقطة أو ممثل بعينه
انتبه إلى
تحتاج إلى وجه واضح في اللقطات
السعر على Imgveo
40 رصيد لمقطع مدته 5 ثوانٍ
الصورة الناطقة
تبدأ بـ
صورة واحدة، مع صوت
الأنسب لـ
الأفاتارات والمقدّمون والشخصيات عندما لا تملك لقطات فيديو
الأسعار مأخوذة من قائمة أسعارنا الحالية. صف الصورة الناطقة هو المسار نفسه الذي استخدمناه في المثال أعلاه.
/f/
الدبلجة بالذكاء الاصطناعي: مقطع واحد بلغات عديدة
مزامنة الشفاه بالذكاء الاصطناعي هي الخطوة الأخيرة في الدبلجة. يمكن للقطات نفسها أن تتحدث بالإسبانية أو اليابانية أو الألمانية دون تصوير جديد.
1
اكتب النص المترجم
ترجم الجملة واقرأها بصوت عالٍ. اجعلها قريبة من طول الأصل.
2
سجّل الصوت أو ولّده
سجّل متحدثًا أصليًا باللغة، أو صدّر الجملة من أداة صوتية بصيغة MP3 أو WAV.
3
طابق التوقيت
احذف الصمت في البداية والنهاية ليملأ الكلام المقطع.
4
شغّل مزامنة الشفاه بالذكاء الاصطناعي
ارفع الفيديو الأصلي مع الصوت الجديد. كرّر ذلك لكل لغة.
مجاراة إيقاع لغة أخرى
تحتاج بعض اللغات إلى مقاطع لفظية أكثر للتعبير عن الفكرة نفسها. إذا طالت جملة بالألمانية، فاختصر الصياغة بدلًا من تسريع الصوت الذي يبدو متعجلًا. تتبع مزامنة الشفاه بالذكاء الاصطناعي أي إيقاع في الصوت.
/th/
استخدامات مزامنة الشفاه بالذكاء الاصطناعي
في كل مكان يحتاج فيه وجه على الشاشة إلى قول شيء لم يقله يوم التصوير.
01
الإعلانات وشروحات المنتجات
غيّر سعرًا أو اسم منتج أو دعوة إلى إجراء دون حجز المقدّم من جديد.
جرّب هذا
احتفظ بلقطة نظيفة للمقدّم وهو ينظر إلى العدسة لتعديلات المستقبل.
02
الدبلجة والتوطين
انشر فيديو واحدًا بعدة لغات بحركات فم تطابق كل لغة.
جرّب هذا
ابدأ بأهم سوق وتحقق من النتيجة قبل البقية.
03
شخصيات الذكاء الاصطناعي والأفاتارات
امنح شخصية مولّدة صوتًا وجملة حوار تناسب قصتك.
جرّب هذا
ولّد الشخصية وهي تواجه الكاميرا بفم مغلق، كما في مثالنا.
04
تصحيح جملة واحدة
استبدل كلمة خاطئة واحدة في محاضرة أو دورة أو مقطع لمنصات التواصل دون إعادة التصوير.
جرّب هذا
اقتطع الجملة وحدها، وزامنها، ثم أعدها إلى مونتاجك.
/l/
ما لا تستطيع مزامنة الشفاه بالذكاء الاصطناعي إصلاحه
اختبرنا الحدود على مقاطعنا الخاصة. إليك ما تتوقعه.
اختبارنا الأول: الوجه محجوب بضربة سيف، فلم يُعثر على أي وجه. توقفت المهمة ولم يُخصم أي رصيد.
لا يوجد وجه واضح
إذا كان الوجه مُشاحًا أو صغيرًا جدًا أو ضبابيًا بسبب الحركة، تتوقف المزامنة ويُعاد إليك رصيدك.
عدة أشخاص يتحدثون
يُزامَن وجه واحد في كل مقطع. للمحادثة، اقطع كل متحدث في مقطع خاص به.
الصوت والمشاعر
تطابق مزامنة الشفاه بالذكاء الاصطناعي الفم، لا طريقة الإلقاء. التسجيل الرتيب يبقى رتيبًا.
/w/
الصيغ والحدود والأسعار
ما تقبله مزامنة الشفاه بالذكاء الاصطناعي، وما تعيده، وكم تكلّف.
الإدخال
الفيديو: MP4 أو MOV، من 2 إلى 60 ثانية، حتى 100 MB، بدقة 360p على الأقل. الصوت: MP3 أو WAV أو M4A أو AAC حتى 10 MB.
الإخراج
ملف MP4 بمدة الفيديو نفسها، مع الكلام الجديد مسارًا صوتيًا والفم مطابق له.
السعر
8 رصيد لكل ثانية من الفيديو، مع التقريب إلى ثوانٍ كاملة. للخطط المدفوعة فقط. تُعاد أرصدة العمليات الفاشلة.