الصورة الناطقة بالذكاء الاصطناعي

ارفع صورة شخصية واحدة والكلام الذي تريده، وستحوّلها الصورة الناطقة بالذكاء الاصطناعي إلى فيديو لهذا الوجه وهو يقول كل كلمة.

  • صورة واحدة تكفي
  • أي مقطع صوتي
  • حتى 1080p
  • الدفع حسب الثانية
720p · 8/ثانية

تحصل على ملف MP4 بطول صوتك. تستغرق معظم المقاطع القصيرة 3–5 دقائق.

مثال على الصورة الناطقة بالذكاء الاصطناعي

أحد اختباراتنا: صورة شخصية واحدة وجملة منطوقة واحدة تحوّلتا إلى فيديو ناطق. شغّل الصوت.

الصورة الشخصية المولّدة بالذكاء الاصطناعي التي صُنعت منها الصورة الناطقة
الصورة
الصورة الناطقة

الجملة التي يقولها بالإنجليزية: «Hi there. A minute ago this clip was silent. Now every word I say matches my lips.»

المستوى القياسي · 6.5 ثانية من الكلام · 56 رصيد · نحو 3.5 دقيقة

صورة واحدة، جملة واحدة، طريقتان

جعلنا الرجل نفسه يقول الجملة نفسها مرتين: مرة بالصورة الناطقة بالذكاء الاصطناعي، ومرة بتحريك الصورة ثم مزامنة شفاهها.

الصورة الناطقة بالذكاء الاصطناعي

خطوة واحدة

صورة وصوت في الإدخال، وفيديو ناطق في الإخراج. خطوة واحدة، ويتحرك الرأس والوجه مع الكلام.

56 رصيد

التحريك ثم مزامنة الشفاه

خطوتان

أولًا مقطع صامت مدته 8 ثوانٍ من الصورة، ثم يُعاد رسم الفم وفق الجملة. خطوتان، وتختار الحركة في الخطوة الأولى.

30 + 64 = 94 رصيد

لصورة شخصية واحدة تتكلم، الصورة الناطقة بالذكاء الاصطناعي أرخص وأبسط. ابدأ بالتحريك عندما تحتاج إلى حركة محددة أو لقطة أطول أو مشهد حول الوجه.

ما هي الصورة الناطقة بالذكاء الاصطناعي؟

الصورة الناطقة بالذكاء الاصطناعي هي فيديو يُصنع من صورة ثابتة واحدة ومقطع صوتي: يفتح الوجه في الصورة فمه ويرمش ويحرّك رأسه بالتزامن مع الكلام. تقدّم صورة شخصية وتسجيلًا صوتيًا، فيُرسم كل إطار لهذا الشخص وهو يتكلم.

تمنح الصوت وجهًا دون كاميرا. يمكن لشرح منتج أو مقدمة دورة أو صورة عائلية أو شخصية مولّدة بالذكاء الاصطناعي أن تتكلم خلال دقائق بدلًا من يوم تصوير.

كيف تعمل الصورة الناطقة بالذكاء الاصطناعي

يقرأ النموذج الصوت ويحدد شكل الفم لكل صوت، إضافة إلى الحركات الصغيرة التي ترافق الكلام: إيماءة عند كلمة مشدّدة، وحاجبان مرفوعان عند السؤال، ورمشات بين العبارات. ثم يرسم كل إطار من صورتك، محافظًا على الوجه والشعر والملابس كما هي بينما تتغير التعابير.

ما يبقى كما هو

هوية الشخص وتسريحة شعره وملابسه والخلفية وتأطير صورتك.

ما يُضاف

حركة شفاه تطابق الكلمات، ورمشات طبيعية، وحركة خفيفة للرأس والكتفين، وصوتك مسارًا صوتيًا للفيديو.

كيف تجعل صورة تتكلم في 3 خطوات

تعمل الصورة الناطقة بالذكاء الاصطناعي بالكامل في متصفحك. بلا كاميرا وبلا برامج تحرير.

01

ارفع صورة شخصية

صورة JPG أو PNG لوجه واحد ينظر إلى الكاميرا، لا يقل كل جانب منها عن 300 بكسل.

02

أضف الكلام

تسجيل بصيغة MP3 أو WAV أو M4A أو AAC. حتى 15 ثانية في المستويين القياسي وHD، و30 ثانية في السينمائي.

MP4
03

اختر المستوى وابدأ التحريك

اختر الجودة، وحدّد مربع الموافقة، ثم اضغط «تحريك». تجهز معظم المقاطع القصيرة خلال ثلاث إلى خمس دقائق.

قياسي أو HD أو سينمائي: أي مستوى تختار

تستخدم المستويات كلها الصورة والصوت نفسيهما، وتختلف في الوضوح، وفي أقصى مدة للكلام، وفي مدى واقعية الحركة.

قياسي

8 رصيد لكل ثانية

الإخراج
720p
أطول صوت
15 ثانية

منشورات التواصل الاجتماعي والمسودات والاختبارات السريعة. مثالنا أعلاه بالمستوى القياسي.

HD

16 رصيد لكل ثانية

الإخراج
1080p
أطول صوت
15 ثانية

المقدّمون والإعلانات وكل ما يُعرض بملء الشاشة على الحاسوب.

سينمائي

27 رصيد لكل ثانية

الإخراج
1080p
أطول صوت
30 ثانية

الخطابات الأطول والأداء المعبّر وأكثر حركات الرأس والجسم واقعية.

ما الذي يجعل الصورة جيدة

لا تستطيع الصورة الناطقة بالذكاء الاصطناعي تحريك إلا ما تراه. هذه الأمور الخمسة تصنع الفرق الأكبر.

01

الوجه نحو الكاميرا

من الأمام أو بانحراف خفيف. الصورة الجانبية لا تُظهر إلا نصف الفم.

لماذا يهم ذلك

يحتاج النموذج إلى زاويتي الشفتين معًا لتشكيل كل كلمة.

02

فم مغلق ومسترخٍ

التعبير المحايد أو الابتسامة الخفيفة يتركان للنموذج مجالًا لفتح الفم بشكل طبيعي.

لماذا يهم ذلك

الابتسامة العريضة أو الفم المفتوح في الصورة يتعارضان مع كل كلمة.

03

واضحة وجيدة الإضاءة

إضاءة متساوية على الوجه، بلا ظلال قوية، ولا يقل كل جانب عن 300 بكسل.

لماذا يهم ذلك

التفاصيل حول العينين والشفتين هي ما يجعل الحركة مقنعة.

04

شخص واحد

اقتصّ صور المجموعات إلى الوجه الوحيد الذي تريده أن يتكلم.

لماذا يهم ذلك

مع عدة وجوه، قد يبدأ الوجه الخطأ بالكلام.

05

لا شيء أمام الوجه

لا أيدي ولا ميكروفونات ولا نظارات شمسية ولا شعر فوق الفم.

لماذا يهم ذلك

الملامح المغطاة يُعاد رسمها بشكل سيئ أو لا تُرسم أبدًا.

كيف تجهّز الصوت

مدة الفيديو تساوي مدة صوتك تمامًا، وتدفع مقابل تلك الثواني. القليل من التحضير يوفّر رصيدك.

  1. 1

    احذف الصمت

    قصّ الثواني الصامتة في البداية والنهاية، فهي تكلّف مثل الكلام.

  2. 2

    صوت واحد واضح

    سجّل في غرفة هادئة وقريبًا من الميكروفون. الموسيقى الخلفية أو صوت ثانٍ قد يجعلان الشفاه تتبع الصوت الخطأ.

  3. 3

    الوقفات الطبيعية تساعد

    الاستراحات القصيرة بين الجمل تمنح الوجه وقتًا ليرمش ويستعيد وضعه، فيبدو أكثر إنسانية.

  4. 4

    أي لغة تصلح

    يتبع الفم الأصوات لا الكلمات، لذا تصلح أي لغة منطوقة أو لهجة.

أفاتار ناطق بالذكاء الاصطناعي أم مزامنة الشفاه أم فيديو بالكلام الأصلي؟

ثلاث طرق لتُظهر على الشاشة شخصًا يقول كلماتك. اختر بحسب ما تبدأ به.

الصورة الناطقة بالذكاء الاصطناعي

تبدأ بـ
صورة واحدة، مع صوت
الأنسب لـ
المقدّمون والأفاتارات والشخصيات عندما لا تملك لقطات فيديو
انتبه إلى
حركة الرأس والكتفين فقط، وتبقى الخلفية ثابتة

السعر على Imgveo

40 رصيد مقابل 5 ثوانٍ في المستوى القياسي

مزامنة الشفاه بالذكاء الاصطناعي

تبدأ بـ
فيديو، مع صوت
الأنسب لـ
الدبلجة وتصحيح الجمل في لقطات تملكها بالفعل
انتبه إلى
تحتاج إلى وجه واضح في الفيديو

السعر على Imgveo

40 رصيد لمقطع مدته 5 ثوانٍ

الفيديو بالكلام الأصلي

تبدأ بـ
وصف نصي يتضمن الحوار
الأنسب لـ
مشاهد جديدة تُولَّد فيها الصورة والصوت معًا
انتبه إلى
لا تختار الوجه أو الصوت بدقة

السعر على Imgveo

من 30 رصيد لمقطع مدته 8 ثوانٍ مع الصوت

الأسعار مأخوذة من قائمة أسعارنا الحالية.

استخدامات الصورة الناطقة بالذكاء الاصطناعي

في كل مكان يقول فيه الوجه الفكرة أفضل من نص على شريحة عرض.

01

المقدّمون والشروحات

امنح صفحة منتج أو دورة تدريبية أو مسار تهيئة وجهًا ودودًا يتكلم.

جرّب هذا

استخدم الصورة الشخصية نفسها في كل فيديو ليتعرّف المشاهدون على المقدّم.

02

الشخصيات المولّدة

دع شخصية مولّدة تعرّف بنفسها أو تروي قصة أو تردّ على أحد المعجبين.

جرّب هذا

ولّد الشخصية وهي تواجه الكاميرا بفم مغلق، كما في مثالنا.

03

الصور العائلية

أعد الحياة إلى صورة قديمة برسالة سجّلها أحد الأقارب.

جرّب هذا

امسح الصورة ضوئيًا بوضوح واقتصّها إلى وجه واحد قبل الرفع.

04

رسائل متعددة اللغات

سجّل الرسالة نفسها بعدة لغات واستخدم صورة شخصية واحدة لها كلها.

جرّب هذا

اجعل التسجيلات متقاربة في الطول لتبدو الفيديوهات متناسقة.

ما لا تستطيعه الصورة الناطقة بالذكاء الاصطناعي

حدود صريحة، لتعرف ما تتوقعه قبل أن تنفق رصيدك.

حركة الجسم بالكامل

يتحرك الوجه والرأس والكتفان. أما المشي والإيماءات وحركات الكاميرا فتحتاج إلى نموذج فيديو.

الصور الجانبية والأفواه المغطاة

إذا كان نصف الفم مخفيًا، تبدو الحركة خاطئة. استخدم صورة أمامية.

الخطابات الطويلة جدًا

يقبل المستويان القياسي وHD حتى 15 ثانية، والسينمائي حتى 30. قسّم النصوص الأطول إلى عدة مقاطع.

ملامح شخص آخر

تحتاج إلى حق استخدام الوجه والصوت. نحظر المحتوى الذي يخالف قواعدنا.

الصيغ والحدود والأسعار

ما تقبله الصورة الناطقة بالذكاء الاصطناعي، وما تعيده، وكم تكلّف.

الإدخال

الصورة: JPG أو PNG حتى 10 MB، بدقة 300 px على الأقل، ولا تتجاوز نسبة الطول إلى العرض أو العكس 2.5 إلى 1. الصوت: MP3 أو WAV أو M4A أو AAC حتى 10 MB.

الإخراج

ملف MP4 بطول صوتك، مع كلامك مسارًا صوتيًا، بدقة 720p في المستوى القياسي و1080p في HD والسينمائي.

السعر

8 أو 16 أو 27 رصيد لكل ثانية من الصوت، مع التقريب إلى ثوانٍ كاملة. للخطط المدفوعة فقط. تُعاد أرصدة العمليات الفاشلة.

السعر حسب المدة

مدة الصوتقياسيHDسينمائي
5 ثانية4080135
10 ثانية80160270
15 ثانية120240405
30 ثانية——810

الموافقة والاستخدام المسؤول

يمكن للصورة الناطقة أن تُظهر أي شخص وكأنه يقول أي شيء، لذلك نطلب الإذن أولًا. قبل كل عملية تؤكد أن لديك الحق في استخدام الوجه والصوت، وتُفحص كل صورة.

  • استخدم وجهك أنت، أو شخصًا موافقًا، أو شخصية ولّدتها بنفسك.
  • لا تجعل الشخصيات العامة أو القاصرين أو الأفراد العاديين يبدون وكأنهم يقولون ما لم يقولوه قط.
  • ضع على فيديوهات الصور الناطقة علامة تفيد بأنها مصنوعة بالذكاء الاصطناعي حيث تطلب منصتك ذلك.

الأسئلة الشائعة حول الصورة الناطقة بالذكاء الاصطناعي

تريد كل نماذج الذكاء الاصطناعي في مكان واحد؟

افتح Imgveo Studio لتشغيل هذه الأداة وكل نماذج فيديو وصور الذكاء الاصطناعي الأخرى من مساحة عمل واحدة، برصيد نقاط واحد.

افتح في Studio

المزيد من أدوات الفيديو

امنحها صوتًا، ثم اذهب أبعد.

اجعل صورتك تتكلم

ارفع صورة شخصية ومقطعًا صوتيًا، وستتولى الصورة الناطقة بالذكاء الاصطناعي الباقي خلال دقائق.