فيديوهات ذكاء اصطناعي أطول (30 ث+) بإطاري البداية والنهاية
عالق عند 5–10 ثوانٍ؟ تعلّم سلسلة الإطار الأخير: استخرج الإطار الأخير، استخدمه إطار بداية للمقطع التالي، وادمج فيديو ذكاء اصطناعي متصلًا مدته 30 ثانية.
كيف تصنع فيديوهات ذكاء اصطناعي أطول: سلسلة المقاطع بإطاري البداية والنهاية
كل مولّد فيديو بالذكاء الاصطناعي يصطدم بالجدار نفسه. تكتب أمرًا نصيًا ممتازًا، ويبدو المقطع صحيحًا، ثم ينتهي بعد خمس ثوانٍ أو عشر. لا يوجد زر "اجعله 30 ثانية"، وحين تقدّم منصة ما ميزة "تمديد"، فهي عادةً نموذج واحد، ومقطع إضافي واحد، وطابور انتظار.
الخبر السار أنك لا تحتاج إلى زر تمديد لصنع فيديوهات ذكاء اصطناعي أطول. تحتاج إلى تقنية واحدة تعمل على كل نموذج: خذ الإطار الأخير من المقطع الذي بين يديك، واستخدمه إطار بداية للمقطع الذي تريده بعده، وحافظ على هيكل الأمر النصي، وغيّر الحركة وحدها، ثم اضمم القطع بعضها إلى بعض. نسميها The Last-Frame Chain (سلسلة الإطار الأخير). ستة مقاطع مدة كل منها 5 ثوانٍ تصبح لقطة من 30 ثانية؛ وثلاثة مقاطع من 10 ثوانٍ تفعل الشيء نفسه بوصلات أقل.
يشرح هذا الدليل الطريقة خطوة بخطوة، ويوضح ما يكلفه فعلًا فيديو من 30 ثانية على كل فئة، ويغطي الطرق الأربع التي تتعثر بها السلسلة وكيف تصلح كلًّا منها. الأسعار هي أرقام الأرصدة الحية من Studio كما هي في سبتمبر 2026.
لماذا مقاطع فيديو الذكاء الاصطناعي قصيرة إلى هذا الحد
فهم الحد يجعل الالتفاف عليه بديهيًا.
الحوسبة تنمو مع كل ثانية
تولّد نماذج الفيديو كل إطارات المقطع معًا، وتكلفة إبقائها متسقة ترتفع بحدة مع الطول. لهذا يحاسب كل نموذج تقريبًا بالثانية ويحدّ عملية التوليد الواحدة عند 5 إلى 10 ثوانٍ: بعد تلك النقطة تنخفض الجودة ويرتفع السعر أسرع مما يقبل أحد دفعه.
الانحراف ينمو مع الطول
حتى حين يسمح النموذج بلقطة واحدة أطول، تكون الثواني الأخيرة هي الأضعف. تلين الوجوه، وتنزلق الخلفيات، وتفقد الحركة قصدها. سلسلة من مقاطع قصيرة مثبّتة جيدًا تكون عادةً أنظف من توليد طويل واحد، لأن كل مقطع يبدأ من إطار حاد ومقصود.
ما هي الحدود اليوم
على Imgveo، أقصى مدة لتوليد واحد في كل فئة، بحسب فحصنا في سبتمبر 2026:
| الفئة | أقصى مقطع واحد | وضع إطار البداية والنهاية |
|---|---|---|
| Kling 3 (std / pro / 4K) | 10 s | نعم، حتى 5 s |
| Wan 2.7 | 10 s | نعم، حتى 5 s |
| Seedance 2 / Seedance 2 Fast | 10 s | نعم، حتى 5 s |
| Basic | 10 s | نعم، حتى 5 s |
| Hailuo | 6 s أو 10 s | نعم، حتى 5 s |
| Veo 3.1 | 8 s (ثابتة) | استخدم الصورة إلى فيديو بدلًا منه |
| Kling 2.6 | 10 s | لا |
يترتب على ذلك أمران. وضع إطار البداية والنهاية، وهو أدق طريقة للسلسلة، يقف عند 5 ثوانٍ لكل مقطع. أما الصورة إلى فيديو العادية، التي لا تحتاج إلا إلى إطار بداية، فتصل إلى 10 ثوانٍ على معظم الفئات. السلسلة تعمل بأيهما؛ والاختيار هو بين الدقة وبين وصلات أقل.
ثلاث طرق للحصول على فيديو ذكاء اصطناعي أطول
المسار 1: اختر أطول فئة وولّد مرة واحدة
إذا كانت 10 ثوانٍ تكفيك، فتوقف هنا. Kling 3 وWan 2.7 وSeedance 2 وBasic كلها تولّد مقطعًا واحدًا من 10 ثوانٍ بلا وصلات وبأمر نصي واحد. وHailuo يقدّم 10 ثوانٍ في وضعه القياسي أيضًا. التكلفة ببساطة ضعف مقطع 5 ثوانٍ على الفئات المحاسَبة بالثانية، والجودة عادةً جيدة طوال المدة في اللقطات البسيطة ذات الحركة الواحدة.
المسار 2: سلسلة المقاطع بإطاري البداية والنهاية
لأي شيء يتجاوز 10 ثوانٍ، أو للقطة من 10 ثوانٍ تحتاج إلى مرحلتين متمايزتين، استخدم السلسلة. يبدأ كل مقطع من الإطار نفسه الذي انتهى عنده المقطع السابق تمامًا، فتكون الوصلة غير مرئية حين تكون الحركة متصلة. ولا يوجد حد أعلى: 30، 60، 90 ثانية، ما دامت مراحلك متماسكة.
المسار 3: دمج لقطات مستقلة
إذا كان الفيديو تتابعًا لزوايا مختلفة لا لقطة واحدة متصلة، فلست بحاجة إلى استمرارية الإطارات أصلًا. ولّد كل لقطة من الصورة المرجعية نفسها وهيكل الأمر النصي نفسه، وركّبها معًا على موسيقى، وسيخفي المونتاج أي انحراف موجود. هكذا تُصنع معظم إعلانات الذكاء الاصطناعي ومقاطعه الدعائية، وهو أسرع المسارات.
معظم المشاريع الحقيقية تمزج بين المسار 2 للقطة الرئيسية والمسار 3 للقطات المساندة حولها.
سلسلة الإطار الأخير، خطوة بخطوة
الخطوة 1: خطّط المراحل
اكتب ما يحدث في كل مقطع قبل أن تولّد أي شيء. مرحلة واحدة لكل 5 ثوانٍ. للقطة منتج مدتها 30 ثانية قد يكون ذلك:
- زجاجة على سطح رخامي، تقدّم بطيء للكاميرا، ضوء صباحي.
- الكاميرا تواصل التقدّم، وقطرات التكاثف تلتقط الضوء.
- يد تدخل الكادر وترفع الزجاجة.
- الزجاجة تدور لتكشف الملصق.
- اليد تضعها، والكاميرا تبدأ التراجع.
- يكتمل التراجع، لقطة واسعة للسطح.
كل مرحلة هي حركة كاميرا واحدة وفعل واحد للموضوع. إذا وجدت نفسك تكتب حركتين في مرحلة واحدة، فاقسمها إلى مرحلتين.
الخطوة 2: ولّد المقطع 1
استخدم الصورة إلى فيديو مع صورتك المرجعية إطار بداية، أو النص إلى فيديو إذا كنت تبدأ من لا شيء. اكتب الأمر النصي كاملًا: الموضوع، والمكان، والإضاءة، وحركة الكاميرا، والمزاج. هذا هو الهيكل الذي سيعيد كل مقطع لاحق استخدامه. ولّد بدقة مسودة (480p على Basic تكلف 20 رصيدًا) حتى تضبط الحركة، ثم أعد تشغيل النسخة المعتمدة على الفئة والدقة اللتين ستنشر بهما.
الخطوة 3: استخرج الإطار الأخير
نزّل المقطع 1 والتقط إطاره الأخير بصيغة PNG. أي من هذه الطرق يفي بالغرض:
- في معظم مشغّلات سطح المكتب، أوقف التشغيل عند الإطار الأخير واستخدم أمر اللقطة أو تصدير الإطار المدمج.
- في سطر الأوامر، استدعاء واحد لـ ffmpeg يقفز إلى النهاية ويكتب إطارًا واحدًا:
ffmpeg -sseof -0.1 -i clip1.mp4 -frames:v 1 -update 1 last-frame.pngالتقط الإطار الأخير الحقيقي، لا إطارًا قبله بثانية. فالإطار المأخوذ من منتصف حركة يُحدث قفزة مرئية حين يبدأ منه المقطع التالي.
الخطوة 4: استخدمه إطار بداية للمقطع التالي
افتح وضع إطار البداية والنهاية أو الصورة إلى فيديو وارفع last-frame.png إطار بداية. في وضع إطار البداية والنهاية يمكنك أيضًا رفع إطار نهاية إذا كنت تعرف أين ينبغي أن تحطّ المرحلة 2؛ وإن لم تكن تعرف، فاتركه فارغًا ودع النموذج يواصل الحركة.
الخطوة 5: أعد كتابة الحركة وحدها
حافظ على الهيكل كلمة بكلمة: الموضوع، والمكان، والإضاءة، والمزاج. غيّر فقط سطر الحركة والكاميرا للمرحلة الجديدة. فالأمر النصي الذي تتغير صياغته في كل موضع يدعو النموذج إلى إعادة تفسير الإضاءة أو الموضوع، ومن هنا تأتي تحولات الألوان وانحراف الهوية.
الخطوة 6: كرّر
ولّد المقطع 2، واستخرج إطاره الأخير، وأدخله في المقطع 3، وهكذا. احتفظ بالأمر النصي لكل مقطع في ملف نصي بجوار المقطع؛ فحين يفشل مقطع، ستعيد تشغيله بالكلمات نفسها بدلًا من إعادة اختراعه.
الخطوة 7: ادمج
ضع المقاطع على خط زمني بالترتيب واضممها مباشرة بلا انتقالات. إذا تلعثمت وصلة، فاقتطع إطارين أو ثلاثة من نهاية المقطع الأسبق، لأن الإطارات الأخيرة في عملية التوليد تكون أحيانًا شبه مكررة. صدّر مرة واحدة بدقة النشر.
الحفاظ على السلاسة
أربع عادات تجعل الوصلات تختفي.
هيكل الأمر النصي نفسه في كل مقطع
أكبر سبب منفرد للوصلات المرئية هو انحراف الأمر النصي. انسخ الأمر السابق، وعدّل جملة واحدة، وولّد. لا تعد الكتابة من الذاكرة.
حركة كاميرا واحدة لكل مقطع
تقدّم للكاميرا يستمر عبر مقطعين يُقرأ لقطة واحدة. أما تقدّم يتحول إلى تحريك أفقي في منتصف المقطع فيُقرأ قطعًا مونتاجيًا حتى لو تطابقت الإطارات. دع كل مقطع يكمل حركة واحدة، وابدأ الحركة التالية عند الوصلة إن احتجت إليها.
طابق كلمات الإضاءة حرفيًا
"ضوء صباحي" في المقطع 1 و"ضوء نهار ناعم" في المقطع 2 تعليمتان مختلفتان للنموذج، وسينفّذهما. مفردات الإضاءة هي الجزء من الهيكل الذي يجب حراسته بأشد الحرص.
استخدم إطار النهاية حين تعرف الوجهة
إذا كان على المرحلة 4 أن تنتهي عند تكوين محدد، كالملصق مواجهًا للكاميرا، فولّد ذلك التكوين صورةً ثابتة أولًا وقدّمه إطار نهاية. سيولّد وضع إطار البداية والنهاية الحركة الفاصلة بين الاثنين، وهذا أوثق بكثير من وصف الوجهة بالكلمات.
كم يكلف فيديو من 30 ثانية
تكلفة السلسلة هي ببساطة تكلفة المقطع مضروبة في عدد المقاطع. إليك ستة مقاطع من 5 ثوانٍ على كل فئة، بلا صوت، على خطة Starter بسعر $19.90 مقابل 1,500 رصيد.
| الفئة | لكل مقطع 5 s | 6 مقاطع (30 s) | ≈ $ (Starter) |
|---|---|---|---|
| Basic 480p | 20 رصيدًا | 120 | $1.60 |
| Kling 3 القياسي 1080p | 50 رصيدًا | 300 | $3.98 |
| Wan 2.7 720p | 50 رصيدًا | 300 | $3.98 |
| Kling 3 الاحترافي 1080p | 65 رصيدًا | 390 | $5.17 |
| Seedance 2 720p | 125 رصيدًا | 750 | $9.95 |
| Kling 3 4K | 225 رصيدًا | 1,350 | $17.91 |
ثلاث طرق لإنفاق أقل:
- اصنع مسودة السلسلة كاملة على Basic 480p مقابل $1.60، واضبط المراحل، ثم أعد توليد المقاطع التي تحتفظ بها فقط على الفئة النهائية.
- استخدم مقاطع الصورة إلى فيديو من 10 ثوانٍ حيث تسمح الدقة بذلك. على الفئات المحاسَبة بالثانية يبقى الإجمالي نفسه، لكن لديك ثلاث وصلات بدلًا من خمس. وعلى Basic، حيث يكلف المقطع 20 رصيدًا ثابتًا أيًّا كان طوله، تكلف ثلاثة مقاطع من 10 ثوانٍ 60 رصيدًا بدلًا من 120.
- أوقف الصوت أثناء السلسلة. الصوت المولَّد لا يستمر عبر الوصلات على أي حال، فستدفع الرسم الإضافي مقابل صوت ستستبدله. أضف مسارًا واحدًا متصلًا في المونتاج.
عمليات التوليد الفاشلة تُسترد تلقائيًا على Imgveo، فالمقطع الذي يخطئ يكلفك وقتًا لا أرصدة. طريقة التكلفة الكاملة، بما فيها حساب نسبة الفشل على المنصات التي لا تسترد، موجودة في شرح أرصدة فيديو الذكاء الاصطناعي.
المشكلات الشائعة وحلولها
تحولات الألوان بين المقاطع
السبب: أعاد النموذج تفسير الإضاءة أو توازن الأبيض لأن صياغة الأمر النصي تغيرت، أو لأن الإطار المستخرج كان مضغوطًا.
الحل: استعد كلمات الإضاءة الدقيقة من الأمر النصي السابق، وصدّر الإطار الأخير بصيغة PNG لا JPEG. وإذا بقي تحول، فتعديل واحد لمطابقة الألوان على المقطع اللاحق في محرّرك يسدّ الفجوة.
الحركة "تعود إلى الصفر" عند الوصلة
السبب: يبدأ المقطع الجديد من صورة ثابتة، فيبدأ النموذج من السكون قبل أن يلتقط الحركة.
الحل: صف الحركة على أنها جارية بالفعل ("الكاميرا تواصل تقدّمها البطيء") لا على أنها تبدأ ("الكاميرا تتقدّم"). كما أن اقتطاع أول إطارين أو ثلاثة من المقطع الجديد يزيل التوقف المرئي.
انحراف الوجه أو الشخصية
السبب: أخطاء الهوية الصغيرة تتراكم عبر المقاطع؛ وبحلول المقطع 4 يصبح الوجه لشخص آخر.
الحل: قدّم الصورة المرجعية الأصلية إلى جانب الإطار الأخير على الفئات التي تقبل المراجع، وأبقِ وصف الهوية في كل أمر نصي. للتتابعات ذات الشخصية الواحدة، يحافظ Seedance 2 على الهوية على أفضل وجه عبر السلاسل الطويلة. يغطي دليل اتساق الشخصيات لدينا التقنيات المشتركة بين النماذج.
الصوت لا يستمر
السبب: يولّد كل مقطع صوته الخاص، ولا شيء يوائم بينها.
الحل: ولّد بلا صوت، وأضف أرضية صوتية واحدة متصلة في المونتاج. وإذا احتاج مقطع إلى حوار أصلي، فولّد ذلك المقطع مع الصوت على فئة تجيده واقطع الباقي صامتًا؛ مقارنة الصوت الأصلي لدينا تشرح أي الفئات تختار.
أي فئة تستخدم للسلسلة
- Kling 3 القياسي هو الخيار الافتراضي: 1080p، و50 رصيدًا لكل 5 ثوانٍ، والتزام قوي في الصورة إلى فيديو، فيحترم كل مقطع إطار بدايته. صفحة Kling 3 تعرض الأوضاع الثلاثة كلها.
- Basic هو فئة المسودات: 20 رصيدًا ثابتًا لكل مقطع بدقة 480p، مثالي لاختبار المراحل قبل الإنفاق على النسخة النهائية.
- Seedance 2 حين يجب أن تصمد شخصية واحدة عبر السلسلة كلها؛ يكلف أكثر بالثانية لكنه يوفر إعادة المحاولات.
- Wan 2.7 للحركة ذات الطابع الفني أو المرسومة بدقة 720p، و50 رصيدًا لكل 5 ثوانٍ.
- Veo 3.1 غير مريح للسلسلة لأن كل مقطع ثابت عند 8 ثوانٍ ولا يقبل إطار نهاية؛ استخدمه لمقطع الحوار، لا للسلسلة.
- Kling 2.6 لا يدعم وضع إطار البداية والنهاية إطلاقًا؛ استخدم الصورة إلى فيديو معه، أو اختر Kling 3.
أيًّا كانت الفئة التي تختارها، تذكّر أن مقاطع إطار البداية والنهاية تقف عند 5 ثوانٍ، ومقاطع الصورة إلى فيديو عند 10.
الأسئلة الشائعة
كم يمكن أن يطول فيديو الذكاء الاصطناعي؟
عملية التوليد الواحدة تكون عادةً من 5 إلى 10 ثوانٍ على النماذج الحالية؛ وعلى Imgveo أطول مقطع واحد هو 10 ثوانٍ، وVeo 3.1 ثابت عند 8. ولا يوجد حد للطول المتسلسل: باستخدام الإطار الأخير من كل مقطع إطار بداية للمقطع التالي، يبني المبدعون بانتظام لقطات متصلة من 30 ثانية و60 ثانية وأطول.
هل يستطيع الذكاء الاصطناعي توليد فيديو مدته دقيقة؟
ليس في تمريرة واحدة على النماذج المستضافة اليوم، لكن نعم عبر السلسلة. لقطة متصلة من 60 ثانية هي اثنا عشر مقطعًا من 5 ثوانٍ أو ستة مقاطع من 10 ثوانٍ. على Kling 3 القياسي يعني ذلك 600 رصيد، نحو $8 على خطة Starter؛ وعلى Basic 480p كمسودة، نحو $2.40.
كيف أمدّد فيديو ذكاء اصطناعي؟
استخرج الإطار الأخير من المقطع بصيغة PNG، وارفعه إطار بداية لعملية توليد جديدة، وأعد استخدام الأمر النصي الأصلي مع تغيير الحركة وحدها، واضمم المقطعين بلا انتقال. تلك هي سلسلة الإطار الأخير، وهي تعمل على أي نموذج يقبل صورة بداية، أي على كل النماذج تقريبًا.
ما هو إطار البداية والنهاية في فيديو الذكاء الاصطناعي؟
وضع توليد تقدّم فيه الإطار الأول، واختياريًا الإطار الأخير، صورتين، فينشئ النموذج الحركة بينهما. إنه أدق طريقة للتحكم في أين يبدأ المقطع وأين ينتهي، ما يجعله مثاليًا لسلسلة المقاطع وللوصول إلى تكوين نهائي محدد.
هل تفقد سلسلة المقاطع الجودة؟
ليس بطبيعتها. يبدأ كل مقطع من إطار حاد، فكثيرًا ما تبدو السلسلة أنظف من توليد طويل واحد. مشكلات الجودة تأتي من انحراف الأمر النصي، والإطارات المستخرجة المضغوطة، وانحراف الهوية عبر مقاطع كثيرة، وكلها تعالجها الحلول أعلاه. صدّر الإطار الأخير بصيغة PNG وحافظ على هيكل الأمر النصي ثابتًا.
ما أرخص طريقة لصنع فيديو ذكاء اصطناعي من 30 ثانية؟
اصنع مسودته على فئة Basic بدقة 480p، حيث يكلف كل مقطع 20 رصيدًا ثابتًا، بإجمالي 60 إلى 120 رصيدًا ($0.80 إلى $1.60 على Starter). ثم أعد توليد المقاطع المعتمدة فقط على Kling 3 القياسي بدقة 1080p مقابل 300 رصيد، نحو $4. أبقِ الصوت مغلقًا أثناء السلسلة وأضف مسارًا واحدًا في المونتاج.
الخلاصة
الفيديوهات الأطول بالذكاء الاصطناعي ليست ميزة تنتظرها؛ بل تقنية تطبّقها. خطّط مرحلة واحدة لكل مقطع، واستخرج الإطار الأخير بصيغة PNG، ومرّره إلى الأمام، وغيّر الحركة وحدها، واضمم النتائج مباشرة. اصنع المسودة رخيصة، وأنهِ العمل مرة واحدة، وعالج الوصلات بالحلول الأربعة أعلاه. جرّب المقطع الأول الآن في وضع إطار البداية والنهاية، أو ابدأ من صورتك الخاصة على صفحة الصورة إلى فيديو؛ سعر الأرصدة لكل فئة يُعرض قبل أن تولّد.
قراءات ذات صلة: اتساق الشخصيات في فيديو الذكاء الاصطناعي: دليل عبر النماذج، وشرح أرصدة فيديو الذكاء الاصطناعي، وكم تكلف فيديوهات الذكاء الاصطناعي فعلًا؟.
الكاتب

التصنيفات
المزيد من المقالات
أفضل مولّدات فيديو ذكاء اصطناعي بصوت أصلي (مقارنة 2026)
أي مولّدات الفيديو تنتج الصوت (حوار، مؤثرات، أجواء، موسيقى) في مرور واحد؟ نقارن Veo 3 وKling 3 وKling 2.6 وSeedance 2 وما يضيفه الصوت إلى الفاتورة.

إزالة الخلفية في GIMP: 5 طرق فعّالة (GIMP 3.0)
دليل خطوة بخطوة لإزالة الخلفية في GIMP — أداة Fuzzy Select وميزة Color to Alpha وأقنعة الطبقات ومعالجة حواف الشعر، ومتى تتفوق أداة الذكاء الاصطناعي التي تنجز المهمة في ثانيتين.

شرح أرصدة فيديو الذكاء الاصطناعي: تكلفة المقطع على 5 منصات
Pollo وHiggsfield وPixVerse وKling وImgveo كلها تبيع أرصدة، لكن الرصيد ليس مقطعًا. إليك حساب سعر الصرف لما يكلفه فعلًا فيديو واحد مدته 5 ثوانٍ.
