يقوم الذكاء الاصطناعي الجديد لـ MiniMax بإنشاء مقاطع فيديو بدقة 2K بصوت أصلي
اكتسب سوق الذكاء الاصطناعي التوليدي للتو منافسًا قويًا مع وصول MiniMax H3، الذي تم إطلاقه رسميًا في 31 يوليو 2026. وعلى عكس الأنظمة الأساسية القديمة التي كانت تتطلب مكونات إضافية تابعة لجهات خارجية لإضافة الصوت، يقوم هذا النظام الجديد بمعالجة الصوت المجسم والصور والنصوص والمقاطع بطريقة متكاملة تمامًا. توفر الأداة مواد سمعية وبصرية بدقة أصلية 2K، مما يؤدي إلى إنشاء ملفات مغلقة تدوم ما بين أربع إلى خمس عشرة ثانية بالضبط، بدون أجزاء زمنية.
حتى وقت قريب، كان المحترفون في المجال السمعي البصري بحاجة إلى الجمع بين برامج متعددة لتحريك صورة فوتوغرافية أو مزامنة التعليقات الصوتية أو ضبط حركة الكاميرا. يزيل النموذج الذي تم إصداره حديثًا هذا التجزئة من خلال تركيز جميع خطوات التحرير في بيئة تدريب مسبقة واحدة. ومن الناحية العملية، يقوم المستخدم بكتابة أوامر بسيطة بلغة المحادثة لجعل الصورة الرمزية تغني بالإيقاع الصحيح أو لتغيير زاوية عرض المشهد، مما يؤدي إلى تسريع سير العمل بشكل كبير.
في نفس الموضوع: AgiBot تعلن عن تعاونها مع MiniMax لتزويد الروبوتات البشرية بصوت طبيعي وإعدادات شخصية فريدة
طرق الوصول إلى منصة الذكاء الاصطناعي الجديدة ومدى توفرها
في هذه المرحلة المبكرة، لا تعمل التكنولوجيا محليًا على أجهزة كمبيوتر المستخدمين، بل تعتمد حصريًا على المعالجة السحابية. يمكن للمطورين دمج النظام في مشاريعهم الخاصة باستخدام واجهة البرمجة (API) ضمن كود MiniMax-H3e. بالنسبة لعامة الناس الذين يبحثون عن تجربة أكثر سهولة في الاستخدام، قامت الشركة بدمج الميزة الجديدة مباشرة في تطبيق Hailuo AI، الذي تم إصداره في وقت واحد في نهاية يوليو 2026.
اعرف المزيد: يقدم تطبيق Snapchat ميزة AI Clips التي تحول معارض الصور إلى مقاطع فيديو متحركة
قطاعات السوق التي تكتسب خفة الحركة باستخدام الأداة
صمم المطور الآسيوي المنصة مع التركيز المباشر على سوق الشركات، ساعيًا إلى تقليل الحملات الإعلانية واستراتيجيات بناء العلامة التجارية. تعد وكالات التسويق واستوديوهات تصميم الواجهات ومنتجي ألعاب الفيديو من بين الأهداف التجارية الرئيسية. إن القدرة على إنشاء رسومات مرئية عالية الدقة تنال إعجاب صناعة الأفلام أيضًا، حيث يمكنها معاينة المشاهد المعقدة قبل التصوير الفعلي، فضلاً عن تسهيل إعداد واجهات المتاجر الافتراضية في التجارة الإلكترونية.
التطبيقات المباشرة في روتين منشئي المحتوى
في الوكالات اليومية، يسمح النظام بمضاعفة قطعة إعلانية واحدة إلى عشرات الأشكال المختلفة للاختبار على الشبكات الاجتماعية. يمكن لتجار التجزئة تحويل صور المنتجات الثابتة إلى مقاطع ديناميكية، بينما يمكن لمصممي الجرافيك تحريك الملصقات الترويجية ببضع نقرات فقط. هناك اختلاف قوي آخر وهو الحفاظ على الهوية المرئية للشخصيات في الرسوم المتحركة لألعاب الفيديو وسهولة نقل تصميم الرقصات للفيديو الحقيقي إلى الصورة الرمزية الرقمية، مما يفتح نطاقًا واسعًا لإنتاج المقالات القصيرة والافتتاحات.
المزيد عن الموضوع: تزود Apple جهاز MacBook Pro بشريحة M5 Max وذاكرة وصول عشوائي (RAM) سعة 128 جيجابايت لتحسين تحرير الفيديو بدقة 8K
الأعمال الداخلية لواجهة برمجة التطبيقات (API) للمطورين
تكشف الوثائق الرسمية أن بنية التكامل تعمل بثلاثة مسارات إدخال: الإنشاء من النص، والرسوم المتحركة من الصور الثابتة، والتوليد الموجه بالملفات المرجعية. كل هذا يحدث على نقطة اتصال شبكة واحدة، تعمل بشكل غير متزامن. يرسل خادم العميل الطلب، ويراقب حالة المعالجة من خلال رمز التتبع، وعند اكتمال العرض، يقوم بتنزيل الملف النهائي.
قيود الحجم وتنسيقات الملفات المدعومة
- تتطلب بيئة التطوير الالتزام بقواعد الشحن الصارمة لتجنب التحميل الزائد على خوادم الشركة.
- يُسمح بإرفاق ما يصل إلى تسع صور فوتوغرافية وثلاثة مقتطفات من الفيديو كأساس، طالما أن الوقت الإجمالي لا يتجاوز خمسة عشر ثانية. تقتصر الملفات الصوتية على ثلاثة طلبات ويجب أن تصاحب الوسائط المرئية.
- لا يمكن أن تتجاوز حزم البيانات المختلطة اثني عشر مستندًا متزامنًا، مع تقييد نص الأمر بسبعة آلاف حرف وإجمالي وزن الطلب عند 64 ميجابايت.
- بشكل فردي، يقوم النظام بحظر مقاطع الفيديو التي يزيد حجمها عن 50 ميجابايت، والصور التي يزيد حجمها عن 30 ميجابايت، والمسارات الصوتية التي يزيد حجمها عن 15 ميجابايت.
- يغطي التوافق برامج الترميز H.264 وH.265 للصور المتحركة، والامتدادات الكلاسيكية مثل JPG وPNG للصور، بالإضافة إلى MP3 وWAV للموسيقى التصويرية.
محركات المعالجة وراء الذكاء الاصطناعي
طريقة قراءة السياق الجديدة تقلل من تحميل البيانات
يُطلق على العمود الفقري للحداثة اسم Omni contextual Representation، وهي آلية تغير منطق تفسير الأوامر. وبدلاً من مجرد تحليل الإطار النهائي، تقوم التقنية برسم خريطة للعلاقة العميقة بين طلب المستخدم والعناصر الموجودة في المشهد. يقلل هذا النهج الجراحي الحاجة إلى معالجة مائة ألف رمز إلى أربعة آلاف فقط، مما يحول اللغة المكتوبة إلى نص عالي الكفاءة للآلة.
التغطية الكاملة: آخر الأخبار (AR)
يتيح الضغط المتقدم دقة عالية أصلية
لتقديم صور واضحة تمامًا دون صهر الخوادم، أعاد المهندسون بناء الرمز المميز، وأطلقوا عليه اسم H3-VAE. يطبق هذا البرنامج معدل ضغط قويًا يضاعف قدرة القراءة التسلسلية للنموذج بمقدار أربعة. إن هذا التوفير الكبير في قوة الحوسبة هو بالضبط ما يسمح للمنصة بتصدير المقاطع بدقة 2K محليًا، مما يحافظ على تكاليف التشغيل ضمن هامش قابل للتطبيق تجاريًا.
تعمل بنية التدريب على تسريع عملية التصوير
وبعيدًا عن الماضي، تخلت الشركة عن هيكل Hailuo-02 القديم لتبني محول H3-Omni الذي تم إنشاؤه حديثًا. نظرًا لأن التعامل مع الصوت والفيديو والنص في نفس الوقت يولد تباينًا كبيرًا في حجم البيانات، فإن البنية الجديدة تقسم العبء الثقيل: يركز جزء من الأجهزة على فهم الطلب، بينما يتم تخصيص جزء آخر حصريًا لرسم وحدات البكسل. أدى تقسيم المهام هذا إلى زيادة بنسبة ثلاثين بالمائة في سرعة تدريب الخوارزمية.
التصحيح التلقائي للنصوص الصغيرة والشعارات
أحد أكبر الاختناقات في الذكاء الاصطناعي التوليدي كان دائمًا تشويه الحروف والشعارات، وهي مشكلة تم حلها هنا من خلال Regeneration in context. لا يتطلب البرنامج أدوات خارجية لتكبير الصورة، إذ يمكنه إعادة قراءة الأمر الأصلي وتصحيح الأخطاء بدقة منخفضة قبل إنهاء الملف. ويضمن هذا التحسين الداخلي ظهور العلامات التجارية وحروف الخلفية بشكل واضح ودقيق، وهو الأمر الذي غالبًا ما تطمسه المكبرات التقليدية.
أسعار تنافسية والنضال من أجل قيادة القطاع
في حرب الأسعار ضد الشركات العملاقة التي تطور أدوات مثل Sora وRunway، يلعب المطور الآسيوي بقوة. تشير تقارير السوق إلى أن إنتاج ثانية من الفيديو بدقة 2K يكلف حوالي 0.13 دولارًا أمريكيًا، أي أقل من دولارين لمقطع كامل مدته 15 ثانية – أي ثلث المبلغ الذي يتقاضاه المنافسون المباشرون. ورغم هذه الأرقام المتداولة في الصحف المتخصصة، إلا أن الصفحة الرسمية للشركة ما زالت تكتفي بإدراج أسعار الإصدار السابق Hailuo 2.3، حتى كتابة هذا التقرير، مع ضرورة الحذر فيما يتعلق بالجدول النهائي.
وقد بدأ تأثير الأداة يظهر بالفعل على لوحات مراقبة قطاع التكنولوجيا. تضع البيانات الواردة من شركة Artificial Analysis الاستشارية عملية الإطلاق على رأس التصنيف العالمي لتحرير الفيديو باستخدام الذكاء الاصطناعي. ومع ذلك، لا تزال المنصة تواجه مقاومة في فئات محددة: في تحويل النص إلى فيديو خالص، يخسر النظام أمام Gemini Omni Flash من Google، بينما في تحويل الصور إلى مقاطع، ينتهي الأمر بالتفوق عليه من قبل كل من نموذج Google والمنافس Seedance 2.0.
ملخص الإمكانيات ومستقبل المنصة المرئية
- يشهد النظام البيئي السمعي البصري تحولًا عميقًا مع وصول أدوات قادرة على توحيد الوسائط المختلفة.
- تقوم المنصة بدمج الصوت والنص والصورة في محرك واحد، مما يوفر ملفات تصل مدتها إلى خمسة عشر ثانية بصوت استريو وجودة 2K.
- يظل الوصول مقيدًا بواجهة البرمجة والتطبيق الرسمي، على الرغم من أن إصدار التعليمات البرمجية مفتوحة المصدر سيكون على رادار الشركة خلال الأيام القليلة المقبلة.
- وتعتمد الجدوى المالية للمشروع على نظام الضغط الجديد H3-VAE، الذي يجعل معالجة الصور بدقة عالية جدًا أرخص.
- تتمتع العلامات التجارية للشركات بالأمان من خلال تقنية التجديد الداخلي، والتي تمنع الشعارات والنصوص الصغيرة من التشوه في الرسوم المتحركة.
- يأخذ النموذج التاج في فئة التحرير، لكنه لا يزال بحاجة إلى التطور للتغلب على خوارزميات Google في إنشاء المشاهد من الصفر.














