بتكلفة تشغيل أقل 100 مرة deepseek تكشف عن نموذجها v4-flash | الشرق للأخبار

بتكلفة تشغيل أقل 100 مرة.. DeepSeek تكشف عن نموذجها الجديد V4-Flash

time reading iconدقائق القراءة - 7
نموذج V4 Flash الجديد من شركة DeepSeek الصينية، صورة منشأة بالذكاء الاصطناعي - Asharq
نموذج V4 Flash الجديد من شركة DeepSeek الصينية، صورة منشأة بالذكاء الاصطناعي - Asharq
القاهرة-

أظهرت اختبارات أداء أجرتها شركة Artificial Analysis المتخصصة في تقييم نماذج الذكاء الاصطناعي، أن تكاليف تشغيل أحدث نماذج شركة DeepSeek الصينية تقل بأكثر من 100 مرة مقارنة بنموذج Claude Fable 5 التابع لشركة أنثروبيك، وهي التكلفة الأقل بين أبرز النماذج العالمية المتاحة حالياً.

وأطلقت DeepSeek، الجمعة، نموذجها الجديد V4-Flash، في أحدث مساعيها لاستعادة الزخم في سوق الذكاء الاصطناعي، عبر الاستراتيجية التي اشتهرت بها والمتمثلة في تقديم نماذج عالية الكفاءة بتكلفة تشغيل منخفضة للغاية.

وكانت الشركة لفتت أنظار قطاع التكنولوجيا عالمياً مطلع عام 2025 بعد إطلاق نموذج R1، الذي تسبب في موجة تراجع لأسهم شركات التكنولوجيا، وأثار نقاشاً واسعاً بشأن حجم الإنفاق الذي تخصصه الشركات الأميركية لتطوير تقنيات الذكاء الاصطناعي.

إمكانيات نموذج V4-Flash من DeepSeek

وفقاً لتقرير مؤسسة Artificial Analysis، تبلغ تكلفة استخدام نموذج V4-Flash نحو 0.14 دولار لكل مليون توكن من المدخلات، و0.28 دولار لكل مليون توكن من المخرجات.

ويُقصد بمصطلح "التوكن" وحدة البيانات المستخدمة لقياس حجم المعلومات التي يعالجها نموذج الذكاء الاصطناعي أو يولدها.

وقدرت الشركة الصينية متوسط تكلفة تشغيل نموذجها الجديد بنحو 3 سنتات فقط لكل اختبار، مقارنة مع 86 سنتاً لنموذج Kimi K3 من شركة Moonshot AI الصينية، و1.86 دولار لنموذج GPT-5.6 Sol من OpenAI، و3.15 دولار لنموذج Claude Fable 5 من أنثروبيك.

وأوضحت الشركة أن هذا النوع من المقارنات يعكس القيمة الفعلية للنماذج بصورة أدق من مقارنة الأسعار وحدها، لأنه يأخذ في الاعتبار حجم البيانات التي يحتاج النموذج إلى معالجتها وإنتاجها لإنجاز المهمة المطلوبة.

فحتى إذا كان سعر الاستخدام منخفضاً، فقد ترتفع التكلفة النهائية إذا احتاج النموذج إلى عدد أكبر من خطوات المعالجة للوصول إلى الإجابة.

ومن حيث الأداء، سجل نموذج V4-Flash نحو 50 نقطة من أصل 100 على مؤشر الذكاء الخاص بشركة Artificial Analysis، وهي النتيجة نفسها التي حققها نموذج Gemini 3.6 Flash من جوجل، وأقل بنقطة واحدة فقط من نموذجي Muse Spark 1.1 من Meta وGLM-5.2 من Z.ai.

في المقابل، سجل نموذج Kimi K3 من Moonshot AI نحو 57 نقطة، بينما حققت نماذج Claude Opus 5 وClaude Fable 5 من أنثروبيك، إضافة إلى GPT-5.6 من OpenAI، نتائج تفوقت على نموذج DeepSeek V4-Flash بفارق 9 نقاط أو أكثر، ما يشير إلى استمرار تفوقها في الأداء رغم ارتفاع تكاليف تشغيلها.

تكشف نماذج DeepSeek V4-Flash وClaude Fable 5 من أنثروبيك وGPT-5.6 Sol من OpenAI عن 3 مسارات مختلفة تتبعها شركات الذكاء الاصطناعي لزيادة قدرات نماذجها وخفض تكلفة تدريبها وتشغيلها، إذ لا تعتمد المنافسة فقط على حجم مراكز البيانات أو عدد الرقائق المستخدمة، وإنما تمتد إلى تصميم النموذج نفسه ودقة العمليات الحسابية وطريقة توزيع أعباء التدريب بين وحدات المعالجة.

وتبدو استراتيجية DeepSeek الأكثر وضوحاً من الناحية التقنية، نظراً لنشر الشركة تفاصيل أكبر عن نموذجها.

ويعتمد DeepSeek V4-Flash على بنية Mixture-of-Experts (خليط الخبراء)، بإجمالي 284 مليار معامل، لكن النموذج يُفعّل نحو 13 مليار معامل فقط عند معالجة كل جزء من البيانات، ما يسمح بتقليل كمية العمليات الحسابية المطلوبة مقارنة بتشغيل جميع معاملات النموذج في كل مرة.

ويستخدم النموذج التدريب بدقة مختلطة FP8، فيما تُستخدم دقة FP4 لبعض معاملات الخبراء في النسخة النهائية، إلى جانب مُحسّن Muon لتسريع التقارب وزيادة استقرار التدريب. 

ودرّبت DeepSeek نماذج V4 على أكثر من 32 تريليون رمز نصي، ثم استخدمت مزيجاً من الضبط الدقيق الخاضع للإشراف والتعلم المعزز وتقنيات التقطير لدمج قدرات خبراء متخصصين داخل نموذج واحد.

ويمثل ذلك امتداداً للنهج الذي اتبعته DeepSeek سابقاً مع V3، عندما صممت البرمجيات وبنية النموذج مع مراعاة خصائص العتاد المتاح، واستخدمت التدريب المختلط بدقة FP8 وتقنيات لتقليل زمن الاتصالات بين وحدات المعالجة أثناء تدريب نماذج "خليط الخبراء"، وفي V3، قالت الشركة إنها أكملت التدريب على 2048 من رقائق Nvidia H800، وهو ما أبرز أهمية "التصميم المشترك" بين النموذج والعتاد في تقليل التكلفة.

ولكن ديب سيك لم تنشر حتى الآن بالوضوح نفسه توزيع الرقائق الذي استُخدم في التدريب الكامل لـV4-Flash، ولذلك لا يمكن الجزم بأن نسخة التدريب التجاري للنموذج اعتمدت حصراً على رقائق Nvidia أو Huawei.

في المقابل، تتبع أنثروبيك استراتيجية أكثر تنوعاً على مستوى موردي الرقائق، إذ وسعت الشركة اعتمادها على رقائق TPU التي تطورها جوجل، ضمن اتفاق يوفر لها ما يصل إلى مليون شريحة وأكثر من جيجاوات من القدرة الحاسوبية خلال 2026 لتدريب الأجيال الجديدة من Claude.

وفي الوقت نفسه، تستخدم أنثروبيك بنية AWS ورقائق Trainium التي تطورها أمازون لتدريب وتشغيل نماذجها، ما يعني أن بنيتها الحاسوبية لا تعتمد على مورد واحد للمعالجات.

ومن المرجح أن النموذج يعتمد منظومة تدريب قائمة على عتاد من معالجات TPU وTrainium وبنى سحابية متعددة.

أما OpenAI فتتجه إلى بناء بنية حاسوبية أوسع نطاقاً تعتمد على أكثر من نوع من رقائق التسريع.

وتشمل شراكاتها الحالية أنظمة Nvidia، إلى جانب قدرات مستقبلية على رقائق Trainium التابعة لأمازون، إذ أعلنت مؤخراً خطة لنشر ما لا يقل عن 10 جيجاوات من أنظمة Nvidia، فيما يبدأ نشر أول جيجاوات على منصة Vera Rubin خلال النصف الثاني من 2026، بجانب تعاقدها على نحو 2 جيجاوات من قدرات Trainium التابعة لـAWS، فضلاً عن تعاون مطورة ChatGPT مع مايكروسوفت وشركات رقائق وشبكات أخرى لبناء حواسيب فائقة مخصصة لتدريب نماذج الذكاء الاصطناعي.

وتعتمد OpenAI في تدريب نماذجها على أعداد ضخمة من وحدات المعالجة المختلفة، مع تحسين شبكات الاتصال التي تنقل البيانات بين تلك الوحدات؛ إذ طورت بروتوكول MRC بالتعاون مع Nvidia وAMD وBroadcom وIntel ومايكروسوفت لزيادة سرعة وموثوقية الاتصالات بين وحدات المعالجة أثناء عمليات التدريب واسعة النطاق.

تصنيفات

قصص قد تهمك