جدول المحتويات
تشير بيانات OpenRouter إلى أن أحمال الذكاء الاصطناعي الوكيلة تستهلك 15 ضعفًا من الرموز مقارنةً بطلبات الدردشة البسيطة. يعود ذلك إلى تعقيد العمليات التي تقوم بها هذه الوكالات. على سبيل المثال، عندما يقوم وكيل ذكاء اصطناعي بالبحث عن معلومات حول شركة ما لاتخاذ قرار استثماري، يقوم باستعلام قواعد البيانات المالية، والبحث في الأخبار والتقارير، واستدعاء وكيل فرعي لإجراء مقارنات مع نظرائه ونمذجة التقييمات، ثم يقوم بتجميع كل ذلك في توصية. تستمر الوكالات والوكالات الفرعية في التفكير حتى إتمام المهمة، مما يزيد من الطلب على الرموز. مع كل خطوة، تصبح الرموز المتراكمة مدخلات للخطوة التالية، مما يجعل التعامل مع السياقات الطويلة أمرًا مركزيًا لأداء الذكاء الاصطناعي الوكيل.
يتكرر هذا النمط عبر جميع حالات الاستخدام الوكيلة، بدءًا من تطوير البرمجيات وصولاً إلى خدمة العملاء والبحث العميق. مع دخول الذكاء الاصطناعي الوكيل إلى الإنتاج عبر الصناعات، يجب أن تلبي البنية التحتية التي تدعمه هذا الطلب على الرموز بكفاءة.
تظهر البيانات الجديدة أن أنظمة NVIDIA Vera Rubin NVL72 تقدم أداءً أعلى بمعدل يصل إلى 30 مرة لكل ميغاوات مقارنةً بـ NVIDIA GB300 NVL72 في أحمال العمل الوكيلة. تم قياس هذه البيانات باستخدام عبء العمل SemiAnalysis AgentX، الذي يتكون من جلسات ترميز وكيلة مسجلة في العالم الحقيقي، مع الحفاظ على نمو السياق الحقيقي واستدعاءات الأدوات واستنساخ الوكلاء الفرعيين. بالنسبة لمصانع الذكاء الاصطناعي التي تعاني من قيود الطاقة، يعني ذلك مباشرةً 30 مرة من العمل الوكيل لنفس بصمة الطاقة.
Vera Rubin NVL72: 30x Higher Throughput per Megawatt and 35x Lower Token Cost
تبدو أحمال العمل الوكيلة مختلفة تمامًا عن الدردشة أو تلخيص الوثائق، حيث تتراوح تسلسلات المدخلات والمخرجات عادةً من 1K إلى 8K رمز. في الجلسات الوكيلة، يتراكم السياق عبر الخطوات ويمكن أن يصل إلى مئات الآلاف من الرموز المدخلة، مع تباين واسع في أطوال المدخلات والمخرجات عبر الطلبات. يجب أن تتطور قياسات الأداء لالتقاط سير العمل الكامل للوكيل بدلاً من طلب استدلال واحد.
تعكس النتائج أدناه الأداء المقاس على مسارات الترميز الوكيلة في العالم الحقيقي. في SemiAnalysis AgentX، تقدم منصة NVIDIA Blackwell أداءً رائدًا عبر نماذج وكيلة متعددة بما في ذلك Kimi K3 وMiniMax M3 وGLM5.3 وQwen3.5 وDeepSeek V4 Pro.
على سبيل المثال، تقدم GB300 NVL72 أداءً أفضل بمعدل يصل إلى 15 مرة لكل ميغاوات مقارنةً بهندسة NVIDIA Hopper على نموذج DeepSeek V4 Pro، مما يوفر للعملاء أساسًا عالي الأداء لتشغيل أحمال العمل الوكيلة. تعكس هذه القفزة ميزة نطاق GPU الأكبر الذي تم توسيعه والبرمجيات المصممة بشكل مشترك في تقديم كفاءة استدلال أفضل بكثير.
توسع Vera Rubin هذه الميزة، مما يرفع الأداء عبر منحنى Pareto، ليقدم ما يصل إلى 30 مرة من الإنتاجية لكل ميغاوات مقارنةً بـ GB300 NVL72 على نموذج DeepSeek V4 Pro. لا تعكس هذه النتائج المبكرة، التي تم قياسها باستخدام عبء العمل SemiAnalysis AgentX والتي لا تزال قيد مراجعة SemiAnalysis، بعد أداء وحدة المعالجة المركزية Vera لاستدعاء الأدوات.
تدير تقنيات NVIDIA DSX MaxLPS الطاقة عبر مستويات GPU والرف وأحمال العمل لتوفير ما يصل إلى 40% من وحدات معالجة الرسومات ضمن نفس ميزانية الميجاوات، مما يدفع الإنتاجية لكل ميغاوات إلى أبعد من ذلك على نطاق مصنع الذكاء الاصطناعي. تؤثر الإنتاجية لكل ميغاوات أيضًا بشكل مباشر على تكلفة كل رمز يتم إنتاجه. حيث يمكن لـ Vera Rubin NVL72 تشغيل الوكلاء بشكل مستمر، على نطاق واسع، عبر مجموعة كاملة من أحمال عمل العملاء بتكلفة أقل تصل إلى 35 مرة لكل مليون رمز مقارنةً بـ GB300 NVL72.
بالنسبة لمصانع الذكاء الاصطناعي التي تعاني من قيود الطاقة، تحدد الإنتاجية لكل ميغاوات إيرادات مصنع الذكاء الاصطناعي، وتحدد تكلفة كل مليون رمز هامش الربح على تلك الإيرادات.
Extreme Codesign for Agentic Scale
يمتد تحسين الاستدلال الحديث عبر مجموعة من التقنيات التي تعتبر حيوية بشكل خاص للذكاء الاصطناعي الوكيل. تمكّن NVIDIA Vera Rubin NVL72 من جميع هذه التقنيات وأكثر من خلال التصميم المتكامل عبر كل طبقة من المنصة لتحقيق مكاسب أداء متعددة.
- يفصل تقديم الخدمة المنفصل معالجة السياق (التحضير) عن توليد الاستجابة (الترميز) بحيث يمكن لكل منهما التوسع بشكل مستقل.
- يعمل التوافق في السرعة على مزامنة السرعات التي تنتج بها وحدات معالجة الرسومات الخاصة بالتحضير والترميز الرموز لتعظيم الكفاءة.
- توزيع الخبراء على نطاق واسع يوزع الشبكات الفرعية الخبيرة في نماذج مزيج الخبراء عبر نطاق GPU الموسع.
- توسيع ذاكرة KV الموزعة عبر نطاق GPU الموسع، بينما يقوم تخزين KV بتخزين السياق الأقل نشاطًا في المضيف والتخزين، مما يحافظ على السياق الذي تم معالجته مسبقًا متاحًا دون إعادة حساب.
- يوجه توجيه KV الوارد الطلبات إلى وحدات معالجة الرسومات التي تحتفظ بالفعل بالسياق المخزن ذي الصلة، مما يقلل من الحسابات الزائدة عبر الجلسات الطويلة.
- تجمع نوى CUDA المدمجة مثل MegaMoE العديد من عمليات الحساب والتواصل بين وحدات معالجة الرسومات في تمريرة تنفيذ واحدة، مما يحافظ على نشاط وحدات معالجة الرسومات بدلاً من انتظار البيانات.
تسرع وحدات معالجة الرسومات NVIDIA Rubin من الجيل الخامس Tensor Cores ومحرك Transformer من مراحل التحضير والترميز للاستدلال. تقلل تقنية NVFP4 من وزن النموذج إلى دقة 4 بت، مما يقلل من حجم الذاكرة ويزيد من الإنتاجية دون التضحية بجودة المخرجات.
يتيح نطاق NVL72، وهو بنية محددة عبر Vera Rubin وGrace Blackwell، الاتصال بين وحدات معالجة الرسومات بسرعة عالية وزمن انتقال منخفض، وهو أمر أساسي لتقنيات مثل توزيع الخبراء على نطاق واسع وتخزين KV الموزع. تم تصميم تقنية NVIDIA NVLink وNVLink Switches، التي تمثل الجيل السادس، لتوفير معدلات حزم أعلى بمعدل 10 مرات وزمن انتقال أقل بمعدل 3 مرات مقارنةً بالبدائل التقليدية.
تمتد مجموعة البرمجيات الخاصة بـ NVIDIA، التي تشمل نوى CUDA المحسّنة، وأوقات تشغيل الاستدلال مثل NVIDIA TensorRT LLM، وإطارات الخدمة مثل NVIDIA Dynamo، لتكون مصممة بشكل مشترك مع الأجهزة لتمكين تحسينات الاستدلال.
بينما تعكس النتائج أعلاه الأداء الحالي لـ Vera Rubin NVL72، فإن المنصة الكاملة تتكون من معمارية مكونة من سبعة شرائح تشمل أيضًا وحدة المعالجة المركزية NVIDIA Vera وGroq 3 LPU، ومفتاح NVLink 6، وBlueField-4 DPU، وSpectrum-6 SPX، وConnectX-9 SuperNIC، جميعها مصممة خصيصًا لمصانع الذكاء الاصطناعي التي تنشر الوكلاء على نطاق واسع.
يمتد التصميم المتكامل أيضًا إلى التعاون الهندسي مع الشركاء. تتواجد Vera Rubin في الإنتاج الكامل وتقوم بالتوسع عبر النظام البيئي.
تعرف على المزيد حول منصة NVIDIA Vera Rubin.
رأي بوابة الذكاء الاصطناعي
تظهر الابتكارات التي تقدمها NVIDIA Vera Rubin NVL72 مدى التقدم في كفاءة الذكاء الاصطناعي الوكيل. مع الأداء العالي وتقليل التكلفة، يبدو أن هذه المنصة تعد بمستقبل واعد في مجال الذكاء الاصطناعي. كيف ترى تأثير هذه التطورات على مستقبل التطبيقات الذكية في مختلف الصناعات؟
المصدر: الرابط الأصلي