verl-agent
verl-agent هو امتداد لـ veRL، مصمم لتدريب وكلاء LLM/VLM عبر التعلم المعزز.

ما هو verl-agent؟
تحسين سياسة المجموعة ضمن مجموعة لتدريب وكلاء نماذج اللغة الكبيرة
`verl-agent` هو امتداد لـ veRL، مصمم خصيصًا لتدريب وكلاء نماذج اللغة الكبيرة (LLM) عبر التعلم المعزز (RL).
على عكس الأساليب السابقة التي كانت تكتفي ببساطة بدمج سجلات التفاعلات الكاملة، يقترح `verl-agent` آلية التوسع متعددة الأدوار غير المرتبطة بالخطوات، مما يتيح هياكل إدخال قابلة للتخصيص بالكامل لكل خطوة، وإدارة التاريخ، ووحدات الذاكرة. يجعل هذا التصميم `verl-agent` قابلاً للتوسع بشكل كبير لتدريب RL على مدى طويل جدًا، والذي يتطلب مهام متعددة الأدوار (على سبيل المثال، قد تتطلب المهام في ALFWorld ما يصل إلى 50 خطوة لإكمالها).
يوفر `verl-agent` مجموعة متنوعة من خوارزميات RL (بما في ذلك خوارزمية GiGPO الجديدة) ومجموعة غنية من بيئات الوكلاء، مما يمكّن من تطوير وكلاء التفكير في المهام المرئية والنصية.
– [2026.05] تم قبول `GraphGPO` في ICML 2026! 🎉🎉🎉 [ورقة] [شفرة]
– [2026.02] تم قبول `HGPO` في ICLR 2026! 🎉🎉🎉 [ورقة] [شفرة]
– [2026.02] 🔥 نحن نفتح مصدر Dr. MAS، الذي يدعم الاستقرار في التعلم المعزز من النهاية إلى النهاية بعد تدريب أنظمة LLM متعددة الوكلاء! [ورقة] [شفرة]
– [2025.12] `Qwen3-VL` مدعوم الآن! راجع المثال هنا.
– [2025.09] `GiGPO` مدعوم الآن من قبل ROLL! [وثيقة] [منحنيات التدريب].
– [2025.09] تدعم OpenManus-RL الآن سير عمل تدريب على نمط `verl-agent`!
– [2025.09] تم قبول GiGPO في NeurIPS 2025! 🎉🎉🎉
– [2025.08] إضافة تجارب Search-R1 وGiGPO القائم على التشابه! تحقق من أداء GiGPO الفائق في تجارب Search-R1 هنا.
– [2025.07] نقاط GiGPO و`verl-agent` في اجتماع الوكلاء لتطوير البرمجيات بواسطة LF AI & Data Singapore في 7/11.
– [2025.07] إضافة مدير ذاكرة مرن. انظر هنا.
– [2025.06] تحديث رئيسي: دمج جميع الميزات من أحدث veRL. على سبيل المثال، يدعم `verl-agent` الآن Qwen3 وLoRA وREINFORCE++، والمزيد. لا تتردد في الاستكشاف!
– [2025.05] تم إصدار الشفرة والورقة حول `GiGPO`.
| فئة الميزات | القدرات المدعومة| | – | – | | التفاعل | ✅ تفاعل متعدد الأدوار بين الوكيل والبيئة✅ تفاعل خطوة بخطوة✅ قابل إلى حد كبير