agent-governance-toolkit
مجموعة أدوات حوكمة وكيل الذكاء الاصطناعي - تطبيق السياسات، هويات غير موثوقة، صندوق رملي، وهندسة موثوقية لوكلاء الذكاء الاصطناعي المستقلين.

ما هو agent-governance-toolkit؟
معاينة عامة — إصدارات المعاينة العامة بجودة الإنتاج. قد تحتوي على تغييرات مدمرة قبل GA.
تطبيق السياسات، الهوية، صندوق الرمل، وهندسة موثوقية لوكلاء الذكاء الاصطناعي المستقلين. تثبيت واحد باستخدام `pip`، لأي إطار عمل.
يتصل وكلاء الذكاء الاصطناعي بالأدوات ويستعرضون الشبكة ويستفسرون من قواعد البيانات ويفوضون لوكلاء آخرين. بمجرد نشرهم، يتخذون قرارات بشكل مستقل. تحتاج إلى إجابات لثلاثة أسئلة:
1. هل هذا الإجراء مسموح؟ وكيل لديه إمكانية الوصول إلى `send_email` و`query_database` يجب ألا يكون قادرًا على `drop_table`. تتحكم نطاقات OAuth وأدوار IAM في الخدمات التي يمكن لوكيل الوصول إليها، وليس ما يفعله بمجرد الاتصال.
2. أي وكيل قام بذلك؟ في نظام متعدد الوكلاء، قد يشارك خمسة وكلاء مفتاح API واحد. عندما يحدث خطأ ما، فإن “وكيل قام بذلك” ليس استجابة لنشاط مريب.
3. هل يمكنك إثبات ما حدث؟ يحتاج المدققون والمراقبون إلى سجلات غير قابلة للتلاعب لكل قرار: ما هي السياسة النشطة، وماذا طلب الوكيل، ولماذا تم السماح به أو منعه.
أمان على مستوى المطالبة (“يرجى اتباع القواعد”) ليس سطح تحكم. إنها طلب مهذب لنظام عشوائي. تُوضح OWASP LLM01:2025 هذا بوضوح: “ليس من الواضح ما إذا كانت هناك طرق مضمونة لمنع حقن المطالبات.” تدعم الأرقام المنشورة ذلك. reports Andriushchenko وآخرون (ICLR 2025) معدل النجاح 100% في الهجمات على GPT-4o وGPT-3.5 وClaude 3 وLlama-3 باستخدام هجمات متكيفة مع وصول logprob وتحسين اللاحقة، تم تقييمها ضد معيار JailbreakBench (Chao et al.، NeurIPS 2024). يقوم وكيل Microsoft الخاص بـ Red Teaming AI بتأسيس معدل نجاح الهجمات (ASR)، معدل انتهاكات السياسة تحت مدخلات عدائية، كمقياس قياسي لهذه الفئة من الفشل. تعزز الدروس المستفادة من اختبار 100 منتج ذكاء اصطناعي الجيل النقطة: “لا تقضي التدابير على المخاطر تمامًا” ويجب أن تكون فرق Red Teaming عملية مستمرة لأن دفاعات طبقة النموذج احتمالية من حيث البناء.