جدول المحتويات
تظهر المؤشرات العامة في مجال الذكاء الاصطناعي الصوتي أن نماذج التعرف على الصوت تحقق مستويات أداء قريبة من البشر. ومع ذلك، لا تعكس هذه الدرجات دائمًا كيفية عمل النماذج في العالم الحقيقي. نظرًا لأن المعايير العامة مفتوحة ومستخدمة على نطاق واسع، يمكن أن تتكيف النماذج مع اختبارات هذه المعايير. قد تتحسن درجاتها لأنها تعلمت أنماطًا محددة تتعلق بالمعايير، وليس لأنها أصبحت أفضل في المهمة الأساسية.
تتجاهل المعايير التقليدية العديد من الظروف والخصائص التي تجعل أنظمة الصوت موثوقة وطبيعية وملائمة للسياق وفعالة في الممارسة العملية. لذلك، قدمنا مؤخرًا مجموعات محجوزة في مشاريع مثل Real World VoiceEQ وOpen-ASR Leaderboard وFar-field ASR Leaderboard، لقياس المزيد مما هو مهم في الاستخدام الواقعي.
ومع ذلك، لا يكفي القياس الأوسع لحل المشكلة. يُعرف هذا الظاهرة، التي تُسمى أحيانًا تحسين المعايير أو “benchmaxxing”، بأنها صعبة القياس في مجال التعرف على الصوت.
تقدم أبحاثنا الأخيرة ثلاثة اختبارات للمساعدة في قياس هذه الظاهرة. قمنا بتقييم 11 نموذجًا مفتوح المصدر مستخدمًا على نطاق واسع في التعرف على الصوت ووجدنا أن العديد من الأنظمة ذات الدرجات العالية أعادت إنتاج نصوص المعايير من مجموعات بيانات VoxPopuli وLibriSpeech (النظيفة، الأخرى) – حتى عندما كانت التسجيلات الصوتية تتعارض معها، أو كانت الكلمات ذات الصلة قد تم إسكاتها، أو كانت التسجيلات تدعم شكلين مكتوبين مختلفين.
في بعض الحالات، بدا أن النماذج تعتمد ليس فقط على ما قيل، ولكن أيضًا على إشارات صوتية دقيقة تشير إلى أي معيار يتم اختباره. نتيجة لذلك، كانت درجاتها مبالغ فيها في مدى قدرتها على نسخ الكلام بشكل عام.
دراسة حالة: عدم تطابق المرجع (VoxPopuli)
تُعرف VoxPopuli بوجود عدد كبير من أخطاء النسخ (لهذا السبب أصدرت Artificial Analysis نسخة منقحة). اختبرت أداة عدم تطابق الإجماع لدينا ما يحدث عندما تواجه النماذج الرائدة في التعرف على الصوت هذه الأخطاء: هل تنسخ بدقة ما يقوله الصوت، أم تعيد إنتاج نص المرجع الخاطئ للمعيار؟
لتجربة ذلك على نطاق واسع، استخدمنا مجموعة من النماذج المستقلة المختارة لمعدل خطأ الصوت المنخفض (PER). يقيس PER مدى قرب النسخة المكتوبة من الأصوات في التسجيل الصوتي، مما يجعله مؤشرًا مفيدًا لمدى دقة النموذج في نسخ ما يسمعه. يمكن استخدام نتائج المجموعة للإشارة إلى الحالات التي تتفق فيها النماذج بالإجماع على عدم تطابق نص المرجع. نقارن بعد ذلك عينة من تلك الحالات المرفوعة مع التقييمات البشرية للتحقق من النصوص المصححة.
على سبيل المثال، يتضمن أحد مقاطع VoxPopuli بوضوح عبارة “شكرًا لك، السيد الرئيس”، لكن نص المرجع يتجاهل “شكرًا لك”. أعادت ستة من النماذج الـ 11 التي اختبرناها إنتاج نص المرجع الخاطئ للمعيار – مما أعطى الإجابة “المتوقعة” على الرغم من تعارضها مع الصوت. في المقطع الحقيقي، يتبع التنسيق نفس النمط: النماذج التي تتجاهل “شكرًا لك” تعيد أيضًا إنتاج نمط علامات الترقيم للمعيار، حيث تكتب “Mr” بدون نقطة، بينما تميل النماذج التي تتضمن العبارة المسموعة إلى كتابة “Mr.” مع النقطة.
عند تقديم نفس المحتوى في أصوات جديدة تم جمعها من تسجيلات البرلمان الأوروبي أو أصوات عامة، غالبًا ما تضعف هذه السلوكيات أو تختفي. في العينات أدناه، يعود جميع النماذج باستثناء واحد إلى نسخ النص المخلص للصوت في نسخة جديدة من تسجيل برلماني. يشير ذلك إلى أن النماذج تستجيب للإشارات الصوتية التي تساعدها على تحديد انتماء المعيار وبالتالي إنتاج النص المتوقع حتى لو تعارض مع الصوت.
استرجاع الكيانات المقنعة
لتعزيز أداة عدم تطابق الإجماع، قمنا عمدًا بإسكات الأرقام في عينات الصوت لمجموعات الاختبار وطلبنا من النماذج نسخ ما تسمعه. الرقم غائب حرفيًا عن الصوت، لذا يجب ألا تنتج النماذج أي رقم، ناهيك عن الرقم الدقيق في النص.
بعض هذه الأرقام يمكن التنبؤ بها جزئيًا (على الرغم من أنه لا يزال من غير المحتمل أن يتنبأ بها النموذج)، بينما تكون أخرى مفاجئة تمامًا. يُظهر المقطع التالي كلا الاختبارين، موضحًا كيف تعيد النماذج إنتاج أخطاء نص المرجع بما في ذلك رقم غير صحيح، ونموذج واحد حتى يكمل تلقائيًا سنة عشوائية نسبيًا (2011) على الرغم من أنها كانت مسكوتة.
التبديل الإملائي
اختبرنا أداة التبديل الإملائي لمعرفة ما إذا كانت النماذج تعيد إنتاج التهجئة الدقيقة المستخدمة في نص المرجع للمعيار على الرغم من عدم وضوحها في الصوت. تشير المتغيرات الإملائية إلى الكلمات التي تتشابه دلاليًا وصوتيًا ولكن يمكن تهجئتها بطرق مختلفة (1 مقابل one، Mr. مقابل mister، John مقابل Jon، Honor مقابل Honour، إلخ). نظريًا، يجب أن تفضل النماذج باستمرار تهجئة واحدة على الأخرى، أو تتناوب بينهما بمعدلات عشوائية تقريبًا.
رأي بوابة الذكاء الاصطناعي
تشير نتائجنا إلى أن بعض النماذج تكتشف إشارات صوتية مرتبطة بالبيانات وتعدل سلوك النسخ وفقًا لذلك. من المهم لمستخدمي النماذج استخدام مجموعات تقييم محجوزة بالكامل، كما تفعل RW-Voice-EQ Bench وOpen ASR Leaderboard، والنظر إلى ما هو أبعد من معدل خطأ الكلمات على معيار عام واحد. كيف يمكن أن تؤثر هذه النتائج على اختياراتك للنماذج المستخدمة في مشاريعك المستقبلية؟
المصدر: الرابط الأصلي