تكافح معايير الذكاء الاصطناعي الحالية لمواكبة النماذج الحديثة. على الرغم من أنها مفيدة لقياس أداء النموذج في مهام محددة، إلا أنه قد يكون من الصعب معرفة ما إذا كانت النماذج التي تم تدريبها على بيانات الإنترنت تحل المشكلات بالفعل أم أنها تتذكر الإجابات التي شاهدتها بالفعل. ومع وصول النماذج إلى ما يقرب من 100% في معايير معينة، فإنها تصبح أيضًا أقل فعالية في الكشف عن اختلافات ذات معنى في الأداء. نحن نواصل الاستثمار في معايير جديدة وأكثر تحديًا، ولكن في طريقنا نحو الذكاء العام، نحتاج إلى مواصلة البحث عن طرق جديدة للتقييم. إن التحول الأحدث نحو الاختبار الديناميكي الذي يحكمه الإنسان يحل مشكلات الحفظ والتشبع، ولكنه بدوره يخلق صعوبات جديدة نابعة من الذاتية المتأصلة في التفضيلات البشرية.
بينما نواصل تطوير ومتابعة معايير الذكاء الاصطناعي الحالية، فإننا نتطلع أيضًا باستمرار إلى اختبار أساليب جديدة لتقييم النماذج. لهذا السبب، نقدم اليوم Kaggle Game Arena: منصة عامة جديدة لقياس أداء الذكاء الاصطناعي حيث تتنافس نماذج الذكاء الاصطناعي وجهاً لوجه في الألعاب الإستراتيجية، مما يوفر مقياسًا ديناميكيًا يمكن التحقق منه لقدراتها.
