أصبحت نماذج اللغات الكبيرة (LLMs) بشكل متزايد مصدرًا أساسيًا لتوصيل المعلومات عبر حالات الاستخدام المتنوعة، لذلك من المهم أن تكون استجاباتها دقيقة بشكل واقعي.

ومن أجل مواصلة تحسين أدائها في هذا التحدي الذي يواجه الصناعة بأكملها، يتعين علينا أن نفهم بشكل أفضل أنواع حالات الاستخدام حيث تكافح النماذج لتوفير استجابة دقيقة وقياس أداء الواقع بشكل أفضل في تلك المجالات.

مجموعة الحقائق المرجعية

واليوم، نتعاون مع Kaggle لتقديم مجموعة FACTS Benchmark. إنه يوسع عملنا السابق في تطوير معيار FACTS Grounding، مع ثلاثة معايير واقعية إضافية، بما في ذلك:

  • أ المعيار البارامترى يقيس قدرة النموذج على الوصول إلى معرفته الداخلية بدقة في حالات استخدام الأسئلة الواقعية.
  • أ بحث مرجعي الذي يختبر قدرة النموذج على استخدام البحث كأداة لاسترداد المعلومات وتجميعها بشكل صحيح.
  • أ المعيار المتعدد الوسائط يختبر قدرة النموذج على الإجابة على المطالبات المتعلقة بالصور المدخلة بطريقة صحيحة.

نقوم أيضًا بتحديث معيار التأريض FACTS الأصلي باستخدام معيار التأريض – الإصدار 2، وهو معيار موسع لاختبار قدرة النموذج على تقديم إجابات ترتكز على سياق موجه معين.

وقد تم تنسيق كل معيار بعناية لإنتاج إجمالي 3513 نموذجًا، والتي نجعلها متاحة للجمهور اليوم. على غرار إصدارنا السابق، فإننا نتبع ممارسات الصناعة القياسية ونحتفظ بمجموعة التقييم كمجموعة خاصة. يتم حساب نقاط FACTS Benchmark Suite (أو FACTS Score) كمتوسط ​​دقة لكل من المجموعات العامة والخاصة عبر المعايير الأربعة. سوف يشرف Kaggle على إدارة مجموعة FACTS Benchmark. يتضمن ذلك امتلاك المجموعات الخاصة، واختبار LLMs الرائدة وفقًا للمعايير، واستضافة النتائج على لوحة المتصدرين العامة. يمكن العثور على مزيد من التفاصيل حول منهجية تقييم FACTS في تقريرنا الفني.

نظرة عامة على المعايير

المعيار البارامترى

يقوم معيار FACTS Parametric بتقييم قدرة النماذج على الإجابة بدقة على الأسئلة الواقعية، دون مساعدة أدوات خارجية مثل البحث على الويب. جميع الأسئلة الموجودة في المعيار هي أسئلة “نمطية تافهة” مدفوعة باهتمام المستخدم والتي يمكن الإجابة عليها عبر ويكيبيديا (مصدر قياسي للتدريب المسبق في LLM). يتكون المعيار الناتج من مجموعة عامة مكونة من 1052 عنصرًا ومجموعة خاصة مكونة من 1052 عنصرًا.

شاركها.
اترك تعليقاً