الإعلان عن مجموعة جديدة ومفتوحة من الأدوات لتفسير نماذج اللغة

نماذج اللغة الكبيرة (LLMs) قادرة على تحقيق إنجازات مذهلة في التفكير، ومع ذلك تظل عمليات صنع القرار الداخلية الخاصة بها مبهمة إلى حد كبير. إذا لم يتصرف النظام كما هو متوقع، فإن الافتقار إلى الرؤية لأعماله الداخلية يمكن أن يجعل من الصعب تحديد السبب الدقيق لسلوكه. في العام الماضي، قمنا بتطوير علم التفسير باستخدام Gemma Scope، وهي مجموعة أدوات مصممة لمساعدة الباحثين على فهم الأعمال الداخلية لـ Gemma 2، مجموعتنا خفيفة الوزن من النماذج المفتوحة.

اليوم، نصدر Gemma Scope 2: مجموعة شاملة ومفتوحة من أدوات الترجمة الفورية لجميع أحجام نماذج Gemma 3، من 270 مليونًا إلى 27 مليار معلمة. يمكن لهذه الأدوات أن تمكننا من تتبع المخاطر المحتملة عبر “عقل” النموذج بأكمله.

على حد علمنا، يعد هذا أكبر إصدار مفتوح المصدر لأدوات الترجمة الفورية من قبل مختبر الذكاء الاصطناعي حتى الآن. يتضمن إنتاج Gemma Scope 2 تخزين ما يقرب من 110 بيتابايت من البيانات، بالإضافة إلى تدريب أكثر من 1 تريليون معلمة إجمالية.

مع استمرار الذكاء الاصطناعي في التقدم، نتطلع إلى مجتمع أبحاث الذكاء الاصطناعي الذي يستخدم Gemma Scope 2 لتصحيح أخطاء السلوكيات النموذجية الناشئة، واستخدام هذه الأدوات لتدقيق وتصحيح أخطاء عملاء الذكاء الاصطناعي بشكل أفضل، وفي النهاية، تسريع تطوير تدخلات السلامة العملية والقوية ضد مشكلات مثل عمليات كسر الحماية والهلوسة والتملق.

العرض التوضيحي التفاعلي لـ Gemma Scope 2 متاح للتجربة، مجانًا من Neuronpedia.

ما الجديد في جيما سكوب 2

تهدف أبحاث القابلية للتفسير إلى فهم الأعمال الداخلية والخوارزميات المكتسبة لنماذج الذكاء الاصطناعي. نظرًا لأن الذكاء الاصطناعي أصبح أكثر قدرة وتعقيدًا على نحو متزايد، فإن إمكانية التفسير أمر بالغ الأهمية لبناء ذكاء اصطناعي آمن وموثوق.

مثل سابقتها، يعمل Gemma Scope 2 كمجهر لعائلة Gemma من نماذج اللغة. من خلال الجمع بين أجهزة التشفير التلقائي المتفرقة (SAEs) وأجهزة تحويل الشفرة، فإنه يسمح للباحثين بالنظر داخل النماذج، ورؤية ما يفكرون فيه، وكيف تتشكل هذه الأفكار واتصالها بسلوك النموذج. وهذا بدوره يتيح إجراء دراسة أكثر ثراءً لكسر الحماية أو سلوكيات الذكاء الاصطناعي الأخرى ذات الصلة بالسلامة، مثل التناقضات بين المنطق الذي ينقله النموذج وحالته الداخلية.

في حين أن Gemma Scope الأصلي مكن البحث في المجالات الرئيسية للسلامة، مثل هلوسة النماذج، وتحديد الأسرار التي يعرفها النموذج، وتدريب النماذج الأكثر أمانًا، فإن Gemma Scope 2 يدعم الأبحاث الأكثر طموحًا من خلال ترقيات مهمة:

  • تغطية كاملة على نطاق واسع: نحن نقدم مجموعة كاملة من الأدوات لعائلة Gemma 3 بأكملها (ما يصل إلى 27B معلمة)، وهي ضرورية لدراسة السلوكيات الناشئة التي تظهر فقط على نطاق واسع، مثل تلك التي تم اكتشافها سابقًا بواسطة نموذج مقياس C2S بحجم 27b الذي ساعد في اكتشاف مسار جديد محتمل لعلاج السرطان. على الرغم من أن Gemma Scope 2 لم يتم تدريبه على هذا النموذج، إلا أن هذا مثال على نوع السلوك الناشئ الذي قد تكون هذه الأدوات قادرة على فهمه.
  • أدوات أكثر دقة لفك رموز السلوكيات الداخلية المعقدة: يشتمل Gemma Scope 2 على SAEs وأجهزة تحويل الشفرة المدربة على كل طبقة من مجموعة نماذج Gemma 3 الخاصة بنا. تسهل أجهزة تحويل التشفير وأجهزة تحويل التشفير عبر الطبقات فك رموز الحسابات والخوارزميات متعددة الخطوات المنتشرة في جميع أنحاء النموذج.
  • تقنيات التدريب المتقدمة: نحن نستخدم أحدث التقنيات، ولا سيما تقنية تدريب ماتريوشكا، التي تساعد SAEs على اكتشاف المزيد من المفاهيم المفيدة وحل بعض العيوب المكتشفة في Gemma Scope.
  • أدوات تحليل سلوك Chatbot: نوفر أيضًا أدوات الترجمة الفورية التي تستهدف إصدارات Gemma 3 المضبوطة لحالات استخدام الدردشة. تتيح هذه الأدوات تحليل السلوكيات المعقدة والمتعددة الخطوات، مثل عمليات كسر الحماية وآليات الرفض والإخلاص في سلسلة الأفكار.
شاركها.
اترك تعليقاً