في المشهد سريع التطور لنماذج اللغات الكبيرة (LLMs)، ركزت الأضواء بشكل كبير على بنية وحدة فك التشفير فقط. في حين أظهرت هذه النماذج قدرات مثيرة للإعجاب عبر مجموعة واسعة من مهام التوليد، فإن بنية التشفير وفك التشفير الكلاسيكية، مثل T5 (محول نقل النص إلى النص)، تظل خيارًا شائعًا للعديد من تطبيقات العالم الحقيقي. غالبًا ما تتفوق نماذج التشفير وفك التشفير في التلخيص والترجمة وضمان الجودة والمزيد نظرًا لكفاءتها العالية في الاستدلال ومرونة التصميم وتمثيل التشفير الأكثر ثراءً لفهم المدخلات. ومع ذلك، فإن بنية التشفير وفك التشفير القوية لم تحظ إلا بقدر قليل من الاهتمام النسبي.
اليوم، نعيد النظر في هذه البنية ونقدم T5Gemma، وهي مجموعة جديدة من LLMs الخاصة بوحدة فك التشفير والتشفير والتي تم تطويرها عن طريق تحويل نماذج وحدة فك التشفير فقط المدربة مسبقًا إلى بنية وحدة فك التشفير والتشفير من خلال تقنية تسمى التكيف. يعتمد T5Gemma على إطار عمل Gemma 2، بما في ذلك نماذج Gemma 2 2B و9B المعدلة بالإضافة إلى مجموعة من النماذج ذات الحجم T5 المدربة حديثًا (Small وBase وLarge وXL). نحن متحمسون لإصدار نماذج T5Gemma المدربة مسبقًا والمضبوطة للتعليمات للمجتمع لفتح فرص جديدة للبحث والتطوير.
من وحدة فك التشفير فقط إلى وحدة فك التشفير
في T5Gemma، نطرح السؤال التالي: هل يمكننا بناء نماذج التشفير وفك التشفير من الدرجة الأولى استنادًا إلى نماذج فك التشفير المدربة مسبقًا فقط؟ نجيب على هذا السؤال من خلال استكشاف تقنية تسمى التكيف النموذجي. تتمثل الفكرة الأساسية في تهيئة معلمات نموذج التشفير وفك التشفير باستخدام أوزان نموذج فك التشفير فقط الذي تم تدريبه مسبقًا، ثم تعديلها بشكل أكبر من خلال التدريب المسبق المستند إلى UL2 أو PrefixLM.
نظرة عامة على النهج الذي نتبعه، توضح كيف نقوم بتهيئة نموذج جديد لوحدة فك التشفير والتشفير باستخدام المعلمات من نموذج مُدرب مسبقًا ومخصص لوحدة فك التشفير فقط.
تتميز طريقة التكيف هذه بالمرونة العالية، مما يسمح بمجموعات إبداعية من أحجام النماذج. على سبيل المثال، يمكننا إقران جهاز تشفير كبير مع جهاز فك تشفير صغير (على سبيل المثال، جهاز تشفير 9B مع جهاز فك ترميز 2B) لإنشاء نموذج “غير متوازن”. وهذا يسمح لنا بضبط المفاضلة بين الجودة والكفاءة لمهام محددة، مثل التلخيص، حيث يكون الفهم العميق للمدخلات أكثر أهمية من تعقيد المخرجات الناتجة.
نحو مقايضة أفضل للجودة والكفاءة
كيف يعمل T5Gemma؟
في تجاربنا، تحقق نماذج T5Gemma أداءً مشابهًا أو أفضل من نظيراتها من Gemma التي تستخدم وحدة فك التشفير فقط، وتهيمن تقريبًا على حدود باريتو لكفاءة استدلال الجودة عبر العديد من المعايير، مثل SuperGLUE الذي يقيس جودة التمثيل المتعلم.

تقدم نماذج التشفير وفك التشفير باستمرار أداء أفضل لمستوى معين من الحوسبة الاستدلالية، مما يؤدي إلى حدود كفاءة الجودة عبر مجموعة من المعايير.
ميزة الأداء هذه ليست نظرية فقط؛ إنه يترجم إلى الجودة والسرعة في العالم الحقيقي أيضًا. عند قياس زمن الوصول الفعلي لـ GSM8K (الاستدلال الرياضي)، حقق T5Gemma فوزًا واضحًا. على سبيل المثال، يحقق T5Gemma 9B-9B دقة أعلى من Gemma 2 9B ولكن مع زمن استجابة مماثل. والأكثر إثارة للإعجاب، أن T5Gemma 9B-2B يوفر تعزيزًا كبيرًا في الدقة مقارنة بالنموذج 2B-2B، ومع ذلك فإن زمن الاستجابة الخاص به مطابق تقريبًا لنموذج Gemma 2 2B الأصغر بكثير. في النهاية، توضح هذه التجارب أن التكيف بين التشفير وفك التشفير يوفر طريقة مرنة وقوية لتحقيق التوازن بين الجودة وسرعة الاستدلال.
إطلاق العنان للقدرات الأساسية والمضبوطة بدقة
هل يمكن أن تتمتع برامج LLM الخاصة بوحدة فك التشفير والتشفير بقدرات مماثلة لنماذج وحدة فك التشفير فقط؟
نعم، يُظهر T5Gemma إمكانات واعدة قبل ضبط التعليمات وبعده.
بعد التدريب المسبق، يحقق T5Gemma مكاسب مذهلة في المهام المعقدة التي تتطلب التفكير. على سبيل المثال، يسجل T5Gemma 9B-9B ما يزيد عن 9 نقاط أعلى في GSM8K (الاستدلال الرياضي) و4 نقاط أعلى في DROP (فهم القراءة) مقارنة بنموذج Gemma 2 9B الأصلي. يوضح هذا النمط أن بنية التشفير وفك التشفير، عند تهيئتها عن طريق التكيف، لديها القدرة على إنشاء نموذج أساسي أكثر قدرة وأداء.

نتائج تفصيلية للنماذج المدربة مسبقًا، توضح كيف حققت النماذج المُكيَّفة مكاسب كبيرة في العديد من المعايير كثيفة الاستدلال مقارنةً بـ Gemma 2 المخصصة لوحدة فك التشفير فقط.
هذه التحسينات الأساسية من التدريب المسبق مهدت الطريق لتحقيق مكاسب أكثر دراماتيكية بعد ضبط التعليمات. على سبيل المثال، عند مقارنة Gemma 2 IT مع T5Gemma IT، تتسع فجوة الأداء بشكل كبير في جميع المجالات. ترى T5Gemma 2B-2B IT أن نقاط MMLU الخاصة بها تقفز بما يقرب من 12 نقطة مقارنة بـ Gemma 2 2B، وترتفع نقاط GSM8K من 58.0% إلى 70.7%. لا توفر البنية المعدلة نقطة بداية أفضل فحسب، بل تستجيب أيضًا بشكل أكثر فعالية لضبط التعليمات، مما يؤدي في النهاية إلى نموذج نهائي أكثر قدرة وإفادة بشكل كبير.

نتائج تفصيلية لنماذج RLHFed المضبوطة بدقة، توضح قدرات ما بعد التدريب لتضخيم مزايا أداء بنية التشفير وفك التشفير بشكل كبير.
استكشف نماذجنا: إطلاق نقاط تفتيش T5Gemma
نحن متحمسون للغاية لتقديم هذه الطريقة الجديدة لبناء نماذج قوية لوحدة فك التشفير والتشفير للأغراض العامة من خلال التكيف من LLMs المدربة مسبقًا لوحدة فك التشفير فقط مثل Gemma 2. للمساعدة في تسريع إجراء المزيد من الأبحاث والسماح للمجتمع بالبناء على هذا العمل، نحن متحمسون لإصدار مجموعة من نقاط تفتيش T5Gemma الخاصة بنا.
يتضمن الإصدار:
- مقاسات متعددة: نقاط التفتيش للنماذج ذات الحجم T5 (الصغيرة، والقاعدة، والكبيرة، وXL)، والنماذج المستندة إلى Gemma 2 (2B و9B)، بالإضافة إلى نموذج إضافي بين T5 Large وT5 XL.
- متغيرات متعددة: النماذج المدربة مسبقًا والمضبوطة حسب التعليمات.
- تكوينات مرنة: نقطة تفتيش 9B-2B قوية وفعالة وغير متوازنة لاستكشاف المفاضلات بين حجم التشفير ووحدة فك التشفير.
- أهداف التدريب المختلفة: النماذج التي تم تدريبها باستخدام أهداف PrefixLM أو UL2 لتوفير أداء إنتاجي متطور أو جودة تمثيل.
نأمل أن توفر نقاط التفتيش هذه مورداً قيماً لدراسة بنية النموذج وكفاءته وأدائه.
الشروع في العمل مع T5Gemma
لا يمكننا الانتظار لرؤية ما ستنشئه باستخدام T5Gemma. يرجى الاطلاع على الروابط التالية لمزيد من المعلومات:
- تعرف على البحث وراء هذا المشروع من خلال قراءة الورقة.
- استكشف إمكانيات النماذج أو قم بضبطها لتناسب حالات الاستخدام الخاصة بك باستخدام دفتر ملاحظات Colab.
