لكي تكون الروبوتات مفيدة حقًا في حياتنا اليومية وصناعاتنا، يجب عليها أن تفعل أكثر من مجرد اتباع التعليمات، بل يجب أن تفكر في العالم المادي. فمن التنقل في منشأة معقدة إلى تفسير الإبرة على مقياس الضغط، فإن “الاستدلال المتجسد” للروبوت هو ما يسمح له بسد الفجوة بين الذكاء الرقمي والعمل الجسدي.
اليوم، نقدم لكم Gemini Robotics-ER 1.6، وهو ترقية مهمة لنموذج الاستدلال أولاً الذي يمكّن الروبوتات من فهم بيئاتها بدقة غير مسبوقة. ومن خلال تعزيز التفكير المكاني والفهم متعدد وجهات النظر، فإننا نقدم مستوى جديدًا من الاستقلالية للجيل القادم من الوكلاء الماديين.
يتخصص هذا النموذج في القدرات المنطقية المهمة للروبوتات، بما في ذلك الفهم البصري والمكاني وتخطيط المهام واكتشاف النجاح. إنه بمثابة نموذج تفكير عالي المستوى للروبوت، قادر على تنفيذ المهام عن طريق استدعاء أدوات مثل بحث Google للعثور على المعلومات، أو نماذج الرؤية واللغة والعمل (VLAs) أو أي وظائف أخرى يحددها المستخدم من طرف ثالث.
يُظهر Gemini Robotics-ER 1.6 تحسنًا كبيرًا مقارنة بكل من Gemini Robotics-ER 1.5 وGemini 3.0 Flash، مما يعزز بشكل خاص قدرات التفكير المكاني والمادي مثل الإشارة والعد واكتشاف النجاح. نحن أيضًا نطلق العنان لقدرة جديدة: قراءة الأجهزة، وتمكين الروبوتات من قراءة أجهزة القياس المعقدة ونظارات الرؤية – وهي حالة استخدام اكتشفناها من خلال التعاون الوثيق مع شريكنا، Boston Dynamics.
بدءًا من اليوم، يتوفر Gemini Robotics-ER 1.6 للمطورين عبر Gemini API وGoogle AI Studio. لمساعدتك على البدء، نشارك مطور Colab الذي يحتوي على أمثلة حول كيفية تكوين النموذج ومطالبته بمهام الاستدلال المضمنة.