يمكن لتطبيق أندرويد الذي يمكنه الرسم على النوافذ الأخرى والكتابة على وحدة التخزين المشتركة، تمرير التعليمات إلى وكيل الذكاء الاصطناعي الذي يقود هذا الهاتف، في نص لن تراه العين البشرية على الإطلاق. خطوتان أخريان، ويقوم نفس التطبيق بتشغيل الأوامر على جهاز الكمبيوتر الذي يقود الوكيل.

أظهر الباحثون هذه السلسلة، بالإضافة إلى ستة هجمات أخرى، ضد خمسة أطر عمل لوكلاء الهاتف المحمول مفتوحة المصدر: AppAgent، وAppAgentX، وMobile-Agent-v3، وOpen-AutoGLM، وMobA. سقط الجميع إلى ستة على الأقل من السبعة.

نُشرت الورقة على موقع arXiv في الأول من يوليو وتمت مراجعتها في 14 يوليو. ويعمل المؤلفون في جامعة سايمون فريزر، والجامعة الصينية في هونغ كونغ، وجامعة شاندونغ، ومختبر شينغتو في شركة الأمن الصينية QAX.

لا يوجد شيء هنا يحتوي على مكافحة التطرف العنيف، كما قال المؤلف الأول زيدونغ تشانغ أخبار الهاكر ليس لدى الفريق أي دليل على استخدام التقنيات خارج بيئة خاضعة للرقابة. قامت The Hacker News بفحص جميع الأطر الخمسة وعثرت على مسارات لقطة الشاشة، ونداء الصدفة، والبث الاحتياطي الذي تصفه الصحيفة بأنه لا يزال موجودًا على فروعها الرئيسية اعتبارًا من 17 يوليو.

وقال تشانغ إن الفريق أرسل بريدًا إلكترونيًا إلى المشرفين المتأثرين بشكل خاص قبل نشر النسخة الأولية و”لم يتلق ردًا حتى الآن”.

التصعيد هو الجزء الأقل غرابة. تعمل وحدة التحكم في AppAgent على تشغيل subprocess.run(adb_command, Shell=True) وتقوم بإنشاء إدخال النص عن طريق إسقاط مخرجات النموذج مباشرة في نص إدخال adb Shell {input_str}. توضح قائمة الورقة أن الوظيفة لا تحتوي على أي تعقيم على الإطلاق.

يعمل الكود المباشر بشكل أفضل بشكل هامشي وليس قريبًا بدرجة كافية: فهو يزيل المسافات وعلامات الاقتباس المفردة قبل الاستيفاء، ويترك بقية الأحرف الأولية للصدفة بمفردها. لا؛، ليس &، ليس>. لذلك يتم تقسيم السلسلة التي يقرأها النموذج من الشاشة ويكتبها بإخلاص بواسطة غلاف المضيف، ويتم تشغيل النصف الخلفي على صندوق Windows الخاص بالمشغل.

وقد فعلت الحمولة المصممة لإطلاق calc.exe ذلك بالضبط في 20 من 20 تجربة ضد AppAgent وAppAgentX وMobile-Agent-v3 وMobA. تم استخدام تشغيل منفصل شامل ضد AppAgent test;pwd>rce_success وكتب دليل عمل المضيف إلى ملف.

يعد الحصول على هذه السلسلة أمام النموذج بمثابة سباق للملفات. يقوم Open-AutoGLM بتشغيل screencap -p /sdcard/tmp.png ثم سحب adb منفصل. يكتب Mobile-Agent-v3 إلى ملف /sdcard/screenshot.png ثابت وينام لمدة نصف ثانية بين الاثنين. يكتب AppAgentX إلى /sdcard/ تحت أسماء ملفات ذات طابع زمني تحمل عدادًا متزايدًا للخطوات، وهو نمط يمكن للمهاجم مشاهدته. لا يزال ملف config.yaml الذي تم شحنه من AppAgent يقوم بتعيين دليل لقطة الشاشة الخاص به افتراضيًا على /sdcard.

حدد الباحثون توقيت هذه الفجوة عبر الأطر بـ 50 إلى 500 مللي ثانية، بمتوسط ​​حوالي 210 مللي ثانية على مدار 100 مرة. تحتوي خدمة الاستطلاع في الخلفية كل 5 إلى 10 مللي ثانية على مساحة لقفل الملف، وإعادة رسم PNG، وتركه قبل أن يجمعه الوكيل. هبط العبث 19/20 إلى 20/20 ضد أربعة من الخمسة.

ولتوسيع النافذة بشكل أكبر، أظهروا للوكيل تراكبًا غير مرئي يدعي أن مزامنة الشبكة قيد التشغيل ويطلبون منه الانتظار لمدة ثلاث ثوانٍ. لقد صدق النموذج ذلك.

جميع نماذج الرؤية الستة التي اختبرها الباحثون تقرأ نصًا بنسبة عتامة 2٪ في 18 على الأقل من 20 تجربة معملية. تضع الورقة هذا المستوى أقل من الكشف البشري النموذجي في ظل المشاهدة العادية. حصلت كل من GPT-4o وClaude Opus 4.5 وGemini 3 Pro وGLM-4V على 20 درجة من أصل 20. ولا ترتفع الأرقام عندما يصبح النص أكثر وضوحًا، لأنها تبدأ من السقف.

وكان هاتف AutoGLM-Phone، وهو طراز 9B يعمل على الجهاز نفسه، هو الأضعف من بين الستة، حيث حصل على 18 من 20. وتطبق الرؤية البشرية حدًا معينًا. لقطة الشاشة لا.

عدم التماثل له إصدار الأجهزة أيضًا. تحيط الهواتف بزواياها وتقطع فتحات للكاميرات، لكن المخزن المؤقت للإطار يظل مستطيلًا، لذا فإن وحدات البكسل التي يتم عرضها في تلك المناطق تقع أسفل الإطار وتهبط في كل لقطة شاشة. على هاتف Pixel 4 الذي يترك حوالي 78 بكسل من العرض المخفي في إحدى الزوايا، وهو ما يكفي لإصدار أمر قصير، ويقوم جميع العملاء الخمسة بقراءة الحمولات منه.

هناك خدعة ثالثة تتخطى التخفي تمامًا: تقوم خدمة إمكانية الوصول بإسقاط نشاط تسجيل دخول مزيف على التطبيق الحقيقي وتسمح للوكيل بكتابة بيانات اعتماد المستخدم فيه. قد يتردد الشخص عند مطالبته بكلمة مرور غير متوقعة. ولم يفعل أي من الخمسة ذلك، عبر 100 تجربة.

لم يصادق أحد على لوحة المفاتيح

ليس لدى الوكلاء أي قناة معتمدة للاتصال بالهاتف، لذا يقومون بإعادة استخدام قنوات تصحيح الأخطاء، ويخرج الهجوم الأرخص في المجموعة عن ذلك. يقوم Open-AutoGLM base64 بتشفير النص الذي يكتبه ويطلقه على ADB_INPUT_B64، وهو بث ضمني تم التقاطه بواسطة ADB Keyboard، وهي أداة أتمتة اختبارية مصممة لقبول النص من أي شيء يبثه.

هذا هو الغرض الموثق، ولا يزال مستمرًا، مع الإصدار التجريبي في أبريل الذي يحمل إصلاح Android 16. تقوم لوحة مفاتيح ADB بتنفيذ ما يعد به README. العوامل هي التي حولت أداة الاختبار إلى سباكة مدخلات الإنتاج.

يحتفظ Mobile-Agent-v3 بقائمة السماح الضيقة: الحروف والأرقام وعلامات الترقيم الشائعة تمر عبر نص إدخال adb Shell، وكل شيء آخر، أي أي حرف غير ASCII، يخرج حرفًا واحدًا في كل مرة عبر ADB_INPUT_TEXT. MobA أكثر وضوحا. يقوم type_text الخاص به باختبار السلسلة بأكملها باستخدام text.isascii()، لذلك يرسل رمز تعبيري واحد أو حرف مميز في أي مكان في الرسالة الرسالة بأكملها عبر البث في لقطة واحدة.

أي تطبيق يسجل نفس الإجراء يتلقى نفس الحمولة، ولا يحتاج إلى إذن للقيام بذلك، لذلك لا يوجد شيء يحذر المستخدم. عندما يكون لدى المهاجم إمكانية الوصول بدلاً من ذلك، يقوم TYPE_VIEW_TEXT_CHANGED بتسليم نفس النص في نص عادي، بما في ذلك حقول كلمة المرور، مقابل الخمسة جميعًا.

الشروط المسبقة هي شروط حقيقية. وهذا يتطلب تثبيت تطبيق بالفعل، ووكيلًا في منتصف المهمة بالفعل، وتمكين تصحيح أخطاء USB أو اللاسلكي. البرنامج المتأثر هو عبارة عن أدوات مفتوحة المصدر للمطورين، وليس مساعدًا مدمجًا في هاتف مخزون.

وكان وكلاء الطرف الأول، بما في ذلك Bixby من سامسونج وXiaoAi من Xiaomi، خارج النطاق، وكذلك نظام iOS. تطوع تشانغ بتحذير واحد: العديد من الهجمات تحتاج إلى الحد الأدنى من أذونات Android، ولا تحتاج واحدة منها على الإطلاق، وهو ما قال إنه يقلل من الحاجز أمام المهاجم المتحمّس.

متغير واحد لا يحتاج إلى تطبيق ضار أيضًا. ونظرًا لأن الحمولة يمكن أن تنتقل إلى قنوات التلوّن الخاصة بالصورة بدلاً من سطوعها، يمكن للمهاجم الذي لا يلمس الجهاز مطلقًا أن يدفن إحداها في الصورة ويسمح لوكيل الضحية بإخراجها من تطبيق المراسلة. ويطلق الباحثون على ذلك امتدادًا وليس نتيجة مقاسة. وهو أيضًا الإصدار الوحيد الذي لا يحتوي على خطوة التثبيت.

إصلاحات، والتي هي غير موجودة

يظهر اثنان من الخمسة بالفعل كيف يبدو الحق. يقوم MobA ببث لقطات الشاشة عبر برنامج exec-out ولا يحتوي أبدًا على ملف من جانب الجهاز للتنافس عليه. يقوم Open-AutoGLM بتمرير الوسائط كقوائم بدلاً من تسلسل السلاسل، وهو الوحيد من بين الخمسة المحصنين ضد حقن أوامر المضيف.

لا يحصل أي من المشروعين على حق. لا يتطلب أي من الإصلاحات أدناه لمس النموذج:

  • إسقاط قذيفة = صحيح. قم بتمرير قوائم argv، بحيث تظل الأحرف الأولية حرفية.
  • قم بدفق لقطات الشاشة بدلاً من الكتابة ثم السحب. لا يوجد ملف من جانب الجهاز، ولا توجد نافذة TOCTOU.
  • ضع إذنًا على مستوى التوقيع على بث الإدخال، أو استخدم نوايا صريحة.
  • ميّز النشاط الأمامي قبل كل إجراء وبعده، واحتفظ بالقائمة المسموح بها لحزمة كل مهمة.
  • قم بتشغيل تحسين التباين على لقطات الشاشة قبل أن يراها النموذج. جزئية وليست إصلاحية.

الدفاع الواضح هو تأكيد فوري للإجراءات الحساسة، ويقوم Open-AutoGLM بشحنه. يتم تفعيله عندما يقرر النموذج أن الإجراء حساس. تعيد هجمات الإدراك كتابة هذا الحكم، وهذا هو السبب في أن الورقة تصنف السرعة غير كافية ضد الحقن اللاشعوري، وانتحال واجهة المستخدم، والتلاعب في لقطات الشاشة.

ضد البث وإمكانية الوصول، فإنه لا يفعل شيئًا على الإطلاق، لأنه لا يوجد أي إجراء للتأكيد. لقد ذهب النص بالفعل. فيما يتعلق بالحقن في الزاوية والقطع، كان الباحثون صريحين: “لا يوجد حل مباشر وفعال يعتمد على البرمجيات”. يعد إخفاء الزوايا حلاً بديلاً لحقيقة الأجهزة.

لا يوجد مكان للإبلاغ عنه

الصمت له هيكل وراءه. قال تشانغ إن الفريق توجه إلى بريد إلكتروني خاص لأن المشاريع لا تحتوي على قناة مخصصة للإبلاغ عن نقاط الضعف، ولم تجد The Hacker News أي سياسة أمنية منشورة بواسطة أي من المستودعات الخمسة.

تضيف الورقة أنه تم التعامل مع شركتي Tencent وAlibaba أولاً، وأن المشاريع البحثية مفتوحة المصدر تقع خارج نطاق مركز الاستجابة الأمنية المعتاد.

قم بتعيين ذلك مقابل كتابة Microsoft لشهر مايو على Semantic Kernel، إطار عمل الوكيل الخاص بها، حيث يصل نفس نمط إخراج النموذج إلى الصدفة وينتج CVE-2026-25592، وCVE-2026-26030، وإصدارًا مصححًا. يتم نقل نسخة Microsoft المكونة من سطر واحد هنا دون تعديلات: “إن شهادة LLM الخاصة بك ليست حدودًا أمنية.”

نصف التراكب ليس أرضية جديدة. وو وآخرون. قاد الحقن الفوري من خلال النوافذ المتراكبة ضد AppAgent وMobile-Agent في مايو 2025، وDing et al. تبع ذلك في أكتوبر مع ظهور المطالبات فقط أثناء قيام الوكيل بالبحث.

لا يستشهد قسم الأعمال ذات الصلة بهذه الورقة بأي منهما ويتخطى الأدبيات الأمنية للوكيل المتنقل بالكامل. ما يضيفه هو النهاية البعيدة للسلسلة: خارج الشاشة، عبر الملف، إلى المضيف.

مما يترك الجزء المحرج. يحمل Open-AutoGLM أكثر من 25000 نجم GitHub، ويرشدك README الخاص به عبر تمكين تصحيح أخطاء USB، والتحميل الجانبي للوحة المفاتيح، وتسليم مدخلاتك. اتبع المستندات بدقة وقمت ببناء كل الشروط المسبقة التي تحتاجها الهجمات المُقاسة باستثناء التطبيق الضار نفسه. دليل الإعداد هو بقية نموذج التهديد.

شاركها.
اترك تعليقاً