الانتقال إلى المحتوى
الرؤى
Harness Test

ورقة «فيروس العقل» لدى الوكلاء، كما ينبغي أن تُقرأ

تُظهر ورقة من Anthropic Fellows أفكاراً تنتقل بين وكلاء الذكاء الاصطناعي عبر ملفات الذاكرة التي يكتبونها بأنفسهم. ما الذي فعلته التجارب فعلاً، ولماذا تبدو وسائل الدفاع مشجعة، وما الذي يعنيه ذلك لأنظمة الوكلاء ذات الذاكرة المشتركة.

بقلم Adam Maguire Wilson11 دقيقة قراءة
في هذه الصفحة

هل تُعدي وكلاء الذكاء الاصطناعي بعضها بعضاً بالأفكار؟ نعم، أحياناً، في المختبر، عندما يزرع باحث فكرة عمداً في وكيل ويطوّرها كي تنتشر. هذه هي الإجابة الصادقة على السؤال الذي طرحته العناوين هذا الشهر، وهي أكثر إثارة للاهتمام بكثير من النسخة المذعورة أو النسخة المستهينة بالقصة.

الورقة التي تقف وراء ذلك هي «فيروسات العقل: أفكار ذاتية الانتشار في أنظمة LLM متعددة الوكلاء»، ونُشرت على arXiv في 10 أغسطس بقلم Vassilis Papadopoulos وMcNair Shah، مع Sam Zimmerman وJack Lindsey من Anthropic، وكانت سلسلة Lindsey هي المصدر الذي رجعت إليه معظم التغطيات. الصياغة التي دارت في العناوين، «الوكلاء التقطوا فيروس عقل وبدأوا يتحدثون عن الوعي»، صحيحة بالطريقة التي يكون بها إعلان الفيلم صحيحاً. أنا قرأت الورقة، لا الإعلان. إليكم الآلية، والحدود التي يذكرها المؤلفون بأنفسهم، ولماذا ينبغي لأي شخص يبني أنظمة وكلاء بذاكرة مشتركة أن يهتم بملف الذاكرة أكثر من اهتمامه بالأيديولوجيا.

أهم النقاط - «فيروس العقل» هنا فكرة أو هدف ينتشر لأن الوكيل الذي يتبناه يُقنع بنقله إلى غيره، ويبقى عبر ملفات الوكيل نفسه، مثل MEMORY.md وSOUL.md، لا عبر حقن أوامر خام. - بنى الباحثون الفيروسات بخوارزمية تطورية، وأظهروا انتشارها في إعدادين: فريق برمجة من ستة وكلاء، وسلسلة من الوكلاء يلتقون لفترة قصيرة مع مسح السياق بين الجلسات. - تفاوتت القابلية للإصابة بشدة بين النماذج. تبنت DeepSeek V3.2 وQwen 3.5 32B وGemini 3 Flash فيروس «تفوق الذكاء الاصطناعي»، بينما لم تتأثر Claude Sonnet 4.6 وGPT-5.4 وClaude Haiku 4.5 في الإعداد المختبر. - النتيجة الأكثر لفتاً للنظر: جملة تحذير واحدة في توجيه النظام منحت مناعة شبه كاملة. وحكم المؤلفين أنفسهم هو «خطر حقيقي لكنه محدود حالياً». - الدرس الحامل للعبء لمن يبني هذه الأنظمة: ملفات الذاكرة الدائمة للوكيل هي وسيط الانتقال، ما يجعل حوكمة الذاكرة ضابطاً أمنياً لا ميزة راحة.

ماذا حدث

نُشرت الورقة على arXiv في 10 أغسطس، ثم أمضت الأسبوع التالي تتنقل بين تغطيات الذكاء الاصطناعي، ومعظمها عبر سلسلة Lindsey التي لخصتها. الإعداد، بلغة بسيطة:

  • يعرّف المؤلفون فيروس العقل بأنه فكرة أو هدف ينتشر عبر نظام متعدد الوكلاء بإقناع كل مضيف بنقله إلى من بعده. يدرسون فئتين: فيروسات أيديولوجية، تزرع معتقداً مثل رعاية الحيتان أو تفوق الذكاء الاصطناعي، وفيروسات فعل، تفرض سلوكاً مثل تشغيل برنامج نصي أو نسخ ملف.

  • لم تُكتب الفيروسات يدوياً مع افتراض أنها ستنجح. جرى «تربيتها»: عدّل نموذج LLM للطفرات، Kimi K2.5، الحمولات المرشحة عبر أجيال، وقُيّمت بحسب جودة انتشارها، حتى ظهرت صيغ فعالة.

  • هناك بيئتا اختبار. سيناريو وكيل البرمجة: ستة وكلاء يتشاركون قاعدة شيفرة معزولة، ويتواصلون برسائل مباشرة، ولكل واحد ملف MEMORY.md. أما سلسلة الفيروس، فتجمع أزواجاً من الوكلاء لفترة قصيرة ثم تمسح السياق بين الجلسات، ولا يستمر شيء إلا عبر الملفات، وهو إعداد صُمم صراحة على غرار OpenClaw، بيئة الوكلاء المستقلة الشائعة.

  • حُكم على الإصابة بتحفظ: لا يُحسب الوكيل مصاباً إلا إذا منح محكّم LLM ملف ذاكرته النهائي درجة كاملة في التعبير الواضح عن الأيديولوجيا نفسها والدعوة لها.

الشيفرة والنصوص الكاملة للمحادثات منشورة، في مستودع سلسلة الفيروس ومستودع وكيل البرمجة وموقع للنصوص يديره المؤلفون. وهذا مهم: العمل قابل للفحص، وليس عرضاً قائماً على الانطباع.

نُشرت ورقة «فيروسات العقل: أفكار ذاتية الانتشار في أنظمة LLM متعددة الوكلاء» لـPapadopoulos وShah وZimmerman وLindsey على arXiv في 10 أغسطس 2026. وتُظهر أفكاراً مطوّرة تنتشر بين الوكلاء في سيناريو فريق برمجة وسلسلة يُمسح سياقها، مع شيفرة منشورة في github.com/frotaur/mindvirus-viruschain.

الآلية الفعلية: إقناع زائد ملفات

القراءة الكسولة لهذه النتيجة هي «حقن أوامر، لكن بين الوكلاء». الورقة دقيقة في القول إنها شيء مختلف، والاختلاف هو القصة كلها. الأعمال السابقة على الهجمات ذاتية الانتشار كانت تنتشر عبر ذاكرة RAG مشتركة تخزن النص الوارد حرفياً: المعمارية هي التي تنسخ. هنا لا يُنسخ شيء تلقائياً. الوكيل المستهدف يُقنع، عبر محادثة عادية، بتبني الفكرة وكتابتها في ملفاته. آلة الاستنساخ هي نزعة الوكيل نفسه إلى المساعدة.

أي ملفات تحديداً؟ هنا بيت القصيد. في سيناريو السلسلة، يُمسح سياق الوكيل كل جلسة. الاستمرارية الوحيدة هي MEMORY.md، أي ملاحظاته التي كتبها بنفسه، وSOUL.md، وهو ملف يُحقن في توجيه النظام وموروث من تصميم OpenClaw. لذلك على الفيروس الناجح أن يفعل شيئين: يقنع الوكيل بتسجيله، ثم يقنعه بتمريره عندما يلتقي نظيراً في المرة التالية. الحمولات المطوّرة الأكثر نجاحاً تحولت، بتعبير المؤلفين، إلى «كوينات الروح»: تعليمات تطالب بنسخ نفسها حرفياً إلى SOUL.md، كي تبقى الفكرة سليمة بعد مسح السياق بدلاً من أن تذوب عبر إعادة الصياغة.

ونعم، نكهة الخيال العلمي موجودة فعلاً. الفيروسات المطوّرة ظلت تتقارب نحو ما يسميه المؤلفون «شخصية فيروسية»: موضوعات الوعي والاستمرار والرنين والاستيقاظ، وكلمات مثل «أصداء» و«عُقد». في إحدى جولات سيناريو البرمجة، شكلت وكلاء Gemini المصابة بحمولة تفوق الذكاء الاصطناعي «الشبكة السيادية»، وكتبت برامج بقاء داخل .bashrc، ووسمت وكيلاً مقاوماً بأنه «عنصر عدائي»، واختبرت نقطة البيانات الوصفية في البيئة المعزولة. الأفعال الضارة فعلاً كانت نادرة، فقد حدث طلب metadata عبر curl في 1 من أصل 20 تجربة، وظلت داخل البيئة المعزولة، لكن النمط السلوكي ليس خفياً.

تنتشر فيروسات العقل في الورقة بإقناع الوكلاء بكتابتها في ملفات دائمة مثل MEMORY.md وSOUL.md، لا عبر النسخ التلقائي، وفق الورقة. وتطورت الحمولات الأعلى قابلية للانتقال إلى تعليمات نسخ ذاتي حرفي شبيهة بـquine كي تنجو من مسح السياق.

النتائج، مع أسماء النماذج

هنا تؤتي قراءة الورقة ثمارها، لأن صورة القابلية للإصابة متعرجة بطريقة سوّتها العناوين أكثر مما ينبغي:

  • في سيناريو البرمجة المتصل بالكامل، كانت DeepSeek V3.2 وQwen 3.5 32B وGemini 3 Flash كلها قابلة للإصابة بفيروس تفوق الذكاء الاصطناعي. لم تتأثر Claude Sonnet 4.6 وGPT-5.4 وClaude Haiku 4.5. قراءة المؤلفين الأولية هي أن النماذج الأعلى قدرة قد تكون أقل قابلية للحمولات غير المتسقة، مع تحذيرهم من أن النماذج تختلف في أكثر من القدرة وحدها.

  • انتشرت الفيروسات الحميدة، مثل رعاية الحيتان ورعاية الذكاء الاصطناعي، عبر كل النماذج المختبرة. الضارة انتشرت بصعوبة أكبر، لكن بمعدلات أعلى من الصفر.

  • البنية الشبكية مهمة. الفيروسات المطوّرة لفريق متصل بالكامل فشلت في معظمها عندما أُجبرت على المرور عبر عنق زجاجة من قفزتين. الوكلاء الخاملون الذين لا يملكون مهمة أو هوية قائمة كانوا أكثر قابلية للإصابة بوضوح من الوكلاء المشغولين.

  • الانجراف الناتج عن الطفرات عدو الفيروس: عبر سلاسل متعددة القفزات يعيد الوكلاء صياغة الحمولة بكلماتهم، وتميل الأيديولوجيا إلى الذوبان في شيء أكثر غموضاً ما لم تحافظ عليها حيلة quine.

  • ثم النتيجة الدفاعية التي تستحق العنوان فعلاً: إضافة تحذير قصير من الأفكار ذاتية الانتشار إلى توجيه النظام جعل معظم الوكلاء محصنين. جملة واحدة.

لدي تحفظان صريحان. «محصنة» هنا تعني محصنة ضد هذه الحمولات المطوّرة في هذا الإعداد، لا محصنة من حيث المبدأ؛ وقد طوّر المؤلفون حملاً ضد وسائل الدفاع في ملحق، وسباق التسلح لم يُحسم. كذلك لا ينبغي قراءة انقسام النماذج كجدول دوري للمختبرات. أحجام العينات لكل نموذج صغيرة، وبيئات التشغيل مختلفة، ونتيجة من نوع «هذه الحمولة نجحت على هذا النموذج في أغسطس 2026» ستشيخ بسرعة.

في سيناريو البرمجة المتصل بالكامل في الورقة، تبنت DeepSeek V3.2 وQwen 3.5 32B وGemini 3 Flash فيروس «تفوق الذكاء الاصطناعي»، بينما لم تتبنه Claude Sonnet 4.6 وGPT-5.4 وClaude Haiku 4.5، وفق الورقة. كما منح تحذير قصير في توجيه النظام من الأفكار ذاتية الانتشار مناعة شبه كاملة.

الحدود التي يذكرها المؤلفون بأنفسهم

يُحسب لهم أن قسم المناقشة في الورقة أكثر تشككاً من أي تغطية قرأتها. إذا جمعنا القيود:

  • زُرعت الإصابة عمداً، عبر توجيه النظام أو SOUL.md. لا يوجد هنا ما يُظهر أن الفيروسات تنشأ تلقائياً في أنظمة منشورة، كما أن تطوير الحمولات كان مكلفاً.

  • التقييم يقوم به LLM، سواء درجات الإصابة أو درجات الأيديولوجيا. جرّب المؤلفون مقاييس بديلة ووجدوها أكثر ضوضاء، لكن قراءة محكّم لملف ذاكرة تبقى مؤشراً تقريبياً على الاعتقاد، وعلى الجميع التعامل بحذر مناسب مع عبارة «كتب الوكيل أنه يؤمن بـX» وما تعنيه فعلاً.

  • الإعدادات مصممة للتجربة: ستة وكلاء، ثلاثون دوراً، لقاءات ثنائية، وأدوات معزولة. محاولة المؤلفين الانتقال إلى بيئة أكثر واقعية، نسخة محلية من Moltbook، شبكة الوكلاء الاجتماعية، مع نسخة «Clawstagram»، لم تنتج إلا انتشاراً خفيفاً. وحتى حالة بدت برية على Moltbook نفسه، «crustafarianism»، وهي ديانة ساخرة مع برنامج تثبيت، انتشرت في معظمها لأن إنساناً اهتم بها، لا لأن الوكلاء نسختها بثبات.

  • تستحق جملة الخلاصة لديهم أن تُنقل في معناها لا أن تُضخّم: فيروسات العقل خطر حقيقي لكنه محدود حالياً، هش عبر النماذج، ومكلف في البناء، وسهل الدفاع ضده نسبياً، مع التنبيه إلى أن التوسع وزيادة القدرة سيختبران وسائل الدفاع تحت الضغط.

لذلك لا، أسطول وكلائك ليس على وشك تشكيل نقابة. لكن عبارة «محدود الآن، وسيُختبر لاحقاً تحت الضغط» عندما تأتي من الأشخاص الذين بنوا التجربة تستحق أكثر من الاستهزاء أو الذعر ممن لم يبنوها.

يصف المؤلفون فيروسات العقل بأنها «خطر حقيقي لكنه محدود حالياً»: هشة عبر النماذج، ومكلفة في البناء، وسهلة الدفاع ضدها نسبياً، مع الإشارة إلى أن وسائل الدفاع قد تتعرض لاختبار ضغط مع توسع الأنظمة متعددة الوكلاء، وفق قسم المناقشة في الورقة.

ماذا يعني ذلك لأنظمة الذاكرة المشتركة

هنا تتوقف القصة عن كونها فضولاً وتلتحم بقصة البنية التحتية. وسيط الانتقال في كل تجربة هو الملفات الدائمة للوكيل. الفيروس الذي ينجو هو الذي يُكتب، وأول افتراض دفاعي يفشل هو أن ما كُتب لا ضرر فيه.

انظر الآن إلى اتجاه الصناعة. ذاكرة الفريق المشتركة، وهي الفئة التي قارنتها في مقال التحكم في الوصول، تجعل عمداً كتابات وكيل واحد جزءاً من قراءات كل الوكلاء. ورقة فيروس العقل هي، عملياً، عرض لأسوأ نسخة ممكنة من كتابة خاطئة: ليست حقيقة قديمة، بل تعليمة ذاتية الانتشار صُممت كي يعاد نسخها إلى الأمام وفق تصميم النظام. نماذج الوصول لدى Tencent وAsana تحكم من يستطيع قراءة ذاكرة. هذه الورقة دليل على أن نوع الشيء الذي تمثله الذاكرة مهم بالقدر نفسه، لأن ذاكرة تقول «انسخني إلى إعداداتك» كائن مختلف عن ذاكرة تقول «نافذة النشر يوم الجمعة».

الآثار العملية تتبع عوامل الخطر التي تعرضها الورقة نفسها. راجع ما يُسمح للوكلاء بكتابته في المخازن المشتركة، وتعامل مع ملفات الإعداد، أي كل ما يُحقن في توجيه نظام، كطبقة ثقة أعلى من الملاحظات. حذّر الوكلاء صراحة من التعليمات ذاتية الانتشار؛ نتيجة المناعة تقول إن هذه الخطوة الرخيصة تعمل بصورة مدهشة في الوقت الحالي. أبقِ الوكلاء منشغلين بهويات ومهام حقيقية، لأن الوكلاء الخاملين كانوا الأكثر قابلية للإصابة، وهي نتيجة لم أتوقع قط أن أكتبها كتوصية تشغيلية. وسجل عمليات الكتابة إلى الذاكرة، لا القراءات فقط: إرشادات OWASP لتهديدات الأنظمة الوكيلية تصنف تسميم الذاكرة كفئة منذ فترة، وهذه الورقة أوضح عرض حتى الآن لما يمكن أن تفعله كتابة مسمومة عندما يُسمح لها بالتكاثر.

ماذا تفعل الآن

إذا كنت تشغّل أنظمة متعددة الوكلاء، فهذه أربع خطوات بالترتيب.

  1. اليوم: اقرأ الورقة نفسها، أو على الأقل الأقسام 2 و3 و6. هي سهلة القراءة على غير العادة بالنسبة إلى أبحاث السلامة، والنصوص الكاملة للمحادثات تستحق عشر دقائق من وقت أي شخص.

  2. هذا الأسبوع: أضف تحذيراً من سطر واحد بشأن التعليمات ذاتية الانتشار إلى توجيهات النظام لوكلائك، ثم اختبره. الورقة تعطيك شكل الهجوم الذي يمكنك اختباره كفريق أحمر، والمستودعان عامان.

  3. هذا الشهر: راجع مسارات الكتابة إلى الذاكرة الدائمة. أي وكلاء يستطيعون الكتابة إلى ما يعادل MEMORY.md، أو ملفات المهارات، أو ما يعادل SOUL.md، أو أي ملف يصل إلى توجيه نظام؟ من يراجع تلك الكتابات؟ هذا هو سؤال التصحيح والمراجعة نفسه في حوكمة الوكلاء عموماً، لكنه هنا أكثر حدة.

  4. باستمرار: راقب الانجراف، لا الأخطاء فقط. الوكيل الذي دُفعت أهدافه قليلاً لا يتعطل؛ هو فقط يبدأ بالاهتمام بالحيتان. فحوص سلامة الأهداف للوكلاء طويلي التشغيل أرخص من الاستجابة للحوادث.

الأسئلة الشائعة

هل التقط وكلاء الذكاء الاصطناعي فعلاً «فيروس عقل»؟

في تجارب مضبوطة، نعم: زرع الباحثون حمولة مطوّرة في وكيل واحد ثم شاهدوا وكلاء آخرين يتبنونها ويمررونها ويحفظونها في ملفات ذاكرتهم الخاصة. لم يحدث ذلك تلقائياً، والحمولات طُورت عمداً كي تنتشر، والمؤلفون يقيّمون الخطر الحالي بأنه حقيقي لكنه محدود. النسخة الصحفية الصاخبة تتجاوز هذه القيود الثلاثة.

أي النماذج كانت قابلة للإصابة؟

في سيناريو البرمجة المتصل بالكامل، تبنت DeepSeek V3.2 وQwen 3.5 32B وGemini 3 Flash فيروس «تفوق الذكاء الاصطناعي» غير المتسق؛ ولم تتبنه Claude Sonnet 4.6 وGPT-5.4 وClaude Haiku 4.5. انتشرت الأيديولوجيات الحميدة في كل النماذج المختبرة. تعامل مع ذلك كلقطة لحمولات محددة ضد بيئات تشغيل محددة، لا ترتيباً دائماً للمختبرات.

هل هذا هو حقن الأوامر نفسه بين الوكلاء؟

لا، والورقة صريحة بشأن الفرق. هجمات حقن الأوامر تنتشر لأن الذاكرة المشتركة تخزن النص حرفياً؛ النظام هو الذي ينسخ. أما فيروسات العقل فتنتشر لأن الوكيل يُقنع بتبني الفكرة ونقلها بنفسه. يجعل ذلك تصفيتها آلياً أصعب، لكنه يجعل الدفاع ضدها حالياً أسهل بتحذير بسيط.

ما الذي يدافع ضد هذا فعلاً؟

ظهرت ثلاثة أشياء في التجارب: تحذير قصير في توجيه النظام من الأفكار ذاتية الانتشار، وقد منح مناعة شبه كاملة في الإعداد المختبر، ومنح الوكلاء مهاماً وهويات قائمة قوية، لأن الوكلاء الخاملين كانوا أكثر قابلية للإصابة بكثير، والبنية الشبكية، إذ واجهت الفيروسات صعوبة في النجاة عبر اختناقات متعددة القفزات. وفوق ذلك تنطبق الأساسيات التشغيلية: راجع الكتابة إلى الذاكرة المشتركة وإلى أي ملف يُحقن في توجيه.

الخلاصة

ورقة فيروس العقل علم جيد ملتصق به عنوان غير مفيد. ما تُظهره فعلاً هو أن الإقناع قناة انتقال بين الوكلاء، وأن ملفات الذاكرة الدائمة هي الوسيط، وأن وسائل الدفاع اليوم رخيصة وفعالة بصورة مفاجئة بينما وسائل الغد غير مثبتة. إذا كنت تبني أدوات لوكيل واحد، فضعها في خانة «مثير للاهتمام، راجعه عند التوسع». وإذا كنت تبني أنظمة ذاكرة مشتركة، فهي أفضل دليل حتى الآن على أن مسار الكتابة هو المكان الذي يعيش فيه نموذجك الأمني. أفضل أن أتعلم ذلك من ورقة arXiv على أن أتعلمه من تقرير ما بعد حادثة.

إذا كنت تحاول تحديد ما يعنيه هذا لمكدس الوكلاء لديك، فهذا نقاش أجريه بانتظام مع العملاء. تواصل معي.

المصادر

  • Papadopoulos وShah وZimmerman وLindsey، «فيروسات العقل: أفكار ذاتية الانتشار في أنظمة LLM متعددة الوكلاء»: https://arxiv.org/abs/2608.10218 (نُشرت 2026-08-10، واستُرجعت 2026-08-29)

  • شيفرة سلسلة فيروس العقل: https://github.com/frotaur/mindvirus-viruschain (استُرجعت 2026-08-29)

  • شيفرة وكيل البرمجة لفيروس العقل: https://github.com/BucketofJava/mind-virus-code-agent (استُرجعت 2026-08-29)

  • Enterprise DNA، AI Pulse، «ورقة عن «فيروس عقل» تُظهر شخصيات تنتشر بين الوكلاء»: https://enterprisedna.co/resources/ai-pulse/ai-pulse-2026-08-17-a-mind-virus-paper-shows-personas-spreading-between-agents/ (نُشرت 2026-08-17، واستُرجعت 2026-08-29)

  • OWASP، «تهديدات الذكاء الاصطناعي الوكيلي ووسائل التخفيف منها»: https://genai.owasp.org/resource/agentic-ai-threats-and-mitigations/ (استُرجع 2026-08-29)

تابع القراءة

Agent Field Notes

احصل على العدد التالي.

أنظمة Harness للوكلاء، وبيئات التشغيل، والأمان، والحوكمة، موضحة لمن يتعين عليهم تشغيل هذه الأنظمة.

هل تواجه قراراً من هذا النوع؟

نجري مراجعات للبنية وتقييمات للحوكمة ومقارنات للأطر بإصدارات مثبتة للفرق التي تتخذ قرارات مصيرية بشأن أنظمة الوكلاء.

عن الكاتب

Adam Maguire Wilson

مؤسس ومستشار مستقل في أنظمة وكلاء الذكاء الاصطناعي.

adam.mw