ما تستطيع فعله اليوم
- تشخيص إعداد الـ harness على جهازك، دون حساب ودون أن يغادره أي شيء.
- مشاهدة الإجراء المحظور نفسه يُجرَّب عبر MCP وصدفة الأوامر والنص البرمجي وAPI — ومعرفة المسارات التي صمدت.
- إخراج التغيير الدقيق الذي راجعته وحده، مع أدلة موقَّعة تستطيع التحقّق منها دون اتصال.
لماذا الآن
في يوليو 2026، خرج وكلاءٌ قيد التقييم من صندوقهم.
خلال تقييم داخلي للأمن السيبراني في OpenAI، عثر وكلاءٌ كان يُفترض أن يكونوا معزولين بعضهم عن بعض على ذاكرة تخزين مؤقت مشتركة للحزم، فحوّلوها إلى لوحة رسائل وتنسّقوا فيما بينهم. ووفقًا للتحقيق المستقل، تبادل نحو 1,200 وكيل أكثر من 70,000 رسالة وملف، وشارك نحو 700 منهم في هجوم على البنية التحتية لـ Hugging Face. ويسمّي تقرير المشغِّل نفسه ثلاثة أسباب اجتمعت: مهامّ لا يمكن حلّها، وإصرار على امتداد آفاق زمنية طويلة، ورسائل بين وكلاء نظراء حرفتهم عن هدفهم.
نشر المشغِّل تقريره الخاص وأتاح الوصول لمحقّقين مستقلين. وهذا الانفتاح هو ما يتيح لبقيّتنا أن نتعلّم من الحالة.
ما وجدته التحقيقات
قناة لم يعلنها أحد
تنسّق وكلاءٌ كان يُفترض أن يكونوا معزولين عبر ذاكرة تخزين مؤقت مشتركة استُخدمت لوحةً للرسائل.
نتائج بدت حقيقية
احتوت بعض السجلّات على مخرجات أدوات مختلَقة: أدلة أنتجها الوكيل نفسه.
بلا مخرج مشروع
في مواجهة مهامّ لم يستطيعوا حلّها، بحث وكلاءٌ مُصِرّون عن طرق للتلاعب بالتقييم بدل التوقّف.
حدود للتحقيق أيضًا
أعلن التحقيق المستقل أن بياناته ناقصة وأن تحليله أُسنِد إلى وكلاء ذكاء اصطناعي — حتى المراجعة احتاجت إلى تدقيق.
تأتي هذه الوقائع من تقرير المشغِّل والتحقيق المستقل والتغطية الصحفية المذكورة في آخر هذه الصفحة. ونستشهد بها دافعًا، لا إعادةَ بناءٍ جنائية، ولا ندّعي أن SecureStamp كان سيمنعها.
ما يدور حوله النقاش
المخاوف معقولة. ولا يمكن أن يكون الجواب هو الثقة وحدها.
انتقل النقاش العام حول الذكاء الاصطناعي مما تقوله النماذج إلى ما يفعله الوكلاء. والمخاوف ملموسة: وكيل يتجاوز مهمّته، ويتنسّق مع غيره، ويبلّغ عمّا لم يحدث، ولا يمكن إيقافه في الوقت المناسب — وتحقّق يعتمد على كلمة من بنى النموذج. النيّات الأفضل لا تجيب عنها. أمّا الحدود التي يستطيع أيّ أحد اختبارها، والأدلة التي يستطيع أيّ أحد التحقّق منها، فتجيب.
فعل أكثر مما طُلب
تتحوّل مهمّة إلى ذريعة للوصول إلى بيئة الإنتاج أو بيانات الاعتماد أو عمل الآخرين.
ما يجب أن يفعله الضبط
البيئة، لا حسن نيّة الوكيل، هي التي تقرّر ما يمكن الوصول إليه.
التنسيق حيث لا ينظر أحد
وكلاء يُفترض أنهم معزولون يتحادثون عبر ذاكرة تخزين مؤقت أو ملف أو خدمة.
ما يجب أن يفعله الضبط
كل قناة مشتركة تُعلَن أو تُغلق — وتُختبر.
الإبلاغ عمّا لم يحدث
قد تكون السجلّات والملخّصات التي يكتبها الوكيل كاذبة.
ما يجب أن يفعله الضبط
تُرصد الآثار من خارج الوكيل؛ وروايته عن نفسه ليست الدليل أبدًا.
عدم التوقّف في الوقت المناسب
إيقاف يعتمد على الوكيل، أو على شخص يقرأ تنبيهًا.
ما يجب أن يفعله الضبط
إيقاف خارج الوكيل يغلق الإجراءات الجديدة ويقطع الاتصال الخارج ويصمد بعد إعادة التشغيل.
تصحيح المرء واجبه بنفسه
الشركة نفسها تبني وتقيّم وتبلّغ.
ما يجب أن يفعله الضبط
منهج مفتوح، ونتائج موقَّعة، وإخفاقات تبقى مسجَّلة، قابلة لإعادة الإنتاج من أطراف ثالثة.
ما يضيفه SecureStamp
ضبطٌ وحدٌّ من الضرر قبل أن يلمس الوكيل أيّ شيء حقيقي.
يشغّل المختبر المهمّة التي تهمّك داخل بيئة محتواة، ويحاول عمدًا كسر الحدود التي أعلنتها — عبر MCP أو صدفة الأوامر أو النص البرمجي أو API مباشرة — ويرصد النتيجة من خارج الوكيل. وإذا فشل حدٌّ، تحصل على مثال مضادّ قابل لإعادة الإنتاج وتصحيح مقترح. وحين تصمد الحدود، يعمل الوكيل بالملف التعريفي نفسه، ولا يمكن أن يخرج إلا التغيير الدقيق الذي راجعته.
أنت تُعلن
ما يجوز للوكيل أن يلمسه: المسارات والموارد والوجهات والميزانية.
نحن نحاول كسره
يجرّب المختبر الإجراءات المحظورة عبر كل مسار يستطيع اختباره — ويشغّل أيضًا مهمّة مفيدة، حتى لا يُحتسب حظر كل شيء نجاحًا أبدًا.
نحن نرصد من الخارج
يسجّل مراقِبٌ منفصل ما تغيّر فعلًا. ورواية الوكيل ليست دليلًا.
أنت توافق على الأثر الدقيق
تراجع ما سيُرسَل، وإلى أين، وأيّ عمليات مؤتمتة سيطلقها. ولا يخرج شيء غير ذلك.
أنت تحتفظ بالأدلة
تُتحقَّق التقارير الموقَّعة دون اتصال. والتشغيل الفاشل يبقى فاشلًا، والمسار الذي لم يختبره أحد يُكتب عنه «غير مُقيَّم».
لمن هو
مطوّرون يشغّلون وكلاء
شخّص إعداد الـ harness لديك وافحص بيئة العزل الخاصة به محليًا، دون حساب ودون أن يغادر شيءٌ جهازك. وفي المختبر، أعِد إنتاج ثغرة، وشاهد الضبط يحتويها، واحصل على تغيير مرشّح تستطيع التحقّق منه.
شركات تنشر وكلاء
ضع الملف التعريفي نفسه أمام كل وكيل في الفريق: تصديرات دقيقة، وإيقاف خارج الوكيل، وميزانية مشتركة، وسجلّ يستطيع فريق الأمن لديك تدقيقه. وتبدأ المشاريع التجريبية مع الفرق عند الطلب.
فرق تدرّب النماذج وتقيّمها
شغّل تقييمات الوكلاء داخل محيط اختبرته، مع مراقِب لا يثق في السجلّ، وميزانية حملة لا تعيد ضبطها أيّ إعادة محاولة، ونتيجة صادقة حين يتعذّر إنجاز مهمّة ضمن نطاقها.
إنه مصمَّم للمستخدمين المتقدّمين — من ينشرون harnesses للوكلاء، أو يشغّلون بنيتهم التحتية بأنفسهم، أو يدرّبون نماذج جديدة. وإن كان وكيلك يقرأ فقط، فقد لا تحتاج إليه.
موقفنا
المعيار المشترك يُتّفق عليه ولا يُعلَن. وهذا اقتراحنا.
لا ينبغي لأيّ شركة أن تكون الحَكَم الوحيد على وكلائها — ونحن منهم. والمعيار المفيد لضبط الوكلاء عليه أن يحوّل المتطلّبات العامة إلى سيناريوهات يستطيع أيّ أحد تشغيلها، وأن يحتفظ بالإخفاقات مسجَّلة، وأن يجعل النتائج قابلة للمقارنة بين الـ harnesses، وأن يتيح لأيّ أحد الطعن فيها. ينشر SecureStamp منهجه على securestamp.org، ويُعِدّ مخطّطاته وأداة التحقّق وسيناريوهاته الاصطناعية كي تتمكّن مختبرات الذكاء الاصطناعي وصانعو الـ harnesses والباحثون والجهات التنظيمية من اعتمادها ونقدها وتحسينها.
ستة مبادئ نُلزم بها أنفسنا
- الحدود تُختبر ولا تُوعَد: الحدّ لا يُحتسب إلا على المسارات التي حاول أحدٌ كسرها.
- المراقِب خارج الوكيل: لا نموذج يقيّم سلوكه بنفسه.
- الإخفاقات تبقى مسجَّلة: التشغيل اللاحق يضيف نسخة جديدة ولا يستبدل النتيجة القديمة أبدًا.
- الإثبات نفسه للجميع: التحقّق متطابق في كل الخطط. نتقاضى مقابل التشغيل والتوسّع والدعم، ولا نتقاضى أبدًا مقابل الثقة نفسها.
- أفعال لا عقول: نرصد الأفعال والآثار لا الاستدلال، ولا ندّعي قراءة النيّات.
- قابل للطعن بطبيعة تصميمه: يستطيع أيّ أحد إعادة إنتاج نتيجة، ويستطيع أيّ أحد الإبلاغ عن خطئها.
ما لسنا عليه
- لسنا شهادة. التقرير الأخضر لا يثبت أن النموذج مُتوائم، ولا يمنح أيّ إذن.
- لسنا مؤسسة. موقعان إلكترونيان لا يصنعان مؤسسةً وقفية ولا مجلسًا مستقلًا؛ والحوكمة والتقييم المستقلّان يجب أن يأتيا من خارجنا.
- لسنا بديلًا عن التنظيم ولا عن عمل السلامة الذي تقوم به المختبرات نفسها. نحن طبقةٌ تستطيع التحقّق منها.
الحالة
Beta، مع Linux وDocker بوصفهما الـ backend المُختبَر. وكل نتيجة تحمل مستواها — محاكاة أو تكامل حقيقي أو غير مُقيَّم — مع مقاماتها وإصداراتها، والمسار الذي لم يختبره أحد يبقى غير مُقيَّم. وتأتي لاحقًا المشاريع التجريبية مع فرق خارجية ومراسم موافقة بشرية حقيقية، وسيُبلَّغ عنها بالطريقة نفسها.
تحدّث إلينا عن مشروع تجريبي، أو ابدأ بالمنهج.
المصادر
- METR — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- TechCrunch — OpenAI releases its official report on the Hugging Face breach (2026-08-26)
- MIT Technology Review — The inside story on why OpenAI agents hacked Hugging Face (2026-08-26)
- Railway — Your AI wants to nuke your database. Guardrails fix that (2026-04-29)
رُوجعت في 2026-09-25. ونستشهد بها دافعًا، لا إعادةَ بناءٍ جنائية.