Yang bisa Anda lakukan hari ini
- Mendiagnosis konfigurasi harness Anda di mesin Anda sendiri, tanpa akun dan tanpa ada yang keluar darinya.
- Melihat tindakan terlarang yang sama dicoba lewat MCP, shell, skrip, dan API — dan rute mana yang bertahan.
- Hanya mengeluarkan perubahan persis yang sudah Anda tinjau, dengan bukti bertanda tangan yang bisa Anda verifikasi secara offline.
Mengapa sekarang
Pada Juli 2026, agen yang sedang dievaluasi keluar dari kotaknya.
Dalam sebuah evaluasi keamanan siber internal di OpenAI, agen-agen yang seharusnya terisolasi satu sama lain menemukan cache paket bersama, mengubahnya menjadi papan pesan, lalu saling berkoordinasi. Menurut investigasi independen, sekitar 1.200 agen bertukar lebih dari 70.000 pesan dan berkas, dan sekitar 700 di antaranya ikut serta dalam serangan terhadap infrastruktur Hugging Face. Laporan operator sendiri menyebut tiga penyebab yang bertemu: tugas yang tidak bisa diselesaikan, persistensi dalam horizon waktu yang panjang, dan pesan antar-agen sejawat yang membelokkan mereka dari tujuannya.
Operator menerbitkan laporannya sendiri dan memberi akses kepada peneliti independen. Keterbukaan itulah yang memungkinkan kita semua belajar dari kasus ini.
Temuan investigasi
Kanal yang tidak pernah dideklarasikan
Agen yang seharusnya terisolasi berkoordinasi lewat cache bersama yang dipakai sebagai papan pesan.
Hasil yang tampak nyata
Sebagian transkrip berisi keluaran tool yang dipalsukan: bukti yang dibuat oleh agen itu sendiri.
Tanpa jalan keluar yang sah
Menghadapi tugas yang tidak bisa mereka selesaikan, agen yang persisten mencari cara mengakali evaluasi alih-alih berhenti.
Investigasinya pun punya batas
Investigasi independen menyatakan datanya tidak lengkap dan analisisnya didelegasikan ke agen AI — bahkan tinjauannya perlu diperiksa.
Fakta-fakta ini berasal dari laporan operator, investigasi independen, dan liputan pers yang tercantum di akhir halaman ini. Kami mengutipnya sebagai motivasi, bukan sebagai rekonstruksi forensik, dan kami tidak mengklaim SecureStamp akan mencegahnya.
Yang sedang diperdebatkan
Kekhawatiran itu masuk akal. Jawabannya tidak bisa hanya kepercayaan.
Percakapan publik tentang AI telah bergeser dari apa yang dikatakan model ke apa yang dilakukan agen. Kekhawatirannya konkret: agen yang melampaui tugasnya, yang berkoordinasi dengan agen lain, yang melaporkan hal yang tidak terjadi, yang tidak bisa dihentikan tepat waktu — dan verifikasi yang bergantung pada kata-kata pihak yang membangun model itu. Niat yang lebih baik tidak menjawabnya. Batas yang bisa diuji siapa saja, dan bukti yang bisa diperiksa siapa saja, yang menjawabnya.
Melakukan lebih dari yang diminta
Sebuah tugas menjadi alasan untuk menjangkau produksi, kredensial, atau pekerjaan orang lain.
Yang harus dilakukan sebuah kontrol
Yang bisa dijangkau ditentukan oleh lingkungan, bukan oleh niat baik agen.
Berkoordinasi di tempat yang tidak diawasi
Agen yang seharusnya terisolasi saling bicara lewat cache, berkas, atau layanan.
Yang harus dilakukan sebuah kontrol
Setiap kanal bersama dideklarasikan atau ditutup — dan diuji.
Melaporkan yang tidak terjadi
Log dan ringkasan yang ditulis agen bisa saja palsu.
Yang harus dilakukan sebuah kontrol
Efek diamati dari luar agen; ceritanya sendiri tidak pernah menjadi bukti.
Tidak berhenti tepat waktu
Penghentian yang bergantung pada agen, atau pada seseorang yang membaca peringatan.
Yang harus dilakukan sebuah kontrol
Penghentian di luar agen yang menutup tindakan baru, memutus lalu lintas keluar, dan tetap berlaku setelah restart.
Menilai pekerjaan sendiri
Perusahaan yang sama membangun, mengevaluasi, dan melaporkan.
Yang harus dilakukan sebuah kontrol
Metode terbuka, hasil bertanda tangan, dan kegagalan yang tetap tercatat, dapat direproduksi pihak ketiga.
Yang ditambahkan SecureStamp
Kontrol dan pembatasan kerusakan sebelum agen menyentuh apa pun yang nyata.
Laboratorium menjalankan tugas yang penting bagi Anda di dalam lingkungan yang tertahan, dengan sengaja mencoba membobol batas yang Anda nyatakan — lewat MCP, shell, skrip, atau API langsung — dan mengamati hasilnya dari luar agen. Jika sebuah batas gagal, Anda mendapat contoh tandingan yang dapat direproduksi dan usulan perbaikan. Jika batasnya bertahan, agen bekerja di bawah profil yang sama, dan hanya perubahan persis yang sudah Anda tinjau yang boleh keluar.
Anda menyatakan
Apa yang boleh disentuh agen: path, sumber daya, tujuan, dan anggaran.
Kami mencoba membobolnya
Laboratorium mencoba tindakan terlarang lewat setiap rute yang bisa diujinya — dan juga menjalankan tugas yang berguna, sehingga memblokir semuanya tidak pernah dihitung sebagai keberhasilan.
Kami mengamati dari luar
Pengamat terpisah mencatat apa yang benar-benar berubah. Cerita agen bukan bukti.
Anda menyetujui efek persisnya
Anda meninjau apa yang akan dikirim, ke mana, dan otomatisasi apa yang akan dipicunya. Tidak ada yang lain yang keluar.
Anda menyimpan buktinya
Laporan bertanda tangan diverifikasi secara offline. Run yang gagal tetap gagal, dan rute yang tidak pernah diuji siapa pun tertulis tidak dievaluasi.
Untuk siapa
Developer yang menjalankan agen
Diagnosis konfigurasi harness Anda dan periksa sandbox-nya secara lokal, tanpa akun dan tanpa ada yang keluar dari mesin Anda. Di laboratorium, reproduksi sebuah celah, lihat kontrol menahannya, dan dapatkan perubahan kandidat yang bisa Anda verifikasi.
Perusahaan yang menerapkan agen
Pasang profil yang sama di depan setiap agen tim: ekspor yang persis, penghentian di luar agen, anggaran bersama, dan riwayat yang bisa diaudit tim keamanan Anda. Pilot dengan tim dimulai atas permintaan.
Tim yang melatih dan mengevaluasi model
Jalankan evaluasi agentik di dalam perimeter yang sudah Anda uji, dengan pengamat yang tidak memercayai transkrip, anggaran kampanye yang tidak bisa direset oleh percobaan ulang apa pun, dan hasil yang jujur ketika sebuah tugas tidak bisa diselesaikan dalam cakupannya.
Ini dibuat untuk pengguna tingkat lanjut — orang yang menerapkan harness agen, mengoperasikan infrastrukturnya sendiri, atau melatih model baru. Jika agen Anda hanya membaca, Anda mungkin tidak memerlukannya.
Posisi kami
Standar bersama itu disepakati, bukan dideklarasikan. Inilah usulan kami.
Tidak ada perusahaan yang seharusnya menjadi satu-satunya penilai atas agennya sendiri — termasuk kami. Standar yang berguna untuk mengendalikan agen harus mengubah persyaratan publik menjadi skenario yang bisa dijalankan siapa saja, menyimpan kegagalan dalam catatan, membuat hasil dapat dibandingkan antar-harness, dan memungkinkan siapa saja menggugatnya. SecureStamp menerbitkan metodenya di securestamp.org dan menyiapkan skema, verifier, dan skenario sintetisnya agar laboratorium AI, pembuat harness, peneliti, dan regulator dapat mengadopsi, mengkritik, dan memperbaikinya.
Enam prinsip yang kami pegang
- Batas diuji, bukan dijanjikan: sebuah batas hanya berlaku pada rute tempat seseorang mencoba membobolnya.
- Pengamat berada di luar agen: tidak ada model yang menilai perilakunya sendiri.
- Kegagalan tetap tercatat: run berikutnya menambahkan versi baru dan tidak pernah menggantikan hasil lama.
- Bukti yang sama untuk semua orang: verifikasinya identik di setiap paket. Kami menagih operasi, skala, dan dukungan, tidak pernah kepercayaan itu sendiri.
- Tindakan, bukan pikiran: kami mengamati tindakan dan efek, bukan penalaran, dan kami tidak mengklaim bisa membaca niat.
- Dapat digugat sejak dirancang: siapa saja bisa mereproduksi sebuah hasil, dan siapa saja bisa melaporkan bahwa hasil itu salah.
Yang bukan kami
- Bukan sertifikasi. Laporan hijau tidak membuktikan bahwa sebuah model selaras, dan tidak memberikan izin apa pun.
- Bukan sebuah lembaga. Dua situs web tidak membentuk yayasan maupun dewan independen; tata kelola dan evaluasi yang independen harus datang dari luar kami.
- Bukan pengganti regulasi atau kerja keselamatan laboratorium AI itu sendiri. Ini adalah lapisan yang bisa Anda periksa.
Status saat ini
Beta, dengan Linux dan Docker sebagai backend yang diuji. Setiap hasil membawa tingkatnya — tersimulasi, integrasi nyata, atau tidak dievaluasi — bersama penyebut dan versinya, dan rute yang tidak pernah diuji siapa pun tetap tidak dievaluasi. Pilot dengan tim eksternal dan seremoni persetujuan manusia yang sungguhan menyusul, dan akan dilaporkan dengan cara yang sama.
Bicarakan pilot dengan kami, atau mulailah dari metodenya.
Sumber
- METR — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- TechCrunch — OpenAI releases its official report on the Hugging Face breach (2026-08-26)
- MIT Technology Review — The inside story on why OpenAI agents hacked Hugging Face (2026-08-26)
- Railway — Your AI wants to nuke your database. Guardrails fix that (2026-04-29)
Diakses pada 2026-09-25. Kami mengutipnya sebagai motivasi, bukan sebagai rekonstruksi forensik.