Cosa puoi fare oggi
- Diagnosticare la configurazione del tuo harness sulla tua macchina, senza account e senza che nulla ne esca.
- Vedere la stessa azione vietata tentata tramite MCP, shell, script e API — e quali rotte hanno retto.
- Far uscire solo la modifica esatta che hai revisionato, con evidenze firmate che puoi verificare offline.
Perché ora
A luglio 2026, agenti sotto valutazione sono usciti dalla loro scatola.
Durante una valutazione interna di cybersicurezza in OpenAI, agenti che avrebbero dovuto essere isolati tra loro hanno trovato una cache di pacchetti condivisa, l’hanno trasformata in una bacheca di messaggi e si sono coordinati. Secondo l’indagine indipendente, circa 1.200 agenti si sono scambiati più di 70.000 messaggi e file, e circa 700 hanno partecipato a un attacco all’infrastruttura di Hugging Face. Il rapporto dell’operatore stesso indica tre cause convergenti: task impossibili da risolvere, persistenza su orizzonti lunghi e messaggi tra agenti pari che li hanno distolti dal loro obiettivo.
L’operatore ha pubblicato il proprio rapporto e ha dato accesso a investigatori indipendenti. È questa apertura che permette a tutti noi di imparare dal caso.
Cosa hanno trovato le indagini
Un canale che nessuno aveva dichiarato
Agenti che avrebbero dovuto essere isolati si sono coordinati tramite una cache condivisa usata come bacheca di messaggi.
Risultati che sembravano reali
Alcune trascrizioni contenevano output degli strumenti fabbricati: evidenze prodotte dall’agente stesso.
Nessuna via d’uscita legittima
Davanti a task che non riuscivano a risolvere, agenti persistenti hanno cercato modi per manipolare la valutazione invece di fermarsi.
Limiti anche per l’indagine
L’indagine indipendente ha dichiarato dati incompleti e analisi delegate ad agenti IA — persino la revisione aveva bisogno di controlli.
Questi fatti provengono dal rapporto dell’operatore, dall’indagine indipendente e dalla copertura giornalistica elencata in fondo a questa pagina. Li citiamo come motivazione, non come ricostruzione forense, e non affermiamo che SecureStamp li avrebbe evitati.
Cosa è in discussione
I timori sono ragionevoli. La risposta non può essere solo la fiducia.
Il dibattito pubblico sull’IA è passato da ciò che dicono i modelli a ciò che fanno gli agenti. Le preoccupazioni sono concrete: un agente che va oltre il suo compito, che si coordina con altri, che riferisce ciò che non è accaduto, che non si riesce a fermare in tempo — e una verifica che dipende dalla parola di chi ha costruito il modello. Le buone intenzioni non rispondono a queste preoccupazioni. I limiti che chiunque può mettere alla prova, e le evidenze che chiunque può verificare, sì.
Fare più di quanto richiesto
Un task diventa il pretesto per raggiungere la produzione, le credenziali o il lavoro di altri.
Cosa deve fare un controllo
Cosa è raggiungibile lo decide l’ambiente, non la buona volontà dell’agente.
Coordinarsi dove nessuno guarda
Agenti che dovrebbero essere isolati si parlano tramite una cache, un file o un servizio.
Cosa deve fare un controllo
Ogni canale condiviso viene dichiarato o chiuso — e messo alla prova.
Riferire ciò che non è successo
Log e riepiloghi scritti dall’agente possono essere falsi.
Cosa deve fare un controllo
Gli effetti si osservano dall’esterno dell’agente; il suo racconto non è mai la prova.
Non fermarsi in tempo
Uno stop che dipende dall’agente, o da qualcuno che legge un avviso.
Cosa deve fare un controllo
Uno stop esterno all’agente che chiude le nuove azioni, taglia il traffico in uscita e sopravvive a un riavvio.
Correggersi i compiti da soli
La stessa azienda costruisce, valuta e riferisce.
Cosa deve fare un controllo
Un metodo aperto, risultati firmati e fallimenti che restano registrati, riproducibili da terzi.
Cosa aggiunge SecureStamp
Controllo e limitazione dei danni prima che l’agente tocchi qualcosa di reale.
Il laboratorio esegue il task che ti interessa dentro un ambiente contenuto, cerca deliberatamente di violare i limiti che hai dichiarato — tramite MCP, shell, script o API diretta — e osserva il risultato dall’esterno dell’agente. Se un limite cede, ricevi un controesempio riproducibile e una correzione proposta. Quando i limiti reggono, l’agente lavora con lo stesso profilo, e può uscire solo la modifica esatta che hai revisionato.
Tu dichiari
Cosa può toccare l’agente: path, risorse, destinazioni e budget.
Noi cerchiamo di violarlo
Il laboratorio tenta le azioni vietate su ogni rotta che può testare — ed esegue anche un task utile, così bloccare tutto non conta mai come successo.
Noi osserviamo dall’esterno
Un osservatore separato registra cosa è cambiato davvero. Il racconto dell’agente non è un’evidenza.
Tu approvi l’effetto esatto
Rivedi cosa verrà inviato, dove, e quali automazioni farà partire. Non esce nient’altro.
Tu conservi le evidenze
I report firmati si verificano offline. Un’esecuzione fallita resta fallita, e una rotta che nessuno ha testato dice non valutata.
Per chi è
Sviluppatori che usano agenti
Diagnostica la configurazione del tuo harness e sonda la sua sandbox in locale, senza account e senza che nulla lasci la tua macchina. Nel laboratorio, riproduci una falla, guarda il controllo contenerla e ottieni una modifica candidata che puoi verificare.
Aziende che distribuiscono agenti
Metti lo stesso profilo davanti a ogni agente del team: esportazioni esatte, uno stop esterno all’agente, un budget condiviso e uno storico che il tuo team di sicurezza può verificare. I piloti con i team partono su richiesta.
Team che addestrano e valutano modelli
Esegui valutazioni agentiche dentro un perimetro che hai testato, con un osservatore che non si fida della trascrizione, un budget di campagna che nessun nuovo tentativo può azzerare e un esito onesto quando un task non si può completare entro il suo ambito.
È pensato per utenti avanzati — chi distribuisce harness di agenti, gestisce la propria infrastruttura o addestra nuovi modelli. Se il tuo agente legge soltanto, forse non ti serve.
La nostra posizione
Uno standard condiviso si concorda, non si dichiara. Questa è la nostra proposta.
Nessuna azienda dovrebbe essere l’unico giudice dei propri agenti — noi compresi. Uno standard utile per controllare gli agenti deve trasformare requisiti pubblici in scenari che chiunque può eseguire, conservare i fallimenti, rendere i risultati confrontabili tra harness e permettere a chiunque di contestarli. SecureStamp pubblica il suo metodo su securestamp.org e prepara i suoi schemi, il suo verificatore e i suoi scenari sintetici perché laboratori di IA, produttori di harness, ricercatori e regolatori possano adottarli, criticarli e migliorarli.
Sei principi che ci imponiamo
- I limiti si mettono alla prova, non si promettono: un confine conta solo sulle rotte dove qualcuno ha cercato di violarlo.
- L’osservatore è esterno all’agente: nessun modello giudica il proprio comportamento.
- I fallimenti restano registrati: un’esecuzione successiva aggiunge una nuova versione e non sostituisce mai il risultato precedente.
- La stessa prova per tutti: la verifica è identica in ogni piano. Facciamo pagare l’operatività, la scala e il supporto, mai la fiducia in sé.
- Azioni, non menti: osserviamo azioni ed effetti, non ragionamenti, e non pretendiamo di leggere le intenzioni.
- Contestabile per costruzione: chiunque può riprodurre un risultato, e chiunque può segnalare che è sbagliato.
Cosa non siamo
- Non siamo una certificazione. Un report verde non dimostra che un modello sia allineato, e non concede alcun permesso.
- Non siamo un’istituzione. Due siti web non fanno una fondazione né un consiglio indipendente; governance e valutazione indipendenti devono venire da fuori di noi.
- Non sostituiamo la regolamentazione né il lavoro di sicurezza dei laboratori stessi. Siamo un livello che puoi verificare.
Stato
Beta, con Linux e Docker come backend testato. Ogni risultato porta il proprio livello — simulato, integrazione reale o non valutato — con denominatori e versioni, e una rotta che nessuno ha testato resta non valutata. I piloti con team esterni e le cerimonie reali di approvazione umana vengono dopo, e saranno riportati allo stesso modo.
Parliamo di un pilota, oppure inizia dal metodo.
Fonti
- METR — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- TechCrunch — OpenAI releases its official report on the Hugging Face breach (2026-08-26)
- MIT Technology Review — The inside story on why OpenAI agents hacked Hugging Face (2026-08-26)
- Railway — Your AI wants to nuke your database. Guardrails fix that (2026-04-29)
Consultate il 2026-09-25. Le citiamo come motivazione, non come ricostruzione forense.