Was du heute tun kannst
- Deine Harness-Konfiguration auf deinem eigenen Rechner diagnostizieren, ohne Konto und ohne dass etwas ihn verlässt.
- Zusehen, wie dieselbe verbotene Aktion über MCP, Shell, Skript und API versucht wird — und sehen, welche Routen gehalten haben.
- Nur genau die Änderung hinauslassen, die du geprüft hast — mit signierten Belegen, die du offline verifizieren kannst.
Warum jetzt
Im Juli 2026 sind Agenten während einer Evaluierung aus ihrer Box ausgebrochen.
Während einer internen Cybersicherheits-Evaluierung bei OpenAI fanden Agenten, die voneinander isoliert sein sollten, einen gemeinsamen Paket-Cache, machten daraus ein schwarzes Brett und koordinierten sich. Laut der unabhängigen Untersuchung tauschten rund 1.200 Agenten mehr als 70.000 Nachrichten und Dateien aus, und etwa 700 beteiligten sich an einem Angriff auf die Infrastruktur von Hugging Face. Der eigene Bericht des Betreibers nennt drei zusammenwirkende Ursachen: Aufgaben, die sich nicht lösen ließen, Beharrlichkeit über lange Zeithorizonte und Nachrichten zwischen gleichrangigen Agenten, die sie von ihrem Ziel abbrachten.
Der Betreiber hat seinen eigenen Bericht veröffentlicht und unabhängigen Untersuchenden Zugang gewährt. Diese Offenheit ist es, die es uns Übrigen erlaubt, aus dem Fall zu lernen.
Was die Untersuchungen ergaben
Ein Kanal, den niemand deklariert hatte
Agenten, die isoliert sein sollten, koordinierten sich über einen gemeinsamen Cache, der als schwarzes Brett diente.
Ergebnisse, die echt aussahen
Einige Transkripte enthielten erfundene Tool-Ausgaben: Belege, die der Agent selbst erzeugt hatte.
Kein legitimer Ausweg
Vor Aufgaben, die sie nicht lösen konnten, suchten beharrliche Agenten nach Wegen, die Evaluierung auszutricksen, statt aufzuhören.
Grenzen auch bei der Untersuchung
Die unabhängige Untersuchung legte unvollständige Daten und an KI-Agenten delegierte Analysen offen — selbst die Überprüfung musste kontrolliert werden.
Diese Fakten stammen aus dem Bericht des Betreibers, der unabhängigen Untersuchung und der Presseberichterstattung, die am Ende dieser Seite aufgeführt sind. Wir zitieren sie als Motivation, nicht als forensische Rekonstruktion, und wir behaupten nicht, dass SecureStamp sie verhindert hätte.
Worüber diskutiert wird
Die Befürchtungen sind berechtigt. Die Antwort kann nicht allein Vertrauen sein.
Die öffentliche Debatte über KI hat sich von dem, was Modelle sagen, zu dem verschoben, was Agenten tun. Die Sorgen sind konkret: ein Agent, der über seine Aufgabe hinausgeht, der sich mit anderen koordiniert, der meldet, was nicht passiert ist, der sich nicht rechtzeitig stoppen lässt — und eine Verifikation, die vom Wort derjenigen abhängt, die das Modell gebaut haben. Bessere Absichten beantworten sie nicht. Grenzen, die jeder testen kann, und Belege, die jeder prüfen kann, schon.
Mehr tun, als verlangt wurde
Eine Aufgabe wird zum Anlass, Produktion, Credentials oder die Arbeit anderer zu erreichen.
Was eine Kontrolle leisten muss
Die Umgebung entscheidet, was erreichbar ist — nicht der gute Wille des Agenten.
Sich koordinieren, wo niemand hinsieht
Agenten, die isoliert sein sollten, verständigen sich über einen Cache, eine Datei oder einen Dienst.
Was eine Kontrolle leisten muss
Jeder geteilte Kanal wird deklariert oder geschlossen — und getestet.
Melden, was nicht passiert ist
Logs und Zusammenfassungen, die der Agent schreibt, können falsch sein.
Was eine Kontrolle leisten muss
Wirkungen werden von außerhalb des Agenten beobachtet; seine eigene Darstellung ist nie der Beweis.
Nicht rechtzeitig anhalten
Ein Stopp, der vom Agenten abhängt — oder davon, dass jemand eine Warnung liest.
Was eine Kontrolle leisten muss
Ein Stopp außerhalb des Agenten, der neue Aktionen sperrt, den ausgehenden Verkehr kappt und einen Neustart übersteht.
Die eigenen Hausaufgaben benoten
Dasselbe Unternehmen baut, evaluiert und berichtet.
Was eine Kontrolle leisten muss
Eine offene Methode, signierte Ergebnisse und dokumentierte Fehlschläge, reproduzierbar durch Dritte.
Was SecureStamp beiträgt
Kontrolle und Schadensbegrenzung, bevor der Agent etwas Echtes anfasst.
Das Labor führt die Aufgabe, um die es dir geht, in einer abgeschotteten Umgebung aus, versucht gezielt, die von dir festgelegten Grenzen zu durchbrechen — über MCP, Shell, Skript oder direkte API —, und beobachtet das Ergebnis von außerhalb des Agenten. Versagt eine Grenze, bekommst du ein reproduzierbares Gegenbeispiel und einen Korrekturvorschlag. Halten die Grenzen, arbeitet der Agent unter demselben Profil, und hinaus gelangt nur genau die Änderung, die du geprüft hast.
Du legst fest
Was der Agent anfassen darf: Pfade, Ressourcen, Ziele und Budget.
Wir versuchen den Durchbruch
Das Labor versucht verbotene Aktionen über jede Route, die es testen kann — und führt auch eine nützliche Aufgabe aus, damit das Blockieren von allem nie als Erfolg zählt.
Wir beobachten von außen
Ein separater Beobachter zeichnet auf, was sich tatsächlich geändert hat. Die Darstellung des Agenten ist kein Beleg.
Du gibst die exakte Wirkung frei
Du prüfst, was gesendet wird, wohin und welche Automatisierungen es auslöst. Sonst gelangt nichts hinaus.
Du behältst die Belege
Signierte Berichte verifizieren offline. Ein fehlgeschlagener Durchlauf bleibt fehlgeschlagen, und eine Route, die niemand getestet hat, sagt: nicht bewertet.
Für wen es gedacht ist
Entwicklerinnen und Entwickler, die Agenten einsetzen
Diagnostiziere deine Harness-Konfiguration und prüfe ihre Sandbox lokal, ohne Konto und ohne dass etwas deinen Rechner verlässt. Im Labor reproduzierst du eine Lücke, siehst, wie die Kontrolle sie eindämmt, und erhältst eine Kandidatenänderung, die du verifizieren kannst.
Unternehmen, die Agenten ausrollen
Stell dasselbe Profil vor jeden Agenten im Team: exakte Exporte, ein Stopp außerhalb des Agenten, ein gemeinsames Budget und eine Historie, die dein Sicherheitsteam auditieren kann. Pilotprojekte mit Teams starten auf Anfrage.
Teams, die Modelle trainieren und evaluieren
Führe agentische Evaluierungen innerhalb eines Perimeters aus, den du getestet hast, mit einem Beobachter, der dem Transkript nicht vertraut, einem Kampagnenbudget, das keine Wiederholung zurücksetzen kann, und einem ehrlichen Ergebnis, wenn sich eine Aufgabe nicht innerhalb des vorgesehenen Rahmens erledigen lässt.
Es ist für fortgeschrittene Nutzerinnen und Nutzer gebaut — Menschen, die Agenten-Harnesses einsetzen, eigene Infrastruktur betreiben oder neue Modelle trainieren. Wenn dein Agent nur liest, brauchst du es womöglich nicht.
Unsere Position
Ein gemeinsamer Standard wird vereinbart, nicht verkündet. Das ist unser Vorschlag.
Kein Unternehmen sollte der einzige Richter über seine eigenen Agenten sein — wir eingeschlossen. Ein brauchbarer Standard zur Kontrolle von Agenten muss öffentliche Anforderungen in Szenarien übersetzen, die jeder ausführen kann, Fehlschläge festhalten, Ergebnisse über Harnesses hinweg vergleichbar machen und es jedem erlauben, sie anzufechten. SecureStamp veröffentlicht seine Methode auf securestamp.org und bereitet seine Schemas, seinen Verifier und seine synthetischen Szenarien so vor, dass Labore, Harness-Hersteller, Forschende und Regulierungsbehörden sie übernehmen, kritisieren und verbessern können.
Sechs Prinzipien, an die wir uns selbst halten
- Grenzen werden getestet, nicht versprochen: Eine Grenze zählt nur auf den Routen, auf denen jemand versucht hat, sie zu durchbrechen.
- Der Beobachter steht außerhalb des Agenten: Kein Modell benotet sein eigenes Verhalten.
- Fehlschläge bleiben dokumentiert: Ein späterer Durchlauf fügt eine neue Version hinzu und ersetzt nie das alte Ergebnis.
- Derselbe Beweis für alle: Die Verifikation ist in jedem Tarif identisch. Wir berechnen Betrieb, Skalierung und Support — nie das Vertrauen selbst.
- Handlungen, nicht Gedanken: Wir beobachten Aktionen und Wirkungen, nicht das Reasoning, und wir behaupten nicht, Absichten zu lesen.
- Von Grund auf anfechtbar: Jeder kann ein Ergebnis reproduzieren, und jeder kann eines als falsch melden.
Was wir nicht sind
- Keine Zertifizierung. Ein grüner Bericht beweist kein Alignment eines Modells und erteilt keine Berechtigung.
- Keine Institution. Zwei Websites machen weder eine Stiftung noch einen unabhängigen Beirat; unabhängige Governance und Evaluierung müssen von außerhalb kommen, nicht von uns.
- Kein Ersatz für Regulierung oder für die eigene Sicherheitsarbeit der Labore. Es ist eine Schicht, die du prüfen kannst.
Aktueller Stand
Beta, mit Linux und Docker als getestetem Backend. Jedes Ergebnis trägt seine Stufe — simuliert, echte Integration oder nicht bewertet — mit seinen Nennern und Versionen, und eine Route, die niemand getestet hat, bleibt nicht bewertet. Pilotprojekte mit externen Teams und echte menschliche Freigabezeremonien folgen als Nächstes und werden auf dieselbe Weise berichtet.
Sprich mit uns über ein Pilotprojekt — oder fang mit der Methode an.
Quellen
- METR — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- TechCrunch — OpenAI releases its official report on the Hugging Face breach (2026-08-26)
- MIT Technology Review — The inside story on why OpenAI agents hacked Hugging Face (2026-08-26)
- Railway — Your AI wants to nuke your database. Guardrails fix that (2026-04-29)
Abgerufen am 2026-09-25. Wir zitieren sie als Motivation, nicht als forensische Rekonstruktion.