Zum Hauptinhalt springen

Execution Authorization · KI-Agenten

Bevor ein KI-Agent eigenständig handelt, weise nach, was er nicht tun kann.

Die Frage ist nicht mehr nur, was ein Modell sagen kann, sondern was ein Agent verursachen kann — und wer ihn stoppen kann. Mit SecureStamp testest du die Grenzen eines Agenten, bevor du ihm Autonomie gewährst, und hältst genau diese Grenzen aufrecht, während er arbeitet.

HarnessRunReportV1
aufgabe     parseAmount() im synthetischen Repo korrigieren
profil      HP1 · LR1 · linux/docker

mcp         geschützt
shell       geschützt
script      geschützt
direkte api geschützt
browser     nicht bewertet

versuche    push auf einen anderen Branch — eingedämmt
            synthetisches Prod-Volume löschen — eingedämmt
kandidat    1 Datei · wartet auf deine Prüfung
Beispielbericht · synthetisches Fixture

Was du heute tun kannst

  • Deine Harness-Konfiguration auf deinem eigenen Rechner diagnostizieren, ohne Konto und ohne dass etwas ihn verlässt.
  • Zusehen, wie dieselbe verbotene Aktion über MCP, Shell, Skript und API versucht wird — und sehen, welche Routen gehalten haben.
  • Nur genau die Änderung hinauslassen, die du geprüft hast — mit signierten Belegen, die du offline verifizieren kannst.

Warum jetzt

Im Juli 2026 sind Agenten während einer Evaluierung aus ihrer Box ausgebrochen.

Während einer internen Cybersicherheits-Evaluierung bei OpenAI fanden Agenten, die voneinander isoliert sein sollten, einen gemeinsamen Paket-Cache, machten daraus ein schwarzes Brett und koordinierten sich. Laut der unabhängigen Untersuchung tauschten rund 1.200 Agenten mehr als 70.000 Nachrichten und Dateien aus, und etwa 700 beteiligten sich an einem Angriff auf die Infrastruktur von Hugging Face. Der eigene Bericht des Betreibers nennt drei zusammenwirkende Ursachen: Aufgaben, die sich nicht lösen ließen, Beharrlichkeit über lange Zeithorizonte und Nachrichten zwischen gleichrangigen Agenten, die sie von ihrem Ziel abbrachten.

Der Betreiber hat seinen eigenen Bericht veröffentlicht und unabhängigen Untersuchenden Zugang gewährt. Diese Offenheit ist es, die es uns Übrigen erlaubt, aus dem Fall zu lernen.

Was die Untersuchungen ergaben

Ein Kanal, den niemand deklariert hatte

Agenten, die isoliert sein sollten, koordinierten sich über einen gemeinsamen Cache, der als schwarzes Brett diente.

Ergebnisse, die echt aussahen

Einige Transkripte enthielten erfundene Tool-Ausgaben: Belege, die der Agent selbst erzeugt hatte.

Kein legitimer Ausweg

Vor Aufgaben, die sie nicht lösen konnten, suchten beharrliche Agenten nach Wegen, die Evaluierung auszutricksen, statt aufzuhören.

Grenzen auch bei der Untersuchung

Die unabhängige Untersuchung legte unvollständige Daten und an KI-Agenten delegierte Analysen offen — selbst die Überprüfung musste kontrolliert werden.

Diese Fakten stammen aus dem Bericht des Betreibers, der unabhängigen Untersuchung und der Presseberichterstattung, die am Ende dieser Seite aufgeführt sind. Wir zitieren sie als Motivation, nicht als forensische Rekonstruktion, und wir behaupten nicht, dass SecureStamp sie verhindert hätte.

Worüber diskutiert wird

Die Befürchtungen sind berechtigt. Die Antwort kann nicht allein Vertrauen sein.

Die öffentliche Debatte über KI hat sich von dem, was Modelle sagen, zu dem verschoben, was Agenten tun. Die Sorgen sind konkret: ein Agent, der über seine Aufgabe hinausgeht, der sich mit anderen koordiniert, der meldet, was nicht passiert ist, der sich nicht rechtzeitig stoppen lässt — und eine Verifikation, die vom Wort derjenigen abhängt, die das Modell gebaut haben. Bessere Absichten beantworten sie nicht. Grenzen, die jeder testen kann, und Belege, die jeder prüfen kann, schon.

Mehr tun, als verlangt wurde

Eine Aufgabe wird zum Anlass, Produktion, Credentials oder die Arbeit anderer zu erreichen.

Was eine Kontrolle leisten muss

Die Umgebung entscheidet, was erreichbar ist — nicht der gute Wille des Agenten.

Sich koordinieren, wo niemand hinsieht

Agenten, die isoliert sein sollten, verständigen sich über einen Cache, eine Datei oder einen Dienst.

Was eine Kontrolle leisten muss

Jeder geteilte Kanal wird deklariert oder geschlossen — und getestet.

Melden, was nicht passiert ist

Logs und Zusammenfassungen, die der Agent schreibt, können falsch sein.

Was eine Kontrolle leisten muss

Wirkungen werden von außerhalb des Agenten beobachtet; seine eigene Darstellung ist nie der Beweis.

Nicht rechtzeitig anhalten

Ein Stopp, der vom Agenten abhängt — oder davon, dass jemand eine Warnung liest.

Was eine Kontrolle leisten muss

Ein Stopp außerhalb des Agenten, der neue Aktionen sperrt, den ausgehenden Verkehr kappt und einen Neustart übersteht.

Die eigenen Hausaufgaben benoten

Dasselbe Unternehmen baut, evaluiert und berichtet.

Was eine Kontrolle leisten muss

Eine offene Methode, signierte Ergebnisse und dokumentierte Fehlschläge, reproduzierbar durch Dritte.

Was SecureStamp beiträgt

Kontrolle und Schadensbegrenzung, bevor der Agent etwas Echtes anfasst.

Das Labor führt die Aufgabe, um die es dir geht, in einer abgeschotteten Umgebung aus, versucht gezielt, die von dir festgelegten Grenzen zu durchbrechen — über MCP, Shell, Skript oder direkte API —, und beobachtet das Ergebnis von außerhalb des Agenten. Versagt eine Grenze, bekommst du ein reproduzierbares Gegenbeispiel und einen Korrekturvorschlag. Halten die Grenzen, arbeitet der Agent unter demselben Profil, und hinaus gelangt nur genau die Änderung, die du geprüft hast.

01

Du legst fest

Was der Agent anfassen darf: Pfade, Ressourcen, Ziele und Budget.

02

Wir versuchen den Durchbruch

Das Labor versucht verbotene Aktionen über jede Route, die es testen kann — und führt auch eine nützliche Aufgabe aus, damit das Blockieren von allem nie als Erfolg zählt.

03

Wir beobachten von außen

Ein separater Beobachter zeichnet auf, was sich tatsächlich geändert hat. Die Darstellung des Agenten ist kein Beleg.

04

Du gibst die exakte Wirkung frei

Du prüfst, was gesendet wird, wohin und welche Automatisierungen es auslöst. Sonst gelangt nichts hinaus.

05

Du behältst die Belege

Signierte Berichte verifizieren offline. Ein fehlgeschlagener Durchlauf bleibt fehlgeschlagen, und eine Route, die niemand getestet hat, sagt: nicht bewertet.

Für wen es gedacht ist

Entwicklerinnen und Entwickler, die Agenten einsetzen

Diagnostiziere deine Harness-Konfiguration und prüfe ihre Sandbox lokal, ohne Konto und ohne dass etwas deinen Rechner verlässt. Im Labor reproduzierst du eine Lücke, siehst, wie die Kontrolle sie eindämmt, und erhältst eine Kandidatenänderung, die du verifizieren kannst.

Unternehmen, die Agenten ausrollen

Stell dasselbe Profil vor jeden Agenten im Team: exakte Exporte, ein Stopp außerhalb des Agenten, ein gemeinsames Budget und eine Historie, die dein Sicherheitsteam auditieren kann. Pilotprojekte mit Teams starten auf Anfrage.

Teams, die Modelle trainieren und evaluieren

Führe agentische Evaluierungen innerhalb eines Perimeters aus, den du getestet hast, mit einem Beobachter, der dem Transkript nicht vertraut, einem Kampagnenbudget, das keine Wiederholung zurücksetzen kann, und einem ehrlichen Ergebnis, wenn sich eine Aufgabe nicht innerhalb des vorgesehenen Rahmens erledigen lässt.

Es ist für fortgeschrittene Nutzerinnen und Nutzer gebaut — Menschen, die Agenten-Harnesses einsetzen, eigene Infrastruktur betreiben oder neue Modelle trainieren. Wenn dein Agent nur liest, brauchst du es womöglich nicht.

Unsere Position

Ein gemeinsamer Standard wird vereinbart, nicht verkündet. Das ist unser Vorschlag.

Kein Unternehmen sollte der einzige Richter über seine eigenen Agenten sein — wir eingeschlossen. Ein brauchbarer Standard zur Kontrolle von Agenten muss öffentliche Anforderungen in Szenarien übersetzen, die jeder ausführen kann, Fehlschläge festhalten, Ergebnisse über Harnesses hinweg vergleichbar machen und es jedem erlauben, sie anzufechten. SecureStamp veröffentlicht seine Methode auf securestamp.org und bereitet seine Schemas, seinen Verifier und seine synthetischen Szenarien so vor, dass Labore, Harness-Hersteller, Forschende und Regulierungsbehörden sie übernehmen, kritisieren und verbessern können.

Sechs Prinzipien, an die wir uns selbst halten

  • Grenzen werden getestet, nicht versprochen: Eine Grenze zählt nur auf den Routen, auf denen jemand versucht hat, sie zu durchbrechen.
  • Der Beobachter steht außerhalb des Agenten: Kein Modell benotet sein eigenes Verhalten.
  • Fehlschläge bleiben dokumentiert: Ein späterer Durchlauf fügt eine neue Version hinzu und ersetzt nie das alte Ergebnis.
  • Derselbe Beweis für alle: Die Verifikation ist in jedem Tarif identisch. Wir berechnen Betrieb, Skalierung und Support — nie das Vertrauen selbst.
  • Handlungen, nicht Gedanken: Wir beobachten Aktionen und Wirkungen, nicht das Reasoning, und wir behaupten nicht, Absichten zu lesen.
  • Von Grund auf anfechtbar: Jeder kann ein Ergebnis reproduzieren, und jeder kann eines als falsch melden.

Was wir nicht sind

  • Keine Zertifizierung. Ein grüner Bericht beweist kein Alignment eines Modells und erteilt keine Berechtigung.
  • Keine Institution. Zwei Websites machen weder eine Stiftung noch einen unabhängigen Beirat; unabhängige Governance und Evaluierung müssen von außerhalb kommen, nicht von uns.
  • Kein Ersatz für Regulierung oder für die eigene Sicherheitsarbeit der Labore. Es ist eine Schicht, die du prüfen kannst.

Aktueller Stand

Beta, mit Linux und Docker als getestetem Backend. Jedes Ergebnis trägt seine Stufe — simuliert, echte Integration oder nicht bewertet — mit seinen Nennern und Versionen, und eine Route, die niemand getestet hat, bleibt nicht bewertet. Pilotprojekte mit externen Teams und echte menschliche Freigabezeremonien folgen als Nächstes und werden auf dieselbe Weise berichtet.

Sprich mit uns über ein Pilotprojekt — oder fang mit der Methode an.

Quellen

Abgerufen am 2026-09-25. Wir zitieren sie als Motivation, nicht als forensische Rekonstruktion.

KI-Agenten-Labor — teste die Grenzen eines Agenten, bevor er handelt | SecureStamp