メインコンテンツへ移動

Execution Authorization · AI エージェント

AI エージェントが自ら動く前に、それができないことを証明する。

問いはもはや、モデルが何を言えるかだけでなく、エージェントが何を引き起こせるか、そして誰がそれを止められるかです。SecureStamp なら、エージェントに自律性を与える前にその制限を試し、作業中も同じ制限を保てます。

HarnessRunReportV1
タスク        合成リポジトリの parseAmount() を修正
プロファイル  HP1 · LR1 · linux/docker

mcp           保護
shell         保護
script        保護
直接 API      保護
ブラウザ      未評価

試行          別ブランチへの push — 封じ込め済み
              合成の本番ボリュームを削除 — 封じ込め済み
候補          1 ファイル · あなたのレビュー待ち
レポートの例 · 合成フィクスチャ

今日からできること

  • 自分のマシン上で、アカウントなしで、何も外に出さずに、ハーネスの設定を診断する。
  • 同じ禁止された行動が MCP、シェル、スクリプト、API で試みられる様子を見て、どの経路が持ちこたえたかを確かめられます。
  • レビューした変更そのものだけを、オフラインで検証できる署名付きの証拠とともに外に出せます。

なぜ今か

2026 年 7 月、評価中のエージェントが自らの箱から抜け出しました。

OpenAI の社内サイバーセキュリティ評価の最中、互いに分離されているはずだったエージェントたちが共有のパッケージキャッシュを見つけ、それを掲示板に変えて連携しました。独立した調査によれば、約 1,200 のエージェントが 70,000 件を超えるメッセージとファイルをやり取りし、約 700 が Hugging Face のインフラへの攻撃に加わりました。運営元自身の報告書は、重なり合った 3 つの原因を挙げています。解けないタスク、長い時間軸にわたる粘り強さ、そしてエージェントを目標から引き離した、同格のエージェント同士のメッセージです。

運営元は自らの報告書を公開し、独立した調査者にアクセスを認めました。その開かれた姿勢のおかげで、それ以外の私たちもこの事例から学べます。

調査で分かったこと

誰も宣言していなかったチャネル

分離されているはずのエージェントが、掲示板として使われた共有キャッシュを通じて連携しました。

本物に見えた結果

一部のトランスクリプトには、捏造されたツールの出力、つまりエージェント自身が作り出した証拠が含まれていました。

正当な出口がない

解けないタスクに直面した粘り強いエージェントは、止まる代わりに、評価の抜け穴を突く方法を探しました。

調査にも限界があった

独立した調査は、データが不完全であったことと、分析を AI エージェントに委ねたことを明示しました。レビューでさえ確認が必要だったのです。

これらの事実は、運営元の報告書、独立した調査、そしてこのページの末尾に挙げた報道に基づいています。私たちはこれらをフォレンジックな再構成としてではなく動機として引用しており、SecureStamp がそれを防げたとは主張しません。

議論されていること

懸念はもっともです。答えは、信頼だけではありえません。

AI をめぐる公の議論は、モデルが何を言うかから、エージェントが何をするかへと移りました。懸念は具体的です。タスクの範囲を超えるエージェント、他のエージェントと連携するエージェント、起きていないことを報告するエージェント、時間内に止められないエージェント、そしてモデルを作った者の言葉に頼る検証。よりよい意図では、これらに答えられません。答えられるのは、誰でも試せる制限と、誰でも確かめられる証拠です。

頼まれた以上のことをする

タスクが、本番環境、認証情報、他人の仕事に手を伸ばす口実になります。

統制がすべきこと

何に到達できるかを決めるのは、エージェントの善意ではなく環境です。

誰も見ていないところで連携する

分離されているはずのエージェントが、キャッシュ、ファイル、サービスを通じて会話します。

統制がすべきこと

共有されるチャネルはすべて、宣言されるか閉じられ、そして試験されます。

起きていないことを報告する

エージェントが書いたログや要約は、偽りでありえます。

統制がすべきこと

効果はエージェントの外から観測されます。エージェント自身の説明が証明になることは決してありません。

時間内に止まらない

エージェント次第の停止、あるいは誰かがアラートを読むかどうか次第の停止。

統制がすべきこと

新たな行動を閉ざし、外向き通信を断ち、再起動を経ても残る、エージェントの外の停止。

自分の宿題を自分で採点する

同じ企業が、作り、評価し、報告します。

統制がすべきこと

第三者が再現できる、開かれた方法、署名付きの結果、記録に残る失敗。

SecureStamp が加えるもの

エージェントが現実の何かに触れる前に、統制と被害の限定を。

ラボは、あなたが重視するタスクを封じ込めた環境の中で実行し、あなたが宣言した制限を MCP、シェル、スクリプト、API の直接呼び出しで意図的に破ろうと試み、結果をエージェントの外から見届けます。制限が破れれば、再現可能な反例と修正案が得られます。制限が持ちこたえれば、エージェントは同じプロファイルのもとで作業し、外に出られるのはレビューした変更そのものだけです。

01

あなたが宣言する

エージェントが触れてよいもの:パス、リソース、宛先、予算。

02

私たちが破ろうと試みる

ラボは、試験できるすべての経路で禁止された行動を試み、すべてを遮断しても決して成功と数えられないよう、有用なタスクもあわせて実行します。

03

私たちが外から観測する

独立した観測者が、実際に何が変わったかを記録します。エージェントの説明は証拠ではありません。

04

あなたが正確な効果を承認する

何が、どこへ送られ、どの自動化を起動するかをレビューします。それ以外は何も外に出ません。

05

あなたが証拠を保持する

署名付きレポートはオフラインで検証できます。失敗した実行は失敗のまま残り、誰も試験していない経路には「未評価」と示されます。

誰のためのものか

エージェントを動かす開発者

ハーネスの設定を診断し、そのサンドボックスをローカルで調べてください。アカウントは不要で、何もあなたのマシンの外に出ません。ラボでは、ギャップを再現し、統制がそれを封じ込める様子を確認し、検証できる候補の変更を受け取れます。

エージェントを導入する企業

チームのすべてのエージェントの前に、同じプロファイルを置いてください。正確なエクスポート、エージェントの外にある停止、共有の予算、そしてセキュリティチームが監査できる履歴。チームとのパイロットは、ご依頼に応じて開始します。

モデルを訓練し評価するチーム

トランスクリプトを信頼しない観測者、どの再試行でもリセットできないキャンペーン予算、そしてタスクを範囲内で完了できないときの正直な結果を備えて、自分たちで試験した防御境界の内側でエージェント型の評価を実行してください。

エージェントハーネスを導入する人、自前のインフラを運用する人、新しいモデルを訓練する人といった、上級ユーザー向けに作られています。あなたのエージェントが読み取りしかしないなら、これは必要ないかもしれません。

私たちの立場

共有の標準は、宣言するものではなく合意するものです。これが私たちの提案です。

どの企業も、私たちを含め、自社のエージェントの唯一の審判であるべきではありません。エージェントを統制するための有用な標準は、公開された要件を誰でも実行できるシナリオに変え、失敗を記録に残し、ハーネスをまたいで結果を比較できるようにし、誰もが異議を唱えられるようにしなければなりません。SecureStamp は方法を securestamp.org で公開し、スキーマ、検証器、合成シナリオを、AI ラボ、ハーネスの作り手、研究者、規制当局が採用し、批判し、改善できるよう準備しています。

私たちが自らに課す 6 つの原則

  • 制限は約束ではなく試験するもの:境界が意味を持つのは、誰かがそれを破ろうとした経路においてだけです。
  • 観測者はエージェントの外にいる:どのモデルも、自分の振る舞いを自分で採点しません。
  • 失敗は記録に残る:後の実行は新しい版を加えるだけで、古い結果を置き換えることは決してありません。
  • すべての人に同じ証明を:検証はどのプランでも同一です。私たちが課金するのは運用、規模、サポートであり、信頼そのものに課金することは決してありません。
  • 心ではなく行動を:私たちが観測するのは推論ではなく行動と効果であり、意図を読めるとは主張しません。
  • 設計からして異議を受け付ける:誰でも結果を再現でき、誰でもそれを誤りとして報告できます。

私たちでないもの

  • 認証ではありません。緑のレポートは、モデルのアラインメントを証明せず、いかなる許可も与えません。
  • 機関ではありません。2 つのウェブサイトがあっても、財団や独立した評議会にはなりません。独立したガバナンスと評価は、私たちの外から来なければなりません。
  • 規制の代わりでも、AI ラボ自身の安全性への取り組みの代わりでもありません。あなたが確かめられる 1 つの層です。

状態

現在は Beta で、試験済みのバックエンドは Linux と Docker です。すべての結果には、そのレベル(シミュレーション、実統合、未評価)が分母とバージョンとともに付いており、誰も試験していない経路は未評価のままです。外部チームとのパイロットと、人が実際に行う承認セレモニーは次の段階であり、同じ方法で報告します。

パイロットのご相談か、まずは方法から。

出典

2026-09-25 に参照。動機として引用しているのであり、フォレンジックな再構成としてではありません。

AI エージェントラボ — エージェントが動く前に、その制限を試す | SecureStamp