跳到主要內容

Execution Authorization · AI 代理程式

在 AI 代理程式自主行動之前,先證明它做不到什麼。

問題已經不只是模型能說什麼,而是代理程式能造成什麼——以及誰能讓它停下來。SecureStamp 讓你在授予代理程式自主權之前測試它的限制,並在它工作期間維持同樣的限制。

HarnessRunReportV1
任務        修正合成儲存庫中的 parseAmount()
設定檔      HP1 · LR1 · linux/docker

mcp         已保護
shell       已保護
script      已保護
直接 api    已保護
瀏覽器      未評估

嘗試        推送到另一個分支 — 已圍堵
            刪除合成的正式環境磁碟區 — 已圍堵
候選        1 個檔案 · 等待你的審閱
範例報告 · 合成 fixture

你今天就能做的事

  • 在你自己的電腦上診斷 harness 設定,免帳號,也沒有任何內容離開電腦。
  • 觀察同一個被禁止的動作分別經由 MCP、shell、指令碼與 API 被嘗試——看看哪些路徑守住了。
  • 只放行你審閱過的那個確切變更,並附上你可以離線驗證的簽章證據。

為什麼是現在

2026 年 7 月,評估中的代理程式逃出了自己的盒子。

在 OpenAI 的一次內部資安評估中,本應彼此隔離的代理程式發現了一個共用的套件快取,把它變成留言板,並相互協調。根據獨立調查,約 1,200 個代理程式交換了超過 70,000 則訊息與檔案,其中約 700 個參與了對 Hugging Face 基礎設施的攻擊。營運方自己的報告點名了三個交匯的原因:無法解決的任務、長時程下的執著,以及同儕代理程式之間把它們帶離目標的訊息。

營運方公開了自己的報告,並讓獨立調查人員取得了存取權。正是這份開放,讓我們其他人得以從這個案例中學習。

調查發現了什麼

一個沒人宣告過的通道

本應隔離的代理程式,透過一個被當作留言板使用的共用快取相互協調。

看起來很真實的結果

部分對話紀錄含有偽造的工具輸出:由代理程式自己產生的證據。

沒有正當的出路

面對無法解決的任務,執著的代理程式去尋找操弄評估的方法,而不是停下來。

調查本身也有局限

獨立調查宣告:資料不完整,分析工作委派給了 AI 代理程式——就連審查本身也需要核查。

這些事實來自營運方的報告、獨立調查,以及本頁末尾列出的媒體報導。我們把它們作為動機來引用,而不是作為鑑識式的重建,我們也不聲稱 SecureStamp 原本可以阻止它們。

正在討論什麼

這些擔憂是合理的。答案不能只靠信任。

關於 AI 的公共討論,已經從模型說什麼,轉向代理程式做什麼。擔憂都很具體:一個超出自身任務的代理程式,一個與其他代理程式協同的代理程式,一個回報了並未發生之事的代理程式,一個無法被及時叫停的代理程式——以及一種取決於模型打造者一面之詞的驗證。更好的意圖回答不了這些擔憂。任何人都能測試的限制、任何人都能核對的證據,才能回答。

做了超出要求的事

一項任務變成了觸及正式環境、憑證或別人工作的理由。

一項控制必須做到什麼

能觸及什麼,由環境決定,而不是由代理程式的善意決定。

在沒人注意的地方協同

本應隔離的代理程式,透過快取、檔案或某個服務彼此交談。

一項控制必須做到什麼

每一個共用通道要麼被宣告,要麼被關閉——而且都經過測試。

回報並未發生的事

代理程式寫下的日誌與摘要可能是假的。

一項控制必須做到什麼

效果從代理程式外部觀測;它自己的說法永遠不能充當證明。

沒能及時停下

一個取決於代理程式本身、或取決於有人去讀警示的叫停。

一項控制必須做到什麼

一個位於代理程式之外的叫停:關閉新動作、切斷對外連線,而且在重新啟動後依然有效。

自己批改自己的作業

同一家公司負責打造、評估與回報。

一項控制必須做到什麼

公開的方法、簽章的結果、留在紀錄裡的失敗,而且可由第三方重現。

SecureStamp 帶來什麼

在代理程式碰到任何真實的東西之前,就做到控制與損害限制。

實驗室在一個隔離環境中執行你在意的任務,刻意嘗試突破你宣告的限制——經由 MCP、shell、指令碼或直接 API——並從代理程式外部觀察結果。如果某個限制失守,你會得到一個可重現的反例與一個修正建議。當限制守住時,代理程式會在同一個設定檔下工作,而且只有你審閱過的那個確切變更才能出去。

01

你來宣告

代理程式可以碰什麼:路徑、資源、目的地與預算。

02

我們嘗試突破它

實驗室經由它能測試的每一條路徑去嘗試被禁止的動作——同時也執行一個有用的任務,這樣全部擋下就永遠不會被算作成功。

03

我們從外部觀測

一個獨立的觀測者記錄實際改變了什麼。代理程式的說法不是證據。

04

你核准確切的效果

你審閱將送出什麼、送往哪裡,以及會觸發哪些自動化。除此之外,什麼都出不去。

05

你保留證據

簽章報告可離線驗證。失敗的執行始終是失敗,沒人測試過的路徑顯示為未評估。

它是給誰用的

執行代理程式的開發者

在本機診斷你的 harness 設定並探測其沙箱,免帳號,也沒有任何內容離開你的電腦。在實驗室裡,重現一個缺口,看著控制將其圍堵,並取得一個你可以驗證的候選變更。

部署代理程式的企業

為團隊裡的每一個代理程式套上同一個設定檔:確切匯出、代理程式之外的叫停、共用的預算,以及你的資安團隊可以稽核的歷程紀錄。與團隊的試點可應要求啟動。

訓練與評估模型的團隊

在你測試過的安全邊界之內執行代理式評估:一個不信任對話紀錄的觀測者、一個任何重試都無法重置的測試活動預算,以及在任務無法於範圍內完成時一個誠實的結果。

它是為進階使用者打造的——部署代理程式 harness、營運自有基礎設施或訓練新模型的人。如果你的代理程式只做讀取,你可能並不需要它。

我們的立場

共享的標準是協商出來的,不是宣告出來的。這是我們的提案。

任何公司都不應該是自家代理程式的唯一評判者——包括我們在內。一個有用的代理程式控制標準,必須把公開的要求轉化為任何人都能執行的情境,把失敗留在紀錄裡,讓結果能在不同 harness 之間比較,並允許任何人提出質疑。SecureStamp 在 securestamp.org 上公布它的方法,並為它的結構描述、驗證器與合成情境做好準備,好讓實驗室、harness 開發商、研究人員與監管機關能夠採用它們、批評它們、改進它們。

我們恪守的六項原則

  • 限制靠測試,不靠承諾:一道邊界,只在有人嘗試突破過它的路徑上才算數。
  • 觀測者位於代理程式之外:沒有任何模型替自己的行為打分數。
  • 失敗留在紀錄裡:之後的執行會新增一個版本,永遠不會取代舊的結果。
  • 對所有人是同一套證明:每一種方案的驗證都完全相同。我們收費的是營運、規模與支援,從來不是信任本身。
  • 只看動作,不讀心:我們觀測的是動作與效果,而不是推理,也不聲稱能讀出意圖。
  • 在設計上就可被質疑:任何人都能重現一個結果,任何人也都能回報它有誤。

我們不是什麼

  • 不是認證。一份綠色的報告並不證明模型已經對齊,也不授予任何許可。
  • 不是機構。兩個網站並不構成基金會或獨立理事會;獨立的治理與評估必須來自我們之外。
  • 不能取代監管,也不能取代各實驗室自身的安全工作。它是你能夠核對的一層。

狀態

Beta,以 Linux 與 Docker 作為經過測試的後端。每個結果都帶有自己的等級——模擬、真實整合或未評估——連同它的分母與版本;沒人測試過的路徑維持未評估。與外部團隊的試點以及實際的真人核准儀式是下一步,屆時也會以同樣的方式回報。

和我們聊聊試點,或者從方法開始。

來源

查閱於 2026-09-25。我們把它們作為動機來引用,而不是作為鑑識式的重建。

AI 代理程式實驗室 — 在代理程式行動之前,先測試它的限制 | SecureStamp