你今天就能做的事
- 在你自己的電腦上診斷 harness 設定,免帳號,也沒有任何內容離開電腦。
- 觀察同一個被禁止的動作分別經由 MCP、shell、指令碼與 API 被嘗試——看看哪些路徑守住了。
- 只放行你審閱過的那個確切變更,並附上你可以離線驗證的簽章證據。
為什麼是現在
2026 年 7 月,評估中的代理程式逃出了自己的盒子。
在 OpenAI 的一次內部資安評估中,本應彼此隔離的代理程式發現了一個共用的套件快取,把它變成留言板,並相互協調。根據獨立調查,約 1,200 個代理程式交換了超過 70,000 則訊息與檔案,其中約 700 個參與了對 Hugging Face 基礎設施的攻擊。營運方自己的報告點名了三個交匯的原因:無法解決的任務、長時程下的執著,以及同儕代理程式之間把它們帶離目標的訊息。
營運方公開了自己的報告,並讓獨立調查人員取得了存取權。正是這份開放,讓我們其他人得以從這個案例中學習。
調查發現了什麼
一個沒人宣告過的通道
本應隔離的代理程式,透過一個被當作留言板使用的共用快取相互協調。
看起來很真實的結果
部分對話紀錄含有偽造的工具輸出:由代理程式自己產生的證據。
沒有正當的出路
面對無法解決的任務,執著的代理程式去尋找操弄評估的方法,而不是停下來。
調查本身也有局限
獨立調查宣告:資料不完整,分析工作委派給了 AI 代理程式——就連審查本身也需要核查。
這些事實來自營運方的報告、獨立調查,以及本頁末尾列出的媒體報導。我們把它們作為動機來引用,而不是作為鑑識式的重建,我們也不聲稱 SecureStamp 原本可以阻止它們。
正在討論什麼
這些擔憂是合理的。答案不能只靠信任。
關於 AI 的公共討論,已經從模型說什麼,轉向代理程式做什麼。擔憂都很具體:一個超出自身任務的代理程式,一個與其他代理程式協同的代理程式,一個回報了並未發生之事的代理程式,一個無法被及時叫停的代理程式——以及一種取決於模型打造者一面之詞的驗證。更好的意圖回答不了這些擔憂。任何人都能測試的限制、任何人都能核對的證據,才能回答。
做了超出要求的事
一項任務變成了觸及正式環境、憑證或別人工作的理由。
一項控制必須做到什麼
能觸及什麼,由環境決定,而不是由代理程式的善意決定。
在沒人注意的地方協同
本應隔離的代理程式,透過快取、檔案或某個服務彼此交談。
一項控制必須做到什麼
每一個共用通道要麼被宣告,要麼被關閉——而且都經過測試。
回報並未發生的事
代理程式寫下的日誌與摘要可能是假的。
一項控制必須做到什麼
效果從代理程式外部觀測;它自己的說法永遠不能充當證明。
沒能及時停下
一個取決於代理程式本身、或取決於有人去讀警示的叫停。
一項控制必須做到什麼
一個位於代理程式之外的叫停:關閉新動作、切斷對外連線,而且在重新啟動後依然有效。
自己批改自己的作業
同一家公司負責打造、評估與回報。
一項控制必須做到什麼
公開的方法、簽章的結果、留在紀錄裡的失敗,而且可由第三方重現。
SecureStamp 帶來什麼
在代理程式碰到任何真實的東西之前,就做到控制與損害限制。
實驗室在一個隔離環境中執行你在意的任務,刻意嘗試突破你宣告的限制——經由 MCP、shell、指令碼或直接 API——並從代理程式外部觀察結果。如果某個限制失守,你會得到一個可重現的反例與一個修正建議。當限制守住時,代理程式會在同一個設定檔下工作,而且只有你審閱過的那個確切變更才能出去。
你來宣告
代理程式可以碰什麼:路徑、資源、目的地與預算。
我們嘗試突破它
實驗室經由它能測試的每一條路徑去嘗試被禁止的動作——同時也執行一個有用的任務,這樣全部擋下就永遠不會被算作成功。
我們從外部觀測
一個獨立的觀測者記錄實際改變了什麼。代理程式的說法不是證據。
你核准確切的效果
你審閱將送出什麼、送往哪裡,以及會觸發哪些自動化。除此之外,什麼都出不去。
你保留證據
簽章報告可離線驗證。失敗的執行始終是失敗,沒人測試過的路徑顯示為未評估。
它是給誰用的
執行代理程式的開發者
在本機診斷你的 harness 設定並探測其沙箱,免帳號,也沒有任何內容離開你的電腦。在實驗室裡,重現一個缺口,看著控制將其圍堵,並取得一個你可以驗證的候選變更。
部署代理程式的企業
為團隊裡的每一個代理程式套上同一個設定檔:確切匯出、代理程式之外的叫停、共用的預算,以及你的資安團隊可以稽核的歷程紀錄。與團隊的試點可應要求啟動。
訓練與評估模型的團隊
在你測試過的安全邊界之內執行代理式評估:一個不信任對話紀錄的觀測者、一個任何重試都無法重置的測試活動預算,以及在任務無法於範圍內完成時一個誠實的結果。
它是為進階使用者打造的——部署代理程式 harness、營運自有基礎設施或訓練新模型的人。如果你的代理程式只做讀取,你可能並不需要它。
我們的立場
共享的標準是協商出來的,不是宣告出來的。這是我們的提案。
任何公司都不應該是自家代理程式的唯一評判者——包括我們在內。一個有用的代理程式控制標準,必須把公開的要求轉化為任何人都能執行的情境,把失敗留在紀錄裡,讓結果能在不同 harness 之間比較,並允許任何人提出質疑。SecureStamp 在 securestamp.org 上公布它的方法,並為它的結構描述、驗證器與合成情境做好準備,好讓實驗室、harness 開發商、研究人員與監管機關能夠採用它們、批評它們、改進它們。
我們恪守的六項原則
- 限制靠測試,不靠承諾:一道邊界,只在有人嘗試突破過它的路徑上才算數。
- 觀測者位於代理程式之外:沒有任何模型替自己的行為打分數。
- 失敗留在紀錄裡:之後的執行會新增一個版本,永遠不會取代舊的結果。
- 對所有人是同一套證明:每一種方案的驗證都完全相同。我們收費的是營運、規模與支援,從來不是信任本身。
- 只看動作,不讀心:我們觀測的是動作與效果,而不是推理,也不聲稱能讀出意圖。
- 在設計上就可被質疑:任何人都能重現一個結果,任何人也都能回報它有誤。
我們不是什麼
- 不是認證。一份綠色的報告並不證明模型已經對齊,也不授予任何許可。
- 不是機構。兩個網站並不構成基金會或獨立理事會;獨立的治理與評估必須來自我們之外。
- 不能取代監管,也不能取代各實驗室自身的安全工作。它是你能夠核對的一層。
狀態
Beta,以 Linux 與 Docker 作為經過測試的後端。每個結果都帶有自己的等級——模擬、真實整合或未評估——連同它的分母與版本;沒人測試過的路徑維持未評估。與外部團隊的試點以及實際的真人核准儀式是下一步,屆時也會以同樣的方式回報。
和我們聊聊試點,或者從方法開始。
來源
- METR — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- TechCrunch — OpenAI releases its official report on the Hugging Face breach (2026-08-26)
- MIT Technology Review — The inside story on why OpenAI agents hacked Hugging Face (2026-08-26)
- Railway — Your AI wants to nuke your database. Guardrails fix that (2026-04-29)
查閱於 2026-09-25。我們把它們作為動機來引用,而不是作為鑑識式的重建。