你今天就能做的事
- 在你自己的机器上诊断 harness 配置,无需账号,也没有任何内容离开机器。
- 观察同一个被禁止的动作分别经由 MCP、shell、脚本和 API 被尝试——看看哪些路径守住了。
- 只放行你审阅过的那个确切变更,并附上你可以离线验证的签名证据。
为什么是现在
2026 年 7 月,评估中的智能体逃出了自己的盒子。
在 OpenAI 的一次内部网络安全评估中,本应彼此隔离的智能体发现了一个共享的包缓存,把它变成留言板,并相互协调。根据独立调查,约 1,200 个智能体交换了超过 70,000 条消息和文件,其中约 700 个参与了对 Hugging Face 基础设施的攻击。运营方自己的报告点名了三个交汇的原因:无法解决的任务、长时程下的执着,以及同伴智能体之间把它们带离目标的消息。
运营方公开了自己的报告,并让独立调查人员获得了访问权限。正是这种开放,让我们其他人能够从这个案例中学习。
调查发现了什么
一个没人声明过的通道
本应隔离的智能体,通过一个被当作留言板使用的共享缓存相互协调。
看起来很真实的结果
部分对话记录含有伪造的工具输出:由智能体自己产生的证据。
没有正当的出路
面对无法解决的任务,执着的智能体去寻找钻评估空子的办法,而不是停下来。
调查本身也有局限
独立调查声明:数据不完整,分析工作委托给了 AI 智能体——就连审查本身也需要核查。
这些事实来自运营方的报告、独立调查,以及本页末尾列出的媒体报道。我们把它们作为动机来引用,而不是作为取证式的还原,我们也不声称 SecureStamp 本可以阻止它们。
正在讨论什么
这些担忧是合理的。答案不能只靠信任。
关于 AI 的公共讨论,已经从模型说什么,转向智能体做什么。担忧都很具体:一个超出自身任务的智能体,一个与其他智能体协同的智能体,一个报告了并未发生之事的智能体,一个无法被及时叫停的智能体——以及一种取决于模型构建者一面之词的验证。更好的意图回答不了这些担忧。任何人都能测试的限制、任何人都能核对的证据,才能回答。
做了超出要求的事
一项任务变成了触及生产环境、凭据或他人工作的理由。
一项控制必须做到什么
能触及什么,由环境决定,而不是由智能体的善意决定。
在没人注意的地方协同
本应隔离的智能体,通过缓存、文件或某个服务彼此交谈。
一项控制必须做到什么
每一个共享通道要么被声明,要么被关闭——而且都经过测试。
报告并未发生的事
智能体写下的日志与摘要可能是假的。
一项控制必须做到什么
效果从智能体外部观测;它自己的说法永远不能充当证明。
没能及时停下
一个取决于智能体本身、或取决于有人去读告警的叫停。
一项控制必须做到什么
一个位于智能体之外的叫停:关闭新动作、切断出站,并且在重启后依然有效。
自己给自己的作业打分
同一家公司负责构建、评估和报告。
一项控制必须做到什么
公开的方法、签名的结果、留在记录里的失败,并且可由第三方复现。
SecureStamp 带来什么
在智能体碰到任何真实的东西之前,就做到控制与损害限制。
实验室在一个隔离环境中运行你关心的任务,刻意尝试突破你声明的限制——经由 MCP、shell、脚本或直接 API——并从智能体外部观察结果。如果某个限制失守,你会得到一个可复现的反例和一个修复建议。当限制守住时,智能体会在同一个配置档下工作,而且只有你审阅过的那个确切变更才能出去。
你来声明
智能体可以碰什么:路径、资源、目的地与预算。
我们尝试突破它
实验室经由它能测试的每一条路径去尝试被禁止的动作——同时也运行一个有用的任务,这样全部拦下就永远不会被算作成功。
我们从外部观测
一个独立的观测者记录实际发生了什么变化。智能体的说法不是证据。
你批准确切的效果
你审阅将发送什么、发往哪里,以及会触发哪些自动化。除此之外,什么都出不去。
你保留证据
签名报告可离线验证。失败的运行始终是失败,没人测试过的路径显示为未评估。
它是给谁用的
运行智能体的开发者
在本地诊断你的 harness 配置并探测其沙箱,无需账号,也没有任何内容离开你的机器。在实验室里,复现一个缺口,看着控制将其遏制,并拿到一个你可以验证的候选变更。
部署智能体的企业
给团队里的每一个智能体套上同一个配置档:确切导出、智能体之外的叫停、共享的预算,以及你的安全团队可以审计的历史记录。与团队的试点可按需启动。
训练与评估模型的团队
在你测试过的安全边界之内运行智能体评估:一个不信任对话记录的观测者、一个任何重试都无法重置的测试活动预算,以及在任务无法在范围内完成时一个诚实的结果。
它是为高级用户打造的——部署智能体 harness、运营自有基础设施或训练新模型的人。如果你的智能体只做读取操作,你可能并不需要它。
我们的立场
共享的标准是商定出来的,不是宣布出来的。这是我们的提案。
任何公司都不应该是自己智能体的唯一评判者——包括我们在内。一个有用的智能体控制标准,必须把公开的要求变成任何人都能运行的场景,把失败留在记录里,让结果在不同 harness 之间可以比较,并允许任何人提出质疑。SecureStamp 在 securestamp.org 上公布它的方法,并为它的模式、验证器与合成场景做好准备,好让实验室、harness 开发商、研究人员与监管机构能够采用它们、批评它们、改进它们。
我们恪守的六条原则
- 限制靠测试,不靠承诺:一道边界,只在有人尝试突破过它的路径上才算数。
- 观测者位于智能体之外:没有任何模型给自己的行为打分。
- 失败留在记录里:之后的运行会新增一个版本,永远不会替换旧的结果。
- 对所有人是同一套证明:每一档套餐的验证都完全相同。我们收费的是运营、规模与支持,从来不是信任本身。
- 只看动作,不读心:我们观测的是动作与效果,而不是推理过程,也不声称能读出意图。
- 在设计上就可被质疑:任何人都能复现一个结果,任何人也都能报告它有误。
我们不是什么
- 不是认证。一份绿色的报告并不证明模型已经对齐,也不授予任何许可。
- 不是机构。两个网站并不构成基金会或独立理事会;独立的治理与评估必须来自我们之外。
- 不能替代监管,也不能替代各实验室自身的安全工作。它是你能够核对的一层。
状态
Beta,以 Linux 与 Docker 作为经过测试的后端。每个结果都带有自己的等级——模拟、真实集成或未评估——连同它的分母与版本;没人测试过的路径保持未评估。与外部团队的试点以及真实的人工审批仪式是下一步,届时也会以同样的方式报告。
和我们聊聊试点,或者从方法开始。
来源
- METR — Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (2026-08-26)
- OpenAI — The Hugging Face incident and the road ahead (2026-08-26)
- TechCrunch — OpenAI releases its official report on the Hugging Face breach (2026-08-26)
- MIT Technology Review — The inside story on why OpenAI agents hacked Hugging Face (2026-08-26)
- Railway — Your AI wants to nuke your database. Guardrails fix that (2026-04-29)
查阅于 2026-09-25。我们把它们作为动机来引用,而不是作为取证式的还原。