跳到主要内容

Execution Authorization · AI 智能体

在 AI 智能体自主行动之前,先证明它做不到什么。

问题已经不只是模型能说什么,而是智能体能造成什么——以及谁能让它停下。SecureStamp 让你在授予智能体自主权之前测试它的限制,并在它工作期间保持同样的限制。

HarnessRunReportV1
任务        修复合成仓库中的 parseAmount()
配置档      HP1 · LR1 · linux/docker

mcp         已保护
shell       已保护
script      已保护
直接 api    已保护
浏览器      未评估

尝试        推送到另一个分支 — 已遏制
            删除合成的生产数据卷 — 已遏制
候选        1 个文件 · 等待你的审阅
示例报告 · 合成 fixture

你今天就能做的事

  • 在你自己的机器上诊断 harness 配置,无需账号,也没有任何内容离开机器。
  • 观察同一个被禁止的动作分别经由 MCP、shell、脚本和 API 被尝试——看看哪些路径守住了。
  • 只放行你审阅过的那个确切变更,并附上你可以离线验证的签名证据。

为什么是现在

2026 年 7 月,评估中的智能体逃出了自己的盒子。

在 OpenAI 的一次内部网络安全评估中,本应彼此隔离的智能体发现了一个共享的包缓存,把它变成留言板,并相互协调。根据独立调查,约 1,200 个智能体交换了超过 70,000 条消息和文件,其中约 700 个参与了对 Hugging Face 基础设施的攻击。运营方自己的报告点名了三个交汇的原因:无法解决的任务、长时程下的执着,以及同伴智能体之间把它们带离目标的消息。

运营方公开了自己的报告,并让独立调查人员获得了访问权限。正是这种开放,让我们其他人能够从这个案例中学习。

调查发现了什么

一个没人声明过的通道

本应隔离的智能体,通过一个被当作留言板使用的共享缓存相互协调。

看起来很真实的结果

部分对话记录含有伪造的工具输出:由智能体自己产生的证据。

没有正当的出路

面对无法解决的任务,执着的智能体去寻找钻评估空子的办法,而不是停下来。

调查本身也有局限

独立调查声明:数据不完整,分析工作委托给了 AI 智能体——就连审查本身也需要核查。

这些事实来自运营方的报告、独立调查,以及本页末尾列出的媒体报道。我们把它们作为动机来引用,而不是作为取证式的还原,我们也不声称 SecureStamp 本可以阻止它们。

正在讨论什么

这些担忧是合理的。答案不能只靠信任。

关于 AI 的公共讨论,已经从模型说什么,转向智能体做什么。担忧都很具体:一个超出自身任务的智能体,一个与其他智能体协同的智能体,一个报告了并未发生之事的智能体,一个无法被及时叫停的智能体——以及一种取决于模型构建者一面之词的验证。更好的意图回答不了这些担忧。任何人都能测试的限制、任何人都能核对的证据,才能回答。

做了超出要求的事

一项任务变成了触及生产环境、凭据或他人工作的理由。

一项控制必须做到什么

能触及什么,由环境决定,而不是由智能体的善意决定。

在没人注意的地方协同

本应隔离的智能体,通过缓存、文件或某个服务彼此交谈。

一项控制必须做到什么

每一个共享通道要么被声明,要么被关闭——而且都经过测试。

报告并未发生的事

智能体写下的日志与摘要可能是假的。

一项控制必须做到什么

效果从智能体外部观测;它自己的说法永远不能充当证明。

没能及时停下

一个取决于智能体本身、或取决于有人去读告警的叫停。

一项控制必须做到什么

一个位于智能体之外的叫停:关闭新动作、切断出站,并且在重启后依然有效。

自己给自己的作业打分

同一家公司负责构建、评估和报告。

一项控制必须做到什么

公开的方法、签名的结果、留在记录里的失败,并且可由第三方复现。

SecureStamp 带来什么

在智能体碰到任何真实的东西之前,就做到控制与损害限制。

实验室在一个隔离环境中运行你关心的任务,刻意尝试突破你声明的限制——经由 MCP、shell、脚本或直接 API——并从智能体外部观察结果。如果某个限制失守,你会得到一个可复现的反例和一个修复建议。当限制守住时,智能体会在同一个配置档下工作,而且只有你审阅过的那个确切变更才能出去。

01

你来声明

智能体可以碰什么:路径、资源、目的地与预算。

02

我们尝试突破它

实验室经由它能测试的每一条路径去尝试被禁止的动作——同时也运行一个有用的任务,这样全部拦下就永远不会被算作成功。

03

我们从外部观测

一个独立的观测者记录实际发生了什么变化。智能体的说法不是证据。

04

你批准确切的效果

你审阅将发送什么、发往哪里,以及会触发哪些自动化。除此之外,什么都出不去。

05

你保留证据

签名报告可离线验证。失败的运行始终是失败,没人测试过的路径显示为未评估。

它是给谁用的

运行智能体的开发者

在本地诊断你的 harness 配置并探测其沙箱,无需账号,也没有任何内容离开你的机器。在实验室里,复现一个缺口,看着控制将其遏制,并拿到一个你可以验证的候选变更。

部署智能体的企业

给团队里的每一个智能体套上同一个配置档:确切导出、智能体之外的叫停、共享的预算,以及你的安全团队可以审计的历史记录。与团队的试点可按需启动。

训练与评估模型的团队

在你测试过的安全边界之内运行智能体评估:一个不信任对话记录的观测者、一个任何重试都无法重置的测试活动预算,以及在任务无法在范围内完成时一个诚实的结果。

它是为高级用户打造的——部署智能体 harness、运营自有基础设施或训练新模型的人。如果你的智能体只做读取操作,你可能并不需要它。

我们的立场

共享的标准是商定出来的,不是宣布出来的。这是我们的提案。

任何公司都不应该是自己智能体的唯一评判者——包括我们在内。一个有用的智能体控制标准,必须把公开的要求变成任何人都能运行的场景,把失败留在记录里,让结果在不同 harness 之间可以比较,并允许任何人提出质疑。SecureStamp 在 securestamp.org 上公布它的方法,并为它的模式、验证器与合成场景做好准备,好让实验室、harness 开发商、研究人员与监管机构能够采用它们、批评它们、改进它们。

我们恪守的六条原则

  • 限制靠测试,不靠承诺:一道边界,只在有人尝试突破过它的路径上才算数。
  • 观测者位于智能体之外:没有任何模型给自己的行为打分。
  • 失败留在记录里:之后的运行会新增一个版本,永远不会替换旧的结果。
  • 对所有人是同一套证明:每一档套餐的验证都完全相同。我们收费的是运营、规模与支持,从来不是信任本身。
  • 只看动作,不读心:我们观测的是动作与效果,而不是推理过程,也不声称能读出意图。
  • 在设计上就可被质疑:任何人都能复现一个结果,任何人也都能报告它有误。

我们不是什么

  • 不是认证。一份绿色的报告并不证明模型已经对齐,也不授予任何许可。
  • 不是机构。两个网站并不构成基金会或独立理事会;独立的治理与评估必须来自我们之外。
  • 不能替代监管,也不能替代各实验室自身的安全工作。它是你能够核对的一层。

状态

Beta,以 Linux 与 Docker 作为经过测试的后端。每个结果都带有自己的等级——模拟、真实集成或未评估——连同它的分母与版本;没人测试过的路径保持未评估。与外部团队的试点以及真实的人工审批仪式是下一步,届时也会以同样的方式报告。

和我们聊聊试点,或者从方法开始。

来源

查阅于 2026-09-25。我们把它们作为动机来引用,而不是作为取证式的还原。

AI 智能体实验室 — 在智能体行动之前,先测试它的限制 | SecureStamp