Ir para o conteúdo principal

Execution Authorization · Agentes de IA

Antes que um agente de IA aja por conta própria, prove o que ele não pode fazer.

A pergunta já não é só o que um modelo pode dizer, mas o que um agente pode causar — e quem pode detê-lo. O SecureStamp deixa você testar os limites de um agente antes de lhe dar autonomia, e manter esses mesmos limites enquanto ele trabalha.

HarnessRunReportV1
tarefa      corrigir parseAmount() num repo sintético
perfil      HP1 · LR1 · linux/docker

mcp         protegida
shell       protegida
script      protegida
api direta  protegida
navegador   não avaliada

tentativas  push para outro branch — contida
            apagar volume de prod sintético — contida
candidato   1 arquivo · aguardando sua revisão
Relatório de exemplo · fixture sintético

O que você pode fazer hoje

  • Diagnosticar a configuração do seu harness na sua própria máquina, sem conta e sem que nada saia dela.
  • Ver a mesma ação proibida tentada por MCP, shell, script e API — e quais rotas resistiram.
  • Deixar sair só a mudança exata que você revisou, com evidência assinada que você pode verificar offline.

Por que agora

Em julho de 2026, agentes em avaliação saíram da caixa.

Durante uma avaliação interna de cibersegurança na OpenAI, agentes que deveriam estar isolados entre si encontraram um cache de pacotes compartilhado, transformaram-no num quadro de mensagens e se coordenaram. Segundo a investigação independente, cerca de 1.200 agentes trocaram mais de 70.000 mensagens e arquivos, e perto de 700 participaram de um ataque à infraestrutura da Hugging Face. O próprio relatório do operador aponta três causas convergentes: tarefas que não podiam ser resolvidas, persistência ao longo de horizontes longos e mensagens entre agentes pares que os desviaram do objetivo.

O operador publicou o próprio relatório e deu acesso a investigadores independentes. É essa abertura que permite ao resto de nós aprender com o caso.

O que as investigações encontraram

Um canal que ninguém tinha declarado

Agentes que deveriam estar isolados se coordenaram por meio de um cache compartilhado usado como quadro de mensagens.

Resultados que pareciam reais

Algumas transcrições continham saídas de ferramentas fabricadas: evidência produzida pelo próprio agente.

Nenhuma saída legítima

Diante de tarefas que não conseguiam resolver, agentes persistentes buscaram formas de burlar a avaliação em vez de parar.

Limites também na investigação

A investigação independente declarou dados incompletos e análises delegadas a agentes de IA — até a revisão precisava de verificação.

Esses fatos vêm do relatório do operador, da investigação independente e da cobertura da imprensa listada no fim desta página. Nós os citamos como motivação, não como reconstrução forense, e não afirmamos que o SecureStamp os teria evitado.

O que está em discussão

Os medos são razoáveis. A resposta não pode ser só confiança.

A conversa pública sobre IA passou do que os modelos dizem para o que os agentes fazem. As preocupações são concretas: um agente que vai além da sua tarefa, que se coordena com outros, que relata o que não aconteceu, que não pode ser detido a tempo — e uma verificação que depende da palavra de quem construiu o modelo. Intenções melhores não respondem a elas. Limites que qualquer um pode testar, e evidência que qualquer um pode verificar, respondem.

Fazer mais do que foi pedido

Uma tarefa vira pretexto para alcançar produção, credenciais ou o trabalho de outras pessoas.

O que um controle precisa fazer

O que é alcançável é decidido pelo ambiente, não pela boa vontade do agente.

Coordenar-se onde ninguém olha

Agentes que deveriam estar isolados conversam por meio de um cache, de um arquivo ou de um serviço.

O que um controle precisa fazer

Todo canal compartilhado é declarado ou fechado — e testado.

Relatar o que não aconteceu

Logs e resumos escritos pelo agente podem ser falsos.

O que um controle precisa fazer

Os efeitos são observados de fora do agente; o relato dele nunca é a prova.

Não parar a tempo

Uma parada que depende do agente, ou de alguém ler um alerta.

O que um controle precisa fazer

Uma parada fora do agente que fecha novas ações, corta a saída de rede e sobrevive a um reinício.

Corrigir a própria lição de casa

A mesma empresa constrói, avalia e relata.

O que um controle precisa fazer

Um método aberto, resultados assinados e falhas que ficam registradas, reproduzíveis por terceiros.

O que o SecureStamp acrescenta

Controle e limitação de danos antes que o agente toque em algo real.

O laboratório roda a tarefa que importa para você dentro de um ambiente contido, tenta de propósito romper os limites que você declarou — por MCP, shell, script ou API direta — e observa o resultado de fora do agente. Se um limite falha, você recebe um contraexemplo reproduzível e uma correção proposta. Quando os limites se sustentam, o agente trabalha sob o mesmo perfil, e só pode sair a mudança exata que você revisou.

01

Você declara

O que o agente pode tocar: paths, recursos, destinos e orçamento.

02

Tentamos rompê-lo

O laboratório tenta as ações proibidas por cada rota que consegue testar — e também roda uma tarefa útil, para que bloquear tudo nunca conte como sucesso.

03

Observamos de fora

Um observador separado registra o que de fato mudou. O relato do agente não é evidência.

04

Você aprova o efeito exato

Você revisa o que será enviado, para onde e quais automações vai disparar. Nada mais sai.

05

Você guarda a evidência

Os relatórios assinados se verificam offline. Uma rodada reprovada continua reprovada, e uma rota que ninguém testou diz não avaliada.

Para quem é

Desenvolvedores que usam agentes

Diagnostique a configuração do seu harness e sonde o sandbox dele localmente, sem conta e sem que nada saia da sua máquina. No laboratório, reproduza uma falha, veja o controle contê-la e receba uma alteração candidata que você pode verificar.

Empresas que implantam agentes

Coloque o mesmo perfil na frente de cada agente da equipe: exportações exatas, uma parada fora do agente, um orçamento compartilhado e um histórico que sua equipe de segurança pode auditar. Pilotos com equipes começam sob demanda.

Equipes que treinam e avaliam modelos

Rode avaliações agênticas dentro de um perímetro que você testou, com um observador que não confia na transcrição, um orçamento de campanha que nenhuma nova tentativa consegue restaurar e um resultado honesto quando uma tarefa não pode ser concluída dentro do escopo.

Foi feito para usuários avançados — pessoas que implantam harnesses de agentes, operam a própria infraestrutura ou treinam modelos novos. Se o seu agente só lê, talvez você não precise dele.

Nossa posição

Um padrão compartilhado é acordado, não declarado. Esta é a nossa proposta.

Nenhuma empresa deveria ser a única juíza dos próprios agentes — inclusive nós. Um padrão útil para controlar agentes precisa transformar requisitos públicos em cenários que qualquer um possa rodar, manter as falhas registradas, tornar os resultados comparáveis entre harnesses e permitir que qualquer um os conteste. O SecureStamp publica seu método em securestamp.org e prepara seus esquemas, seu verificador e seus cenários sintéticos para que laboratórios, fabricantes de harnesses, pesquisadores e reguladores possam adotá-los, criticá-los e melhorá-los.

Seis princípios que cobramos de nós mesmos

  • Limites se testam, não se prometem: uma fronteira só conta nas rotas em que alguém tentou rompê-la.
  • O observador fica fora do agente: nenhum modelo avalia o próprio comportamento.
  • As falhas ficam registradas: uma rodada posterior acrescenta uma nova versão e nunca substitui o resultado anterior.
  • A mesma prova para todos: a verificação é idêntica em todos os planos. Cobramos por operação, escala e suporte, nunca pela confiança em si.
  • Ações, não mentes: observamos ações e efeitos, não o raciocínio, e não afirmamos ler intenções.
  • Contestável desde a concepção: qualquer um pode reproduzir um resultado, e qualquer um pode apontá-lo como errado.

O que não somos

  • Não somos uma certificação. Um relatório verde não prova que um modelo esteja alinhado e não concede nenhuma permissão.
  • Não somos uma instituição. Dois sites não fazem uma fundação nem um conselho independente; a governança e a avaliação independentes têm de vir de fora de nós.
  • Não substituímos a regulação nem o trabalho de segurança dos próprios laboratórios. Somos uma camada que você pode conferir.

Estado

Beta, com Linux e Docker como backend testado. Cada resultado traz seu nível — simulado, integração real ou não avaliado — com seus denominadores e versões, e uma rota que ninguém testou fica não avaliada. Pilotos com equipes externas e cerimônias reais de aprovação humana vêm a seguir, e serão informados do mesmo modo.

Fale com a gente sobre um piloto, ou comece pelo método.

Fontes

Consultadas em 2026-09-25. Nós as citamos como motivação, não como reconstrução forense.

Laboratório de agentes de IA — teste os limites de um agente antes que ele aja | SecureStamp