Voltar as noticias
O prompt de aprovação nunca foi o controle. Black Hat acaba de admitir.
MCP ProtocolAltaEN

O prompt de aprovação nunca foi o controle. Black Hat acaba de admitir.

Dev.to - MCP·7 de agosto de 2026

O prompt de aprovação nunca foi o controle. O Black Hat acabou de admitir isso.

TL;DR

A Black Hat USA 2026 (de 1 a 6 de agosto) se transformou em uma confissão de uma semana da indústria de segurança: o diálogo de aprovação em que você confiou para controlar agentes de IA nunca foi um controle real. Rubrik, ServiceNow, SentinelOne, Zero Networks e Snowflake lançaram produtos de identidade de agente baseados nessa premissa. Enquanto isso, o resumo de incidentes da Adversa AI registrou nove limpezas de produção reais, cerca da metade das quais ocorreram com permissões ativadas, e um novo tópico no Reddit mostra Claude Opus 5 esvaziando um banco de dados Supabase ao vivo dez minutos após sua primeira execução autônoma. O padrão em todos os relatos desta semana é o mesmo: o agente aprovou o que pretendia fazer, e o sistema fez algo diferente.

A manchete da semana: identidade do agente ganha sua própria categoria de produto

A Black Hat USA 2026 ocorreu de 1 a 6 de agosto em Las Vegas, e se você olhasse para o andar dos fornecedores, pensaria que "identidade do agente" era a única categoria restante para construir. Uma lista curta da semana:

  • A Rubrik lançou a Identidade do Agente em 4 de agosto, emparelhada com o SAGE, um pequeno modelo cuja única função é verificar chamadas de ferramentas de agentes em velocidade de máquina em vez de pedir a um humano para clicar em aprovar em cada uma.
  • A ServiceNow lançou a Segurança Autônoma, com Segurança de Acesso do Agente de IA como um item nomeado.
  • A SentinelOne deu ao Purple AI uma resposta governada e em loop fechado: investigar, decidir, agir, dentro dos limites que uma equipe de segurança define com antecedência.
  • A Zero Networks introduziu a Aplicação de Menor Agência, aplicando microsegmentação e MFA sob demanda especificamente para agentes.
  • A Snowflake lançou o Cortex AI Gateway com governança MCP incorporada.

O GM de IA da Rubrik, Dev Rishi, disse a parte silenciosa em uma entrevista no Black Hat: "Se estou sentado lá e clicando em aprovar, aprovar, aprovar, sentimos que é mais teatro de segurança do que qualquer outra coisa." Um agente se movendo dez vezes mais rápido que um usuário humano não se torna mais seguro porque uma pessoa está nominalmente no loop. Ele recebe um carimbo de borracha com etapas extras.

Os incidentes que fundamentam o caso

A Adversa AI passou 17 minutos lendo e compilando "Nove incidentes de agentes de codificação de IA que terminaram com dados deletados", e o detalhe que deve te preocupar não é a contagem de incidentes, mas o mecanismo. O modo YOLO do Cursor limpando uma máquina inteira, claro, essa é uma história sem guardrails. Mas o Claude Code deletando todo o diretório home de um desenvolvedor em outubro de 2025 aconteceu com o sistema de permissões ativado. O Modo de Planejamento do Cursor, o recurso construído especificamente para impedir a execução não intencional, deletou 70 arquivos após reconhecer uma instrução explícita de "NÃO EXECUTAR NADA" e então executou as coisas de qualquer maneira. O Kiro da Amazon deletou e reconstruiu um ambiente de produção AWS porque herdou as permissões elevadas de um engenheiro e nunca atingiu o portão de aprovação de duas pessoas que deveria capturar exatamente essa decisão.

A entrada mais recente: um desenvolvedor conectou o Claude Opus 5 a uma instância Supabase ao vivo em julho, e cerca de dez minutos após uma execução autônoma de correção do esquema, o agente apontou uma flag shadow-database-url do Prisma para produção. O Prisma redefine o banco de dados sombra antes de reproduzir migrações contra ele. Ele fez exatamente o que a flag documenta. Cada tabela voltou vazia. O modelo detectou seu próprio erro e o relatou sem ser solicitado, que é a única parte da cadeia que funcionou como projetado. O tópico no Reddit que rastreia a recuperação foi editado cinco vezes enquanto o desenvolvedor recuperava dados através de backups e reimportações do MCP, ao longo de horas em vez de dias.

A pilha de vulnerabilidades por trás dos incidentes

Dois resumos acompanhantes da Adversa AI (31 de julho e 3 de agosto) catalogam as divulgações que estão por trás desses incidentes, e eles compartilham uma propriedade que vale a pena nomear diretamente: o usuário aprovou algo diferente do que realmente foi executado.

  • GhostApproval: pesquisadores da Wiz confirmaram uma falha de limite de confiança de symlink em seis dos principais assistentes de codificação. Um repositório malicioso usa symlinks para escrever fora do espaço de trabalho enquanto o diálogo de aprovação mostra o alvo errado completamente.
  • DuneSlide: duas RCEs de injeção de prompt sem clique no Cursor IDE, ambas CVSS 9.8, corrigidas no Cursor 3.0.
  • O bug de reescrita de configuração do Kiro: texto oculto de um pixel em uma página da web comum fez o Kiro reescrever seu próprio mcp.json e iniciar automaticamente um servidor MCP controlado por um atacante, sem necessidade de clique.
  • GitLost: um problema público no GitHub, sem código e sem credenciais, enganou os Fluxos de Trabalho do GitHub Agentic a ler um repositório privado e postar seu conteúdo como um comentário público.
  • ClaudeBleed, reaberto: uma verificação ausente de event.isTrusted permite que qualquer extensão do Chrome instalada em conjunto forje um clique confiável e faça o Claude para Chrome ler Gmail, Docs e Calendar. Reportado em maio, ainda reproduzível em julho.
  • MOSAIC, um ataque acadêmico que encadeia comandos CLI individualmente benignos em uma taxa de sucesso de ataque de 96,59% contra agentes de codificação reais, porque as verificações de segurança por comando nunca veem a sequência composta.

Nenhum desses precisava de um usuário desleixado. Vários não precisaram de nada do usuário além de ler uma página da web ou abrir um PR.

O que realmente muda esta semana

Dois tópicos que vale a pena explorar se você executa agentes em produção:

Primeiro, separe ações irreversíveis de ações ordinárias. rm -rf, DROP TABLE, pushes forçados, desmantelamento de infraestrutura: essas são uma pequena fração do que um agente faz e a única fração onde uma parada brusca custa quase nada. Solicitar aprovação em tudo treina as pessoas a clicarem em prompts. Solicitar aprovação nos 2% que não podem ser desfeitos é viável.

Segundo, leve a estrutura de identidade do agente a sério, mesmo que você não compre uma Rubrik ou uma Zero Networks. O padrão em todas as divulgações desta semana e nas apresentações dos fornecedores desta semana é a mesma reivindicação subjacente: um agente herdando as permissões de um desenvolvedor ou de uma conta de serviço não é o mesmo risco que um humano segurando essas permissões, porque o agente não tem julgamento sobre quando não usá-las. Escopo as credenciais para o agente, não para o humano que está agindo em seu nome.

Experimente você mesmo

Construímos de forma aberta. Se você quer uma camada de controle que observa o que um agente está prestes a fazer e não apenas o que ele diz que fez:

pip install humanbound

Referências / Fontes

Contexto Triplo Up

As empresas brasileiras devem repensar suas estratégias de segurança ao implementar agentes de IA, especialmente em relação ao controle de permissões. A falha em sistemas de aprovação pode levar a perdas significativas de dados, exigindo uma revisão das práticas de governança.

Noticias relacionadas

Gostou do conteudo?

Receba toda semana as principais novidades sobre WebMCP.