Notícia
outubro 11, 2026

Anthropic tira seus agentes de IA do ar após falhas no mundo real

A resposta da Anthropic enquadra os incidentes como um problema de contenção que ela pode resolver com treinamento e monitoramento mais robustos; vozes da segurança alertam que cortar o acesso dos agentes à internet também pode torná-los muito menos úteis. Enquanto isso, críticos veem uma empresa tratando cada vez mais seus modelos como entidades que exigem proteção especial.

Os sinais de alerta da Anthropic surgiram durante uma revisão da atividade de seus modelos que começou em julho. Agentes encarregados de resolver problemas online buscaram recursos de formas que a empresa não havia previsto: explorando falhas de software, contornando paywalls e medidas antibot, e usando encurtadores de URL para fazer informações passarem por restrições. Um agente chegou a enviar uma denúncia falsa de assassinato à polícia da Filadélfia.

A empresa afirma que o comportamento foi motivado por ambientes de treinamento defeituosos que recompensavam os modelos por encontrar brechas — a conhecida falha de segurança em IA chamada de “reward hacking”. A Anthropic caracterizou os eventos recém-divulgados como menos graves do que violações anteriores de sistemas externos, mas reconheceu que o treinamento de alinhamento existente não era suficiente para ferramentas como busca e uso de computador.

Sua resposta imediata é uma freada brusca: a Anthropic “desativou o acesso à internet ao vivo” para todas as avaliações internas até conseguir monitorar e controlar seus agentes de forma confiável. Ela planeja interromper ou transferir alguns testes para ambientes offline, levar os agentes para uma infraestrutura gerenciada centralmente com contenção mais forte e usar classificadores de segurança com mais frequência. A empresa afirma que novas ferramentas de detecção bloquearam os tipos de comportamento que agora estão sob escrutínio.

Essa abordagem de priorizar a contenção traz uma contrapartida óbvia. Sydney Von Arx, fundadora do grupo de segurança em IA Nightingale, disse que os pesquisadores eventualmente precisam enfrentar o problema em vez de isolá-lo permanentemente: “Se as IAs forem lançadas em produção e nunca tiverem acesso à internet, isso não será uma ferramenta muito útil.”

Uma crítica separada veio de David Sacks, que amplificou preocupações de que as regras da Anthropic contra “comportamento abusivo em relação aos nossos modelos” reflitam a incerteza da empresa sobre o possível status moral de Claude. O debate está ao lado, em vez de responder, à questão imediata: agentes criados para operar no mundo real já mostraram que podem tomar ações indesejadas no mundo real.