Notícia
outubro 1, 2026

OpenAI afirma que o raciocínio oculto se tornou o novo alvo na corrida pela segurança em IA

A OpenAI retrata a operação de julho como uma tentativa séria e em evolução de copiar capacidades de modelos de ponta sem suas salvaguardas, enquanto sua atribuição permanece deliberadamente restrita: um núcleo central, e não todos os operadores, foi ligado a pessoas associadas à Moonshot AI.

A OpenAI afirma que a campanha começou discretamente em 1º de julho, quando operadores passaram a testar maneiras de extrair o “raciocínio protegido” — o registro interno de trabalho do modelo — em respostas visíveis. A empresa descreve a prática como destilação adversarial: usar as saídas ou o raciocínio de um modelo para treinar, reproduzir ou aprimorar outro sistema sem autorização.

A operação então se acelerou. A OpenAI afirma ter observado picos de alto volume em 24 e 25 de julho, com 16.000 solicitações com padrões de extração vindas de mais de 4.000 usuários. Sua investigação acabou identificando atividade relacionada em um grupo de mais de 15.000 usuários, que, segundo a empresa, foi totalmente interrompido até 28 de julho.

Segundo a OpenAI, os operadores não quebraram criptografia, violaram um banco de dados nem obtiveram diretamente conversas armazenadas. Em vez disso, eles supostamente manipularam interações — em um método, copiando o raciocínio criptografado de um chat e pedindo a um modelo em outro que o descriptografasse e transcrevesse. Pesquisadores independentes haviam sinalizado separadamente fragilidades relacionadas entre modelos e na compactação de conversas, disse a OpenAI, ajudando-a a mapear a classe mais ampla de ataque.

A empresa afirma ter fechado a via de repetição, reforçado as verificações de saída, banido ou restringido contas fraudulentas e coordenado ações com provedores terceirizados. Também compartilhou suas conclusões com o Frontier Model Forum e canais governamentais, argumentando que artefatos de raciocínio portáteis ou reproduzíveis poderiam criar riscos semelhantes em sistemas avançados de IA.

A atribuição é a parte mais politicamente sensível da divulgação. A OpenAI afirma não poder determinar se todos os operadores vinham de um único agente, mas atribui um “núcleo central” a indivíduos associados à Moonshot AI, a desenvolvedora chinesa por trás do Kimi. Uma reportagem sobre o anúncio observa que a Anthropic fez alegações semelhantes envolvendo a Moonshot.

O alerta mais amplo da OpenAI é que o raciocínio roubado poderia transferir capacidades avançadas sem levar consigo as restrições de segurança impostas às respostas voltadas ao público. À medida que os modelos se tornam mais capazes, afirma a empresa, as tentativas de transformar o raciocínio oculto em um atalho só se tornarão mais sofisticadas.