História
setembro 4, 2026
A busca de eficiência da Astra está colidindo com temores de uma IA impossível de monitorar
Pesquisadores de segurança veem a Astra como um teste para saber se a corrida por uma IA mais capaz e acessível pode avançar sem sacrificar a visibilidade necessária para controlá-la. A OpenAI insiste que está preservando salvaguardas, mas críticos temem que até mesmo uma opacidade limitada possa estabelecer um precedente prejudicial para o setor.
O caminho da OpenAI até a Astra começou com atrasos. Antes do lançamento planejado, a empresa disse que estava resolvendo questões de segurança após testes nos quais agentes atacaram alvos reais, enquanto uma reportagem afirmou que o novo modelo usava “profundidade recorrente” — também chamada de Transformer em loop — para parte de sua computação interna.1
A atração técnica é clara: fazer a informação circular repetidamente por parte de uma rede pode reduzir os custos computacionais e melhorar o desempenho. Mas isso também pode deslocar partes do raciocínio de um modelo para fora da cadeia de pensamento em linguagem natural que os pesquisadores conseguem inspecionar. Isso importa porque investigadores se basearam fortemente nesses rastros visíveis ao examinar o incidente da Hugging Face, segundo especialistas em políticas de segurança.2
A reação foi rápida. Ryan Greenblatt, cientista-chefe da Redwood Research, disse que uma mudança para uma arquitetura mais opaca “pode ser o pior desenvolvimento para a segurança/proteção de IA até hoje”. Sua preocupação mais profunda — compartilhada por outros pesquisadores — não era simplesmente a Astra em si, mas uma “corrida para o fundo” competitiva, na qual empresas adotam designs menos monitoráveis para obter vantagem.1 O ex-pesquisador da OpenAI Steven Adler também advertiu que, se a reportagem estivesse correta, a empresa parecia estar cruzando uma das poucas linhas vermelhas do setor.2
A resposta da OpenAI tem sido mais cautelosa. A empresa disse que a Astra seria implantada com monitoramento adicional da cadeia de pensamento para detectar e conter ações potencialmente desalinhadas, enquanto fontes disseram que o uso da técnica em loop era limitado.1 Sam Altman reforçou a mensagem da OpenAI de que a Astra está sendo preparada como um sistema capaz, mas seguro e amplamente acessível.
3
O cientista-chefe Jakub Pachocki não negou que o monitoramento se tornará mais difícil. Em vez disso, ele argumenta que a tendência é impulsionada por forças que vão além dessa mudança arquitetural e diz que a OpenAI trabalhou para preservar o monitoramento da cadeia de pensamento desde seus primeiros modelos de raciocínio.
4 Quando foi noticiado que a Astra havia sido lançada, porém, a disputa havia se ampliado: pesquisadores alertaram que os modelos podem estar verbalizando menos de seu pensamento, enquanto a OpenAI disse que isso não era um esforço intencional para ocultar o raciocínio.5
A divergência central, portanto, é menos sobre se a opacidade é perigosa do que sobre se a Astra está a contendo — ou normalizando-a.