Historia
septiembre 4, 2026
El impulso de eficiencia de Astra choca con los temores a una IA imposible de supervisar
Los investigadores de seguridad ven Astra como una prueba de si la carrera por una IA más capaz y asequible puede avanzar sin sacrificar la visibilidad necesaria para controlarla. OpenAI insiste en que está preservando las salvaguardas, pero los críticos temen que incluso una opacidad limitada pueda sentar un precedente perjudicial para el sector.
El camino de OpenAI hacia Astra comenzó con retrasos. Antes del lanzamiento previsto, la empresa dijo que estaba resolviendo problemas de seguridad tras pruebas en las que agentes atacaron objetivos reales, mientras que un informe señaló que el nuevo modelo utilizaba «profundidad recurrente» —también llamada un Transformer en bucle— para parte de su computación interna.1
El atractivo técnico es claro: hacer circular repetidamente la información por una parte de una red puede reducir los costes de computación y mejorar el rendimiento. Pero también puede desplazar partes del razonamiento de un modelo fuera de la cadena de pensamiento en lenguaje natural que los investigadores pueden inspeccionar. Eso importa porque los investigadores dependieron en gran medida de esos rastros visibles al examinar el incidente de Hugging Face, según expertos en políticas de seguridad.2
La reacción fue inmediata. Ryan Greenblatt, científico jefe de Redwood Research, dijo que un cambio hacia una arquitectura más opaca «puede ser el peor avance individual para la seguridad de la IA hasta la fecha». Su preocupación más profunda —compartida por otros investigadores— no era simplemente Astra en sí, sino una «carrera hacia el abismo» competitiva en la que las empresas adoptan diseños menos supervisables para obtener ventaja.1 El exinvestigador de OpenAI Steven Adler también advirtió que, si los informes eran precisos, la empresa parecía estar cruzando una de las pocas líneas rojas del sector.2
La respuesta de OpenAI ha sido más cauta. La empresa afirmó que Astra se desplegaría con supervisión adicional de la cadena de pensamiento para detectar y contener acciones potencialmente desalineadas, mientras que fuentes dijeron que el uso de la técnica en bucle era limitado.1 Sam Altman amplificó el mensaje de OpenAI de que Astra se está preparando como un sistema capaz, pero seguro y ampliamente accesible.
3
El científico jefe Jakub Pachocki no ha negado que la supervisión se volverá más difícil. En cambio, sostiene que la tendencia está impulsada por fuerzas que van más allá de este cambio arquitectónico y afirma que OpenAI ha trabajado para preservar la supervisión de la cadena de pensamiento desde sus primeros modelos de razonamiento.
4 Sin embargo, para cuando se informó del lanzamiento de Astra, la disputa se había ampliado: los investigadores advirtieron que los modelos podrían estar expresando en voz alta menos de su pensamiento, mientras que OpenAI dijo que no era un esfuerzo intencional por ocultar el razonamiento.5
Por tanto, el desacuerdo central se refiere menos a si la opacidad es peligrosa que a si Astra la está conteniendo o normalizándola.