Historia
octubre 1, 2026
OpenAI afirma que el razonamiento oculto se convirtió en el nuevo objetivo en la carrera de seguridad de la IA
OpenAI presenta la operación de julio como un intento serio y en evolución de copiar las capacidades de modelos de frontera sin sus salvaguardas, mientras que su atribución sigue siendo deliberadamente limitada: un grupo central, no todos los operadores, fue vinculado a personas asociadas con Moonshot AI.
OpenAI afirma que la campaña comenzó discretamente el 1 de julio, cuando los operadores empezaron a probar formas de llevar el “razonamiento protegido” —el registro interno de trabajo del modelo— a respuestas visibles. La empresa describe la práctica como destilación adversarial: usar las salidas o el razonamiento de un modelo para entrenar, reproducir o mejorar otro sistema sin autorización.1
La operación se aceleró entonces. OpenAI afirma que observó picos de gran volumen el 24 y 25 de julio, con 16.000 solicitudes con patrones de extracción de más de 4.000 usuarios. Su investigación finalmente identificó actividad relacionada en un grupo de más de 15.000 usuarios, que, según afirma, interrumpió por completo antes del 28 de julio.1
Según OpenAI, los operadores no descifraron cifrado, vulneraron una base de datos ni obtuvieron directamente conversaciones almacenadas. En cambio, presuntamente manipularon las interacciones; en un método, copiaban razonamiento cifrado de un chat y pedían a un modelo en otro que lo descifrara y transcribiera. Investigadores independientes habían señalado por separado debilidades relacionadas entre modelos y en la compactación de conversaciones, afirmó OpenAI, lo que le ayudó a trazar la clase más amplia de ataque.1
La empresa afirma que cerró la vía de reproducción, reforzó las comprobaciones de salida, prohibió o restringió cuentas fraudulentas y coordinó con proveedores externos. También compartió sus hallazgos con el Frontier Model Forum y canales gubernamentales, sosteniendo que los artefactos de razonamiento portátiles o reproducibles podrían generar riesgos similares en los sistemas avanzados de IA.1
La atribución es la parte políticamente más delicada de la divulgación. OpenAI afirma que no puede determinar si todos los operadores procedían de un solo actor, pero atribuye un “grupo central” a individuos asociados con Moonshot AI, el desarrollador chino detrás de Kimi. Un informe sobre el anuncio señala que Anthropic ha formulado acusaciones similares relacionadas con Moonshot.2
La advertencia más amplia de OpenAI es que el razonamiento robado podría transferir capacidades avanzadas sin conservar las restricciones de seguridad impuestas a las respuestas orientadas al público. A medida que los modelos se vuelven más capaces, afirma, los intentos de convertir el razonamiento oculto en un atajo no harán sino crecer en sofisticación.1