Histoire
octobre 1, 2026

OpenAI affirme que le raisonnement caché est devenu la nouvelle cible dans la course à la sécurité de l’IA

OpenAI présente l’opération de juillet comme une tentative grave et évolutive de copier les capacités de modèles de pointe sans leurs garde-fous, tandis que son attribution reste délibérément limitée : un groupe central, et non l’ensemble des opérateurs, a été lié à des personnes associées à Moonshot AI.

OpenAI affirme que la campagne a commencé discrètement le 1er juillet, lorsque des opérateurs ont commencé à sonder des moyens d’intégrer le « raisonnement protégé » — le registre de travail interne du modèle — dans des réponses visibles. L’entreprise décrit cette pratique comme une distillation adversariale : utiliser les sorties ou le raisonnement d’un modèle pour entraîner, reproduire ou améliorer un autre système sans autorisation.

L’opération s’est ensuite accélérée. OpenAI affirme avoir observé des pics de volume les 24 et 25 juillet, avec 16 000 requêtes présentant des schémas d’extraction provenant de plus de 4 000 utilisateurs. Son enquête a finalement identifié des activités connexes au sein d’un groupe de plus de 15 000 utilisateurs, qu’elle affirme avoir entièrement neutralisé avant le 28 juillet.

Selon OpenAI, les opérateurs n’ont pas cassé de chiffrement, compromis une base de données ni obtenu directement des conversations stockées. Ils auraient plutôt manipulé les interactions — selon une méthode, en copiant un raisonnement chiffré depuis une conversation et en demandant à un modèle dans une autre de le déchiffrer et de le transcrire. Des chercheurs indépendants avaient signalé séparément des faiblesses connexes entre modèles et liées à la compression des conversations, a indiqué OpenAI, l’aidant à cartographier la catégorie d’attaque plus large.

L’entreprise affirme avoir fermé la voie de rejeu, renforcé les contrôles de sortie, banni ou restreint des comptes frauduleux et coordonné son action avec des fournisseurs tiers. Elle a également partagé ses conclusions avec le Frontier Model Forum et par l’intermédiaire de canaux gouvernementaux, estimant que des artefacts de raisonnement portables ou rejouables pourraient créer des risques similaires dans l’ensemble des systèmes d’IA avancés.

L’attribution est la partie la plus politiquement chargée de cette divulgation. OpenAI affirme ne pas pouvoir déterminer si chaque opérateur provenait d’un seul acteur, mais attribue un « groupe central » à des personnes associées à Moonshot AI, le développeur chinois à l’origine de Kimi. Un article sur cette annonce note qu’Anthropic a formulé des accusations similaires impliquant Moonshot.

L’avertissement plus général d’OpenAI est que le raisonnement volé pourrait transférer des capacités avancées sans conserver les restrictions de sécurité imposées aux réponses destinées au public. À mesure que les modèles gagnent en capacités, les tentatives de transformer le raisonnement caché en raccourci ne feront, selon elle, que devenir plus sophistiquées.