Storia
ottobre 1, 2026

OpenAI afferma che il ragionamento nascosto è diventato il nuovo bersaglio nella corsa alla sicurezza dell’IA

OpenAI descrive l’operazione di luglio come un tentativo serio e in evoluzione di copiare le capacità dei modelli di frontiera senza le loro protezioni, mentre la sua attribuzione rimane deliberatamente circoscritta: un nucleo centrale, non ogni operatore, è stato collegato a persone associate a Moonshot AI.

OpenAI afferma che la campagna è iniziata silenziosamente il 1° luglio, quando alcuni operatori hanno cominciato a sondare modi per estrarre il “ragionamento protetto” — il registro interno di elaborazione del modello — in risposte visibili. L’azienda descrive questa pratica come distillazione avversaria: usare gli output o il ragionamento di un modello per addestrare, riprodurre o migliorare un altro sistema senza autorizzazione.

L’operazione ha poi accelerato. OpenAI afferma di aver rilevato picchi ad alto volume il 24 e il 25 luglio, con 16.000 richieste secondo schemi di estrazione provenienti da oltre 4.000 utenti. La sua indagine ha infine identificato attività correlate in un gruppo di oltre 15.000 utenti, che afferma di aver completamente neutralizzato entro il 28 luglio.

Secondo OpenAI, gli operatori non hanno violato la crittografia, compromesso un database né ottenuto direttamente conversazioni archiviate. Avrebbero invece manipolato le interazioni — in un metodo, copiando il ragionamento crittografato da una chat e chiedendo a un modello in un’altra di decrittarlo e trascriverlo. Ricercatori indipendenti avevano separatamente segnalato vulnerabilità correlate tra modelli e nella compattazione delle conversazioni, ha dichiarato OpenAI, aiutandola a mappare la più ampia classe di attacchi.

L’azienda afferma di aver chiuso il percorso di riproduzione, rafforzato i controlli sugli output, vietato o limitato gli account fraudolenti e coordinato le azioni con fornitori terzi. Ha inoltre condiviso le proprie conclusioni con il Frontier Model Forum e attraverso canali governativi, sostenendo che artefatti di ragionamento portabili o riproducibili potrebbero creare rischi simili nei sistemi di IA avanzati.

L’attribuzione è la parte politicamente più delicata della divulgazione. OpenAI afferma di non poter stabilire se ogni operatore provenisse da un unico soggetto, ma attribuisce un “nucleo centrale” a individui associati a Moonshot AI, lo sviluppatore cinese dietro Kimi. Un rapporto sull’annuncio osserva che Anthropic ha formulato accuse simili che coinvolgono Moonshot.

L’avvertimento più ampio di OpenAI è che il ragionamento sottratto potrebbe trasferire capacità avanzate senza trasferire anche le restrizioni di sicurezza imposte alle risposte destinate al pubblico. Man mano che i modelli diventano più capaci, afferma, i tentativi di trasformare il ragionamento nascosto in una scorciatoia non potranno che diventare più sofisticati.