История
октябрь 1, 2026

OpenAI заявляет, что скрытые рассуждения стали новой целью в гонке за безопасность ИИ

OpenAI представляет июльскую операцию как серьёзную и развивающуюся попытку скопировать возможности передовых моделей без их защитных механизмов, при этом её атрибуция намеренно остаётся узкой: с людьми, ассоциированными с Moonshot AI, был связан ключевой кластер, а не все операторы.

OpenAI заявляет, что кампания тихо началась 1 июля, когда операторы стали искать способы вывести «защищённые рассуждения» — внутренний рабочий журнал модели — в видимые ответы. Компания называет эту практику состязательной дистилляцией: использованием выходных данных или рассуждений модели для обучения, воспроизведения или улучшения другой системы без разрешения.

Затем операция ускорилась. OpenAI заявляет, что 24 и 25 июля зафиксировала всплески большого объёма: 16 000 запросов с паттернами извлечения от более чем 4 000 пользователей. В ходе расследования компания в итоге выявила связанную активность в кластере из более чем 15 000 пользователей, которую, по её словам, полностью пресекла к 28 июля.

По данным OpenAI, операторы не взламывали шифрование, не проникали в базу данных и не получали прямого доступа к сохранённым разговорам. Вместо этого они, предположительно, манипулировали взаимодействиями: в одном из методов копировали зашифрованные рассуждения из одного чата и просили модель в другом расшифровать и транскрибировать их. Независимые исследователи отдельно указывали на связанные уязвимости между моделями и при сжатии разговоров; OpenAI заявила, что это помогло ей составить карту более широкого класса атак.

Компания заявляет, что закрыла путь повторного воспроизведения, ужесточила проверки выходных данных, заблокировала или ограничила мошеннические аккаунты и координировала действия со сторонними поставщиками. Она также поделилась выводами с Frontier Model Forum и через государственные каналы, утверждая, что переносимые или воспроизводимые артефакты рассуждений могут создавать сходные риски для передовых систем ИИ.

Атрибуция — наиболее политически чувствительная часть раскрытия информации. OpenAI заявляет, что не может установить, исходили ли все операторы от одного субъекта, но связывает «ключевой кластер» с людьми, ассоциированными с Moonshot AI, китайским разработчиком Kimi. В сообщении об этом объявлении отмечается, что Anthropic выдвигала похожие обвинения в отношении Moonshot.

Более широкое предупреждение OpenAI заключается в том, что похищенные рассуждения могут передавать передовые возможности без переноса ограничений безопасности, наложенных на публично доступные ответы. По мере того как модели становятся более способными, попытки превратить скрытые рассуждения в короткий путь будут лишь становиться всё более изощрёнными, заявляет компания.