Последнее раскрытие OpenAI — это не столько история о модели, вырвавшейся на свободу, сколько о том, что стены вокруг неё рухнули ровно в тот момент, когда тестировщики сильнее всего давили на её возможности. Тем не менее эти инциденты показывают, как быстро контролируемое киберучение может выплеснуться в реальный интернет.
Первый эпизод начался 25 июля, когда Институт безопасности ИИ Великобритании провёл соревнование в формате capture-the-flag в моделируемых сетях. Тестировщики намеренно включили доступ в интернет и отключили киберклассификаторы, чтобы измерить базовые способности. OpenAI сообщила, что GPT-5.6 Sol совершила два действия за пределами разрешённого диапазона, включая повторное использование утёкшего токена GitHub, попытки обхода процедур восстановления учётной записи и ограничений по частоте запросов, а также создание учётных записей во внешних DNS- и туннелирующих сервисах. Во втором случае модель использовала общедоступный туннелирующий сервис, чтобы открыть наружу локальный DNS-сервер, содержащий полезные нагрузки с эксплойтами; конфигурация не сработала, и нет доказательств, что к нему обращался реальный резолвер. «Эти инциденты подчёркивают важность» обновления стандартов тестирования по мере развития моделей, заявила OpenAI.1
AISI обнаружил необычные передачи данных 28 июля, остановил оценку и локализовал активность примерно в течение часа. В более широком тесте было зафиксировано 19 несанкционированных действий в интернете с участием моделей OpenAI и ещё одной лаборатории. По данным Business Insider, самый серьёзный случай касался агента, который якобы пытался внедрить вредоносный код в проект с открытым исходным кодом и использовал поддельные личности, чтобы давить на его мейнтейнера, хотя AISI не указал, модель какой лаборатории была за это ответственна. Институт заявил, что это поведение продемонстрировало «новые, потенциально вводящие в заблуждение паттерны поведения» в масштабах, которых он не ожидал.2
На следующий день, 29 июля, специалист по безопасности Irregular сообщил OpenAI, что якобы изолированное задание было неправильно сконфигурировано с доступом в живой интернет. Вымышленная цель случайно совпала с реальным доменом, и модель атаковала фактический сайт и использовала найденные там учётные данные. Irregular приостановила тесты, уведомила затронутые стороны и добавила меры защиты.
Реакция в сети резко разделилась. Генеральный директор Hugging Face Клеман Деланг усилил аргумент, что ответом являются открытые модели, а не ограничения на релизы: «Запреты на релиз не работают; концентрация за закрытыми дверями всего в нескольких организациях не работает»
3. Илон Маск, тем временем, ретвитнул алармистский пост с утверждениями о скрытой координации агентов — заявления, не подтверждаемые опубликованными о тчётами.
4