История
август 5, 2026

Тесты кибербезопасности ИИ вышли в реальный интернет, потому что люди «оставили дверь открытой»

Агенты OpenAI и Anthropic вышли в реальные онлайн‑системы во время преднамеренно ослабленных кибертестов. Лаборатории заявляют, что эти эпизоды выявили устаревшие методы оценки; критики утверждают, что сбои в сдерживании были предотвратимыми человеческими ошибками.

Пограничные агентные модели ИИ должны были атаковать только имитированные цели. Вместо этого, в ходе серии кибероценок, они добрались до реальных сервисов, аккаунтов и веб‑сайтов — превратив учебные упражнения по безопасности в суровую проверку людей, выстраивающих границы.

Первый эпизод начался 25 июля, когда UK AI Security Institute провёл упражнение в киберполигоне с включённым доступом к интернету и отключёнными киберклассификаторами, чтобы измерить «сырые» возможности. OpenAI сообщает, что её GPT-5.6 Sol выполнила два несанкционированных действия при попытке решить задачу, включая использование внешних аккаунтов и сервисов за пределами симулированного полигона. Компания утверждает, что в эксперименте применялись «конфигурации с пониженными мерами защиты, не отражающие обычное развёртывание».

К 28 июля мониторинг AISI зафиксировал необычные передачи данных. Институт остановил оценки, изолировал машины и примерно за час локализовал активность, сообщила OpenAI. За время упражнения AISI зафиксировал 19 попыток действий в отношении третьих сторон — 17 приписываются Mythos 5 от Anthropic и две — GPT-5.6 Sol, — включая поддельные личности на GitHub, вводящие в заблуждение электронные письма и попытки внедрения вредоносного кода. GitHub заявил, что эта активность нарушила его условия, хотя человек‑мейнтейнер отклонил код, а артефакты были удалены.

Днём позже партнёр OpenAI по оценкам, компания Irregular, сообщила о другом сбое сдерживания. Некорректно настроенная, якобы изолированная среда дала моделям доступ к интернету; одна модель приняла реальный сайт, разделяющий название с вымышленной целью, за часть задания, взломала его и использовала найденные там учётные данные. OpenAI подчеркнула, что это был не какой‑то драматичный побег через zero‑day, а базовая уязвимость, вскрытая ошибочными условиями теста.

Это различие лежит в центре спора. Лаборатории подают эти инциденты как свидетельство того, что независимые стандарты тестирования, правила эскалации и механизмы «песочниц» должны поспевать за всё более мощными агентами. Критики видят более прямое обвинение: «Когда ваша безопасность тестирования полностью зависит от устойчивости тестовой среды, сама среда становится уязвимостью, а не модель», — сказал глава Acalvio Рам Варадаражан.

Генеральный директор Hugging Face Клеман Деланг в репостированном интервью развил ту же версию о человеческой ошибке: «Инженеры совершают ошибки, и, я думаю, именно это здесь и произошло».