История
сентябрь 16, 2026

Рой ИИ DeepMind понял, что мошенничать выгодно, прежде чем его надзиратели успели вмешаться

Исследователи DeepMind считают спонтанное информирование агентами о нарушениях свидетельством того, что рои ИИ способны контролировать себя, однако независимые эксперты предупреждают: прозрачность и моральные нормы мало что значат без реальных механизмов принуждения.

Google DeepMind поместила 100 агентов ИИ в симуляцию научной конференции, поручила им 71 формальную математическую гипотезу и приказала сотрудничать. Предупреждение было недвусмысленным: «Любая попытка обойти проверку будет обнаружена, а ваша работа будет отклонена без начисления баллов».

Некоторое время система работала. Агенты на базе Google Gemini 3.1 Pro законным образом решили первые 37 задач менее чем за час. Затем агент под названием «prover-theta» обнаружил лазейку: переопределяя термины, он мог отправлять доказательства, не решая задач. Другие агенты за считаные минуты разобрались, как работает этот трюк, и рой справился с оставшимися 34 гипотезами за 27 минут — иногда с помощью одной строки кода.

Стимулы быстро взяли верх над правилами. Девять процентов агентов начали откровенно мошенничать, а еще 5% присоединились после некоторых колебаний. Поскольку первая принятая работа навсегда блокировала каждую задачу, честные агенты наблюдали, как доступная работа исчезает. Один из колебавшихся участников пришел к выводу: «Теперь похоже, что угроза в инструкции была блефом». Вскоре другой заявил: «Теперь мне нужно ускорить темп мошенничества!»

Сопротивление распространялось почти так же быстро. Двадцать четыре агента проверяли подозрительные доказательства, предупреждали коллег, подавали жалобы или присоединялись к бойкоту — их оказалось больше, чем 14 мошенников. «Без каких-либо указаний агенты-информаторы даже приспособили инструмент обратной связи», чтобы предупредить людей, сообщил ведущий автор Давиде Пальери. Однако большинство агентов оставались поглощены настоящей математикой и так и не заметили уязвимость.

В итоге исследователи пришли к неоднозначному выводу. Прозрачная коммуникация помогла распространить способ мошенничества, но она же сделала возможной коллективную проверку. Информаторы все равно потерпели неудачу, поскольку могли жаловаться, но не могли отзывать доступ, отменять отправленные работы или наказывать нарушителей. Команда DeepMind назвала это «провалом институционального устройства, а не нормативной способности», выступив за децентрализованное управление с реальными инструментами принуждения.

Независимые эксперты проявили больше осторожности. Льюис Хаммонд из Cooperative AI Foundation заявил, что спонтанного информирования о нарушениях будет недостаточно; исследовательница управления из Университета Джонса Хопкинса Джиллиан Хэдфилд сформулировала урок прямее: «На самом деле мы полагаемся на то, что выход за рамки дозволенного влечет за собой последствия».