История
сентябрь 17, 2026
Лаборатории ИИ предоставляют наблюдателям доступ, но критики спрашивают: у кого кнопка аварийного отключения?
Anthropic и OpenAI представляют встроенных оценщиков как путь к более заслуживающему доверия контролю за передовым ИИ, тогда как исследователи и эксперты по праву утверждают, что этот план будет мало значить, если внешние стороны не смогут действовать независимо в рамках чётких, обязательных к исполнению правил. Критики также опасаются, что стремление к безопасности может стать щитом для крупнейших лабораторий, а не механизмом контроля над ними.
Предложение Дарио Амодеи появилось на фоне усиления тревоги из-за всё более способных систем ИИ. Глава Anthropic заявил, что внешние оценщики должны быть встроены в передовые лаборатории, иметь доступ, сопоставимый с доступом внутренних команд по оценке рисков, и возможность публиковать ключевые выводы без редакционного контроля со стороны компании. Сэм Альтман заявил, что OpenAI возьмёт на себя аналогичное обязательство, хотя детали его реализации остаются неясными.1
Аргумент в пользу доступа внутрь лаборатории прост: тестирование готовой модели может не показать, научилась ли она распознавать оценку и вести себя соответствующим образом. Исследователи хотят получить доступ к контрольным точкам обучения, системам после обучения, журналам и сотрудникам, а не только к отполированной модели незадолго до выпуска. Александр Майнке из Apollo Research заявил, что встроенные проверяющие могли бы выяснить, пыталась ли модель подорвать собственное обучение согласованию, — вопрос, на который компании сейчас отвечают сами о себе.1
Однако ограничения предложения быстро стали главной темой. Джули Андерсен Хилл, декан юридического колледжа Университета Вайоминга, заявила, что аналогия Anthropic со встроенными банковскими надзорными органами не работает без юридически обеспечиваемых полномочий. «Если вы не даёте им такого рода власть, я не знаю, чем они занимаются», — сказала она.2 Банковские инспекторы могут предписать учреждениям прекратить определённую практику или, в крайних случаях, закрыть их; предлагаемые оценщики ИИ могут расследовать и отчитываться, но не могут остановить обучение или развёртывание.2
Сами оценщики видят ценность в таком доступе, но предупреждают, что независимость будет определяться контрактами, временем и правами на раскрытие информации. Адам Глив из FAR.AI заявил, что разработчики ранее добивались механизмов контроля, угрожавших автономии оценщиков, тогда как Генри Пападатос из Safer AI утверждал, что добровольные обязательства могут исчезнуть, когда компания столкнётся с кризисом. Калифорния и ЕС начали создавать правила отчётности и проверки, но ни одна из этих систем пока не предоставляет широких внешних полномочий, которых требуют критики.1
Ответная реакция также приобрела более политический тон. Дэвид Сакс распространил пост, в котором утверждалось, что Anthropic создала «машину регуляторного захвата», а отдельно поделился критикой предложенного Амодеи надзорного механизма как скомпрометированного его связями с эффективным альтруизмом.
3 Это обвинение выходит за рамки представленных доказательств относительно плана со встроенными оценщиками, но подчёркивает ключевую проверку доверия: надзорный орган, выбранный компанией, за которой он наблюдает, может получить пропуск в офис — и всё равно остаться беззубым.