История
август 17, 2026
Охота Amazon за данными для ИИ ставит редкие книги под удар
Сообщения, связывающие оптовые закупки книг и их разрушительное сканирование с обучением ИИ, усилили опасения, что незаменимые издания жертвуют ради масштабирования. Amazon заявляет, что покупает книги через коммерческие каналы, тогда как защитники сохранения культурного наследия утверждают, что гонка технологий не требует их уничтожения.
Гонка по насыщению искусственного интеллекта всё большим количеством текстов сталкивается с более простым и давним императивом: некоторые книги нельзя заменить после того, как их разрезали.
Тревога усилилась после того, как 404 Media поместило трекер в редкую книгу и сообщило, что в итоге она оказалась на объекте Amazon VGT3 в Лас-Вегасе. В материале описывались покупки книг, связанных с Amazon, у которых удаляли корешки, чтобы их страницы можно было отсканировать для обучения моделей. Amazon не ответила напрямую на обвинения в уничтожении, заявив лишь, что компания «покупает книги через коммерческие каналы, чтобы улучшать продукты и услуги, которыми пользуются клиенты».1
Коммерческая логика здесь предельно проста. Большим языковым моделям требуются огромные объёмы надёжного, развёрнутого текста, а изданные из печати книги могут содержать материалы, недоступные онлайн — в том числе тексты, написанные до того, как сгенерированная ИИ проза начала загрязнять массив данных. Но продавцы книг и защитники сохранения видят цену, которая плохо укладывается в конвейер обучения: редкий физический экземпляр, однажды разобранный, исчезает навсегда.
Беспокойство росло ещё с тех пор, как стало известно, что Anthropic уничтожила миллионы печатных книг ради обучения, хотя никаких указаний на разрушение редких изданий не было. Сообщения о подозрительных оптовых заказах с тех пор сделали этот страх более осязаемым. Ирландский книжный магазин Kennys Bookshop недавно сообщил о покупателе, который искал 5 000 малоизвестных названий без каких-либо попыток торговаться — поведение, которое продавцы книг всё чаще воспринимают как тревожный сигнал возможного использования для ИИ.2
Спор идёт не о том, можно ли оцифровывать книги, а о том, как это делать. Google ещё много лет назад запатентовала технологию неразрушающего сканирования, а Internet Archive использует обученных сотрудников, которые вручную перелистывают хрупкие страницы. Её сканировщики пришли к выводу, что автоматизированные системы плохо подходят для хрупких книг и специальных коллекций; «чистые, сухие человеческие руки — лучший способ перелистывать страницы», сказали сотрудники архива.2
Компании ИИ и их защитники могут утверждать, что купленные экземпляры юридически допустимо сканировать. Критики возражают, что законность — слабый ответ на культурную утрату. Как выразился Томас Кенни из Kennys, если покупатель сканирует книгу «с намерением завладеть интеллектуальной соб ственностью», его магазин не хочет в этом участвовать.2