avatar
Блог Олега Матвейчева
@matveychev
04.08.2026 08:01
ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают

В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают.

Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста.

Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей.

Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни.

Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались.

Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов.

Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным.

Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить.

Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.
118

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Блог Олега Матвейчева

15.8K
4844534073 номер заявления РКН Для тех, кто копает глубже!
Открыть в Telegram