avatar
The Edinorog 🦄
@Theedinorogblog
28.06.2025 14:31
📚 Как Anthropic купила и уничтожила миллионы книг, чтобы обучить свой AI

В решении суда по делу Anthropic о том, могла ли компания использовать книги для обучения AI или нет, есть интересный момент. Там описывается процесс, как именно компания собирала книги для своей библиотеки и что с ними стало дальше. И это прям целая спецоперация.

Читая этот пост, подключите свое воображение, чтобы представить масштаб действия. Если хотите почитать полное решение суда, то есть вот здесь.

Сначала чуваки из Anthropic просто скопировали несколько пиратских библиотек — около 7 млн книг. А потом, похоже, решили, что надо бы пойти более легальным путем. И наняли Тома Терви, он до этого руководил отделом партнерских отношений в проекте Google по сканированию книг.

Задача Терви была найти новые способы получения книг. А точнее — получить «все книги в мире» и при этом избежать «юридической/практической/деловой суеты». Терви отправил пару писем крупным издательствам с просьбой выдать лицензии на книги для обучения AI. Но на этот путь как-то сразу забили, не пошло.

Терви и его команда переключились на дистрибьюторов книг, книжные магазины и так далее. Они стали скупать бумажные книги. За «много миллионов долларов» Anthropic купил миллионы бумажных книг. Миллионы! Часто эти книги были в подержанном состоянии.

А потом началось самое интересное. Нужно было эти книги перевести в электронных вид, чтобы с ними можно было работать и обучать AI. Согласно решению суда, этим занимались подрядные организации.

Процесс выглядел так. С каждой книги снимали обложку и разделяли на отдельные страницы. А потом эти страницы сканировались — получалась PDF-версия с машиночитаемым текстом. А бумажную версию уничтожали.

Издание ArsTechnica пишет, что такое деструктивное сканирование, в принципе, является обычной практикой при оцифровке книг. То есть Anthropic не первая. Вот только масштаб впечатляет. При этом Google при оцифровке книг использует специальные камеры, чтобы не уничтожать книги. Но тут вопрос скорости и цены. Вариант с разрезанием книг на страницы, похоже, оказался быстрее и дешевле.

Теперь у Anthropic гигантская электронная библиотека из миллионов книг. Но доступ к ней есть только у компании, в паблик ничего не выложено.

С одной стороны, они честно купили эти книги и, наверное, могут с ними делать что хотят. С другой стороны, читать про то, как уничтожили миллионы книг, довольно дико, если честно.

А еще очень хочется почитать про техническую составляющую процесса. Ведь для начала нужно было купить и собрать в одной локации миллионы книг. Потом нужно все разобрать на отдельные листы и отсканировать. Это ж сколько людей нужно, чтобы это все вручную сделать? Наверняка же как-то был автоматизирован процесс. Ну, и утилизировать миллионы книг та еще задача. Хотя, в теории, они могли подзаработать на сдаче макулатуры. В решении суда про это нет, но может быть всплывет когда-нибудь.

@TheEdinorogBlog — тот самый канал про стартапы🦄
😱 49
23
12
🔥 6
🤔 5
👍 3
17 161 7.5K

Обсуждение 17

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

The Edinorog 🦄

41.7K
Тот самый канал про стартапы🤪
Автор - журналист Дмитрий Филонов
❗️Реклама на канале — https://teletype.in/@theedinorog/xASBsmc6JNE

Связь с автором - @TheEdinorog

РКН: https://clck.ru/3PUAPX
Открыть в Telegram