Нейросети и ИИ

Книги стали топливом для ИИ: их скупают тысячами и отправляют под сканер

Книги стали топливом для ИИ: их скупают тысячами и отправляют под сканер

Компании, работающие с ИИ, всё чаще берут печатные книги не для витрин и не для складов: книги для обучения ИИ нужны им как тексты для обучения моделей. По данным расследования 404 Media, через посредников скупают от тысяч до миллионов экземпляров, а потом книги оцифровывают и часто просто разбирают на страницы. Дальше — в утиль.

Схема завязана на посредниках, поэтому конечных покупателей почти не видно. И это, похоже, и есть смысл всей конструкции: компании получают тексты, написанные людьми, но не идут по каждому праву отдельно и не светятся в лоб.

Продавцы подержанных книг спрос уже почувствовали. Если раньше отдельные точки продавали примерно по 20 экземпляров в неделю, то теперь речь идёт о сотнях. На площадках вроде Alibris и Biblio такие заказы тоже стали появляться заметно чаще.

Книги для обучения ИИ: как устроена эта схема

По данным 404 Media, книги закупают партиями, и покупателя не особенно волнует ни жанр, ни автор, ни редкость издания. ИИ-компаниям нужен не книжный рынок как таковой, а большой пласт человеческого текста, который можно быстро прогнать через сканеры и собрать в обучающий корпус.

Один из заметных участников этой цепочки — база ISBNdb. Раньше сервис был завязан на книжные магазины и библиотеки, а теперь предлагает массовые закупки для клиентов из сферы искусственного интеллекта. На практике это выглядит довольно прямолинейно: книга уходит со склада подержанной литературы и довольно быстро оказывается под промышленным сканером.

Такой способ оцифровки дешевле, чем аккуратное неразрушающее сканирование. Страницы можно разъединить и подавать на оборудование потоком. Для обучения моделей это особенно удобно, когда нужны не сгенерированные тексты, а материалы, написанные человеком.

Что уже стало предметом споров

История с книгами упирается не только в технологию, но и в право. В материалах по делу Anthropic уже описывалась похожая схема: компания скупала печатные издания, сканировала их через подрядчиков, а часть экземпляров потом разбирали на страницы для быстрой обработки.

Суд тогда признал использование законно приобретённых книг для обучения допустимым в рамках fair use. Но параллельно Anthropic получила и отдельный иск из-за библиотеки из 7 млн пиратских книг, которую, как утверждалось, компания хранила у себя.

Похожий спор сейчас идёт вокруг Google: издатели обвиняют компанию в незаконном использовании миллионов книг, защищённых авторским правом, для обучения Gemini. На этом фоне массовая скупка бумажных изданий выглядит для ИИ-рынка как запасной канал пополнения данных, особенно когда компании хотят опираться на тексты с понятным происхождением.

Есть ещё один слой проблемы — редкие и давно не переиздававшиеся книги. После сканирования часть экземпляров уже не возвращается в оборот, а цифровые копии уезжают в закрытые базы, которые используют только для обучения моделей. Если такие закупки продолжат расти, под ударом могут оказаться именно старые издания, те самые, которые и так редко всплывают в открытой продаже.

Источник: Ixbt
Илья Игнатов
Технический журналист и новостник. Окончил МТУСИ по специальности «Информационная безопасность». Пишет о железе, софте и потребительской электронике с 2018 года. Верит, что хорошая новость — это когда всё по делу и без воды.

Оставить комментарий