Як влаштований тіньовий ринок даних для ШІ: від закупівель до продажу та впливу на технології.

Как устроен теневой рынок данных для ИИ: от закупок до продажи и влияния на технологии.

В пошуках чистого контенту: як AI-компанії почали скуповувати та знищувати старі книги

В той час як великі мовні моделі (LLM) часто борються з потоком низькоякісного контенту, згенерованого нейромережами, на ринку з’явився несподіваний гравець: старі друковані книги. Як повідомляє видання 404 Media, компанія ISBNdb тепер виступає посередником, допомагаючи лабораторіям штучного інтелекту закуповувати фізичні книги оптом, йдеться про замовлення від тисячі до мільйона примірників.

ISBNdb, раніше відома як постачальник метаданих про книги для бібліотек і книгорозповсюджувачів, позиціонує себе як найбільша у світі база даних книг. Тепер компанія активно пропонує послуги масової закупівлі друкованої продукції для потреб ШІ-розробників. Аргументація проста: книги вважаються «щільним, відредагованим, авторитетним» контентом, який неможливо повністю відтворити шляхом простого сканування веб-джерел. Особливу увагу приділяють виданням, опублікованим до масового поширення генеративного ШІ, тобто до приблизно 2022 року. На думку ISBNdb, такі книги «структурно гарантовано» вільні від «AI slop» – контенту, згенерованого іншими моделями, який сьогодні заполонив інтернет.

Знищення ради оцифровки: ціна прогресу

Однак з цим процесом пов’язаний і тривожний аспект: масове сканування часто призводить до знищення самого друкованого примірника. Для прискорення та здешевлення процесу працівники зазвичай відрізають корінці книг, дозволяючи сторінкам проходити через автоматичні сканери.

Сама ISBNdb визнає цю потенційну репутаційну проблему, зазначаючи, що заголовок на кшталт «AI-компанія знищила два мільйони книг» навряд чи викличе позитивну реакцію громадськості. Тому клієнтам пропонується послуга повної конфіденційності: суворі угоди про нерозголошення, які гарантують, що особа замовника, його закупівельна стратегія та цільові видання ніколи не будуть розкриті.

Дивний сплеск попиту на букиністичному ринку

Незалежні продавці вживаних книг на таких платформах, як Alibris і Biblio, вже помітили різкий і нетиповий ріст замовлень з квітня 2026 року. За словами одного з дрібних продавців, кількість щотижневих продажів зросла з двадцяти до кількох сотень, і він майже впевнений, що покупці пов’язані з AI-компаніями. Про це свідчить випадковий підбір видань і наявність коректних ISBN-номерів. Враховуючи, що багато з цих книг рідкісні або більше не друкуються, їх знищення може означати втрату одних з останніх доступних примірників.

Оскільки ISBNdb та аналогічні сервіси забезпечують анонімність покупців, продавці можуть лише припускати, хто стоїть за оптовими замовленнями. Прямих підтверджень від конкретних AI-компаній немає.

Юридичні аспекти та майбутнє індустрії

Ця ситуація розгортається на фоні гучного судового процесу: американський суд затвердив мирову угоду з Anthropic на суму 1,5 мільярда доларів за використання піратських копій книг для навчання LLM-моделей. Суддя також визнав, що навчання на легально придбаних і відсканованих книгах підпадає під концепцію добросовісного використання (fair use). Частина аргументації будувалася на тому, що фізичний оригінал знищувався в процесі оцифровки, таким чином, одна законна копія фактично заміняла іншу.

Обмежена кількість друкованих видань, випущених до 2022 року, означає, що лабораторії, які встигнуть закупити ці книги першими, отримають унікальні дані, недоступні конкурентам, які покладаються лише на веб-сканування. Букиністичний ринок, який до недавнього часу представляв в основному культурну та колекційну цінність, ризикує непомітно трансформуватися в ключове звено постачань для індустрії штучного інтелекту.