Уиллоу Тохи,
НАТУРАЛЬНЫЕ НОВОСТИ
- Компании, занимающиеся разработкой искусственного интеллекта, скупают миллионы бумажных книг на вторичном рынке, уничтожая их после сканирования в поисках обучающих данных.
- Книги, изданные до 2022 года, пользуются спросом, поскольку не содержат текста, сгенерированного искусственным интеллектом, что позволяет избежать «коллапса модели» во время обучения.
- ISBNdb и другие посредники облегчают оптовые закупки от 1000 до 1 миллиона книг за один заказ, сохраняя при этом анонимность покупателей, использующих искусственный интеллект.
- Редкие, иноязычные и вышедшие из печати издания находятся под угрозой исчезновения, поскольку последние бумажные экземпляры уничтожаются.
Судебное решение, изменившее всё
21 июля 2026 года окружной судья США Уильям Алсуп вынес знаковое решение по делу Anthropic против Authors Guild, которое коренным образом изменило отношения между компаниями, занимающимися искусственным интеллектом, и печатным наследием человечества. Судья заявил, что практика Anthropic по приобретению физических книг, удалению корешек для промышленного сканирования и уничтожению оригиналов представляет собой «добросовестное использование» в соответствии со статьей 107 Закона об авторском праве. Это решение, первое в своем роде, применяющее закон об авторском праве к обучающим наборам данных для ИИ, спровоцировало беспрецедентную гонку среди технологических компаний по приобретению и уничтожению книг в промышленных масштабах — угрожая редким томам и стирая физические копии человеческих знаний, которые, возможно, никогда не будут восстановлены.
Почему книги, изданные до 2022 года, стали бесценны
Движущей силой этого разрушения является то, что исследователи называют «коллапсом модели». Когда системы ИИ обучаются на тексте, сгенерированном другими системами ИИ, качество ухудшается с каждым поколением, что приводит к все более бессвязным результатам. Интернет настолько перенасыщен синтетическим контентом, что компании теперь активно ищут печатные книги, изданные до 2022 года, как последний незагрязненный источник знаний, созданных людьми.
Компания ISBNdb, которая занимается поиском печатных книг для обучения ИИ, рекламирует на своем веб-сайте, что «лучшие в мире данные для обучения ИИ лежат на полке». Компания описывает печатные книги как «тщательно отобранные, прошедшие экспертную оценку, специализированные знания, структурированные таким образом, что ни один веб-сканер не может их воспроизвести». Публикации, вышедшие до 2022 года, «гарантированно не содержат подобных загрязнений», — заявляет компания, ссылаясь как на текст, сгенерированный ИИ, так и на растущую практику авторов «отравлять» веб-контент, чтобы саботировать процессы сбора данных.
Промышленный процесс разрушения
Механизм этой операции точен и вызывает опасения. Стандартные поддоны с книгами вмещают от 800 до 1200 томов. Покупатели увеличивают объемы заказов от пилотных до 10 000 и более книг за партию. Деструктивные сканеры обрабатывают от 80 до 120 страниц в минуту после того, как гидравлические режущие станки срезают корешки книг. Затем оригинальные книги измельчаются и перерабатываются.
Согласно судебным документам по делу компании Anthropic, в рамках «Проекта Панама» компания потратила десятки миллионов долларов именно на этот канал сбыта, заключив контракт с Datamation на услуги сканирования. Книготорговцы выявляли таких оптовых покупателей по характерным признакам: аномально большие объемы, заказы, не привязанные к конкретной тематике, охватывающие одновременно историю, ботанику, региональное право и немецкую экономику, а также полное безразличие к ценам. Как сказал один книгопродавец изданию 404 Media: «Дело не только в количестве, но и в странности заказов».
Том Харви из компании Anthropic, ранее участвовавший в создании Google Books, руководил этой операцией. Один книгопродавец, продавший сотни книг покупателям, подозреваемым в использовании ИИ, выразил смешанные чувства: «Это выгодно мне в финансовом плане… С другой стороны, мне не нравится конечное использование, и мне не нравится, что редкие книги отправляются на переработку».
Исчезающее наследие
Наиболее тревожный аспект этой практики заключается в том, что она означает для редких и вышедших из печати книг. Книги на иностранных языках, малотиражные академические работы и старинные тексты с ограниченным количеством сохранившихся экземпляров могут оказаться под угрозой исчезновения. Когда компания, использующая искусственный интеллект, покупает последний известный физический экземпляр редкой книги, сканирует его и уничтожает оригинал, этот том перестает существовать в физическом мире. Он становится данными, запертыми на корпоративных серверах — недоступными для будущих ученых, коллекционеров или широкой публики.
ISBNdb признает «проблему имиджа» на своем веб-сайте, отмечая, что «заголовок „Компания, занимающаяся ИИ, уничтожила два миллиона книг“ не вызывает сочувствия». Компания обещает строгие соглашения о неразглашении информации по каждому проекту, заявляя, что «ваша личность, стратегия и цели приобретения никогда не раскрываются». Эта секретность означает, что книготорговцы могут лишь гадать, кто покупает их товар и с какой целью.
Продавцы редких книг в Нидерландах сообщали о подобных подозрительных оптовых закупках. Один из продавцов на форумах Alibris в феврале 2026 года задал вопрос: «Будет ли искусственный интеллект читать каждую книгу? Есть ли какие-либо сведения о том, как осуществляется отбор?»
Правовая система, поощряющая разрушение.
В своем решении судья Алсуп прямо подтвердил законность схемы «покупка-сканирование-уничтожение», написав, что «каждая приобретенная печатная копия копировалась для экономии места для хранения и обеспечения возможности поиска в цифровой копии. Оригинал печатной копии уничтожался. Один заменял другой». Поскольку цифровая копия никогда не демонстрировалась, не передавалась и не продавалась за пределами компании, судья счел это «явно трансформирующим» и, следовательно, защищенным принципом добросовестного использования.
Эта логика фактически создает юридический стимул к уничтожению. Если компания хранит физическую книгу, она обязана ее хранить. Уничтожив оригинал, компания может утверждать, что «заменила» физическую копию цифровой. Это решение предоставило всей индустрии искусственного интеллекта образец для подражания, и теперь компании прямо ссылаются на него.
Гарвардский университет в партнерстве с Google и Microsoft продемонстрировал, что существует альтернатива. В результате сотрудничества было выпущено почти миллион оцифрованных книг, находящихся в общественном достоянии, на 254 языках — без необходимости их уничтожения. Бертон Дэвис из Microsoft назвал начало работы с данными из общественного достояния «разумным», отметив, что библиотеки хранят «значительное количество интересных культурных, исторических и языковых данных». Этот альтернативный путь ясно показывает, что у лабораторий есть более экологичные варианты. Они просто предпочитают их не использовать.
Кто контролирует текстовое наследие человечества?
Вопрос о том, кто контролирует текстовое наследие человечества, больше нельзя откладывать. Каждый вышедший из печати том, исчезающий в промышленном сканере, может представлять собой последнюю копию, доступную кому-либо за пределами серверов лаборатории искусственного интеллекта. Редкие книги, тексты на иностранных языках и малоизвестные научные работы — многие из которых никогда не были оцифрованы где-либо еще — исчезают из физического существования после одного сканирования. Аргументация суда о том, что уничтожение является «трансформационным», привела к систематическому уничтожению физических архивов не ради сохранения, а ради корпоративной прибыли. По мере того, как компании, занимающиеся искусственным интеллектом, ускоряют приобретение печатных знаний, общество должно решить, оправдывает ли удобство обучающих данных безвозвратную потерю книг, которые невозможно восстановить.
Источники для данной статьи:
Комментариев нет:
Отправить комментарий