четверг, 20 августа 2026 г.

Компания Amazon уничтожила редкие книги, используемые для обучения ИИ, несмотря на предыдущие опровержения, подтвердила компания AirTag.

 

В подразделении VGT3 компании Amazon в Лас-Вегасе корешки книг разрезаны, страницы отсканированы, оригиналы выброшены.

Роджер Саттерфилд,
TECH TIMES

Основатель и генеральный директор Amazon.com Джеффри П. Безос выступает на презентации нового Amazon Kindle 2.0 в библиотеке и музее Моргана 9 февраля 2009 года в Нью-Йорке. Фото: Марио Тама/Getty Images

Компания Amazon когда-то построила весь свой бизнес на продаже книг. Теперь у нее есть склад в Лас-Вегасе, где редкие экземпляры разбираются и обрабатываются с помощью моделей искусственного интеллекта — и это доказал журналист с помощью трекера стоимостью 29 долларов. Расследование 404 Media, опубликованное в понедельник, отследило редкие книги до Amazon , поместив метку Apple AirTag внутрь партии из примерно 1000 томов, предположительно предназначенных для компании, занимающейся искусственным интеллектом. Отслеживание проходило через четыре штата до объекта Amazon под названием LAS8 на северо-востоке Лас-Вегаса, где специальное подразделение, обозначенное внутренним кодом VGT3, принимает паллетные грузы, срезает корешки книг для ускорения сканирования и утилизирует физические экземпляры. Отсканированные страницы используются для обучения моделей искусственного интеллекта Amazon. Сами книги не сохраняются.

Полученные данные важны по одной конкретной причине: ранее Amazon отрицала использование деструктивного сканирования . AirTag прямо опроверг это опровержение.

Что обнаружил AirTag на станции LAS8 компании Amazon

Путь устройства слежения был неприглядным и доносил компрометирующие сведения. Продавец редких книг на Biblio — независимой торговой площадке, которая сохраняет анонимность покупателей, — в сотрудничестве с репортером 404 Media Эмануэлем Майбергом незаметно подложил AirTag в один из томов в оптовом заказе из 1000 книг, который, по подозрению продавца, предназначался для обучения искусственного интеллекта.

Устройство сначала доставили в Милуоки, затем две недели оно простояло на распределительном складе недалеко от Кеноши, штат Висконсин. Грузовик перевез его на запад с ночевкой в ​​Гранд-Джанкшене, штат Колорадо. Последний сигнал пришел из Лас-Вегаса, с северной оконечности складского комплекса Amazon под названием LAS8, как сообщило издание GeekWire .

LAS8 — это в основном типография, занимающаяся печатью по требованию, то есть производством книг. Но в северной части здания находится отдельное подразделение. Сотрудники Amazon, разместившие сообщения на внутреннем форуме для персонала, идентифицировали это подразделение по кодовому названию: VGT3. Логотип, нарисованный на входе в VGT3, представляет собой тираннозавра, держащего открытую книгу. Изображение является точной рекламой.

«Мы всего лишь сканируем книги», — написал один из сотрудников на форуме, как сообщает Tom's Hardware . Другие работники описали рабочий процесс: прибывают большие партии книг на поддонах, сотрудники срезают корешки с каждого тома, чтобы свободные страницы могли пройти через высокоскоростные сканеры, а физические копии выбрасываются после завершения сканирования. В итоге получается только цифровой файл.

Когда издания 404 Media и Ars Technica обратились к Amazon за комментариями, компания предоставила обеим компаниям одно и то же заявление: «Amazon закупает книги через коммерческие каналы, чтобы помочь в разработке и улучшении продуктов и услуг, которыми пользуются наши клиенты», — сообщает The Next Web . В заявлении не упоминается искусственный интеллект. Ничто в нем не противоречит сообщениям СМИ.

Что показывает сканирование штрихкода

Одна деталь в репортажах 404 Media выполняет больше работы, чем любая другая.

Сотрудники VGT3 не просто сканируют страницы книг. Согласно свидетельствам сотрудников, изученным 404 Media, персонал сканирует штрихкод ISBN каждой книги перед сканированием ее страниц. Международный стандартный книжный номер (ISBN) — 13-значный идентификатор, присваиваемый каждой коммерчески изданной книге с 1970 года, стандартизированный как ISO 2108 и в настоящее время используемый более чем в 150 странах, — это глобальная система каталогизации, которая делает каждую опубликованную книгу уникально идентифицируемой.

Сканируя ISBN до контента, Amazon создает запись о том, что она уже потребила. Эта запись, сопоставленная с любой базой данных ISBN, сообщает компании, какие книги ей еще нужны. Компания, занимающаяся искусственным интеллектом и имеющая доступ к каталогу ISBN, в принципе, может создавать систематические заказы на закупку, чтобы заполнить все пробелы в своем обучающем корпусе — обрабатывая всю документированную библиографию книгоиздания, написанных людьми, по одной паллете за раз. Книготорговцы в США и Европе уже описали именно эту схему: оптовые заказы без какой-либо связной тематики, объединенные только наличием ISBN, размещаемые покупателями, не заинтересованными в литературной или коммерческой ценности книг, как было описано в более ранней публикации TechTimes .

Книготорговец, установивший трекер, описал, что теряется в этом процессе. «Существуют разные виды ценности, — сказал продавец изданию 404 Media, как сообщает The Next Web . — Есть денежная ценность, очевидно, но есть и множество других видов ценности. Есть историческая ценность, интеллектуальная ценность, сентиментальная ценность. Всевозможные вещи, и все это не интересует компании, занимающиеся искусственным интеллектом. Им нужен просто контент в виде набора слов, связанных между собой».

Почему открытый интернет больше не работает

Чтобы понять, почему Amazon занимается уничтожением документов в пустыне Невады, необходимо понять, что произошло с интернетом как ресурсом для обучения.

Первое поколение больших языковых моделей было построено в основном на основе веб-сканирования. Сейчас этот ресурс скомпрометирован двумя различными способами. Первый — это коллапс модели: задокументированное явление, при котором модели ИИ, обучающиеся на сгенерированном ИИ тексте, постепенно деградируют с каждым поколением, поскольку синтетический результат более ранних моделей не обладает тем разнообразием распределения, которое присуще действительно написанному человеком тексту. Исследователи из Оксфорда, Кембриджа, Имперского колледжа Лондона и Университета Торонто опубликовали официальный анализ в журнале Nature в июле 2024 года, предупреждая, что петля обратной связи уже самоподкрепляется. Исследование Ahrefs, охватившее около 900 000 вновь созданных веб-страниц, показало, что по состоянию на апрель 2025 года 74,2% из них содержали контент, сгенерированный ИИ , — это означает, что загрязнение уже распространилось почти на три четверти того, что обнаружит любое новое веб-сканирование.

Вторая проблема — это вредоносное отравление. Методы, разработанные лабораторией SAND Чикагского университета (общий принцип продемонстрировала программа Nightshade для обработки изображений), позволили авторам внедрять в текст невидимые искажения, которые целенаправленно ухудшают качество обучения моделей ИИ. Совместное исследование Anthropic, Института безопасности ИИ Великобритании и Института Алана Тьюринга показало, что всего 250 вредоносных документов в обучающем корпусе, содержащем триллионы токенов, могут установить измеримый бэкдор.

Печатные книги, изданные до 2022 года, одновременно обходят обе проблемы. Они были написаны до появления каких-либо крупных языковых моделей, а значит, не могут содержать текст, сгенерированный искусственным интеллектом. Они также были написаны до появления каких-либо инструментов для искажения данных, а значит, не могли быть подвергнуты вредоносной обработке. Исследователи из Epoch AI прогнозируют, что спрос на общедоступный текст, созданный людьми, может исчерпать доступное предложение где-то между 2026 и 2032 годами. Книги, напечатанные до эры ИИ, представляют собой конечный, фиксированный и незаменимый корпус, структурно чистый таким образом, как это не может обеспечить ни один современный веб-сканер.

ISBNdb — компания, занимающаяся метаданными и некоторое время предлагавшая компаниям, занимающимся искусственным интеллектом, услуги по массовому приобретению книг, прежде чем расследование 404 Media привело к отзыву её в июле 2026 года, — откровенно излагала эту логику в своих ныне удалённых маркетинговых материалах: «Лучшие в мире данные для обучения ИИ лежат на полке». Компания отметила, что печатные книги, изданные до 2022 года, были «структурно чистыми» именно потому, что они предшествовали обоим источникам загрязнения, как было описано в расследовании TechTimes об ISBNdb .

Как компания Anthropic сделала это первой — и что Amazon отказывается говорить по этому поводу.

Компания Amazon не изобрела эту практику. Она следует по пути, проложенному компанией Anthropic, что задокументировано в федеральном суде.

Внутренние документы компании Anthropic, рассекреченные в январе 2026 года в рамках коллективного иска о нарушении авторских прав Bartz v. Anthropic, описывали внутреннюю инициативу под названием «Проект Панама» в одной необычной строке: «Проект Панама — это наша попытка деструктивно отсканировать все книги в мире», — как подробно описало издание TechTimes . Anthropic наняла Тома Тёрви — бывшего руководителя отдела партнерских отношений проекта Google Books — для руководства этой работой, намеренно воспроизведя правовую основу, которая позволила сканированию книг Google выдержать проверку на соответствие авторским правам. Механизм был идентичен тому, что использует Amazon VGT3: гидравлические режущие станки удаляют корешки; высокоскоростные сканеры обрабатывают отдельные страницы; физические книги перерабатываются.

В июне 2025 года окружной судья США Уильям Алсуп в деле «Бартц против Антропика» постановил , что преобразование законно приобретенной физической книги в цифровой файл для обучения ИИ представляет собой трансформативное добросовестное использование в соответствии с авторским правом — одобренное судом разрешение на приобретение на основании уничтожения. Решение Алсупа является единственным решением окружного суда Северного округа Калифорнии; поскольку Антропик урегулировал дело мирным путем, а не обжаловал его, решение так и не дошло до апелляционного суда и не создает обязательного прецедента для других юрисдикций. В отчете, опубликованном в мае 2025 года Управление по авторским правам США, выражало скептицизм по поводу добросовестного использования, отмечая, что не все коммерческие программы обучения ИИ подпадают под это определение. Но для компаний, занимающихся ИИ и работающих сейчас, это служит временным юридическим прикрытием.

Соглашение по делу Бартца было окончательно оформлено в июле 2026 года, и компания Anthropic выплатила приблизительно 1,5 миллиарда долларов — по 3000 долларов за каждое из примерно 500 000 произведений, на которые распространялось действие соглашения, — что сделало его крупнейшим коллективным иском по защите авторских прав в истории США. Эта выплата покрыла часть дела, касающуюся пиратства: Anthropic отдельно скачала более семи миллионов книг из пиратских хранилищ, таких как Library Genesis и Pirate Library Mirror, что, по мнению суда, не подпадает под действие принципа добросовестного использования.

Ключевое различие между Anthropic и Amazon заключается не в законе, а в одном-единственном утверждении. Когда 404 Media и BBC обратились к Anthropic с вопросом о её методах работы, компания уточнила , что её программы сбора данных не покупают и не уничтожают редкие или антикварные книги. Компания xAI — разработчик искусственного интеллекта Илона Маска — публично заявила то же самое.

Компания Amazon подобных заявлений не делала. Комментарий её представителя — «закупает книги через коммерческие каналы для улучшения продуктов и услуг, которыми пользуются клиенты» — не уточняет, какие категории книг приобретаются, в каком физическом состоянии они поступают, что происходит с физическими экземплярами или какое приложение на основе искусственного интеллекта получает отсканированное содержимое. Книгопродавец, разместивший AirTag, приобрел книги на Biblio, торговой площадке, специализирующейся на редких и подержанных изданиях.

Уничтожает ли Amazon книги на законных основаниях? Краткий ответ: да — пока что.

Правовая основа, обеспечивающая работу VGT3, та же самая, что защищала проект Panama компании Anthropic: сочетание доктрины первой продажи (покупатель может распоряжаться физической копией по своему усмотрению) и решения по делу Alsup (преобразование приобретенной физической книги в цифровой файл для обучения ИИ является трансформативным добросовестным использованием).

Как сообщалось, деятельность Amazon, по всей видимости, остается в рамках этой схемы: компания закупает книги через коммерческие каналы — она, судя по всему, не скачивает пиратские копии — и уничтожает физические оригиналы, создавая при этом единственную цифровую версию. В решении по делу Alsup особо отмечалось, что уничтожение физической копии во время сканирования соответствует принципу «одна копия — одна копия» в рамках добросовестного использования.

Такая правовая ситуация может не соответствовать международным стандартам. Эмили Хадсон, специалист по интеллектуальной собственности из Оксфордского университета, сообщила BBC, что британское законодательство требует получения разрешения на использование авторских прав как для создания обучающего набора данных, так и для проведения обучения — эквивалента добросовестного использования не существует. Немецкое авторское право еще яснее: Ассоциация издателей и книготорговцев Германии заявила, что сканирование книг будет нарушением немецких авторских прав независимо от того, были ли физические книги приобретены законным путем.

Для авторов, чьи работы попадают на склад Amazon в Лас-Вегасе, юридическая ясность не решает этическую проблему. Автор, чья книга была законно приобретена, продана на вторичном рынке, а затем уничтожена в Неваде, не получает ни уведомления, ни компенсации. Соглашение с Бартцем касалось пиратства Anthropic; оно не затрагивало вопрос о том, что именно разрешает добросовестное использование. Авторы, которые продавали или лицензировали свои работы издателям и сохраняли права на вторичное использование, не имеют механизма, позволяющего отказаться от законной оптовой покупки на рынке подержанных книг.

Что происходит с книгами, которые остались единственными экземплярами?

Расследование AirTag не отслеживало экземпляр бестселлера, сохранившегося миллионным тиражом. Оно отслеживало партию, полученную с Biblio — торговой площадки, специализирующейся на изданиях, которые трудно найти в других местах.

Разница существенна. Для книги, выпущенной тиражом 500 000 экземпляров, потеря одного купленного экземпляра при сканировании не представляет сложности. Для специализированного, научного или регионального издания, выпущенного тиражом 100 экземпляров или меньше, ситуация иная. После того как корешок редкой книги обрезан и измельчен, текст может сохраниться в виде частного массива данных. Физический объект, и все, что отличает физическую книгу от набора отдельных экземпляров — пометки на полях, переплет, происхождение, материальная история — исчезают навсегда.

Европейские книготорговцы уже выявили специфическую закономерность, позволяющую обнаружить целевую продажу редких книг: покупатели, которые платят выше рыночной цены за книги с низкой денежной ценностью, запрашивают книги, объединенные только наличием ISBN, и отказываются идентифицировать себя или указать предполагаемое назначение книги. Дерек Уокер из книжного магазина McNaughtan's в Эдинбурге рассказал изданию The Next Web, что он продал, по-видимому, единственный сохранившийся экземпляр издания XVIII века через канал, который, как он теперь подозревает, был создан с помощью искусственного интеллекта, и что это будет существенно отличающейся проблемой от продажи обычных книг.

Стюарт Мэнли из книжного магазина Barter Books в Нортумберленде высказал наиболее откровенную противоположную точку зрения в отрасли. «Миру больше не нужно пять миллионов экземпляров «Кода да Винчи», — сказал он, отметив, что у него есть книги, которые 20 лет продавались онлайн, и которые, наконец, были распроданы в рамках крупных заказов. Отрасль не едина в своем противостоянии. Она действительно разделена между продавцами, которые видят благоприятный рынок для медленно продающихся товаров, и теми, кто понимает, что редкие и специализированные книги — это совершенно другое дело.

Компания Amazon не проводит четкой границы между этими двумя категориями.

Что ждет стратегию Amazon в области искусственного интеллекта в будущем — и каково будет законодательство в этой сфере?

Сроки реализации проекта VGT3 компанией Amazon осложняются изменениями в ее стратегии в области искусственного интеллекта. В конце июля 2026 года Amazon начала сворачивать свои флагманские модели Nova — включая Nova Premier, Nova Omni, Nova Reel и Nova Canvas — перенаправляя ресурсы на разработку новой перспективной модели под руководством исследователя Питера Аббила, дебют которой ожидается на конференции Amazon re:Invent в конце этого года. К активным моделям Nova относятся Nova 2 Lite, Nova 2 Sonic и Nova Forge. Amazon подтвердила, что продолжает инвестировать в разработку моделей; отсканированные книги будут использоваться в качестве основы для любой модели, созданной в рамках программы Frontier Model Research.

Правовая ситуация, связанная с приобретением физических книг, также находится в процессе изменений. Решение по делу Бартца установило, что сканирование является добросовестным использованием, но не создало обязательного прецедента. Новый коллективный иск, поданный в федеральный суд Нью-Йорка 10 июля 2026 года — от Hachette Book Group, Cengage Learning, Elsevier и автора Скотта Туроу против Google из-за обучающих данных Gemini — не связан прецедентом Калифорнии. В этом иске содержатся утверждения о том, что Google удалил или изменил информацию об авторских правах на загруженные произведения.

Для продавцов подержанных книг практическим следствием расследования, проведенного в понедельник, стало установление личности. Книготорговцы целый год замечали закономерность — бессвязные оптовые заказы, анонимные покупатели, цены, не имеющие коммерческого смысла, — не имея возможности установить, кто их размещал. Один AirTag изменил ситуацию. Пунктом назначения стал склад Amazon в Лас-Вегасе. Устройство имело кодовое обозначение VGT3. Операция продолжается.


Часто задаваемые вопросы

Законно ли для Amazon покупать редкие книги и уничтожать их для обучения искусственного интеллекта?

Согласно действующему законодательству США, да — с важными оговорками. В июне 2025 года судья окружного суда США Уильям Алсуп постановил, что преобразование законно приобретенной физической книги в цифровой файл для обучения ИИ представляет собой трансформационное добросовестное использование в соответствии со статьей 107 раздела 17 Свода законов США, как подробно описано в материалах TechTimes о мировом соглашении . Это решение является единственным решением окружного суда Калифорнии, которое никогда не рассматривалось апелляционным судом и не создает обязательного прецедента для других судов. Управление по авторским правам США выразило скептицизм по поводу того, что все коммерческие программы обучения ИИ подпадают под определение добросовестного использования. За пределами США правовая ситуация значительно отличается: законодательство Великобритании и Германии не содержит эквивалентных исключений добросовестного использования для обучения ИИ, а это означает, что аналогичная операция, проведенная в Европе, скорее всего, будет незаконной.

Почему компании, занимающиеся искусственным интеллектом, покупают именно книги, изданные до 2022 года?

Книги, изданные до 2022 года, предлагают то, чего больше нет в открытом интернете: гарантию исключительно человеческого авторства. В 2024 году исследователи в журнале Nature задокументировали, что модели ИИ, обученные на контенте, сгенерированном ИИ, деградируют с течением времени — явление, называемое коллапсом модели, — а исследование Ahrefs показало, что по состоянию на апрель 2025 года 74,2% вновь созданных веб-страниц содержали текст, сгенерированный ИИ. Книги, изданные до 2022 года, также предшествуют инструментам, использующим вредоносные программы для искажения данных, которые могут внедрять невидимые искажения в обучающие данные. Физические книги, напечатанные до эры ИИ, обладают структурной чистотой, недоступной современному веб-контенту, что делает их все более ценными в качестве учебного ресурса и все более востребованными для приобретения.

Что ранее говорила компания Amazon о разрушительном сканировании, и как AirTag меняет эту ситуацию?

Согласно сообщениям UniladTech, ранее Amazon отрицала использование деструктивного сканирования . В текущем заявлении компании — «закупает книги через коммерческие каналы, чтобы помочь в разработке и улучшении продуктов и услуг, которыми пользуются наши клиенты» — не упоминается ИИ, не описывается процесс и не уточняется, что происходит с физическими книгами. Сотрудники Amazon в сообщениях на внутреннем форуме описывали, что вся функция VGT3 заключается в обрезке корешков книг и сканировании отдельных страниц, после чего физические книги выбрасываются. AirTag подтвердил эти сведения, отследив доставку груза на склад. Amazon не предоставила объяснений расхождения между своим предыдущим отрицанием и операцией, задокументированной в ходе расследования.

Что могут сделать продавцы подержанных книг, если подозревают, что заказ предназначен для обучения искусственного интеллекта?

В настоящее время ни один закон не обязывает покупателей раскрывать свою личность или предполагаемое использование книги при стандартной коммерческой покупке. Однако продавцы, обеспокоенные этим, могут обратить внимание на характерную схему, описанную книгопродавцами в США и Европе: оптовые заказы без единой тематики, объединенные только ISBN; покупатели, не проявляющие ценовой чувствительности и не желающие торговаться; анонимные личности покупателей; и адреса доставки, не соответствующие заявленной стоимости или тематике книг. Книгопродавцы, отказывающиеся от таких заказов — как это сделал Томас Кенни из книжного магазина Kennys Bookshop в Голуэе — используют единственную доступную форму вето в цепочке поставок, специально созданной для сокрытия цели заказа. Решение о выполнении такого заказа в конечном итоге является деловым и этическим решением, которое каждый продавец должен принять без юридического регулирования, в отсутствие какого-либо регулирующего органа, который бы принял меры для решения проблем этого рынка.

____
https://www.techtimes.com/articles/324871/20260818/amazon-destroys-rare-books-ai-training-despite-prior-denial-airtag-confirms.htm

Эта запись была опубликована в рубрике Без рубрики . Добавьте в закладки 

Комментариев нет:

Отправить комментарий

Компания Amazon уничтожила редкие книги, используемые для обучения ИИ, несмотря на предыдущие опровержения, подтвердила компания AirTag.

  В подразделении VGT3 компании Amazon в Лас-Вегасе корешки книг разрезаны, страницы отсканированы, оригиналы выброшены. Роджер Саттерфилд, ...