Amazon уничтожает редкие книги ради обучения ИИ // будет заменено на конкретный список

#Amazon#ИИ#обучение моделей#редкие книги#Nova#Anthropic
Amazon уничтожает редкие книги ради обучения ИИ

// будет заменено на конкретный список

Full HTML content

Let me write the full article now.

Amazon уничтожает редкие книги ради обучения ИИ

// будет заменено на конкретный список

Компания, начавшая свой путь с продажи книг, теперь массово скупает редкие издания, разрезает их корешки, сканирует страницы и уничтожает оригиналы — всё ради обучения собственных больших языковых моделей. Расследование 404 Media, опубликованное 16 августа 2026 года, впервые документально подтвердило, что Amazon ведёт деструктивное сканирование книг на объекте VGT3 в Лас-Вегасе. Разбираемся, как это стало возможным, почему это легально и что это значит для рынка.

Как журналисты отследили «книжный конвейер» Amazon

В июле 2026 года один из продавцов редких книг на маркетплейсе Biblio получил необычный заказ — примерно на 1000 книг. Покупатель был анонимным, не проявлял чувствительности к цене и заказывал, казалось бы, несвязанные между собой издания. Продавец согласился вложить в одну из книг Apple AirTag, предоставленный 404 Media.

Трекер проследил путь посылки: из Калифорнии через Милуоки, склад в Кеноше и грузовую остановку в Колорадо — до объекта LAS8 на северо-востоке Лас-Вегаса. Именно там расположена операция под названием VGT3, вход которой украшает красноречивый логотип: динозавр, держащий в когтях книгу.

Сотрудники объекта в обсуждениях на форумах подтвердили: их работа — «только сканировать книги». Рабочий процесс прост и безжалостен: книги принимаются крупными партиями, срезаются корешки, страницы прогоняются через сканер, а физический оригинал отправляется в утиль.

Технические детали: почему именно редкие книги

Ключевой вопрос — зачем Amazon уничтожать физические книги, если в интернете полно текстов? Ответ кроется в проблеме «модельного коллапса» (model collapse).

Когда большие языковые модели обучаются на текстах, сгенерированных другими ИИ, качество их выходных данных постепенно деградирует. Модели начинают «поедать» собственный синтетический мусор, теряя связность и оригинальность. К 2026 году интернет настолько переполнен AI-контентом, что простое «соскребание» веб-страниц превращается в каннибализм.

Редкие книги, особенно вышедшие из печати или недоступные в сети, — это идеальный источник «чистых» данных. Любое издание, опубликованное до 2022 года, структурно гарантированно не содержит текста, написанного LLM. Это подтверждает и компания ISBNdb, которая впоследствии удалила свой маркетинговый пост с фразой: «Лучшие в мире данные для обучения ИИ лежат на полке».

| Параметр | Значение |
| --- | --- |
| Объём заказа, отслеженного 404 Media | ~1000 книг |
| Типичный диапазон заказов для ИИ-компаний | от 1000 до 1 000 000 книг |
| Целевой период публикаций | до 2022 года |
| Метод обработки | срез корешка, сканирование, утилизация |
| Объект | VGT3 / LAS8, Лас-Вегас |

Рыночный контекст: Amazon не одинока

Amazon — далеко не единственный игрок на этом «книжном конвейере». Наиболее громкий прецедент — «Проект Панама» (Project Panama) компании Anthropic. Согласно документам, вскрытым в ходе судебных разбирательств, Anthropic с начала 2024 года массово закупала миллионы печатных книг, срезала корешки, сканировала страницы и уничтожала оригиналы. Внутренний документ гласил: «Проект Панама — это наши усилия по деструктивному сканированию всех книг в мире. Мы не хотим, чтобы было известно, что мы работаем над этим».

Ключевой юридический момент — решение федерального судьи Уильяма Алсупа, вынесенное в июне 2025 года. Суд постановил, что сканирование легально приобретённых книг для обучения ИИ является «трансформирующим» использованием и подпадает под доктрину добросовестного использования (fair use). Логика суда парадоксальна: поскольку физический оригинал уничтожается, цифровая копия «заменяет» его, а не дублирует.

В июле 2026 года суд окончательно утвердил мировое соглашение Anthropic с авторами на 1,5 миллиарда долларов — крупнейшее в истории по авторским правам на ИИ. Около 91% из более чем 482 000 книг, охваченных соглашением, были заявлены авторами и издателями.

Экономика «книжной гонки»

Масштаб явления впечатляет. По данным 404 Media, один продавец сообщил, что его еженедельные продажи выросли с менее чем 20 книг до сотен в апреле 2026 года. Покупатели выбирали случайные издания с ISBN-номерами, что указывало на алгоритмический, а не человеческий отбор.

Редкие книги, особенно на малораспространённых языках и с ограниченным тиражом, стали стратегическим ресурсом. Продавцы в Нидерландах и по всей Европе фиксируют необычно крупные заказы, которые, по их подозрению, исходят от американских ИИ-лабораторий.

При этом Amazon в июле 2026 года объявила о сворачивании большинства своих моделей Nova (включая Premier, Omni, Reel и Canvas), сосредоточившись на одном флагманском frontier-модели, анонс которой ожидается на конференции re:Invent в конце 2026 года. Именно для этой модели, судя по всему, и накапливается «чистый» книжный корпус.

Критика и этические дилеммы

Практика вызвала резонанс в индустрии. Бывший конгрессмен США Брэд Карсон указал на извращённый стимул: «Закон теперь вознаграждает уничтожение и наказывает сохранение. Лаборатория, которая хочет отсканировать книгу и сохранить её, или передать в публичный архив, находится в более слабой правовой позиции, чем лаборатория, которая всё измельчает».

Илон Маск заявил в X: «Я попросил команду SpaceX AI сохранять редкие книги в библиотеке и сканировать их сложным способом, а не просто срезать корешок и сканировать».

Основатель Fairly Trained Эд Ньютон-Рекс назвал ситуацию показательной: «Почти триллионные компании покупают книги за несколько центов или доллар, сканируют их, обучаются на них, а затем уничтожают, по сути поглощая культуру».

Перспективы

В краткосрочной перспективе «книжная гонка» продолжится. Пока судебный прецедент Алсупа действует, а регуляторы не вмешались, ИИ-лаборатории будут наращивать закупки. Ожидается, что к концу 2026 года Amazon представит свой новый флагманский frontier-модель, обученный в том числе на уничтоженных книгах.

Однако нарастает давление. Общественный резонанс, реакция авторов и издателей, а также потенциальные законодательные инициативы могут изменить правила игры. Вопрос о том, следует ли разрешать уничтожение физических носителей культурного наследия ради обучения коммерческих моделей, остаётся открытым.

Итог

С технической точки зрения стратегия Amazon логична: «чистые» до-LLM тексты действительно снижают риск модельного коллапса и повышают качество генерации. Но цена этого подхода — безвозвратная утрата физических экземпляров редких книг, многие из которых существуют в единичных экземплярах.

Для бизнес-аудитории это важный сигнал: рынок данных для обучения ИИ смещается от открытого интернета к закрытым, физическим источникам. Компании, владеющие архивами оцифрованных или физических текстов, оказываются в выигрышной позиции. Вопрос лишь в том, как долго продлится эта гонка до того, как общество и регуляторы найдут баланс между прогрессом ИИ и сохранением культурного наследия.

FAQ

Законно ли Amazon уничтожать книги для обучения ИИ?
Да, на данный момент это легально в США. Решение судьи Уильяма Алсупа от июня 2025 года признало деструктивное сканирование легально приобретённых книг «трансформирующим» использованием по доктрине fair use. Однако это решение активно критикуется, и законодательные изменения возможны.

Что такое «модельный коллапс»?
Это деградация качества больших языковых моделей, когда они обучаются на текстах, сгенерированных другими ИИ. Модели «поедают» собственный синтетический контент, теряя связность и оригинальность. Книги, изданные до 2022 года, гарантированно не содержат AI-текста, поэтому считаются ценным «чистым» источником данных.

Какие компании замешаны в уничтожении книг?
Помимо Amazon (объект VGT3 в Лас-Вегасе), наиболее известен «Проект Панама» компании Anthropic, которая закупила миллионы книг. В июле 2026 года суд утвердил мировое соглашение Anthropic с авторами на 1,5 миллиарда долларов. Также в закупках подозреваются другие крупные ИИ-лаборатории.