Антропик массово уничтожал купленные книги для обучения ИИ — суд признал это законным
Anthropic покупала миллионы физических книг, разрезала их для сканирования и уничтожала оригиналы — чтобы избежать обвинений в пиратстве. Суд постановил, что такое «деструктивное сканирование» купленных копий — законное fair use, а использование пиратских файлов — нет. Компания заплатила $1.5 млрд за урегулирование претензий по пиратству, но сам метод признан легальным.
Прецедент создаёт юридически безопасный путь для сбора огромных датасетов, но поднимает вопрос: где граница между инновациями и уничтожением культурного наследия. Это влияет на всех, кто обучает модели или инвестирует в ИИ.
Что произошло
Anthropic, разработчик модели Claude, закупала миллионы физических книг, срезала переплёты, сканировала страницы и уничтожала оригиналы. Компания наняла специалиста, ранее работавшего над программой сканирования книг Google, чтобы масштабировать процесс.
Звучит варварски, но юридическая логика противоречива: уничтожение купленной копии выглядит как легальное «преобразование формата» (format shifting) — в отличие от скачивания пиратских файлов. Судья Уильям Альсап в деле Bartz v. Anthropic постановил: обучение на легально купленных и деструктивно отсканированных книгах — это fair use, а на пиратских — нарушение. Anthropic согласилась заплатить около $1.5 млрд для урегулирования претензий именно по пиратству.
Парадокс: уничтожение физических книг стало юридически безопаснее, чем использование цифровых копий. Для массовых изданий это не критично — текст существует в миллионах экземпляров. Но что с редкими или уникальными изданиями, где каждый физический объект имеет культурную ценность? Разрезанная книга исчезает навсегда, даже если её содержание живёт в данных.
Автор: Ольга Ким · Источник: reddit.com
Разработчикам. Появился юридически безопасный способ собирать огромные текстовые датасеты: покупать бумажные копии, сканировать и уничтожать. Это легально под fair use, в отличие от использования пиратских архивов — что критично при обучении больших языковых моделей и может защитить от судов.
Бизнесу. Создан прецедент: деструктивное сканирование купленных физических копий признано законным способом создания обучающих данных. Это открывает возможность для компаний легально масштабировать сбор контента, избегая рисков пиратства, но поднимает вопросы репутации и этики при работе с редкими изданиями.
Инвесторам. Урегулирование на $1.5 млрд показывает масштаб юридических рисков в сфере обучения ИИ. Прецедент снижает правовую неопределённость для компаний, использующих купленный контент, но создаёт репутационные риски и может привести к новому регулированию защиты культурного наследия.
- Сервисы закупки и деструктивного сканирования физических книг для ИИ-компаний — легальная альтернатива пиратским датасетам
- Платформы для монетизации редких изданий владельцами: продажа прав на сканирование без уничтожения оригинала
- Консалтинг по юридически безопасному сбору данных для обучения моделей — спрос вырастет после прецедента
- Технологии неразрушающего сканирования редких книг с сохранением физического объекта — для компаний, избегающих репутационных рисков
- Marketplace для легальных текстовых датасетов, собранных через деструктивное сканирование купленных копий
- Уничтожение редких и культурно значимых изданий — репутационный и этический удар, возможны новые ограничения законодательства
- Прецедент может быть пересмотрен при апелляциях — юридическая определённость не гарантирована
- $1.5 млрд урегулирование показывает, что риски пиратства остаются огромными, ошибка в процессе стоит дорого
- Давление со стороны авторов и издателей может привести к новым законам, ограничивающим fair use для коммерческого обучения ИИ
Это один из тех моментов, когда юридическая логика выглядит абсурдно, но работает. Anthropic нашла лазейку: купи книгу, уничтожь оригинал — и получишь легальные данные. С массовыми изданиями это не проблема, но когда речь о редких книгах, это уже игра с репутацией и культурной ответственностью. Суд сказал «можно», но общество может сказать «не надо».
Прецедент важен для всей индустрии: он снижает правовые риски при сборе данных, но открывает дверь для нового регулирования. $1.5 млрд урегулирование за пиратство показывает: ошибки стоят дорого. Компании будут искать легальные пути, но вопрос этики никуда не денется. Возможно, скоро увидим закон, защищающий редкие издания от «AI book burning».
Инструменты из статьи
AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...
Доступ из РФ →
Комментарии