регулирование 1 мин

Reddit против веб-скраперов: суд признал законным иск о незаконном сборе данных через Google

Суд США частично отклонил ходатайство SerpApi (сервиса для парсинга поисковой выдачи Google) о закрытии дела по иску Reddit. Судья посчитал, что Reddit убедительно доказала сговор: SerpApi создал инструмент обхода защиты Google, а Perplexity AI платил за него, чтобы собирать контент Reddit без разрешения. Параллельно другой суд отклонил похожий иск Google — там не смогли доказать, что правообладатели давали право блокировать скрейпинг.

От исхода этих дел зависит, сколько будут стоить данные для обучения AI и сможет ли открытый интернет остаться открытым. Это напрямую влияет на бизнес-модели AI-стартапов и платформ с пользовательским контентом.

Что произошло

Судья федерального суда США Пол Энгельмайер отклонил большую часть ходатайства SerpApi о закрытии дела. Reddit обвинила компанию в сговоре с Perplexity AI для незаконного скрейпинга своего контента из результатов поиска Google.

Судья пришёл к выводу: на ранней стадии разбирательства Reddit убедительно показала, что был сговор. SerpApi разработал продукт для обхода механизмов контроля доступа Google, а Perplexity AI заплатила за эту услугу, чтобы собирать защищённый контент Reddit.

Контекст: Google проиграл похожее дело

Двумя неделями ранее другой суд отклонил аналогичный иск от Google. Причина: Google не смог доказать, что правообладатели (вроде того же Reddit) когда-либо давали поисковику право блокировать скрейпинг защищённого контента. Google заявил о намерении изменить иск и продолжить борьбу.

SerpApi резко ответил: и Google, и Reddit пытаются использовать закон DMCA (о защите авторских прав), чтобы «отгородить открытый интернет», задним числом заявляя права на контент, который они не создавали и которым не владеют.

Автор: Ольга Ким · Источник: arstechnica.com

Разработчикам. Если создаёте скрейперы или API для сбора данных — готовьтесь к усилению юридического давления. Сейчас суды начинают рассматривать использование сторонних инструментов для обхода защиты как сговор. Robots.txt и Terms of Service больше не игнорируются так безнаказанно, особенно если за скрейпингом стоит коммерческий AI-продукт

Бизнесу. AI-компаниям, которые тренируют модели или строят продукты на чужих данных, станет дороже и опаснее. Reddit доказывает, что может защищать свой контент даже через посредников вроде Google. Лицензионные сделки (как у OpenAI с Reddit) становятся не роскошью, а необходимостью для легального масштабирования

Инвесторам. Рынок данных для AI переходит в фазу судебных войн и платных лицензий. Компании вроде Perplexity AI рискуют дорогими исками, если полагаются на скрейпинг без разрешения. Растёт ценность платформ с собственным контентом (Reddit, Stack Overflow) — они могут монетизировать данные напрямую. Одновременно усиливается запрос на легальные data-маркетплейсы и синтетические датасеты

Хайп15
Реальная польза75
Заработать80
  • Создание легальных data-маркетплейсов, где AI-компании покупают лицензии на контент у платформ и авторов
  • Развитие сервисов синтетических данных и дата-аугментации — обходим риски скрейпинга чужого контента
  • Консалтинг по DMCA-compliance и legal tech для AI-стартапов: как собирать данные законно
  • Инструменты мониторинга и блокировки несанкционированного скрейпинга для платформ-контентхолдеров
  • Платные API от крупных платформ (Reddit, Twitter/X) для доступа к данным — растущий B2B-сегмент
  • AI-компании, полагающиеся на агрессивный скрейпинг, столкнутся с волной дорогих исков и убытков
  • Суды США пока не выработали единую позицию: одни дела выигрывают платформы, другие — скрейперы. Юридическая неопределённость высока
  • Если прецедент закрепится в пользу Reddit, стоимость данных для обучения AI резко вырастет — многие стартапы не потянут
  • Защита контента может превратиться в оружие монополистов: крупные платформы перекроют доступ к данным для конкурентов под видом борьбы с нарушениями

Занятная история: Reddit смог убедить суд в сговоре между скрейпером и AI-компанией, а Google в похожем деле проиграл — не доказал, что вообще имеет право защищать чужой контент. Это показывает, что американские суды пока не определились, где кончается открытый интернет и начинается частная собственность на данные.

На практике это означает одно: AI-компании больше не могут бездумно собирать всё подряд и надеяться отмазаться. Либо платишь за лицензии (как OpenAI заплатил Reddit), либо рискуешь дорогим судом. Для разработчиков и стартапов это головная боль — легальные источники данных станут дороже, а синтетика и собственный контент — ценнее. Для инвесторов сигнал: компании с большими данными и контентом (Reddit, Stack Overflow) получили новый источник дохода — продажу доступа для обучения моделей.

Ещё по теме

Комментарии