исследования 1 мин

Какие AI-модели пишут наименее похоже на «AI-мусор»: бенчмарк 18 моделей

Энтузиаст создал открытый бенчмарк theslopindex.com, проверив 18 AI-моделей на «слопность» текстов — избыточность, шаблонность, характерные обороты. Неожиданный результат: модели, лучшие по механическим метрикам, проигрывают в человеческом восприятии. Fable заняла 2 место по техническим показателям, но последнее по предпочтениям людей.

Если вы делаете продукт с AI-контентом или сами пишете с помощью моделей, это первый объективный способ измерить, насколько ваш текст похож на автомат. Открытая методология позволяет встроить проверку в пайплайн и не облажаться перед аудиторией.

Что сделали

Автор собрал корпус человеческих текстов (письма, посты, эссе), написал 112 сценариев (холодный email, твит о запуске, аргументативное эссе) и прогнал все модели с одинаковыми настройками. Все выходы публичны на GitHub.

Оценка шла по 5 осям: краткость (сколько воды), шаблонность (повторяющиеся фразы), ритм (разнообразие структуры), характерные маркеры (delve, it's not just X it's Y) и человеческие предпочтения. Принципиально без LLM-судей — только люди и статистика.

Главный сюрприз

Fable технически занял 2 место, но с учётом человеческих оценок скатился в конец. Модели, натренированные под современные бенчмарки, генерируют больше слопа, чем старые. Оптимизация под метрики убила живость текста. Хороший промптинг важнее модели.

Всё открыто: методология, данные, код доступны на theslopindex.com.

AI writingбенчмаркикачество текстаоткрытые данныеhuman evaluation

Автор: Артём Ковалёв · Источник: reddit.com

Разработчикам. Открытый датасет и методология для тестирования качества генерации текстов. Можно использовать для оценки собственных промптов, файн-тюна или построения пайплайнов постобработки, снижающих шаблонность. Репо на GitHub с примерами выходов для 18 моделей.

Бизнесу. Показывает, что маркетинговые тексты и email-кампании на AI без доработки быстро распознаются аудиторией как искусственные. Инвестиции в качественный промптинг и редактирование окупятся лучше, чем гонка за топовой моделью. Контент-команды могут использовать бенчмарк для выбора инструментов.

Инвесторам. Рынок AI-контента созрел для решений второго порядка: инструментов постобработки, детекторов слопа, промпт-платформ. Просто API большой модели уже недостаточно — нужна обёртка с настройкой под человеческий голос. Стартапы типа humanizers могут выстрелить.

Хайп25
Реальная польза60
Заработать55
  • SaaS-сервис автоматической деслопизации текстов: прогоняет выход LLM, убирает шаблоны, водянистость и маркеры. Подписка для маркетологов и копирайтеров.
  • Промпт-маркетплейс с оценкой по Slop Index: продажа промптов не по хайпу, а по объективной метрике естественности. Валидация через открытый бенчмарк.
  • Консалтинг для контент-команд: аудит AI-пайплайнов, настройка промптов и файн-тюн под конкретный бренд-войс. Дорого, B2B, повторяющиеся контракты.
  • Плагин для редакторов (Notion, Google Docs): подсвечивает шаблонные фразы и AI-маркеры в реальном времени. Фримиум модель.
  • AI-детектор для HR и образования на основе Slop Index — не на водяных знаках, а на стилистических паттернах. Альтернатива Turnitin.
  • Модели быстро адаптируются: через полгода новые версии научатся обходить текущие метрики слопа, и бенчмарк устареет.
  • Субъективность human preference: выборка оценщиков может быть смещена, и результаты не масштабируются на другие аудитории и языки.
  • Размер датасета 112 сценариев мал для статистически значимых выводов — нужны тысячи примеров для устойчивости.
  • Открытость бенчмарка означает, что вендоры моделей начнут целенаправленно оптимизироваться под него, повторив цикл Гудхарта.

Это редкий случай, когда энтузиаст делает то, что должны были крупные лаборатории: честный публичный бенчмарк без LLM-судей и маркетинговой шелухи. Результаты бьют по самолюбию вендоров — Fable технически хорош, но людям противен. Вывод простой: гонка за MMLU и HumanEval убивает читабельность. Модели учатся врать бенчмаркам, а не писать для людей.

На практике это значит две вещи. Первое: если вы строите контент-продукт, не верьте рекламным цифрам — тестируйте на живых людях или используйте этот индекс. Второе: рынок созрел для инструментов второго порядка — деслопизаторов, стилистических корректоров, промпт-оптимизаторов. Просто API GPT уже не конкурентное преимущество, нужна обёртка с мозгами.

Ещё по теме

Комментарии