модели 1 мин

Claude Opus 5: максимальная «вдумчивость» убивает код — Anthropic сама это признаёт

У Claude Opus 5 есть настройка «усилий» от low до max, но выше уровня high качество кода падает. Модель начинает переусложнять, рефакторить не по делу и галлюцинировать чаще. Anthropic сама предупреждает об этом в документации, а независимые тесты подтверждают: на FrontierCode точность снижается, на CodeRabbit — больше придирок, меньше реальных багов. При этом даже на минимальной настройке Opus 5 обгоняет конкурентов.

Если вы уже интегрировали Opus 5 и включили max по умолчанию, вы платите больше за худший результат. Это касается code review, автодополнения, рефакторинга — всего, где модель пишет или правит код.

Больше усилий ≠ лучше код

Claude Opus 5 получила пять уровней «вдумчивости»: low, medium, high, xhigh и max. Интуиция подсказывает крутить на максимум, но для кода это ошибка.

На бенчмарке FrontierCode точность начинает падать после уровня high. Модель вместо решения задачи начинает рефакторить код за пределами запроса и переусложнять решение. Это не догадки извне — сама Anthropic предупреждает в миграционной документации: на простых задачах высокие настройки дают «overthinking» и снижение отдачи.

Цифры не врут

Закрытый бенчмарк AA-Omniscience: Opus 5 на 11% точнее Opus 4.8, но галлюцинирует на 6% чаще. Больше рассуждений = больше шансов уверенно ошибиться.

CodeRabbit протестировал xhigh на реальном code review: - Точность полезных комментариев выросла: 39,3% vs 35,2% - Но реальных багов поймал меньше: 55,2% vs 61,1% - Количество придирок к мелочам выросло в четыре раза

Низкий старт уже впереди всех

На AutomationBench от Zapier Opus 5 на минимальной настройке проходит больше задач, чем любая другая модель вообще. Для большинства задач базовый уровень — уже избыточен.

Что ещё осталось за кадром

Когда safety-классификатор в Claude.ai, Claude Code или Cowork срабатывает на запрос, система молча откатывается на Opus 4.8. Именно так Anthropic запускала собственный Frontier-Bench. Сколько запросов это затрагивает — не раскрыто.

Вывод: свой потолок для каждого кодбейза придётся искать руками. Универсальной карты нет, а max по умолчанию — не только дороже, но и рискованнее.

Ключевые выводы

  • Выше уровня «high» качество кода у Opus 5 падает из-за переусложнения и лишних правок
  • На минимальной настройке Opus 5 уже обгоняет конкуренцию, высокие уровни нужны не всегда
  • Больше «мышления» = выше риск галлюцинаций (на 6% по сравнению с Opus 4.8)
  • Claude молча переключается на Opus 4.8 при срабатывании safety-фильтров, масштаб неизвестен
  • Оптимальный уровень effort зависит от кодбейза и контекста, универсального рецепта нет

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

Вот это поворот: модель, которую все крутят на максимум, работает лучше на середине шкалы. И это не баг, а фича — Anthropic сама признаёт, что «больше думания» на простых задачах ведёт к overthinking. В коде это выглядит как рефакторинг ради рефакторинга, придирки к отступам вместо поиска багов и галлюцинации на ровном месте.

Что реально настораживает: никто не знает, как часто Claude молча переключается на старую версию из-за safety-фильтров. Вы платите за Opus 5, а получаете Opus 4.8 — и узнаете об этом только из сносок к чартам Anthropic. Прозрачности ноль. Пока что совет один: тестируйте на своём коде, ищите свой потолок и не верьте, что max = best.

Инструменты из статьи

Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...

Доступ из РФ →

Ещё по теме

Комментарии