Gemma 4 31B не может редактировать код: проблема точности при работе с файлами
Разработчик сообщает о систематической проблеме Gemma 4 31B при редактировании кода: модель постоянно ошибается в отступах и форматировании, из-за чего AI-инструменты отклоняют её правки. Проблема воспроизводится в разных системах (Goose, Copilot, Codex, Little Coder), несмотря на хорошие бенчмарки модели.
Если вы внедряете AI-инструменты для разработки или выбираете модель для локального использования — эта проблема сэкономит вам недели отладки. Бенчмарки не покажут вам подобных граблей.
Что произошло
Разработчик столкнулся с проблемой при использовании Gemma 4 31B (полная версия bf16 через VLLM) для редактирования кода. Модель показывает приличные результаты в бенчмарках, но в реальной работе постоянно зацикливается: пытается отредактировать файлы, но отправляет неправильный оригинальный текст — чаще всего ошибается в отступах и форматировании.
Из-за этого все AI-агенты (Goose, Copilot, Codex, Little Coder) отклоняют правки с сообщением «такого кода в файле нет». Проблема воспроизводится стабильно во всех протестированных системах, несмотря на обновлённый шаблон чата.
Это классический пример разрыва между синтетическими бенчмарками и реальным применением: модель может выдавать хороший код с нуля, но проваливается на задаче точного воспроизведения существующего кода для внесения изменений. Проблема особенно критична для AI-агентов, которые должны вносить правки в существующую кодовую базу.
Автор: Юлия Тарасова · Источник: reddit.com
Разработчикам. Если выбираете модель для кодинга локально — проверяйте не только генерацию с нуля, но и редактирование существующего кода. Gemma 4 31B показывает слабость в точном воспроизведении форматирования, что ломает работу с AI-агентами. Возможное решение — инструменты редактирования, игнорирующие отступы, или модели с лучшим instruction following типа DeepSeek Coder
Бизнесу. Кейс показывает, почему AI-агенты для кода пока сырые в проде: даже топовые open-source модели проваливаются на базовых задачах редактирования. Если строите продукт на базе LLM для работы с кодом — закладывайте время на валидацию и fallback-механизмы, иначе пользователи получат бесконечные циклы правок
Инвесторам. Разрыв между бенчмарками и реальной применимостью AI-моделей остаётся огромным. Это окно для стартапов, которые строят специализированные инструменты и обёртки, компенсирующие слабости базовых моделей — рынок AI Dev Tools далёк от насыщения
- Разработать AI-редактор кода, который работает с семантическими диффами вместо точного совпадения символов и отступов
- Создать специализированный inference-сервис с постобработкой для нормализации отступов и форматирования перед применением правок
- Файн-тюнить модели специально на датасетах редактирования кода (не генерации), где важна точность воспроизведения контекста
- Сделать плагин/инструмент для популярных AI-агентов с умной системой match, игнорирующей whitespace-различия
- Консалтинг по выбору и настройке LLM для реальных задач разработки — бенчмарки врут, нужна валидация на практике
- Бенчмарки AI-моделей не отражают реальное качество в продакшене — особенно для сложных workflow типа редактирования кода
- Open-source модели уровня Gemma 4 пока не дотягивают до качества проприетарных API для агентных задач
- Даже при правильной настройке (обновлённый chat template, bf16, VLLM) фундаментальные проблемы модели остаются
- Инструменты AI-агентов для кода ещё не стандартизированы — каждый решает одни и те же проблемы по-своему
Это отличная иллюстрация того, почему я скептически отношусь к хайпу вокруг AI-агентов для кода: даже базовая задача редактирования файлов ломается на всех популярных инструментах с одной и той же open-source моделью. Gemma 4 31B — не маргинальная модель, это топ от Google, и она показывает приличные цифры в бенчмарках. Но как только доходит до реального workflow, где нужно точно воспроизвести форматирование и внести правку — полный провал.
Причина проста: бенчмарки тестируют генерацию кода, а не редактирование. А это принципиально разные задачи. Для продакшн-применения AI в разработке нужны либо специализированные инструменты (семантические диффы, умные match-алгоритмы), либо модели, файн-тюненные именно на редактирование. Пока этого нет — будут костыли и разочарования. Зато для энтузиастов открывается куча возможностей сделать инструменты, которые реально работают.
Комментарии