исследования 1 мин

ASCIITermDraw-Bench: новый бенчмарк проверяет, умеют ли AI-модели рисовать схемы текстом

Исследователи представили ASCIITermDraw-Bench — бенчмарк из 80 задач для оценки способности мультимодальных моделей создавать и редактировать диаграммы в формате ASCII. Лучшие результаты показали Gemini-4-31B-IT (73.8%) и Qwen3.7-Plus (70.2%). Оказалось, что модели могут описывать схемы словами, но точно расставить блоки, стрелки и связи — отдельная сложная задача.

ASCII-диаграммы — быстрый и универсальный способ визуализации в коде, документации и чатах. Если AI-ассистенты научатся их генерировать и редактировать, это ускорит работу с архитектурой и инфраструктурой без переключения на графические инструменты.

Новый бенчмарк проверяет AI на умение «рисовать» текстом

Исследователи представили ASCIITermDraw-Bench — специализированный бенчмарк для оценки способности Vision Language Models (VLM) создавать и редактировать диаграммы в формате ASCII — то есть используя только обычные текстовые символы.

Зачем это нужно

Вопрос простой: нужен ли графический редактор, чтобы быстро набросать архитектуру системы, топологию сети или схему кластера? Авторы предполагают, что старый добрый ASCII может быть достаточно — если AI-ассистент научится его понимать и генерировать.

Что тестируют

Бенчмарк включает 80 задач четырёх типов: - Базовые блоки и раскладки - Сетевые топологии - Архитектурные диаграммы ПО - Редактирование существующих схем по инструкции (с сохранением неизменённых частей)

Как оценивают

Каждый ответ получает два балла: - Структурный: проверяет наличие всех требуемых элементов, связей и меток - Семантический: выставляется LLM-судьёй (5 раз на задачу для снижения дисперсии)

Финальный результат агрегируется по всем задачам с 95% доверительным интервалом.

Результаты

Лидеры: 1. Gemini-4-31B-IT — 73.8% (±4.1) 2. Qwen3.7-Plus — 70.2% (±4.6) 3. Kimi-K2.6 — 61.8% (±6.0)

Даже топовые модели справляются с задачей на 70-75%, что указывает на реальную сложность: описать диаграмму словами модели могут, а вот точно расставить символы в пространстве — совсем другая история.

Бенчмарк открыт на Hugging Face.

Ключевые выводы

  • Создание ASCII-диаграмм — отдельная задача, требующая пространственного мышления, а не только понимания текста
  • Даже лучшие VLM справляются с ASCII-рисованием только на 70-75%, показывая разрыв между вербальным и визуальным синтезом
  • Редактирование существующих схем с сохранением контекста — самая сложная категория задач
  • Двойная оценка (структурная + семантическая) снижает субъективность и повышает воспроизводимость результатов
  • Бенчмарк открывает новое направление тестирования моделей на задачах, близких к реальной работе разработчиков
бенчмаркиVLMASCIIтестирование моделейвизуализация

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

**Это тот редкий случай, когда бенчмарк тестирует что-то реально полезное.** ASCII-диаграммы — не академическая экзотика, а то, чем ежедневно пользуются разработчики: набросать архитектуру в Slack, запротоколировать топологию в Markdown, объяснить структуру в коммите. И вот оказывается, что даже Gemini 4 справляется с этим только на 3 из 4 раз.

Особенно интересно, что провал случается не на понимании (модели отлично *описывают* диаграммы), а на точном позиционировании символов. Это показывает фундаментальный разрыв: языковая модель мыслит последовательностями токенов, а ASCII-арт — это двумерная сетка с пространственными отношениями. Хорошая проверка того, где у современных VLM реальные границы возможностей.

Ещё по теме

Комментарии