Qwen-Image-3.0 от Alibaba генерирует многостраничные инфографики и читаемый текст в 10 пикселей за один проход
Alibaba выпустила Qwen-Image-3.0 — генератор изображений, который создаёт сложные макеты с несколькими панелями, читаемым текстом размером до 10 пикселей и поддержкой 12 языков за один запрос. Модель нацелена на практические задачи: газетные полосы, учебные материалы, сложные инфографики с формулами и вложенными интерфейсами.
Показывает прогресс в точности генерации текста и сложных макетов, но ставит вопрос о реальной полезности статических изображений документов вместо редактируемых форматов.
Больше текста, больше деталей
Alibaba представила третью версию генератора изображений Qwen-Image-3.0. Если первая модель фокусировалась на точности, а вторая добавила разнообразие и эстетику, то новая нацелена на «реальность» — практическое применение в рабочих задачах.
Модель принимает промпты до 4500 токенов, что позволяет создавать плотные макеты за один проход. Демо-примеры включают сетку 3×3 с девятью отдельными инфографиками: от жизненного цикла печёночного сосальщика до теорем Силова для групп порядка 72. Каждая панель содержит текст, формулы и иллюстрации.
Вложенные интерфейсы и микротекст
Qwen-Image-3.0 справляется с вложенными интерфейсами: например, окно VSCode с чатом Qwen, внутри которого беседа WeChat с постером о кофе. Модель генерирует читаемый текст размером до 10 пикселей — в примерах есть инфографика про китовую акулу и полноценная страница вымышленной статьи по алгебраической геометрии с многострочными LaTeX-формулами.
Фотореализм и редактирование
Помимо текста, модель умеет в фотореалистичные портреты с видимыми порами и отдельными волосками. В одном из демо она восстанавливает повреждённую традиционную китайскую живопись, подбирая мазки кисти и оттенки туши.
Практическая ценность под вопросом
Модель поддерживает 12 языков, может интегрировать данные из интернета (например, прогноз погоды для Ханчжоу) и воссоздавать интерфейсы сайтов и игр. Доступна пока только через закрытое API.
Вопрос практической пользы остаётся открытым: научные статьи обычно пишут в LaTeX, а не генерируют картинками. То же касается газет и инфографик — редактируемые форматы удобнее для продакшена. Однако примеры показывают прогресс в рендеринге текста и намекают на возможные применения за пределами показанных демо.
Ключевые выводы
- Qwen-Image-3.0 генерирует сложные макеты с текстом до 10 пикселей и поддержкой 12 языков за один проход
- Модель справляется с вложенными интерфейсами и многострочными LaTeX-формулами
- Практическая ценность генерации статических изображений документов сомнительна — редактируемые форматы удобнее
- Прогресс в рендеринге текста может открыть применения за пределами текущих демо
- Доступ пока только через закрытое API, открытых весов не будет
Автор: Ксения Лаврова · Источник: the-decoder.com
С одной стороны, впечатляет: 10-пиксельный текст, вложенные интерфейсы, LaTeX-формулы — всё за один проход. С другой — зачем? Научные статьи пишут в LaTeX, газеты вёрстают в редактируемых форматах, инфографику правят по частям. Генерировать всё это картинкой — красиво для демо, но непрактично для реальной работы.
Возможно, есть ниши: быстрые мокапы, визуальные черновики, учебные материалы. Или это шаг к тому, чтобы AI сам генерил редактируемые форматы, а не просто картинки. Пока что Qwen-Image-3.0 — это впечатляющий технический прорыв в поисках убедительного use case. Доступ через закрытое API намекает, что и сама Alibaba пока не уверена, как это монетизировать.
Инструменты из статьи
Чат и открытые модели Alibaba. Один из лучших открытых вариантов для русского языка.
Доступ из РФ →
Комментарии