модели 1 мин

Qwen-Image-3.0 от Alibaba генерирует многостраничные инфографики и читаемый текст в 10 пикселей за один проход

Alibaba выпустила Qwen-Image-3.0 — генератор изображений, который создаёт сложные макеты с несколькими панелями, читаемым текстом размером до 10 пикселей и поддержкой 12 языков за один запрос. Модель нацелена на практические задачи: газетные полосы, учебные материалы, сложные инфографики с формулами и вложенными интерфейсами.

Показывает прогресс в точности генерации текста и сложных макетов, но ставит вопрос о реальной полезности статических изображений документов вместо редактируемых форматов.

Больше текста, больше деталей

Alibaba представила третью версию генератора изображений Qwen-Image-3.0. Если первая модель фокусировалась на точности, а вторая добавила разнообразие и эстетику, то новая нацелена на «реальность» — практическое применение в рабочих задачах.

Модель принимает промпты до 4500 токенов, что позволяет создавать плотные макеты за один проход. Демо-примеры включают сетку 3×3 с девятью отдельными инфографиками: от жизненного цикла печёночного сосальщика до теорем Силова для групп порядка 72. Каждая панель содержит текст, формулы и иллюстрации.

Вложенные интерфейсы и микротекст

Qwen-Image-3.0 справляется с вложенными интерфейсами: например, окно VSCode с чатом Qwen, внутри которого беседа WeChat с постером о кофе. Модель генерирует читаемый текст размером до 10 пикселей — в примерах есть инфографика про китовую акулу и полноценная страница вымышленной статьи по алгебраической геометрии с многострочными LaTeX-формулами.

Фотореализм и редактирование

Помимо текста, модель умеет в фотореалистичные портреты с видимыми порами и отдельными волосками. В одном из демо она восстанавливает повреждённую традиционную китайскую живопись, подбирая мазки кисти и оттенки туши.

Практическая ценность под вопросом

Модель поддерживает 12 языков, может интегрировать данные из интернета (например, прогноз погоды для Ханчжоу) и воссоздавать интерфейсы сайтов и игр. Доступна пока только через закрытое API.

Вопрос практической пользы остаётся открытым: научные статьи обычно пишут в LaTeX, а не генерируют картинками. То же касается газет и инфографик — редактируемые форматы удобнее для продакшена. Однако примеры показывают прогресс в рендеринге текста и намекают на возможные применения за пределами показанных демо.

Ключевые выводы

  • Qwen-Image-3.0 генерирует сложные макеты с текстом до 10 пикселей и поддержкой 12 языков за один проход
  • Модель справляется с вложенными интерфейсами и многострочными LaTeX-формулами
  • Практическая ценность генерации статических изображений документов сомнительна — редактируемые форматы удобнее
  • Прогресс в рендеринге текста может открыть применения за пределами текущих демо
  • Доступ пока только через закрытое API, открытых весов не будет
генерация изображенийtext-to-imageрендеринг текстаAlibabamultimodal AI

Автор: Ксения Лаврова · Источник: the-decoder.com

Мнение редакции

С одной стороны, впечатляет: 10-пиксельный текст, вложенные интерфейсы, LaTeX-формулы — всё за один проход. С другой — зачем? Научные статьи пишут в LaTeX, газеты вёрстают в редактируемых форматах, инфографику правят по частям. Генерировать всё это картинкой — красиво для демо, но непрактично для реальной работы.

Возможно, есть ниши: быстрые мокапы, визуальные черновики, учебные материалы. Или это шаг к тому, чтобы AI сам генерил редактируемые форматы, а не просто картинки. Пока что Qwen-Image-3.0 — это впечатляющий технический прорыв в поисках убедительного use case. Доступ через закрытое API намекает, что и сама Alibaba пока не уверена, как это монетизировать.

Инструменты из статьи

Qwen Chatбез VPN

Чат и открытые модели Alibaba. Один из лучших открытых вариантов для русского языка.

Доступ из РФ →

Ещё по теме

Комментарии