#мультимодальные модели

И исследования ·15 авг 2026

Лучшие AI-модели проваливают тесты на базовое зрение — GPT-4o достигает только 60% точности

Moonshot AI выпустила PerceptionBench — бенчмарк, который изолированно тестирует визуальное восприятие мультимодальных моделей без примеси логики. Ни одна топовая модель не дотянула до 60% точности. GPT-4o показал лучший результат (59.7%), Kimi K1.5 — 58.5%, Claude Sonnet 3.5 — 57.2%. Открытые модели отстают ещё сильнее. Выяснилось: большинство «ошибок рассуждения» на самом деле происходят на этапе чтения картинки.

0 130
И инструменты ·12 авг 2026

Google DeepMind встроила перевод жестового языка в Pixel 11 — первый AI для глухих в массовом телефоне

Google DeepMind выпустила SL2T — модель перевода американского жестового языка в текст, встроенную в Gboard и Live Transcribe на Pixel 11. Это первый случай, когда AI для жестового языка попал в коммерческий смартфон. Работает везде, где обычно набирают текст: поиск, сообщения, запросы к Gemini.

0 115
И исследования ·11 авг 2026

Google показала AMIE (Video) — AI-врача, который в реальном времени проводит видеоконсультации на уровне экспертов

Google Research представила AMIE (Video) — AI-систему на основе Gemini и Project Astra, которая проводит клинические консультации по видеосвязи в реальном времени. В рандомизированном исследовании с 300 живыми сессиями и 30 врачами-терапевтами система показала экспертный уровень: считывает невербальные сигналы, направляет пациента через физический осмотр и рассуждает диагностически. Используется трёхагентная архитектура, где один агент поддерживает беседу, второй анализирует аудио и видео, третий проводит глубокое клиническое рассуждение — всё параллельно, без задержек в диалоге.

0 137
М модели ·10 авг 2026

ByteDance выпустил SeedRealtime: первую полнодуплексную мультимодальную модель, которая видит, слушает и говорит одновременно

ByteDance представил SeedRealtime — audio-visual LLM, работающую в режиме реального времени без промежуточных звеньев вроде ASR и TTS. Модель умеет распознавать лица, прерывать пользователя при ошибках, проактивно напоминать о чём-то на экране и поддерживать естественный разговор с видеопотока. Уже работает в приложении Doubao, но без открытых весов и API для сторонних разработчиков.

0 90
И инструменты ·11 авг 2026

Как запустить MiniMax-H3 для генерации видео и аудио через ComfyUI API: полный гайд

Вышел детальный туториал по интеграции MiniMax-H3 (мультимодальная генерация видео+аудио) с ComfyUI через HTTP/WebSocket API. Автор показывает, как программно настроить окружение, скачать веса моделей с Hugging Face, построить граф выполнения в Python и запустить генерацию без GUI — с поддержкой разных режимов (text-to-video, conditioned generation) и профилей под разный объём видеопамяти (от 20 до 70+ ГБ).

0 66
И инструменты ·4 авг 2026

MiniMax-H3 на Apple Silicon: генерация видео за 45 минут на MacBook — первый опыт

MiniMax выпустили H3 — мультимодальную модель для генерации 15-секундных видеороликов со звуком из текста, картинок, аудио и видео. Вышел порт для MLX, позволяющий запускать модель на Apple Silicon. На MacBook Pro M5 Max генерация видео заняла 45 минут, потребовалось 115 ГБ под модель. Качество видео впечатляет, но аудио без промпт-указаний получается невнятным.

0 118
И инструменты ·3 авг 2026

Как правильно тестировать мультимодальные AI-модели: разбираем PerceptionBench пошагово

Moonshot выпустил PerceptionBench — бенчмарк для тестирования визуального восприятия AI-моделей (OCR, подсчёт объектов, пространственное понимание, галлюцинации). Статья показывает полный пайплайн: от загрузки данных до оценки моделей через API или локально, с автоматическим судейством и статистикой по confidence intervals.

0 105
И исследования ·23 июл 2026

GPT-5.5 провалил новый визуальный тест: 10,6% против 96,1% у людей

Новый бенчмарк ActiveVision показал критический провал передовых AI-моделей в задачах, требующих повторного анализа изображений. GPT-5.5 справился лишь с 10,6% заданий, Claude Fable 5 — с 3,5%, в то время как люди показали 96,1%. Ключевой момент: модели не могут исправить ситуацию даже написав собственный код для решения задач.

0 134
И инструменты ·31 июл 2026

Заявление — это не контроль

MiniMax представила мультимодальную модель H3 с обещаниями длинных роликов, стереозвука и низкой цены. Автор напоминает, что коммерческим командам недостаточно красивых демо — нужна проверка качества вывода, надёжности процесса, прав на данные и реальной стоимости, прежде чем внедрять инструмент в платную работу.

0 57
М модели ·21 июл 2026

NVIDIA выпустила Cosmos 3 Edge — мировую модель на 4 млрд параметров для роботов без облака

NVIDIA представила Cosmos 3 Edge — компактную 4B-параметровую модель, которая работает локально на GPU и позволяет роботам понимать окружение, предсказывать результаты действий и генерировать команды управления в реальном времени. Модель объединяет два трансформера (для рассуждений и генерации) и поддерживает разные типы роботов — от манипуляторов до гуманоидов.

0 98