#vision AI

И инструменты ·3 авг 2026

Как правильно тестировать мультимодальные AI-модели: разбираем PerceptionBench пошагово

Moonshot выпустил PerceptionBench — бенчмарк для тестирования визуального восприятия AI-моделей (OCR, подсчёт объектов, пространственное понимание, галлюцинации). Статья показывает полный пайплайн: от загрузки данных до оценки моделей через API или локально, с автоматическим судейством и статистикой по confidence intervals.

0 105
И исследования ·3 авг 2026

Apple исследует alignment для мультимодальных LLM: как научить модели не галлюцинировать с картинками

Apple Machine Learning опубликовала исследование по alignment для мультимодальных LLM (MLLM). Главная проблема: модели галлюцинируют, выдавая ответы, не соответствующие изображению. Цель — научить их точнее понимать визуальный контекст и генерировать релевантные тексты.

0 76