#бенчмарк

И инструменты ·3 авг 2026

Как правильно тестировать мультимодальные AI-модели: разбираем PerceptionBench пошагово

Moonshot выпустил PerceptionBench — бенчмарк для тестирования визуального восприятия AI-моделей (OCR, подсчёт объектов, пространственное понимание, галлюцинации). Статья показывает полный пайплайн: от загрузки данных до оценки моделей через API или локально, с автоматическим судейством и статистикой по confidence intervals.

0 105
И инструменты ·29 июл 2026

Малые локальные LLM с правильной оркестрацией решают задачи вдвое лучше: исследование на 100 кейсах

Инженер протестировал методы оркестрации на небольших open-source моделях (1.2B–26B параметров). 90% техник не сработали, но оставшиеся 10% удвоили процент выполненных задач — с 15% до 32% на LFM 1.2B, до 56% на Gemma 4 26B. Вывод: проблема малых моделей не в весах, а в плохой инженерной обвязке.

0 107
И инструменты ·27 июл 2026

Speculative decoding на Qwen3.6-27B: чем тяжелее квантизация, тем выше прирост скорости

Бенчмарк speculative decoding на Qwen3.6-27B показал парадоксальный результат: чем меньше сжата модель (Q8 против Q4), тем больший прирост даёт спекулятивная генерация. DFlash — самый быстрый алгоритм в общем случае, MTP — стабильная альтернатива, EAGLE3 и ngram проигрывают. Результаты справедливы для узкого сценария (короткие выходы, один поток), под нагрузкой выигрыш сожмётся.

0 117
М модели ·27 июл 2026

KAT-Coder-V2.5-Dev обошёл Qwen 3.6 по эффективности в реальных задачах кодирования

Независимое сравнение 35B-моделей для автономного кодирования (120 прогонов) показало: KAT-Coder-V2.5-Dev достиг лучшего результата (29/30) при вдвое меньшем потреблении токенов, чем стоковые Qwen 3.5/3.6. Ornith показал хуже своей базы из-за технических ошибок, а не знаний. Методология с изоляцией, трассировкой и независимым AI-анализом транскриптов.

0 98
И инструменты ·3 авг 2026

Google OKF против обычного RAG: разработчик сравнил на 60 документах — оба провалились

Разработчик протестировал новый формат Google OKF (структурированные markdown-файлы со связями) против классического vector RAG на одних данных. RAG ответил верно на 2 из 7 вопросов, OKF — на 3, гибрид — на 4. Главная проблема: векторный поиск топит свежие короткие документы под устаревшими длинными (актуальный спек на 500 символов проиграл deprecated-доку на 4000), а OKF бессилен против длиннохвостых запросов по тикетам.

0 20
И исследования ·27 июл 2026

Apple представила GH-ESD: новый подход к поиску систематических ошибок в компьютерном зрении

Исследователи Apple разработали GH-ESD — фреймворк для выявления «срезов ошибок» (систематических сбоев) в моделях компьютерного зрения на уровне отдельных объектов. Метод использует языковые модели для генерации гипотез об ошибках, затем проверяет их через визуально-языковые модели и статистический анализ. На новом бенчмарке GESD для задач детекции объектов GH-ESD показал точность 0.73 против 0.63 у базовых методов.

0 26