#оценка моделей

И исследования ·7 авг 2026

TutorMoments: почему AI-репетиторы слишком много подсказывают и как это измерить

Исследователи из Allen AI создали TutorMoments — фреймворк для оценки главной проблемы AI-репетиторов: они слишком много помогают вместо того, чтобы дать ученику думать самому. Тестирование на реальных сессиях показало, что современные LLM переоценивают поддержку и редко подталкивают к самостоятельному решению — даже когда это нужнее всего.

0 122
Б безопасность ·2 авг 2026

Тесты безопасности устаревают быстрее, чем модели

Бенчмарк по безопасности ИИ может давать воспроизводимые результаты и при этом быть бесполезным для принятия решений. Его срок годности определяется не датой релиза модели, а скоростью изменения контекста: определения рисков, паттернов атак, способов использования и окружающей системы.

0 125
И исследования ·27 июл 2026

Видеогенераторы назвали world models, но проверяют их по принципу «нравится — не нравится»

Термин «world model» незаметно сменил значение: раньше так называли системы, понимающие физику мира, теперь — любой видеогенератор с хорошим маркетингом. Вендоры вроде Black Forest Labs публикуют внутренние тесты предпочтений (77% пользователей выбрали наше видео против Runway), но эти цифры невоспроизводимы, непроверяемы и ничего не говорят о реальном понимании физики. Когда такие модели подключат к роботам или беспилотникам, процент «красивых» видео не предскажет, как система поведёт себя в реальности.

0 116
И исследования ·30 июл 2026

Как повторные запуски выявляют нестабильность, скрытую за единичной демонстрацией

Одна успешная генерация языковой модели не гарантирует повторяемости результата. Статья показывает, что даже при «детерминированных» настройках (температура=0, фиксированный seed) модели выдают разные ответы на идентичные запросы из-за особенностей API, численной точности и конфигурации инфраструктуры.

0 88
И исследования ·23 июл 2026

Долг прозрачности: как недокументированные обновления моделей подрывают доверие

Когда языковая модель обновляется без чёткой фиксации версий, организации теряют возможность отследить, какая именно система проходила оценку. Результаты тестов становятся несопоставимыми, а выводы — ненадёжными. Это создаёт «долг прозрачности»: накопленное бремя необъяснимых изменений, которое разрушает аудируемость и воспроизводимость исследований.

0 86
М модели ·22 июл 2026

Gemini 3.6 Flash: когда улучшение на бумаге не гарантирует апгрейд в продакшене

Google выпустил Gemini 3.6 Flash с улучшениями на бенчмарках и на 17% меньшим расходом токенов. Но ранние тесты показывают возможные регрессии в генерации интерфейсов и пространственном мышлении. Автор предлагает методологию, как правильно тестировать новую модель перед апгрейдом: заморозить промпты и настройки, прогнать на реальных задачах, установить чёткие критерии отказа заранее — и использовать роутинг, а не слепую замену.

0 68
И исследования ·22 июл 2026

Может ли некоммерческая организация воспроизвести оценку frontier-модели при скромном бюджете?

Исследовательский центр TAIRC разбирает, как некоммерческие организации могут проверять заявления разработчиков AI-моделей при ограниченном бюджете. Главный тезис: воспроизвести отдельное измерение возможно и недорого (десятки долларов за API-вызовы), но это не заменяет полноценную валидацию модели, а дорогая часть — не токены, а методология оценки.

0 67