#воспроизводимость

И исследования ·5 авг 2026

Научные статьи для ИИ вместо людей: хайп или новая эра исследований?

37 исследователей из ведущих университетов и техкомпаний предложили заменить традиционные научные статьи форматом ARA — Agent-Native Research Artifact, оптимизированным для ИИ-агентов. Авторы утверждают: ИИ стал полноценным соавтором, а не инструментом, и ему нужна своя инфраструктура. Главный аргумент — научные статьи теряют 80% информации о процессе исследования и не воспроизводимы без деталей.

0 109
И исследования ·3 авг 2026

Без кода — отказ: почему научные статьи по ML нельзя принимать без воспроизводимых результатов

Рецензент NeurIPS описал системную проблему: из 12 проверенных статей только одна содержала полный код, а в трёх из пяти частично опубликованных нашлись критические баги, которые обесценивали результаты. Предложение: автоматически отклонять работы без воспроизводимого кода.

0 88
И инструменты ·31 июл 2026

Точность 4B-модели прыгнула с 60% до 82% из-за дизайна промпта — без изменения весов

Эксперимент показал: одна и та же 4B-модель на задаче классификации Kubernetes-задач выдала точность 60% на плохом промпте и 82% на хорошем. Разница в 22 процентных пункта — только из-за структуры запроса: порядка правил, контекста, количества шагов рассуждений.

0 87
И исследования ·30 июл 2026

Как повторные запуски выявляют нестабильность, скрытую за единичной демонстрацией

Одна успешная генерация языковой модели не гарантирует повторяемости результата. Статья показывает, что даже при «детерминированных» настройках (температура=0, фиксированный seed) модели выдают разные ответы на идентичные запросы из-за особенностей API, численной точности и конфигурации инфраструктуры.

0 88
И исследования ·23 июл 2026

Долг прозрачности: как недокументированные обновления моделей подрывают доверие

Когда языковая модель обновляется без чёткой фиксации версий, организации теряют возможность отследить, какая именно система проходила оценку. Результаты тестов становятся несопоставимыми, а выводы — ненадёжными. Это создаёт «долг прозрачности»: накопленное бремя необъяснимых изменений, которое разрушает аудируемость и воспроизводимость исследований.

0 86
И исследования ·22 июл 2026

Может ли некоммерческая организация воспроизвести оценку frontier-модели при скромном бюджете?

Исследовательский центр TAIRC разбирает, как некоммерческие организации могут проверять заявления разработчиков AI-моделей при ограниченном бюджете. Главный тезис: воспроизвести отдельное измерение возможно и недорого (десятки долларов за API-вызовы), но это не заменяет полноценную валидацию модели, а дорогая часть — не токены, а методология оценки.

0 67