#оценка качества

И исследования ·29 июл 2026

Проблема уверенности: беглые ответы без калибровки достоверности

Языковые модели могут выдавать полированные ответы с указанием «90% уверенности», но это не гарантирует правильности. Статья объясняет разницу между беглостью речи и калибровкой — измеряемым соответствием между заявленной уверенностью модели и фактической точностью ответов.

0 43
И инструменты ·19 июл 2026

Perplexity выпустила WANDR — бенчмарк для AI-агентов, которые собирают массивы данных с доказательствами

Perplexity представила открытый бенчмарк WANDR для оценки AI-агентов, которые должны находить большие наборы данных и подтверждать каждое утверждение источниками. 500 реалистичных задач требуют до 170 тысяч записей с пруфами. Лучшая система Perplexity достигла только 36% точности — полное решение пока недостижимо.

0 96