#тестирование AI

И инструменты ·22 июл 2026

Оценка AI без чёткой рубрики — это просто интуиция с дополнительными шагами

Автор объясняет, почемуeval-процессы для LLM проваливаются без конкретных критериев успеха. Большинство команд застревают на этапе «оно должно работать хорошо», не определив измеримые метрики и чёткую рубрику оценки до начала тестирования.

0 90
М модели ·20 июл 2026

Я попытался доказать превосходство одной AI-модели над другой. Вот что произошло на самом деле

Автор решил сравнить две AI-модели (ChatGPT и Kimi K3) не по бенчмаркам, а на реальной задаче — поиске багов в коде. Он подготовил программу с неочевидной race condition в асинхронном rate limiter'е и прогнал одинаковый запрос через каждую модель по три раза, получив неожиданные результаты.

0 87