Я попытался доказать превосходство одной AI-модели над другой. Вот что произошло на самом деле
Автор решил сравнить две AI-модели (ChatGPT и Kimi K3) не по бенчмаркам, а на реальной задаче — поиске багов в коде. Он подготовил программу с неочевидной race condition в асинхронном rate limiter'е и прогнал одинаковый запрос через каждую модель по три раза, получив неожиданные результаты.
Тем, кто использует AI для code review или отладки, интересно узнать, как модели справляются с неочевидными багами в реальном коде, а не синтетических бенчмарках. Методология тестирования может быть полезна для собственных экспериментов.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Автор тестировал модели на реальном коде с race condition — баге, который проявляется только при конкурентной нагрузке
- Методология включала три независимых прогона для каждой модели с чистой историей чата
- Результат оказался неожиданным для автора (детали не раскрываются в превью)
Инструменты из статьи
Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.
Доступ из РФ →Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии