модели 1 мин

Я попытался доказать превосходство одной AI-модели над другой. Вот что произошло на самом деле

Автор решил сравнить две AI-модели (ChatGPT и Kimi K3) не по бенчмаркам, а на реальной задаче — поиске багов в коде. Он подготовил программу с неочевидной race condition в асинхронном rate limiter'е и прогнал одинаковый запрос через каждую модель по три раза, получив неожиданные результаты.

Тем, кто использует AI для code review или отладки, интересно узнать, как модели справляются с неочевидными багами в реальном коде, а не синтетических бенчмарках. Методология тестирования может быть полезна для собственных экспериментов.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Автор тестировал модели на реальном коде с race condition — баге, который проявляется только при конкурентной нагрузке
  • Методология включала три независимых прогона для каждой модели с чистой историей чата
  • Результат оказался неожиданным для автора (детали не раскрываются в превью)
сравнение моделейcode reviewтестирование AIrace conditionasyncio
Артём Ковалёв Medium #artificial-intelligence
Читать оригинал

Инструменты из статьи

Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.

Доступ из РФ →

Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...

Доступ из РФ →

Ещё по теме

Комментарии