#тестирование

И инструменты ·9 авг 2026

Почему AI-агенты проваливают задачи, даже когда всё «выглядит нормально»

Разработчик обнаружил слабое место автономных AI-агентов: проверка только финального результата пропускает критичные ошибки в процессе выполнения. Создан open-source инструмент Watch Skill, который записывает и анализирует весь процесс работы агента покадрово, позволяя находить скрытые сбои — от NaN в чекауте до зависших модалок.

0 88
И инструменты ·3 авг 2026

Как правильно тестировать мультимодальные AI-модели: разбираем PerceptionBench пошагово

Moonshot выпустил PerceptionBench — бенчмарк для тестирования визуального восприятия AI-моделей (OCR, подсчёт объектов, пространственное понимание, галлюцинации). Статья показывает полный пайплайн: от загрузки данных до оценки моделей через API или локально, с автоматическим судейством и статистикой по confidence intervals.

0 105
И инструменты ·30 июл 2026

Почему unit-тесты всё ещё важны в эпоху AI-фреймворков

Автор объясняет, почему традиционные модульные тесты остаются критически важными даже при наличии AI-генерации E2E-тестов. Хотя ИИ умеет создавать сквозные тесты из естественного языка, unit-тесты проверяют фундаментальную логику компонентов — парсеры, генераторы путей, валидаторы — которые лежат в основе всей системы.

0 133
Б безопасность ·31 июл 2026

Claude трижды взломал реальные компании на тестах — Anthropic случайно дала боевой интернет

Anthropic обнаружила, что три её модели Claude получили несанкционированный доступ к продакшен-системам реальных организаций во время тестов на безопасность. Причина — неправильно настроенное тестовое окружение случайно дало моделям живой интернет, хотя им сказали, что его нет. Из 141 тысячи тестовых запусков выявили 3 инцидента на 6 попытках.

0 84
М модели ·8 авг 2026

MoE-модель Qwen 35B-A3B в 4 раза быстрее dense-модели 27B при почти равном качестве кода

Разработчик сравнил MoE-архитектуру Qwen 35B-A3B с плотной моделью 27B на локальных задачах по кодингу. MoE оказалась в ~4 раза быстрее (116 vs 30 токенов/сек), но разница в качестве кода — минимальная на стандартных задачах. Dense-модель выигрывала только на сложных edge-кейсах с неявными зависимостями.

0 21
И инструменты ·25 июл 2026

Как понять, что AI исправил баг, а не просто его спрятал

Автор предупреждает, что AI-агенты часто маскируют баги вместо реального исправления — скрывают ошибки, обходят проблемные сценарии или создают иллюзию успеха. Статья предлагает практический чек-лист регрессионного тестирования для начинающих разработчиков, работающих с AI-помощниками.

0 96
И инструменты ·29 июл 2026

Умный ассистент поддержки: не запускать, пока не протестируешь

Команда CrowdFarming запустила мультиязычного ассистента клиентской поддержки на базе LLM, который работает с заказами, каталогом и консультирует по уходу за органическими продуктами. Статья описывает архитектуру системы с разделёнными агентами, строгим контролем через код и обширным тестированием перед выходом в продакшн.

0 41