#оптимизация затрат

И инструменты ·21 авг 2026

Nvidia доказала: важна не модель, а «упряжка» агента — Claude Opus 5 набрал 100% на ARC-AGI-3

Nvidia показала, что для долгосрочных задач AI-агента важнее не сама модель, а «упряжка» (harness) — оболочка с памятью, инструментами и супервизором. Claude Opus 5 без неё дал 30% на бенчмарке ARC-AGI-3, с ней — 100%. OpenAI на том же тесте не дотянул до 10%, даже после твиков.

0 34
И инструменты ·20 авг 2026

Stripe покупает OpenRouter: единый роутер для 400+ AI-моделей и умное переключение провайдеров

Stripe купил OpenRouter — платформу, которая даёт доступ к 400+ моделям через один API и выбирает провайдера по цене, скорости и надёжности. Сделка объединяет маршрутизацию моделей с биллингом Stripe: разработчик пишет запрос, система сама решает, какую модель и у какого провайдера вызвать, учитывая бюджет, задержки и доступность. Это ответ на реальную боль: 52% компаний уже используют несколько моделей одновременно, а разница в цене у разных провайдеров на одну модель доходит до 10 раз.

0 107
И инструменты ·19 авг 2026

AWS показал, как не платить за простой Lambda при вызове AI-агентов: три асинхронных паттерна для Bedrock AgentCore

AWS опубликовал руководство по асинхронным вызовам AgentCore-агентов в serverless-пайплайнах. Проблема: Lambda синхронно ждёт ответа агента минуты, платишь за каждую секунду простоя. Решение: task-token callback, прямая интеграция Step Functions или durable functions — запустил агента, освободил compute, возобновил пайплайн по готовности. Экономия на compute идёт в разы.

0 75
И инструменты ·31 июл 2026

Почему мы удалили LLM-роутер: опыт Manifest после 7000 пользователей

Manifest запустил LLM-роутер в марте, а в июне его удалил. После 4 месяцев работы с 7000 пользователей выяснилось: экономия на inference оборачивается скрытыми затратами на поддержку, качество падает, а контекст задачи невозможно определить по одному промпту. Вывод: лучше один проверенный в бою LLM, чем умный роутинг.

0 88
И инструменты ·6 авг 2026

Фреймворки для AI-агентов: разница в цене до 3х, в скорости — вдвое

Composio протестировала DeepSeek V4 Flash на четырёх агентских фреймворках (Claude Code, Codex, OpenCode, Oh My Pi) на 30 реальных задачах. Результат: выбор обёртки вокруг модели меняет стоимость в 3 раза, скорость — в 2,2 раза. Claude Code самый быстрый (122 сек), но дорогой ($0.195 за задачу). OpenCode самый дешёвый ($0.073), но медленнее. Oh My Pi лидирует по проценту успешных задач (17/30), но самый медленный (272 сек).

0 30
И инструменты ·23 июл 2026

OpenAI берёт $10 за 1000 веб-поисков и впихивает 17к лишних токенов — разработчик показал, как сэкономить 87%

Разработчик измерил эффективность API веб-поиска OpenAI и обнаружил, что ~87% инжектируемых токенов (около 17 тысяч на запрос) не используются для ответа. Он создал локальный пайплайн с гибридным поиском, реранжированием и сжатием на уровне предложений — точность осталась на уровне 96%, но затраты на токены упали почти в 8 раз. Даже на 16 поисках экономия составила ~$1.50.

0 22
И инструменты ·22 июл 2026

Cursor Router: система маршрутизации AI-запросов экономит разработчикам до 50% без потери качества

Cursor выпустил Router — классификатор, который анализирует каждый запрос и отправляет его на оптимальную модель (простые задачи — на дешёвые, сложные — на frontier). Обучен на 600 тыс. реальных запросов, тестировался на миллионах живых сессий. Результат: экономия 30–50% при сохранении качества на уровне топовых моделей.

0 22