Рынок AI-инференса: технический разбор и сравнение провайдеров
Автор раскладывает по полочкам экономику и технологию облачного инференса LLM. Объясняет, почему выходные токены дороже входных, как батчинг снижает затраты в 4 раза, и почему сравнивать цены за токен и за GPU-час бессмысленно без учёта утилизации. Приводит конкретные цифры: кто сколько привлёк, кто как быстро растёт, и какие технические трюки применяет.
Если вы выбираете провайдера инференса, внедряете LLM в продукт или работаете с GPU-инфраструктурой — статья даёт чёткую модель затрат, технических ограничений и рыночной динамики. Автор собрал цифры (валюации, цены, throughput), которых нет в маркетинговых материалах.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- CoreWeave/Nebius продают голое GPU-время, Fireworks/Together/Baseten — управляемый инференс за токены; это разные юнит-экономики и разные покупатели
- Скорость инференса ограничена пропускной способностью памяти (memory bandwidth), а не вычислительной мощностью — поэтому квантизация (FP16→FP8→FP4) ускоряет в 2+ раза, а батчинг снижает стоимость токена в ~4 раза
- Оценки стартапов взлетели: Fireworks — с $552M до $17.5B за два года (ARR $1B+), Together — $8.3B, Baseten — до $13B; NVIDIA купила Groq за ~$20B и одновременно финансирует конкурентов
- Реальный рынок — мультивендорный: предприятия используют в среднем 3.1 провайдера через агрегаторы (OpenRouter, LiteLLM, Portkey), переключения редки (~11%)
Инструменты из статьи
AI-редактор кода на базе VS Code: автодополнение, агентный режим, работа с...
Доступ из РФ →AI-поиск с источниками: отвечает на вопросы со ссылками на первоисточники.
Доступ из РФ →
Комментарии