#production

И инструменты ·6 авг 2026

Как работает vLLM: разбор системы высокопроизводительного инференса LLM

Детальный разбор vLLM — движка для быстрого запуска больших языковых моделей. Объясняет ключевые техники: paged attention для экономии памяти, continuous batching для одновременной обработки запросов, chunked prefill для длинных промптов и prefix caching для переиспользования общих частей запросов. Показывает, как система масштабируется от однопроцессного инференса до multi-GPU кластера.

0 112
И инструменты ·9 авг 2026

Почему AI-агенты для кода не могут отлаживать продакшен: проблема наблюдаемости против генерации

AI-агенты умеют читать код и генерировать патчи, но в реальных системах баги часто связаны с окружением: упавшие сервисы, порты, таймауты, переменные. Автор предлагает сместить фокус с улучшения моделей на их интеграцию с observability-инструментами: логами, метриками, трейсингом. Вопрос — как правильно подавать runtime-данные в контекст агента и не дать ему действовать на основе неполной информации.

0 35
И инструменты ·24 июл 2026

Выбор RAG-фреймворка под задачу, а не по инерции: разбор альтернатив LangChain

Автор делится опытом аварийного отказа системы на LangChain из-за транзитивных зависимостей и непрозрачности абстракций. Главная мысль: не бывает «одного фреймворка для всего» — выбирать нужно под конкретную нагрузку, а не по популярности.

0 108
И инструменты ·23 июл 2026

Неделю винил AI-модель, а проблема была в одной вставке в базу данных

Разработчик API для извлечения данных из документов обнаружил, что главный источник задержки — не медленный вызов vision LLM (3 секунды), как он предполагал, а одна операция записи в Postgres, которая занимала 1,2 секунды вместо ожидаемых 50-150 миллисекунд. Детальное профилирование показало, что «очевидный виновник» не всегда оказывается реальной проблемой.

0 116
И исследования ·26 июл 2026

Taobao показала RecGPT-V3: рекомендации на LLM с памятью, гибридной модальностью и скрытым reasoning

Alibaba выпустила технический отчёт о RecGPT-V3 — продакшен-системе рекомендаций для Taobao на базе LLM. Ключевые новшества: постоянная память пользователя (Memory Hub), гибридная работа с текстом и семантическими ID товаров, скрытый reasoning вместо явного chain-of-thought. В A/B-тестах: CTR +1%, GMV +3.97%, потребление ресурсов −52.4%.

0 71
И инструменты ·29 июл 2026

Умный ассистент поддержки: не запускать, пока не протестируешь

Команда CrowdFarming запустила мультиязычного ассистента клиентской поддержки на базе LLM, который работает с заказами, каталогом и консультирует по уходу за органическими продуктами. Статья описывает архитектуру системы с разделёнными агентами, строгим контролем через код и обширным тестированием перед выходом в продакшн.

0 41
И инструменты ·22 июл 2026

2000 часов с AI-помощником: почему его успехи и провалы имеют одну причину

Разработчик без опыта программирования потратил 7 месяцев и 2000+ часов на создание платформы с помощью AI. Он выделил 6 повторяющихся типов ошибок: «пластырные» решения, необоснованные предположения, незаметный дрейф задачи, галлюцинации, отсутствие здравого смысла и выбор лёгкого пути вместо правильного. Главная проблема — уверенность AI не связана с реальной проверкой истины, и даже улучшенные модели не избавлены от этих паттернов.

0 44
И инструменты ·22 июл 2026

Я создал 5 генеративных AI-ботов за 30 дней: что сломалось в продакшене

Автор за месяц запустил пять разных AI-ботов (от поддержки до голосовых FAQ) на одном стеке (Dialogflow CX, Vertex AI, RAG). Каждый бот ломался по-своему: галлюцинации создавали несуществующие политики возврата, контекст терялся, векторный поиск выдавал мусор. Статья — это отчёт о реальных проблемах в продакшене и конкретных решениях.

0 44