#self-hosting

Б бизнес ·20 авг 2026

Скрытая наценка за безопасность: корпоративные фильтры добавляют 25-35% к счёту за AI и никто об этом не говорит

Коммерческие AI-модели (GPT-4, Claude, Gemini) незаметно съедают четверть вашего бюджета на токены: каждый запрос несёт 800-2500 токенов системных инструкций и фильтров безопасности. Плюс ложные отказы на 11-22% легитимных запросов в академической и корпоративной работе. Собственная инфраструктура на открытых моделях окупается за 7-9 месяцев и экономит 60% за три года.

0 62
И инструменты ·25 июл 2026

Что может AI-агент на ноутбучной видеокарте с 4 ГБ: эксперимент с Qwen на RTX 3050 Ti

Разработчик AI-воркспейса Bike4Mind показал, как работает полноценный локальный AI-агент (с инструментами, RAG, генерацией артефактов и мультимодальностью) на ноутбучной RTX 3050 Ti с 4 ГБ видеопамяти. Qwen3.5:2b выдаёт 96 токенов/сек и умещается в память с запасом, но для генерации кода приходится переключаться на специализированную модель, а эмбеддер и чат-модель не помещаются одновременно. Главный вывод: 4 ГБ хватает для полноценной работы, но с компромиссами в выборе моделей.

0 118
И инструменты ·29 июл 2026

Как создавать эмбеддинги бесплатно и навсегда

Автор объясняет, почему облачные API для эмбеддингов (OpenAI, Cohere, Google) никогда не будут бесплатными в масштабе, и предлагает альтернативу: запуск open-source моделей на собственном железе. Приводит конкретные модели, код для быстрого старта и варианты самостоятельного хостинга векторных баз.

0 87
И инструменты ·4 авг 2026

Llama.cpp ускорили на 4-8% за счёт переноса сэмплинга на GPU

В llama.cpp добавили опцию переноса сэмплирования токенов с CPU на GPU при использовании MTP (multi-token prediction). На RTX 5090 прирост скорости достигает 8%, на старой Tesla P40 — 4%. Это самое заметное улучшение производительности локального инференса за последнее время.

0 18
И инструменты ·26 июл 2026

Как я развернул Langfuse у себя, чтобы перестать платить за чужие серверы

Команда достигла 100K трейсов LLM в месяц, и облачный тариф Langfuse стал заметной статьёй расходов. Автор описывает опыт самостоятельного развёртывания open-source версии Langfuse на собственной инфраструктуре — от первого запуска за полдня до production-ready решения за неделю.

0 17