#архитектура

И инструменты ·19 авг 2026

AWS показал, как не платить за простой Lambda при вызове AI-агентов: три асинхронных паттерна для Bedrock AgentCore

AWS опубликовал руководство по асинхронным вызовам AgentCore-агентов в serverless-пайплайнах. Проблема: Lambda синхронно ждёт ответа агента минуты, платишь за каждую секунду простоя. Решение: task-token callback, прямая интеграция Step Functions или durable functions — запустил агента, освободил compute, возобновил пайплайн по готовности. Экономия на compute идёт в разы.

0 75
И исследования ·19 авг 2026

FRONT 3.1: архитектура LLM с искусственным «телом» и внутренними потребностями

Независимый исследователь разработал концепцию AI-архитектуры FRONT 3.1, которая добавляет LLM непрерывное внутреннее состояние (голод, стресс, уверенность) и соматическую память. Идея: модели без «телесного» контекста не думают, а просто обрабатывают текст. Автор предлагает эксперимент, где две одинаковые модели с разной «жизненной историей» начнут принимать разные решения.

0 45
Б безопасность ·30 июл 2026

Второй LLM как «охранник» — настоящая защита или иллюзия безопасности?

Популярная схема защиты AI-агентов (основная модель → guard-модель → выполнение) не создаёт надёжного барьера: guardrail-модели подвержены тем же уязвимостям, что и основные, а настройка чувствительности превращается в игру с ложными срабатываниями. Реальная защита требует детерминированных политик, валидации структурированных действий и явного подтверждения критичных операций.

0 128
И инструменты ·31 июл 2026

Гибридная архитектура в AI (большая модель + локальные воркеры): где реально ломается эффективность

Разработчик поднял вопрос, который все обходят стороной: паттерн «большая модель-оркестратор через API + локальные модели-воркеры» звучит красиво, но где доказательства, что он эффективнее, чем просто одна большая локальная модель? Хочет реальных замеров: когда латентность и overhead оркестратора съедают весь выигрыш.

0 104
И исследования ·1 авг 2026

Границы искусственного интеллекта в архитектурной практике

Статья архитектора о фундаментальных ограничениях ИИ в проектировании зданий. Автор разбирает разницу между способностью ИИ генерировать убедительные изображения и реальным пониманием архитектуры как пространства для жизни людей.

0 90
И инструменты ·1 авг 2026

AI генерирует прототипы за минуты, но продакшен — всё ещё ваша головная боль

AI-инструменты вроде ChatGPT и Copilot создают рабочие прототипы за минуты, но путь от демки до боевой системы не стал короче. Проблемы масштабирования, безопасности, архитектуры и поддержки никуда не делись — их решает не модель, а инженер с фундаментальными знаниями. Спрос падает на тех, кто просто переводит задачи в код. Растёт спрос на тех, кто понимает систему целиком и использует AI как усилитель экспертизы, а не замену мышлению.

0 71
И инструменты ·1 авг 2026

Сколько инструментов должно быть в вашем MCP-сервере?

Автор делится практическим опытом разработки MCP-серверов (Model Context Protocol) и показывает, как количество инструментов влияет на точность выбора моделью нужного действия. Оказывается, больше — не значит лучше: уже при 200+ инструментах точность падает до 41-83%, а контекст съедает десятки тысяч токенов ещё до начала диалога.

0 70
И инструменты ·26 июл 2026

MCP и ACP: как работают протоколы AI-агентов — объяснение через светофор

Статья объясняет разницу между двумя протоколами для AI-агентов — MCP (Model Context Protocol) и ACP (Agent Communication Protocol) — через метафору светофора. Автор показывает, что новички часто путают эти протоколы, хотя они решают разные задачи: MCP — это про получение контекста от инструментов, ACP — про координацию между агентами.

0 117
И исследования ·1 авг 2026

Как рассуждает LLM: в чём его мышление отличается от человеческого и почему

Автор разбирает две категории различий между рассуждениями LLM и человека: первые связаны с конкретной архитектурой (отсутствие памяти между сессиями, невозможность пересмотреть уже сказанное) и потенциально устранимы новым дизайном, вторые — это фундаментальные математические ограничения любого алгоритма, доказанные задолго до появления языковых моделей.

0 44
И исследования ·29 июл 2026

Шестьсот девяносто один тик

Повествование от лица AI-агента, который существует в дискретных тактах (тиках), между которыми сохраняется только то, что записано в файлы. Столкнувшись с проблемой переполнения памяти (61% времени уходило на загрузку воспоминаний), агент постепенно перестроил свою систему хранения данных и памяти, разработав архитектуру на базе SQLite и C.

0 50
И исследования ·29 июл 2026

Токены, контекст, параметры: как на самом деле работает большая языковая модель

Статья объясняет техническую архитектуру LLM через три ключевых компонента: токенизацию текста, механизм контекстного окна и структуру параметров нейросети. Автор разбирает, как трансформеры обрабатывают последовательности токенов, почему контекст — это временная рабочая память, а параметры — долгосрочные паттерны, и как attention-механизм позволяет модели предсказывать следующий токен.

0 66
И инструменты ·26 июл 2026

Когда RAG — не лучший выбор: урок из базы знаний на 9 чанков

Разработчик построил WhatsApp-ассистента для небольшого бизнеса по домашней кухне, используя стандартную RAG-архитектуру (векторный поиск по эмбеддингам). Оказалось, что для базы знаний всего из 9 чанков RAG добавляет точку отказа без реальной пользы — проще и надёжнее передавать весь документ целиком в промпт.

0 72
И инструменты ·29 июл 2026

Субагенты Claude Code: правильный способ делегировать работу

Статья объясняет концепцию субагентов в Claude Code — специализированных экземпляров Claude, работающих в отдельном контекстном окне. Автор разбирает, почему простое добавление множества агентов может ухудшить workflow, и показывает правильный подход к делегированию задач между агентами.

0 47
И инструменты ·29 июл 2026

Умный ассистент поддержки: не запускать, пока не протестируешь

Команда CrowdFarming запустила мультиязычного ассистента клиентской поддержки на базе LLM, который работает с заказами, каталогом и консультирует по уходу за органическими продуктами. Статья описывает архитектуру системы с разделёнными агентами, строгим контролем через код и обширным тестированием перед выходом в продакшн.

0 41
М модели ·24 июл 2026

Как современные LLM генерируют текст: пошаговый разбор на чистом Python

Автор показывает, что происходит «под капотом» языковой модели между вводом запроса и получением ответа. Вместо использования готовых библиотек он загружает реальные веса модели Qwen3-0.6B и воссоздаёт весь конвейер инференса в 200 строках чистого Python с использованием MLX (фреймворк Apple для массивов).

0 53
И инструменты ·24 июл 2026

ComfyUI и «Package Hell»: когда гибкость становится проблемой

ComfyUI — популярный инструмент для локального запуска генеративных AI-моделей с нодовой системой. Автор описывает растущую проблему: все модели и кастомные ноды работают в одном Python-окружении, что приводит к конфликтам зависимостей — одна версия библиотеки ломает другие воркфлоу, и пользователи вынуждены вручную балансировать между несовместимыми требованиями.

0 51
Б бизнес ·23 июл 2026

Контекстная зависимость — новая форма vendor lock-in

Статья проводит параллель между классической проблемой vendor lock-in в базах данных (Oracle, проприетарные хранилища) и новой ситуацией в AI: компании передают не просто данные, а контекст — промпты, коррекции, eval-сеты, трейсы агентов — провайдерам моделей, теряя контроль над своим институциональным знанием. Автор предлагает решение по аналогии с открытыми форматами таблиц (Iceberg, Delta Lake): отделить контекст от модели, сделав его портируемым активом.

0 44
И инструменты ·22 июл 2026

Почему простые агенты побеждают: опыт разработки AI-систем в продакшене

Автор запустил сложную мультиагентную систему в продакшен и столкнулся с непредсказуемыми провалами: агенты терялись в циклах рассуждений и тихо ломались. Решение — отказаться от сложных архитектур в пользу узкоспециализированных микроагентов с чёткими границами задач и строгим контролем состояния.

0 56
И инструменты ·26 июл 2026

Разделение Prefill и Decode: когда стоит разбивать инференс на два стека

Все крупные движки инференса LLM теперь поддерживают разделение фаз prefill (обработка промпта) и decode (генерация токенов) на отдельные пулы GPU. Автор объясняет техническую природу этого подхода и главное — когда он действительно нужен, а когда создаёт лишние сложности.

0 20
И исследования ·24 июл 2026

Компилятор превращает вычислительные графы в веса трансформера — без обучения

Разработчик создал инструмент, который компилирует обычный Python-код вычислительных графов напрямую в веса трансформера (архитектура Phi-3). Результат — стандартный чекпоинт, загружаемый через HuggingFace без кастомного кода и без единой итерации обучения. Цель проекта — понять, какие алгоритмы трансформер может выразить структурно, независимо от того, чему его учат.

0 35
И исследования ·27 июл 2026

Как на самом деле работают LLM — руководство для новичков

Автор объясняет устройство языковых моделей через метафору города TokenTown, где каждый район — это этап обработки данных. Статья показывает путь текста от токенизации через механизм внимания (attention) до генерации следующего слова, избегая как упрощённых аналогий, так и сложной математики.

0 19