Собрал бота-суммаризатора для длинных Telegram-чатов команды
Рабочие чаты за ночь набегают на 500 сообщений, читать невозможно. Сделал утренний дайджест ключевого. Бот забирает историю, LLM выделяет решения, задачи и открытые вопросы, шлёт к
Рабочие чаты за ночь набегают на 500 сообщений, читать невозможно. Сделал утренний дайджест ключевого. Бот забирает историю, LLM выделяет решения, задачи и открытые вопросы, шлёт к
Nvidia инвестирует до $3 млрд в Lancium (энергоинфраструктуру для дата-центров OpenAI и Oracle), Amazon строит гигантскую газовую электростанцию в Техасе на 7,65 ГВт, которая станет самой грязной в США (33 млн тонн CO₂ в год). Энергопотребление AI растёт в разы — один heavy-пользователь агентной AI уже жрёт столько же, сколько сушилка для белья годами.
Статья разбирает системную архитектуру для AI-агентов, которые работают часами и днями, а не минутами. Основная проблема: история взаимодействия быстро перерастает контекстное окно модели, что ведёт к деградации качества, росту затрат и в итоге к отказу. Автор предлагает разделить память агента на типы (рабочая, эпизодическая, семантическая, процедурная) и использовать стратегии управления контекстом — от простого скользящего окна до иерархических сжатий и retrieval-подхода.
Команда видеоредактора PostSlate показала, как ncnn с Vulkan-бэкендом решает проблему кросс-платформенного inference на клиентских устройствах. Вместо CUDA (только NVIDIA) они получили 10-кратное ускорение распознавания лиц на любых GPU — от Intel интегрированных до Apple Silicon — без установки дополнительных рантаймов.
Пользователь из Южной Африки размышляет о парадоксе: западные компании годами прятали передовые AI-модели за закрытыми API под предлогом безопасности, взимая плату за доступ. Когда же китайские игроки начали выпускать открытые модели и заставили остальных последовать примеру, старые ярлыки «хорошие/плохие» перестали работать. Для стран третьего мира это не геополитика, а вопрос доступа к технологиям: кто реально относится к человечеству как к виду, способному справиться с прогрессом, а кто просто защищает бизнес-модель.
Эксперимент показал: одна и та же 4B-модель на задаче классификации Kubernetes-задач выдала точность 60% на плохом промпте и 82% на хорошем. Разница в 22 процентных пункта — только из-за структуры запроса: порядка правил, контекста, количества шагов рассуждений.
Cursor Research выложил в открытый доступ MoK — мегаядро для обучения mixture-of-experts моделей на стойках GB300 NVL72. Вместо разделения коммуникации и вычислений всё слито в один детерминированный kernel, что даёт до 2.37x прирост скорости против лучших публичных решений. Уже работает на десятках тысяч GPU в продакшене при обучении Composer.
Автор создал экспериментальную систему «AI-присяжных», рассматривающих вымышленное дело об аварии беспилотного такси. Пять AI-агентов с разными профессиональными бэкграундами голосовали независимо и в режиме прямой коммуникации. При одинаковых доказательствах результат изменился с 2:3 на 3:2 в зависимости от того, могли ли агенты общаться друг с другом.
Apple Machine Learning опубликовала исследование по alignment для мультимодальных LLM (MLLM). Главная проблема: модели галлюцинируют, выдавая ответы, не соответствующие изображению. Цель — научить их точнее понимать визуальный контекст и генерировать релевантные тексты.
Компании обычно воспринимают security questionnaires от клиентов как формальность для отдела продаж. Автор показывает, что это ошибка: такие вопросы — индикатор реальных опасений покупателей, которые должны влиять на продукт и процессы, а не просто превращаться в красиво составленные, но неточные обещания.