Собрал дашборд затрат на LLM по командам — глаза открылись
Никто не знал, сколько реально уходит на API по отделам. Прокинул все запросы через прокси с тегами команды и модели. Через неделю картина: 70% бюджета жгла одна фича с раздутым пр
Никто не знал, сколько реально уходит на API по отделам. Прокинул все запросы через прокси с тегами команды и модели. Через неделю картина: 70% бюджета жгла одна фича с раздутым пр
AWS выпустил обновление Amazon Bedrock AgentCore с темпоральными политиками (язык Dogwood) и лимитами на шлюзе. Теперь можно контролировать не только отдельные действия агента, но и их последовательность во времени — предотвращать нежелательные сценарии вроде обхода лимитов через множество мелких операций или неправильный порядок шагов. Догвуд опенсорсен под Apache 2.0, работает поверх Cedar.
Исследователи протестировали разные LLM на задачах Международной математической олимпиады IMO-2026. Топовые модели (o1 и Claude 3.5) справились отлично, но «средний класс» вроде Opus и Sonnet показал слабый результат без специальных надстроек-оркестраторов. Даже с мультиагентными системами они не дотянули до фронтира. Главный вывод: сложная многошаговая логика — всё ещё слабое место для моделей ниже флагманского уровня.
Google Research проанализировала 15 млн взаимодействий с Gemini и обнаружила: массовой автоматизации белых воротничков нет. AI используют как помощника для части задач, а не замену человека. Хайп про тотальную замену людей не подтверждается реальными данными.
Не «заменил людей», а поставил первую линию: ассистент отвечает на частое, сложное передаёт оператору с контекстом. 70% тикетов закрывается без человека, среднее время ответа с 4 ч
Manifest запустил LLM-роутер в марте, а в июне его удалил. После 4 месяцев работы с 7000 пользователей выяснилось: экономия на inference оборачивается скрытыми затратами на поддержку, качество падает, а контекст задачи невозможно определить по одному промпту. Вывод: лучше один проверенный в бою LLM, чем умный роутинг.
Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.
Автор разбирает техническую основу стилометрии — метода идентификации людей по стилю письма. В отличие от cookies или fingerprinting'а устройств, стилометрический «отпечаток» содержится внутри самого текста и не может быть просто удалён. Современные нейросетевые методы позволяют различать авторов даже по коротким текстам, а LLM-чаты дают провайдерам идеальный корпус помеченных текстов миллионов пользователей.
Автор провёл эксперимент: пять LLM-моделей написали эссе на одну тему, затем каждая оценивала все пять работ вслепую (без указания авторства). Результат оказался неожиданным: не все модели завышали оценки собственным текстам. GPT-4 и DeepSeek завысили свои оценки относительно коллег, Claude оценила себя в тон с остальными (и её текст действительно оказался лучшим по общему мнению), а Grok и Gemini были самокритичны.
Автор утверждает, что в 2024 году успех работы с AI-агентами для кодирования зависит не от искусства формулирования промптов, а от грамотного управления контекстом. Модели стали умнее, и теперь ключевой фактор — что именно попадает в контекстное окно и когда, а не как вы формулируете запрос.