Популярное за неделю

И инструменты ·6 авг 2026

AWS AgentCore научили контролировать AI-агентов на уровне последовательности действий — новый язык политик Dogwood и лимиты

AWS выпустил обновление Amazon Bedrock AgentCore с темпоральными политиками (язык Dogwood) и лимитами на шлюзе. Теперь можно контролировать не только отдельные действия агента, но и их последовательность во времени — предотвращать нежелательные сценарии вроде обхода лимитов через множество мелких операций или неправильный порядок шагов. Догвуд опенсорсен под Apache 2.0, работает поверх Cedar.

0 37
И исследования ·26 июл 2026

Математическая олимпиада показала: даже лучшие AI-модели буксуют без «костылей»

Исследователи протестировали разные LLM на задачах Международной математической олимпиады IMO-2026. Топовые модели (o1 и Claude 3.5) справились отлично, но «средний класс» вроде Opus и Sonnet показал слабый результат без специальных надстроек-оркестраторов. Даже с мультиагентными системами они не дотянули до фронтира. Главный вывод: сложная многошаговая логика — всё ещё слабое место для моделей ниже флагманского уровня.

0 132
И исследования ·28 июл 2026

Google раскрыла реальные данные: работники не торопятся автоматизировать себя через AI

Google Research проанализировала 15 млн взаимодействий с Gemini и обнаружила: массовой автоматизации белых воротничков нет. AI используют как помощника для части задач, а не замену человека. Хайп про тотальную замену людей не подтверждается реальными данными.

0 105
Б бизнес ·26 июн 2026

Перевёл поддержку на ассистента с эскалацией — метрики через месяц

Не «заменил людей», а поставил первую линию: ассистент отвечает на частое, сложное передаёт оператору с контекстом. 70% тикетов закрывается без человека, среднее время ответа с 4 ч

0 279
И инструменты ·31 июл 2026

Почему мы удалили LLM-роутер: опыт Manifest после 7000 пользователей

Manifest запустил LLM-роутер в марте, а в июне его удалил. После 4 месяцев работы с 7000 пользователей выяснилось: экономия на inference оборачивается скрытыми затратами на поддержку, качество падает, а контекст задачи невозможно определить по одному промпту. Вывод: лучше один проверенный в бою LLM, чем умный роутинг.

0 88
И инструменты ·2 авг 2026

DeepSeek-V4-Flash на 284 млрд параметров запустили на 5,3 ГБ памяти — как это вообще возможно

Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.

0 75
Б безопасность ·25 июл 2026

Стиль письма как сигнал для слежки в интернете

Автор разбирает техническую основу стилометрии — метода идентификации людей по стилю письма. В отличие от cookies или fingerprinting'а устройств, стилометрический «отпечаток» содержится внутри самого текста и не может быть просто удалён. Современные нейросетевые методы позволяют различать авторов даже по коротким текстам, а LLM-чаты дают провайдерам идеальный корпус помеченных текстов миллионов пользователей.

0 119
И исследования ·30 июл 2026

Я попытался поймать 5 ИИ на предвзятости к себе. Только некоторые попались

Автор провёл эксперимент: пять LLM-моделей написали эссе на одну тему, затем каждая оценивала все пять работ вслепую (без указания авторства). Результат оказался неожиданным: не все модели завышали оценки собственным текстам. GPT-4 и DeepSeek завысили свои оценки относительно коллег, Claude оценила себя в тон с остальными (и её текст действительно оказался лучшим по общему мнению), а Grok и Gemini были самокритичны.

0 94
И инструменты ·29 июл 2026

Контекстная инженерия против промпт-инженерии: как получать качественный код от AI-агентов

Автор утверждает, что в 2024 году успех работы с AI-агентами для кодирования зависит не от искусства формулирования промптов, а от грамотного управления контекстом. Модели стали умнее, и теперь ключевой фактор — что именно попадает в контекстное окно и когда, а не как вы формулируете запрос.

0 111