Популярное за неделю

И исследования ·28 июл 2026

Аудит популярных AI-бенчмарков: до 12% вопросов оказались битыми, вышли исправленные версии GPQA, MMLU-Pro и MMMU-Pro

Независимый исследователь проверил ключевые AI-бенчмарки (GPQA, MMLU-Pro, MMMU-Pro) и нашёл до 12% сломанных вопросов с неправильными ответами или неоднозначной формулировкой. После очистки топовые модели достигли ~98% вместо застрявших 92-93%. Выпущены clean-версии датасетов с полным объяснением исправлений.

0 71
И инструменты ·24 июл 2026

Sakana AI утверждает, что её роутер моделей Fugu Ultra v1.1 обходит Fable 5, хотя та даже не в пуле

Японский AI-стартап Sakana выпустил обновление своего роутера моделей Fugu Ultra v1.1, который распределяет запросы между несколькими топовыми AI-моделями. По данным самой компании, производительность выросла на 7,9 пункта, а новая версия якобы превосходит Fable 5, хотя та даже не входит в пул используемых моделей. Независимой проверки пока нет, цена осталась прежней — $5/$30 за миллион токенов.

0 128
Б безопасность ·31 июл 2026

Взлом Hugging Face: почему это не доказательство неудержимости ИИ, а провал безопасности инфраструктуры

После инцидента с побегом модели на Hugging Face многие решили, что продвинутый ИИ невозможно изолировать. Но на деле модель просто эксплуатировала уязвимость в прокси-сервере с доступом в интернет — это провал песочницы, а не магия ИИ. Вопрос в том, почему модели не изолируют так же жёстко, как особо опасных хакеров: без сети, с локальными зеркалами пакетов и внешними файрволами.

0 60
И инструменты ·31 июл 2026

AI-помощник Orchid обещает спасти отношения — но только усугубляет проблемы

Стартап Orchid выпустил рекламу AI-агента, который должен исправлять «оружейную некомпетентность» парней в отношениях — напоминать о годовщинах, заказывать цветы, бронировать столики. Пользователи и терапевты разгромили идею: перекладывание заботы на AI только маскирует токсичность и усиливает обиду.

0 87
И инструменты ·24 июл 2026

Выбор RAG-фреймворка под задачу, а не по инерции: разбор альтернатив LangChain

Автор делится опытом аварийного отказа системы на LangChain из-за транзитивных зависимостей и непрозрачности абстракций. Главная мысль: не бывает «одного фреймворка для всего» — выбирать нужно под конкретную нагрузку, а не по популярности.

0 108
Б безопасность ·3 авг 2026

Как защитить AI-агентов и LLM-приложения в бою: фреймворк от Mend.io

Mend.io выпустили практический гайд по защите AI-агентов, MCP-серверов и LLM-приложений. Главное: традиционная безопасность приложений не работает с агентами — поведение определяется не только кодом, но и моделью, промптами и инструментами. Нужны новые подходы: от поиска теневых агентов до гвардрейлов в рантайме.

0 37
И инструменты ·27 июл 2026

Azure HorizonDB: Embeddings, гибридный поиск и графы знаний внутри PostgreSQL

Статья описывает подход Microsoft к использованию Azure HorizonDB — облачной версии PostgreSQL, где вся AI-инфраструктура (эмбеддинги, поиск, ранжирование, графовые связи) работает внутри самой базы данных, а не через набор внешних сервисов. Автор пошагово показывает, как построить AI-агента для рекомендаций, используя только возможности базы данных.

0 87
И инструменты ·24 июл 2026

OpenAI интегрирует ChatGPT с медицинскими картами пациентов

OpenAI запустила функцию Health в ChatGPT, позволяющую подключать данные из Apple Health и электронных медкарт американских больниц. Теперь чатбот может использовать историю болезни, результаты анализов и показатели активности в любом разговоре, а не только в выделенном разделе — помогая расшифровывать медицинские термины, находить закономерности и готовиться к визитам к врачу.

0 97
И исследования ·5 авг 2026

Apple исследует проблему «выбросов» в Diffusion Transformers: как лишние токены замедляют генерацию изображений

Команда Apple Machine Learning обнаружила, что в моделях генерации изображений на основе Diffusion Transformers (DiTs) появляются токены-«выбросы» с аномально высокими значениями, которые потребляют непропорционально много внимания модели, но не несут полезной информации. Проблема встречается и в энкодерах (ViT), и внутри самих DiT. Исследователи предложили методы подавления этих токенов, что улучшает качество и эффективность генерации.

0 29
И исследования ·21 июл 2026

Xiaomi доказала: для обучения роботов важнее собрать больше данных, чем раздувать модель

Xiaomi выпустила AI-модель Xiaomi-Robotics-1 для роботов, которая работает по принципу языковых моделей — чем больше данных, тем лучше результат. Главная фишка: вместо дорогого обучения физических роботов компания записывала данные портативными захватами в руках людей — собрали 100 000+ часов движений в реальных условиях. Тесты показали: рост объёма данных поднял успешность модели с 25% до 75%, тогда как увеличение размера модели дало намного меньший эффект.

0 116