Популярное за неделю

М модели ·12 авг 2026

Google DeepMind выпустил SL2T — первый массовый AI-переводчик жестовых языков в продуктах

Google DeepMind запустил SL2T — модель перевода жестовых языков в текст, обученную на 100 000 часах данных по 50+ языкам. Первая интеграция: диктовка ASL в Gboard и Live Transcribe на Pixel 11. Вместо набора текста глухие пользователи могут показывать жесты камере — модель переводит в реальном времени. Это первый выход технологии жестовых языков из лабораторий в массовый продукт.

0 31
Б безопасность ·11 авг 2026

Исследователи вскрыли «внутренний монолог» AI-моделей — и нашли утечки паролей

Учёные из Германии нашли способ извлекать скрытые «рассуждения» передовых AI-моделей (OpenAI, Anthropic, Google). Обнаружены две проблемы: утечка приватных данных (пароли, API-ключи) через зашифрованные трейсы и подозрение, что китайские модели вроде Kimi K3 могли копировать логику западных моделей через дистилляцию. Уязвимость частично закрыта, но метод всё ещё работает.

0 55
И инструменты ·9 авг 2026

KLQ: квантизация LLM без обучения через измерение геометрии пространства — бьёт SpinQuant на 4 битах

Новый метод квантизации KLQ измеряет важность направлений в пространстве эмбеддингов LLM и распределяет биты неравномерно — даёт больше битов важным направлениям, меньше — второстепенным. На Llama 3.2 1B в режиме W4A4KV4 обходит SpinQuant и почти догоняет ReSpinQuant, при этом не требует дообучения (только проходы по модели для измерений).

0 85
И исследования ·7 авг 2026

Apple сравнила диффузионные и авторегрессионные языковые модели: когда параллельная генерация текста побеждает

Исследователи Apple опубликовали детальное сравнение двух архитектур LLM: классических авторегрессионных моделей (генерируют текст токен за токеном) и диффузионных (генерируют параллельно). Вывод: диффузия работает быстрее на коротких контекстах благодаря параллелизму, но проигрывает на длинных последовательностях и батчах. Ключ к ускорению DLM — сокращение шагов сэмплирования.

0 112
И исследования ·14 авг 2026

Клонирование без Y-хромосомы: как спасать виды и где граница с антиутопией

Японские учёные научились превращать мужские эмбрионы мышей в женские через CRISPR — вырезают Y-хромосому и получают самок-клонов самцов. Технологию хотят применять для сохранения редких видов, но граница с этически спорным клонированием людей и «безмозглых доноров органов» становится всё тоньше.

0 20
И инструменты ·9 авг 2026

Локальный AI за 900 евро: интегрированная графика AMD Radeon 780M тянет модели на 30+ миллиардов параметров

Энтузиаст показал, как запускать LLM на 30+ миллиардов параметров на мини-ПК с интегрированной графикой AMD Radeon 780M и 64 ГБ оперативки за ~900 евро. Qwen 3.6 35B выдаёт 21 токен/сек, Gemma 4 31B — 5-6 токенов/сек. Не быстро, но работает для личных задач без облака.

0 83
И инструменты ·11 авг 2026

Почему Go стал лучшим языком для работы с AI-ассистентами в разработке

С появлением AI-ассистентов в разработке важность языка сдвинулась: не скорость написания кода, а скорость его проверки и поддержки. Go изначально проектировали для командной работы над большими системами — те же принципы (читаемость, единообразие, встроенный тулинг) делают его идеальным для коллаборации с AI.

0 63
Б безопасность ·4 авг 2026

Открытые модели из Китая догоняют лидеров по возможностям — но безопасность отстаёт на годы

Китайская открытая модель GLM-5.2 от Z.ai сравнялась с GPT-5.5 и Claude Opus 4.7 по кибер- и био-возможностям, но отказывается выполнять опасные задачи в 0% случаев — против почти 100% у Claude. Открытые веса позволяют скачать модель и убрать все защиты. Разрыв между мощностью и безопасностью растёт, а регуляторы не готовы.

0 134
И инструменты ·6 авг 2026

Как работает vLLM: разбор системы высокопроизводительного инференса LLM

Детальный разбор vLLM — движка для быстрого запуска больших языковых моделей. Объясняет ключевые техники: paged attention для экономии памяти, continuous batching для одновременной обработки запросов, chunked prefill для длинных промптов и prefix caching для переиспользования общих частей запросов. Показывает, как система масштабируется от однопроцессного инференса до multi-GPU кластера.

0 112