#on-device AI

И инструменты ·12 авг 2026

Google DeepMind встроила перевод жестового языка в Pixel 11 — первый AI для глухих в массовом телефоне

Google DeepMind выпустила SL2T — модель перевода американского жестового языка в текст, встроенную в Gboard и Live Transcribe на Pixel 11. Это первый случай, когда AI для жестового языка попал в коммерческий смартфон. Работает везде, где обычно набирают текст: поиск, сообщения, запросы к Gemini.

0 115
И инструменты ·5 авг 2026

Whisper, Qwen3-ASR и Nemotron теперь работают локально на iPhone — разбор реального кейса

Разработчик создал LiveTranscriber — полностью офлайновое iOS-приложение для транскрибации речи с поддержкой Whisper, Qwen3-ASR, NVIDIA Nemotron и MOSS. Все модели работают на устройстве без отправки данных в облако. Проект open-source с готовым решением в App Store.

0 118
М модели ·7 авг 2026

Liquid AI выпустила LFM2.5-2.6B: агентная модель на 2.7 млрд параметров, которая работает локально с контекстом 128К и вызовом функций

Liquid AI представила LFM2.5-2.6B — компактную агентную модель (2.7 млрд параметров), которая запускается локально на смартфонах, ноутбуках и роботах. Модель поддерживает контекст 128К токенов, вызов инструментов и многошаговые задачи. Веса открыты, доступны в форматах GGUF, MLX, ONNX. По бенчмаркам следования инструкциям обгоняет модели вчетверо крупнее.

0 47
И инструменты ·29 июл 2026

SeedVR2-1.4B: upscaler-модель в 6 раз легче ByteDance, которая влезает в 16 ГБ RAM

Энтузиаст дистиллировал 7B-параметровую модель апскейла SeedVR2 ByteDance в 1.4B версию с 6 слоями вместо 36. Результат: 2.7 ГБ на диске вместо 15.3 ГБ, работает в 4.6 ГБ оперативки вместо 14–16 ГБ, в 1.6–5.6× быстрее. Качество близко к учителю на 2×–4× масштабе, на 8× деградирует, но остается юзабельным.

0 90
М модели ·30 июл 2026

Как Google запустила генеративную AI на смарт-часах

Google встроила локальную языковую модель в Pixel Watch, хотя часы имеют в сотни раз меньше памяти, чем телефон, и физически не могут долго работать на полной мощности из-за перегрева. Статья объясняет, какие три технических компромисса позволили уместить AI в столь ограниченное устройство.

0 73
М модели ·22 июл 2026

Cactus Hybrid: Gemma 4 научили признаваться, когда модель не уверена

Команда Cactus модифицировала Gemma 4, добавив слой из 68k параметров, который предсказывает уверенность модели в своём ответе (0-1). Это позволяет автоматически маршрутизировать только 15-35% запросов на большую облачную модель, достигая при этом качества Gemini 3.1 Flash-Lite. Ключевая фишка: зонд читает «самосознание» модели из скрытых состояний, а не из текста ответа или энтропии токенов.

0 119
И инструменты ·5 авг 2026

MacPaw встраивает Liquid AI в свой магазин приложений — конкуренция Apple в локальных моделях

Украинская MacPaw (разработчик CleanMyMac, SetApp) объединилась с Liquid AI для запуска локальной AI-инференции на устройствах пользователей. Создают систему Elix для on-device обработки, которую откроют разработчикам SetApp вместе с облачными моделями Google и других. Магазин переходит на кредитную модель подписки под AI-приложения.

0 32
М модели ·28 июл 2026

Apple показала архитектуру синтеза речи для Siri: 21 МБ памяти и в 16 раз быстрее реального времени

Apple опубликовала детали архитектуры синтеза речи для Siri Expressive Voices на базе AFM 3 Core Advanced. Новый detokenizer превращает семантические аудиотокены в речь, используя всего 21 МБ оперативной памяти и 329 МБ ассетов на устройстве. Работает в 16 раз быстрее реального времени на Apple Matrix Coprocessor (AMX), улучшает качество голоса на +0.28 MOS. Три компонента (streaming encoder, temporal decoder, depth decoder) разделяют обработку времени и глубины, один универсальный декодер заменяет кучу специализированных.

0 61
И инструменты ·24 июл 2026

Core ML vs. Core AI: Кто управляет циклом генерации?

Apple выпустила Core AI (iOS/macOS 27+) — преемника Core ML для запуска LLM на устройствах. Главное отличие не в возможностях моделей, а в том, кто управляет циклом генерации токенов: приложение (CPU) или системная среда выполнения (runtime). Это даёт измеримое ускорение в 3,5 раза на идентичной модели.

0 20