Apple показала архитектуру синтеза речи для Siri: 21 МБ памяти и в 16 раз быстрее реального времени
Apple опубликовала детали архитектуры синтеза речи для Siri Expressive Voices на базе AFM 3 Core Advanced. Новый detokenizer превращает семантические аудиотокены в речь, используя всего 21 МБ оперативной памяти и 329 МБ ассетов на устройстве. Работает в 16 раз быстрее реального времени на Apple Matrix Coprocessor (AMX), улучшает качество голоса на +0.28 MOS. Три компонента (streaming encoder, temporal decoder, depth decoder) разделяют обработку времени и глубины, один универсальный декодер заменяет кучу специализированных.
Показывает, что генеративный AI можно запускать на обычных смартфонах без облака, сохраняя качество и приватность. Открывает новый класс продуктов и сервисов, где данные остаются на устройстве.
Что сделали

Команда Apple Machine Learning опубликовала архитектуру синтеза аудио, которая работает в Siri Expressive Voices на устройствах. Система превращает семантические токены от большой модели AFM 3 Core Advanced (1 миллиард параметров) в высококачественную речь с настройками темпа и выразительности.
Ключевое решение — detokenizer, разбитый на три компонента: streaming encoder (кодирует токены), temporal decoder (обрабатывает временную последовательность) и depth decoder (генерирует уровни residual vector quantization через Diffusion Transformer). Вместо традиционных архитектур, где каждый уровень RVQ декодируется отдельным модулем, здесь один переиспользуемый depth decoder с DiT-style conditioning генерирует все уровни автоpегрессивно.
Применили causal sliding window attention с fixed-window key-value caching — память остается константной независимо от длины последовательности. В обычных трансформерах и GAN-архитектурах память растет линейно или квадратично, здесь фиксированная.
Результаты
Работает на Apple Matrix Coprocessor (AMX): ~10 мс на шаг генерации (в 16 раз быстрее реального времени), пиковое потребление памяти всего 21 МБ, ассетов на устройстве 329 МБ. Может синтезировать 20-320 секунд непрерывного аудио параллельно с работой основной модели.
Качество выросло: средняя оценка (MOS) поднялась на +0.28 (с 3.87 до 4.15), на разговорной речи на +0.42 (с 3.82 до 4.24) по сравнению с предыдущей системой TTS на устройстве.
Система уже работает в продакшене во всех новых голосовых ассистентах Apple с кастомизацией темпа и выразительности.
Автор: Ксения Лаврова · Источник: machinelearning.apple.com
Разработчикам. Архитектура показывает, как решать проблему памяти в on-device синтезе речи через decoupled обработку (разделение temporal и depth компонентов) и DiT-conditioning. Sliding window attention с фиксированным KV-кэшем дает константную память. Detokenizer конвертирует семантические токены в RVQ-представление через единый переиспользуемый decoder вместо множества специализированных. Подход применим к другим задачам генерации последовательностей с жесткими ограничениями по памяти.
Бизнесу. Apple доказала, что качественный AI-синтез речи возможен полностью на устройстве без облака — это конкурентное преимущество по приватности и латентности. Архитектура позволяет кастомизировать голос (темп, выразительность) без дополнительных серверных затрат. Такой подход открывает возможности для персонализированных голосовых интерфейсов в умных устройствах, автомобилях, носимой электронике, где облачный синтез неприемлем или дорог.
Инвесторам. Apple вкладывается в собственные foundation-модели совместно с Google и демонстрирует технологическое лидерство в on-device AI. Архитектура с минимальным footprint открывает рынок edge AI-синтеза речи для устройств с ограниченными ресурсами. Сектора роста: носимая электроника, IoT-девайсы, автомобильная электроника, приватные голосовые ассистенты. Конкуренция с облачными провайдерами перемещается в сторону гибридных и полностью on-device решений.
- Разработка on-device TTS-движков для носимых устройств (умные часы, наушники) с аналогичной архитектурой — рынок растет с переходом на edge AI
- Создание кастомизируемых голосовых интерфейсов для автомобилей и IoT-устройств, где приватность и латентность критичны
- Адаптация DiT-style conditioning и decoupled архитектур для других генеративных задач на edge (видео, изображения, музыка) с жесткими ограничениями памяти
- Консалтинг и инструменты для оптимизации трансформеров под ARM-процессоры и специализированные коpроцессоры (аналоги AMX)
- Разработка персонализированных голосовых клонов на устройстве для контент-креаторов и подкастеров без отправки данных в облако
- Архитектура сильно завязана на кастомное железо Apple (AMX), воспроизвести на стандартном ARM сложнее — барьер для входа высокий
- Публикация не содержит кода и весов модели, только описание — внедрение требует значительных R&D-затрат
- Качество (MOS 4.15) хорошее, но не рекордное — облачные решения типа ElevenLabs/Resemble могут звучать лучше, хотя и медленнее
- Рынок on-device TTS пока нишевый, большинство приложений все еще выбирают облако из-за простоты масштабирования и обновлений
Это редкий случай, когда Apple публикует детальную архитектуру продакшен-системы — обычно они молчат. Здесь интересно не то, что Siri научилась говорить выразительнее (это ожидаемо), а как они запихнули качественную генерацию в устройство с фиксированной памятью. Decoupled архитектура с разделением temporal и depth обработки, переиспользуемый decoder вместо кучи специализированных, sliding window attention с фиксированным кэшем — это инженерные решения, которые можно и нужно тащить в другие edge-задачи.
С точки зрения денег: Apple создает экосистему, где AI работает на устройстве, а конкуренты зависят от облака. Это стратегическое преимущество и по приватности, и по издержкам в долгосрочной перспективе. Для разработчиков это сигнал: рынок сдвигается в сторону edge AI, и кто научится оптимизировать модели под железо (не только Apple), тот выиграет следующий раунд. Да, без кода и весов это больше вдохновение, чем инструмент, но направление ясное.
Комментарии