Google DeepMind выпустил SL2T — первый массовый AI-переводчик жестовых языков в продуктах
Google DeepMind запустил SL2T — модель перевода жестовых языков в текст, обученную на 100 000 часах данных по 50+ языкам. Первая интеграция: диктовка ASL в Gboard и Live Transcribe на Pixel 11. Вместо набора текста глухие пользователи могут показывать жесты камере — модель переводит в реальном времени. Это первый выход технологии жестовых языков из лабораторий в массовый продукт.
Это первый раз, когда технология жестовых языков вышла из лабораторий в массовый продукт. Для 70 млн глухих пользователей это означает новый уровень доступности цифровых сервисов. Для разработчиков и предпринимателей — редкая возможность первыми зайти в недообслуженную нишу с долгосрочным потенциалом.
Google DeepMind представил SL2T (sign-language-to-text) — первую массовую модель перевода жестовых языков в текст. Модель обучена на 100 000+ часах видео по 50+ жестовым языкам (четверть — американский ASL). Ключевое отличие от прошлых попыток: жестовые языки — это не «английский руками», а самостоятельные языки с уникальной грамматикой. SL2T делает полноценный машинный перевод, а не просто распознаёт жесты.

Модель работает через pose landmarks (координаты точек на теле) — видео сразу отбрасывается, на сервер идут только геометрические данные. Перевод идёт напрямую в текст, минуя промежуточные глоссы, которые искажают богатство жестовых языков. На бенчмарке FLEURS-ASL модель набрала 70 BLEURT (zero-shot) — рекорд для задачи.
Первая интеграция уже в бою: диктовка ASL в Gboard и Live Transcribe на Pixel 11. Глухие пользователи могут показывать жесты камере везде, где раньше печатали: поиск, сообщения, запросы Gemini. По отзывам тестировщиков, это быстрее и естественнее набора текста. Команда работала с глухим сообществом на всех этапах — от концепции до сбора данных и тестирования.
Автор: Артём Ковалёв · Источник: deepmind.google
Разработчикам. Появился открытый путь для интеграции жестовых языков в продукты через pose landmarks и мультиязычные модели. Архитектура SL2T показывает, как обходить промежуточные представления (глоссы) и масштабировать качество данными. MediaPipe Holistic уже доступен для трекинга жестов на устройстве — можно строить privacy-first решения.
Бизнесу. Рынок жестовых языков (70 млн глухих пользователей) наконец получил технологию, готовую к массовому применению. Появляются ниши: accessibility-инструменты для корпоративных коммуникаций, образовательные платформы, переводчики для видеоконференций, контент-платформы с автоматическими субтитрами для жестового контента. Первопроходцы получат лояльность недообслуженной аудитории.
Инвесторам. Это не просто технологический прорыв — это открытие рынка accessibility-продуктов с долгосрочным потенциалом роста. Интеграция в Pixel — начало, дальше будут сторонние приложения, корпоративные решения, образовательные платформы. Accessibility становится конкурентным преимуществом и регуляторным требованием. Компании, первыми освоившие жестовые языки, получат преимущество в публичных закупках и корпоративных тендерах.
- Образовательные платформы для изучения жестовых языков с AI-фидбеком в реальном времени — аналог Duolingo для ASL и других языков.
- Корпоративные инструменты доступности: переводчики для видеоконференций Zoom/Teams, автоматические субтитры для внутренних тренингов.
- Accessibility-слой для мобильных приложений: SDK для интеграции жестовой диктовки в мессенджеры, соцсети, CRM.
- Контент-платформы с автоматической транскрипцией жестового видео — монетизация accessibility через рекламу и подписки.
- Медицинские и госуслуги: терминалы самообслуживания с жестовым интерфейсом, телемедицина с автоматическим переводом.
- Качество перевода ещё не идеальное: модель ошибается в редких жестах, быстрой дактилировке, пассивных конструкциях. В критичных сценариях (медицина, право) нужна человеческая проверка.
- Культурная специфичность: жестовые языки сильно отличаются по странам и диалектам. Масштабирование на новые языки требует больших данных и работы с локальными сообществами.
- Privacy-риски при неправильной реализации: если третьи стороны будут использовать raw video вместо pose landmarks, появятся проблемы с приватностью.
- Переоценка краткосрочного охвата: 70 млн пользователей звучит масштабно, но только часть из них будет активно использовать технологию — нужны годы на adoption и обучение.
Это один из тех редких моментов, когда технология действительно меняет правила игры. Google не просто выпустил крутую модель — они первыми вывели жестовые языки в массовый продукт. И это не благотворительность, а стратегия: accessibility становится конкурентным преимуществом и регуляторным требованием. Кто первым освоит эту нишу, получит лояльность огромной недообслуженной аудитории.
Но давайте без розовых очков: качество перевода ещё не идеальное, модель ошибается в сложных конструкциях, и масштабирование на новые языки — долгий и дорогой процесс. Это не волшебная кнопка, а начало долгого пути. Но начало — правильное. Главный урок: если строите для accessibility, делайте это вместе с сообществом, а не за них. Google показал, как это работает.
Комментарии