модели 1 мин

Google DeepMind выпустил SL2T — первый массовый AI-переводчик жестовых языков в продуктах

Google DeepMind запустил SL2T — модель перевода жестовых языков в текст, обученную на 100 000 часах данных по 50+ языкам. Первая интеграция: диктовка ASL в Gboard и Live Transcribe на Pixel 11. Вместо набора текста глухие пользователи могут показывать жесты камере — модель переводит в реальном времени. Это первый выход технологии жестовых языков из лабораторий в массовый продукт.

Это первый раз, когда технология жестовых языков вышла из лабораторий в массовый продукт. Для 70 млн глухих пользователей это означает новый уровень доступности цифровых сервисов. Для разработчиков и предпринимателей — редкая возможность первыми зайти в недообслуженную нишу с долгосрочным потенциалом.

Google DeepMind представил SL2T (sign-language-to-text) — первую массовую модель перевода жестовых языков в текст. Модель обучена на 100 000+ часах видео по 50+ жестовым языкам (четверть — американский ASL). Ключевое отличие от прошлых попыток: жестовые языки — это не «английский руками», а самостоятельные языки с уникальной грамматикой. SL2T делает полноценный машинный перевод, а не просто распознаёт жесты.

Модель работает через pose landmarks (координаты точек на теле) — видео сразу отбрасывается, на сервер идут только геометрические данные. Перевод идёт напрямую в текст, минуя промежуточные глоссы, которые искажают богатство жестовых языков. На бенчмарке FLEURS-ASL модель набрала 70 BLEURT (zero-shot) — рекорд для задачи.

Первая интеграция уже в бою: диктовка ASL в Gboard и Live Transcribe на Pixel 11. Глухие пользователи могут показывать жесты камере везде, где раньше печатали: поиск, сообщения, запросы Gemini. По отзывам тестировщиков, это быстрее и естественнее набора текста. Команда работала с глухим сообществом на всех этапах — от концепции до сбора данных и тестирования.

моделиaccessibilityкомпьютерное зрениемашинный переводжестовые языки

Автор: Артём Ковалёв · Источник: deepmind.google

Разработчикам. Появился открытый путь для интеграции жестовых языков в продукты через pose landmarks и мультиязычные модели. Архитектура SL2T показывает, как обходить промежуточные представления (глоссы) и масштабировать качество данными. MediaPipe Holistic уже доступен для трекинга жестов на устройстве — можно строить privacy-first решения.

Бизнесу. Рынок жестовых языков (70 млн глухих пользователей) наконец получил технологию, готовую к массовому применению. Появляются ниши: accessibility-инструменты для корпоративных коммуникаций, образовательные платформы, переводчики для видеоконференций, контент-платформы с автоматическими субтитрами для жестового контента. Первопроходцы получат лояльность недообслуженной аудитории.

Инвесторам. Это не просто технологический прорыв — это открытие рынка accessibility-продуктов с долгосрочным потенциалом роста. Интеграция в Pixel — начало, дальше будут сторонние приложения, корпоративные решения, образовательные платформы. Accessibility становится конкурентным преимуществом и регуляторным требованием. Компании, первыми освоившие жестовые языки, получат преимущество в публичных закупках и корпоративных тендерах.

Хайп35
Реальная польза85
Заработать75
  • Образовательные платформы для изучения жестовых языков с AI-фидбеком в реальном времени — аналог Duolingo для ASL и других языков.
  • Корпоративные инструменты доступности: переводчики для видеоконференций Zoom/Teams, автоматические субтитры для внутренних тренингов.
  • Accessibility-слой для мобильных приложений: SDK для интеграции жестовой диктовки в мессенджеры, соцсети, CRM.
  • Контент-платформы с автоматической транскрипцией жестового видео — монетизация accessibility через рекламу и подписки.
  • Медицинские и госуслуги: терминалы самообслуживания с жестовым интерфейсом, телемедицина с автоматическим переводом.
  • Качество перевода ещё не идеальное: модель ошибается в редких жестах, быстрой дактилировке, пассивных конструкциях. В критичных сценариях (медицина, право) нужна человеческая проверка.
  • Культурная специфичность: жестовые языки сильно отличаются по странам и диалектам. Масштабирование на новые языки требует больших данных и работы с локальными сообществами.
  • Privacy-риски при неправильной реализации: если третьи стороны будут использовать raw video вместо pose landmarks, появятся проблемы с приватностью.
  • Переоценка краткосрочного охвата: 70 млн пользователей звучит масштабно, но только часть из них будет активно использовать технологию — нужны годы на adoption и обучение.

Это один из тех редких моментов, когда технология действительно меняет правила игры. Google не просто выпустил крутую модель — они первыми вывели жестовые языки в массовый продукт. И это не благотворительность, а стратегия: accessibility становится конкурентным преимуществом и регуляторным требованием. Кто первым освоит эту нишу, получит лояльность огромной недообслуженной аудитории.

Но давайте без розовых очков: качество перевода ещё не идеальное, модель ошибается в сложных конструкциях, и масштабирование на новые языки — долгий и дорогой процесс. Это не волшебная кнопка, а начало долгого пути. Но начало — правильное. Главный урок: если строите для accessibility, делайте это вместе с сообществом, а не за них. Google показал, как это работает.

Ещё по теме

Комментарии