DeepMind выпустила SL2T — AI переводит жестовый язык в текст прямо на смартфоне
DeepMind запустила SL2T — модель для перевода жестового языка в текст в реальном времени. Глухие пользователи теперь могут жестикулировать вместо набора текста. Модель работает на смартфонах, распознаёт руки, тело и мимику одновременно, отслеживание поз — на устройстве для приватности, перевод — на сервере. Разработана с участием сообщества глухих, планируется расширение на другие жестовые языки.
Это показывает, что AI перестаёт быть игрушкой для технарей и начинает решать реальные социальные проблемы. Миллионы глухих людей получают инструмент для естественной коммуникации — это больше, чем просто новая модель.
DeepMind выпустила SL2T — модель, которая переводит жестовый язык в текст на смартфонах. Теперь глухие пользователи могут общаться жестами вместо набора текста — AI читает одновременные движения рук, тела и мимики, превращая их в английский текст в реальном времени.
Модель учитывает реальные сценарии: работает даже при одноручном жестикулировании (когда телефон в другой руке). Отслеживание поз происходит на устройстве для приватности, а перевод — на сервере.
По данным DeepMind, SL2T показывает state-of-the-art результаты на академических бенчмарках. Ключевое отличие — разработка велась с тесным участием сообщества глухих, что делает инструмент практически применимым, а не лабораторной игрушкой.
Сейчас модель работает с английским жестовым языком, но команда планирует добавить поддержку других языков. Это тихий, но серьёзный шаг в accessibility: технология снимает барьер коммуникации для миллионов людей.
Автор: Павел Заславский · Источник: reddit.com
Разработчикам. Гибридная архитектура — отслеживание поз на устройстве (edge), тяжёлый перевод на сервере — готовый паттерн для реалтайм-приложений с приватностью. Можно адаптировать для других задач компьютерного зрения. API пока не открыт, но это маркер направления Google в on-device AI + server inference.
Бизнесу. Открывается рынок accessibility-приложений: образование, медицина, колл-центры, клиентский сервис. Компании смогут нанимать глухих сотрудников без барьеров коммуникации. Потенциально огромная ниша B2B2C — интеграция в корпоративные мессенджеры и CRM.
Инвесторам. Accessibility tech — недооценённый сектор с 1+ млрд пользователей по всему миру. DeepMind показывает, что технология созрела для массового рынка. Стоит смотреть на стартапы вокруг жестового языка, субтитров в реальном времени и инклюзивных интерфейсов.
- Создать платформу для онлайн-образования на жестовом языке — видеоуроки с автопереводом
- Разработать корпоративный инструмент для колл-центров и клиентского сервиса, где операторы могут работать с глухими клиентами через видеосвязь
- Сделать мобильное приложение для экстренных служб — глухие пользователи жестикулируют, AI переводит диспетчеру
- Запустить marketplace переводчиков жестового языка с AI-ассистентами для повышения скорости работы
- Интегрировать в телемедицину — врачи и глухие пациенты общаются без посредников
- Точность модели неизвестна на практике — академические бенчмарки не всегда отражают реальное использование, особенно с разными диалектами жестовых языков
- Зависимость от сервера для перевода — без интернета модель бесполезна, что ограничивает применение
- Конкуренция с Apple и Microsoft — у них уже есть accessibility-команды и инфраструктура, DeepMind может не успеть захватить рынок
- Культурные барьеры — глухие сообщества очень разные, универсальная модель может не учесть локальные особенности
Честно говоря, удивляет не сама технология (компьютерное зрение для жестов существует годами), а то, что DeepMind довела её до рабочего продукта. Обычно Google громко анонсирует прототипы, а потом они тихо умирают. Здесь же — реальное приложение с участием сообщества глухих. Это хороший знак, хотя остаётся вопрос: насколько точно работает модель в реальных условиях? Академические бенчмарки и живые разговоры — две большие разницы.
Но если качество окажется достаточным, это реально большое дело. Представьте: глухой человек может позвонить в службу поддержки, жестикулировать, и оператор видит текст. Или студент может отвечать на экзамене жестами, а преподаватель — читать. Рынок accessibility огромный и недооценённый. Если Google не похоронит проект через год (как обычно), это может стать массовым инструментом. Пока осторожный оптимизм — жду отзывы реальных пользователей.
Комментарии