инструменты 1 мин

DeepMind выпустила SL2T — AI переводит жестовый язык в текст прямо на смартфоне

DeepMind запустила SL2T — модель для перевода жестового языка в текст в реальном времени. Глухие пользователи теперь могут жестикулировать вместо набора текста. Модель работает на смартфонах, распознаёт руки, тело и мимику одновременно, отслеживание поз — на устройстве для приватности, перевод — на сервере. Разработана с участием сообщества глухих, планируется расширение на другие жестовые языки.

Это показывает, что AI перестаёт быть игрушкой для технарей и начинает решать реальные социальные проблемы. Миллионы глухих людей получают инструмент для естественной коммуникации — это больше, чем просто новая модель.

DeepMind выпустила SL2T — модель, которая переводит жестовый язык в текст на смартфонах. Теперь глухие пользователи могут общаться жестами вместо набора текста — AI читает одновременные движения рук, тела и мимики, превращая их в английский текст в реальном времени.

Модель учитывает реальные сценарии: работает даже при одноручном жестикулировании (когда телефон в другой руке). Отслеживание поз происходит на устройстве для приватности, а перевод — на сервере.

По данным DeepMind, SL2T показывает state-of-the-art результаты на академических бенчмарках. Ключевое отличие — разработка велась с тесным участием сообщества глухих, что делает инструмент практически применимым, а не лабораторной игрушкой.

Сейчас модель работает с английским жестовым языком, но команда планирует добавить поддержку других языков. Это тихий, но серьёзный шаг в accessibility: технология снимает барьер коммуникации для миллионов людей.

компьютерное зрениеaccessibilityжестовый языкмобильные приложенияинклюзия

Автор: Павел Заславский · Источник: reddit.com

Разработчикам. Гибридная архитектура — отслеживание поз на устройстве (edge), тяжёлый перевод на сервере — готовый паттерн для реалтайм-приложений с приватностью. Можно адаптировать для других задач компьютерного зрения. API пока не открыт, но это маркер направления Google в on-device AI + server inference.

Бизнесу. Открывается рынок accessibility-приложений: образование, медицина, колл-центры, клиентский сервис. Компании смогут нанимать глухих сотрудников без барьеров коммуникации. Потенциально огромная ниша B2B2C — интеграция в корпоративные мессенджеры и CRM.

Инвесторам. Accessibility tech — недооценённый сектор с 1+ млрд пользователей по всему миру. DeepMind показывает, что технология созрела для массового рынка. Стоит смотреть на стартапы вокруг жестового языка, субтитров в реальном времени и инклюзивных интерфейсов.

Хайп35
Реальная польза75
Заработать60
  • Создать платформу для онлайн-образования на жестовом языке — видеоуроки с автопереводом
  • Разработать корпоративный инструмент для колл-центров и клиентского сервиса, где операторы могут работать с глухими клиентами через видеосвязь
  • Сделать мобильное приложение для экстренных служб — глухие пользователи жестикулируют, AI переводит диспетчеру
  • Запустить marketplace переводчиков жестового языка с AI-ассистентами для повышения скорости работы
  • Интегрировать в телемедицину — врачи и глухие пациенты общаются без посредников
  • Точность модели неизвестна на практике — академические бенчмарки не всегда отражают реальное использование, особенно с разными диалектами жестовых языков
  • Зависимость от сервера для перевода — без интернета модель бесполезна, что ограничивает применение
  • Конкуренция с Apple и Microsoft — у них уже есть accessibility-команды и инфраструктура, DeepMind может не успеть захватить рынок
  • Культурные барьеры — глухие сообщества очень разные, универсальная модель может не учесть локальные особенности

Честно говоря, удивляет не сама технология (компьютерное зрение для жестов существует годами), а то, что DeepMind довела её до рабочего продукта. Обычно Google громко анонсирует прототипы, а потом они тихо умирают. Здесь же — реальное приложение с участием сообщества глухих. Это хороший знак, хотя остаётся вопрос: насколько точно работает модель в реальных условиях? Академические бенчмарки и живые разговоры — две большие разницы.

Но если качество окажется достаточным, это реально большое дело. Представьте: глухой человек может позвонить в службу поддержки, жестикулировать, и оператор видит текст. Или студент может отвечать на экзамене жестами, а преподаватель — читать. Рынок accessibility огромный и недооценённый. Если Google не похоронит проект через год (как обычно), это может стать массовым инструментом. Пока осторожный оптимизм — жду отзывы реальных пользователей.

Ещё по теме

Комментарии