Запись архива

SL2T перевод жестового языка: как работает AI и где его границы

Google заявила о запуске SL2T — системы прямого перевода sign languages в текст. Разбираем landmark pipeline, gloss-free архитектуру, 70 BLEURT, приватность и пределы реального применения.

Схема SL2T: камера, локальное извлечение landmarks рук, лица и тела, серверный gloss-free перевод и вывод английского текста

Коротко

12 августа Google DeepMind представила SL2T и сообщила, что ввод с американского жестового языка, ASL, на английский появится в Gboard и Live Transcribe — сначала на Pixel 11. Это заявление компании о запуске продукта, а не независимая проверка его качества в повседневном общении.

SL2T переводит не отдельные позы рук, а последовательность визуальных языковых сигналов. MediaPipe Holistic на устройстве извлекает координаты ключевых точек лица, рук и тела. По заявлению Google, на сервер уходит поток этих координат, а не исходное видео; сырой видеопоток сразу удаляется. Серверная модель преобразует последовательность landmarks непосредственно в английский текст, не используя glosses как обязательный промежуточный слой.

  • Масштаб по данным разработчика: более 100 000 часов материалов более чем на 50 sign languages; около четверти данных приходится на ASL.
  • Заявленный результат: 70 BLEURT на FLEURS-ASL sd-test в zero-shot постановке.
  • Что это не означает: 70% правильно переведённых разговоров, одинаковое качество для всех языков, диалектов, пользователей и условий съёмки.
  • Известные слабые места: редкие знаки, быстрое fingerspelling, пассивные конструкции, classifier depictions и выражение времени без достаточного контекста.
  • Главная продуктовая граница: удаление сырого видео уменьшает объём передаваемых визуальных данных, но координаты остаются содержательным потоком, требующим отдельной модели угроз и прозрачных правил хранения.

Редакционный вывод. Значение SL2T не в том, что AI якобы «научился понимать жесты». Важнее переход к многоязычному прямому переводу sign languages и его встраивание в пользовательский интерфейс. Оценивать такой продукт нужно не одной метрикой, а по качеству диалога, возможности исправить ошибку, устойчивости к вариативности языка и контролю пользователя над данными.

Почему это перевод, а не транскрипция

Транскрипция обычно сохраняет язык и меняет форму записи: например, переводит речь на английском в английский текст. В случае ASL-to-English исходное высказывание построено на одном естественном языке, а результат — на другом. Между ними нет гарантированного соответствия «один знак — одно английское слово» и одинакового порядка элементов.

Sign languages используют не только форму кисти. Значение создаётся движением, ориентацией, положением в пространстве, работой корпуса и немануальными компонентами, включая лицо. Одновременно могут передаваться несколько признаков. Поэтому система должна учитывать временную последовательность и композицию сигналов, а затем сформировать грамматически связный текст на целевом языке.

Задача Что поступает на вход Что требуется на выходе Почему этого недостаточно для SL2T
Распознавание позы Один кадр или короткое движение Класс позы либо команды Класс не передаёт структуру полного высказывания
Распознавание знака Фрагмент signing Метка предполагаемого знака Последовательность меток ещё не является переводом
Транскрипция Высказывание на исходном языке Запись на том же языке ASL и английский — не две формы одного языка
Перевод Высказывание на sign language Текст с сохранением доступного смысла Именно к этой постановке относится SL2T

Интерпретация. Формулировка «распознавание жестов» сужает задачу до классификации движений и скрывает языковую работу модели. Она также способствует ошибочному представлению, будто sign languages являются наборами универсальных жестов. Корректнее говорить о переводе между самостоятельными естественными языками.

Ограничение. Прямой перевод не гарантирует полного сохранения оттенков смысла. Если визуальный сигнал неоднозначен, контекст отсутствует или в целевом языке требуется выбрать одну из нескольких формулировок, модель всё равно вынуждена принять решение.

Что запустила Google

Google DeepMind описывает SL2T как систему sign-language-to-text и заявляет о её первом пользовательском внедрении для ASL-to-English в Gboard и Live Transcribe на Pixel 11. В Gboard такой механизм становится способом текстового ввода, а в Live Transcribe — частью интерфейса, где результат можно читать как текст.

Важно разделять три уровня заявления. Первый — существование исследовательской модели. Второй — её интеграция в конкретные приложения. Третий — реальная доступность и качество для разных пользователей. Анонс подтверждает первые два уровня в заявленном объёме, но сам по себе не доказывает третий для каждого сценария.

Число языков в обучающем наборе также нельзя автоматически превращать в число готовых продуктовых направлений перевода. Компания сообщает о материалах более чем на 50 sign languages, однако стартовый продукт описан как ASL-to-English. Многоязычное обучение может улучшать перенос представлений, но не является обещанием одинаковой поддержки каждого языка.

Как проверять. До покупки устройства или внедрения функции нужно отдельно уточнить фактическую доступность в нужном приложении, языковую пару, ограничения аккаунта или региона, работу в конкретном режиме и возможность исправлять текст. Исследовательская демонстрация и доступная пользователю функция — не одно и то же.

Как устроен pipeline landmarks-to-text

Вместо отправки каждого кадра на сервер система сначала преобразует видео в структурированное представление. Для этого используется MediaPipe Holistic, объединяющий оценку ключевых точек лица, рук и позы на устройстве.

  1. Захват. Камера получает последовательность кадров с человеком, который подписывает высказывание.
  2. Локальное извлечение landmarks. MediaPipe Holistic определяет координаты ключевых точек рук, лица и тела.
  3. Отделение представления от видео. Следующим этапом становится последовательность координат во времени, а не набор исходных изображений.
  4. Передача. По заявлению Google, на сервер отправляются координаты landmarks; сырой видеопоток не отправляется и сразу удаляется.
  5. Перевод. SL2T сопоставляет временную последовательность landmarks с текстом на целевом языке.
  6. Интерфейс. Полученный английский текст появляется в Gboard или Live Transcribe, где пользователь должен иметь возможность увидеть и оценить результат.

Схема потока.

Камера → MediaPipe Holistic на устройстве → координаты лица, рук и тела → серверная SL2T → английский текст → интерфейс и исправление
Этап Где выполняется Представление данных Что нужно проверять
Захват Устройство Сырой видеопоток Угол камеры, кадрирование, обратная связь пользователю
Извлечение признаков Устройство Landmark coordinates Не теряются ли важные движения, лицо и пространственные отношения
Передача Между устройством и сервером Временная последовательность координат Шифрование, журналы, сроки хранения и вторичное использование
Перевод Сервер Внутреннее представление и текст Качество по подгруппам, контекст, ошибки и неопределённость
Вывод Приложение Английский текст Можно ли быстро заметить, исправить или отменить перевод

Landmark pipeline уменьшает зависимость серверной части от цвета фона, текстуры одежды и других пиксельных деталей, поскольку модель получает геометрию. Но это не означает, что условия съёмки перестают иметь значение: если локальный трекер не увидел руку, потерял лицо или неверно оценил координаты, переводчик работает уже с искажённым входом.

Практический вывод. Качество всей цепочки ограничено не только переводческой моделью. Ошибку может создать камера, трекер landmarks, передача, интерпретация контекста или интерфейс. Тестировать только финальную строку недостаточно: продуктовой команде нужна диагностика по этапам.

Почему без glosses

Glosses — это служебные текстовые метки, которыми исследователи и аннотаторы описывают элементы sign language. Они полезны для анализа, но не являются самим языком и не обязаны сохранять всю информацию лица, пространства, движения и контекста. Конвейер с glosses сначала пытается получить последовательность таких меток, а затем переводит её в обычный текст.

SL2T относится к gloss-free подходу: входное визуальное представление связывается с целевым текстом без обязательной выдачи gloss-последовательности. Этому направлению посвящены работы о gloss-free end-to-end переводе и многоязычном gloss-free SLT.

Мотивация понятна. Если промежуточная разметка неполна или недоступна для части языков, она становится узким местом. Прямое обучение позволяет использовать пары визуального высказывания и целевого текста, не требуя, чтобы каждый пример имел отдельный gloss-слой.

Однако «без glosses» не означает «без внутренних представлений». Модель всё равно должна сжать временную последовательность и связать её с гипотезой перевода. Работа Think in Latent Thoughts рассматривает скрытые представления, контекст и reasoning в gloss-free переводе. Для пользователя важно не название внутреннего слоя, а то, насколько система сохраняет смысл и показывает неопределённость.

Компромисс. Отказ от glosses убирает один источник ошибок и зависимость от дорогостоящей промежуточной разметки, но усложняет диагностику. Когда финальная фраза неверна, труднее понять, какой именно языковой элемент был потерян. Поэтому gloss-free продукту особенно нужны воспроизводимые тесты, анализ ошибок и механизмы исправления результата.

Что означает 70 BLEURT

Google заявляет zero-shot результат 70 BLEURT на FLEURS-ASL sd-test. FLEURS-ASL — исследовательский benchmark для оценки перевода ASL, а sd-test — конкретный тестовый срез. BLEURT автоматически сравнивает сгенерированный текст с эталонным и оценивает их близость.

Факт. Число 70 — результат, сообщённый разработчиком в указанной постановке.

Чего из него нельзя заключить. Это не доля безошибочных разговоров, не «70% понимания», не вероятность правильного перевода следующего высказывания и не оценка всех sign languages. Метрика не сообщает, насколько опасной была конкретная ошибка и смогли ли участники разговора её обнаружить и исправить.

Zero-shot в анонсе характеризует режим оценки модели. Но само слово не превращает один тест в доказательство универсального переноса. Результат остаётся привязанным к набору данных, эталонным переводам, правилам подсчёта и составу тестового среза.

Вопрос Что даёт 70 BLEURT Чего показатель не даёт
Похож ли текст на эталон? Агрегированный автоматический сигнал близости Полного объяснения каждой ошибки
Работает ли модель на тесте? Сравнимую точку в заявленной постановке Гарантию качества вне benchmark
Безопасен ли перевод? Сам по себе не отвечает Оценку последствий неверного имени, времени или отрицания
Удобен ли продукт? Не измеряет интерфейс Данные о задержке, исправлениях и контроле пользователя
Справедлив ли результат? Общий score может быть отправной точкой Паритет между диалектами и пользовательскими группами

Исследование Beyond BLEU: Linguistic Invisibility and Interactional Repair указывает на более широкую проблему: автоматическая близость к эталону не охватывает всю языковую видимость и то, как люди восстанавливают взаимопонимание после сбоя.

Редакционная рекомендация. Публиковать BLEURT следует вместе с примерами категорий ошибок, оценкой людьми, результатами по подгруппам и метриками repair: заметил ли пользователь ошибку, сколько действий потребовалось для исправления и удалось ли завершить разговор.

Где benchmark не похож на жизнь

Benchmark нужен для воспроизводимого сравнения моделей. Проблема начинается, когда его итоговый score выдают за портрет реального общения. В повседневной ситуации меняются камера, расстояние, темп, фон, освещение, подписывающий человек, тема разговора и объём доступного контекста.

Один агрегированный результат также сглаживает различия между типами ошибок. Перестановка слов, потеря имени, неверное время и изменение отрицания могут влиять на общение совершенно по-разному, даже если автоматическая метрика штрафует их сходным образом.

Измерение Benchmark Реальное использование Нужная проверка
Контекст Фиксирован тестовой постановкой Зависит от предыдущих реплик и ситуации Многоходовые диалоги и сброс контекста
Темп Задан материалами теста Меняется внутри одной реплики Обычный и быстрый signing, включая fingerspelling
Вариативность Ограничена составом набора Включает диалекты и индивидуальные особенности Раздельные отчёты, а не только среднее
Камера Контролируется данными Возможны обрезанные руки и движение устройства Тесты на типичных пользовательских устройствах
Исправление Обычно оценивается готовая гипотеза Участники уточняют и переформулируют Успешность interactional repair
Цена ошибки Сводится в общий score Зависит от содержания реплики Сценарии с низкой и высокой чувствительностью

Как проверять. Сначала воспроизводят заявленный benchmark. Затем создают отдельный набор сценариев, не подменяя им исходный тест: разные пользователи, темпы, ракурсы, диалекты, повторные реплики и контекст. Результаты публикуют раздельно. Среднее без размера и состава групп не показывает, для кого функция действительно работает.

Ограничение. Исследовательский пакет не содержит независимого полевого теста реализации на Pixel 11. Поэтому нельзя переносить заявленные 70 BLEURT на конкретную беседу или утверждать, что интеграция в приложения уже воспроизводит benchmark при любых условиях.

Fingerspelling, лицо и пространство

Fingerspelling особенно важно для имён, названий и других последовательностей, которые передаются через быстрые изменения конфигурации рук. Google прямо относит быстрое fingerspelling к слабым местам SL2T. Отдельная работа Fingerspelling within Sign Language Translation рассматривает его ошибки и оценку внутри систем перевода.

Для landmark pipeline это трудный режим: различие между соседними состояниями может быть кратким, а итоговая ошибка в одной букве меняет имя или термин. Общая семантическая метрика способна недостаточно ясно показать такую проблему, если остальная часть предложения близка к эталону.

Лицо также нельзя считать декоративным каналом. Немануальные компоненты участвуют в структуре и смысле высказывания. MediaPipe Holistic извлекает лицевые landmarks, но сам факт наличия координат ещё не доказывает, что переводчик одинаково хорошо использует все значимые сигналы.

Пространство важно для связей между участниками и объектами высказывания. В classifier depictions форма руки, движение и размещение могут совместно изображать свойства или действие. Google указывает такие конструкции среди известных источников ошибок. Ещё одна заявленная проблема — время без достаточного контекста: отдельного фрагмента может не хватить, чтобы выбрать корректную английскую форму.

Категория Заявленная или логическая точка риска Практический тест
Редкие знаки Недостаточная представленность вариантов Отдельный набор редких, но значимых случаев
Быстрое fingerspelling Краткие переходы и цена ошибки в имени Посимвольная и целословная оценка при разных темпах
Пассивные конструкции Неверный выбор английской грамматики Пары с различными ролями участников
Classifier depictions Потеря пространственной и изобразительной информации Оценка смысла людьми, а не только текстового совпадения
Время без контекста Неоднозначная форма целевого текста Один и тот же фрагмент с разным предшествующим контекстом
Лицевые компоненты Трекер видит точки, но модель может недоиспользовать сигнал Контролируемые пары с изменением немануального компонента

Продуктовый вывод. Критичные сущности — имена, даты, время и отрицание — полезно выделять для подтверждения пользователем. Это не исправляет модель, но снижает риск незаметной подмены смысла.

Левши и одноручный ввод

Подписывающие люди различаются по доминирующей руке, амплитуде движений и способу исполнения. Кроме того, использование одной руки может быть постоянным или ситуативным. Архитектурное наличие landmarks для обеих рук не является доказательством одинакового качества для левшей и одноручного signing.

В исследовательском пакете нет отдельной метрики SL2T для левшей, правшей и одноручных пользователей. Следовательно, редакционно корректная позиция — не объявлять ни поддержку, ни провал, а требовать раздельной оценки.

Как тестировать. Нужны сопоставимые по содержанию наборы, подписанные левшами и правшами, а также сценарии естественного одноручного использования. Следует измерять не только средний BLEURT, но и пропуски рук трекером, качество fingerspelling, частоту критических смысловых ошибок и успешность исправления.

Нельзя перекладывать проблему на пользователя инструкцией «подписывайте стандартнее». Если функция позиционируется как доступный способ ввода, продукт обязан показывать границы захвата, сообщать о потере руки или лица и позволять повторить фрагмент без обвиняющего интерфейса.

Редакционная рекомендация. В карточке доступности следует публиковать не абстрактную фразу о поддержке вариативности, а дизайн теста, состав групп и результаты по каждой из них.

Приватность landmark coordinates

Приватностная граница SL2T проходит между локальным извлечением признаков и серверным переводом. Google заявляет: MediaPipe Holistic обрабатывает видео на устройстве, на сервер отправляются landmark coordinates, а сырой видеопоток сразу удаляется. Исследование Towards Privacy-Aware Sign Language Translation at Scale рассматривает privacy-aware представления как способ масштабировать перевод без передачи исходного визуального потока.

Это содержательное улучшение по сравнению со схемой, где сервер получает все кадры. Координаты не несут полного набора пиксельных деталей сцены. Но выражение «видео не отправляется» нельзя сокращать до «данные не отправляются»: сервер всё равно получает временную последовательность лица, рук и тела, предназначенную для восстановления содержания высказывания.

Privacy-aware также не равно анонимному. Даже без исходного изображения поток может сохранять особенности движения и сам переводимый смысл. Поэтому оценка должна охватывать не только удаление видео, но и весь жизненный цикл координат и текста.

Вопросы к модели угроз

  • Где именно и в какой момент удаляется сырой видеопоток?
  • Хранятся ли landmark coordinates после получения перевода?
  • Попадают ли координаты, текст или технические метаданные в журналы?
  • Используются ли они для обучения, оценки или диагностики?
  • Как ограничен доступ сотрудников и сервисов к данным?
  • Может ли пользователь отказаться от сохранения и вторичного использования?
  • Как удаляются связанные копии и резервные данные?
  • Что происходит при сетевой ошибке или незавершённой отправке?
  • Показывает ли интерфейс, когда данные уходят на сервер?
  • Можно ли использовать функцию без привязки чувствительного текста к длительной истории?

Ограничение источников. Пакет подтверждает заявленную архитектурную границу, но не содержит полного аудита реализации, сроков хранения, журналирования и серверного контроля доступа. Эти свойства нельзя вывести из одного факта локального landmark extraction.

Участие Deaf community

Deaf community должна участвовать не только в финальном тестировании готовой функции. Ключевые решения принимаются раньше: какие сценарии считать приоритетными, что является серьёзной ошибкой, какие варианты языка включать, как запрашивать согласие и кто может остановить выпуск.

Для SL2T это особенно важно, потому что автоматическая метрика не определяет социальную цену ошибки. Пользователи могут по-разному оценить задержку, необходимость повторять высказывание, неверный перевод имени, потерю немануального компонента или навязчивое сохранение текста.

Участие не следует сводить к сбору данных. Нужны оплачиваемая экспертная работа, совместное определение метрик, проверка интерфейса исправления, анализ вреда и понятный канал обратной связи после запуска. Отдельно требуется представительство разных sign languages, диалектов и способов signing; один участник не может представлять всё сообщество.

Факт и пробел. Источники пакета позволяют разобрать модель, benchmark и заявленную обработку данных, но не дают достаточной детализации, чтобы оценить состав участников, полномочия Deaf community и механизм управления продуктом. Поэтому глубину соучастия нельзя предполагать по самому факту запуска.

Редакционная рекомендация. Компаниям стоит публиковать не только благодарности консультантам, а описание процесса: кто участвовал, на каких стадиях, какие изменения были внесены и как решались разногласия — без раскрытия персональных данных участников.

Чек-лист доступного продукта

Этот список подходит для приёмки sign-language-to-text функции, пилотного внедрения или независимого теста. Он не заменяет участие Deaf community, но помогает не свести оценку к одной демонстрации.

  1. Назовите языковую пару. Не используйте расплывчатую формулировку «перевод жестов»; укажите исходный sign language и целевой письменный язык.
  2. Отделите обучение от поддержки. Не выдавайте число языков в наборе данных за число доступных продуктовых направлений.
  3. Опишите поток данных. Покажите, где находятся видео, landmarks, текст и технические журналы на каждом этапе.
  4. Проверьте заявление об удалении. Зафиксируйте момент удаления сырого видео и поведение при сбое.
  5. Тестируйте весь pipeline. Разделяйте ошибки камеры, landmark tracker, переводчика и интерфейса.
  6. Публикуйте несколько метрик. Дополняйте BLEURT человеческой оценкой смысла, критическими ошибками и repair.
  7. Разбивайте результаты по группам. Проверяйте диалекты, доминирующую руку, одноручный signing, темп и другие релевантные варианты.
  8. Выделите fingerspelling. Оценивайте имена и последовательности отдельно, включая быстрый темп.
  9. Проверьте лицо и пространство. Не ограничивайтесь видимостью кистей в кадре.
  10. Добавьте контекстные сценарии. Тестируйте время, пассивные конструкции, classifier depictions и зависимость от предыдущих реплик.
  11. Покажите неопределённость. Интерфейс не должен выдавать сомнительную гипотезу как гарантированно точную.
  12. Дайте исправить результат. Пользователь должен быстро повторить, отредактировать, отменить или подтвердить критичный фрагмент.
  13. Проектируйте interactional repair. Измеряйте, удалось ли участникам восстановить смысл после ошибки.
  14. Не делайте функцию единственным каналом. В чувствительных сценариях должен оставаться альтернативный способ общения.
  15. Привлеките Deaf community к управлению. Участие должно начинаться с постановки задачи и продолжаться после выпуска.
  16. Проведите независимую проверку. Self-reported benchmark разработчика следует воспроизвести на документированном наборе и реальных устройствах.

Критерий готовности. Продукт доступен не тогда, когда он однажды выдал правильную строку, а когда разные пользователи понимают его границы, контролируют данные и могут безопасно восстановить коммуникацию после предсказуемой ошибки.

Что нас ждёт

Источники показывают исследовательскую повестку, а не подтверждённую дорожную карту Google. Наиболее заметны пять направлений.

  • Многоязычные gloss-free модели. Общие представления могут уменьшить зависимость от отдельного gloss-слоя, но потребуют отчётности по каждому языку и диалекту.
  • Больше контекста. Работа со скрытыми представлениями и reasoning нацелена на случаи, где значение времени или конструкции нельзя восстановить из короткого фрагмента.
  • Специализированная оценка. Fingerspelling, имена и другие критичные элементы будут требовать собственных тестов, а не растворения в общем score.
  • Метрики взаимодействия. В центре окажется не только сходство текста с эталоном, но и способность людей заметить ошибку, запросить уточнение и завершить разговор.
  • Более строгая privacy boundary. Локальные представления сокращают передачу пикселей, однако давление будет смещаться к прозрачности хранения координат, текста и телеметрии.

Вероятный инженерный сдвиг — от демонстрации «видео превращается в предложение» к системе с контекстом, подтверждением чувствительных сущностей, диагностикой качества захвата и repair-интерфейсом. Это редакционная интерпретация направлений исследований, а не обещание конкретных функций или сроков.

Не менее важен институциональный сдвиг: качество sign-language AI придётся обсуждать как сочетание лингвистики, доступности, приватности и управления данными. Более высокий benchmark score не решает эти вопросы автоматически.

Ограничения

Фактологический срез материала — 27 августа 2026 года. Разбор опирается только на перечисленный исследовательский пакет.

  • Сведения о запуске, объёме обучения, 70 BLEURT, архитектуре передачи данных и известных ошибках являются заявлениями Google DeepMind.
  • В пакете нет независимого воспроизведения результата SL2T на Pixel 11 в реальном общении.
  • Нет достаточных данных для вывода о равном качестве по всем sign languages, диалектам, левшам и одноручным пользователям.
  • Не раскрыты полные распределения ошибок, задержка и качество по отдельным продуктовым сценариям.
  • Локальное извлечение landmarks не доказывает отсутствие рисков хранения координат, текста и метаданных.
  • Один BLEURT score не позволяет оценить критичность ошибок и успешность interactional repair.
  • Пакет не даёт достаточной информации для оценки полномочий и представительности Deaf community в разработке.

Поэтому SL2T корректно описывать как значимый продуктовый шаг и многоязычный gloss-free подход с заявленным benchmark, но не как решённую задачу универсального перевода sign languages.

FAQ

Что такое SL2T?

SL2T — представленная Google DeepMind система, которая получает последовательность landmarks лица, рук и тела и напрямую формирует текст без обязательного промежуточного gloss-слоя. Для первого запуска компания заявила ASL-to-English в Gboard и Live Transcribe на Pixel 11.

Почему это перевод, а не распознавание жестов?

Потому что исходное высказывание построено на sign language, а результат — на другом языке, английском. Система должна передать смысл, структуру и контекст, а не просто присвоить отдельным движениям метки.

Означает ли 70 BLEURT точность 70%?

Нет. Это заявленный автоматический показатель близости перевода к эталону на FLEURS-ASL sd-test. Он не равен доле безошибочных разговоров и не гарантирует качество за пределами benchmark.

Поддерживает ли продукт более 50 sign languages?

Такого вывода из анонса сделать нельзя. Более 50 sign languages относятся к заявленному составу обучающих данных, а первый продуктовый запуск описан для ASL-to-English.

Отправляется ли видео на сервер?

По заявлению Google, MediaPipe Holistic извлекает landmarks на устройстве, на сервер передаются координаты, а сырой видеопоток сразу удаляется. Это уменьшает объём визуальных данных, но не отменяет приватностные вопросы к координатам, тексту и журналам.

Зачем SL2T отказалась от glosses?

Gloss-free подход устраняет обязательный промежуточный слой разметки и переводит визуальное представление прямо в текст. Это снижает зависимость от gloss-аннотаций, но усложняет диагностику отдельных ошибок.

Хорошо ли SL2T распознаёт fingerspelling?

Google прямо называет быстрое fingerspelling одним из слабых мест. Его нужно оценивать отдельно, особенно на именах и терминах, где единичная ошибка может изменить смысл.

Подтверждена ли одинаковая работа для левшей и одноручного signing?

Нет. В пакете нет раздельных результатов для этих групп. Наличие landmarks обеих рук не заменяет тестирование левшей, правшей и естественных одноручных сценариев.

Может ли SL2T заменить переводчика-человека?

Источники не дают оснований для такого вывода. Известные ошибки, зависимость от контекста и отсутствие независимой полевой проверки требуют альтернативного канала общения, особенно в чувствительных ситуациях.

Как проверить подобный продукт?

Нужно воспроизвести benchmark, провести тесты на реальных устройствах и раздельно оценить языки, диалекты, fingerspelling, лицо, пространство, доминирующую руку, контекст, приватность и успешность исправления ошибок.

Источники

  1. Putting sign language AI into users’ hands — подтверждает заявления Google DeepMind о SL2T, запуске ASL-to-English в Gboard и Live Transcribe на Pixel 11, объёме данных, 70 BLEURT и известных категориях ошибок.
  2. MediaPipe Holistic — описывает локальное одновременное извлечение landmarks лица, рук и позы.
  3. FLEURS-ASL — источник о benchmark, его назначении и составе данных для оценки ASL-перевода.
  4. Towards Privacy-Aware Sign Language Translation at Scale — подтверждает исследовательскую мотивацию privacy-aware представлений и масштабирования перевода без передачи исходного видеопотока как входа серверной модели.
  5. Multilingual Gloss-free Sign Language Translation — источник о многоязычном gloss-free подходе.
  6. Gloss-Free End-to-End Sign Language Translation — объясняет ограничения обязательного gloss-слоя и исследовательскую постановку прямого перевода.
  7. Think in Latent Thoughts — подтверждает направление исследований контекста, reasoning и скрытых представлений в gloss-free SLT.
  8. Beyond BLEU: Linguistic Invisibility and Interactional Repair — источник о границах автоматических текстовых метрик и важности восстановления взаимодействия после ошибки.
  9. Fingerspelling within Sign Language Translation — подтверждает необходимость отдельного анализа и оценки fingerspelling внутри систем перевода.