Pixel 11、ASLを英語テキストへ変換するGoogle DeepMind SL2Tでスマホ入力の障壁を低減
Original: Google SL2T Turns ASL Into English Text on Pixel 11 View original →
手話がスマートフォンの直接入力になる
Pixel 11は、アメリカ手話(ASL)を英語テキストへ変換し、GboardとLive Transcribeに直接入力する機能を備える。中核となるのはGoogle DeepMindの手話テキスト変換モデル「SL2T」だ。カメラで手話を認識するデモにとどまらず、Androidで日常的に使うキーボードと文字起こし機能へ結果を渡す。ろう者や難聴者が、先に音声やキーボード入力へ表現方法を変えたり、別の翻訳アプリを開いたりする手順を減らせる点が重要になる。
“Starting with American Sign Language-to-English on Pixel 11, people can sign directly into Gboard and Live Transcribe instead of typing.”
Google DeepMindは元の投稿で、Pixel 11におけるASLから英語への変換を最初の導入例として示した。続く投稿では、SL2Tが学術ベンチマークで最高水準の性能に達し、片手でスマートフォンを持ちながらもう一方の手で手話を使う状況にも最適化したと説明している。両手、固定された画角、整った背景だけを前提にした認識モデルは、実験室では動いても携帯端末の入力機能としては使いにくい。その差を製品設計の段階で扱った形だ。
姿勢追跡は端末、翻訳はクラウド
処理は二つに分かれる。カメラ映像から身体の姿勢を追跡する工程はPixel端末内で行い、その表現をGoogleのサーバーがテキストへ翻訳する。映像全体をそのまま遠隔処理する方式とは異なる一方、完全な端末内翻訳でもない。製品版では、端末外へ送られるデータの形式、保存期間、通信が不安定な場合の挙動、関連データを利用者が確認・削除できるかがプライバシーを評価する基準になる。
Google DeepMindの公式技術解説によると、開発にはろう者のGoogle社員とAI Sign Language Advisory Committeeが参加した。同アカウントは通常、Geminiの研究、科学向けモデル、ロボティクス、Google製品へ移行した応用研究を扱う。今回は研究成果がOSの入力層へ組み込まれる点に価値がある。Gboardを通じてメッセージ、検索、文書など多くのAndroidアプリへ利用範囲が広がる可能性がある。
次に確認すべきこと
最初の対象はASLから英語への一方向で、端末はPixel 11に限られる。今後は他の手話と言語の組み合わせ、地域による表現差、長い連続手話の文脈処理、翻訳までの遅延が焦点になる。実利用では、照明、撮影角度、手話の速度、身体条件が異なる環境での誤認識率が、抽象的な最高水準という評価より重要だ。Googleは対象の手話と用途を増やす方針を示したが、時期は明らかにしていない。発売後のオフライン動作、代替入力、利用者からの修正をどう反映するかが、SL2Tを信頼できる基盤へ育てられるかを左右する。
Related Articles
注目点はサイズだけではない。安全ポリシーを自然言語の質問として渡せる設計に関心が集まった。
話題は「AI moderator」という見出しだけではない。Automod、開発者政策、コミュニティの裁量が同時に動いている。
GoogleはKoray KavukcuogluにGeminiモデル開発、アプリ、Frontier AI researchを束ねさせ、Demis HassabisをAlphabet Chief Scientistへ移す。Geminiアプリ950M+月間ユーザー、Gemma 900M+ダウンロードの規模で、Jeff DeanとSanjay Ghemawatは独立public benefit corporationを立ち上げる。