Skip to main content
音声対話AI更新

音声UIで画面をそのまま置き換えてはいけない理由

短い文の入力では音声が打鍵より速いのに、画面の操作をそのまま声に置き換えると使いにくくなります。入力と出力で得意が分かれる理由と、聞き間違いを前提にした設計の組み方を説明します。

ハンドルを握る運転者の手元と車内のダッシュボード
Photo: Atlantic Ambience / Pexels

静かな実験室で短い文を転記する実験では、音声入力は画面での打鍵より3倍近く速いという結果が出ています[1]。それでも、画面でやっていた操作をそのまま声に置き換えると、かえって使いにくくなります。速いのは入力だけで、出力の側には別の制約が残るためです。画面を声に変えるかどうかより先に、入力・出力・確認のどこを声に任せるかを決めます。

入力は速く、出力は1件ずつしか届かない

この実験は英語と中国語で行われたものです。同じ実験では、修正されないまま残った誤りは音声のほうがわずかに多く残りました[1]。誤りの損失が大きい入力では、確定の前に確認が要ります。

出力の側は、同じようにはいきません。画面なら10件の検索結果を一度に眺めて、必要なものだけ拾えます。音声では候補を時間順に聞くことになり、複数の候補を行き来しながら比べるのが難しくなります。要らない候補を一瞬で飛ばすこともできません。

音声が得意 画面が得意
入力 短い指示・報告 長文の編集、途中だけの修正
出力 1件の結果、短い確認 一覧、比較、絞り込み

設計で決めるのは、その操作のどこを声に任せ、どこを画面に残すかです。声で条件を入れて画面で確認する、という分担のほうが自然に収まります。音声で入力したからといって、出力まで音声にする必要はありません。

声でなければ困る場面かどうかで決まる

音声UIが効くかどうかは、使われる場面で決まります。運転中、調理中、設備点検中のように手や目が別の作業に使われていれば、「3番、異常なし」と声で記録できる価値が大きくなります。電話窓口も、利用者との接点が音声しかないという点で同じです。手も目も自由に使える場面では、音声を選ぶ理由を別に説明できる必要があります。

効く条件 効かない条件
手や目が別の作業でふさがっている 画面を見ながら操作できる
入力が短い(「次へ」「温度23度」) 長い文章の編集や、途中だけの修正
選択肢を見比べる必要がない ホテル・商品・検索結果を比較する

同じ機能でも、置かれる環境で評価が変わります。車内なら便利な音声入力も、静かな共有オフィスでは使いにくくなります。他人に聞かれたくない情報の入力にも向きません。適性は機能だけで決まらず、どこでどんな姿勢で使われるかまで含めて決まります。

聞き間違いを減らすだけでなく、すぐ戻れるようにする

音声認識の性能が上がっても、周囲の雑音、話し方、固有名詞、通信環境によって認識は揺れます。音声認識・LLM・音声合成をつないだ対話システムでは、聞き間違いが応答の生成に影響し、段階をまたいで累積することがあります[3]。認識率を100%に近づける方向だけでは、設計が閉じません。

効いてくるのは、間違えたときに困らない経路のほうです。

設計 狙い 中身
受け付けている時間を示す 誤入力を減らす 呼びかけ語で開始する、ボタンを押している間だけ聞く、受付中を画面や音で示す
影響の大きい操作だけ確認する 誤った操作の確定を止める 予約の取り消しは確認する。検索や画面遷移まで毎回確認すると、音声の速さが消える
間違えた項目だけ直せる 修正コストを減らす 住所5項目のうち郵便番号だけ聞き間違えたときに、その項目だけ言い直せるようにする
画面や人へ逃げられる 失敗ループを止める 一定回数失敗したら画面入力へ切り替える。電話ならオペレーターへつなぐ

1つめの受付状態の明示が要るのは、マイクを開いたままにすると、独り言や周囲の会話まで拾ってしまうからです。利用者の側にも、ずっと聞かれているという不安が残ります。

技術指標だけを見ても、使いやすさは決まらない

AI面接システムで音声認識・LLM・音声合成の組み合わせを入れ替えて比べた評価では、自動評価による品質指標と利用者の満足度の相関は弱かったと報告されています[2]。自動評価で高い点が付く構成が、使っていて満足できるUIになるとは限りません。

評価するときに見るのは、声で入力して操作が本当に楽になるか、聞き間違えてもすぐ戻れるか、一覧や比較を無理に音声化していないかです。音声UIは画面を消すための技術ではなく、手や目が使えない瞬間に画面では埋められない部分を補うものです。声が得意な部分だけを任せると、音声の利点がそのまま残ります。

裏側の技術構成は 音声AIは、画面が使える場所では意外と出番がない に、電話環境で音声認識が難しくなる理由は 電話の音声認識はなぜ聞き間違えるのか に記載しています。

参考文献

  1. Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones(2016年、英語・中国語での音声入力と打鍵入力の比較)
  2. Evaluating Speech-to-Text × LLM × Text-to-Speech Combinations for AI Interview Systems
  3. Recent Advances in Speech Language Models: A Survey
LET'S START TOGETHER

Ready to
Design Your Voice?

法人向け受託開発から、コンシューマーアプリの導入相談まで。まずはお気軽にお問い合わせください。