本文へスキップ

WER はうそをつく。本物のインタビューで正確さをどう測るか

· Zeyu Si

このページの内容

以前、スウェーデンの朝のテレビ番組から、本の書評インタビューをテストしたことがあります。四つの音声エンジンがそれを書き起こしました。ほぼ誰もが使う指標である WER で見ると、エラー率は 194% から 216% の間でした。語数より誤りのほうが多いのです。

その後、四つの書き起こしを一行ずつ読みました。それはバッチ全体で最も欠けの少ないものでした。書名も、名前も、筋の要点も、すべて正しい。参照書き起こしが省いていた部分まで拾っていました。

問題は参照のほうにありました。

この記事では二つのことを扱います。なぜ WER はインタビューで破綻するのか、そして私たちが何に切り替えたのか。これは、私たちが 27 の言語すべてでエンジンを選ぶのに使った方法です。

インタビュー音声で WER が人を誤らせる五つの理由

20 を超える言語で、同じいくつかの問題に突き当たりました。どれも、精密に見えて間違ったことを語る数字を生みます。

1. 参照はすでに刈り込まれている。 私たちの参照の大半は、映画やテレビの聴覚障害者向け字幕から来ています。字幕は素早く読めなければならないので、人が実際に言ったことを日常的に圧縮します。エンジンが忠実に書き起こすほど字幕と食い違い、そのぶん減点されます。それがスウェーデンのインタビューで起きたことです。全員が互いに怒鳴り合うスペイン映画の場面では、どのエンジンも WER が 63% から 80% の間でした。一行ずつ読むと、どれも意味はきちんと伝えていました。

2. 書き言葉と話し言葉は同じものではない。 書き言葉のアラビア語と、人が日常で話すアラビア語は大きく離れていることがあります。同じエンジンを現代標準アラビア語で書かれた参照で採点すると 49%、方言を忠実に記録した参照では 16% でした。エンジンは変わっていません。変わったのは参照です。

タミル語はもっと極端です。字幕は慣習的に文語体で書かれる一方、人は口語体で話します。字幕を参照にすると、発話を文語のタミル語に「書き換える」エンジンが勝ちます。忠実に書き起こすエンジンは最下位です。順位が逆転するのです。

3. 中国語と日本語は単語の間にスペースを入れない。 スペースで区切ると、中国語の一文まるごとが一つの「単語」になります。エラー率は 1000% を超えることもあります。その数字には何の意味もありません。

4. 綴りは違っても、意味は同じ。 ギリシャ語とアラビア語はしばしば高いスコアになります。よく見ると「誤り」の多くは語形変化や綴りの慣習で、たとえばハムザと呼ばれるアラビア語の小さな記号が書かれているかどうかです。読み手が文を誤解することはありません。それでも指標はそれを数えます。

5. だから WER は煙試験であって、それ以上ではない。 WER が教えてくれるのは、エンジンが完全に崩れたかどうかです。区間がまるごと抜けている、画面いっぱいの意味不明な文字、といったことです。まともに動く二つのエンジンのどちらがより正確かを決めるのに、もう WER は見ていません。

参照は本物の会話であるべき

本物のインタビューには、間、フィラー、割り込み、発話の重なりがあります。ニュースキャスターや朗読の音声でテストすれば、どのエンジンも素晴らしく見えます。インタビューは話が別です。

そこで、私たちのテスト音源は自発的な発話に限っています。まず映画の場面です。セリフに忠実に沿った聴覚障害者向け字幕があり、入手もできます。適した映画が見つからないときは、テレビドラマとドキュメンタリー、議会や法廷の録音、逐語の書き起こしがあるポッドキャストの順に代替します。

難易度は三段階で、それぞれが前の段階の上に積み上がります。

  • 基本:一人か二人、一定のペース、背景雑音なし、標準的な訛り。それでも本物の会話です。この段階だけで弱いエンジンがいくつか脱落します。
  • やや難:基本に一つか二つの難しさを加えたもの。たとえば早口、少人数のグループ、速い話者交代、多少の背景雑音、あるいは訛り。
  • 極難:発話の重なり、強い雑音や音楽、強い方言、悪い音質が一度に来るもの。

地域差の大きい言語では、地域ごとに音源を用意します。スペイン語ならスペイン、メキシコ、アルゼンチン。アラビア語なら湾岸、エジプト、レバント。

エンジンを確かめる前に参照を確かめる

これは皆が飛ばす工程です。私たちは痛い目を見てから加えました。参照を採点に使う前に、参照そのものが正しいことを確認します。

ある監査では、問題なさそうに見えていた音源を大量に捨てました。

  • タガログ語と表示された番組が、実際には別のフィリピンの言語であるセブアノ語でした。
  • タイ語の音源で、字幕が音声と約 30 秒ずれていました。
  • 広東語のインタビューが、実は韓国語でした。ゲストが韓国人で、広東語の字幕は翻訳だったのです。どのエンジンもそこではほぼ 100% の誤りになりました。

どれも、精密に見えて意味のないスコアを生んでいたはずです。さらに悪いことに、以前の結論のいくつかはこうした音源の上に築かれていました。

使える参照がまだ見つからない言語が三つあります。タミル語、ベンガル語、フィリピン語です。これらはまだ対応していません。責任を持てない数字を出すくらいなら、その言語を提供しないほうを選びます。

意味を変える誤りを数える

研究者はインタビューの書き起こしを意味のために読みます。「um」を「uh」と書いても問題ありません。「しなかった」を「した」と書くのは問題です。そこで各エンジンについて、六つの分類でレッドラインの誤りを数えます。

  1. 捏造された文:誰も言っていない文が現れる。エラー率はまったく立派だったあるエンジンは、強い訛りのある音源で「バナナを買う」で終わる完全な一文を出力しました。誰もそんなことは言っていません。そのエンジンは使いませんでした。
  2. 反転した否定:「いいえ」が「はい」になる、あるいはその逆。完璧に読めて、意味は正反対です。次の記事はこれについてです。
  3. ループ:同じ語が何十回、何百回と繰り返される。
  4. 挿入された内容:音声になかったものが足される。
  5. 欠落した区間:発話のひと続きがまるごと抜ける。強い方言と騒がしい群衆のある映画の場面で、あるエンジンは最初の 54 秒を落としました。
  6. 言語のずれ:途中で言語が切り替わる。あるエンジンはスペイン語の長い区間をポルトガル語に変えました。「Soy abogado」が「Sou advogado」になったのです。

どのエンジンも同じ物差しで測ります。名前の綴りの違いや、数字を「6」と書くか「六」と書くかは、レッドラインには数えません。

書き起こしを読む人間も見落とすので、機械的な確認も二つ走らせています。

  • 出力比:エンジンが出力した語数を参照の語数で割ったもの。1 を大きく下回るときは、たいてい大きな区間が落ちています。0.1 を見たこともあります。1 を大きく上回り、同じ語の繰り返しが多いときは、たいていループです。1.8 を見たことがあります。
  • 繰り返し:短い範囲の中で同じ語がどれだけ頻繁に現れるか。

どちらも音声形式や音源の難易度に左右されないので、言語をまたいで比較できます。WER にはそれができません。

自分たちをだまさないためのルール

どれも失敗から生まれたものです。

複数のエンジンが一致し、参照だけが食い違うときは、まず参照を疑う。 トルコ語で二度これを間違えました。字幕がそのセリフを省いていただけなのに、本物の発話を「ハルシネーション」として記録したのです。

複数のエンジンが同じ箇所で同じ誤りを犯すときは、そのうちの一つのせいにしない。 たいていはそこの音声が本当に不明瞭で、誰でも間違えます。一つのエンジンの失点にするのはそのエンジンに不公平で、間違ったエンジンを選ぶことにつながります。

短い音源は信用できない。必ず録音全体を走らせる。 私たちが検討したある手法は、10 分の音源で話者識別が 99.8% でした。録音全体で走らせると 63.9% に落ちました。

すべての設定を少なくとも二回走らせる。 同じ入力がいつも同じ出力になるとは限りません。あるとき、エンジンがたった一つの「um」を 99 回繰り返し、続く三文を飲み込みました。一回しか走らせなければ、それが典型なのか偶然なのか判断できません。

この方法が及ばないところ

私たちのテスト音源の大半は、調査インタビューではなく映画とテレビから来ています。映画のセリフは台本があり、丁寧に録音されています。会議室のテーブルに置かれたレコーダー一台とは別物です。したがって、これらの結果が教えてくれるのは、本物の会話でエンジンがどう失敗するかであって、あなたのインタビューがどれだけ正確になるかではありません。

それが、書き起こしの正確さについて見出しになるような単一の数字を公表しない理由でもあります。私たちが共有できるのは、どうテストしたか、何がわかったか、そしてまだ何がわかっていないかです。

次回:六つのレッドラインの中で最も危険なもの。意味が反転しても、文は完璧に読めてしまうケースです。

執筆Zeyu Si