シリーズ:27言語の検証記録
日本語:一番よく見えたエンジンは、フィラーを消していた
· Zeyu Si
現代の日本語のインタビュー音声二つで、AssemblyAI は当初、試した四つのエンジンの中で最も正確に見えました。そのうち一つでは文字誤り率が 8.4% まで下がりました。そこで、そのリードがどこから来ているのかを突き止めました。採点に使う字幕は、話し言葉のフィラーや言いよどみを落としています。AssemblyAI もそれを落とします。Soniox はそれを書き取り、書いたものはすべて誤りとして数えられていました。両側からフィラーを取り除くと、Soniox が四つの音声すべてで勝ち、最後の一つでは 2.0% と、メインエンジンより低くなりました。
この発見で、日本語のリファレンストラックの顔ぶれが変わりました。
テスト用の音声
二組、四つの音声:
- 七人の侍(1954):東北方言、密度の高い怒鳴り声、古い映画のヒスノイズ。
- 羅生門(1950):標準語だが、激しい雨と、互いに割り込む三人。
- YouTube の二人のインタビュー:頻繁なターン交代、クリアなスタジオ音声。
- 日本語の YouTube 番組の一回分:二人の司会者が絶えず相づちを打ち(そうだね、うん など)、数語ごとに話者が替わる。
三段階の難易度の尺度では、映画は最上位、現代の音声は中間です。易しい日本語の音声(一人か二人、一定のペース、雑音なし)は別にテストしていません。
現代の音声では、自動字幕ではなく、必ず投稿者が手作りした字幕と照らして採点しました。最初に選んだインタビューは、一行ずつ確認したところ、英語で話していて日本語の翻訳字幕が付いたものでした。書き起こしを翻訳と照らして採点しても意味がないので、差し替えました。
試したエンジン
第一ラウンドは ElevenLabs Scribe v2、AssemblyAI、Doubao、Speechmatics。追加の実行で Soniox、Gladia、Deepgram、FunASR、Qwen。Gemini は別途テストしました。
エンジンがレッドラインを越えたところ
繰り返しのループ。 七人の侍 の怒鳴り声で、AssemblyAI は一つの音を 95 回繰り返しました。同じ音声で Gladia は 447 回繰り返しました。書き起こしが一つの音節で埋まると、その後に続いたものはすべて消えます。
作り出された文。 同じく 七人の侍 で、AssemblyAI は文をまるごとでっち上げ、羅生門 では行の末尾に話されていない言葉を付け足しました。
挿入された内容。 古い映画で、Doubao は誰も出していない暴力的な命令を一度書き出しました。Doubao がきれいだったと言えるのは現代の音声だけです。
意味の反転。 Soniox は 七人の侍 の方言と怒鳴り声の部分で、二つの行の意味を逆にしました。同じ音声で、AssemblyAI はループし、文を作り出していました。この二つの誤りで Soniox を外し、AssemblyAI を残すのは、別々の基準で判断することになるので、この場面固有の問題として扱いました。
言語ドリフト。 Gemini をメインエンジンの代役として試したとき、日本語の一部の漢字が中国語の簡体字の形で出てきました。紹介、連絡、結婚ではなく、绍介、连络、结婚。字は合っていても、字体が違います。
置換(レッドラインではないが、誤解を招くもの):Speechmatics は、家族や友人の前で挙げる結婚式である 人前式 を 人権意識 と聞きました。Doubao と AssemblyAI はどちらも 酌み交わす(「酒を酌み交わす」)を同音の 組み交わす と書きました。
何を選んだか
メイン:ElevenLabs Scribe v2。 四つの音声のどれでも一度も崩壊しなかった唯一のエンジンで、YouTube 番組では 5.1% でした。
リファレンス(順に):Soniox、Doubao、Gemini。 三つとも日本語のすべてのファイルで動きます。
- Soniox:フィラーを除くと四つの音声すべてで勝ちます。古い映画での二つの反転は、その場面によるものと判断しました。
- Doubao:意味不明な出力が返ってきたので、当初は日本語に対応していないと思っていました。単に正しい言語コードを送っていなかっただけでした。ja-JP を指定すると、現代の音声ではきれいで、羅生門 では三位、七人の侍 では中位ながら崩れませんでした。Soniox とは系統が大きく異なるため、二つが同じ箇所で失敗することはめったにありません。
- Gemini:二つの現代の音声でレッドラインの誤りはありませんでした。
AssemblyAI は予備になりました。
私たちの選択に不利な証拠
- AssemblyAI は現代のインタビューでは実際に正確で、クリアな本物の会話では問題がほぼ消えます。置き換えた主な理由は、古い映画でのループと作り出された文、そしてフィラーを除くともはや一位ではないことです。
- 以前のラウンドでは逆の結論が出ていました。その時点では、インタビューの素材で Soniox が既存の二つより良くは見えず、ルールは「同点なら変更しない」でした。フィラーの発見がそれを覆しました。つまりこの判断は、フィラーを数えるかどうかという、採点上の一つの選択にかかっています。
- Gemini は二本の古い映画で多くの間違いをしました。七人の侍 では 米(「こめ」)を姓の 亀岡 にしました。羅生門 では平安時代の警察の役職 検非違使 を 蛇石(「へびいし」)と書き、「説教はもうたくさんだ」を「咳はもうたくさんだ」にし、最後の文を落としました。羅生門 はセリフがクリアなので、問題は雑音よりも録音品質に連動しています。クライアントの録音が悪ければ、このトラックもそれにつられて崩れるかもしれません。
未解決の問題
- 本物のインタビューは二本しかなく、どちらもクリアです。騒がしい部屋での現代の日本語インタビューの採点例はありません。
- クライアントが えーと まですべて残す厳密な逐語を望むなら、フィラーを書く Soniox の癖は強みです。整えた書き起こしを望むなら、順位の根拠を見直す必要があります。
- 簡体字の問題は、Gemini がメインエンジンの代役を務めたときに出ました。Gemini がリファレンストラックとして動くときにも起きるかどうかについては、別のデータがありません。
執筆:Zeyu Si