シリーズ:27言語の検証記録
アラビア語:話すのは方言、字幕は MSA。それでもエンジンをどう選んだか
· Zeyu Si
エンジンは一つ、実力も一つ。それなのに、あるアラビア語の録音では誤り率が 49.2%、別の録音では 18.2% でした。
エンジンは変わっていません。変わったのは基準となる書き起こしです。一つ目は正式なアラビア語で書かれていました。二つ目は、話者が実際に使った方言をそのまま一語ずつ記録していました。
テスト用の音声:二本の録音、二つの方言
- Talhouk:レバノン人の話者による、母語とアラビア語教育についての公開講演。本人はレバノン方言の口語で話しています。字幕はそれを現代標準アラビア語(MSA)に置き換えています。
- Fenjan(روقي):湾岸(サウジアラビア)アラビア語による時事インタビュー。字幕は話された方言を逐語で書き起こしています。
手元にあるのはこれだけです。方言の音声、人手による字幕、逐語の忠実さの三つを兼ね備えた無料素材は非常に見つけにくく、この二本で打ち止めにしました。選んだ基準は方言であって、難易度ではありません。最も難しい層(話者の重なり、強い背景雑音)は、アラビア語ではカバーしていません。
そして、エンジンの順位付けに使えるのは二本目だけです。理由は次のとおりです。
テストしたエンジン
十個です。ElevenLabs Scribe v2、AssemblyAI、Speechmatics(enhanced と Melia-1)、Doubao(ar-SA)、Soniox、Deepgram、Gladia、FunASR(fun-asr-mtl)、Qwen(qwen3.5-omni)。Gemini は 2026年8月の追加ラウンドで加わりました。
レッドライン:アラビア語は「安全な」言語だった
Fenjan のインタビューでは、ElevenLabs、Soniox、Speechmatics、Qwen、Doubao、Gladia、Deepgram、FunASR の八つの書き起こしを一行ずつ読みました。どれも意味を保っていました。作り話の文も、否定の反転も、でっち上げの一節もありません。
問題は別のところにありました。
- AssemblyAI は Talhouk の講演の一部でループし、音声にない内容を、長さゼロのタイムスタンプに紐づけて出力しました。アラビア語の全エンジンの中で、本物のハルシネーションはこれだけでした。
- FunASR はアラビア語の文に英単語「Also」を紛れ込ませ(小さな言語ドリフト)、1990 年を 2990 年にしました。
- Doubao と FunASR は Fenjan で 41.4% と 37.7% と、上位のおよそ倍のスコアでした。詳しく読むと、その「誤り」の大半は二つの原因によるものでした。ハムザ記号の省略と、方言での言い方どおりに綴られた年号(2011 を الفين واحدعش と表記)です。読み手が誤解することはありません。当初は Doubao がアラビア語に弱いと結論しましたが、後にそれを撤回しました。
同じ音声で、Speechmatics は 15.7%、Qwen は 17.9%、Soniox は 18.2%、ElevenLabs は 20.1% でした。差は数ポイントです。
何を選んだか、そしてなぜ
メイン:ElevenLabs Scribe v2。 Fenjan では上位グループの後方にいて、アラビア語が最も得意な言語というわけではありません。しかし二本とも忠実でした。レバノンの講演では بدي、هيدا、وين といった方言の単語をほぼそのまま残しました。湾岸のインタビューでは、話者が وش(「何」)と言ったところをより一般的な أيش と書きましたが、意味は失っていません。全言語でメインエンジンにしている主な理由は、話者分離と長い録音での安定性であって、このスコアではありません。
リファレンス 1:Soniox。 二本ともハルシネーションなし、湾岸方言の読み取りは最も忠実でした。レバノンの講演では逆に、方言を正式なアラビア語として書いたため、そこでの WER が最も低くなりました。つまりメインエンジンとは反対方向に間違えます。一方は方言寄り、もう一方は書き言葉寄り。同じように間違える二つのエンジンより、照合にはずっと役立ちます。
リファレンス 2:Speechmatics。 Fenjan で誤り率が最も低く、出力はきれいで、崩れもありません。従来型の音響モデルで、Soniox とは作りが違います。書き起こしに句読点が付きませんが、これは API の設定で、単語には影響しません。
リファレンス 3:Gemini。 八月のラウンドで、アラビア語は「追加可能」のグループに入りました。少なくとも二本の会話またはスピーチの音声でレッドラインがなかったためです。
採用しなかったもの:Qwen は上位二つと同じくらい正確でしたが、Gemini と同じ大規模言語モデル型の文字起こしで、単語レベルのタイムスタンプを返さないため、控えに回しています。Doubao は構成内のどのエンジンとも仕組みが違い、予備の候補にはなりますが、組み込んではいません。
私たちの選択に不利な証拠
- 以前、Soniox を選んだ理由として「レバノン方言に最も忠実」と挙げていました。単語ごとに再確認すると、話は逆でした。方言の単語を残していたのは ElevenLabs、FunASR、Qwen、Doubao で、最も書き言葉に寄せていたのが Soniox でした。その理由は取り下げました。Soniox は上に書いた理由で残しています。
- 信頼できる順位付けは、一本の録音だけに依拠しています。Speechmatics、Qwen、Soniox の差は二、三ポイントで、一本の音声では区別できません。
- アラビア語の最初の評価は、主に WER と出力の構造に頼っていました。意味で読むのは後になってからで、それが「Doubao と FunASR はアラビア語に弱い」という判定を覆しました。
未解決のこと
- テストしたのはレバント方言と湾岸方言だけです。エジプト方言などはカバーしていません。
- 方言に忠実な三本目、四本目の録音が見つかったら、順位付けをやり直す必要があります。
- 二本とも公開講演とメディアのインタビューで、リサーチのインタビューではありません。
執筆:Zeyu Si