インタビューの途中で言語が切り替わるとき
· Zeyu Si
国境を越える調査では、こんな録音がたくさん生まれます。インタビュー対象者はスペイン語を話し、質問する側は中国語を話し、その間に通訳が座っています。会話は二つの言語を行き来します。
私たちはこれを簡単なことだと考えていました。各エンジンの資料をすべて読み、ラボテストを一通り走らせ、一連の結論に達しました。その後、本物の録音をテストすると、結論はひっくり返りました。
二種類の混在、まったく違う結果
まず、二つの状況を分けて考える必要があります。
- ときどき挟まる別の言語:主な言語が一つあり、たまに別の言語の単語や文が入るもので、録音の十分の一未満です。
- 交互に話す:たとえば逐次通訳のように、二つの言語が交互に現れ、それぞれがおよそ半分を占めるものです。
この二つのケースでエンジンの振る舞いは大きく異なります。一括りにすべきではありません。
まず良い知らせから。英語が混ざる場合はおおむね問題ありません。ほぼすべてのエンジンの多言語対応は「X 語+英語」を軸に作られています。私たちの主軸エンジンは、スペイン語の真ん中であっても、英語の文をまるごと話されたとおりに書き出します。
問題が始まるのは、どちらの言語も英語でないとき、たとえばスペイン語と中国語が混ざるときです。
同じ「言語」設定が四つの違う意味を持つ
ほとんどのエンジンには言語のパラメーターがあります。どこでもだいたい同じことをすると思うかもしれません。私たちは各ベンダーの資料を読み、それから一つずつテストしました。それは四つの違うものでした。
- ElevenLabs:録音が主にどの言語かを伝えるもの。
- Soniox:そちらに寄せるヒントで、ほかの言語の認識を妨げるものではありません。
- Doubao:どの言語モデルを走らせるかを選ぶもの。奇妙なことに、空欄のままにするのが最悪の選択です。その場合は中国語と英語を聞き取ろうとし、スペイン語を無理やり英語にしてしまいます。
- AssemblyAI:ファイル全体がどの言語かを決め、ファイル全体をその一言語のモデルに渡すもの。同時に扱える二言語のうち、一つは英語でなければなりません。
最後のものには露骨な帰結があります。中国語が 45% を占める録音で、AssemblyAI はそれでもスペイン語だと判断しました(確信度 0.84)。四通りの設定を試しましたが、中国語は一文字も出てきませんでした。
逆方向の驚きもありました。Doubao の資料を読む限り、言語をスペイン語に設定するとファイル全体がスペイン語に固定されるはずです。実際にはそうなりませんでした。途中の中国語もちゃんと書き起こしたのです。
最悪の結果は翻訳
ときどき別の言語が挟まる場合、私たちの主軸エンジンは設定次第で二通りのどちらかの失敗をします。(これはつなぎ合わせた録音でテストしました。つなぎ合わせの問題点は次の節で扱いますが、言語の切り替わりがこれほど明白なときにエンジンが間違えるなら、本物の録音が簡単になることはありません。)
- 主な言語はスペイン語だと伝えると、中国語の文はあっさり消えます。タイムラインはそこを飛ばし、痕跡を残しません。
- 伝えないと、中国語の文は流暢なスペイン語に翻訳されます。「你是谁?」は「¿Quién eres?」になりました。書き起こし全体に中国語は一文字もありません。
一つ目は穴を残します。二つ目は誰も言っていないスペイン語を足します。二つ目のほうが悪いのです。書き起こしは完璧に読め、研究者は対象者が本当にスペイン語でそう言ったと思い込むからです。
大規模言語モデルで書き起こす別のエンジンは、言語の切り替わりで行き詰まり、同じ語を約 370 回繰り返しました。
本物の音声がラボの結果を覆した
交互に話すケースをテストするため、まずはつなぎ合わせた音声から始めました。既存のスペイン語の音源と中国語の音源を切り貼りしたものです。参照書き起こしはそのまま手に入り、費用はほとんどかかりませんでした。
つなぎ合わせたテストが示したのは次のことです。
- 主軸エンジンに主な言語はスペイン語だと伝えると、すべてが壊れます。中国語は翻訳され、捏造された内容が現れ、タイムラインは崩れます。
- 言語を自分で判断させると、すべて正しく書けます。
その後、本物の通訳付きインタビューを入手しました。66 分、スペイン語と中国語、研究者と通訳と対象者の三人です。結果はまったく正反対でした。
- 主な言語はスペイン語だと伝えると、ほぼ完璧な書き起こしになりました。両方の言語が正しく切り替わり、三人の話し手もすべて区別されました。言語を行き来する通訳でさえ、一人の人物として正しく認識されました。
- 判断を任せると、全体を中国語だと結論づけ(確信度 0.86)、中国語を主軸にして書き起こし、スペイン語の区間をまるごと落としました。
なぜでしょうか。つなぎ合わせた音声には言語の間に明白な継ぎ目があります。部屋も音量も背景雑音も一度に変わるので、エンジンは切り替わりに気づきやすいのです。本物の録音は一つの部屋、一本のマイクです。継ぎ目はありません。
リズムもつなぎ合わせたものとは違っていました。中国語は 29% を占め、「一〜四分のスペイン語の長い回答と、十五秒から一分ほどの中国語の短い挟み込み」という形で交互に現れていました。これはちょうど、つなぎ合わせでは扱っていなかった範囲に当たります。
わかったこと
言語が混在するインタビューがどれだけうまく書き起こされるかは、三つのことで決まります。どの二言語か、ときどき挟まるのか交互に話すのか、そしてエンジンをどう設定するかです。ベンダーの資料はこれらの問いに答えられず、つなぎ合わせたテスト音声も答えられません。
答えられるのは本物の録音だけです。
執筆:Zeyu Si