シリーズ:27言語の検証記録
タイ語:主軸エンジンのスコアの一部は、私たち自身のバグだった
· Zeyu Si
タイ語のテストでは、主軸エンジンの良いスコアの一部が、私たち自身のコードのバグから来ていました。
パイプラインのある関数は、語の両端から句読点を取り除きます。タイ語の母音記号と声調記号は文字の上や下に付く結合文字で、その関数はそれらを句読点として扱い、削除していました。そのため保存されていた ElevenLabs の書き起こしからは母音記号と声調記号がすべて失われ、エラー率はそれらの記号が存在しないかのように計算されていました。バグは修正済みですが、タイ語の発音区別記号について ElevenLabs が本当にどれだけ正確かは、まだ抜き取り確認が必要です。
以下のすべての数字について、この注意書きを念頭に置いてください。
テスト音源
三本の音源を、同じソースの手作りのタイ語字幕と照らして採点しました。
- 料理のインタビュー:一人か二人が普通のペースで話し、背景雑音はわずかです。これが基準の音源で、私たちの三段階の難易度尺度では易しい側に近いものです。
- リアリティ番組:複数のゲストが重なって話し、笑い、背景に音楽と効果音があります。中程度に分類しています。
- 人狼形式の討論:互いを告発し合い、早口で、話を遮り合い、Seer や defend といった英語の語が混ざります。最上位。
四本目の音源もありましたが、確認すると音声と字幕が約 30 秒ずれており、間違った答えに照らして採点することになるため、外しました。無料で、会話体で、逐語のタイ語字幕は珍しく、三本が見つけられた最大数です。
試したエンジン
十種類:ElevenLabs Scribe v2、AssemblyAI、Speechmatics(二つのバージョン)、Doubao、Soniox、Deepgram、Gladia、FunASR、Qwen。Gemini は別途テストしました。
エンジンがレッドラインを越えた箇所
反復ループ。 討論は笑いの爆発で始まり、字幕はそれを短い笑い一つとして記録しています。Gladia は笑い声 ฮ่า の後に、タイ語の繰り返し記号 ๆ を二行にわたって 400 回以上連続で書き、その後同じ二文を四回繰り返しました。それがスコアを 83.9% に押し上げた原因です。ほかの二本ではこのようなループはありませんでした。AssemblyAI もループします。検証すると、リアリティ番組で一語を約 22 行にわたって繰り返し、別の言い回しを約 25 回繰り返していました。
区間の欠落。 討論で AssemblyAI は大きな区間を飛ばし、ところによっては十秒近く何も出力しませんでした。最初の二本では最下位で、討論で最下位を免れたのは Gladia の崩壊のおかげにすぎません。
挿入された内容(撤回)。 一時期、Qwen が討論の冒頭で一節を捏造したと考えていました。検証すると、字幕が冒頭で約 10 秒ずれており、Soniox、Doubao、FunASR もそろって同じ箇所で同じ内容を書き起こしていました。誰かが本当にそう言っていたのです。この所見は撤回しました。
何を選んだか
主軸:ElevenLabs Scribe v2。 どの音源でも崩壊も暴走する繰り返しもなく、料理のインタビューで 12.6%、リアリティ番組では最低スコアでした。上の注意書き付きです。
参照、順に:Soniox、Doubao、Gemini。 三つともタイ語のすべてのファイルで走ります。
- Soniox:三本を通じて最も安定しており、区切りが最もきれいで、字幕に一行ずつ沿い、ループも大きな抜けもありません。
- Doubao:本物のタイ語を出力し、討論では Soniox や主軸と同水準で、外来語の defend をそのまま残します。レポートは当初、料理のインタビューでは Doubao を走らせていないとしていました。実際には走らせており、そこでは Soniox より正確な箇所もありましたが、結果が表に入らなかっただけです。また、最初の二つとは技術的な系譜も異なります。
- Gemini:討論では投票結果の中の名前を一つ間違え、四つのエンジンすべてが互いに 1.9 ポイント以内に収まりました。
外したもの:Qwen は討論で最良のスコア(18.3%)でしたが、三分間全体を単語単位のタイムスタンプのない一行として返し、私たちの整列工程では使えません。FunASR のスコアもまずまずでしたが、出力は文の区切りのない一続きの文字の塊です。Gladia はループで、AssemblyAI は欠落で外れました。
私たちの選択に不利な証拠
- 最大のものは冒頭のとおりです。主軸のタイ語スコアは水増しされており、発音区別記号の実際の正確さはまだ抜き取り確認していません。
- 私たちの検証担当者はタイ語が読めません。レポートは言語を知らなくても見えることだけを判断しました。暴走する繰り返し、長さの急な変化、抜けた塊、すべてが一つの塊で返ってくること。どのエンジンがセリフの意味を反転させたり崩したりしたかは、文ごとには確認していません。
- Gemini のタイ語の会話形式のテスト音源は一本しかなく、十分ではありません。以前のラウンドでは笑いのタグやタイ語以外のラベルのようなものも出力しましたが、どちらもこの音源では再発しませんでした。タイ語では一度、出力長の上限に達したこともあります。
- Soniox 自体が大規模言語モデル型の書き起こしエンジンです。こうしたエンジンは聞き取れない部分をなめらかにごまかすのではないかと、私たちは全般的に懸念しています。タイ語ではそれは見られませんでしたが、一行ずつ確認したわけでもありません。
未解決の問題
- タイ語は語の境界をスペースで示さず、私たちにはまだタイ語の分かち書きツールがないため、整列工程は文単位で動いており、かなり粗いものです。
- 三本のどれも本物の調査インタビューではありません。
- 主軸エンジンの発音区別記号の正確さはまだ確認が必要です。
執筆:Zeyu Si