最も危険な文字起こしの誤りは、完璧に読めてしまう
· Zeyu Si
このページの内容
ノルウェー語のインタビューで、音声はクリアです。インタビュー相手は、パートナーを裏切ったことはないと話しています。ところが、あるエンジンの文字起こしでは、裏切ることを選んだと言っていることになっていました。
文法的には正しい文です。誤字もありません。文脈の中でも違和感がありません。読み手が立ち止まる理由はどこにもないのです。
否定の反転は、インタビューの文字起こしで起こりうる最悪の誤りです
単語のつづりが間違っていれば、読み手はたいてい気づきます。意味が逆になっていても、気づきません。
ノルウェー語のケースは一度きりではありませんでした。その後、ノルウェー語のクリップをさらに五本、Gemini と Qwen にかけました。どちらも、はっきり聞き取れる箇所で同じ種類の誤りを出しました。
英語でも起こります。"You're still not a cop" が、Qwen の二つの音声モデルの両方で "still a cop" になりました。"not" がそのまま消えていたのです。
モデルに直接指示することも試しました。否定は発話どおりに必ず残すこと、聞き取れない箇所には印をつけること、何も補わないこと。効果はありませんでした。"not" はやはり消えました。
多数決では救われません
すぐに思いつく対策は、複数のエンジンを走らせて多数派に従うことです。
五つの言語(ロシア語、韓国語、ウクライナ語、ノルウェー語、スペイン語)で、複数のエンジンがまったく同じ誤りを犯し、正しい版が少数派になっている箇所が見つかりました。そのうち四つでは、誤りは否定か意味の反転でした。ノルウェー語のケースでは、五つのエンジンが意味を反転させ、正しかったのは一つだけでした。投票にかければ、間違った答えが勝ちます。
理由は、音声の中の不明瞭な一区間が、複数のエンジンに同じ間違ったものを「聞かせて」しまうことがあるからです。エンジンの誤りは互いに独立していません。
そこで私たちのルールはこうです。否定や意味の反転が関わる箇所では、エンジン同士の一致は何の根拠にもなりません。前後の文の論理や、話し手が少し後で同じ点を言い直している、といった確かな証拠が必要です。それがなければ、その箇所には人が聞いて確かめるための印をつけます。読み手に代わって私たちが判断することはしません。
流暢な誤りは、明らかな誤りより見つけにくい
否定の反転はその一種です。さらに気づきにくいものもあります。
私たちはテスト用の録音を作りました。スペイン語の会話の途中に、中国語を一行だけ差し込んだものです。"你是谁?"(「あなたは誰?」)。あるエンジンはその中国語を文字起こしせず、翻訳して "¿Quién eres?" と書きました。文字起こし全体には中国語が一文字もなく、完璧に読めました。中国語が分からず、音声も聞いていなければ、そこで別の言語が話されていたとは決して分かりません。
これらの誤りに共通するのは、文字起こしがまったく問題なく見えることです。読んでも見つけられません。どの秒を聞きに行けばよいのか、誰かが教えてくれる必要があります。
文字起こしツールは、どこが不確かかを教えてくれるべきです
では、実際に使われている文字起こしツールは「この部分は自信がありません」と教えてくれるのでしょうか。2026年9月、私たちはよく使われている 15 のツールを調べました。ヘルプセンター、製品ドキュメント、API ドキュメント、変更履歴です。
エディタ上で表示するのは三つ:
- Sonix には切り替えで表示できるヒートマップがあり、エンジンの確信度に応じて単語ごとに色の濃さを変えます。薄いほど確信度が低いという意味です。Sonix 自身、薄い単語は「必ずしも誤りではない」と注記しています。
- Rev にはエディタの切り替えがあり、エンジンが誤りの可能性ありと判定した単語を灰色でハイライトします。
- Happy Scribe は確信度の低い単語を赤で表示します。私たちの情報源は 2023 年のヘルプ記事で、現在の画面は確認していません。
API やエクスポートのみ: Amberscript はエクスポートファイルに単語ごとの確信度スコアを含められます。エディタでのハイライトについては、第三者の記述しか見つかりませんでした。TurboScribe については、確信度の低い単語を黄色でハイライトすると書いているのは第三者の記事だけで、同社のサイトは読み込めず確認できませんでした。
このような機能が見つからなかったのは 10: Transkriptor、Otter.ai、Fireflies.ai、Notta、Noota、Trint、Descript、Riverside、Dovetail、transcribe.com。
見つからなかったことは、存在しないことと同じではありません。API ドキュメントの中にはログインが必要なものやスクリプトで読み込まれるものがあり、すべてを読むことはできませんでした。これらのいずれかをお使いで、実際にその機能がある場合はお知らせください。訂正します。
エンジンの自己採点と、エンジン同士の食い違いは別物です
この機能を持つ三つのツールは、どれも同じものに印をつけています。一つのエンジンが自分の確信度につけた点数です。
これは確かに役に立ちますが、一つ死角があります。エンジンが自信満々に聞き間違えた場合、その自己採点は警報を鳴らしません。
私たちのやり方は、複数のエンジンに同じ音声を文字起こしさせ、エンジン同士の結果が一致しない箇所に印をつけることです。あわせて、誤りが集中しやすい人名、会社名、専門用語にも印をつけます。どの印にもタイムスタンプがあり、クリック一つでその秒を再生できます。すべての印が処理されて初めて、製品は文字起こしのエクスポート準備ができたと表示します。
それでもすべてを捉えられるわけではありません。複数のエンジンが同じ箇所をまったく同じように間違えれば、それらは「一致」し、何も印がつきません。だからこそ私たちは、すべてのエンジンが同じことを言っていても、否定と意味の反転を確認します。
私たちが約束できるのは、録音全体を聞き直す必要はない、ということです。疑うべき箇所だけを聞けば済みます。
執筆:Zeyu Si