Transcribe Labs ブログ
文字起こしの品質をどう検証しているか、そして何がわかったか。
まずはここから
テーマ別
すべての記事
一つのエンジンでは足りない理由:エンジンを増やして効くのは、間違える場所が違うときだけ
一つのエンジンは固有名詞や数字を一貫して間違えます。エンジンを増やして効くのは、間違える場所が違うときだけ。負けた箇所も含めた実際のインタビューの記録です。
続きを読む最も危険な文字起こしの誤りは、完璧に読めてしまう
否定が反転しても文章は自然に読め、多数決でも見抜けません。だからツールは不確かな箇所を示すべきです。15 のツールを調べました。
続きを読むWER はうそをつく。本物のインタビューで正確さをどう測るか
業界で最も好まれる誤り指標は、インタビュー音声では人を誤らせます。代わりに私たちが使うもの:まず参照を確かめ、次に意味を変える誤りを数えます。
続きを読むインタビューの途中で言語が切り替わるとき
スペイン語の対象者、中国語の調査者、その間に通訳。ベンダーの資料とラボのテストは私たちを誤らせ、本物の録音は正反対の答えを出しました。
続きを読む誰が言ったのか? 大人数の会話での話者の特定
組み込みの話者ラベルは人数が増えるとずれていきます。先に一人ひとりの声を学ばせることで、公開の会議データで 99% を超えました。ただし皆が順番に話す場合に限ります。
続きを読む27 言語の現場ノート:言語ごとにエンジンをどう選んだか
どこでも一番のエンジンはありません。27 言語それぞれについて、どのエンジンを選び、なぜそう選んだのか。言語別テストの索引です。
続きを読む