本文へスキップ

誰が言ったのか? 大人数の会話での話者の特定

· Zeyu Si

このページの内容

七人での討論、長さは 37 分。録音全体を ElevenLabs に渡し、各文を誰が言ったかをラベル付けさせました。

見つかったのは九人でした。

より大きな問題は、人のラベルが変わり続けたことです。ある話者は 8 分から 18 分まで A とラベル付けされ、18:30 の直後に B になり、30 分ごろに A に戻り、32:47 に再び B になりました。七人の話者全体で、人物の入れ替わりは 16 回ありました。語数で測ると、書き起こしのうち正しい人物に帰属していたのは 68.6% だけでした。

インタビュー調査にとって、これはいくつかの語の聞き違いより悪いことです。誰が何を言ったのか、何ひとつ信用できないのですから。

人数が増えると、組み込みの話者ラベルはずれていく

この録音は、中国語の会議録音の公開データセット AISHELL-4 から取ったもので、どれもテーブルを囲む五〜七人の会議です。そこで ElevenLabs の組み込みの話者ラベル付けを繰り返しテストしました。

  • 10〜15 分の音源では、設定によって 67.5% から 97.8% の内容が正しく帰属され、一人の人物が最大 12 回入れ替わりました。
  • 人数が増えるほど悪化しました。七人の音源では、話者が七人だと伝えても 77% から 82% にとどまりました。
  • 人数を確実に数えられませんでした。自分で判断させると、正しい人数だったのは 12 回中 4 回で、外れはすべて一人少ないものでした。最も口数の少ない一人か二人が、ほかの誰かに合流させられていたのです。

同じ設定で二回走らせても、結果が大きく異なることがありました。ある音源は一回目に 81.9%、次の回に 93.8% でした。

短い音源は結果を良く見せる

これらの数字には、それ自体の罠が潜んでいます。音源が短いほど、良く見えるのです。

同じ会議室で、15 分の音源は 78% から 93% でした。37 分の録音全体では 68.6% に落ち、10〜25 ポイント低く、失敗の形も「一人少ない」から「人が増え、人物が行ったり来たり入れ替わる」に変わりました。

同じことはほかでも見ています。あるオープンソースの手法は、10 分の音源で話者識別が 99.8% でした。録音全体で走らせると 63.9% に落ちました。

そのため、現在は完全な録音だけで判断しています。

採点方法も人を誤らせる

物差しそのものにも、もう一つ罠があります。

人手の参照書き起こしは通常、秒単位でタイムスタンプを付け、慣習として複数の行が同じ秒を共有できます(一人が話し終えると、別の人がすぐに入ってくる場合)。私たちが使ったある参照では、行の 55% が隣の行とタイムスタンプを共有していました。

タイムラインで採点すると、一秒のずれが、文まるごと別人に帰属したものとして数えられます。同じ出力が、タイムラインでは 81%、テキストの整列では 99.7% になりました。

直感に反するいくつかの発見

  • 話者の枠を増やしても、話者は増えて見つからない。 オープンソースのシステムで試しました。一人分の余地を与えると、三人目の話者を見つけるのではなく、最もよく話す人を二人に割ってしまいます。
  • 違うモデルが違うとは限らない。 同じ開発元の音声モデル五つは、一語一句同じ出力を出しました。何かが変わったのは、別の開発元のモデルだけでした。
  • デフォルト設定は「うん」や「ええ」を消してしまう。 半秒より短い相づちが雑音として捨てられていました。それをやめると、より多くの話者交代が、より正確に捉えられるようになりました。

私たちのアプローチ:先に一人ひとりの声を学び、それから文ごとに帰属する

最終的に行き着いたのは三つのステップです。

  1. 一人ひとりの「声のカード」:その人のクリーンな発話を 10〜30 秒、たとえば冒頭の自己紹介の一巡のようなものです。10 秒を下回ると目に見えて悪化し、30 秒を超えても改善しなくなります。
  2. 文ごとの帰属:ElevenLabs には書き起こしと文の分割だけをさせます。各文を誰が言ったかは、ElevenLabs 自身の話者ラベルではなく、その文の声をすべてのカードと比べて決めます。そのラベルは時間を通じて一貫しておらず、ラベルで帰属すると 71.5% にしかなりませんでした。
  3. 確信度で振り分ける:確信のある判定はそのまま下し、確信のないものは人が確認できるよう印を付けます。二つのテスト会議を通じて、確信のあるグループは 564 区間をカバーし、誤りは一つもありませんでした。

ごく短い「うん」や「ええ」は、それだけで識別できるほどの声を含んでいないので、周りにある同じ人の長い文の人物を引き継ぎます。

結果:公開の会議データで 99% 超、ずれなし

AISHELL-4 の完全な会議二つ:

ElevenLabs 組み込み 私たちのアプローチ
5 人、36 分 97.28% 99.76%
7 人、37 分 68.6%(人物の入れ替わり 16 回) 99.32%

どちらも人数を正しく数え、人物の入れ替わりはゼロでした。

さらに 10〜15 分の音源六本と、公開の五人のパネルディスカッション(99.75%)もテストしました。九本すべてが 97% を超えました。

残った誤りのほぼすべては、一秒より短い「うん」「そう」「オーケー」です。

限界:人が重なって話すとき

以上は公開データの話です。本物のフォーカスグループはもっと難しいものでした。

  • 五人の自由討論:司会者が話題を出し、四人の参加者が自由に入ってきます。五人とも女性で、話している時間の約五分の一は複数の人が同時に話しています。確信のある判定は約 97% が正しかったものの、区間の 30〜40% は確信なしとして印を付けることしかできませんでした。
  • 電話品質で録音された八人のフォーカスグループ:参加者全員にちゃんとした声のカードを用意すると、確信のある判定は 98.1% が正しくなりましたが、確信のない部分がなおテキストの 17.5% を占めました。私たち自身の基準は「確信のある判定が 99% 超、確信のない部分が最大 5%」です。このケースは合格しませんでした。

誤りを聞き返して一つはっきりしたことがあります。複数の人が同時に話すと、人間の耳でも聞き分けられません。その場にいるプロの記録係は映像に頼っています。

したがって、話者の特定について私たちが約束するのは、皆が順番に話す複数人の討論です。一人が話し、ほかの人は聞いている。その範囲では、最初から最後まで全員の人物を一貫して保ちます。人が重なって話す場面は、その範囲の外です。

執筆Zeyu Si