跳到主内容

多人发言时,谁说了哪句话

· Zeyu Si

本页目录

一场七个人的讨论,录了 37 分钟。我们把整段录音交给 ElevenLabs,让它顺便标出每句话是谁说的。

它标出了 9 个人。

更麻烦的是同一个人的身份会变。某位发言人在第 8 到 18 分钟被标成 A,18 分半之后变成了 B,第 30 分钟又变回 A,第 32 分钟再变成 B。七个人加起来,身份一共换了 16 次。按字数算,只有 68.6% 的内容标对了人。

对访谈研究来说,这比转错几个字更糟:你没法相信任何一句话的归属。

人一多,引擎自带的说话人识别就会漂移

上面这场录音来自 AISHELL-4,一个公开的中文会议录音数据集,每场五到七个人围着一张桌子讨论。我们在它上面反复测了 ElevenLabs 自带的说话人识别:

  • 在 10 到 15 分钟的片段上,按不同的设置,标对的比例在 67.5% 到 97.8% 之间,同一个人的身份最多切换了 12 次。
  • 人越多越差。七个人的片段,明确告诉它"有 7 个人",也只有 77% 到 82%。
  • 连人数都数不准。不告诉它有几个人时,12 次里只数对了 4 次,而且都是少数了一个人:说话最少的那一两位被并进了别人名下。

同一个设置跑两遍,结果也可能差很多。有一段是 81.9% 和 93.8%。

短片段测试会骗你

这些数字本身就有个陷阱:片段越短,看起来越好。

同一个会议房间,15 分钟的片段上是 78% 到 93%;整场 37 分钟送进去,掉到 68.6%,差了 10 到 25 个百分点,而且从"少算一个人"变成了"多出几个人、身份来回换"。

我们在别的方案上也见过同样的事。有一个开源方案,在 10 分钟片段上说话人准确率 99.8%,同一条录音跑全长,掉到 63.9%。

所以我们现在只看整场录音的成绩。

打分的方法本身也会造假象

还有一个坑在尺子上。

人工整理的标准答案,时间戳一般只精确到秒,而且按惯例,同一秒里可以记好几行(一个人刚说完、另一个人马上接话)。我们用的一份标准答案里,55% 的行和相邻的行共用同一个时间戳。

如果按时间轴打分,一秒的偏差就会被判成整句归错。同一份结果,按时间轴算是 81%,按文字对齐算是 99.7%。

几个反直觉的发现

  • 多告诉它几个名额,不会找出新的人。 我们在另一个开源方案上试过,给它多留一个"人"的位置,它不会去找第三个说话人,而是把说话最多的那个人劈成两半。
  • 换模型不等于换了东西。 同一家出的五个声纹模型,输出逐字完全相同。换一家出品方的模型,才有区别。
  • 默认设置会抹掉"嗯"和"哦"。 不到半秒的附和声被当成噪声去掉了。放开之后,换人点多找回了一些,也更准了。

我们的做法:先记住每个人的声音,再一句一句认人

我们最后的做法分三步:

  1. 给每个人留一张"声音卡片":从录音里取这个人 10 到 30 秒的干净发言,就像开场的自我介绍。少于 10 秒效果明显变差,超过 30 秒就不再提升。
  2. 逐句认人:ElevenLabs 只负责转文字、切句子。"这句话是谁说的",由每一句的声音去和所有卡片比对来决定,不用它自带的说话人标签。那些标签前后对不上,直接按标签认人只有 71.5%。
  3. 按把握程度分三档:很有把握的直接判;没把握的标成"存疑",交给人确认。在两场测试会议上,"很有把握"这一档一共 564 段,一段都没错。

太短的"嗯""对"声音信息太少,单靠声音认不出来,就借用前后同一个人长句的身份。

结果:公开会议数据上 99% 以上,身份不再漂移

两场完整的 AISHELL-4 会议:

ElevenLabs 自带 我们的做法
5 个人,36 分钟 97.28% 99.76%
7 个人,37 分钟 68.6%(身份切换 16 次) 99.32%

两场都是人数全对,身份切换为零。

另外还有 6 个 10 到 15 分钟的片段,以及一场公开的五人圆桌讨论(99.75%),九份数据全部在 97% 以上。

剩下的错,几乎全是 1 秒以内的"嗯""对""好"。

它的边界:抢着说话的座谈会,还做不到

上面是公开数据。换成真实的座谈会,结果就没这么好了。

  • 一场五个人的自由讨论:主持人抛出问题,四位参与者随意接话,五个人都是女性,叠在一起说话的时间约占两成。有把握的部分大约 97% 准,但三到四成的片段只能标成"存疑"。
  • 一场八个人、电话音质的座谈会:我们补齐了每个人的声音卡片之后,有把握的部分 98.1% 准,存疑的内容仍占全文的 17.5%。我们自己定的及格线是"有把握的部分 99% 以上、存疑不超过 5%",这场没过。

听完那些判错的片段,结论很清楚:几个人同时开口的时候,人耳也分不清,现场的速记员也要靠视频辅助。

所以我们对说话人识别的承诺,只限于轮流发言的多人讨论:一次一个人说,其他人听。在这个范围内,我们能让每个人的身份从头到尾保持一致。几个人同时抢着说,不在这个范围里。

作者Zeyu Si