Transcribe Labs 博客
我们怎么测转写质量,以及测出来的东西。
从这里开始
按主题
全部文章
一个引擎为什么不够:多引擎要「错得不一样」才有用
单个引擎整体听得懂,专名和数字却错得很稳定。多引擎有用的前提,是它们错在不同的地方。附一次真实访谈的完整对比和我们输掉的部分。
继续阅读最危险的错,读起来最通顺
否定被转反了,句子照样通顺,多个引擎投票也救不了。所以转写工具要告诉你它哪里没把握。我们逐家核了 15 款工具有没有这个功能。
继续阅读WER 会骗人:我们怎么测出接近真实访谈的准确率
行业最常用的错误率指标,在访谈录音上会系统性地骗人。我们换了一套办法:先验标准答案,再数意思错了几处。
继续阅读混合发言:一段访谈里几种语言交替说
受访者说西语,提问的人说中文,中间还有翻译。引擎的官方说明和实验室测试都会误导你。我们用真实录音测出来的结果,和拼接测试正好相反。
继续阅读多人发言时,谁说了哪句话
人一多,引擎自带的说话人识别就会漂移。我们先记住每个人的声音,再逐句认人:在公开会议数据上到 99% 以上。前提是大家轮流说话。
继续阅读27 门语言实测档案:每门语言的引擎是怎么选出来的
没有最好的引擎,只有在这门语言上错得最少、而且和别家错得不一样的组合。这是 27 门语言逐一测试的档案入口。
继续阅读