跳到主内容

Transcribe Labs 博客

我们怎么测转写质量,以及测出来的东西。

从这里开始

按主题

全部文章

  1. 一个引擎为什么不够:多引擎要「错得不一样」才有用

    单个引擎整体听得懂,专名和数字却错得很稳定。多引擎有用的前提,是它们错在不同的地方。附一次真实访谈的完整对比和我们输掉的部分。

    继续阅读
  2. 最危险的错,读起来最通顺

    否定被转反了,句子照样通顺,多个引擎投票也救不了。所以转写工具要告诉你它哪里没把握。我们逐家核了 15 款工具有没有这个功能。

    继续阅读
  3. WER 会骗人:我们怎么测出接近真实访谈的准确率

    行业最常用的错误率指标,在访谈录音上会系统性地骗人。我们换了一套办法:先验标准答案,再数意思错了几处。

    继续阅读
  4. 混合发言:一段访谈里几种语言交替说

    受访者说西语,提问的人说中文,中间还有翻译。引擎的官方说明和实验室测试都会误导你。我们用真实录音测出来的结果,和拼接测试正好相反。

    继续阅读
  5. 多人发言时,谁说了哪句话

    人一多,引擎自带的说话人识别就会漂移。我们先记住每个人的声音,再逐句认人:在公开会议数据上到 99% 以上。前提是大家轮流说话。

    继续阅读
  6. 27 门语言实测档案:每门语言的引擎是怎么选出来的

    没有最好的引擎,只有在这门语言上错得最少、而且和别家错得不一样的组合。这是 27 门语言逐一测试的档案入口。

    继续阅读

用 Atom 订阅