同一章AT100,80毫秒流逝识别,Nin-Man-Tun是240路,对比模型只有14路,官方差距大约17倍。 但它最值钱的不只是6亿参数和40个语言地区,而是让每一路持续语音少做重复计算,它怎么做到的? 传统的缓冲式流处理,会把前面一节音频反复重算,缓存感知fast conformer,把历史状态留下,只处理新的音频针。 多余种依靠语言标识提示,声学特征和语言向量一起送进RNT,设置成自动模式,还会在拒末输出语言标签。 40个并不都能开箱即用,19个转写就绪,13个广覆盖,8个需要微调,普通话就在广覆盖这一档。 音频块越大,上下文越多,准确率通常越好。 官方平均词错误率从80毫秒的10.38%降到1120毫秒的8.84%。 那吞吐呢,同一章H100,那么创从240路升到2400路。 注意,这是NVIDIA官方基准测试,不是所有硬件的承诺。 准确率来自Flores中文、日文和韩文看字符错误率,其他语言主要看词错误率,它不是你的客服电话、原厂会议或者专业术语实测。 如果你在做语音智能体、实时字幕或者呼叫中心,它值得评估。 偶尔转写一个文件,就不一定需要为了并发折腾。 所以它真正改写的不只是40个语言地区,而是每张图形处理器能接住多少路真实声音,实时语音识别,开始认真拼成本。