{"text": "同一章AT100,80毫秒流逝识别,Nin-Man-Tun是240路,对比模型只有14路,官方差距大约17倍。但它最值钱的不只是6亿参数和40个语言地区,而是让每一路持续语音少做重复计算,它怎么做到的?传统的缓冲式流处理,会把前面一节音频反复重算,缓存感知fast conformer,把历史状态留下,只处理新的音频针。多余种依靠语言标识提示,声学特征和语言向量一起送进RNT,设置成自动模式,还会在拒末输出语言标签。40个并不都能开箱即用,19个转写就绪,13个广覆盖,8个需要微调,普通话就在广覆盖这一档。音频块越大,上下文越多,准确率通常越好。官方平均词错误率从80毫秒的10.38%降到1120毫秒的8.84%。那吞吐呢,同一章H100,那么创从240路升到2400路。注意,这是NVIDIA官方基准测试,不是所有硬件的承诺。准确率来自Flores中文、日文和韩文看字符错误率,其他语言主要看词错误率,它不是你的客服电话、原厂会议或者专业术语实测。如果你在做语音智能体、实时字幕或者呼叫中心,它值得评估。偶尔转写一个文件,就不一定需要为了并发折腾。所以它真正改写的不只是40个语言地区,而是每张图形处理器能接住多少路真实声音,实时语音识别,开始认真拼成本。", "segments": [{"id": 0, "seek": 0, "start": 0.0, "end": 6.34, "text": "同一章AT100,80毫秒流逝识别,Nin-Man-Tun是240路,对比模型只有14路,官方差距大约17倍。", "tokens": [50365, 13089, 2257, 11957, 254, 2218, 6879, 11, 4702, 7256, 104, 20956, 27854, 2215, 251, 5233, 228, 18453, 11, 45, 259, 12, 6652, 12, 51, 409, 1541, 17, 5254, 24658, 11, 8713, 11706, 41908, 39823, 35244, 7271, 24658, 11, 31929, 9249, 21679, 6563, 251, 3582, 16853, 99, 7773, 35477, 1543, 50682], "temperature": 0, "avg_logprob": -0.12620537651909722, "compression_ratio": 1.1820330969267139, "no_speech_prob": 7.236920264441782e-12}, {"id": 1, "seek": 0, "start": 7.16, "end": 14.24, "text": "但它最值钱的不只是6亿参数和40个语言地区,而是让每一路持续语音少做重复计算,它怎么做到的?", "tokens": [50723, 8395, 11284, 8661, 40242, 39623, 1546, 1960, 36859, 21, 1369, 123, 2129, 224, 33188, 12565, 5254, 7549, 5233, 255, 12009, 10928, 9937, 118, 11, 11070, 1541, 33650, 23664, 2257, 24658, 17694, 10115, 255, 5233, 255, 18034, 15686, 10907, 12624, 1787, 235, 7422, 94, 19497, 11, 11284, 15282, 10907, 4511, 1546, 30, 51077], "temperature": 0, "avg_logprob": -0.12620537651909722, "compression_ratio": 1.1820330969267139, "no_speech_prob": 7.236920264441782e-12}, {"id": 2, "seek": 0, "start": 14.86, "end": 22.28, "text": "传统的缓冲式流处理,会把前面一节音频反复重算,缓存感知fast conformer,把历史状态留下,只处理新的音频针。", "tokens": [51108, 7384, 254, 10115, 253, 1546, 38109, 241, 5676, 110, 27584, 27854, 1787, 226, 13876, 11, 12949, 16075, 8945, 8833, 2257, 45161, 18034, 39752, 22138, 1787, 235, 12624, 19497, 11, 38109, 241, 39781, 9709, 6498, 7011, 18975, 260, 11, 16075, 5014, 228, 45399, 35276, 114, 3757, 223, 24456, 4438, 11, 14003, 1787, 226, 13876, 12560, 1546, 18034, 39752, 25153, 230, 1543, 51479], "temperature": 0, "avg_logprob": -0.12620537651909722, "compression_ratio": 1.1820330969267139, "no_speech_prob": 7.236920264441782e-12}, {"id": 3, "seek": 2228, "start": 22.28, "end": 29.44, "text": "多余种依靠语言标识提示,声学特征和语言向量一起送进RNT,设置成自动模式,还会在拒末输出语言标签。", "tokens": [50365, 6392, 1593, 247, 39810, 3254, 251, 5363, 254, 5233, 255, 12009, 162, 3921, 5233, 228, 20949, 25696, 11, 32045, 29618, 17682, 2172, 223, 12565, 5233, 255, 12009, 24282, 26748, 29567, 29309, 36700, 49, 30817, 11, 7422, 122, 34719, 11336, 9722, 34961, 41908, 27584, 11, 14852, 12949, 3581, 6852, 240, 1474, 104, 9830, 241, 7781, 5233, 255, 12009, 162, 3921, 7973, 122, 1543, 50723], "temperature": 0, "avg_logprob": -0.10369951320144366, "compression_ratio": 1.2401129943502824, "no_speech_prob": 1.1715644947229986e-11}, {"id": 4, "seek": 2228, "start": 30.340000000000003, "end": 36.18, "text": "40个并不都能开箱即用,19个转写就绪,13个广覆盖,8个需要微调,普通话就在广覆盖这一档。", "tokens": [50768, 5254, 7549, 3509, 114, 1960, 7182, 8225, 18937, 11249, 109, 39127, 9254, 11, 3405, 7549, 17819, 105, 5676, 247, 3111, 10115, 103, 11, 7668, 7549, 3509, 123, 2888, 228, 5419, 244, 11, 23, 7549, 35748, 39152, 8897, 225, 11, 29993, 19550, 21596, 3111, 3581, 3509, 123, 2888, 228, 5419, 244, 5562, 2257, 21416, 96, 1543, 51060], "temperature": 0, "avg_logprob": -0.10369951320144366, "compression_ratio": 1.2401129943502824, "no_speech_prob": 1.1715644947229986e-11}, {"id": 5, "seek": 2228, "start": 36.900000000000006, "end": 40.08, "text": "音频块越大,上下文越多,准确率通常越好。", "tokens": [51096, 18034, 39752, 47734, 25761, 3582, 11, 5708, 4438, 17174, 25761, 6392, 11, 6336, 228, 38114, 106, 44866, 19550, 11279, 25761, 2131, 1543, 51255], "temperature": 0, "avg_logprob": -0.10369951320144366, "compression_ratio": 1.2401129943502824, "no_speech_prob": 1.1715644947229986e-11}, {"id": 6, "seek": 2228, "start": 40.36, "end": 46.22, "text": "官方平均词错误率从80毫秒的10.38%降到1120毫秒的8.84%。", "tokens": [51269, 31929, 9249, 16716, 14872, 229, 5233, 235, 29900, 5233, 107, 44866, 35630, 4702, 7256, 104, 20956, 1546, 3279, 13, 12625, 4, 47421, 4511, 5348, 2009, 7256, 104, 20956, 1546, 23, 13, 25494, 4, 1543, 51562], "temperature": 0, "avg_logprob": -0.10369951320144366, "compression_ratio": 1.2401129943502824, "no_speech_prob": 1.1715644947229986e-11}, {"id": 7, "seek": 2228, "start": 46.82, "end": 50.82, "text": "那吞吐呢,同一章H100,那么创从240路升到2400路。", "tokens": [51592, 4184, 2392, 252, 2392, 238, 6240, 11, 13089, 2257, 11957, 254, 39, 6879, 11, 35693, 2437, 249, 35630, 17, 5254, 24658, 41670, 4511, 7911, 628, 24658, 1543, 51792], "temperature": 0, "avg_logprob": -0.10369951320144366, "compression_ratio": 1.2401129943502824, "no_speech_prob": 1.1715644947229986e-11}, {"id": 8, "seek": 5082, "start": 50.82, "end": 54.480000000000004, "text": "注意,这是NVIDIA官方基准测试,不是所有硬件的承诺。", "tokens": [50365, 40794, 11, 27455, 45, 3958, 6914, 31929, 9249, 26008, 6336, 228, 11038, 233, 5233, 243, 11, 7296, 39300, 38114, 105, 20485, 1546, 3416, 123, 5233, 118, 1543, 50548], "temperature": 0, "avg_logprob": -0.07419981522993609, "compression_ratio": 1.2751196172248804, "no_speech_prob": 1.2993376340142415e-11}, {"id": 9, "seek": 5082, "start": 55.38, "end": 62.9, "text": "准确率来自Flores中文、日文和韩文看字符错误率,其他语言主要看词错误率,它不是你的客服电话、原厂会议或者专业术语实测。", "tokens": [50593, 6336, 228, 38114, 106, 44866, 6912, 9722, 25680, 2706, 5975, 17174, 1231, 6890, 17174, 12565, 13665, 102, 17174, 4200, 22381, 5437, 99, 29900, 5233, 107, 44866, 11, 9572, 5000, 5233, 255, 12009, 13557, 4275, 4200, 5233, 235, 29900, 5233, 107, 44866, 11, 11284, 7296, 18961, 32316, 27408, 42182, 21596, 1231, 19683, 5014, 224, 12949, 7422, 106, 31148, 940, 241, 940, 248, 1474, 107, 5233, 255, 24726, 11038, 233, 1543, 50969], "temperature": 0, "avg_logprob": -0.07419981522993609, "compression_ratio": 1.2751196172248804, "no_speech_prob": 1.2993376340142415e-11}, {"id": 10, "seek": 5082, "start": 63.82, "end": 67.38, "text": "如果你在做语音智能体、实时字幕或者呼叫中心,它值得评估。", "tokens": [51015, 13119, 41410, 10907, 5233, 255, 18034, 5094, 118, 8225, 29485, 1231, 24726, 15729, 22381, 40211, 31148, 38718, 19855, 5975, 7945, 11, 11284, 40242, 5916, 5233, 226, 7384, 108, 1543, 51193], "temperature": 0, "avg_logprob": -0.07419981522993609, "compression_ratio": 1.2751196172248804, "no_speech_prob": 1.2993376340142415e-11}, {"id": 11, "seek": 5082, "start": 67.66, "end": 70.42, "text": "偶尔转写一个文件,就不一定需要为了并发折腾。", "tokens": [51207, 7437, 114, 1530, 242, 17819, 105, 5676, 247, 20182, 17174, 20485, 11, 3111, 1960, 24272, 35748, 13992, 2289, 3509, 114, 28926, 7235, 246, 21184, 122, 1543, 51345], "temperature": 0, "avg_logprob": -0.07419981522993609, "compression_ratio": 1.2751196172248804, "no_speech_prob": 1.2993376340142415e-11}, {"id": 12, "seek": 5082, "start": 71.03999999999999, "end": 79.0, "text": "所以它真正改写的不只是40个语言地区,而是每张图形处理器能接住多少路真实声音,实时语音识别,开始认真拼成本。", "tokens": [51376, 7239, 11284, 6303, 15789, 34490, 5676, 247, 1546, 1960, 36859, 5254, 7549, 5233, 255, 12009, 10928, 9937, 118, 11, 11070, 1541, 23664, 44059, 3919, 122, 30900, 1787, 226, 13876, 34386, 8225, 14468, 21632, 41492, 24658, 6303, 24726, 32045, 18034, 11, 24726, 15729, 5233, 255, 18034, 5233, 228, 18453, 11, 45213, 7422, 97, 6303, 6852, 120, 11336, 8802, 1543, 51774], "temperature": 0, "avg_logprob": -0.07419981522993609, "compression_ratio": 1.2751196172248804, "no_speech_prob": 1.2993376340142415e-11}], "language": "zh"}