{"text": "2026年,有没有ASR模型在中文识别上可以替代WESP?这个视频我将瑞评主流的支持中文转录的ASR开源模型。哪一个模型中文转录识别准确率最高?哪个模型翻译识别最好?哪个模型适合愿意计要?哪个模型歌曲识别能力最好?如果你使用过上述模型,欢迎在评论区给出你的推荐建议。我做了一款可能是市面上功能最强大的AI字幕软件。好啊,为了给用户使用最合适的ASR模型,我测试了大部分支持中文的ASR模型。这是我祖传的中文测试音频数据集。一半以上是复杂的音频。我会使用我自己写的Benchmark程序,让模型逐一转录,然后生成转录的结果报告。我会重点展示其中一个讲解模型量化的音频识别结果。其中包含了大量的计算机术语与大量的数字。先来看一下WASP,这也是用的最广的ASR模型。WASP的优点是异于极城,生态最为丰富,支持语种多。但在中文识别上面,准确度与稳定性都是不够的。比如容易出现幻觉,复杂的语音的场景会漏词或是乱补词。中英混缩的错误比较多,有时会出繁体中文。专有名词识别不准,断句不稳定,容易出长句。歌曲识别不好,虽然带有词集时间戳,但偏移很严重。2026年的今天,我会把它排在人上人的位置。Memo V2.5 ASR,我上一期的视频有详细的测评,感兴趣的小伙伴可以去看一下。是目前中文转入最强的ASR模型。最好的方言识别能力与歌曲识别能力,几乎克服了WASP在中文识别上面的所有毛病。唯一的问题是它是8B的参数量,体积巨大,执行很慢,顶级位置。再来看另外一个重量级的选手,7B参数的Web Voice ASR,专有名词识别上面最好。支持50种语言,内置功能最全面的ASR模型。比如一次即可转入长达60分钟的音频,支持说话能分割,带有段落时间戳,音频识件识别,可以自定义乐词等。但复杂场景容易出现幻觉,出现重复的文字。输出的Jesion格式不够稳定,在工程处理上面要很小心。中文断句会有不稳定的情况,方言识别很一般,我会把它放在顶级位置。混杂ASR1.7B,强烈推荐你使用的ASR模型。中文识别准确率高,识别稳定,不容易出现幻觉。支持30种语言与22种方言,可以处理多语种的混缩。可以识别歌曲,执行速度很快,自带断句非常不错。缺点是,装有名词识别不够稳定,断句有时会出现长句。这是我测试下来综合能力最强的中文ASR模型,我会把它排在,憨爆了。2026年ASR模型的第一选择。Quin3 ASR0.6B,非常好的小参数ASR模型。执行速度非常的快,可以适配大部分的电脑部署。Quin3 ASR1.7B,大部分的优点它都有。不足的是,识别的稳定性与专有名词的识别会相对差一些。Quin3 ASR0.6B,已经比Whisper好运很多了。我会把它还在顶级推荐你使用。Kahir这个模型,我有一期视频专门测试过。拉完了,别愿。幻觉非常的严重,中文识别非常的糟糕。基本上是不可怨的。JLM ASRNANO,这是智朴发布的1.5B的模型。对数字的处理很好。断句也非常的精准。识别的准确度与稳定性,跟Quin3 ASR0.6B是差不多的。翻炎的识别上面会相对比较一般。然后执行的速度上面是比Quin3 ASR0.6B慢挺多的。我会把它排在人上人,在Whisper的前面。FireRed ASR2小红书发布的1款有特点的模型。其实是1套可以分开使用的模型组合。自动语音识别,语音活动检测,口语识别,和标点符号预测。需要结合使用。其中语音活动检测模型非常的好用。可以准确地识别歌曲中的语音。对幻觉的控制很好。专有名词的错误率但是偏高。我会把它排在NPC。Fire ASR nano对数字的处理非常的好。断句与方言的识别是强于Quin3 ASR0.6B的。但稳定性不如Quin3 ASR0.6B。会有幻觉,会有肉词的情况。自带的字集时间戳,飘移非常的严重。我会把它排在人上人。Sense OIS特别适合移动端的部署。体积很小,执行很快。但识别的准确率上面是比较一般的。肉词的问题挺严重的。需要自己处理标点。当存从识别的准确率与稳定性的角度。我会把它排在NPC。接下来来看一下相同语音各个模型的准确率的情况。可以看到Memo V2.5 ASR是现在中文识别准确率最高的模型。其次是Quin3 ASR1.7B。除了拉胯的Kohir模型,所有的模型的中文识别准确率都高于WESP。最后看一下多个维度的综合对比。单维度满分是5分。可以看到中文识别上面综合能力Memo V2.5 ASR是最好的。其次是Quin3 ASR1.7B。Memo V2.5 ASR不熟的难度是很高的。2026年最推荐的中文ASR模型就是Quin3 ASR1.7B。方言识别最准的模型是Memo V2.5 ASR。歌曲识别最好的模型是Quin3 ASR1.7B。以上就是视频的全部内容。我是浩叔,我们下一个视频见。我们下一个视频见。", "segments": [{"id": 0, "seek": 0, "start": 0.0, "end": 5.0, "text": "2026年,有没有ASR模型在中文识别上可以替代WESP?", "tokens": [50365, 2009, 10880, 5157, 11, 2412, 17944, 3160, 49, 41908, 39823, 3581, 5975, 17174, 5233, 228, 18453, 5708, 6723, 9531, 123, 19105, 54, 2358, 47, 30, 50615], "temperature": 0, "avg_logprob": -0.15102256824767668, "compression_ratio": 1.3522727272727273, "no_speech_prob": 7.769277408919972e-12}, {"id": 1, "seek": 0, "start": 5.0, "end": 10.0, "text": "这个视频我将瑞评主流的支持中文转录的ASR开源模型。", "tokens": [50615, 15368, 40656, 39752, 1654, 45456, 37955, 252, 5233, 226, 13557, 27854, 1546, 35488, 5975, 17174, 17819, 105, 7391, 243, 1546, 3160, 49, 18937, 47402, 41908, 39823, 1543, 50865], "temperature": 0, "avg_logprob": -0.15102256824767668, "compression_ratio": 1.3522727272727273, "no_speech_prob": 7.769277408919972e-12}, {"id": 2, "seek": 0, "start": 10.0, "end": 21.0, "text": "哪一个模型中文转录识别准确率最高?哪个模型翻译识别最好?哪个模型适合愿意计要?哪个模型歌曲识别能力最好?", "tokens": [50865, 17028, 20182, 41908, 39823, 5975, 17174, 17819, 105, 7391, 243, 5233, 228, 18453, 6336, 228, 38114, 106, 44866, 8661, 12979, 30, 17028, 7549, 41908, 39823, 42716, 5233, 239, 5233, 228, 18453, 8661, 2131, 30, 17028, 7549, 41908, 39823, 2215, 224, 14245, 4820, 123, 9042, 7422, 94, 4275, 30, 17028, 7549, 41908, 39823, 29582, 30753, 5233, 228, 18453, 8225, 13486, 8661, 2131, 30, 51415], "temperature": 0, "avg_logprob": -0.15102256824767668, "compression_ratio": 1.3522727272727273, "no_speech_prob": 7.769277408919972e-12}, {"id": 3, "seek": 0, "start": 21.0, "end": 26.0, "text": "如果你使用过上述模型,欢迎在评论区给出你的推荐建议。", "tokens": [51415, 45669, 22982, 9254, 16866, 5708, 3316, 108, 41908, 39823, 11, 28566, 17699, 3581, 5233, 226, 7422, 118, 9937, 118, 23197, 7781, 18961, 33597, 31409, 238, 34157, 7422, 106, 1543, 51665], "temperature": 0, "avg_logprob": -0.15102256824767668, "compression_ratio": 1.3522727272727273, "no_speech_prob": 7.769277408919972e-12}, {"id": 4, "seek": 2600, "start": 26.0, "end": 30.0, "text": "我做了一款可能是市面上功能最强大的AI字幕软件。", "tokens": [50365, 1654, 10907, 2289, 2257, 48798, 16657, 1541, 27261, 8833, 5708, 32311, 8225, 8661, 5702, 118, 39156, 48698, 22381, 40211, 17819, 107, 20485, 1543, 50565], "temperature": 0, "avg_logprob": -0.06868791246747637, "compression_ratio": 1.2384341637010676, "no_speech_prob": 1.3964979346525741e-11}, {"id": 5, "seek": 2600, "start": 30.0, "end": 38.0, "text": "好啊,为了给用户使用最合适的ASR模型,我测试了大部分支持中文的ASR模型。", "tokens": [50565, 2131, 4905, 11, 13992, 2289, 23197, 9254, 1486, 115, 22982, 9254, 8661, 14245, 2215, 224, 1546, 3160, 49, 41908, 39823, 11, 1654, 11038, 233, 5233, 243, 2289, 3582, 32174, 35488, 5975, 17174, 1546, 3160, 49, 41908, 39823, 1543, 50965], "temperature": 0, "avg_logprob": -0.06868791246747637, "compression_ratio": 1.2384341637010676, "no_speech_prob": 1.3964979346525741e-11}, {"id": 6, "seek": 2600, "start": 38.0, "end": 44.0, "text": "这是我祖传的中文测试音频数据集。一半以上是复杂的音频。", "tokens": [50965, 27455, 1654, 12695, 244, 7384, 254, 1546, 5975, 17174, 11038, 233, 5233, 243, 18034, 39752, 33188, 26075, 106, 26020, 1543, 2257, 30018, 29497, 1541, 1787, 235, 4422, 224, 1546, 18034, 39752, 1543, 51265], "temperature": 0, "avg_logprob": -0.06868791246747637, "compression_ratio": 1.2384341637010676, "no_speech_prob": 1.3964979346525741e-11}, {"id": 7, "seek": 2600, "start": 44.0, "end": 52.0, "text": "我会使用我自己写的Benchmark程序,让模型逐一转录,然后生成转录的结果报告。", "tokens": [51265, 1654, 12949, 22982, 9254, 1654, 17645, 5676, 247, 1546, 21736, 339, 5638, 29649, 6346, 237, 11, 33650, 41908, 39823, 2215, 238, 2257, 17819, 105, 7391, 243, 11, 26636, 8244, 11336, 17819, 105, 7391, 243, 1546, 45641, 9319, 49817, 16846, 1543, 51665], "temperature": 0, "avg_logprob": -0.06868791246747637, "compression_ratio": 1.2384341637010676, "no_speech_prob": 1.3964979346525741e-11}, {"id": 8, "seek": 5200, "start": 52.0, "end": 60.0, "text": "我会重点展示其中一个讲解模型量化的音频识别结果。其中包含了大量的计算机术语与大量的数字。", "tokens": [50365, 1654, 12949, 12624, 12579, 43491, 25696, 9572, 5975, 20182, 39255, 17278, 41908, 39823, 26748, 23756, 1546, 18034, 39752, 5233, 228, 18453, 45641, 9319, 1543, 9572, 5975, 23305, 2392, 104, 2289, 3582, 26748, 1546, 7422, 94, 19497, 37960, 1474, 107, 5233, 255, 940, 236, 3582, 26748, 1546, 33188, 22381, 1543, 50765], "temperature": 0, "avg_logprob": -0.09829027132880419, "compression_ratio": 1.2325581395348837, "no_speech_prob": 1.4734090683643508e-11}, {"id": 9, "seek": 5200, "start": 60.0, "end": 64.0, "text": "先来看一下WASP,这也是用的最广的ASR模型。", "tokens": [50765, 10108, 6912, 28324, 54, 3160, 47, 11, 5562, 22021, 9254, 1546, 8661, 3509, 123, 1546, 3160, 49, 41908, 39823, 1543, 50965], "temperature": 0, "avg_logprob": -0.09829027132880419, "compression_ratio": 1.2325581395348837, "no_speech_prob": 1.4734090683643508e-11}, {"id": 10, "seek": 5200, "start": 64.0, "end": 73.0, "text": "WASP的优点是异于极城,生态最为丰富,支持语种多。但在中文识别上面,准确度与稳定性都是不够的。", "tokens": [50965, 54, 3160, 47, 1546, 7384, 246, 12579, 1541, 5702, 224, 37732, 7360, 223, 45277, 11, 8244, 3757, 223, 8661, 13992, 940, 108, 47564, 11, 35488, 5233, 255, 39810, 6392, 1543, 8395, 3581, 5975, 17174, 5233, 228, 18453, 49750, 11, 6336, 228, 38114, 106, 13127, 940, 236, 10415, 111, 12088, 21686, 22796, 1960, 1787, 253, 1546, 1543, 51415], "temperature": 0, "avg_logprob": -0.09829027132880419, "compression_ratio": 1.2325581395348837, "no_speech_prob": 1.4734090683643508e-11}, {"id": 11, "seek": 7300, "start": 73.0, "end": 79.0, "text": "比如容易出现幻觉,复杂的语音的场景会漏词或是乱补词。", "tokens": [50365, 36757, 49212, 7781, 20204, 3509, 119, 24447, 11, 1787, 235, 4422, 224, 1546, 5233, 255, 18034, 1546, 50255, 50218, 12949, 14065, 237, 5233, 235, 19780, 1541, 2930, 109, 9890, 98, 5233, 235, 1543, 50665], "temperature": 0, "avg_logprob": -0.08589828305128144, "compression_ratio": 1.219626168224299, "no_speech_prob": 1.5531404287671968e-11}, {"id": 12, "seek": 7300, "start": 79.0, "end": 83.0, "text": "中英混缩的错误比较多,有时会出繁体中文。", "tokens": [50665, 5975, 27869, 48640, 38109, 102, 1546, 29900, 5233, 107, 11706, 9830, 225, 6392, 11, 2412, 15729, 12949, 7781, 23141, 223, 29485, 5975, 17174, 1543, 50865], "temperature": 0, "avg_logprob": -0.08589828305128144, "compression_ratio": 1.219626168224299, "no_speech_prob": 1.5531404287671968e-11}, {"id": 13, "seek": 7300, "start": 83.0, "end": 88.0, "text": "专有名词识别不准,断句不稳定,容易出长句。", "tokens": [50865, 940, 241, 2412, 15940, 5233, 235, 5233, 228, 18453, 1960, 6336, 228, 11, 4307, 255, 34592, 1960, 10415, 111, 12088, 11, 49212, 7781, 32271, 34592, 1543, 51115], "temperature": 0, "avg_logprob": -0.08589828305128144, "compression_ratio": 1.219626168224299, "no_speech_prob": 1.5531404287671968e-11}, {"id": 14, "seek": 7300, "start": 88.0, "end": 93.0, "text": "歌曲识别不好,虽然带有词集时间戳,但偏移很严重。", "tokens": [51115, 29582, 30753, 5233, 228, 18453, 15769, 11, 12026, 121, 5823, 4845, 99, 2412, 5233, 235, 26020, 44848, 1486, 111, 11, 8395, 7437, 237, 8204, 119, 4563, 940, 98, 12624, 1543, 51365], "temperature": 0, "avg_logprob": -0.08589828305128144, "compression_ratio": 1.219626168224299, "no_speech_prob": 1.5531404287671968e-11}, {"id": 15, "seek": 9300, "start": 93.0, "end": 97.0, "text": "2026年的今天,我会把它排在人上人的位置。", "tokens": [50365, 2009, 10880, 34128, 12074, 11, 1654, 12949, 42061, 44647, 3581, 4035, 5708, 4035, 1546, 11160, 34719, 1543, 50565], "temperature": 0, "avg_logprob": -0.09067756559219828, "compression_ratio": 1.2095238095238094, "no_speech_prob": 1.508395491844894e-11}, {"id": 16, "seek": 9300, "start": 97.0, "end": 104.0, "text": "Memo V2.5 ASR,我上一期的视频有详细的测评,感兴趣的小伙伴可以去看一下。", "tokens": [50565, 44, 36221, 691, 17, 13, 20, 7469, 49, 11, 1654, 5708, 2257, 16786, 1546, 40656, 39752, 2412, 5233, 99, 10115, 228, 1546, 11038, 233, 5233, 226, 11, 9709, 2347, 112, 39835, 1546, 7322, 7384, 247, 7384, 112, 6723, 6734, 28324, 1543, 50915], "temperature": 0, "avg_logprob": -0.09067756559219828, "compression_ratio": 1.2095238095238094, "no_speech_prob": 1.508395491844894e-11}, {"id": 17, "seek": 9300, "start": 104.0, "end": 107.0, "text": "是目前中文转入最强的ASR模型。", "tokens": [50915, 1541, 39004, 5975, 17174, 17819, 105, 14028, 8661, 5702, 118, 1546, 3160, 49, 41908, 39823, 1543, 51065], "temperature": 0, "avg_logprob": -0.09067756559219828, "compression_ratio": 1.2095238095238094, "no_speech_prob": 1.508395491844894e-11}, {"id": 18, "seek": 9300, "start": 107.0, "end": 115.0, "text": "最好的方言识别能力与歌曲识别能力,几乎克服了WASP在中文识别上面的所有毛病。", "tokens": [51065, 8661, 20715, 9249, 12009, 5233, 228, 18453, 8225, 13486, 940, 236, 29582, 30753, 5233, 228, 18453, 8225, 13486, 11, 6336, 254, 2930, 236, 24881, 27408, 2289, 54, 3160, 47, 3581, 5975, 17174, 5233, 228, 18453, 49750, 1546, 39300, 39057, 30986, 1543, 51465], "temperature": 0, "avg_logprob": -0.09067756559219828, "compression_ratio": 1.2095238095238094, "no_speech_prob": 1.508395491844894e-11}, {"id": 19, "seek": 9300, "start": 115.0, "end": 121.0, "text": "唯一的问题是它是8B的参数量,体积巨大,执行很慢,顶级位置。", "tokens": [51465, 17198, 107, 2257, 1546, 34069, 1541, 11284, 1541, 23, 33, 1546, 2129, 224, 33188, 26748, 11, 29485, 8204, 107, 5238, 101, 3582, 11, 3416, 100, 8082, 4563, 20645, 11, 10178, 114, 16853, 100, 11160, 34719, 1543, 51765], "temperature": 0, "avg_logprob": -0.09067756559219828, "compression_ratio": 1.2095238095238094, "no_speech_prob": 1.508395491844894e-11}, {"id": 20, "seek": 12100, "start": 121.0, "end": 128.0, "text": "再来看另外一个重量级的选手,7B参数的Web Voice ASR,专有名词识别上面最好。", "tokens": [50365, 8623, 6912, 4200, 26202, 20182, 12624, 26748, 16853, 100, 1546, 2215, 231, 11389, 11, 22, 33, 2129, 224, 33188, 1546, 4360, 65, 15229, 7469, 49, 11, 940, 241, 2412, 15940, 5233, 235, 5233, 228, 18453, 49750, 8661, 2131, 1543, 50715], "temperature": 0, "avg_logprob": -0.0986560558450633, "compression_ratio": 1.1638795986622072, "no_speech_prob": 1.5321195701023527e-11}, {"id": 21, "seek": 12100, "start": 128.0, "end": 133.0, "text": "支持50种语言,内置功能最全面的ASR模型。", "tokens": [50715, 35488, 2803, 39810, 5233, 255, 12009, 11, 34742, 34719, 32311, 8225, 8661, 11319, 8833, 1546, 3160, 49, 41908, 39823, 1543, 50965], "temperature": 0, "avg_logprob": -0.0986560558450633, "compression_ratio": 1.1638795986622072, "no_speech_prob": 1.5321195701023527e-11}, {"id": 22, "seek": 12100, "start": 133.0, "end": 143.0, "text": "比如一次即可转入长达60分钟的音频,支持说话能分割,带有段落时间戳,音频识件识别,可以自定义乐词等。", "tokens": [50965, 36757, 27505, 39127, 4429, 17819, 105, 14028, 32271, 9830, 122, 4550, 6627, 50064, 1546, 18034, 39752, 11, 35488, 8090, 21596, 8225, 6627, 5935, 110, 11, 4845, 99, 2412, 28427, 30848, 44848, 1486, 111, 11, 18034, 39752, 5233, 228, 20485, 5233, 228, 18453, 11, 6723, 9722, 12088, 2930, 231, 44365, 5233, 235, 10187, 1543, 51465], "temperature": 0, "avg_logprob": -0.0986560558450633, "compression_ratio": 1.1638795986622072, "no_speech_prob": 1.5321195701023527e-11}, {"id": 23, "seek": 12100, "start": 143.0, "end": 146.0, "text": "但复杂场景容易出现幻觉,出现重复的文字。", "tokens": [51465, 8395, 1787, 235, 4422, 224, 50255, 50218, 49212, 7781, 20204, 3509, 119, 24447, 11, 7781, 20204, 12624, 1787, 235, 1546, 17174, 22381, 1543, 51615], "temperature": 0, "avg_logprob": -0.0986560558450633, "compression_ratio": 1.1638795986622072, "no_speech_prob": 1.5321195701023527e-11}, {"id": 24, "seek": 14600, "start": 146.0, "end": 151.0, "text": "输出的Jesion格式不够稳定,在工程处理上面要很小心。", "tokens": [50365, 9830, 241, 7781, 1546, 41, 279, 313, 30921, 27584, 1960, 1787, 253, 10415, 111, 12088, 11, 3581, 23323, 29649, 1787, 226, 13876, 49750, 4275, 4563, 34021, 1543, 50615], "temperature": 0, "avg_logprob": -0.13280857310575597, "compression_ratio": 1.0062111801242235, "no_speech_prob": 1.867294339985559e-11}, {"id": 25, "seek": 14600, "start": 151.0, "end": 158.0, "text": "中文断句会有不稳定的情况,方言识别很一般,我会把它放在顶级位置。", "tokens": [50615, 5975, 17174, 4307, 255, 34592, 12949, 2412, 1960, 10415, 111, 12088, 1546, 46514, 11, 9249, 12009, 5233, 228, 18453, 4563, 2257, 49640, 11, 1654, 12949, 42061, 12744, 3581, 10178, 114, 16853, 100, 11160, 34719, 1543, 50965], "temperature": 0, "avg_logprob": -0.13280857310575597, "compression_ratio": 1.0062111801242235, "no_speech_prob": 1.867294339985559e-11}, {"id": 26, "seek": 15800, "start": 158.0, "end": 165.0, "text": "混杂ASR1.7B,强烈推荐你使用的ASR模型。", "tokens": [50365, 48640, 4422, 224, 3160, 49, 16, 13, 22, 33, 11, 5702, 118, 23661, 230, 33597, 31409, 238, 2166, 22982, 9254, 1546, 3160, 49, 41908, 39823, 1543, 50715], "temperature": 0, "avg_logprob": -0.09350288959971645, "compression_ratio": 1.1255813953488372, "no_speech_prob": 1.6150710976936544e-11}, {"id": 27, "seek": 15800, "start": 165.0, "end": 169.0, "text": "中文识别准确率高,识别稳定,不容易出现幻觉。", "tokens": [50715, 5975, 17174, 5233, 228, 18453, 6336, 228, 38114, 106, 44866, 12979, 11, 5233, 228, 18453, 10415, 111, 12088, 11, 1960, 49212, 7781, 20204, 3509, 119, 24447, 1543, 50915], "temperature": 0, "avg_logprob": -0.09350288959971645, "compression_ratio": 1.1255813953488372, "no_speech_prob": 1.6150710976936544e-11}, {"id": 28, "seek": 15800, "start": 169.0, "end": 174.0, "text": "支持30种语言与22种方言,可以处理多语种的混缩。", "tokens": [50915, 35488, 3446, 39810, 5233, 255, 12009, 940, 236, 7490, 39810, 9249, 12009, 11, 6723, 1787, 226, 13876, 6392, 5233, 255, 39810, 1546, 48640, 38109, 102, 1543, 51165], "temperature": 0, "avg_logprob": -0.09350288959971645, "compression_ratio": 1.1255813953488372, "no_speech_prob": 1.6150710976936544e-11}, {"id": 29, "seek": 15800, "start": 174.0, "end": 179.0, "text": "可以识别歌曲,执行速度很快,自带断句非常不错。", "tokens": [51165, 6723, 5233, 228, 18453, 29582, 30753, 11, 3416, 100, 8082, 31217, 13127, 4563, 10251, 11, 9722, 4845, 99, 4307, 255, 34592, 14392, 1960, 29900, 1543, 51415], "temperature": 0, "avg_logprob": -0.09350288959971645, "compression_ratio": 1.1255813953488372, "no_speech_prob": 1.6150710976936544e-11}, {"id": 30, "seek": 17900, "start": 179.0, "end": 185.0, "text": "缺点是,装有名词识别不够稳定,断句有时会出现长句。", "tokens": [50365, 38109, 118, 12579, 1541, 11, 8083, 227, 2412, 15940, 5233, 235, 5233, 228, 18453, 1960, 1787, 253, 10415, 111, 12088, 11, 4307, 255, 34592, 2412, 15729, 12949, 7781, 20204, 32271, 34592, 1543, 50665], "temperature": 0, "avg_logprob": -0.13802085603986466, "compression_ratio": 1.0954545454545455, "no_speech_prob": 1.721057671377757e-11}, {"id": 31, "seek": 17900, "start": 185.0, "end": 191.0, "text": "这是我测试下来综合能力最强的中文ASR模型,我会把它排在,憨爆了。", "tokens": [50665, 27455, 1654, 11038, 233, 5233, 243, 4438, 6912, 10115, 120, 14245, 8225, 13486, 8661, 5702, 118, 1546, 5975, 17174, 3160, 49, 41908, 39823, 11, 1654, 12949, 42061, 44647, 3581, 11, 29713, 101, 45827, 2289, 1543, 50965], "temperature": 0, "avg_logprob": -0.13802085603986466, "compression_ratio": 1.0954545454545455, "no_speech_prob": 1.721057671377757e-11}, {"id": 32, "seek": 17900, "start": 191.0, "end": 194.0, "text": "2026年ASR模型的第一选择。", "tokens": [50965, 2009, 10880, 5157, 3160, 49, 41908, 39823, 1546, 18049, 2215, 231, 6852, 102, 1543, 51115], "temperature": 0, "avg_logprob": -0.13802085603986466, "compression_ratio": 1.0954545454545455, "no_speech_prob": 1.721057671377757e-11}, {"id": 33, "seek": 17900, "start": 194.0, "end": 199.0, "text": "Quin3 ASR0.6B,非常好的小参数ASR模型。", "tokens": [51115, 8547, 259, 18, 7469, 49, 15, 13, 21, 33, 11, 14392, 20715, 7322, 2129, 224, 33188, 3160, 49, 41908, 39823, 1543, 51365], "temperature": 0, "avg_logprob": -0.13802085603986466, "compression_ratio": 1.0954545454545455, "no_speech_prob": 1.721057671377757e-11}, {"id": 34, "seek": 19900, "start": 199.0, "end": 204.0, "text": "执行速度非常的快,可以适配大部分的电脑部署。", "tokens": [50365, 3416, 100, 8082, 31217, 13127, 48263, 10251, 11, 6723, 2215, 224, 38846, 3582, 32174, 1546, 42182, 27067, 239, 13470, 16469, 110, 1543, 50615], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 35, "seek": 19900, "start": 204.0, "end": 208.0, "text": "Quin3 ASR1.7B,大部分的优点它都有。", "tokens": [50615, 8547, 259, 18, 7469, 49, 16, 13, 22, 33, 11, 3582, 32174, 1546, 7384, 246, 12579, 11284, 48121, 1543, 50815], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 36, "seek": 19900, "start": 208.0, "end": 212.0, "text": "不足的是,识别的稳定性与专有名词的识别会相对差一些。", "tokens": [50815, 1960, 37236, 24620, 11, 5233, 228, 18453, 1546, 10415, 111, 12088, 21686, 940, 236, 940, 241, 2412, 15940, 5233, 235, 1546, 5233, 228, 18453, 12949, 15106, 8713, 21679, 38515, 1543, 51015], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 37, "seek": 19900, "start": 212.0, "end": 216.0, "text": "Quin3 ASR0.6B,已经比Whisper好运很多了。", "tokens": [51015, 8547, 259, 18, 7469, 49, 15, 13, 21, 33, 11, 49161, 11706, 2471, 271, 610, 2131, 3316, 238, 20778, 2289, 1543, 51215], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 38, "seek": 19900, "start": 216.0, "end": 219.0, "text": "我会把它还在顶级推荐你使用。", "tokens": [51215, 1654, 12949, 42061, 14852, 3581, 10178, 114, 16853, 100, 33597, 31409, 238, 2166, 22982, 9254, 1543, 51365], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 39, "seek": 19900, "start": 219.0, "end": 223.0, "text": "Kahir这个模型,我有一期视频专门测试过。", "tokens": [51365, 42, 545, 347, 15368, 41908, 39823, 11, 1654, 32241, 16786, 40656, 39752, 940, 241, 8259, 101, 11038, 233, 5233, 243, 16866, 1543, 51565], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 40, "seek": 19900, "start": 223.0, "end": 225.0, "text": "拉完了,别愿。", "tokens": [51565, 29717, 41665, 11, 18453, 4820, 123, 1543, 51665], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 41, "seek": 19900, "start": 225.0, "end": 228.0, "text": "幻觉非常的严重,中文识别非常的糟糕。", "tokens": [51665, 3509, 119, 24447, 48263, 940, 98, 12624, 11, 5975, 17174, 5233, 228, 18453, 48263, 15239, 253, 15239, 243, 1543, 51815], "temperature": 0, "avg_logprob": -0.11824469730771821, "compression_ratio": 1.2239263803680982, "no_speech_prob": 1.508836111607792e-11}, {"id": 42, "seek": 22800, "start": 228.0, "end": 230.0, "text": "基本上是不可怨的。", "tokens": [50365, 37946, 5708, 1541, 1960, 4429, 3757, 101, 1546, 1543, 50465], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 43, "seek": 22800, "start": 230.0, "end": 234.0, "text": "JLM ASRNANO,这是智朴发布的1.5B的模型。", "tokens": [50465, 41, 43, 44, 7469, 49, 45, 48129, 11, 27455, 5094, 118, 1474, 112, 28926, 34688, 1546, 16, 13, 20, 33, 1546, 41908, 39823, 1543, 50665], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 44, "seek": 22800, "start": 234.0, "end": 236.0, "text": "对数字的处理很好。", "tokens": [50665, 8713, 33188, 22381, 1546, 1787, 226, 13876, 23801, 1543, 50765], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 45, "seek": 22800, "start": 236.0, "end": 238.0, "text": "断句也非常的精准。", "tokens": [50765, 4307, 255, 34592, 6404, 48263, 34910, 6336, 228, 1543, 50865], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 46, "seek": 22800, "start": 238.0, "end": 243.0, "text": "识别的准确度与稳定性,跟Quin3 ASR0.6B是差不多的。", "tokens": [50865, 5233, 228, 18453, 1546, 6336, 228, 38114, 106, 13127, 940, 236, 10415, 111, 12088, 21686, 11, 9678, 8547, 259, 18, 7469, 49, 15, 13, 21, 33, 1541, 37876, 1546, 1543, 51115], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 47, "seek": 22800, "start": 243.0, "end": 246.0, "text": "翻炎的识别上面会相对比较一般。", "tokens": [51115, 42716, 4804, 236, 1546, 5233, 228, 18453, 49750, 12949, 15106, 8713, 11706, 9830, 225, 2257, 49640, 1543, 51265], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 48, "seek": 22800, "start": 246.0, "end": 251.0, "text": "然后执行的速度上面是比Quin3 ASR0.6B慢挺多的。", "tokens": [51265, 26636, 3416, 100, 8082, 1546, 31217, 13127, 49750, 1541, 11706, 8547, 259, 18, 7469, 49, 15, 13, 21, 33, 20645, 41046, 6392, 1546, 1543, 51515], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 49, "seek": 22800, "start": 251.0, "end": 255.0, "text": "我会把它排在人上人,在Whisper的前面。", "tokens": [51515, 1654, 12949, 42061, 44647, 3581, 4035, 5708, 4035, 11, 3581, 2471, 271, 610, 1546, 8945, 8833, 1543, 51715], "temperature": 0, "avg_logprob": -0.10400366327565187, "compression_ratio": 1.2061855670103092, "no_speech_prob": 1.4784467053385875e-11}, {"id": 50, "seek": 25500, "start": 255.0, "end": 261.0, "text": "FireRed ASR2小红书发布的1款有特点的模型。", "tokens": [50365, 45651, 20544, 7469, 49, 17, 7322, 16853, 95, 2930, 99, 28926, 34688, 1546, 16, 48798, 2412, 17682, 12579, 1546, 41908, 39823, 1543, 50665], "temperature": 0, "avg_logprob": -0.10950206858771187, "compression_ratio": 1.2277227722772277, "no_speech_prob": 1.739210338247421e-11}, {"id": 51, "seek": 25500, "start": 261.0, "end": 264.0, "text": "其实是1套可以分开使用的模型组合。", "tokens": [50665, 41646, 1541, 16, 1881, 245, 6723, 6627, 18937, 22982, 9254, 1546, 41908, 39823, 10115, 226, 14245, 1543, 50815], "temperature": 0, "avg_logprob": -0.10950206858771187, "compression_ratio": 1.2277227722772277, "no_speech_prob": 1.739210338247421e-11}, {"id": 52, "seek": 25500, "start": 264.0, "end": 269.0, "text": "自动语音识别,语音活动检测,口语识别,和标点符号预测。", "tokens": [50815, 9722, 34961, 5233, 255, 18034, 5233, 228, 18453, 11, 5233, 255, 18034, 25956, 34961, 16407, 222, 11038, 233, 11, 18144, 5233, 255, 5233, 228, 18453, 11, 12565, 162, 3921, 12579, 5437, 99, 26987, 12501, 226, 11038, 233, 1543, 51065], "temperature": 0, "avg_logprob": -0.10950206858771187, "compression_ratio": 1.2277227722772277, "no_speech_prob": 1.739210338247421e-11}, {"id": 53, "seek": 25500, "start": 269.0, "end": 271.0, "text": "需要结合使用。", "tokens": [51065, 35748, 45641, 14245, 22982, 9254, 1543, 51165], "temperature": 0, "avg_logprob": -0.10950206858771187, "compression_ratio": 1.2277227722772277, "no_speech_prob": 1.739210338247421e-11}, {"id": 54, "seek": 25500, "start": 271.0, "end": 274.0, "text": "其中语音活动检测模型非常的好用。", "tokens": [51165, 9572, 5975, 5233, 255, 18034, 25956, 34961, 16407, 222, 11038, 233, 41908, 39823, 48263, 2131, 9254, 1543, 51315], "temperature": 0, "avg_logprob": -0.10950206858771187, "compression_ratio": 1.2277227722772277, "no_speech_prob": 1.739210338247421e-11}, {"id": 55, "seek": 27400, "start": 274.0, "end": 277.0, "text": "可以准确地识别歌曲中的语音。", "tokens": [50365, 6723, 6336, 228, 38114, 106, 10928, 5233, 228, 18453, 29582, 30753, 5975, 1546, 5233, 255, 18034, 1543, 50515], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 56, "seek": 27400, "start": 277.0, "end": 279.0, "text": "对幻觉的控制很好。", "tokens": [50515, 8713, 3509, 119, 24447, 1546, 48707, 25491, 23801, 1543, 50615], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 57, "seek": 27400, "start": 279.0, "end": 282.0, "text": "专有名词的错误率但是偏高。", "tokens": [50615, 940, 241, 2412, 15940, 5233, 235, 1546, 29900, 5233, 107, 44866, 11189, 7437, 237, 12979, 1543, 50765], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 58, "seek": 27400, "start": 282.0, "end": 284.0, "text": "我会把它排在NPC。", "tokens": [50765, 1654, 12949, 42061, 44647, 3581, 45, 12986, 1543, 50865], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 59, "seek": 27400, "start": 284.0, "end": 288.0, "text": "Fire ASR nano对数字的处理非常的好。", "tokens": [50865, 45651, 7469, 49, 30129, 8713, 33188, 22381, 1546, 1787, 226, 13876, 48263, 2131, 1543, 51065], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 60, "seek": 27400, "start": 288.0, "end": 292.0, "text": "断句与方言的识别是强于Quin3 ASR0.6B的。", "tokens": [51065, 4307, 255, 34592, 940, 236, 9249, 12009, 1546, 5233, 228, 18453, 1541, 5702, 118, 37732, 8547, 259, 18, 7469, 49, 15, 13, 21, 33, 1546, 1543, 51265], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 61, "seek": 27400, "start": 292.0, "end": 295.0, "text": "但稳定性不如Quin3 ASR0.6B。", "tokens": [51265, 8395, 10415, 111, 12088, 21686, 1960, 8238, 8547, 259, 18, 7469, 49, 15, 13, 21, 33, 1543, 51415], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 62, "seek": 27400, "start": 295.0, "end": 298.0, "text": "会有幻觉,会有肉词的情况。", "tokens": [51415, 12949, 2412, 3509, 119, 24447, 11, 12949, 2412, 31980, 5233, 235, 1546, 46514, 1543, 51565], "temperature": 0, "avg_logprob": -0.08691255994837918, "compression_ratio": 1.171206225680934, "no_speech_prob": 1.7656898512741215e-11}, {"id": 63, "seek": 29800, "start": 298.0, "end": 301.0, "text": "自带的字集时间戳,飘移非常的严重。", "tokens": [50365, 9722, 4845, 99, 1546, 22381, 26020, 44848, 1486, 111, 11, 11808, 246, 8204, 119, 48263, 940, 98, 12624, 1543, 50515], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 64, "seek": 29800, "start": 301.0, "end": 304.0, "text": "我会把它排在人上人。", "tokens": [50515, 1654, 12949, 42061, 44647, 3581, 4035, 5708, 4035, 1543, 50665], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 65, "seek": 29800, "start": 304.0, "end": 308.0, "text": "Sense OIS特别适合移动端的部署。", "tokens": [50665, 50, 1288, 422, 2343, 17682, 18453, 2215, 224, 14245, 8204, 119, 34961, 11957, 107, 1546, 13470, 16469, 110, 1543, 50865], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 66, "seek": 29800, "start": 308.0, "end": 310.0, "text": "体积很小,执行很快。", "tokens": [50865, 29485, 8204, 107, 4563, 7322, 11, 3416, 100, 8082, 4563, 10251, 1543, 50965], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 67, "seek": 29800, "start": 310.0, "end": 313.0, "text": "但识别的准确率上面是比较一般的。", "tokens": [50965, 8395, 5233, 228, 18453, 1546, 6336, 228, 38114, 106, 44866, 49750, 1541, 11706, 9830, 225, 2257, 49640, 1546, 1543, 51115], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 68, "seek": 29800, "start": 313.0, "end": 315.0, "text": "肉词的问题挺严重的。", "tokens": [51115, 31980, 5233, 235, 1546, 34069, 41046, 940, 98, 12624, 1546, 1543, 51215], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 69, "seek": 29800, "start": 315.0, "end": 316.0, "text": "需要自己处理标点。", "tokens": [51215, 35748, 17645, 1787, 226, 13876, 162, 3921, 12579, 1543, 51265], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 70, "seek": 29800, "start": 316.0, "end": 320.0, "text": "当存从识别的准确率与稳定性的角度。", "tokens": [51265, 16233, 39781, 35630, 5233, 228, 18453, 1546, 6336, 228, 38114, 106, 44866, 940, 236, 10415, 111, 12088, 21686, 1546, 29389, 13127, 1543, 51465], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 71, "seek": 29800, "start": 320.0, "end": 322.0, "text": "我会把它排在NPC。", "tokens": [51465, 1654, 12949, 42061, 44647, 3581, 45, 12986, 1543, 51565], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 72, "seek": 29800, "start": 322.0, "end": 326.0, "text": "接下来来看一下相同语音各个模型的准确率的情况。", "tokens": [51565, 14468, 4438, 6912, 6912, 28324, 15106, 13089, 5233, 255, 18034, 17516, 7549, 41908, 39823, 1546, 6336, 228, 38114, 106, 44866, 1546, 46514, 1543, 51765], "temperature": 0, "avg_logprob": -0.10262484908793014, "compression_ratio": 1.3135313531353134, "no_speech_prob": 1.3742084727097481e-11}, {"id": 73, "seek": 32600, "start": 326.0, "end": 332.0, "text": "可以看到Memo V2.5 ASR是现在中文识别准确率最高的模型。", "tokens": [50365, 6723, 18032, 44, 36221, 691, 17, 13, 20, 7469, 49, 1541, 25040, 5975, 17174, 5233, 228, 18453, 6336, 228, 38114, 106, 44866, 8661, 12979, 1546, 41908, 39823, 1543, 50665], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 74, "seek": 32600, "start": 332.0, "end": 335.0, "text": "其次是Quin3 ASR1.7B。", "tokens": [50665, 9572, 9487, 1541, 8547, 259, 18, 7469, 49, 16, 13, 22, 33, 1543, 50815], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 75, "seek": 32600, "start": 335.0, "end": 338.0, "text": "除了拉胯的Kohir模型,", "tokens": [50815, 32999, 2289, 29717, 19095, 107, 1546, 42, 1445, 347, 41908, 39823, 11, 50965], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 76, "seek": 32600, "start": 338.0, "end": 341.0, "text": "所有的模型的中文识别准确率都高于WESP。", "tokens": [50965, 39300, 1546, 41908, 39823, 1546, 5975, 17174, 5233, 228, 18453, 6336, 228, 38114, 106, 44866, 7182, 12979, 37732, 54, 2358, 47, 1543, 51115], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 77, "seek": 32600, "start": 341.0, "end": 344.0, "text": "最后看一下多个维度的综合对比。", "tokens": [51115, 8661, 13547, 28324, 6392, 7549, 10115, 112, 13127, 1546, 10115, 120, 14245, 8713, 11706, 1543, 51265], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 78, "seek": 32600, "start": 344.0, "end": 346.0, "text": "单维度满分是5分。", "tokens": [51265, 47446, 10115, 112, 13127, 15868, 94, 6627, 1541, 20, 6627, 1543, 51365], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 79, "seek": 32600, "start": 346.0, "end": 352.0, "text": "可以看到中文识别上面综合能力Memo V2.5 ASR是最好的。", "tokens": [51365, 6723, 18032, 5975, 17174, 5233, 228, 18453, 49750, 10115, 120, 14245, 8225, 13486, 44, 36221, 691, 17, 13, 20, 7469, 49, 1541, 8661, 20715, 1543, 51665], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 80, "seek": 32600, "start": 352.0, "end": 355.0, "text": "其次是Quin3 ASR1.7B。", "tokens": [51665, 9572, 9487, 1541, 8547, 259, 18, 7469, 49, 16, 13, 22, 33, 1543, 51815], "temperature": 0, "avg_logprob": -0.10787844809756916, "compression_ratio": 1.3745019920318724, "no_speech_prob": 1.4012437911381515e-11}, {"id": 81, "seek": 35500, "start": 355.0, "end": 358.0, "text": "Memo V2.5 ASR不熟的难度是很高的。", "tokens": [50365, 44, 36221, 691, 17, 13, 20, 7469, 49, 1960, 21805, 253, 1546, 46531, 13127, 1541, 4563, 12979, 1546, 1543, 50515], "temperature": 0, "avg_logprob": -0.07312822341918945, "compression_ratio": 1.2714285714285714, "no_speech_prob": 1.7404407776089315e-11}, {"id": 82, "seek": 35500, "start": 358.0, "end": 363.0, "text": "2026年最推荐的中文ASR模型就是Quin3 ASR1.7B。", "tokens": [50515, 2009, 10880, 5157, 8661, 33597, 31409, 238, 1546, 5975, 17174, 3160, 49, 41908, 39823, 5620, 8547, 259, 18, 7469, 49, 16, 13, 22, 33, 1543, 50765], "temperature": 0, "avg_logprob": -0.07312822341918945, "compression_ratio": 1.2714285714285714, "no_speech_prob": 1.7404407776089315e-11}, {"id": 83, "seek": 35500, "start": 363.0, "end": 367.0, "text": "方言识别最准的模型是Memo V2.5 ASR。", "tokens": [50765, 9249, 12009, 5233, 228, 18453, 8661, 6336, 228, 1546, 41908, 39823, 1541, 44, 36221, 691, 17, 13, 20, 7469, 49, 1543, 50965], "temperature": 0, "avg_logprob": -0.07312822341918945, "compression_ratio": 1.2714285714285714, "no_speech_prob": 1.7404407776089315e-11}, {"id": 84, "seek": 35500, "start": 367.0, "end": 371.0, "text": "歌曲识别最好的模型是Quin3 ASR1.7B。", "tokens": [50965, 29582, 30753, 5233, 228, 18453, 8661, 20715, 41908, 39823, 1541, 8547, 259, 18, 7469, 49, 16, 13, 22, 33, 1543, 51165], "temperature": 0, "avg_logprob": -0.07312822341918945, "compression_ratio": 1.2714285714285714, "no_speech_prob": 1.7404407776089315e-11}, {"id": 85, "seek": 35500, "start": 371.0, "end": 373.0, "text": "以上就是视频的全部内容。", "tokens": [51165, 29497, 5620, 40656, 39752, 1546, 38714, 34742, 25750, 1543, 51265], "temperature": 0, "avg_logprob": -0.07312822341918945, "compression_ratio": 1.2714285714285714, "no_speech_prob": 1.7404407776089315e-11}, {"id": 86, "seek": 35500, "start": 373.0, "end": 375.0, "text": "我是浩叔,我们下一个视频见。", "tokens": [51265, 15914, 11038, 102, 39936, 11, 15003, 4438, 20182, 40656, 39752, 23813, 1543, 51365], "temperature": 0, "avg_logprob": -0.07312822341918945, "compression_ratio": 1.2714285714285714, "no_speech_prob": 1.7404407776089315e-11}, {"id": 87, "seek": 37500, "start": 375.0, "end": 377.0, "text": "我们下一个视频见。", "tokens": [50365, 15003, 4438, 20182, 40656, 39752, 23813, 1543, 50465], "temperature": 0, "avg_logprob": -0.3216218948364258, "compression_ratio": 0.7105263157894737, "no_speech_prob": 2.3824322722965086e-11}], "language": "zh"}