0:00.000–0:05.000
ja2026年,有没有ASR模型在中文识别上可以替代WESP?
0:05.000–0:10.000
ja这个视频我将瑞评主流的支持中文转录的ASR开源模型。
0:10.000–0:13.596
ja哪一个模型中文转录识别准确率最高?
0:13.596–0:15.923
ja哪个模型翻译识别最好?
0:15.923–0:18.250
ja哪个模型适合愿意计要?
0:18.250–0:21.000
ja哪个模型歌曲识别能力最好?
0:21.000–0:26.000
ja如果你使用过上述模型,欢迎在评论区给出你的推荐建议。
0:26.000–0:30.000
ja我做了一款可能是市面上功能最强大的AI字幕软件。
0:30.000–0:34.211
ja好啊,为了给用户使用最合适的ASR模型,
0:34.211–0:38.000
ja我测试了大部分支持中文的ASR模型。
0:38.000–0:44.000
ja这是我祖传的中文测试音频数据集。一半以上是复杂的音频。
0:44.000–0:48.098
ja我会使用我自己写的Benchmark程序,
0:48.098–0:49.659
ja让模型逐一转录,
0:49.659–0:52.000
ja然后生成转录的结果报告。
0:52.000–0:56.364
ja我会重点展示其中一个讲解模型量化的音频识别结果。
0:56.364–1:00.000
ja其中包含了大量的计算机术语与大量的数字。
1:00.000–1:04.000
ja先来看一下WASP,这也是用的最广的ASR模型。
1:04.000–1:06.438
jaWASP的优点是异于极城,
1:06.438–1:07.750
ja生态最为丰富,
1:07.750–1:08.875
ja支持语种多。
1:08.875–1:10.562
ja但在中文识别上面,
1:10.562–1:13.000
ja准确度与稳定性都是不够的。
1:13.000–1:19.000
ja比如容易出现幻觉,复杂的语音的场景会漏词或是乱补词。
1:19.000–1:23.000
ja中英混缩的错误比较多,有时会出繁体中文。
1:23.000–1:28.000
ja专有名词识别不准,断句不稳定,容易出长句。
1:28.000–1:33.000
ja歌曲识别不好,虽然带有词集时间戳,但偏移很严重。
1:33.000–1:37.000
ja2026年的今天,我会把它排在人上人的位置。
1:37.000–1:39.100
enMemo V2.5 ASR,
1:39.100–1:41.550
ja我上一期的视频有详细的测评,
1:41.550–1:44.000
ja感兴趣的小伙伴可以去看一下。
1:44.000–1:47.000
ja是目前中文转入最强的ASR模型。
1:47.000–1:50.487
ja最好的方言识别能力与歌曲识别能力,
1:50.487–1:55.000
ja几乎克服了WASP在中文识别上面的所有毛病。
1:55.000–2:01.000
ja唯一的问题是它是8B的参数量,体积巨大,执行很慢,顶级位置。
2:01.000–2:03.333
ja再来看另外一个重量级的选手,
2:03.333–2:06.167
ja7B参数的Web Voice ASR,
2:06.167–2:08.000
ja专有名词识别上面最好。
2:08.000–2:13.000
ja支持50种语言,内置功能最全面的ASR模型。
2:13.000–2:16.600
ja比如一次即可转入长达60分钟的音频,
2:16.600–2:18.200
ja支持说话能分割,
2:18.200–2:19.800
ja带有段落时间戳,
2:19.800–2:21.200
ja音频识件识别,
2:21.200–2:23.000
ja可以自定义乐词等。
2:23.000–2:26.000
ja但复杂场景容易出现幻觉,出现重复的文字。
2:26.000–2:31.000
ja输出的Jesion格式不够稳定,在工程处理上面要很小心。
2:31.000–2:38.000
ja中文断句会有不稳定的情况,方言识别很一般,我会把它放在顶级位置。
2:38.000–2:45.000
ja混杂ASR1.7B,强烈推荐你使用的ASR模型。
2:45.000–2:49.000
ja中文识别准确率高,识别稳定,不容易出现幻觉。
2:49.000–2:54.000
ja支持30种语言与22种方言,可以处理多语种的混缩。
2:54.000–2:59.000
ja可以识别歌曲,执行速度很快,自带断句非常不错。
2:59.000–3:05.000
ja缺点是,装有名词识别不够稳定,断句有时会出现长句。
3:05.000–3:11.000
ja这是我测试下来综合能力最强的中文ASR模型,我会把它排在,憨爆了。
3:11.000–3:14.000
ja2026年ASR模型的第一选择。
3:14.000–3:19.000
jaQuin3 ASR0.6B,非常好的小参数ASR模型。
3:19.000–3:24.000
ja执行速度非常的快,可以适配大部分的电脑部署。
3:24.000–3:28.000
jaQuin3 ASR1.7B,大部分的优点它都有。
3:28.000–3:32.000
ja不足的是,识别的稳定性与专有名词的识别会相对差一些。
3:32.000–3:36.000
enQuin3 ASR0.6B,已经比Whisper好运很多了。
3:36.000–3:39.000
ja我会把它还在顶级推荐你使用。
3:39.000–3:43.000
jaKahir这个模型,我有一期视频专门测试过。
3:43.000–3:45.000
ja拉完了,别愿。
3:45.000–3:48.000
ja幻觉非常的严重,中文识别非常的糟糕。
3:48.000–3:50.000
ja基本上是不可怨的。
3:50.000–3:54.000
jaJLM ASRNANO,这是智朴发布的1.5B的模型。
3:54.000–3:56.000
ja对数字的处理很好。
3:56.000–3:58.000
ja断句也非常的精准。
3:58.000–4:03.000
ja识别的准确度与稳定性,跟Quin3 ASR0.6B是差不多的。
4:03.000–4:06.000
ja翻炎的识别上面会相对比较一般。
4:06.000–4:11.000
ja然后执行的速度上面是比Quin3 ASR0.6B慢挺多的。
4:11.000–4:15.000
ja我会把它排在人上人,在Whisper的前面。
4:15.000–4:21.000
jaFireRed ASR2小红书发布的1款有特点的模型。
4:21.000–4:24.000
ja其实是1套可以分开使用的模型组合。
4:24.000–4:29.000
ja自动语音识别,语音活动检测,口语识别,和标点符号预测。
4:29.000–4:31.000
ja需要结合使用。
4:31.000–4:34.000
ja其中语音活动检测模型非常的好用。
4:34.000–4:37.000
ja可以准确地识别歌曲中的语音。
4:37.000–4:39.000
ja对幻觉的控制很好。
4:39.000–4:42.000
ja专有名词的错误率但是偏高。
4:42.000–4:44.000
ja我会把它排在NPC。
4:44.000–4:48.000
jaFire ASR nano对数字的处理非常的好。
4:48.000–4:52.000
ja断句与方言的识别是强于Quin3 ASR0.6B的。
4:52.000–4:55.000
en但稳定性不如Quin3 ASR0.6B。
4:55.000–4:58.000
ja会有幻觉,会有肉词的情况。
4:58.000–5:01.000
ja自带的字集时间戳,飘移非常的严重。
5:01.000–5:04.000
ja我会把它排在人上人。
5:04.000–5:08.000
jaSense OIS特别适合移动端的部署。
5:08.000–5:10.000
ja体积很小,执行很快。
5:10.000–5:13.000
ja但识别的准确率上面是比较一般的。
5:13.000–5:15.000
ja肉词的问题挺严重的。
5:15.000–5:16.000
ja需要自己处理标点。
5:16.000–5:20.000
ja当存从识别的准确率与稳定性的角度。
5:20.000–5:22.000
ja我会把它排在NPC。
5:22.000–5:26.000
ja接下来来看一下相同语音各个模型的准确率的情况。
5:26.000–5:32.000
ja可以看到Memo V2.5 ASR是现在中文识别准确率最高的模型。
5:32.000–5:35.000
en其次是Quin3 ASR1.7B。
5:35.000–5:38.000
ja除了拉胯的Kohir模型,
5:38.000–5:41.000
ja所有的模型的中文识别准确率都高于WESP。
5:41.000–5:44.000
ja最后看一下多个维度的综合对比。
5:44.000–5:46.000
ja单维度满分是5分。
5:46.000–5:52.000
ja可以看到中文识别上面综合能力Memo V2.5 ASR是最好的。
5:52.000–5:55.000
en其次是Quin3 ASR1.7B。
5:55.000–5:58.000
jaMemo V2.5 ASR不熟的难度是很高的。
5:58.000–6:03.000
ja2026年最推荐的中文ASR模型就是Quin3 ASR1.7B。
6:03.000–6:07.000
ja方言识别最准的模型是Memo V2.5 ASR。
6:07.000–6:11.000
ja歌曲识别最好的模型是Quin3 ASR1.7B。
6:11.000–6:13.000
ja以上就是视频的全部内容。
6:13.000–6:15.000
ja我是浩叔,我们下一个视频见。
6:15.000–6:15.861
ja我们下一个视频见。
0:00.000–0:05.000
2026年,有没有ASR模型在中文识别上可以替代WESP?
0:05.000–0:10.000
这个视频我将瑞评主流的支持中文转录的ASR开源模型。
0:10.000–0:13.596
哪一个模型中文转录识别准确率最高?
0:13.596–0:15.923
哪个模型翻译识别最好?
0:15.923–0:18.250
哪个模型适合愿意计要?
0:18.250–0:21.000
哪个模型歌曲识别能力最好?
0:21.000–0:26.000
如果你使用过上述模型,欢迎在评论区给出你的推荐建议。
0:26.000–0:30.000
我做了一款可能是市面上功能最强大的AI字幕软件。
0:30.000–0:34.211
好啊,为了给用户使用最合适的ASR模型,
0:34.211–0:38.000
我测试了大部分支持中文的ASR模型。
0:38.000–0:44.000
这是我祖传的中文测试音频数据集。一半以上是复杂的音频。
0:44.000–0:48.098
我会使用我自己写的Benchmark程序,
0:48.098–0:49.659
让模型逐一转录,
0:49.659–0:52.000
然后生成转录的结果报告。
0:52.000–0:56.364
我会重点展示其中一个讲解模型量化的音频识别结果。
0:56.364–1:00.000
其中包含了大量的计算机术语与大量的数字。
1:00.000–1:04.000
先来看一下WASP,这也是用的最广的ASR模型。
1:04.000–1:06.438
WASP的优点是异于极城,
1:06.438–1:07.750
生态最为丰富,
1:07.750–1:08.875
支持语种多。
1:08.875–1:10.562
但在中文识别上面,
1:10.562–1:13.000
准确度与稳定性都是不够的。
1:13.000–1:19.000
比如容易出现幻觉,复杂的语音的场景会漏词或是乱补词。
1:19.000–1:23.000
中英混缩的错误比较多,有时会出繁体中文。
1:23.000–1:28.000
专有名词识别不准,断句不稳定,容易出长句。
1:28.000–1:33.000
歌曲识别不好,虽然带有词集时间戳,但偏移很严重。
1:33.000–1:37.000
2026年的今天,我会把它排在人上人的位置。
1:37.000–1:39.100
Memo V2.5 ASR,
1:39.100–1:41.550
我上一期的视频有详细的测评,
1:41.550–1:44.000
感兴趣的小伙伴可以去看一下。
1:44.000–1:47.000
是目前中文转入最强的ASR模型。
1:47.000–1:50.487
最好的方言识别能力与歌曲识别能力,
1:50.487–1:55.000
几乎克服了WASP在中文识别上面的所有毛病。
1:55.000–2:01.000
唯一的问题是它是8B的参数量,体积巨大,执行很慢,顶级位置。
2:01.000–2:03.333
再来看另外一个重量级的选手,
2:03.333–2:06.167
7B参数的Web Voice ASR,
2:06.167–2:08.000
专有名词识别上面最好。
2:08.000–2:13.000
支持50种语言,内置功能最全面的ASR模型。
2:13.000–2:16.600
比如一次即可转入长达60分钟的音频,
2:16.600–2:18.200
支持说话能分割,
2:18.200–2:19.800
带有段落时间戳,
2:19.800–2:21.200
音频识件识别,
2:21.200–2:23.000
可以自定义乐词等。
2:23.000–2:26.000
但复杂场景容易出现幻觉,出现重复的文字。
2:26.000–2:31.000
输出的Jesion格式不够稳定,在工程处理上面要很小心。
2:31.000–2:38.000
中文断句会有不稳定的情况,方言识别很一般,我会把它放在顶级位置。
2:38.000–2:45.000
混杂ASR1.7B,强烈推荐你使用的ASR模型。
2:45.000–2:49.000
中文识别准确率高,识别稳定,不容易出现幻觉。
2:49.000–2:54.000
支持30种语言与22种方言,可以处理多语种的混缩。
2:54.000–2:59.000
可以识别歌曲,执行速度很快,自带断句非常不错。
2:59.000–3:05.000
缺点是,装有名词识别不够稳定,断句有时会出现长句。
3:05.000–3:11.000
这是我测试下来综合能力最强的中文ASR模型,我会把它排在,憨爆了。
3:11.000–3:14.000
2026年ASR模型的第一选择。
3:14.000–3:19.000
Quin3 ASR0.6B,非常好的小参数ASR模型。
3:19.000–3:24.000
执行速度非常的快,可以适配大部分的电脑部署。
3:24.000–3:28.000
Quin3 ASR1.7B,大部分的优点它都有。
3:28.000–3:32.000
不足的是,识别的稳定性与专有名词的识别会相对差一些。
3:32.000–3:36.000
Quin3 ASR0.6B,已经比Whisper好运很多了。
3:36.000–3:39.000
我会把它还在顶级推荐你使用。
3:39.000–3:43.000
Kahir这个模型,我有一期视频专门测试过。
3:43.000–3:45.000
拉完了,别愿。
3:45.000–3:48.000
幻觉非常的严重,中文识别非常的糟糕。
3:48.000–3:50.000
基本上是不可怨的。
3:50.000–3:54.000
JLM ASRNANO,这是智朴发布的1.5B的模型。
3:54.000–3:56.000
对数字的处理很好。
3:56.000–3:58.000
断句也非常的精准。
3:58.000–4:03.000
识别的准确度与稳定性,跟Quin3 ASR0.6B是差不多的。
4:03.000–4:06.000
翻炎的识别上面会相对比较一般。
4:06.000–4:11.000
然后执行的速度上面是比Quin3 ASR0.6B慢挺多的。
4:11.000–4:15.000
我会把它排在人上人,在Whisper的前面。
4:15.000–4:21.000
FireRed ASR2小红书发布的1款有特点的模型。
4:21.000–4:24.000
其实是1套可以分开使用的模型组合。
4:24.000–4:29.000
自动语音识别,语音活动检测,口语识别,和标点符号预测。
4:29.000–4:31.000
需要结合使用。
4:31.000–4:34.000
其中语音活动检测模型非常的好用。
4:34.000–4:37.000
可以准确地识别歌曲中的语音。
4:37.000–4:39.000
对幻觉的控制很好。
4:39.000–4:42.000
专有名词的错误率但是偏高。
4:42.000–4:44.000
我会把它排在NPC。
4:44.000–4:48.000
Fire ASR nano对数字的处理非常的好。
4:48.000–4:52.000
断句与方言的识别是强于Quin3 ASR0.6B的。
4:52.000–4:55.000
但稳定性不如Quin3 ASR0.6B。
4:55.000–4:58.000
会有幻觉,会有肉词的情况。
4:58.000–5:01.000
自带的字集时间戳,飘移非常的严重。
5:01.000–5:04.000
我会把它排在人上人。
5:04.000–5:08.000
Sense OIS特别适合移动端的部署。
5:08.000–5:10.000
体积很小,执行很快。
5:10.000–5:13.000
但识别的准确率上面是比较一般的。
5:13.000–5:15.000
肉词的问题挺严重的。
5:15.000–5:16.000
需要自己处理标点。
5:16.000–5:20.000
当存从识别的准确率与稳定性的角度。
5:20.000–5:22.000
我会把它排在NPC。
5:22.000–5:26.000
接下来来看一下相同语音各个模型的准确率的情况。
5:26.000–5:32.000
可以看到Memo V2.5 ASR是现在中文识别准确率最高的模型。
5:32.000–5:35.000
其次是Quin3 ASR1.7B。
5:35.000–5:38.000
除了拉胯的Kohir模型,
5:38.000–5:41.000
所有的模型的中文识别准确率都高于WESP。
5:41.000–5:44.000
最后看一下多个维度的综合对比。
5:44.000–5:46.000
单维度满分是5分。
5:46.000–5:52.000
可以看到中文识别上面综合能力Memo V2.5 ASR是最好的。
5:52.000–5:55.000
其次是Quin3 ASR1.7B。
5:55.000–5:58.000
Memo V2.5 ASR不熟的难度是很高的。
5:58.000–6:03.000
2026年最推荐的中文ASR模型就是Quin3 ASR1.7B。
6:03.000–6:07.000
方言识别最准的模型是Memo V2.5 ASR。
6:07.000–6:11.000
歌曲识别最好的模型是Quin3 ASR1.7B。
6:11.000–6:13.000
以上就是视频的全部内容。
6:13.000–6:15.000
我是浩叔,我们下一个视频见。
6:15.000–6:15.861
我们下一个视频见。
0:00.000–0:05.000
ja2026年,有没有ASR模型在中文识别上可以替代WESP?
2026年,有没有ASR模型在中文识别上可以替代WESP?
0:05.000–0:10.000
ja这个视频我将瑞评主流的支持中文转录的ASR开源模型。
这个视频我将瑞评主流的支持中文转录的ASR开源模型。
0:10.000–0:13.596
ja哪一个模型中文转录识别准确率最高?
哪一个模型中文转录识别准确率最高?
0:13.596–0:15.923
ja哪个模型翻译识别最好?
哪个模型翻译识别最好?
0:15.923–0:18.250
ja哪个模型适合愿意计要?
哪个模型适合愿意计要?
0:18.250–0:21.000
ja哪个模型歌曲识别能力最好?
哪个模型歌曲识别能力最好?
0:21.000–0:26.000
ja如果你使用过上述模型,欢迎在评论区给出你的推荐建议。
如果你使用过上述模型,欢迎在评论区给出你的推荐建议。
0:26.000–0:30.000
ja我做了一款可能是市面上功能最强大的AI字幕软件。
我做了一款可能是市面上功能最强大的AI字幕软件。
0:30.000–0:34.211
ja好啊,为了给用户使用最合适的ASR模型,
好啊,为了给用户使用最合适的ASR模型,
0:34.211–0:38.000
ja我测试了大部分支持中文的ASR模型。
我测试了大部分支持中文的ASR模型。
0:38.000–0:44.000
ja这是我祖传的中文测试音频数据集。一半以上是复杂的音频。
这是我祖传的中文测试音频数据集。一半以上是复杂的音频。
0:44.000–0:48.098
ja我会使用我自己写的Benchmark程序,
我会使用我自己写的Benchmark程序,
0:48.098–0:49.659
ja让模型逐一转录,
让模型逐一转录,
0:49.659–0:52.000
ja然后生成转录的结果报告。
然后生成转录的结果报告。
0:52.000–0:56.364
ja我会重点展示其中一个讲解模型量化的音频识别结果。
我会重点展示其中一个讲解模型量化的音频识别结果。
0:56.364–1:00.000
ja其中包含了大量的计算机术语与大量的数字。
其中包含了大量的计算机术语与大量的数字。
1:00.000–1:04.000
ja先来看一下WASP,这也是用的最广的ASR模型。
先来看一下WASP,这也是用的最广的ASR模型。
1:04.000–1:06.438
jaWASP的优点是异于极城,
WASP的优点是异于极城,
1:06.438–1:07.750
ja生态最为丰富,
生态最为丰富,
1:07.750–1:08.875
ja支持语种多。
支持语种多。
1:08.875–1:10.562
ja但在中文识别上面,
但在中文识别上面,
1:10.562–1:13.000
ja准确度与稳定性都是不够的。
准确度与稳定性都是不够的。
1:13.000–1:19.000
ja比如容易出现幻觉,复杂的语音的场景会漏词或是乱补词。
比如容易出现幻觉,复杂的语音的场景会漏词或是乱补词。
1:19.000–1:23.000
ja中英混缩的错误比较多,有时会出繁体中文。
中英混缩的错误比较多,有时会出繁体中文。
1:23.000–1:28.000
ja专有名词识别不准,断句不稳定,容易出长句。
专有名词识别不准,断句不稳定,容易出长句。
1:28.000–1:33.000
ja歌曲识别不好,虽然带有词集时间戳,但偏移很严重。
歌曲识别不好,虽然带有词集时间戳,但偏移很严重。
1:33.000–1:37.000
ja2026年的今天,我会把它排在人上人的位置。
2026年的今天,我会把它排在人上人的位置。
1:37.000–1:39.100
enMemo V2.5 ASR,
Memo V2.5 ASR,
1:39.100–1:41.550
ja我上一期的视频有详细的测评,
我上一期的视频有详细的测评,
1:41.550–1:44.000
ja感兴趣的小伙伴可以去看一下。
感兴趣的小伙伴可以去看一下。
1:44.000–1:47.000
ja是目前中文转入最强的ASR模型。
是目前中文转入最强的ASR模型。
1:47.000–1:50.487
ja最好的方言识别能力与歌曲识别能力,
最好的方言识别能力与歌曲识别能力,
1:50.487–1:55.000
ja几乎克服了WASP在中文识别上面的所有毛病。
几乎克服了WASP在中文识别上面的所有毛病。
1:55.000–2:01.000
ja唯一的问题是它是8B的参数量,体积巨大,执行很慢,顶级位置。
唯一的问题是它是8B的参数量,体积巨大,执行很慢,顶级位置。
2:01.000–2:03.333
ja再来看另外一个重量级的选手,
再来看另外一个重量级的选手,
2:03.333–2:06.167
ja7B参数的Web Voice ASR,
7B参数的Web Voice ASR,
2:06.167–2:08.000
ja专有名词识别上面最好。
专有名词识别上面最好。
2:08.000–2:13.000
ja支持50种语言,内置功能最全面的ASR模型。
支持50种语言,内置功能最全面的ASR模型。
2:13.000–2:16.600
ja比如一次即可转入长达60分钟的音频,
比如一次即可转入长达60分钟的音频,
2:16.600–2:18.200
ja支持说话能分割,
支持说话能分割,
2:18.200–2:19.800
ja带有段落时间戳,
带有段落时间戳,
2:19.800–2:21.200
ja音频识件识别,
音频识件识别,
2:21.200–2:23.000
ja可以自定义乐词等。
可以自定义乐词等。
2:23.000–2:26.000
ja但复杂场景容易出现幻觉,出现重复的文字。
但复杂场景容易出现幻觉,出现重复的文字。
2:26.000–2:31.000
ja输出的Jesion格式不够稳定,在工程处理上面要很小心。
输出的Jesion格式不够稳定,在工程处理上面要很小心。
2:31.000–2:38.000
ja中文断句会有不稳定的情况,方言识别很一般,我会把它放在顶级位置。
中文断句会有不稳定的情况,方言识别很一般,我会把它放在顶级位置。
2:38.000–2:45.000
ja混杂ASR1.7B,强烈推荐你使用的ASR模型。
混杂ASR1.7B,强烈推荐你使用的ASR模型。
2:45.000–2:49.000
ja中文识别准确率高,识别稳定,不容易出现幻觉。
中文识别准确率高,识别稳定,不容易出现幻觉。
2:49.000–2:54.000
ja支持30种语言与22种方言,可以处理多语种的混缩。
支持30种语言与22种方言,可以处理多语种的混缩。
2:54.000–2:59.000
ja可以识别歌曲,执行速度很快,自带断句非常不错。
可以识别歌曲,执行速度很快,自带断句非常不错。
2:59.000–3:05.000
ja缺点是,装有名词识别不够稳定,断句有时会出现长句。
缺点是,装有名词识别不够稳定,断句有时会出现长句。
3:05.000–3:11.000
ja这是我测试下来综合能力最强的中文ASR模型,我会把它排在,憨爆了。
这是我测试下来综合能力最强的中文ASR模型,我会把它排在,憨爆了。
3:11.000–3:14.000
ja2026年ASR模型的第一选择。
2026年ASR模型的第一选择。
3:14.000–3:19.000
jaQuin3 ASR0.6B,非常好的小参数ASR模型。
Quin3 ASR0.6B,非常好的小参数ASR模型。
3:19.000–3:24.000
ja执行速度非常的快,可以适配大部分的电脑部署。
执行速度非常的快,可以适配大部分的电脑部署。
3:24.000–3:28.000
jaQuin3 ASR1.7B,大部分的优点它都有。
Quin3 ASR1.7B,大部分的优点它都有。
3:28.000–3:32.000
ja不足的是,识别的稳定性与专有名词的识别会相对差一些。
不足的是,识别的稳定性与专有名词的识别会相对差一些。
3:32.000–3:36.000
enQuin3 ASR0.6B,已经比Whisper好运很多了。
Quin3 ASR0.6B,已经比Whisper好运很多了。
3:36.000–3:39.000
ja我会把它还在顶级推荐你使用。
我会把它还在顶级推荐你使用。
3:39.000–3:43.000
jaKahir这个模型,我有一期视频专门测试过。
Kahir这个模型,我有一期视频专门测试过。
3:43.000–3:45.000
ja拉完了,别愿。
拉完了,别愿。
3:45.000–3:48.000
ja幻觉非常的严重,中文识别非常的糟糕。
幻觉非常的严重,中文识别非常的糟糕。
3:48.000–3:50.000
ja基本上是不可怨的。
基本上是不可怨的。
3:50.000–3:54.000
jaJLM ASRNANO,这是智朴发布的1.5B的模型。
JLM ASRNANO,这是智朴发布的1.5B的模型。
3:54.000–3:56.000
ja对数字的处理很好。
对数字的处理很好。
3:56.000–3:58.000
ja断句也非常的精准。
断句也非常的精准。
3:58.000–4:03.000
ja识别的准确度与稳定性,跟Quin3 ASR0.6B是差不多的。
识别的准确度与稳定性,跟Quin3 ASR0.6B是差不多的。
4:03.000–4:06.000
ja翻炎的识别上面会相对比较一般。
翻炎的识别上面会相对比较一般。
4:06.000–4:11.000
ja然后执行的速度上面是比Quin3 ASR0.6B慢挺多的。
然后执行的速度上面是比Quin3 ASR0.6B慢挺多的。
4:11.000–4:15.000
ja我会把它排在人上人,在Whisper的前面。
我会把它排在人上人,在Whisper的前面。
4:15.000–4:21.000
jaFireRed ASR2小红书发布的1款有特点的模型。
FireRed ASR2小红书发布的1款有特点的模型。
4:21.000–4:24.000
ja其实是1套可以分开使用的模型组合。
其实是1套可以分开使用的模型组合。
4:24.000–4:29.000
ja自动语音识别,语音活动检测,口语识别,和标点符号预测。
自动语音识别,语音活动检测,口语识别,和标点符号预测。
4:29.000–4:31.000
ja需要结合使用。
需要结合使用。
4:31.000–4:34.000
ja其中语音活动检测模型非常的好用。
其中语音活动检测模型非常的好用。
4:34.000–4:37.000
ja可以准确地识别歌曲中的语音。
可以准确地识别歌曲中的语音。
4:37.000–4:39.000
ja对幻觉的控制很好。
对幻觉的控制很好。
4:39.000–4:42.000
ja专有名词的错误率但是偏高。
专有名词的错误率但是偏高。
4:42.000–4:44.000
ja我会把它排在NPC。
我会把它排在NPC。
4:44.000–4:48.000
jaFire ASR nano对数字的处理非常的好。
Fire ASR nano对数字的处理非常的好。
4:48.000–4:52.000
ja断句与方言的识别是强于Quin3 ASR0.6B的。
断句与方言的识别是强于Quin3 ASR0.6B的。
4:52.000–4:55.000
en但稳定性不如Quin3 ASR0.6B。
但稳定性不如Quin3 ASR0.6B。
4:55.000–4:58.000
ja会有幻觉,会有肉词的情况。
会有幻觉,会有肉词的情况。
4:58.000–5:01.000
ja自带的字集时间戳,飘移非常的严重。
自带的字集时间戳,飘移非常的严重。
5:01.000–5:04.000
ja我会把它排在人上人。
我会把它排在人上人。
5:04.000–5:08.000
jaSense OIS特别适合移动端的部署。
Sense OIS特别适合移动端的部署。
5:08.000–5:10.000
ja体积很小,执行很快。
体积很小,执行很快。
5:10.000–5:13.000
ja但识别的准确率上面是比较一般的。
但识别的准确率上面是比较一般的。
5:13.000–5:15.000
ja肉词的问题挺严重的。
肉词的问题挺严重的。
5:15.000–5:16.000
ja需要自己处理标点。
需要自己处理标点。
5:16.000–5:20.000
ja当存从识别的准确率与稳定性的角度。
当存从识别的准确率与稳定性的角度。
5:20.000–5:22.000
ja我会把它排在NPC。
我会把它排在NPC。
5:22.000–5:26.000
ja接下来来看一下相同语音各个模型的准确率的情况。
接下来来看一下相同语音各个模型的准确率的情况。
5:26.000–5:32.000
ja可以看到Memo V2.5 ASR是现在中文识别准确率最高的模型。
可以看到Memo V2.5 ASR是现在中文识别准确率最高的模型。
5:32.000–5:35.000
en其次是Quin3 ASR1.7B。
其次是Quin3 ASR1.7B。
5:35.000–5:38.000
ja除了拉胯的Kohir模型,
除了拉胯的Kohir模型,
5:38.000–5:41.000
ja所有的模型的中文识别准确率都高于WESP。
所有的模型的中文识别准确率都高于WESP。
5:41.000–5:44.000
ja最后看一下多个维度的综合对比。
最后看一下多个维度的综合对比。
5:44.000–5:46.000
ja单维度满分是5分。
单维度满分是5分。
5:46.000–5:52.000
ja可以看到中文识别上面综合能力Memo V2.5 ASR是最好的。
可以看到中文识别上面综合能力Memo V2.5 ASR是最好的。
5:52.000–5:55.000
en其次是Quin3 ASR1.7B。
其次是Quin3 ASR1.7B。
5:55.000–5:58.000
jaMemo V2.5 ASR不熟的难度是很高的。
Memo V2.5 ASR不熟的难度是很高的。
5:58.000–6:03.000
ja2026年最推荐的中文ASR模型就是Quin3 ASR1.7B。
2026年最推荐的中文ASR模型就是Quin3 ASR1.7B。
6:03.000–6:07.000
ja方言识别最准的模型是Memo V2.5 ASR。
方言识别最准的模型是Memo V2.5 ASR。
6:07.000–6:11.000
ja歌曲识别最好的模型是Quin3 ASR1.7B。
歌曲识别最好的模型是Quin3 ASR1.7B。
6:11.000–6:13.000
ja以上就是视频的全部内容。
以上就是视频的全部内容。
6:13.000–6:15.000
ja我是浩叔,我们下一个视频见。
我是浩叔,我们下一个视频见。
6:15.000–6:15.861
ja我们下一个视频见。
我们下一个视频见。