如果你再找一款適合于会议总结的ASR模型,需要说话能分割,精确的时间戳,自定义论时,查音频稳定转路。那么可以试一下新出的MOS Translator Dialize开源模型。 浩叔因为需要在How One字幕软件中集成说话能分割与识别的功能,测试了市面上很多的技术方案,也包括了这款MOS新出的模型。整体体验下来是非常不错的。推荐给大家MOS Translator Dialize 0.9B模型,装为会议、通话、播客、访谈、讲座等内容而设计的,能够一次性转路产音频,自带说话能分割与句子的时间戳,还可以识别升学的事件。 整体的架构上面使用Whatsp做音频编码器,千问3 0.6B做解码器。非大参数的模型,在识别的准确率上面是不如MIMO V2.5 ASR与千问3 ASR 1.7B的。好于千问3 ASR 0.6B模型,千问3 ASR 1.7B模型在准确率上面会比MOS高2%左右。MOS的方言处理能力是比较一般的,专用名词的识别也比较一般,必须配合热词的公布。 优点是,短语保留完整,肉聚肉池的情况很少,原产语音的识别的能力是可以的,所以识别的稳定性上面还是非常不错的。 下面是官方的三个指标的对比的一个情况。MOS对比WebOS ASR,SIMALINE,SANPOR,ELEVLABS跟DOUBAU都有更好的表现。WebOS ASR 7B是最适合MOS 0.9B对标的对象。两者都是开源的,功能也非常的相似。 先说结论,经过多个中文语音的验证。MOS在中文识别的稳定性上面,说话能识别与分割的准确率上面要好于大参数的WebOS ASR。 以一个难能杀的音频为例,包含了10个发言人,里面有很多的短句与插话,这是识别与分割上面的难点。下面是两个模型分别转录之后的对比表格。MOS明显好于WebOS ASR。WebOS ASR是一个对音频质量比较敏感的模型,容易出现幻觉。 多次说话人切换的时候,MOS虽然也有归类的错误,但是分割是正确的,对短句的识别与分割非常的出色。 而WebOS ASR会把这些句子都归类到一个说话人,几乎是不可怨的。 再来看一个例子,155秒开始,有一个玩家开始长篇的发言。MOS会将主要的发言人标记为S06,别人插话的时候会切换成S02发言人。 然后又能准确的回到主发言人S06。 而WebOS ASR在被插画之后,后续的发言被识别成了新的发言人。 总结一下,MOS TraceLabor Dialyze的说话人识别与分割是目前第一推队的水平,可能是2026年现阶段最适合中文会议总结的ASR模型。 如果你有相关的需求,可以使愿试试。