{"text": "如果你再找一款適合于会议总结的ASR模型,需要说话能分割,精确的时间戳,自定义论时,查音频稳定转路。那么可以试一下新出的MOS Translator Dialize开源模型。浩叔因为需要在How One字幕软件中集成说话能分割与识别的功能,测试了市面上很多的技术方案,也包括了这款MOS新出的模型。整体体验下来是非常不错的。推荐给大家MOS Translator Dialize 0.9B模型,装为会议、通话、播客、访谈、讲座等内容而设计的,能够一次性转路产音频,自带说话能分割与句子的时间戳,还可以识别升学的事件。整体的架构上面使用Whatsp做音频编码器,千问3 0.6B做解码器。非大参数的模型,在识别的准确率上面是不如MIMO V2.5 ASR与千问3 ASR 1.7B的。好于千问3 ASR 0.6B模型,千问3 ASR 1.7B模型在准确率上面会比MOS高2%左右。MOS的方言处理能力是比较一般的,专用名词的识别也比较一般,必须配合热词的公布。优点是,短语保留完整,肉聚肉池的情况很少,原产语音的识别的能力是可以的,所以识别的稳定性上面还是非常不错的。下面是官方的三个指标的对比的一个情况。MOS对比WebOS ASR,SIMALINE,SANPOR,ELEVLABS跟DOUBAU都有更好的表现。WebOS ASR 7B是最适合MOS 0.9B对标的对象。两者都是开源的,功能也非常的相似。先说结论,经过多个中文语音的验证。MOS在中文识别的稳定性上面,说话能识别与分割的准确率上面要好于大参数的WebOS ASR。以一个难能杀的音频为例,包含了10个发言人,里面有很多的短句与插话,这是识别与分割上面的难点。下面是两个模型分别转录之后的对比表格。MOS明显好于WebOS ASR。WebOS ASR是一个对音频质量比较敏感的模型,容易出现幻觉。多次说话人切换的时候,MOS虽然也有归类的错误,但是分割是正确的,对短句的识别与分割非常的出色。而WebOS ASR会把这些句子都归类到一个说话人,几乎是不可怨的。再来看一个例子,155秒开始,有一个玩家开始长篇的发言。MOS会将主要的发言人标记为S06,别人插话的时候会切换成S02发言人。然后又能准确的回到主发言人S06。而WebOS ASR在被插画之后,后续的发言被识别成了新的发言人。总结一下,MOS TraceLabor Dialyze的说话人识别与分割是目前第一推队的水平,可能是2026年现阶段最适合中文会议总结的ASR模型。如果你有相关的需求,可以使愿试试。", "segments": [{"id": 0, "seek": 0, "start": 0.0, "end": 14.540000000000001, "text": "如果你再找一款適合于会议总结的ASR模型,需要说话能分割,精确的时间戳,自定义论时,查音频稳定转路。那么可以试一下新出的MOS Translator Dialize开源模型。", "tokens": [50365, 45669, 8623, 25085, 2257, 48798, 3330, 102, 14245, 37732, 12949, 7422, 106, 33440, 45641, 1546, 3160, 49, 41908, 39823, 11, 35748, 8090, 21596, 8225, 6627, 5935, 110, 11, 34910, 38114, 106, 1546, 44848, 1486, 111, 11, 9722, 12088, 2930, 231, 7422, 118, 15729, 11, 42623, 18034, 39752, 10415, 111, 12088, 17819, 105, 24658, 1543, 35693, 6723, 5233, 243, 8861, 12560, 7781, 1546, 44, 4367, 6531, 75, 1639, 29658, 1125, 18937, 47402, 41908, 39823, 1543, 51092], "temperature": 0, "avg_logprob": -0.2308066930526342, "compression_ratio": 0.9666666666666667, "no_speech_prob": 6.670336158420831e-12}, {"id": 1, "seek": 1454, "start": 14.54, "end": 44.3, "text": "浩叔因为需要在How One字幕软件中集成说话能分割与识别的功能,测试了市面上很多的技术方案,也包括了这款MOS新出的模型。整体体验下来是非常不错的。推荐给大家MOS Translator Dialize 0.9B模型,装为会议、通话、播客、访谈、讲座等内容而设计的,能够一次性转路产音频,自带说话能分割与句子的时间戳,还可以识别升学的事件。", "tokens": [50365, 11038, 102, 39936, 34627, 35748, 3581, 6462, 1485, 22381, 40211, 17819, 107, 20485, 5975, 26020, 11336, 8090, 21596, 8225, 6627, 5935, 110, 940, 236, 5233, 228, 18453, 1546, 32311, 8225, 11, 11038, 233, 5233, 243, 2289, 27261, 8833, 5708, 20778, 1546, 32502, 1474, 107, 9249, 28899, 11, 6404, 41828, 2289, 5562, 48798, 44, 4367, 12560, 7781, 1546, 41908, 39823, 1543, 27662, 29485, 29485, 49657, 234, 4438, 6912, 1541, 14392, 1960, 29900, 1546, 1543, 33597, 31409, 238, 23197, 6868, 44, 4367, 6531, 75, 1639, 29658, 1125, 1958, 13, 24, 33, 41908, 39823, 11, 8083, 227, 13992, 12949, 7422, 106, 1231, 19550, 21596, 1231, 49993, 32316, 1231, 7422, 123, 8897, 230, 1231, 39255, 6346, 100, 10187, 34742, 25750, 11070, 7422, 122, 7422, 94, 1546, 11, 8225, 1787, 253, 27505, 21686, 17819, 105, 24658, 1369, 100, 18034, 39752, 11, 9722, 4845, 99, 8090, 21596, 8225, 6627, 5935, 110, 940, 236, 34592, 7626, 1546, 44848, 1486, 111, 11, 14852, 6723, 5233, 228, 18453, 41670, 29618, 1546, 6973, 20485, 1543, 51853], "temperature": 0, "avg_logprob": -0.0932510012672061, "compression_ratio": 1.1861111111111111, "no_speech_prob": 8.07915106343371e-12}, {"id": 2, "seek": 4454, "start": 44.54, "end": 74.52, "text": "整体的架构上面使用Whatsp做音频编码器,千问3 0.6B做解码器。非大参数的模型,在识别的准确率上面是不如MIMO V2.5 ASR与千问3 ASR 1.7B的。好于千问3 ASR 0.6B模型,千问3 ASR 1.7B模型在准确率上面会比MOS高2%左右。MOS的方言处理能力是比较一般的,专用名词的识别也比较一般,必须配合热词的公布。", "tokens": [50365, 27662, 29485, 1546, 7360, 114, 7360, 226, 49750, 22982, 9254, 2471, 1720, 79, 10907, 18034, 39752, 38109, 244, 23230, 223, 34386, 11, 20787, 22064, 18, 1958, 13, 21, 33, 10907, 17278, 23230, 223, 34386, 1543, 12107, 3582, 2129, 224, 33188, 1546, 41908, 39823, 11, 3581, 5233, 228, 18453, 1546, 6336, 228, 38114, 106, 44866, 49750, 1541, 1960, 8238, 44, 6324, 46, 691, 17, 13, 20, 7469, 49, 940, 236, 20787, 22064, 18, 7469, 49, 502, 13, 22, 33, 1546, 1543, 2131, 37732, 20787, 22064, 18, 7469, 49, 1958, 13, 21, 33, 41908, 39823, 11, 20787, 22064, 18, 7469, 49, 502, 13, 22, 33, 41908, 39823, 3581, 6336, 228, 38114, 106, 44866, 49750, 12949, 11706, 44, 4367, 12979, 17, 4, 29457, 1543, 44, 4367, 1546, 9249, 12009, 1787, 226, 13876, 8225, 13486, 1541, 11706, 9830, 225, 2257, 49640, 1546, 11, 940, 241, 9254, 15940, 5233, 235, 1546, 5233, 228, 18453, 6404, 11706, 9830, 225, 2257, 49640, 11, 28531, 10178, 119, 38846, 14245, 23661, 255, 5233, 235, 1546, 13545, 34688, 1543, 51864], "temperature": 0, "avg_logprob": -0.1562902206598326, "compression_ratio": 1.3, "no_speech_prob": 2.3100313328860977e-11}, {"id": 3, "seek": 7454, "start": 74.54, "end": 84.54, "text": "优点是,短语保留完整,肉聚肉池的情况很少,原产语音的识别的能力是可以的,所以识别的稳定性上面还是非常不错的。", "tokens": [50365, 7384, 246, 12579, 1541, 11, 5881, 255, 5233, 255, 24302, 24456, 14128, 27662, 11, 31980, 8171, 248, 31980, 12800, 254, 1546, 46514, 4563, 15686, 11, 19683, 1369, 100, 5233, 255, 18034, 1546, 5233, 228, 18453, 1546, 8225, 13486, 1541, 6723, 1546, 11, 7239, 5233, 228, 18453, 1546, 10415, 111, 12088, 21686, 49750, 45726, 14392, 1960, 29900, 1546, 1543, 50865], "temperature": 0, "avg_logprob": -0.18002056306408298, "compression_ratio": 1.0694444444444444, "no_speech_prob": 1.7578268701745614e-11}, {"id": 4, "seek": 8454, "start": 84.54, "end": 102.54, "text": "下面是官方的三个指标的对比的一个情况。MOS对比WebOS ASR,SIMALINE,SANPOR,ELEVLABS跟DOUBAU都有更好的表现。WebOS ASR 7B是最适合MOS 0.9B对标的对象。两者都是开源的,功能也非常的相似。", "tokens": [50365, 47150, 1541, 31929, 9249, 1546, 10960, 7549, 25922, 162, 3921, 1546, 8713, 11706, 1546, 20182, 46514, 1543, 44, 4367, 8713, 11706, 4360, 65, 4367, 7469, 49, 11, 50, 6324, 3427, 16258, 11, 50, 1770, 47, 2483, 11, 36, 2634, 53, 11435, 8176, 9678, 35, 4807, 33, 2340, 48121, 19002, 20715, 17571, 20204, 1543, 4360, 65, 4367, 7469, 49, 1614, 33, 1541, 8661, 2215, 224, 14245, 44, 4367, 1958, 13, 24, 33, 8713, 162, 3921, 1546, 8713, 45007, 1543, 36257, 12444, 22796, 18937, 47402, 1546, 11, 32311, 8225, 6404, 48263, 15106, 7384, 120, 1543, 51265], "temperature": 0, "avg_logprob": -0.31014900600787293, "compression_ratio": 1.0943396226415094, "no_speech_prob": 1.5096127473079868e-11}, {"id": 5, "seek": 10254, "start": 102.54, "end": 114.54, "text": "先说结论,经过多个中文语音的验证。MOS在中文识别的稳定性上面,说话能识别与分割的准确率上面要好于大参数的WebOS ASR。", "tokens": [50365, 10108, 8090, 45641, 7422, 118, 11, 30276, 16866, 6392, 7549, 5975, 17174, 5233, 255, 18034, 1546, 49657, 234, 5233, 223, 1543, 44, 4367, 3581, 5975, 17174, 5233, 228, 18453, 1546, 10415, 111, 12088, 21686, 49750, 11, 8090, 21596, 8225, 5233, 228, 18453, 940, 236, 6627, 5935, 110, 1546, 6336, 228, 38114, 106, 44866, 49750, 4275, 2131, 37732, 3582, 2129, 224, 33188, 1546, 4360, 65, 4367, 7469, 49, 1543, 50965], "temperature": 0, "avg_logprob": -0.08056967125998603, "compression_ratio": 1.0125786163522013, "no_speech_prob": 1.3311468247123592e-11}, {"id": 6, "seek": 11454, "start": 114.54, "end": 137.54000000000002, "text": "以一个难能杀的音频为例,包含了10个发言人,里面有很多的短句与插话,这是识别与分割上面的难点。下面是两个模型分别转录之后的对比表格。MOS明显好于WebOS ASR。WebOS ASR是一个对音频质量比较敏感的模型,容易出现幻觉。", "tokens": [50365, 3588, 20182, 46531, 8225, 4422, 222, 1546, 18034, 39752, 13992, 17797, 11, 23305, 2392, 104, 2289, 3279, 7549, 28926, 12009, 4035, 11, 15759, 8833, 2412, 20778, 1546, 5881, 255, 34592, 940, 236, 11673, 240, 21596, 11, 27455, 5233, 228, 18453, 940, 236, 6627, 5935, 110, 49750, 1546, 46531, 12579, 1543, 47150, 1541, 36257, 7549, 41908, 39823, 6627, 18453, 17819, 105, 7391, 243, 9574, 13547, 1546, 8713, 11706, 17571, 30921, 1543, 44, 4367, 11100, 1431, 122, 2131, 37732, 4360, 65, 4367, 7469, 49, 1543, 4360, 65, 4367, 7469, 49, 1541, 20182, 8713, 18034, 39752, 18464, 101, 26748, 11706, 9830, 225, 7017, 237, 9709, 1546, 41908, 39823, 11, 49212, 7781, 20204, 3509, 119, 24447, 1543, 51515], "temperature": 0, "avg_logprob": -0.08012549082438152, "compression_ratio": 1.159362549800797, "no_speech_prob": 1.3636317769405437e-11}, {"id": 7, "seek": 13754, "start": 137.54, "end": 147.54, "text": "多次说话人切换的时候,MOS虽然也有归类的错误,但是分割是正确的,对短句的识别与分割非常的出色。", "tokens": [50365, 6392, 9487, 8090, 21596, 4035, 23632, 26075, 95, 49873, 11, 44, 4367, 12026, 121, 5823, 6404, 2412, 7391, 240, 22113, 119, 1546, 29900, 5233, 107, 11, 11189, 6627, 5935, 110, 1541, 15789, 38114, 106, 1546, 11, 8713, 5881, 255, 34592, 1546, 5233, 228, 18453, 940, 236, 6627, 5935, 110, 48263, 7781, 17673, 1543, 50865], "temperature": 0, "avg_logprob": -0.06753991943558836, "compression_ratio": 1.2789115646258504, "no_speech_prob": 1.3734606334192545e-11}, {"id": 8, "seek": 13754, "start": 147.54, "end": 153.54, "text": "而WebOS ASR会把这些句子都归类到一个说话人,几乎是不可怨的。", "tokens": [50865, 11070, 4360, 65, 4367, 7469, 49, 12949, 16075, 5562, 13824, 34592, 7626, 7182, 7391, 240, 22113, 119, 4511, 20182, 8090, 21596, 4035, 11, 6336, 254, 2930, 236, 1541, 1960, 4429, 3757, 101, 1546, 1543, 51165], "temperature": 0, "avg_logprob": -0.06753991943558836, "compression_ratio": 1.2789115646258504, "no_speech_prob": 1.3734606334192545e-11}, {"id": 9, "seek": 13754, "start": 153.54, "end": 166.54, "text": "再来看一个例子,155秒开始,有一个玩家开始长篇的发言。MOS会将主要的发言人标记为S06,别人插话的时候会切换成S02发言人。", "tokens": [51165, 8623, 6912, 4200, 20182, 17797, 7626, 11, 5211, 20, 20956, 45213, 11, 2412, 20182, 19912, 5155, 45213, 32271, 20878, 229, 1546, 28926, 12009, 1543, 44, 4367, 12949, 45456, 13557, 4275, 1546, 28926, 12009, 4035, 162, 3921, 34756, 13992, 50, 12791, 11, 18453, 4035, 11673, 240, 21596, 49873, 12949, 23632, 26075, 95, 11336, 50, 12756, 28926, 12009, 4035, 1543, 51815], "temperature": 0, "avg_logprob": -0.06753991943558836, "compression_ratio": 1.2789115646258504, "no_speech_prob": 1.3734606334192545e-11}, {"id": 10, "seek": 16654, "start": 166.54, "end": 171.54, "text": "然后又能准确的回到主发言人S06。", "tokens": [50365, 26636, 17047, 8225, 6336, 228, 38114, 106, 1546, 8350, 4511, 13557, 28926, 12009, 4035, 50, 12791, 1543, 50615], "temperature": 0, "avg_logprob": -0.12432003021240234, "compression_ratio": 1.136518771331058, "no_speech_prob": 1.567386498368961e-11}, {"id": 11, "seek": 16654, "start": 171.54, "end": 177.54, "text": "而WebOS ASR在被插画之后,后续的发言被识别成了新的发言人。", "tokens": [50615, 11070, 4360, 65, 4367, 7469, 49, 3581, 23238, 11673, 240, 27126, 9574, 13547, 11, 13547, 10115, 255, 1546, 28926, 12009, 23238, 5233, 228, 18453, 11336, 2289, 12560, 1546, 28926, 12009, 4035, 1543, 50915], "temperature": 0, "avg_logprob": -0.12432003021240234, "compression_ratio": 1.136518771331058, "no_speech_prob": 1.567386498368961e-11}, {"id": 12, "seek": 16654, "start": 177.54, "end": 190.54, "text": "总结一下,MOS TraceLabor Dialyze的说话人识别与分割是目前第一推队的水平,可能是2026年现阶段最适合中文会议总结的ASR模型。", "tokens": [50915, 33440, 45641, 8861, 11, 44, 4367, 1765, 617, 43, 3816, 29658, 88, 1381, 1546, 8090, 21596, 4035, 5233, 228, 18453, 940, 236, 6627, 5935, 110, 1541, 39004, 18049, 33597, 10034, 253, 1546, 15590, 16716, 11, 16657, 1541, 2009, 10880, 5157, 20204, 10034, 114, 28427, 8661, 2215, 224, 14245, 5975, 17174, 12949, 7422, 106, 33440, 45641, 1546, 3160, 49, 41908, 39823, 1543, 51565], "temperature": 0, "avg_logprob": -0.12432003021240234, "compression_ratio": 1.136518771331058, "no_speech_prob": 1.567386498368961e-11}, {"id": 13, "seek": 16654, "start": 190.54, "end": 194.54, "text": "如果你有相关的需求,可以使愿试试。", "tokens": [51565, 13119, 43320, 15106, 28053, 1546, 32535, 32718, 11, 6723, 22982, 4820, 123, 5233, 243, 5233, 243, 1543, 51765], "temperature": 0, "avg_logprob": -0.12432003021240234, "compression_ratio": 1.136518771331058, "no_speech_prob": 1.567386498368961e-11}], "language": "zh"}