0:00.000–0:07.940
你敢信吗?微软最新一篇论文把一个2.47GB的语音识别模型硬塞到了670Mbps,准确率几乎没掉。
0:09.160–0:15.180
故事是这样的,一直以来,做端侧语音识别有四道坎,模型小,速度快,延迟低,还得准。
0:15.700–0:21.460
这四个几乎不可能同时满足,要么云端调API泄露隐私,要么本地跑的卡成PPT。
0:21.460–0:30.060
微软团队拉通测了50多种配置,结果挖到一个反常识的事实,P处理跑分最高的模型,到了流处理场景直接崩。
0:30.760–0:38.020
QWN3ASRP处理只有5.9%的词错率,切到2.4秒分块后,直接标到10.45%,几乎翻倍。
0:39.280–0:45.540
真正的赢家是英伟达的Nemotron,这个模型最大的特点是缓存感知架构,天生为实时识别而生。
0:45.540–0:50.060
它能记住前面5.6秒的历史信息,每次只处理0.56秒的新音频。
0:50.580–0:53.120
从P处理切到10时,准确率几乎没掉。
0:54.480–1:02.220
选完模型只是开始,微软把整个推理管线用ONEX ROM10重写了一遍,把模型拆成编码器、解码器、Joyner三块独立优化。
1:02.380–1:08.520
最关键的一招是Int 4K Quant量化,不是简单的四舍五入,而是按权重重要性加权重建。
1:09.800–1:14.440
最终结果,模型从2.47G压到670米,体积少了73%,
1:14.440–1:19.160
平均词错率8.2%,相比FP32只退化了0.17个百分点。
1:19.660–1:23.080
CPU上跑得比实时快6倍多,算法延迟0.56秒。
1:23.420–1:28.140
这套方案已经在微软Foundry Local平台开源,端测语音识别这事儿真要起飞了。
0:00.000–0:07.940
你敢信吗?微软最新一篇论文把一个2.47GB的语音识别模型硬塞到了670Mbps,准确率几乎没掉。
0:09.160–0:15.180
故事是这样的,一直以来,做端侧语音识别有四道坎,模型小,速度快,延迟低,还得准。
0:15.700–0:21.460
这四个几乎不可能同时满足,要么云端调API泄露隐私,要么本地跑的卡成PPT。
0:21.460–0:30.060
微软团队拉通测了50多种配置,结果挖到一个反常识的事实,P处理跑分最高的模型,到了流处理场景直接崩。
0:30.760–0:38.020
QWN3ASRP处理只有5.9%的词错率,切到2.4秒分块后,直接标到10.45%,几乎翻倍。
0:39.280–0:45.540
真正的赢家是英伟达的Nemotron,这个模型最大的特点是缓存感知架构,天生为实时识别而生。
0:45.540–0:50.060
它能记住前面5.6秒的历史信息,每次只处理0.56秒的新音频。
0:50.580–0:53.120
从P处理切到10时,准确率几乎没掉。
0:54.480–1:02.220
选完模型只是开始,微软把整个推理管线用ONEX ROM10重写了一遍,把模型拆成编码器、解码器、Joyner三块独立优化。
1:02.380–1:08.520
最关键的一招是Int 4K Quant量化,不是简单的四舍五入,而是按权重重要性加权重建。
1:09.800–1:14.440
最终结果,模型从2.47G压到670米,体积少了73%,
1:14.440–1:19.160
平均词错率8.2%,相比FP32只退化了0.17个百分点。
1:19.660–1:23.080
CPU上跑得比实时快6倍多,算法延迟0.56秒。
1:23.420–1:28.140
这套方案已经在微软Foundry Local平台开源,端测语音识别这事儿真要起飞了。
0:00.000–0:07.940
你敢信吗?微软最新一篇论文把一个2.47GB的语音识别模型硬塞到了670Mbps,准确率几乎没掉。
你敢信吗?微软最新一篇论文把一个2.47GB的语音识别模型硬塞到了670Mbps,准确率几乎没掉。
0:09.160–0:15.180
故事是这样的,一直以来,做端侧语音识别有四道坎,模型小,速度快,延迟低,还得准。
故事是这样的,一直以来,做端侧语音识别有四道坎,模型小,速度快,延迟低,还得准。
0:15.700–0:21.460
这四个几乎不可能同时满足,要么云端调API泄露隐私,要么本地跑的卡成PPT。
这四个几乎不可能同时满足,要么云端调API泄露隐私,要么本地跑的卡成PPT。
0:21.460–0:30.060
微软团队拉通测了50多种配置,结果挖到一个反常识的事实,P处理跑分最高的模型,到了流处理场景直接崩。
微软团队拉通测了50多种配置,结果挖到一个反常识的事实,P处理跑分最高的模型,到了流处理场景直接崩。
0:30.760–0:38.020
QWN3ASRP处理只有5.9%的词错率,切到2.4秒分块后,直接标到10.45%,几乎翻倍。
QWN3ASRP处理只有5.9%的词错率,切到2.4秒分块后,直接标到10.45%,几乎翻倍。
0:39.280–0:45.540
真正的赢家是英伟达的Nemotron,这个模型最大的特点是缓存感知架构,天生为实时识别而生。
真正的赢家是英伟达的Nemotron,这个模型最大的特点是缓存感知架构,天生为实时识别而生。
0:45.540–0:50.060
它能记住前面5.6秒的历史信息,每次只处理0.56秒的新音频。
它能记住前面5.6秒的历史信息,每次只处理0.56秒的新音频。
0:50.580–0:53.120
从P处理切到10时,准确率几乎没掉。
从P处理切到10时,准确率几乎没掉。
0:54.480–1:02.220
选完模型只是开始,微软把整个推理管线用ONEX ROM10重写了一遍,把模型拆成编码器、解码器、Joyner三块独立优化。
选完模型只是开始,微软把整个推理管线用ONEX ROM10重写了一遍,把模型拆成编码器、解码器、Joyner三块独立优化。
1:02.380–1:08.520
最关键的一招是Int 4K Quant量化,不是简单的四舍五入,而是按权重重要性加权重建。
最关键的一招是Int 4K Quant量化,不是简单的四舍五入,而是按权重重要性加权重建。
1:09.800–1:14.440
最终结果,模型从2.47G压到670米,体积少了73%,
最终结果,模型从2.47G压到670米,体积少了73%,
1:14.440–1:19.160
平均词错率8.2%,相比FP32只退化了0.17个百分点。
平均词错率8.2%,相比FP32只退化了0.17个百分点。
1:19.660–1:23.080
CPU上跑得比实时快6倍多,算法延迟0.56秒。
CPU上跑得比实时快6倍多,算法延迟0.56秒。
1:23.420–1:28.140
这套方案已经在微软Foundry Local平台开源,端测语音识别这事儿真要起飞了。
这套方案已经在微软Foundry Local平台开源,端测语音识别这事儿真要起飞了。