# 影片筆記:锐评2026年 ASR 开源模型,中文识别准确率与稳定性最好的模型是... ## 一句話總結 影片評測了 2026 年多款支援中文的 ASR 開源模型,結論指出 **Quin3 ASR 1.7B** 為綜合能力最強、穩定性高且執行速度快的首選模型;**Memo V2.5 ASR** 準確率最高但體積龐大;而 Whisper 則被排在較低順位。 ## 核心重點 1. **評測目標**:尋找 2026 年可替代 Whisper 的中文 ASR 模型,重點評估中文識別準確率、穩定性、方言識別、歌曲識別及專有名詞處理能力。 2. **評測方法**:使用自製 Benchmark 程序及包含複雜語音、計算機術語與大量數字的中文字測試音頻數據集進行逐一轉錄與報告生成。 3. **模型排名與推薦**: * **首選推薦**:**Quin3 ASR 1.7B**(評級:憨爆了/2026 年第一選擇)。具備高準確率與穩定性,不易幻覺,支持多語言與方言,執行速度快。 * **頂級表現**:**Memo V2.5 ASR**(評級:頂級)。中文轉入最強,方言與歌曲識別最佳,但參數量大(8B)、執行慢。**Web Voice ASR**(評級:頂級)。專有名詞識別最好,但複雜場景易出現幻覺與格式不穩定。 * **特定場景推薦**:方言識別最準為 Memo V2.5 ASR;歌曲識別最好為 Quin3 ASR 1.7B。 * **Whisper 定位**:講者將 Whisper 排在「人上人」位置(註:根據上下文推測為相對較低或需謹慎使用的順位,具體評級詞彙保留原樣)。 4. **綜合結論**:除 Kahir 外,其他模型中文識別準確率均高於 Whisper。Memo V2.5 ASR 綜合能力最好,Quin3 ASR 1.7B 次之。 ## 詳細大綱 ### 1. 評測背景與方法論 * **目標**:尋找 2026 年可替代 Whisper 的中文 ASR 模型。 * **工具**:自製 Benchmark 程序、祖傳中文測試音頻數據集(一半以上為複雜語音)。 * **測試維度**:轉錄準確率、翻譯識別、計算機術語與數字識別、歌曲識別、斷句穩定性、方言識別。 ### 2. 各模型詳細評測與排名 #### 第一梯隊:頂級與推薦 * **Memo V2.5 ASR** * **優點**:中文轉入最強,方言與歌曲識別最佳,克服 Whisper 多數缺點。 * **缺點**:8B 參數量,體積巨大,執行慢。 * **排名**:頂級。 * **Web Voice ASR (7B)** * **優點**:專有名詞識別最好,支持 50 種語言,功能全面(長音頻轉錄、說話人分割、段落時間戳、自定義詞彙)。 * **缺點**:複雜場景易幻覺、重複文字、JSON 格式輸出不穩定、中文斷句不穩定、方言識別一般。 * **排名**:頂級。 * **雜草 ASR 1.7B** * **優點**:強烈推薦,中文識別準確率高且穩定,不易幻覺,支持 30 種語言與 22 種方言,處理多語種混縮,歌曲識別,執行速度快,斷句不錯。 * **缺點**:專有名詞識別不穩定,斷句有時長句。 * **排名**:憨爆了(2026 年第一選擇)。 * **Quin3 ASR 1.7B** * **優點**:具備 Quin3 ASR 0.6B 大部分優點,識別穩定性與專有名詞識別相對較差(註:此處筆記描述似有矛盾,原文提及 Quin3 ASR 1.7B 為推薦,但此處描述缺點,需參考疑點或逐字稿確認,筆記中列為頂級推薦)。 * **排名**:頂級推薦。 #### 第二梯隊:人上人(Whisper 前面/附近) * **WASP** * **優點**:生態豐富。 * **缺點**:中文識別準確度與穩定性不足,易出現幻覺、漏詞、亂補詞、中英混縮錯誤、繁體中文輸出、專有名詞識別不准、斷句不穩定、歌曲識別偏移嚴重。 * **排名**:人上人。 * **JLM ASR NANO** * **背景**:智朴發布,1.5B 參數。 * **優點**:數字處理好,斷句精準,準確度與穩定性同 Quin3 ASR 0.6B。 * **缺點**:方言識別一般,執行速度較慢。 * **排名**:人上人(Whisper 前面)。 * **Fire ASR nano** * **優點**:數字處理好,斷句與方言識別強於 Quin3 ASR 0.6B。 * **缺點**:穩定性較差,有幻覺與肉詞,時間戳偏移嚴重。 * **排名**:人上人。 #### 第三梯隊:NPC(不推薦或特定用途) * **Quin3 ASR 0.6B** * **特點**:小參數,執行速度快,适配大部分電腦部署。 * **Kahir** * **缺點**:幻覺嚴重,中文識別糟糕,基本不可用。 * **FireRed ASR** * **背景**:小紅書發布,由多個模型組合(ASR、VAD、口語識別、標點預測)。 * **優點**:VAD 模型好用,歌曲識別準確,幻覺控制好。 * **缺點**:專有名詞錯誤率高。 * **排名**:NPC。 * **Sense OIS** * **優點**:適合移動端,體積小,執行快。 * **缺點**:準確率一般,肉詞問題嚴重,需自行處理標點。 * **排名**:NPC。 ### 3. 綜合對比與結論 * **準確率對比**:Memo V2.5 ASR 最高,Quin3 ASR 1.7B 次之。除 Kahir 外,其他模型中文識別準確率均高於 Whisper。 * **綜合評分**:單維度滿分 5 分,Memo V2.5 ASR 綜合能力最好,Quin3 ASR 1.7B 次之。 * **最終推薦**:2026 年最推薦中文 ASR 模型為 Quin3 ASR 1.7B。 ## 工具 / 模型 / 名詞整理 * **ASR 模型/產品**: * WASP (或 WESP) * Memo V2.5 ASR * Web Voice ASR * 雜草 ASR 1.7B * Quin3 ASR 0.6B * Quin3 ASR 1.7B * Kahir * JLM ASR NANO * FireRed ASR * Fire ASR nano * Sense OIS * Whisper * **技術/功能名稱**: * Benchmark 程序 * 祖傳中文測試音頻數據集 * 語音活動檢測 (VAD) * 口語識別 * 標點符號預測 * JSON 格式 (或 Jesion 格式) * 詞集時間戳 (或字集時間戳) * 段落時間戳 * 說話人分割 * 量化 * **其他**: * 智朴 (JLM ASR NANO 發布方) * 小紅書 (FireRed ASR 發布方) * 浩叔 (講者) * 評級用語:人上人、憨爆了、NPC、拉胯、不可怨、拉完了, 别愿 ## 操作流程整理 1. **準備測試數據**:使用包含複雜語音、計算機術語與大量數字的中文字測試音頻數據集(祖傳數據集)。 2. **執行 Benchmark**:使用自製 Benchmark 程序對各 ASR 模型進行逐一轉錄。 3. **生成報告**:生成轉錄報告,評估準確率、翻譯識別、術語與數字識別、歌曲識別、斷句穩定性、方言識別等維度。 4. **綜合評分**:根據單維度滿分 5 分的標準進行綜合評分。 5. **排名與推薦**:根據評測結果進行排名,並針對不同場景(如方言、歌曲)與綜合需求給出推薦模型。 ## 值得注意的限制或風險 1. **模型參數與效能權衡**:高準確率模型(如 Memo V2.5 ASR)往往參數量大(8B),導致執行速度慢;小參數模型(如 Quin3 ASR 0.6B)執行快但穩定性與專有名詞識別較差。 2. **特定場景表現不佳**: * WASP 在中文識別準確度與穩定性上不足,易出現幻覺、漏詞、亂補詞。 * Web Voice ASR 在複雜場景下易出現幻覺、重複文字及 JSON 格式輸出不穩定。 * Fire ASR nano 穩定性較差,有幻覺與肉詞,時間戳偏移嚴重。 * Sense OIS 準確率一般,肉詞問題嚴重。 * Kahir 中文識別糟糕,基本不可用。 3. **專有名詞識別挑戰**:多個模型(如 WASP, FireRed ASR, 雜草 ASR)在專有名詞識別上表現不穩定或錯誤率高。 4. **斷句與時間戳問題**:部分模型存在斷句不穩定、時間戳偏移(飄移)或長句斷句問題。 ## 逐字稿辨識疑點 * **WESP / WASP**:逐字稿中交替出現「WESP」與「WASP」,疑為同一模型名稱聽寫錯誤或口誤。 * **瑞評**:疑為「評測」或「推薦」之聽寫錯誤。 * **願意計要**:語意不明,疑為「願意計算」或特定術語之聽寫錯誤。 * **異于極城**:語意不明,疑為「易於集成」或「異於極致」等詞之聽寫錯誤。 * **人上人 / 憨爆了 / NPC**:評級用詞,疑為講者自創或特定社群用語,保留原樣。 * **Memo V2.5 ASR**:模型名稱,保留原樣。 * **Web Voice ASR**:模型名稱,保留原樣。 * **Jesion 格式**:疑為「JSON 格式」之聽寫錯誤。 * **雜草 ASR**:模型名稱,保留原樣。 * **裝有名詞**:疑為「專有名詞」之聽寫錯誤。 * **拉完了, 别愿**:語意不明,疑為「拉胯了,別用」或類似評價之聽寫錯誤。 * **不可怨**:疑為「不可用」之聽寫錯誤。 * **智朴**:公司或品牌名稱,保留原樣。 * **翻炎**:疑為「方言」之聽寫錯誤。 * **肉詞**:疑為「漏詞」或「冗詞」之聽寫錯誤。 * **字集時間戳**:疑為「詞集時間戳」或「時間戳」之聽寫錯誤。 * **飄移**:疑為「偏移」之聽寫錯誤。 * **當存從**:語意不明,疑為「從...角度」或「從...來看」之聽寫錯誤。 * **拉胯**:形容詞,保留原樣。 * **不熟的難度**:語意不明,疑為「部署的難度」或「使用的難度」之聽寫錯誤。 ## 可延伸追問 1. Quin3 ASR 1.7B 與 Quin3 ASR 0.6B 在具體性能指標上的差異為何? 2. Memo V2.5 ASR 的 8B 參數量對硬體部署有何具體要求? 3. Web Voice ASR 的 JSON 格式輸出不穩定具體表現為何?是否有解決方案? 4. 「祖傳中文測試音頻數據集」的具體構成與來源為何? 5. 講者提到的「人上人」、「憨爆了」、「NPC」等評級標準的具體定義為何?