# 影片筆記:本地语音 AI 又升级了!10个新模型、GGUF量化、流式ASR语音输入|audio.cpp ## 一句話總結 Audio CPP 進行重大升級,新增 10 個模型(總計支持 30 個語音模型),支援 GGUF 量化以降低顯存佔用,並提供繁體中文介面。影片演示了如何利用該工具開發「語音輸入法」,涵蓋了從模型下載、量化轉換到實際應用開發的完整流程。 ## 核心重點 1. **模型擴充與多語言支援**: * Audio CPP 新增 10 個模型,總計完整支持 30 個語音模型。 * 涵蓋 TTS(文字轉語音)與 ASR(語音轉文字)兩大領域。 * 介面新增繁體中文與英文支援。 2. **GGUF 量化技術**: * 內建模型量化轉換功能,將模型轉換為 GGUF 格式。 * 優點:大幅降低顯存佔用,使低顯存設備或無顯卡機器(使用 CPU)運行成為可能。 * 機制:當存在 GGUF 文件時,後台服務優先加載量化版;若不想使用,可轉換恢復原始權重。 3. **新模型特性與限制**: * **TTS 方面**: * **Index TTS2**:支持從文本內容推斷語氣(情感參考文本),但較吃顯存。 * **Supertonic3**:速度快,支持流式合成(Streaming),但不支援中文。 * **Vox CP-M2**:目前僅此模型支援中文流式合成,但效果仍在優化,首次延遲高且有卡頓。 * **ASR 方面**: * **千問 3 ASR 1.7B**:中文轉寫準確率相當高。 * **Vib Voice ASR**:能力更強,支持多人對話,需足夠顯存。 * **Limotron 3.5 ASR 0.6B**:速度快,但中文識別準確率較差;支持離線和流式轉寫,適合語音輸入場景。 4. **應用落地實戰(語音輸入法)**: * 開發流程簡便:撰寫需求 -> 交給 Codex 生成代碼 -> 服務端調用 Audio CPP -> 前端處理顯示。 * 開發耗時約半小時,調試約 10 分鐘。 * 操作方式:按住 `Ctrl` + `Shift` + `空格` 打開麥克風,在文本編輯軟件中說話即可直接轉寫。 5. **整合包升級與模型下載機制**: * 升級方式:新安裝下載完整版,舊版升級下載升級包覆蓋原目錄。 * 模型下載:必須從 Hugging Face 下載,不支持手動放置模型。 * 特殊模型:部分模型(如 Stable Audio 系列)需申請權限並設置 Token。 * 下載過程:支持斷點續傳,完成後程序自動創建文件夾並自檢完整性。 ## 詳細大綱 ### I. 升級概覽與新功能 * **版本更新**:Audio CPP 進行大升級,新增 10 個模型,支持 GGUF 量化版加載。 * **介面變更**: * 新增多語言支持(繁體中文、英文)。 * 新增內置音頻管理功能(上傳參考音頻與文本保存)。 * 新增模型量化管理功能。 * **應用案例**:演示了基於 Audio CPP 開發的語音輸入法。 ### II. 新增 TTS 模型介紹 * **Index TTS2**: * **特點**:支持從文本內容推斷語氣的聲音合成。 * **操作**:在高級參數填寫「情感參考文本」,模型會根據文本情緒合成語音(如憤怒、失望)。 * **參數調整**:可調整「情感強度」(如 0.8)。 * **推斷模式**:若無情感參考文本,可勾選「從朗讀文本推斷」。 * **注意事項**:較吃顯存,低顯存建議使用 MOS 系列或千問 3 TTS 0.6b。 * **Supertonic3**: * **特點**:速度快,支持流式合成(Streaming)。 * **操作**:切換至流式模式。 * **注意事項**: * 首次合成需重載後台服務,有加載時間,建議先用短文本預熱。 * **不支持中文**。 * 中文流式合成目前僅 Vox CP-M2 支持,但效果仍在優化,首次延遲高且有卡頓。 * **優勢**:長文本合成可邊合成邊輸出,無需等待全部結束。 ### III. 新增 ASR 模型介紹 * **模型對比與推薦**: * **中文轉寫推薦**:千問 3 ASR 1.7B(準確率相當高)。 * **高性能推薦**:Vib Voice ASR(能力更強,支持多人對話,需足夠顯存)。 * **速度推薦**:Limotron 3.5 ASR 0.6B(速度快,但中文識別準確率較差)。 * **Limotron 3.5 ASR 0.6B 特性**: * 同時支持離線和流式轉寫。 * 勾選「流式轉寫」可邊識別邊吐字,適合語音輸入、即時對話場景。 * 本地語音輸入法即基於此模型開發。 ### IV. 語音輸入法開發實戰 * **開發流程**: 1. 撰寫大致需求描述。 2. 交給 **Codex** 生成代碼。 3. 服務端直接調用 Audio CPP 服務。 4. 代碼僅需處理語音輸入發送與顯示層。 5. 開發耗時約半小時,調試約 10 分鐘。 * **使用步驟**: 1. 啟動 Run Server ASR Stream 服務。 2. 運行 Speak Type。 3. 按住 `Ctrl` + `Shift` + `空格` 打開麥克風。 4. 將光標置於文本編輯軟件(如記事本、Obsidian)中說話,內容直接轉寫。 * **定位說明**:此程序為 DEMO,旨在驗證 Audio CPP 開發落地應用(如 WebUI、即時語音對話、OpenAI 風格 API、瀏覽器擴展等)的可能性。 ### V. 介面功能詳細說明 * **語言切換**:右上角語言支持繁體和英文,切換時約有 1-2 秒延時。 * **音頻管理**: * 上傳參考音頻並寫入對應文本。 * 點擊保存後自動存入內置音頻列表。 * 可選中刪除不用的音頻。 * **GGUF 量化管理**: * **功能**:將模型轉換為 GGUF 格式。 * **優點**:顯存佔用更小;無顯卡機器使用 CPU 運行量化版速度更快。 * **案例**:VibeOS ASR 原始模型需 16G 顯存,轉為 Q4 量化版後 8G 顯存即可運行。 * **限制**: * Audio CPP 不支持其他框架轉換的 GGUF。 * 僅部分模型可轉換(列表中有提示)。 * 大參數模型轉換耗時長(約 20 多分鐘)。 * **加載邏輯**:當存在 GGUF 文件時,後台服務優先加載量化版。 * **還原**:量化版不想用可直接轉換恢復原始權重。 ### VI. 整合包升級與模型下載 * **升級方式**: * **新安裝**:下載新版完整版整合包。 * **舊版升級**:下載升級包,解壓後複製所有文件覆蓋原整合包目錄。 * **未來更新**:點擊 Update,程序自動檢測並下載新版本。 * **啟動流程**:雙擊 Run WebUI,首次啟動需等待幾十秒加載,隨後自動打開網頁。 * **模型下載機制**: * **來源**:必須從 Hugging Face 下載,不支持手動放置模型。 * **網絡問題**:國內下載受阻可填寫代理地址。 * **特殊模型申請**: * 部分模型(如 Stable Audio 系列)需在 Hugging Face 申請權限。 * **步驟**:註冊免費帳號 -> 填寫申請表單 -> 通過後在頭像菜單底部訪問 Token -> 創建新 Token(選讀) -> 複製 Token 粘貼至 WebUI Token 框。 * **下載過程**: * 在 `Modus` 目錄下創建臨時下載目錄。 * 支持斷點續傳(中斷後繼續點擊下載)。 * 下載完成後程序自動創建/重命名模型文件夾。 * 點擊刷新下載模型,程序會自檢文件完整性,缺失會提示不完整。 ## 工具 / 模型 / 名詞整理 * **Audio CPP**:影片主要介紹的本地語音 AI 工具。 * **Nama CPP**:文中比喻為音頻版 Nama CPP。 * **Index TTS2**:新增的 TTS 模型,支持情感推斷。 * **Supertonic3**:新增的 TTS 模型,速度快,支持流式合成,不支持中文。 * **MOS 系列**:低顯存建議使用的 TTS 模型系列。 * **千問 3 TTS 0.6b**:低顯存建議使用的 TTS 模型。 * **Vox CP-M2**:目前僅此模型支援中文流式合成。 * **千問 3 ASR 1.7B**:推薦的中文轉寫 ASR 模型。 * **Vib Voice ASR**:高性能 ASR 模型,支持多人對話。 * **Limotron 3.5 ASR 0.6B**:速度快的 ASR 模型,用於開發語音輸入法。 * **Codex**:用於生成代碼的 AI 工具。 * **Speak Type**:開發的語音輸入法程序名稱。 * **Run Server ASR Stream**:啟動 ASR 流式服務的指令/程序。 * **Run WebUI**:啟動 WebUI 的指令/程序。 * **Hugging Face**:模型下載來源平台。 * **Stable Audio**:需申請權限的特殊模型系列。 * **WebUI**:Audio CPP 的網頁用戶介面。 * **Obsidian**:文本編輯軟件示例。 * **記事本**:文本編輯軟件示例。 * **GGUF**:模型量化格式。 * **Q4 量化版**:具體的量化級別。 * **VibeOS ASR**:原始模型名稱,需 16G 顯存。 * **OpenAI 風格的 API**:Audio CPP 可能支援的 API 格式。 ## 操作流程整理 ### 1. 升級 Audio CPP 1. **新安裝**:下載新版完整版整合包。 2. **舊版升級**:下載升級包,解壓後複製所有文件覆蓋原整合包目錄。 3. **啟動**:雙擊 `Run WebUI`,等待加載後自動打開網頁。 ### 2. 下載與配置模型 1. **準備 Hugging Face 帳號**:註冊免費帳號。 2. **申請權限(如需要)**: * 填寫申請表單。 * 通過後,在頭像菜單底部訪問 Token。 * 創建新 Token(選讀權限)。 * 複製 Token 粘貼至 WebUI Token 框。 3. **下載模型**: * 在 WebUI 中選擇模型點擊下載。 * 若網絡受阻,填寫代理地址。 * 程序在 `Modus` 目錄下創建臨時目錄並下載(支持斷點續傳)。 * 下載完成後,程序自動創建/重命名模型文件夾。 * 點擊刷新下載模型,程序自檢文件完整性。 ### 3. 使用 GGUF 量化 1. 在量化管理功能中,選擇支持的模型進行轉換。 2. 等待轉換完成(大參數模型約需 20 多分鐘)。 3. 重新啟動服務,後台服務會優先加載 GGUF 文件。 4. 若不想使用量化版,可轉換恢復原始權重。 ### 4. 開發與使用語音輸入法 (Speak Type) 1. **開發階段**: * 撰寫需求描述。 * 使用 Codex 生成代碼。 * 服務端調用 Audio CPP 服務。 2. **運行階段**: * 啟動 `Run Server ASR Stream` 服務。 * 運行 `Speak Type` 程序。 * 在文本編輯軟件(如記事本、Obsidian)中將光標置於輸入位置。 * 按住 `Ctrl` + `Shift` + `空格` 打開麥克風並說話。 * 語音內容直接轉寫為文字。 ## 值得注意的限制或風險 1. **顯存需求**: * Index TTS2 較吃顯存,低顯存設備建議使用 MOS 系列或千問 3 TTS 0.6b。 * Vib Voice ASR 需足夠顯存以支持多人對話。 * VibeOS ASR 原始模型需 16G 顯存,量化後需 8G。 2. **語言支援限制**: * Supertonic3 不支持中文。 * Limotron 3.5 ASR 0.6B 中文識別準確率較差。 * Vox CP-M2 中文流式合成效果仍在優化,首次延遲高且有卡頓。 3. **GGUF 轉換限制**: * Audio CPP 不支持其他框架轉換的 GGUF。 * 僅部分模型可轉換。 * 大參數模型轉換耗時長。 4. **模型下載限制**: * 必須從 Hugging Face 下載,不支持手動放置模型文件。 * 部分模型需單獨申請權限。 5. **性能延遲**: * 語言切換時約有 1-2 秒延時。 * Supertonic3 首次合成需重載後台服務,有加載時間。 ## 逐字稿辨識疑點 * **Audio CPP**:文中多次提及,疑似為特定軟體名稱,保留原樣。 * **Nama CPP**:文中比喻用詞,保留原樣。 * **MOS 系列**:文中提及「顯卡配置低的話,就用MOS系列」,疑點:具體指代不明,保留原樣。 * **千問 3 TTS0.6b**:文中寫法,疑點:通常模型版本號格式可能不同,保留原樣。 * **流式生存**:文中多次出現「流式生存」,疑點:語境為語音合成,應為「流式合成」之聽寫錯誤,但依規則標為疑點。 * **生存模式**:文中出現「生存模式切換到流式」,疑點:應為「合成模式」,保留原樣。 * **Limotron 3.5ASR 0.6B**:文中提及,疑點:模型名稱拼寫需查證,保留原樣。 * **Vib Voice ASR**:文中提及,疑點:與後文「VibeOS ASR」名稱不一致,保留原樣。 * **實施對話**:文中出現「實施對話」,疑點:語境應為「即時對話」,保留原樣。 * **實施語音對話**:文中出現,疑點:應為「即時語音對話」,保留原樣。 * **VibeOS ASR**:文中提及,疑點:與前文「Vib Voice ASR」名稱不一致,保留原樣。 * **Stable Audio**:文中提及,疑點:通常為 Stable Diffusion 或特定音頻模型,保留原樣。 * **Modus 目錄**:文中提及下載目錄路徑,疑點:目錄名稱拼寫需查證,保留原樣。 * **新商手**:文中出現「新商手的朋友」,疑點:應為「新手」,保留原樣。 * **典禮的 Hugging Face 頭像**:文中出現「在典禮的 Hugging Face 頭像」,疑點:應為「點擊」或類似動詞,保留原樣。 * **選紙讀**:文中出現「選紙讀」,疑點:應為「選只讀」或類似權限選項,保留原樣。 * **數查**:文中出現「來數查」,疑點:應為「查詢」,保留原樣。 ## 可延伸追