# 影片筆記:audio.cpp 音频 AI 领域的“Ollama” 本地部署音频AI模型,开箱即用,支持命令行 CLI 以及Web UI, TTS / 声音克隆、ASR / ## 一句話總結 影片介紹了一款名為 **AudioCPP** 的純 C++ 本地語音 AI 部署工具,旨在解決傳統 Python/Conda 環境配置繁瑣的問題,提供輕量級、開箱即用的體驗,支援 TTS(含聲音克隆)、ASR、音樂生成及即時語音對話,並同時提供 CLI 與 Web UI 介面。 ## 核心重點 1. **技術架構與優勢**: * 純 C++ 實現,原生二進制程序。 * 輕量級(APU 版本僅 8MB),無需 Conda、Python 等複雜環境配置。 * 開箱即用,簡化本地語音 AI 部署流程。 2. **核心功能**: * **TTS(文字轉語音)**:支援聲音克隆、批量合成、多語言(10種主要語言及方言)。 * **ASR(語音轉文字)**:支援語音轉寫。 * **音樂生成**:支援基於參考音頻和提示詞生成音樂。 * **即時語音對話**:結合 ASR、LLM 與 TTS 實現即時互動。 3. **介面支援**: * 同時提供命令行介面(CLI)與網頁介面(Web UI)。 4. **安裝與模型管理**: * 需手動下載模型文件至指定資料夾,或下載官方整合包。 * 支援 CPU 與 GPU (Cuda) 推理後端。 ## 詳細大綱 ### I. AudioCPP 簡介與優勢 * **定位**:簡化本地語音 AI 部署的實用工具。 * **技術架構**:純 C++ 實現,原生二進制程序。 * **優點**: * 輕量級(APU 版本僅 8MB)。 * 無需複雜環境配置(無須 Conda、Python 等)。 * 開箱即用。 ### II. 核心功能與操作演示 #### A. 命令行介面 (CLI) 操作 1. **基本參數結構**: * `Task`:指定任務類型(如 TTS)。 * `Family`:指定模型系列(如 Pocket TTS, QuantTTS)。 * `Model`:模型文件路徑。 * `Backend`:推理後端(CPU 或 Cuda/GPU)。 * `Text`:合成文字內容。 * `Voice ID`:參考音色文件。 * `Out`:輸出音頻位置。 2. **實例演示 1 (Pocket TTS)**: * 使用 `AudioCppClare` 命令。 * 設定 CPU 推理,輸入文字與參考音色。 * 生成音頻並播放,效果良好。 3. **實例演示 2 (QuantTTS)**: * 使用 `QuantTTS` 模型。 * 設定 `Voice Reef`(參考音頻)與 `Reference Text`(參考文本)。 * 生成並播放,確認在 Windows CPU 上運行效果佳。 #### B. 網頁介面 (Web UI) 操作 1. **TTS 聲音克隆測試**: * 選擇模型(Pocket TTS 或 Q1-3TT-S/QVN3 TTS)。 * 加載模型,選擇參考音色(英文或中文)。 * 輸入合成文本,選擇語言,點擊生成。 * 播放聽取效果,支援下載音頻文件。 2. **多語言支援**: * 覆蓋中文、英語、日語、韓語、德語、法語、俄語、葡萄牙語、西班牙語、義大利語。 * 提供多種方言配置。 3. **注意事項**: * 合成文本建議不超過 100 字,否則速度變慢且質量下降。 #### C. 批量處理 (Batch Processing) * **適用場景**:處理長文本。 * **操作方式**: * `Batch Text File`:按行處理,每行作為獨立段落合成。 * `Batch Merge Audio`:自動將合成的小段音頻合併為完整文件。 * **演示**:將多行句子文本拆分合成後合併播放。 #### D. 語音轉寫 (ASR) * **模型選擇**:Qin3ASR。 * **操作**:上傳音頻文件,點擊開始轉寫。 * **結果**:轉寫結果顯示於文本框,準確率高。 #### E. 音樂生成 * **操作**:選擇模型 -> 加載 -> 上傳參考音頻 -> 輸入提示詞 -> 點擊生成。 * **備註**:若模型未安裝可點擊下載,影片未做詳細演示。 #### F. 即時語音 (Real-time Voice) * **工作原理**: 1. 麥克風輸入聲音。 2. ASR 模型轉成文字。 3. 文字交給大語言模型 (LLM) 處理。 4. TTS 模型將處理結果合成語音輸出。 * **資源消耗**:較高(同時加載 TTS 和 ASR 模型)。 * **啟動步驟**: 1. 雙擊 `RunWebBit` 開啟 WebUI 服務。 2. 加載 TTS 模型。 3. 雙擊 `ASRBit` 加載 ASR 模型。 4. 雙擊 `RealtelBit` 打開即時語音頁面。 5. 配置 LLM 接口地址、模型名稱和 API Key。 6. 點擊對話進行測試。 ### III. 安裝與模型下載指南 1. **獲取主程序**: * 前往 GitHub Releases 頁面。 * 下載 CPU 版本壓縮包。 2. **模型文件配置**: * 主程序內無音頻模型,需自行創建 `Models` 資料夾。 3. **特定模型安裝**: * **Pocket TTS**: * 來源:Hugging Face。 * 特點:1 億參數,輕量,無 GPU 亦可流暢運行。 * 步驟:下載英文相關模型文件、分詞器、參考音色,放入 `Models/Pocket TS` 資料夾。 * **QVN3 TTS**: * 來源:摩塔社區 (MotA Community) 或 Hugging Face 倉庫。 * 推薦工具:GitLFS(管理大文件擴展)。 * 步驟:複製 GitClone 地址,在模型資料夾 CMD 中執行下載。 4. **官方整合包**: * 提供包含 CPU、GPU 和 Web UI 版本的整合包。 * 集成常用音頻模型,可直接使用 CPU 運行。 ### IV. 總結 * AudioCPP 簡化了本地語音 AI 部署。 * 支援 CLI 與 Web UI。 * 功能涵蓋 TTS、ASR、音樂生成、即時對話。 * 提供統一語音服務接口。 * 安裝簡便,只需下載模型文件。 ## 工具 / 模型 / 名詞整理 * **AudioCPP** (影片主要介紹的工具) * **Alama** (逐字稿提及,用於簡化大語言模型,疑似指代某工具但名稱存疑) * **Conda** * **Python** * **E-Lite** * **Pocket TTS** * **QuantTTS** (CLI 參數中出現) * **Q1-3TT-S** (Web UI 測試中出現) * **QVN3 TTS** (安裝指南中出現) * **Qin3ASR** (ASR 功能中出現) * **GLM5.2** (ASR 轉寫測試中提及) * **RunWebBit** (啟動 WebUI 服務程序) * **ASRBit** (加載 ASR 模型程序) * **RealtelBit** (打開即時語音頁面程序) * **GitHub** * **Hugging Face** * **摩塔社區** * **GitLFS** * **GitClone** ## 操作流程整理 ### CLI 操作流程 1. 打開命令行窗口。 2. 執行 `AudioCppClare` 命令。 3. 設定參數: * `Task`: TTS * `Family`: Pocket TTS 或 QuantTTS * `Backend`: CPU 或 Cuda * `Text`: 輸入合成文字 * `Voice ID`: 指定參考音色文件 * `Out`: 指定輸出音頻位置 4. 執行命令生成音頻。 5. 播放生成的音頻文件。 ### Web UI 操作流程 1. 雙擊 `RunWebBit` 啟動服務。 2. 在瀏覽器中打開 Web UI。 3. **TTS 聲音克隆**: * 選擇模型(Pocket TTS 或 Q1-3TT-S/QVN3 TTS)。 * 加載模型。 * 上傳參考音色文件。 * 輸入合成文本。 * 選擇語言。 * 點擊生成並播放/下載。 4. **批量處理**: * 上傳 `Batch Text File`。 * 系統按行拆分合成。 * 使用 `Batch Merge Audio` 合併音頻。 5. **ASR 轉寫**: * 選擇 Qin3ASR 模型。 * 上傳音頻文件。 * 點擊開始轉寫,查看文本結果。 6. **即時語音對話**: * 加載 TTS 模型。 * 雙擊 `ASRBit` 加載 ASR 模型。 * 雙擊 `RealtelBit` 打開即時語音頁面。 * 配置 LLM 接口地址、模型名稱和 API Key。 * 進行語音對話測試。 ### 安裝與模型下載流程 1. 前往 GitHub Releases 下載 CPU 版本壓縮包。 2. 解壓後創建 `Models` 資料夾。 3. **下載 Pocket TTS**: * 從 Hugging Face 下載英文相關模型文件、分詞器、參考音色。 * 放入 `Models/Pocket TS` 資料夾。 4. **下載 QVN3 TTS**: * 從摩塔社區或 Hugging Face 獲取 GitClone 地址。 * 使用 GitLFS 在模型資料夾 CMD 中執行下載。 5. 或使用官方整合包(包含 CPU/GPU/Web UI 及常用模型)。 ## 值得注意的限制或風險 1. **文本長度限制**:Web UI 合成文本建議不超過 100 字,否則速度變慢且質量下降。 2. **資源消耗**:即時語音對話需同時加載 TTS 和 ASR 模型,資源消耗較高。 3. **模型依賴**:主程序內無音頻模型,需自行下載並配置模型文件,否則無法使用。 4. **硬體要求**:Pocket TTS 雖輕量(1 億參數),但其他模型可能需要 GPU (Cuda) 支援以獲得流暢體驗。 ## 逐字稿辨識疑點 * **AudioCPP**:逐字稿中出現 `AudioCPP`、`AudioCPC`、`AudioX CPT` 等多種寫法,需查證正確產品名稱。 * **Alama**:逐字稿提及「就像 Alama 簡化了大語言模型一樣」,此名稱不常見,需查證是否為特定工具名稱或口誤。 * **E-Lite**:逐字稿提及「Python, E-Lite 這些痛點」,需查證此名稱是否為特定庫或工具。 * **QuantTTS**:CLI 參數中出現,需確認是否為正確模型名稱。 * **Q1-3TT-S**:Web UI 測試中出現,需確認是否為正確模型名稱。 * **QVN3 TTS**:安裝指南中出現,需確認是否為正確模型名稱。 * **Qin3ASR**:ASR 功能中出現,需確認是否為正確模型名稱。 * **RunWebBit**、**ASRBit**、**RealtelBit**:這些程序名稱拼寫較為特殊(如 Bit 而非 Bit 或 UI),需查證是否為正確的可執行文件名稱。 * **摩塔社區**:需查證此名稱是否為正確的平台名稱。 * **1 億參數**:逐字稿稱 Pocket TTS 只有 1 億參數,需查證是否準確。 * **8 兆大小**:逐字稿稱 APU 版本僅 8 兆大小,需查證單位是否為 MB 或 KB。 * **Batch P 處理**:逐字稿中出現「Batch P 處理」,疑為「Batch Processing」或「批量處理」的口誤或聽寫錯誤。 * **AUT 文件夾**:逐字稿中出現「打開 AUT 文件夾」,疑為「Out 文件夾」的聽寫錯誤。 * **Commanding 窗口**:逐字稿中出現「切換到命令型窗口」,疑為「命令行窗口」的口誤。 * **特隆**:逐字稿總結中出現「涵蓋 TTS 特隆 ASR 轉寫」,疑為「翻譯」或特定功能的口誤。 * **Voice Reef**:CLI 參數中出現,疑為「Voice Ref」或「Voice Reference」的口誤。 * **Reference Text**:CLI 參數中出現,需確認是否為正確參數名稱。 * **Task TTS**:CLI 參數中出現,需確認是否為正確參數名稱。 * **Family Pocket TTS**:CLI 參數中出現,需確認是否為正確參數名稱。 * **Backend CPU**:CLI 參數中出現,需確認是否為正確參數名稱。 * **Cuda**:CLI 參數中出現,需確認是否為正確參數名稱(通常為 CUDA)。 * **Voice ID**:CLI 參數中出現,需確認是否為正確參數名稱。 * **Out**:CLI 參數中出現,需確認是否為正確參數名稱。 * **Batch Text File**:批量處理參數中出現,需確認是否為正確參數名稱。 * **Batch Merge Audio Concrete**:批量處理參數中出現,需確認是否為正確參數名稱。 * **Models玩件夾**:安裝指南中出現,疑為「Models 文件夾」的聽寫錯誤。 * **分磁器**:安裝指南中出現,疑為「分詞器」的聽寫錯誤。 * **科問倉庫**:安裝指南中出現,疑為「問答倉庫」或特定倉庫名稱的聽寫錯誤。 ## 可延伸追問 1. AudioCPP 的正確產品名稱及官方 GitHub 倉庫地址為何? 2. 「Alama」、「E-Lite」、「摩塔社區」等名稱的具體指代對象及正確拼寫為何? 3. CLI 參數中 `Voice Reef`、`Batch Merge Audio Concrete` 等名稱的正確拼寫及完整參數列表為何? 4. `RunWebBit`、`ASRBit`、`RealtelBit` 等可執行文件的正確名稱及下載來源為何? 5. Pocket TTS 的「1 億參數」與「8MB 大小」是否準確?是否有更詳細的技術規格? 6. 官方整合包中是否包含所有列出的模型(Pocket TTS, QVN3 TTS, Qin3ASR 等)? 7. 即時語音對話中,LLM 接口配置是否有推薦的模型或 API 提供商? 8. 對於長文本批量處理,是否有更優化的參數設置建議?