# 影片筆記:太丝滑了!本地 AI 实时语音对话,免费开源、低延迟,支持中文(Realtime Voice)完整部署教程!| 零度解说 ## 一句話總結 本影片演示如何在本地電腦上完全免費、開源地搭建一個實時語音對話 AI 系統,該系統無需聯網即可運行,具備高度隱私性(數據不上傳雲端),支援中文語音輸入與輸出,並能實現低延遲的即時思考與回答。 ## 核心重點 * **本地化與隱私**:所有運算在本地電腦完成,數據不上傳雲端,斷網可用。 * **技術棧**:基於 Python、Git、llama-cpp、speech to speech (S2S) 及 Qwen 系列模型。 * **性能優化**:默認使用 4B 模型以兼容大多數設備,若顯存充足(如 24GB)可更換為更大參數量模型(如 Qwen3.6 35B A3B)以提升性能。 * **便捷部署**:提供一鍵啟動腳本,重啟電腦後可快速恢復服務。 ## 詳細大綱 ### 一、 系統介紹與優勢 * **核心特點**:完全免費、開源、本地運行、無延遲、斷網可用。 * **隱私安全**:所有運算在本地電腦完成,數據不上傳雲端。 * **功能表現**:支援普通話輸入與中文語音輸出,具備實時思考與回答能力。 ### 二、 環境準備與基礎安裝 1. **安裝 Python** * 建議版本:Python 3.11(需 3.10 以上)。 * 關鍵步驟:安裝時必須勾選「將 Python 添加到系統路徑 (PATH)」。 * 操作:下載 Windows 64位版本並執行安裝。 2. **安裝 Git** * 下載並安裝最新版本的 Git(約 60MB)。 3. **安裝音頻解碼器** * 使用 PowerShell 執行作者提供的一鍵安裝命令。 * 確認安裝過程(輸入 y)。 ### 三、 核心組件與虛擬環境配置 1. **安裝 Speech to Speech (S2S)** * 使用命令激活環境。 * 執行一鍵安裝命令,預設安裝於 C 盤(可更改路徑)。 * 確認虛擬環境激活成功(PowerShell 提示符出現綠色 `VENV`)。 2. **安裝 S2S 與 Qwen3 TTS 底層組件** * **注意**:必須在虛擬環境(帶 `VENV` 標記)下執行。 * 執行一鍵安裝命令下載開源項目。 * **網絡建議**:非海外用戶建議開啟全局科學上網以確保下載順利。 ### 四、 本地大模型與驅動配置 1. **下載 llama-cpp** * 根據 NVIDIA 顯卡驅動版本選擇對應的 CUDA 版本(如 CUDA 12 或 13)。 * 檢查驅動方法:CMD 中查看當前 N 卡驅動版本。 * 下載內容:主程序(約 130MB)及相應驅動文件。 2. **文件整理** * 新建資料夾(命名為 `llama`)。 * 將解壓後的兩個壓縮包內容拖入該資料夾,驅動文件覆蓋主程序。 * 將資料夾移動至指定路徑(如 D 盤)。 3. **下載模型文件** * 執行一鍵安裝命令下載模型。 * **常見錯誤修復**:若因 `huggingface hub` 版本過高導致錯誤,需執行命令降低版本後重新下載。 * 模型將存儲於 `llama` 資料夾下的 `models` 資料夾中。 ### 五、 服務啟動與使用 1. **運行 llama-cpp 服務** * 在新 PowerShell 窗口執行命令啟動服務。 * **注意**:啟動後需最小化窗口,不可關閉。 2. **啟動語音對話服務** * 回到帶有 `VENV` 標記的虛擬環境窗口。 * 執行命令啟動語音服務,允許瀏覽器訪問地址。 3. **瀏覽器端操作** * 在瀏覽器輸入本地訪問地址。 * 設置本地語音服務地址(localhost + 端口號)。 * 選擇語音音色,點擊保存並重啟。 * 測試語音對話功能。 ### 六、 進階應用與優化 1. **一鍵啟動腳本** * 針對重啟電腦後的便捷使用,提供一鍵啟動腳本。 * 運行腳本會自動彈出三個獨立窗口,均不可關閉。 * 瀏覽器填入本地語音地址即可使用。 2. **方言與音色切換** * 支援切換不同音色(如 ERIC 音色可說四川方言)。 3. **提升性能(更換大模型)** * 默認使用 4B 模型以兼容大多數設備。 * 若顯存充足(如 24GB),可更換為更大模型(如 Qwen3.6 35B A3B)。 * **更換步驟**: 1. 下載新模型並放入 `models` 資料夾。 2. 複製新模型文件名。 3. 修改啟動腳本中的模型文件名稱,替換為新模型。 4. 保存並重新運行腳本,加載新模型進行測試。 ## 工具 / 模型 / 名詞整理 * **Python** (版本建議 3.11) * **Git** * **PowerShell** * **CMD** (命令提示符) * **llama-cpp** * **CUDA** (版本提及 12, 13, 13.2, 13.3) * **speech to speech** (簡稱 S2S) * **Qwen3 TTS** * **Qwen3.6 35B A3B** (模型名稱) * **huggingface hub** * **零度博客** (參考來源) * **ERIC** (音色名稱) * **科學上網** (特定語境下的術語) * **Top start** (瀏覽器界面提及的 UI 組件名稱) ## 操作流程整理 1. **基礎環境安裝**: * 安裝 Python 3.11+(勾選 PATH)。 * 安裝 Git。 * 使用 PowerShell 執行一鍵命令安裝音頻解碼器。 2. **項目與虛擬環境配置**: * 執行一鍵安裝命令下載 S2S 項目(預設 C 盤)。 * 激活虛擬環境,確認 PowerShell 提示符出現綠色 `VENV`。 * 在虛擬環境下執行一鍵安裝命令下載底層組件(建議科學上網)。 3. **驅動與模型下載**: * 檢查 NVIDIA 驅動版本,下載對應 CUDA 版本的 llama-cpp。 * 整理文件:新建 `llama` 資料夾,合併主程序與驅動文件,移動至指定盤符(如 D 盤)。 * 執行一鍵命令下載模型,若遇 `huggingface hub` 版本錯誤,需降級後重新下載。 4. **服務啟動與測試**: * **窗口 1**:新 PowerShell 運行 llama-cpp 服務(啟動後最小化,勿關閉)。 * **窗口 2**:虛擬環境窗口運行語音服務。 * **瀏覽器**:輸入本地地址,設置 localhost 端口,選擇音色(如 ERIC),保存重啟。 * **測試**:進行語音對話測試。 5. **日常使用(一鍵腳本)**: * 運行一鍵啟動腳本,自動彈出三個窗口。 * 瀏覽器填入地址即可使用。 6. **更換大模型(可選)**: * 下載大參數量模型(如 Qwen3.6 35B A3B)放入 `models` 資料夾。 * 修改啟動腳本中的模型文件名。 * 重新運行腳本加載新模型。 ## 值得注意的限制或風險 * **顯存要求**:默認使用 4B 模型以兼容大多數設備;若需更換更大模型(如 35B),需確保顯存充足(如 24GB)。 * **網絡依賴**:下載開源項目及模型時,非海外用戶可能需要科學上網。 * **服務穩定性**:啟動後的 PowerShell 窗口(llama-cpp 服務及語音服務)不可關閉,需最小化運行。 * **版本兼容性**:`huggingface hub` 版本過高可能導致下載錯誤,需手動降級。 * **CUDA 版本匹配**:需嚴格根據 NVIDIA 驅動版本選擇對應的 CUDA 版本(12 或 13)。 ## 逐字稿辨識疑點 * **Qwen3 TTS**:逐字稿中提及「Qwen3 TTS」,通常 Qwen 系列為語言模型,TTS 為語音合成,此處組合名稱需查證是否為特定整合包名稱或口誤。 * **Qwen3.6 35B A3B**:逐字稿中提及「Qwen3.6 35B A3B」,此命名格式(3.6 版本與 35B/A3B 參數量的組合)在常見公開模型中較少見,需查證是否為特定量化版本或聽寫錯誤。 * **4B 模型**:逐字稿提及「目前使用的是 4B 模型」,未指明具體模型名稱,僅以參數量描述。 * **科學上網**:逐字稿中提及「科學上網」,為特定語境下的術語,保留原樣。 * **Top start**:逐字稿中瀏覽器界面提及「Top start」,疑為特定 UI 組件名稱或聽寫錯誤,需查證。 ## 可延伸追問 * 如何確認當前 NVIDIA 顯卡驅動版本以選擇正確的 CUDA 版本? * 若遇到 `huggingface hub` 版本過高錯誤,具體的降級命令是什麼? * 一鍵啟動腳本中三個窗口的具體功能分別為何? * 如何判斷自己的顯存是否足以運行 Qwen3.6 35B A3B 模型? * ERIC 音色是否支援其他方言?如何切換音色?