# 影片筆記:ClearVoice目前开源效果最好的人声提取模型,去除背景音乐,人声增强,语音降噪,去除底噪 | 余子越Talk ## 一句話總結 講者介紹了一個被視為開源界最強的人聲提取專案,並演示了如何在雲端環境中部署該專案,透過上傳音訊進行預處理、人聲增強與去噪,以解決 TTS 模型微調時殘留底噪的問題。 ## 核心重點 * **專案定位**:該專案去年已開源,目前仍被講者視為開源界效果最好的專案。 * **應用情境**:講者在進行 TTS 模型微調時,即使使用 UVR5 去除大部分背景音樂,仍會殘留底噪,因此引入此專案作為解決方案。 * **雲端部署優勢**:利用雲端鏡像創建實例,採用「開機計費、關機不計費」的模式,並選擇有庫存 GPU 的實例。 * **處理流程**:標準處理順序為「預處理音訊 -> 加載模型 -> 人聲增強 -> 去噪」。 * **進階優化**:使用者可根據顯存狀況調整模型、人聲潤色、分塊長度等設定,以加速推理過程。 ## 詳細大綱 ### 1. 專案背景與效果展示 * **背景**:專案於去年開源,目前評價極高。 * **痛點**:講者進行 TTS 模型微調時,使用 UVR5 處理後仍有底噪。 * **效果驗證**: * 展示未處理的原始音訊。 * 模擬新聞報導語音進行測試(內容提及第 12 號颱風紅霞、黃步陣、道路積水、倒伏樹木、惠州市惠東縣平海鎮登陸時間等細節)。 * 確認處理後效果完美。 ### 2. 雲端部署與操作步驟 * **資源準備**: * 使用雲端鏡像。 * 點擊「使用此鏡像創建實例」。 * 選擇有庫存 GPU 的實例。 * 計費方式:開機計費,關機不計費。 * **進入介面**: * 等待幾分鐘後,在實例列表中點擊「YZY 啟動器」或「9000」按鈕打開頁面。 * **處理操作**: * 上傳音訊檔案。 * 點擊「開始處理」。 * 系統依序執行:預處理音訊 -> 加載模型 -> 人聲增強 -> 去噪。 ### 3. 進階設定選項 * 選擇不同的模型。 * 調整人聲潤色參數。 * 調整分塊長度。 * 根據顯存是否充足進行配置調整,以加速推理。 ### 4. 結尾 * 講者自稱為「魚子月」。 * 呼籲觀眾關注、訂閱、點讚及收藏。 ## 工具 / 模型 / 名詞整理 * **ClearVoice**:影片標題提及的專案名稱,被描述為目前開源效果最好的人聲提取模型。 * **TTS 模型**:文字轉語音模型,講者用於微調的對象。 * **UVR5**:用於去除背景音樂的工具,講者表示其無法完全去除底噪。 * **雲端鏡像**:用於部署專案的環境基礎。 * **YZY 啟動器**:進入專案介面的工具/按鈕名稱。 * **9000**:進入專案介面的另一個按鈕/功能名稱。 * **預處理**:處理流程的第一步。 * **人聲增強**:處理流程中的一個步驟。 * **去噪**:處理流程中的最後一個步驟。 * **分塊長度**:進階設定中的一個參數。 * **魚子月**:講者自稱的名稱。 ## 操作流程整理 1. **創建雲端實例**: * 選擇包含 GPU 庫存且支援「開機計費、關機不計費」的雲端鏡像。 * 點擊「使用此鏡像創建實例」。 2. **進入操作介面**: * 等待實例啟動完成(約幾分鐘)。 * 在實例列表點擊「YZY 啟動器」或「9000」按鈕。 3. **執行音訊處理**: * 上傳需要處理的音訊檔案。 * 點擊「開始處理」。 4. **確認處理結果**: * 系統自動執行:預處理 -> 加載模型 -> 人聲增強 -> 去噪。 5. **調整進階設定(可選)**: * 若需加速推理或調整效果,可在進階設定中調整模型、人聲潤色、分塊長度及顯存配置。 ## 值得注意的限制或風險 * **雲端成本**:雖採「開機計費、關機不計費」模式,但仍需確保實例正確關閉以避免額外費用。 * **硬體依賴**:需要選擇有 GPU 庫存的雲端實例才能運行。 * **等待時間**:創建實例後需等待幾分鐘才能進入介面。 * **顯存限制**:若顯存不足,可能需要調整分塊長度或模型設定才能成功推理。 ## 逐字稿辨識疑點 * **黃步陣**:逐字稿中出現「從黃步陣開始」,疑似為地名或專有名詞的聽寫錯誤,但無法確認實際名稱,故保留原樣。 * **倒幅的数目**:逐字稿中出現「倒幅的数目」,疑似為「倒伏的樹木」或類似詞彙的聽寫錯誤,但無法確認實際名稱,故保留原樣。 * **去照**:逐字稿中出現「去照等等」,根據上下文推測可能為「去噪」,但無法確認,故保留原樣。 * **魚子月**:講者自稱名稱為「魚子月」,與常見名稱可能不同,保留原樣。 ## 可延伸追問 * ClearVoice 專案的具體 GitHub 連結或官方文檔為何? * UVR5 與 ClearVoice 在處理底噪上的技術原理差異為何? * 雲端部署 ClearVoice 的具體硬體規格建議(如 GPU 型號、記憶體大小)為何? * 「分塊長度」對處理速度和音質具體有何影響? * 該專案是否支援批量處理或 API 呼叫?