實際影片長度:1:54.624。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:02.560
这个项目其实在去年就已经开源了,
0:02.560–0:05.760
但是到目前为止它依然是开源界里面的最强,
0:05.760–0:08.640
只是最近我在做一些TTS模型的微调,
0:08.640–0:09.760
使用UVR5,
0:09.760–0:12.480
驱除大部分背景音乐后还有很多底噪,
0:12.480–0:14.240
所以就有了今天的分享,
0:14.240–0:15.840
我们先来看一下效果,
0:15.840–0:17.760
这是没有处理的原始音频。
0:17.760–0:20.452
观众朋友们大家好,
0:20.452–0:24.639
欢迎来到南多音视频的直播间,
0:24.639–0:26.733
我是记者王杰,
0:26.733–0:30.023
今年第12号台风红霞,
0:30.023–0:32.116
从黄步阵开始,
0:32.116–0:37.799
我们就能感受到道路上的积水是比较多的,
0:37.799–0:44.080
那除此之外一路上随处可见的这种倒幅的数目。
0:44.080–0:49.080
今天的凌晨3点50分前后,在惠州市惠东县的平海镇登陆。
0:50.260–0:54.060
怎么样,效果是不是非常完美?好,我们来看一下怎么使用。
0:55.020–0:56.914
如果只是偶尔使用一下,
0:56.914–0:58.464
可以使用云端镜像,
0:58.464–1:00.014
打开云端镜像以后,
1:00.014–1:02.081
点击使用此镜像创建实例,
1:02.081–1:05.008
然后选择一个可用的有库存的GPU,
1:05.008–1:06.902
这种模式是开机才计费,
1:06.902–1:08.280
关机不会计费的。
1:08.280–1:09.556
部署实例以后,
1:09.556–1:10.651
等待几分钟,
1:10.651–1:15.939
然后我们在实例列表里面点击YZY启动器或者9000的按钮,
1:15.939–1:17.580
就可以打开页面了。
1:18.460–1:20.115
我们点击这里,
1:20.115–1:21.770
上传一个音频,
1:21.770–1:23.897
然后点击开始处理,
1:23.897–1:26.261
它会依次预处理音频,
1:26.261–1:27.443
加载模型,
1:27.443–1:29.098
然后人声增强,
1:29.098–1:30.280
去照等等。
1:30.280–1:31.888
在高级设置这里,
1:31.888–1:34.100
还可以选择不同的模型,
1:34.100–1:35.507
调整人声润色,
1:35.507–1:36.513
分块长度,
1:36.513–1:39.729
在显存不足或者是显存充足的时候,
1:39.729–1:41.740
可以调整以加速推理。
1:42.580–1:43.307
好了各位,
1:43.307–1:45.196
希望本期视频对你有所帮助,
1:45.196–1:46.213
欢迎关注订阅,
1:46.213–1:46.940
点赞收藏,
1:46.940–1:47.812
我是鱼子月,
1:47.812–1:49.120
那我们下个视频见。
0:00.000–0:02.560
这个项目其实在去年就已经开源了,
0:02.560–0:05.760
但是到目前为止它依然是开源界里面的最强,
0:05.760–0:08.640
只是最近我在做一些TTS模型的微调,
0:08.640–0:09.760
使用UVR5,
0:09.760–0:12.480
驱除大部分背景音乐后还有很多底噪,
0:12.480–0:14.240
所以就有了今天的分享,
0:14.240–0:15.840
我们先来看一下效果,
0:15.840–0:17.760
这是没有处理的原始音频。
0:17.760–0:20.452
观众朋友们大家好,
0:20.452–0:24.639
欢迎来到南多音视频的直播间,
0:24.639–0:26.733
我是记者王杰,
0:26.733–0:30.023
今年第12号台风红霞,
0:30.023–0:32.116
从黄步阵开始,
0:32.116–0:37.799
我们就能感受到道路上的积水是比较多的,
0:37.799–0:44.080
那除此之外一路上随处可见的这种倒幅的数目。
0:44.080–0:49.080
今天的凌晨3点50分前后,在惠州市惠东县的平海镇登陆。
0:50.260–0:54.060
怎么样,效果是不是非常完美?好,我们来看一下怎么使用。
0:55.020–0:56.914
如果只是偶尔使用一下,
0:56.914–0:58.464
可以使用云端镜像,
0:58.464–1:00.014
打开云端镜像以后,
1:00.014–1:02.081
点击使用此镜像创建实例,
1:02.081–1:05.008
然后选择一个可用的有库存的GPU,
1:05.008–1:06.902
这种模式是开机才计费,
1:06.902–1:08.280
关机不会计费的。
1:08.280–1:09.556
部署实例以后,
1:09.556–1:10.651
等待几分钟,
1:10.651–1:15.939
然后我们在实例列表里面点击YZY启动器或者9000的按钮,
1:15.939–1:17.580
就可以打开页面了。
1:18.460–1:20.115
我们点击这里,
1:20.115–1:21.770
上传一个音频,
1:21.770–1:23.897
然后点击开始处理,
1:23.897–1:26.261
它会依次预处理音频,
1:26.261–1:27.443
加载模型,
1:27.443–1:29.098
然后人声增强,
1:29.098–1:30.280
去照等等。
1:30.280–1:31.888
在高级设置这里,
1:31.888–1:34.100
还可以选择不同的模型,
1:34.100–1:35.507
调整人声润色,
1:35.507–1:36.513
分块长度,
1:36.513–1:39.729
在显存不足或者是显存充足的时候,
1:39.729–1:41.740
可以调整以加速推理。
1:42.580–1:43.307
好了各位,
1:43.307–1:45.196
希望本期视频对你有所帮助,
1:45.196–1:46.213
欢迎关注订阅,
1:46.213–1:46.940
点赞收藏,
1:46.940–1:47.812
我是鱼子月,
1:47.812–1:49.120
那我们下个视频见。
0:00.000–0:02.560
这个项目其实在去年就已经开源了,
这个项目其实在去年就已经开源了,
0:02.560–0:05.760
但是到目前为止它依然是开源界里面的最强,
但是到目前为止它依然是开源界里面的最强,
0:05.760–0:08.640
只是最近我在做一些TTS模型的微调,
只是最近我在做一些TTS模型的微调,
0:08.640–0:09.760
使用UVR5,
使用UVR5,
0:09.760–0:12.480
驱除大部分背景音乐后还有很多底噪,
驱除大部分背景音乐后还有很多底噪,
0:12.480–0:14.240
所以就有了今天的分享,
所以就有了今天的分享,
0:14.240–0:15.840
我们先来看一下效果,
我们先来看一下效果,
0:15.840–0:17.760
这是没有处理的原始音频。
这是没有处理的原始音频。
0:17.760–0:20.452
观众朋友们大家好,
观众朋友们大家好,
0:20.452–0:24.639
欢迎来到南多音视频的直播间,
欢迎来到南多音视频的直播间,
0:24.639–0:26.733
我是记者王杰,
我是记者王杰,
0:26.733–0:30.023
今年第12号台风红霞,
今年第12号台风红霞,
0:30.023–0:32.116
从黄步阵开始,
从黄步阵开始,
0:32.116–0:37.799
我们就能感受到道路上的积水是比较多的,
我们就能感受到道路上的积水是比较多的,
0:37.799–0:44.080
那除此之外一路上随处可见的这种倒幅的数目。
那除此之外一路上随处可见的这种倒幅的数目。
0:44.080–0:49.080
今天的凌晨3点50分前后,在惠州市惠东县的平海镇登陆。
今天的凌晨3点50分前后,在惠州市惠东县的平海镇登陆。
0:50.260–0:54.060
怎么样,效果是不是非常完美?好,我们来看一下怎么使用。
怎么样,效果是不是非常完美?好,我们来看一下怎么使用。
0:55.020–0:56.914
如果只是偶尔使用一下,
如果只是偶尔使用一下,
0:56.914–0:58.464
可以使用云端镜像,
可以使用云端镜像,
0:58.464–1:00.014
打开云端镜像以后,
打开云端镜像以后,
1:00.014–1:02.081
点击使用此镜像创建实例,
点击使用此镜像创建实例,
1:02.081–1:05.008
然后选择一个可用的有库存的GPU,
然后选择一个可用的有库存的GPU,
1:05.008–1:06.902
这种模式是开机才计费,
这种模式是开机才计费,
1:06.902–1:08.280
关机不会计费的。
关机不会计费的。
1:08.280–1:09.556
部署实例以后,
部署实例以后,
1:09.556–1:10.651
等待几分钟,
等待几分钟,
1:10.651–1:15.939
然后我们在实例列表里面点击YZY启动器或者9000的按钮,
然后我们在实例列表里面点击YZY启动器或者9000的按钮,
1:15.939–1:17.580
就可以打开页面了。
就可以打开页面了。
1:18.460–1:20.115
我们点击这里,
我们点击这里,
1:20.115–1:21.770
上传一个音频,
上传一个音频,
1:21.770–1:23.897
然后点击开始处理,
然后点击开始处理,
1:23.897–1:26.261
它会依次预处理音频,
它会依次预处理音频,
1:26.261–1:27.443
加载模型,
加载模型,
1:27.443–1:29.098
然后人声增强,
然后人声增强,
1:29.098–1:30.280
去照等等。
去照等等。
1:30.280–1:31.888
在高级设置这里,
在高级设置这里,
1:31.888–1:34.100
还可以选择不同的模型,
还可以选择不同的模型,
1:34.100–1:35.507
调整人声润色,
调整人声润色,
1:35.507–1:36.513
分块长度,
分块长度,
1:36.513–1:39.729
在显存不足或者是显存充足的时候,
在显存不足或者是显存充足的时候,
1:39.729–1:41.740
可以调整以加速推理。
可以调整以加速推理。
1:42.580–1:43.307
好了各位,
好了各位,
1:43.307–1:45.196
希望本期视频对你有所帮助,
希望本期视频对你有所帮助,
1:45.196–1:46.213
欢迎关注订阅,
欢迎关注订阅,
1:46.213–1:46.940
点赞收藏,
点赞收藏,
1:46.940–1:47.812
我是鱼子月,
我是鱼子月,
1:47.812–1:49.120
那我们下个视频见。
那我们下个视频见。

影片筆記:ClearVoice目前开源效果最好的人声提取模型,去除背景音乐,人声增强,语音降噪,去除底噪 | 余子越Talk

一句話總結

講者介紹了一個被視為開源界最強的人聲提取專案,並演示了如何在雲端環境中部署該專案,透過上傳音訊進行預處理、人聲增強與去噪,以解決 TTS 模型微調時殘留底噪的問題。

核心重點

  • 專案定位:該專案去年已開源,目前仍被講者視為開源界效果最好的專案。
  • 應用情境:講者在進行 TTS 模型微調時,即使使用 UVR5 去除大部分背景音樂,仍會殘留底噪,因此引入此專案作為解決方案。
  • 雲端部署優勢:利用雲端鏡像創建實例,採用「開機計費、關機不計費」的模式,並選擇有庫存 GPU 的實例。
  • 處理流程:標準處理順序為「預處理音訊 -> 加載模型 -> 人聲增強 -> 去噪」。
  • 進階優化:使用者可根據顯存狀況調整模型、人聲潤色、分塊長度等設定,以加速推理過程。

詳細大綱

1. 專案背景與效果展示

  • 背景:專案於去年開源,目前評價極高。
  • 痛點:講者進行 TTS 模型微調時,使用 UVR5 處理後仍有底噪。
  • 效果驗證
  • 展示未處理的原始音訊。
  • 模擬新聞報導語音進行測試(內容提及第 12 號颱風紅霞、黃步陣、道路積水、倒伏樹木、惠州市惠東縣平海鎮登陸時間等細節)。
  • 確認處理後效果完美。

2. 雲端部署與操作步驟

  • 資源準備
  • 使用雲端鏡像。
  • 點擊「使用此鏡像創建實例」。
  • 選擇有庫存 GPU 的實例。
  • 計費方式:開機計費,關機不計費。
  • 進入介面
  • 等待幾分鐘後,在實例列表中點擊「YZY 啟動器」或「9000」按鈕打開頁面。
  • 處理操作
  • 上傳音訊檔案。
  • 點擊「開始處理」。
  • 系統依序執行:預處理音訊 -> 加載模型 -> 人聲增強 -> 去噪。

3. 進階設定選項

  • 選擇不同的模型。
  • 調整人聲潤色參數。
  • 調整分塊長度。
  • 根據顯存是否充足進行配置調整,以加速推理。

4. 結尾

  • 講者自稱為「魚子月」。
  • 呼籲觀眾關注、訂閱、點讚及收藏。

工具 / 模型 / 名詞整理

  • ClearVoice:影片標題提及的專案名稱,被描述為目前開源效果最好的人聲提取模型。
  • TTS 模型:文字轉語音模型,講者用於微調的對象。
  • UVR5:用於去除背景音樂的工具,講者表示其無法完全去除底噪。
  • 雲端鏡像:用於部署專案的環境基礎。
  • YZY 啟動器:進入專案介面的工具/按鈕名稱。
  • 9000:進入專案介面的另一個按鈕/功能名稱。
  • 預處理:處理流程的第一步。
  • 人聲增強:處理流程中的一個步驟。
  • 去噪:處理流程中的最後一個步驟。
  • 分塊長度:進階設定中的一個參數。
  • 魚子月:講者自稱的名稱。

操作流程整理

  1. 創建雲端實例
  • 選擇包含 GPU 庫存且支援「開機計費、關機不計費」的雲端鏡像。
  • 點擊「使用此鏡像創建實例」。
  1. 進入操作介面
  • 等待實例啟動完成(約幾分鐘)。
  • 在實例列表點擊「YZY 啟動器」或「9000」按鈕。
  1. 執行音訊處理
  • 上傳需要處理的音訊檔案。
  • 點擊「開始處理」。
  1. 確認處理結果
  • 系統自動執行:預處理 -> 加載模型 -> 人聲增強 -> 去噪。
  1. 調整進階設定(可選)
  • 若需加速推理或調整效果,可在進階設定中調整模型、人聲潤色、分塊長度及顯存配置。

值得注意的限制或風險

  • 雲端成本:雖採「開機計費、關機不計費」模式,但仍需確保實例正確關閉以避免額外費用。
  • 硬體依賴:需要選擇有 GPU 庫存的雲端實例才能運行。
  • 等待時間:創建實例後需等待幾分鐘才能進入介面。
  • 顯存限制:若顯存不足,可能需要調整分塊長度或模型設定才能成功推理。

逐字稿辨識疑點

  • 黃步陣:逐字稿中出現「從黃步陣開始」,疑似為地名或專有名詞的聽寫錯誤,但無法確認實際名稱,故保留原樣。
  • 倒幅的数目:逐字稿中出現「倒幅的数目」,疑似為「倒伏的樹木」或類似詞彙的聽寫錯誤,但無法確認實際名稱,故保留原樣。
  • 去照:逐字稿中出現「去照等等」,根據上下文推測可能為「去噪」,但無法確認,故保留原樣。
  • 魚子月:講者自稱名稱為「魚子月」,與常見名稱可能不同,保留原樣。

可延伸追問

  • ClearVoice 專案的具體 GitHub 連結或官方文檔為何?
  • UVR5 與 ClearVoice 在處理底噪上的技術原理差異為何?
  • 雲端部署 ClearVoice 的具體硬體規格建議(如 GPU 型號、記憶體大小)為何?
  • 「分塊長度」對處理速度和音質具體有何影響?
  • 該專案是否支援批量處理或 API 呼叫?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習