實際影片長度:8:09.016。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:03.000
ja請評估本項目加入中英文支持。
0:08.000–0:10.705
ja上期視頻我介紹了Audio CPP,
0:10.705–0:13.727
ja當時我把它比作音頻版的Nama CPP,
0:13.727–0:14.841
ja僅僅過了幾天,
0:14.841–0:16.114
ja它又一次大升級,
0:16.114–0:18.341
ja不僅一口氣新增了10個模型,
0:18.341–0:20.409
ja還支持加載GGUF量化版,
0:20.409–0:22.000
ja並且落地了牛市生成。
0:22.000–0:31.500
ja甚至現在,你看到的這個語音輸入法,就是用它做的。
0:32.500–0:33.547
ja操作介面上,
0:33.547–0:34.769
ja基礎用法沒變,
0:34.769–0:37.213
ja主要改動是增加了多語言支持,
0:37.213–0:38.784
jaGGUF量化轉換,
0:38.784–0:40.180
ja還有音色庫管理。
0:40.700–0:43.157
ja接下來,我先挑幾個有特點的新模型,
0:43.157–0:44.312
ja直接給你看效果,
0:44.312–0:46.480
ja再詳細介紹前面那個語音輸入法。
0:46.480–0:48.813
ja然後是這次很重要的一個能力,
0:48.813–0:49.980
jaGGUF量化,
0:49.980–0:52.480
ja最後統一說一下整合包怎麼升級,
0:52.480–0:54.480
ja以及模型下載的一些細節。
0:54.480–0:56.980
ja上次沒講到的地方,這次一起補上。
0:56.980–1:01.980
ja先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
1:01.980–1:06.980
enTTS裡最有特點的是,Index TTS2和Supertonic3。
1:06.980–1:11.480
jaIndex TTS2,它支持從文本內容推斷語氣的聲音合成。
1:11.480–1:12.615
ja高級參數裡,
1:12.615–1:14.318
ja寫上情感參考文本,
1:14.318–1:17.156
ja模型會根據這段文本來推斷情緒,
1:17.156–1:18.480
ja然後合成語音。
1:18.480–1:23.480
ja比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
1:23.480–1:27.480
ja請把桌上的文件整理好,下午3點前交給我。
1:27.480–1:32.480
ja我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
1:32.480–1:36.480
ja請把桌上的文件整理好,下午3點前交給我。
1:36.480–1:41.480
ja如果去掉情感參考文本,勾選從朗讀文本推斷。
1:41.480–1:43.480
ja那合成出來的就是這種效果。
1:43.480–1:48.480
ja請把桌上的文件整理好,下午3點前交給我。
1:48.480–1:51.480
ja需要注意的是,Index TTS2比較吃顯存。
1:51.480–1:57.480
ja顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
1:57.480–2:01.480
jaSupertonic3的特點是速度快,而且支持流式生存。
2:01.480–2:03.480
ja生存模式切換到流式。
2:03.480–2:07.480
ja第一次生存會重載後台服務,會多出一段加載時間。
2:07.480–2:11.480
ja第二次就快了,所以建議第一次用一小段文本來預熱一下。
2:11.480–2:12.480
ja看,我明白你什麼想的。
2:12.480–2:14.480
ja他再次回到,
2:14.480–2:15.480
ja男人在金色衣服,
2:15.480–2:17.480
ja男人在走動的心靈跟一路復動的問題,
2:17.480–2:20.480
ja正在做一場文件,像是一場文件的議題。
2:20.480–2:23.480
ja流式的好處主要體現在長文本合成上,
2:23.480–2:25.480
ja可以邊合成邊輸出語音。
2:25.480–2:28.480
ja不用像離線模式那樣,要等所有文本合成結束,
2:28.480–2:30.480
ja才返回完整的語音。
2:30.480–2:32.480
ja需要注意的是,這個模型不支持中文。
2:32.480–2:36.480
ja中文的流式合成現在只有Vox CP-M2支持,
2:36.480–2:38.480
ja不過目前效果還在優化當中。
2:38.480–2:41.480
ja但首次延遲高,流式生存,
2:41.480–2:44.480
ja則邊接受文字,邊分段合成。
2:44.480–2:47.480
ja中間有卡頓,想使用中文流式可以再等等。
2:47.480–2:50.480
jaTTS說完,再看語音轉寫。
2:50.480–2:52.480
ja這次也新增了五個模型。
2:52.480–2:56.480
ja先說結論,中文轉寫推薦用千問3ASR 1.7B,
2:56.480–3:00.480
ja準確率相當高,顯存夠的話就用Vib Voice ASR,
3:00.480–3:03.480
ja能力更強,不精準還支持多人對話。
3:03.480–3:06.480
en要速度就用Limotron 3.5ASR 0.6B,
3:06.480–3:09.480
ja但它中文識別的準確率要差一些。
3:09.480–3:12.480
ja這是同一段音頻三個模型的識別對比,
3:12.480–3:14.480
ja我把他們的結果丟給AI打分。
3:14.480–3:17.480
ja最終判定千問3ASR 1.7B,
3:17.480–3:18.480
ja轉寫的最準確。
3:18.480–3:21.480
enLimotron 3.5ASR 0.6B,
3:21.480–3:23.480
ja同時支持離線和流式,
3:23.480–3:25.480
ja勾選最下面的流式轉寫,
3:25.480–3:27.480
ja它就會邊識別邊吐字。
3:27.480–3:29.480
ja這種模式非常適合語音輸入,
3:29.480–3:31.480
ja實施對話這些場景,
3:31.480–3:33.480
ja不用等音頻全部識別完才返回結果。
3:33.480–3:36.480
ja我本地的語音輸入就是拿它做的。
3:36.480–3:39.480
ja具體實施過程其實不複雜。
3:39.480–3:41.480
ja我先寫了一份大致需求,
3:41.480–3:43.480
ja描述下功能要求,
3:43.480–3:44.480
ja然後交給Codex。
3:44.480–3:46.480
ja因為服務端是現成的,
3:46.480–3:48.480
ja直接調用AudioCPP的服務。
3:48.480–3:50.480
ja代碼只需要做語音輸入發送,
3:50.480–3:51.480
ja顯示這一層。
3:51.480–3:53.480
ja大概半小時就完成了,
3:53.480–3:55.480
ja後面調適用了10分鐘左右。
3:55.480–3:57.480
ja具體用法,
3:57.480–4:00.480
en先啟動Run Server ASR Stream服務,
4:00.480–4:02.480
en再運行Speak Type。
4:02.480–4:05.480
ja按住Ctrl加Shift加空格,
4:05.480–4:06.480
ja打開麥克風。
4:06.480–4:08.480
ja然後把光標放進你的文本編輯軟件裡。
4:08.480–4:09.480
ja記事本,
4:09.480–4:10.480
enObsidian都可以,
4:10.480–4:11.480
ja對著麥克風說話,
4:11.480–4:13.480
ja內容就直接轉寫過來了。
4:13.480–4:15.480
ja這次升級真正重要的,
4:15.480–4:18.480
ja不是模型又多了幾個。
4:18.480–4:19.480
ja如果想換行,
4:19.480–4:21.480
ja期間你說完一句打個回車。
4:21.480–4:22.480
ja需要說明一點,
4:22.480–4:24.480
ja這程序只是個DEMO,
4:24.480–4:26.480
ja主要是為了驗證用AudioCPP,
4:26.480–4:28.480
ja開發落地應用的可能性。
4:28.480–4:31.480
ja在它上面可以開發出WebUI界面,
4:31.480–4:33.480
ja可以做實施語音對話,
4:33.480–4:35.480
ja可以接OpenAI風格的API,
4:35.480–4:37.480
ja往下還有剛才的語音輸入,
4:37.480–4:39.480
ja瀏覽器擴展以及其他桌面應用等等,
4:39.480–4:40.480
ja都可以做。
4:40.480–4:41.480
ja現在回過頭,
4:41.480–4:44.480
ja把這次介面上的幾個改動過一遍。
4:44.480–4:45.480
ja右上角語言,
4:45.480–4:47.480
ja現在支持繁體和英文,
4:47.480–4:49.480
ja切換時大概有一到兩秒的延時。
4:49.480–4:52.480
ja另一個新增功能是內置音頻管理。
4:52.480–4:54.480
ja上傳參考音頻,
4:54.480–4:55.480
ja寫好對應的文本,
4:55.480–4:57.480
ja然後點保存,
4:57.480–4:59.480
ja就會自動存到內置音頻列表裡。
4:59.480–5:01.480
ja不用的可以選中刪除。
5:01.480–5:04.480
ja界面上這次最大的功能更新,
5:04.480–5:05.480
ja是模型的量化管理。
5:05.480–5:07.480
en點開GGUF,
5:07.480–5:08.480
ja下面提示可轉換的,
5:08.480–5:10.480
ja就能進行量化。
5:10.480–5:11.480
ja先選幾位量化,
5:11.480–5:13.480
ja然後點轉換按鈕。
5:13.480–5:15.480
ja量化的好處是顯存佔用更小。
5:15.480–5:17.480
ja對於沒有顯卡的機器,
5:17.480–5:19.480
jaCPU運行量化板速度也更快。
5:19.480–5:21.480
ja比如這個VibeOS ASR模型,
5:21.480–5:23.480
ja原始模型加載後,
5:23.480–5:24.480
ja大概要占16G顯存。
5:24.480–5:26.480
ja8G顯存根本就跑不動。
5:26.480–5:28.480
ja但把它轉成Q4量化板以後,
5:28.480–5:30.480
ja加載就沒問題了。
5:30.480–5:32.480
ja但是大參數模型轉換比較慢,
5:32.480–5:34.480
ja像我這次用了20多分鐘。
5:34.480–5:36.480
ja當有GGUF時,
5:36.480–5:38.480
ja點這裡加載模型,
5:38.480–5:40.480
ja後台服務會優先加載量化板。
5:40.480–5:41.480
ja需要提醒一點,
5:41.480–5:45.480
ja目前AudioCPP並不支持其他框架轉換的GGUF,
5:45.480–5:47.480
ja並且也只有部分模型現在可以轉換。
5:47.480–5:49.480
ja在列表裡選模型時,
5:49.480–5:51.480
ja能不能轉換下面都有提示。
5:51.480–5:53.480
ja轉好的量化板不想用也可以直接轉換。
5:53.480–5:55.480
ja就能恢復原始權重。
5:55.480–5:59.480
ja目前AudioCPP已經完整支持30個語音模型。
5:59.480–6:01.480
ja所有模型的能力特點,
6:01.480–6:03.480
ja我都整理成了配套筆記。
6:03.480–6:05.480
ja可以通過這張表格來數查。
6:05.480–6:07.480
ja鏈接我放在評論區置頂。
6:07.480–6:09.480
ja最後說下整合包怎麼升級,
6:09.480–6:10.480
ja以及模型下載。
6:10.480–6:13.480
ja第一個鏈接是新的完整版整合包。
6:13.480–6:14.480
ja如果你之前沒安裝過,
6:14.480–6:15.480
ja就下這個。
6:15.480–6:16.480
ja上期安裝過的,
6:16.480–6:18.480
ja點第二個鏈接下載升級包。
6:18.480–6:19.480
ja解壓以後,
6:19.480–6:20.480
ja複製裡面的所有文件,
6:20.480–6:22.480
ja覆蓋到原來整合包目錄下。
6:22.480–6:24.480
ja然後全部替換,
6:24.480–6:25.480
ja就升級好了。
6:25.480–6:26.480
ja以後更新,
6:26.480–6:27.480
ja可以直接點update。
6:27.480–6:28.480
ja程序會自動檢測,
6:28.480–6:30.480
ja有新版本會自動下載。
6:30.480–6:32.480
ja雙擊Run WebUI打開界面。
6:32.480–6:34.480
ja這個啟動窗口第一次要等幾十秒。
6:34.480–6:36.480
ja程序加載完會自動打開網頁。
6:36.480–6:38.480
ja再說下模型下載。
6:38.480–6:40.480
ja目前AudioCPP的模型
6:40.480–6:42.480
ja都要從Hugging Face上下載。
6:42.480–6:44.480
ja並且不支持手動放模型。
6:44.480–6:46.480
ja國內網絡如果下載有問題,
6:46.480–6:48.480
ja可以試一下這裡填上代理地址。
6:48.480–6:49.480
ja另外有個別模型,
6:49.480–6:51.480
en像Stable Audio這個系列,
6:51.480–6:53.480
ja需要在Hugging Face上申請。
6:53.480–6:55.480
ja具體操作步驟是這樣。
6:55.480–6:57.480
ja先註册一個免費的Hugging Face帳號,
6:57.480–6:59.480
ja然後到這個地址填寫申請表單。
6:59.480–7:01.480
ja申請通過後,
7:01.480–7:03.480
ja在典禮的Hugging Face頭像,
7:03.480–7:04.480
ja菜單底部訪問Token。
7:04.480–7:06.480
ja創建一個新Token,
7:06.480–7:07.480
ja選紙讀。
7:07.480–7:09.480
ja複製創建的Token,
7:09.480–7:11.480
ja粘貼到WebUI的Token框裡,
7:11.480–7:13.480
ja就可以下載模型了。
7:13.480–7:15.480
ja模型下載機制,
7:15.480–7:16.480
ja是先在Modus目錄下,
7:16.480–7:18.480
ja創建一個臨時下載目錄,
7:18.480–7:19.480
ja就是這個文件夾。
7:19.480–7:21.480
ja既然能看到正在下載的模型。
7:21.480–7:23.480
ja全部下載完成後,
7:23.480–7:26.480
ja程序會自動創建重命名模型文件夾。
7:26.480–7:28.480
ja下載過程中中斷也沒關係。
7:28.480–7:30.480
ja繼續點下載按鈕,
7:30.480–7:31.480
ja會斷點續傳。
7:31.480–7:34.480
ja下載完成後點刷新,
7:34.480–7:35.480
ja就可以下載模型了。
7:35.480–7:37.480
ja程序也會自检模型文件
7:37.480–7:38.480
ja的完整性。
7:38.480–7:40.480
ja缺文件會提示模型不完整。
7:40.480–7:42.480
ja新商手的朋友,
7:42.480–7:44.480
ja想了解介面基礎操作,
7:44.480–7:45.480
ja以及其他常用模型,
7:45.480–7:48.480
ja可以看語音AI系統化的那期視頻。
7:48.480–7:50.480
ja本期視頻的配套筆記,
7:50.480–7:51.480
ja鏈接我放在評論區置頂。
7:51.480–7:53.480
ja整個包使用中的問題,
7:53.480–7:54.480
ja或者好的點子想法,
7:54.480–7:56.480
ja都可以在評論區留言。
7:56.480–7:58.480
ja我會定期收集整理,更新版本。
7:58.480–8:00.480
ja這裡是AI探索與發現,
8:00.480–8:01.480
ja感謝觀看,下期見。
8:07.480–8:09.016
ja我們在評論區,
0:00.000–0:03.000
請評估本項目加入中英文支持。
0:08.000–0:10.705
上期視頻我介紹了Audio CPP,
0:10.705–0:13.727
當時我把它比作音頻版的Nama CPP,
0:13.727–0:14.841
僅僅過了幾天,
0:14.841–0:16.114
它又一次大升級,
0:16.114–0:18.341
不僅一口氣新增了10個模型,
0:18.341–0:20.409
還支持加載GGUF量化版,
0:20.409–0:22.000
並且落地了牛市生成。
0:22.000–0:31.500
甚至現在,你看到的這個語音輸入法,就是用它做的。
0:32.500–0:33.547
操作介面上,
0:33.547–0:34.769
基礎用法沒變,
0:34.769–0:37.213
主要改動是增加了多語言支持,
0:37.213–0:38.784
GGUF量化轉換,
0:38.784–0:40.180
還有音色庫管理。
0:40.700–0:43.157
接下來,我先挑幾個有特點的新模型,
0:43.157–0:44.312
直接給你看效果,
0:44.312–0:46.480
再詳細介紹前面那個語音輸入法。
0:46.480–0:48.813
然後是這次很重要的一個能力,
0:48.813–0:49.980
GGUF量化,
0:49.980–0:52.480
最後統一說一下整合包怎麼升級,
0:52.480–0:54.480
以及模型下載的一些細節。
0:54.480–0:56.980
上次沒講到的地方,這次一起補上。
0:56.980–1:01.980
先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
1:01.980–1:06.980
TTS裡最有特點的是,Index TTS2和Supertonic3。
1:06.980–1:11.480
Index TTS2,它支持從文本內容推斷語氣的聲音合成。
1:11.480–1:12.615
高級參數裡,
1:12.615–1:14.318
寫上情感參考文本,
1:14.318–1:17.156
模型會根據這段文本來推斷情緒,
1:17.156–1:18.480
然後合成語音。
1:18.480–1:23.480
比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
1:23.480–1:27.480
請把桌上的文件整理好,下午3點前交給我。
1:27.480–1:32.480
我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
1:32.480–1:36.480
請把桌上的文件整理好,下午3點前交給我。
1:36.480–1:41.480
如果去掉情感參考文本,勾選從朗讀文本推斷。
1:41.480–1:43.480
那合成出來的就是這種效果。
1:43.480–1:48.480
請把桌上的文件整理好,下午3點前交給我。
1:48.480–1:51.480
需要注意的是,Index TTS2比較吃顯存。
1:51.480–1:57.480
顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
1:57.480–2:01.480
Supertonic3的特點是速度快,而且支持流式生存。
2:01.480–2:03.480
生存模式切換到流式。
2:03.480–2:07.480
第一次生存會重載後台服務,會多出一段加載時間。
2:07.480–2:11.480
第二次就快了,所以建議第一次用一小段文本來預熱一下。
2:11.480–2:12.480
看,我明白你什麼想的。
2:12.480–2:14.480
他再次回到,
2:14.480–2:15.480
男人在金色衣服,
2:15.480–2:17.480
男人在走動的心靈跟一路復動的問題,
2:17.480–2:20.480
正在做一場文件,像是一場文件的議題。
2:20.480–2:23.480
流式的好處主要體現在長文本合成上,
2:23.480–2:25.480
可以邊合成邊輸出語音。
2:25.480–2:28.480
不用像離線模式那樣,要等所有文本合成結束,
2:28.480–2:30.480
才返回完整的語音。
2:30.480–2:32.480
需要注意的是,這個模型不支持中文。
2:32.480–2:36.480
中文的流式合成現在只有Vox CP-M2支持,
2:36.480–2:38.480
不過目前效果還在優化當中。
2:38.480–2:41.480
但首次延遲高,流式生存,
2:41.480–2:44.480
則邊接受文字,邊分段合成。
2:44.480–2:47.480
中間有卡頓,想使用中文流式可以再等等。
2:47.480–2:50.480
TTS說完,再看語音轉寫。
2:50.480–2:52.480
這次也新增了五個模型。
2:52.480–2:56.480
先說結論,中文轉寫推薦用千問3ASR 1.7B,
2:56.480–3:00.480
準確率相當高,顯存夠的話就用Vib Voice ASR,
3:00.480–3:03.480
能力更強,不精準還支持多人對話。
3:03.480–3:06.480
要速度就用Limotron 3.5ASR 0.6B,
3:06.480–3:09.480
但它中文識別的準確率要差一些。
3:09.480–3:12.480
這是同一段音頻三個模型的識別對比,
3:12.480–3:14.480
我把他們的結果丟給AI打分。
3:14.480–3:17.480
最終判定千問3ASR 1.7B,
3:17.480–3:18.480
轉寫的最準確。
3:18.480–3:21.480
Limotron 3.5ASR 0.6B,
3:21.480–3:23.480
同時支持離線和流式,
3:23.480–3:25.480
勾選最下面的流式轉寫,
3:25.480–3:27.480
它就會邊識別邊吐字。
3:27.480–3:29.480
這種模式非常適合語音輸入,
3:29.480–3:31.480
實施對話這些場景,
3:31.480–3:33.480
不用等音頻全部識別完才返回結果。
3:33.480–3:36.480
我本地的語音輸入就是拿它做的。
3:36.480–3:39.480
具體實施過程其實不複雜。
3:39.480–3:41.480
我先寫了一份大致需求,
3:41.480–3:43.480
描述下功能要求,
3:43.480–3:44.480
然後交給Codex。
3:44.480–3:46.480
因為服務端是現成的,
3:46.480–3:48.480
直接調用AudioCPP的服務。
3:48.480–3:50.480
代碼只需要做語音輸入發送,
3:50.480–3:51.480
顯示這一層。
3:51.480–3:53.480
大概半小時就完成了,
3:53.480–3:55.480
後面調適用了10分鐘左右。
3:55.480–3:57.480
具體用法,
3:57.480–4:00.480
先啟動Run Server ASR Stream服務,
4:00.480–4:02.480
再運行Speak Type。
4:02.480–4:05.480
按住Ctrl加Shift加空格,
4:05.480–4:06.480
打開麥克風。
4:06.480–4:08.480
然後把光標放進你的文本編輯軟件裡。
4:08.480–4:09.480
記事本,
4:09.480–4:10.480
Obsidian都可以,
4:10.480–4:11.480
對著麥克風說話,
4:11.480–4:13.480
內容就直接轉寫過來了。
4:13.480–4:15.480
這次升級真正重要的,
4:15.480–4:18.480
不是模型又多了幾個。
4:18.480–4:19.480
如果想換行,
4:19.480–4:21.480
期間你說完一句打個回車。
4:21.480–4:22.480
需要說明一點,
4:22.480–4:24.480
這程序只是個DEMO,
4:24.480–4:26.480
主要是為了驗證用AudioCPP,
4:26.480–4:28.480
開發落地應用的可能性。
4:28.480–4:31.480
在它上面可以開發出WebUI界面,
4:31.480–4:33.480
可以做實施語音對話,
4:33.480–4:35.480
可以接OpenAI風格的API,
4:35.480–4:37.480
往下還有剛才的語音輸入,
4:37.480–4:39.480
瀏覽器擴展以及其他桌面應用等等,
4:39.480–4:40.480
都可以做。
4:40.480–4:41.480
現在回過頭,
4:41.480–4:44.480
把這次介面上的幾個改動過一遍。
4:44.480–4:45.480
右上角語言,
4:45.480–4:47.480
現在支持繁體和英文,
4:47.480–4:49.480
切換時大概有一到兩秒的延時。
4:49.480–4:52.480
另一個新增功能是內置音頻管理。
4:52.480–4:54.480
上傳參考音頻,
4:54.480–4:55.480
寫好對應的文本,
4:55.480–4:57.480
然後點保存,
4:57.480–4:59.480
就會自動存到內置音頻列表裡。
4:59.480–5:01.480
不用的可以選中刪除。
5:01.480–5:04.480
界面上這次最大的功能更新,
5:04.480–5:05.480
是模型的量化管理。
5:05.480–5:07.480
點開GGUF,
5:07.480–5:08.480
下面提示可轉換的,
5:08.480–5:10.480
就能進行量化。
5:10.480–5:11.480
先選幾位量化,
5:11.480–5:13.480
然後點轉換按鈕。
5:13.480–5:15.480
量化的好處是顯存佔用更小。
5:15.480–5:17.480
對於沒有顯卡的機器,
5:17.480–5:19.480
CPU運行量化板速度也更快。
5:19.480–5:21.480
比如這個VibeOS ASR模型,
5:21.480–5:23.480
原始模型加載後,
5:23.480–5:24.480
大概要占16G顯存。
5:24.480–5:26.480
8G顯存根本就跑不動。
5:26.480–5:28.480
但把它轉成Q4量化板以後,
5:28.480–5:30.480
加載就沒問題了。
5:30.480–5:32.480
但是大參數模型轉換比較慢,
5:32.480–5:34.480
像我這次用了20多分鐘。
5:34.480–5:36.480
當有GGUF時,
5:36.480–5:38.480
點這裡加載模型,
5:38.480–5:40.480
後台服務會優先加載量化板。
5:40.480–5:41.480
需要提醒一點,
5:41.480–5:45.480
目前AudioCPP並不支持其他框架轉換的GGUF,
5:45.480–5:47.480
並且也只有部分模型現在可以轉換。
5:47.480–5:49.480
在列表裡選模型時,
5:49.480–5:51.480
能不能轉換下面都有提示。
5:51.480–5:53.480
轉好的量化板不想用也可以直接轉換。
5:53.480–5:55.480
就能恢復原始權重。
5:55.480–5:59.480
目前AudioCPP已經完整支持30個語音模型。
5:59.480–6:01.480
所有模型的能力特點,
6:01.480–6:03.480
我都整理成了配套筆記。
6:03.480–6:05.480
可以通過這張表格來數查。
6:05.480–6:07.480
鏈接我放在評論區置頂。
6:07.480–6:09.480
最後說下整合包怎麼升級,
6:09.480–6:10.480
以及模型下載。
6:10.480–6:13.480
第一個鏈接是新的完整版整合包。
6:13.480–6:14.480
如果你之前沒安裝過,
6:14.480–6:15.480
就下這個。
6:15.480–6:16.480
上期安裝過的,
6:16.480–6:18.480
點第二個鏈接下載升級包。
6:18.480–6:19.480
解壓以後,
6:19.480–6:20.480
複製裡面的所有文件,
6:20.480–6:22.480
覆蓋到原來整合包目錄下。
6:22.480–6:24.480
然後全部替換,
6:24.480–6:25.480
就升級好了。
6:25.480–6:26.480
以後更新,
6:26.480–6:27.480
可以直接點update。
6:27.480–6:28.480
程序會自動檢測,
6:28.480–6:30.480
有新版本會自動下載。
6:30.480–6:32.480
雙擊Run WebUI打開界面。
6:32.480–6:34.480
這個啟動窗口第一次要等幾十秒。
6:34.480–6:36.480
程序加載完會自動打開網頁。
6:36.480–6:38.480
再說下模型下載。
6:38.480–6:40.480
目前AudioCPP的模型
6:40.480–6:42.480
都要從Hugging Face上下載。
6:42.480–6:44.480
並且不支持手動放模型。
6:44.480–6:46.480
國內網絡如果下載有問題,
6:46.480–6:48.480
可以試一下這裡填上代理地址。
6:48.480–6:49.480
另外有個別模型,
6:49.480–6:51.480
像Stable Audio這個系列,
6:51.480–6:53.480
需要在Hugging Face上申請。
6:53.480–6:55.480
具體操作步驟是這樣。
6:55.480–6:57.480
先註册一個免費的Hugging Face帳號,
6:57.480–6:59.480
然後到這個地址填寫申請表單。
6:59.480–7:01.480
申請通過後,
7:01.480–7:03.480
在典禮的Hugging Face頭像,
7:03.480–7:04.480
菜單底部訪問Token。
7:04.480–7:06.480
創建一個新Token,
7:06.480–7:07.480
選紙讀。
7:07.480–7:09.480
複製創建的Token,
7:09.480–7:11.480
粘貼到WebUI的Token框裡,
7:11.480–7:13.480
就可以下載模型了。
7:13.480–7:15.480
模型下載機制,
7:15.480–7:16.480
是先在Modus目錄下,
7:16.480–7:18.480
創建一個臨時下載目錄,
7:18.480–7:19.480
就是這個文件夾。
7:19.480–7:21.480
既然能看到正在下載的模型。
7:21.480–7:23.480
全部下載完成後,
7:23.480–7:26.480
程序會自動創建重命名模型文件夾。
7:26.480–7:28.480
下載過程中中斷也沒關係。
7:28.480–7:30.480
繼續點下載按鈕,
7:30.480–7:31.480
會斷點續傳。
7:31.480–7:34.480
下載完成後點刷新,
7:34.480–7:35.480
就可以下載模型了。
7:35.480–7:37.480
程序也會自检模型文件
7:37.480–7:38.480
的完整性。
7:38.480–7:40.480
缺文件會提示模型不完整。
7:40.480–7:42.480
新商手的朋友,
7:42.480–7:44.480
想了解介面基礎操作,
7:44.480–7:45.480
以及其他常用模型,
7:45.480–7:48.480
可以看語音AI系統化的那期視頻。
7:48.480–7:50.480
本期視頻的配套筆記,
7:50.480–7:51.480
鏈接我放在評論區置頂。
7:51.480–7:53.480
整個包使用中的問題,
7:53.480–7:54.480
或者好的點子想法,
7:54.480–7:56.480
都可以在評論區留言。
7:56.480–7:58.480
我會定期收集整理,更新版本。
7:58.480–8:00.480
這裡是AI探索與發現,
8:00.480–8:01.480
感謝觀看,下期見。
8:07.480–8:09.016
我們在評論區,
0:00.000–0:03.000
ja請評估本項目加入中英文支持。
請評估本項目加入中英文支持。
0:08.000–0:10.705
ja上期視頻我介紹了Audio CPP,
上期視頻我介紹了Audio CPP,
0:10.705–0:13.727
ja當時我把它比作音頻版的Nama CPP,
當時我把它比作音頻版的Nama CPP,
0:13.727–0:14.841
ja僅僅過了幾天,
僅僅過了幾天,
0:14.841–0:16.114
ja它又一次大升級,
它又一次大升級,
0:16.114–0:18.341
ja不僅一口氣新增了10個模型,
不僅一口氣新增了10個模型,
0:18.341–0:20.409
ja還支持加載GGUF量化版,
還支持加載GGUF量化版,
0:20.409–0:22.000
ja並且落地了牛市生成。
並且落地了牛市生成。
0:22.000–0:31.500
ja甚至現在,你看到的這個語音輸入法,就是用它做的。
甚至現在,你看到的這個語音輸入法,就是用它做的。
0:32.500–0:33.547
ja操作介面上,
操作介面上,
0:33.547–0:34.769
ja基礎用法沒變,
基礎用法沒變,
0:34.769–0:37.213
ja主要改動是增加了多語言支持,
主要改動是增加了多語言支持,
0:37.213–0:38.784
jaGGUF量化轉換,
GGUF量化轉換,
0:38.784–0:40.180
ja還有音色庫管理。
還有音色庫管理。
0:40.700–0:43.157
ja接下來,我先挑幾個有特點的新模型,
接下來,我先挑幾個有特點的新模型,
0:43.157–0:44.312
ja直接給你看效果,
直接給你看效果,
0:44.312–0:46.480
ja再詳細介紹前面那個語音輸入法。
再詳細介紹前面那個語音輸入法。
0:46.480–0:48.813
ja然後是這次很重要的一個能力,
然後是這次很重要的一個能力,
0:48.813–0:49.980
jaGGUF量化,
GGUF量化,
0:49.980–0:52.480
ja最後統一說一下整合包怎麼升級,
最後統一說一下整合包怎麼升級,
0:52.480–0:54.480
ja以及模型下載的一些細節。
以及模型下載的一些細節。
0:54.480–0:56.980
ja上次沒講到的地方,這次一起補上。
上次沒講到的地方,這次一起補上。
0:56.980–1:01.980
ja先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
1:01.980–1:06.980
enTTS裡最有特點的是,Index TTS2和Supertonic3。
TTS裡最有特點的是,Index TTS2和Supertonic3。
1:06.980–1:11.480
jaIndex TTS2,它支持從文本內容推斷語氣的聲音合成。
Index TTS2,它支持從文本內容推斷語氣的聲音合成。
1:11.480–1:12.615
ja高級參數裡,
高級參數裡,
1:12.615–1:14.318
ja寫上情感參考文本,
寫上情感參考文本,
1:14.318–1:17.156
ja模型會根據這段文本來推斷情緒,
模型會根據這段文本來推斷情緒,
1:17.156–1:18.480
ja然後合成語音。
然後合成語音。
1:18.480–1:23.480
ja比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
1:23.480–1:27.480
ja請把桌上的文件整理好,下午3點前交給我。
請把桌上的文件整理好,下午3點前交給我。
1:27.480–1:32.480
ja我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
1:32.480–1:36.480
ja請把桌上的文件整理好,下午3點前交給我。
請把桌上的文件整理好,下午3點前交給我。
1:36.480–1:41.480
ja如果去掉情感參考文本,勾選從朗讀文本推斷。
如果去掉情感參考文本,勾選從朗讀文本推斷。
1:41.480–1:43.480
ja那合成出來的就是這種效果。
那合成出來的就是這種效果。
1:43.480–1:48.480
ja請把桌上的文件整理好,下午3點前交給我。
請把桌上的文件整理好,下午3點前交給我。
1:48.480–1:51.480
ja需要注意的是,Index TTS2比較吃顯存。
需要注意的是,Index TTS2比較吃顯存。
1:51.480–1:57.480
ja顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
1:57.480–2:01.480
jaSupertonic3的特點是速度快,而且支持流式生存。
Supertonic3的特點是速度快,而且支持流式生存。
2:01.480–2:03.480
ja生存模式切換到流式。
生存模式切換到流式。
2:03.480–2:07.480
ja第一次生存會重載後台服務,會多出一段加載時間。
第一次生存會重載後台服務,會多出一段加載時間。
2:07.480–2:11.480
ja第二次就快了,所以建議第一次用一小段文本來預熱一下。
第二次就快了,所以建議第一次用一小段文本來預熱一下。
2:11.480–2:12.480
ja看,我明白你什麼想的。
看,我明白你什麼想的。
2:12.480–2:14.480
ja他再次回到,
他再次回到,
2:14.480–2:15.480
ja男人在金色衣服,
男人在金色衣服,
2:15.480–2:17.480
ja男人在走動的心靈跟一路復動的問題,
男人在走動的心靈跟一路復動的問題,
2:17.480–2:20.480
ja正在做一場文件,像是一場文件的議題。
正在做一場文件,像是一場文件的議題。
2:20.480–2:23.480
ja流式的好處主要體現在長文本合成上,
流式的好處主要體現在長文本合成上,
2:23.480–2:25.480
ja可以邊合成邊輸出語音。
可以邊合成邊輸出語音。
2:25.480–2:28.480
ja不用像離線模式那樣,要等所有文本合成結束,
不用像離線模式那樣,要等所有文本合成結束,
2:28.480–2:30.480
ja才返回完整的語音。
才返回完整的語音。
2:30.480–2:32.480
ja需要注意的是,這個模型不支持中文。
需要注意的是,這個模型不支持中文。
2:32.480–2:36.480
ja中文的流式合成現在只有Vox CP-M2支持,
中文的流式合成現在只有Vox CP-M2支持,
2:36.480–2:38.480
ja不過目前效果還在優化當中。
不過目前效果還在優化當中。
2:38.480–2:41.480
ja但首次延遲高,流式生存,
但首次延遲高,流式生存,
2:41.480–2:44.480
ja則邊接受文字,邊分段合成。
則邊接受文字,邊分段合成。
2:44.480–2:47.480
ja中間有卡頓,想使用中文流式可以再等等。
中間有卡頓,想使用中文流式可以再等等。
2:47.480–2:50.480
jaTTS說完,再看語音轉寫。
TTS說完,再看語音轉寫。
2:50.480–2:52.480
ja這次也新增了五個模型。
這次也新增了五個模型。
2:52.480–2:56.480
ja先說結論,中文轉寫推薦用千問3ASR 1.7B,
先說結論,中文轉寫推薦用千問3ASR 1.7B,
2:56.480–3:00.480
ja準確率相當高,顯存夠的話就用Vib Voice ASR,
準確率相當高,顯存夠的話就用Vib Voice ASR,
3:00.480–3:03.480
ja能力更強,不精準還支持多人對話。
能力更強,不精準還支持多人對話。
3:03.480–3:06.480
en要速度就用Limotron 3.5ASR 0.6B,
要速度就用Limotron 3.5ASR 0.6B,
3:06.480–3:09.480
ja但它中文識別的準確率要差一些。
但它中文識別的準確率要差一些。
3:09.480–3:12.480
ja這是同一段音頻三個模型的識別對比,
這是同一段音頻三個模型的識別對比,
3:12.480–3:14.480
ja我把他們的結果丟給AI打分。
我把他們的結果丟給AI打分。
3:14.480–3:17.480
ja最終判定千問3ASR 1.7B,
最終判定千問3ASR 1.7B,
3:17.480–3:18.480
ja轉寫的最準確。
轉寫的最準確。
3:18.480–3:21.480
enLimotron 3.5ASR 0.6B,
Limotron 3.5ASR 0.6B,
3:21.480–3:23.480
ja同時支持離線和流式,
同時支持離線和流式,
3:23.480–3:25.480
ja勾選最下面的流式轉寫,
勾選最下面的流式轉寫,
3:25.480–3:27.480
ja它就會邊識別邊吐字。
它就會邊識別邊吐字。
3:27.480–3:29.480
ja這種模式非常適合語音輸入,
這種模式非常適合語音輸入,
3:29.480–3:31.480
ja實施對話這些場景,
實施對話這些場景,
3:31.480–3:33.480
ja不用等音頻全部識別完才返回結果。
不用等音頻全部識別完才返回結果。
3:33.480–3:36.480
ja我本地的語音輸入就是拿它做的。
我本地的語音輸入就是拿它做的。
3:36.480–3:39.480
ja具體實施過程其實不複雜。
具體實施過程其實不複雜。
3:39.480–3:41.480
ja我先寫了一份大致需求,
我先寫了一份大致需求,
3:41.480–3:43.480
ja描述下功能要求,
描述下功能要求,
3:43.480–3:44.480
ja然後交給Codex。
然後交給Codex。
3:44.480–3:46.480
ja因為服務端是現成的,
因為服務端是現成的,
3:46.480–3:48.480
ja直接調用AudioCPP的服務。
直接調用AudioCPP的服務。
3:48.480–3:50.480
ja代碼只需要做語音輸入發送,
代碼只需要做語音輸入發送,
3:50.480–3:51.480
ja顯示這一層。
顯示這一層。
3:51.480–3:53.480
ja大概半小時就完成了,
大概半小時就完成了,
3:53.480–3:55.480
ja後面調適用了10分鐘左右。
後面調適用了10分鐘左右。
3:55.480–3:57.480
ja具體用法,
具體用法,
3:57.480–4:00.480
en先啟動Run Server ASR Stream服務,
先啟動Run Server ASR Stream服務,
4:00.480–4:02.480
en再運行Speak Type。
再運行Speak Type。
4:02.480–4:05.480
ja按住Ctrl加Shift加空格,
按住Ctrl加Shift加空格,
4:05.480–4:06.480
ja打開麥克風。
打開麥克風。
4:06.480–4:08.480
ja然後把光標放進你的文本編輯軟件裡。
然後把光標放進你的文本編輯軟件裡。
4:08.480–4:09.480
ja記事本,
記事本,
4:09.480–4:10.480
enObsidian都可以,
Obsidian都可以,
4:10.480–4:11.480
ja對著麥克風說話,
對著麥克風說話,
4:11.480–4:13.480
ja內容就直接轉寫過來了。
內容就直接轉寫過來了。
4:13.480–4:15.480
ja這次升級真正重要的,
這次升級真正重要的,
4:15.480–4:18.480
ja不是模型又多了幾個。
不是模型又多了幾個。
4:18.480–4:19.480
ja如果想換行,
如果想換行,
4:19.480–4:21.480
ja期間你說完一句打個回車。
期間你說完一句打個回車。
4:21.480–4:22.480
ja需要說明一點,
需要說明一點,
4:22.480–4:24.480
ja這程序只是個DEMO,
這程序只是個DEMO,
4:24.480–4:26.480
ja主要是為了驗證用AudioCPP,
主要是為了驗證用AudioCPP,
4:26.480–4:28.480
ja開發落地應用的可能性。
開發落地應用的可能性。
4:28.480–4:31.480
ja在它上面可以開發出WebUI界面,
在它上面可以開發出WebUI界面,
4:31.480–4:33.480
ja可以做實施語音對話,
可以做實施語音對話,
4:33.480–4:35.480
ja可以接OpenAI風格的API,
可以接OpenAI風格的API,
4:35.480–4:37.480
ja往下還有剛才的語音輸入,
往下還有剛才的語音輸入,
4:37.480–4:39.480
ja瀏覽器擴展以及其他桌面應用等等,
瀏覽器擴展以及其他桌面應用等等,
4:39.480–4:40.480
ja都可以做。
都可以做。
4:40.480–4:41.480
ja現在回過頭,
現在回過頭,
4:41.480–4:44.480
ja把這次介面上的幾個改動過一遍。
把這次介面上的幾個改動過一遍。
4:44.480–4:45.480
ja右上角語言,
右上角語言,
4:45.480–4:47.480
ja現在支持繁體和英文,
現在支持繁體和英文,
4:47.480–4:49.480
ja切換時大概有一到兩秒的延時。
切換時大概有一到兩秒的延時。
4:49.480–4:52.480
ja另一個新增功能是內置音頻管理。
另一個新增功能是內置音頻管理。
4:52.480–4:54.480
ja上傳參考音頻,
上傳參考音頻,
4:54.480–4:55.480
ja寫好對應的文本,
寫好對應的文本,
4:55.480–4:57.480
ja然後點保存,
然後點保存,
4:57.480–4:59.480
ja就會自動存到內置音頻列表裡。
就會自動存到內置音頻列表裡。
4:59.480–5:01.480
ja不用的可以選中刪除。
不用的可以選中刪除。
5:01.480–5:04.480
ja界面上這次最大的功能更新,
界面上這次最大的功能更新,
5:04.480–5:05.480
ja是模型的量化管理。
是模型的量化管理。
5:05.480–5:07.480
en點開GGUF,
點開GGUF,
5:07.480–5:08.480
ja下面提示可轉換的,
下面提示可轉換的,
5:08.480–5:10.480
ja就能進行量化。
就能進行量化。
5:10.480–5:11.480
ja先選幾位量化,
先選幾位量化,
5:11.480–5:13.480
ja然後點轉換按鈕。
然後點轉換按鈕。
5:13.480–5:15.480
ja量化的好處是顯存佔用更小。
量化的好處是顯存佔用更小。
5:15.480–5:17.480
ja對於沒有顯卡的機器,
對於沒有顯卡的機器,
5:17.480–5:19.480
jaCPU運行量化板速度也更快。
CPU運行量化板速度也更快。
5:19.480–5:21.480
ja比如這個VibeOS ASR模型,
比如這個VibeOS ASR模型,
5:21.480–5:23.480
ja原始模型加載後,
原始模型加載後,
5:23.480–5:24.480
ja大概要占16G顯存。
大概要占16G顯存。
5:24.480–5:26.480
ja8G顯存根本就跑不動。
8G顯存根本就跑不動。
5:26.480–5:28.480
ja但把它轉成Q4量化板以後,
但把它轉成Q4量化板以後,
5:28.480–5:30.480
ja加載就沒問題了。
加載就沒問題了。
5:30.480–5:32.480
ja但是大參數模型轉換比較慢,
但是大參數模型轉換比較慢,
5:32.480–5:34.480
ja像我這次用了20多分鐘。
像我這次用了20多分鐘。
5:34.480–5:36.480
ja當有GGUF時,
當有GGUF時,
5:36.480–5:38.480
ja點這裡加載模型,
點這裡加載模型,
5:38.480–5:40.480
ja後台服務會優先加載量化板。
後台服務會優先加載量化板。
5:40.480–5:41.480
ja需要提醒一點,
需要提醒一點,
5:41.480–5:45.480
ja目前AudioCPP並不支持其他框架轉換的GGUF,
目前AudioCPP並不支持其他框架轉換的GGUF,
5:45.480–5:47.480
ja並且也只有部分模型現在可以轉換。
並且也只有部分模型現在可以轉換。
5:47.480–5:49.480
ja在列表裡選模型時,
在列表裡選模型時,
5:49.480–5:51.480
ja能不能轉換下面都有提示。
能不能轉換下面都有提示。
5:51.480–5:53.480
ja轉好的量化板不想用也可以直接轉換。
轉好的量化板不想用也可以直接轉換。
5:53.480–5:55.480
ja就能恢復原始權重。
就能恢復原始權重。
5:55.480–5:59.480
ja目前AudioCPP已經完整支持30個語音模型。
目前AudioCPP已經完整支持30個語音模型。
5:59.480–6:01.480
ja所有模型的能力特點,
所有模型的能力特點,
6:01.480–6:03.480
ja我都整理成了配套筆記。
我都整理成了配套筆記。
6:03.480–6:05.480
ja可以通過這張表格來數查。
可以通過這張表格來數查。
6:05.480–6:07.480
ja鏈接我放在評論區置頂。
鏈接我放在評論區置頂。
6:07.480–6:09.480
ja最後說下整合包怎麼升級,
最後說下整合包怎麼升級,
6:09.480–6:10.480
ja以及模型下載。
以及模型下載。
6:10.480–6:13.480
ja第一個鏈接是新的完整版整合包。
第一個鏈接是新的完整版整合包。
6:13.480–6:14.480
ja如果你之前沒安裝過,
如果你之前沒安裝過,
6:14.480–6:15.480
ja就下這個。
就下這個。
6:15.480–6:16.480
ja上期安裝過的,
上期安裝過的,
6:16.480–6:18.480
ja點第二個鏈接下載升級包。
點第二個鏈接下載升級包。
6:18.480–6:19.480
ja解壓以後,
解壓以後,
6:19.480–6:20.480
ja複製裡面的所有文件,
複製裡面的所有文件,
6:20.480–6:22.480
ja覆蓋到原來整合包目錄下。
覆蓋到原來整合包目錄下。
6:22.480–6:24.480
ja然後全部替換,
然後全部替換,
6:24.480–6:25.480
ja就升級好了。
就升級好了。
6:25.480–6:26.480
ja以後更新,
以後更新,
6:26.480–6:27.480
ja可以直接點update。
可以直接點update。
6:27.480–6:28.480
ja程序會自動檢測,
程序會自動檢測,
6:28.480–6:30.480
ja有新版本會自動下載。
有新版本會自動下載。
6:30.480–6:32.480
ja雙擊Run WebUI打開界面。
雙擊Run WebUI打開界面。
6:32.480–6:34.480
ja這個啟動窗口第一次要等幾十秒。
這個啟動窗口第一次要等幾十秒。
6:34.480–6:36.480
ja程序加載完會自動打開網頁。
程序加載完會自動打開網頁。
6:36.480–6:38.480
ja再說下模型下載。
再說下模型下載。
6:38.480–6:40.480
ja目前AudioCPP的模型
目前AudioCPP的模型
6:40.480–6:42.480
ja都要從Hugging Face上下載。
都要從Hugging Face上下載。
6:42.480–6:44.480
ja並且不支持手動放模型。
並且不支持手動放模型。
6:44.480–6:46.480
ja國內網絡如果下載有問題,
國內網絡如果下載有問題,
6:46.480–6:48.480
ja可以試一下這裡填上代理地址。
可以試一下這裡填上代理地址。
6:48.480–6:49.480
ja另外有個別模型,
另外有個別模型,
6:49.480–6:51.480
en像Stable Audio這個系列,
像Stable Audio這個系列,
6:51.480–6:53.480
ja需要在Hugging Face上申請。
需要在Hugging Face上申請。
6:53.480–6:55.480
ja具體操作步驟是這樣。
具體操作步驟是這樣。
6:55.480–6:57.480
ja先註册一個免費的Hugging Face帳號,
先註册一個免費的Hugging Face帳號,
6:57.480–6:59.480
ja然後到這個地址填寫申請表單。
然後到這個地址填寫申請表單。
6:59.480–7:01.480
ja申請通過後,
申請通過後,
7:01.480–7:03.480
ja在典禮的Hugging Face頭像,
在典禮的Hugging Face頭像,
7:03.480–7:04.480
ja菜單底部訪問Token。
菜單底部訪問Token。
7:04.480–7:06.480
ja創建一個新Token,
創建一個新Token,
7:06.480–7:07.480
ja選紙讀。
選紙讀。
7:07.480–7:09.480
ja複製創建的Token,
複製創建的Token,
7:09.480–7:11.480
ja粘貼到WebUI的Token框裡,
粘貼到WebUI的Token框裡,
7:11.480–7:13.480
ja就可以下載模型了。
就可以下載模型了。
7:13.480–7:15.480
ja模型下載機制,
模型下載機制,
7:15.480–7:16.480
ja是先在Modus目錄下,
是先在Modus目錄下,
7:16.480–7:18.480
ja創建一個臨時下載目錄,
創建一個臨時下載目錄,
7:18.480–7:19.480
ja就是這個文件夾。
就是這個文件夾。
7:19.480–7:21.480
ja既然能看到正在下載的模型。
既然能看到正在下載的模型。
7:21.480–7:23.480
ja全部下載完成後,
全部下載完成後,
7:23.480–7:26.480
ja程序會自動創建重命名模型文件夾。
程序會自動創建重命名模型文件夾。
7:26.480–7:28.480
ja下載過程中中斷也沒關係。
下載過程中中斷也沒關係。
7:28.480–7:30.480
ja繼續點下載按鈕,
繼續點下載按鈕,
7:30.480–7:31.480
ja會斷點續傳。
會斷點續傳。
7:31.480–7:34.480
ja下載完成後點刷新,
下載完成後點刷新,
7:34.480–7:35.480
ja就可以下載模型了。
就可以下載模型了。
7:35.480–7:37.480
ja程序也會自检模型文件
程序也會自检模型文件
7:37.480–7:38.480
ja的完整性。
的完整性。
7:38.480–7:40.480
ja缺文件會提示模型不完整。
缺文件會提示模型不完整。
7:40.480–7:42.480
ja新商手的朋友,
新商手的朋友,
7:42.480–7:44.480
ja想了解介面基礎操作,
想了解介面基礎操作,
7:44.480–7:45.480
ja以及其他常用模型,
以及其他常用模型,
7:45.480–7:48.480
ja可以看語音AI系統化的那期視頻。
可以看語音AI系統化的那期視頻。
7:48.480–7:50.480
ja本期視頻的配套筆記,
本期視頻的配套筆記,
7:50.480–7:51.480
ja鏈接我放在評論區置頂。
鏈接我放在評論區置頂。
7:51.480–7:53.480
ja整個包使用中的問題,
整個包使用中的問題,
7:53.480–7:54.480
ja或者好的點子想法,
或者好的點子想法,
7:54.480–7:56.480
ja都可以在評論區留言。
都可以在評論區留言。
7:56.480–7:58.480
ja我會定期收集整理,更新版本。
我會定期收集整理,更新版本。
7:58.480–8:00.480
ja這裡是AI探索與發現,
這裡是AI探索與發現,
8:00.480–8:01.480
ja感謝觀看,下期見。
感謝觀看,下期見。
8:07.480–8:09.016
ja我們在評論區,
我們在評論區,

影片筆記:本地语音 AI 又升级了!10个新模型、GGUF量化、流式ASR语音输入|audio.cpp

一句話總結

Audio CPP 進行重大升級,新增 10 個模型(總計支持 30 個語音模型),支援 GGUF 量化以降低顯存佔用,並提供繁體中文介面。影片演示了如何利用該工具開發「語音輸入法」,涵蓋了從模型下載、量化轉換到實際應用開發的完整流程。

核心重點

  1. 模型擴充與多語言支援
  • Audio CPP 新增 10 個模型,總計完整支持 30 個語音模型。
  • 涵蓋 TTS(文字轉語音)與 ASR(語音轉文字)兩大領域。
  • 介面新增繁體中文與英文支援。
  1. GGUF 量化技術
  • 內建模型量化轉換功能,將模型轉換為 GGUF 格式。
  • 優點:大幅降低顯存佔用,使低顯存設備或無顯卡機器(使用 CPU)運行成為可能。
  • 機制:當存在 GGUF 文件時,後台服務優先加載量化版;若不想使用,可轉換恢復原始權重。
  1. 新模型特性與限制
  • TTS 方面
  • Index TTS2:支持從文本內容推斷語氣(情感參考文本),但較吃顯存。
  • Supertonic3:速度快,支持流式合成(Streaming),但不支援中文。
  • Vox CP-M2:目前僅此模型支援中文流式合成,但效果仍在優化,首次延遲高且有卡頓。
  • ASR 方面
  • 千問 3 ASR 1.7B:中文轉寫準確率相當高。
  • Vib Voice ASR:能力更強,支持多人對話,需足夠顯存。
  • Limotron 3.5 ASR 0.6B:速度快,但中文識別準確率較差;支持離線和流式轉寫,適合語音輸入場景。
  1. 應用落地實戰(語音輸入法)
  • 開發流程簡便:撰寫需求 -> 交給 Codex 生成代碼 -> 服務端調用 Audio CPP -> 前端處理顯示。
  • 開發耗時約半小時,調試約 10 分鐘。
  • 操作方式:按住 Ctrl + Shift + 空格 打開麥克風,在文本編輯軟件中說話即可直接轉寫。
  1. 整合包升級與模型下載機制
  • 升級方式:新安裝下載完整版,舊版升級下載升級包覆蓋原目錄。
  • 模型下載:必須從 Hugging Face 下載,不支持手動放置模型。
  • 特殊模型:部分模型(如 Stable Audio 系列)需申請權限並設置 Token。
  • 下載過程:支持斷點續傳,完成後程序自動創建文件夾並自檢完整性。

詳細大綱

I. 升級概覽與新功能

  • 版本更新:Audio CPP 進行大升級,新增 10 個模型,支持 GGUF 量化版加載。
  • 介面變更
  • 新增多語言支持(繁體中文、英文)。
  • 新增內置音頻管理功能(上傳參考音頻與文本保存)。
  • 新增模型量化管理功能。
  • 應用案例:演示了基於 Audio CPP 開發的語音輸入法。

II. 新增 TTS 模型介紹

  • Index TTS2
  • 特點:支持從文本內容推斷語氣的聲音合成。
  • 操作:在高級參數填寫「情感參考文本」,模型會根據文本情緒合成語音(如憤怒、失望)。
  • 參數調整:可調整「情感強度」(如 0.8)。
  • 推斷模式:若無情感參考文本,可勾選「從朗讀文本推斷」。
  • 注意事項:較吃顯存,低顯存建議使用 MOS 系列或千問 3 TTS 0.6b。
  • Supertonic3
  • 特點:速度快,支持流式合成(Streaming)。
  • 操作:切換至流式模式。
  • 注意事項
  • 首次合成需重載後台服務,有加載時間,建議先用短文本預熱。
  • 不支持中文
  • 中文流式合成目前僅 Vox CP-M2 支持,但效果仍在優化,首次延遲高且有卡頓。
  • 優勢:長文本合成可邊合成邊輸出,無需等待全部結束。

III. 新增 ASR 模型介紹

  • 模型對比與推薦
  • 中文轉寫推薦:千問 3 ASR 1.7B(準確率相當高)。
  • 高性能推薦:Vib Voice ASR(能力更強,支持多人對話,需足夠顯存)。
  • 速度推薦:Limotron 3.5 ASR 0.6B(速度快,但中文識別準確率較差)。
  • Limotron 3.5 ASR 0.6B 特性
  • 同時支持離線和流式轉寫。
  • 勾選「流式轉寫」可邊識別邊吐字,適合語音輸入、即時對話場景。
  • 本地語音輸入法即基於此模型開發。

IV. 語音輸入法開發實戰

  • 開發流程
  1. 撰寫大致需求描述。
  2. 交給 Codex 生成代碼。
  3. 服務端直接調用 Audio CPP 服務。
  4. 代碼僅需處理語音輸入發送與顯示層。
  5. 開發耗時約半小時,調試約 10 分鐘。
  • 使用步驟
  1. 啟動 Run Server ASR Stream 服務。
  2. 運行 Speak Type。
  3. 按住 Ctrl + Shift + 空格 打開麥克風。
  4. 將光標置於文本編輯軟件(如記事本、Obsidian)中說話,內容直接轉寫。
  • 定位說明:此程序為 DEMO,旨在驗證 Audio CPP 開發落地應用(如 WebUI、即時語音對話、OpenAI 風格 API、瀏覽器擴展等)的可能性。

V. 介面功能詳細說明

  • 語言切換:右上角語言支持繁體和英文,切換時約有 1-2 秒延時。
  • 音頻管理
  • 上傳參考音頻並寫入對應文本。
  • 點擊保存後自動存入內置音頻列表。
  • 可選中刪除不用的音頻。
  • GGUF 量化管理
  • 功能:將模型轉換為 GGUF 格式。
  • 優點:顯存佔用更小;無顯卡機器使用 CPU 運行量化版速度更快。
  • 案例:VibeOS ASR 原始模型需 16G 顯存,轉為 Q4 量化版後 8G 顯存即可運行。
  • 限制
  • Audio CPP 不支持其他框架轉換的 GGUF。
  • 僅部分模型可轉換(列表中有提示)。
  • 大參數模型轉換耗時長(約 20 多分鐘)。
  • 加載邏輯:當存在 GGUF 文件時,後台服務優先加載量化版。
  • 還原:量化版不想用可直接轉換恢復原始權重。

VI. 整合包升級與模型下載

  • 升級方式
  • 新安裝:下載新版完整版整合包。
  • 舊版升級:下載升級包,解壓後複製所有文件覆蓋原整合包目錄。
  • 未來更新:點擊 Update,程序自動檢測並下載新版本。
  • 啟動流程:雙擊 Run WebUI,首次啟動需等待幾十秒加載,隨後自動打開網頁。
  • 模型下載機制
  • 來源:必須從 Hugging Face 下載,不支持手動放置模型。
  • 網絡問題:國內下載受阻可填寫代理地址。
  • 特殊模型申請
  • 部分模型(如 Stable Audio 系列)需在 Hugging Face 申請權限。
  • 步驟:註冊免費帳號 -> 填寫申請表單 -> 通過後在頭像菜單底部訪問 Token -> 創建新 Token(選讀) -> 複製 Token 粘貼至 WebUI Token 框。
  • 下載過程
  • Modus 目錄下創建臨時下載目錄。
  • 支持斷點續傳(中斷後繼續點擊下載)。
  • 下載完成後程序自動創建/重命名模型文件夾。
  • 點擊刷新下載模型,程序會自檢文件完整性,缺失會提示不完整。

工具 / 模型 / 名詞整理

  • Audio CPP:影片主要介紹的本地語音 AI 工具。
  • Nama CPP:文中比喻為音頻版 Nama CPP。
  • Index TTS2:新增的 TTS 模型,支持情感推斷。
  • Supertonic3:新增的 TTS 模型,速度快,支持流式合成,不支持中文。
  • MOS 系列:低顯存建議使用的 TTS 模型系列。
  • 千問 3 TTS 0.6b:低顯存建議使用的 TTS 模型。
  • Vox CP-M2:目前僅此模型支援中文流式合成。
  • 千問 3 ASR 1.7B:推薦的中文轉寫 ASR 模型。
  • Vib Voice ASR:高性能 ASR 模型,支持多人對話。
  • Limotron 3.5 ASR 0.6B:速度快的 ASR 模型,用於開發語音輸入法。
  • Codex:用於生成代碼的 AI 工具。
  • Speak Type:開發的語音輸入法程序名稱。
  • Run Server ASR Stream:啟動 ASR 流式服務的指令/程序。
  • Run WebUI:啟動 WebUI 的指令/程序。
  • Hugging Face:模型下載來源平台。
  • Stable Audio:需申請權限的特殊模型系列。
  • WebUI:Audio CPP 的網頁用戶介面。
  • Obsidian:文本編輯軟件示例。
  • 記事本:文本編輯軟件示例。
  • GGUF:模型量化格式。
  • Q4 量化版:具體的量化級別。
  • VibeOS ASR:原始模型名稱,需 16G 顯存。
  • OpenAI 風格的 API:Audio CPP 可能支援的 API 格式。

操作流程整理

1. 升級 Audio CPP

  1. 新安裝:下載新版完整版整合包。
  2. 舊版升級:下載升級包,解壓後複製所有文件覆蓋原整合包目錄。
  3. 啟動:雙擊 Run WebUI,等待加載後自動打開網頁。

2. 下載與配置模型

  1. 準備 Hugging Face 帳號:註冊免費帳號。
  2. 申請權限(如需要)
  • 填寫申請表單。
  • 通過後,在頭像菜單底部訪問 Token。
  • 創建新 Token(選讀權限)。
  • 複製 Token 粘貼至 WebUI Token 框。
  1. 下載模型
  • 在 WebUI 中選擇模型點擊下載。
  • 若網絡受阻,填寫代理地址。
  • 程序在 Modus 目錄下創建臨時目錄並下載(支持斷點續傳)。
  • 下載完成後,程序自動創建/重命名模型文件夾。
  • 點擊刷新下載模型,程序自檢文件完整性。

3. 使用 GGUF 量化

  1. 在量化管理功能中,選擇支持的模型進行轉換。
  2. 等待轉換完成(大參數模型約需 20 多分鐘)。
  3. 重新啟動服務,後台服務會優先加載 GGUF 文件。
  4. 若不想使用量化版,可轉換恢復原始權重。

4. 開發與使用語音輸入法 (Speak Type)

  1. 開發階段
  • 撰寫需求描述。
  • 使用 Codex 生成代碼。
  • 服務端調用 Audio CPP 服務。
  1. 運行階段
  • 啟動 Run Server ASR Stream 服務。
  • 運行 Speak Type 程序。
  • 在文本編輯軟件(如記事本、Obsidian)中將光標置於輸入位置。
  • 按住 Ctrl + Shift + 空格 打開麥克風並說話。
  • 語音內容直接轉寫為文字。

值得注意的限制或風險

  1. 顯存需求
  • Index TTS2 較吃顯存,低顯存設備建議使用 MOS 系列或千問 3 TTS 0.6b。
  • Vib Voice ASR 需足夠顯存以支持多人對話。
  • VibeOS ASR 原始模型需 16G 顯存,量化後需 8G。
  1. 語言支援限制
  • Supertonic3 不支持中文。
  • Limotron 3.5 ASR 0.6B 中文識別準確率較差。
  • Vox CP-M2 中文流式合成效果仍在優化,首次延遲高且有卡頓。
  1. GGUF 轉換限制
  • Audio CPP 不支持其他框架轉換的 GGUF。
  • 僅部分模型可轉換。
  • 大參數模型轉換耗時長。
  1. 模型下載限制
  • 必須從 Hugging Face 下載,不支持手動放置模型文件。
  • 部分模型需單獨申請權限。
  1. 性能延遲
  • 語言切換時約有 1-2 秒延時。
  • Supertonic3 首次合成需重載後台服務,有加載時間。

逐字稿辨識疑點

  • Audio CPP:文中多次提及,疑似為特定軟體名稱,保留原樣。
  • Nama CPP:文中比喻用詞,保留原樣。
  • MOS 系列:文中提及「顯卡配置低的話,就用MOS系列」,疑點:具體指代不明,保留原樣。
  • 千問 3 TTS0.6b:文中寫法,疑點:通常模型版本號格式可能不同,保留原樣。
  • 流式生存:文中多次出現「流式生存」,疑點:語境為語音合成,應為「流式合成」之聽寫錯誤,但依規則標為疑點。
  • 生存模式:文中出現「生存模式切換到流式」,疑點:應為「合成模式」,保留原樣。
  • Limotron 3.5ASR 0.6B:文中提及,疑點:模型名稱拼寫需查證,保留原樣。
  • Vib Voice ASR:文中提及,疑點:與後文「VibeOS ASR」名稱不一致,保留原樣。
  • 實施對話:文中出現「實施對話」,疑點:語境應為「即時對話」,保留原樣。
  • 實施語音對話:文中出現,疑點:應為「即時語音對話」,保留原樣。
  • VibeOS ASR:文中提及,疑點:與前文「Vib Voice ASR」名稱不一致,保留原樣。
  • Stable Audio:文中提及,疑點:通常為 Stable Diffusion 或特定音頻模型,保留原樣。
  • Modus 目錄:文中提及下載目錄路徑,疑點:目錄名稱拼寫需查證,保留原樣。
  • 新商手:文中出現「新商手的朋友」,疑點:應為「新手」,保留原樣。
  • 典禮的 Hugging Face 頭像:文中出現「在典禮的 Hugging Face 頭像」,疑點:應為「點擊」或類似動詞,保留原樣。
  • 選紙讀:文中出現「選紙讀」,疑點:應為「選只讀」或類似權限選項,保留原樣。
  • 數查:文中出現「來數查」,疑點:應為「查詢」,保留原樣。

可延伸追

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習