0:00.000–0:03.000
ja請評估本項目加入中英文支持。
0:08.000–0:10.705
ja上期視頻我介紹了Audio CPP,
0:10.705–0:13.727
ja當時我把它比作音頻版的Nama CPP,
0:13.727–0:14.841
ja僅僅過了幾天,
0:14.841–0:16.114
ja它又一次大升級,
0:16.114–0:18.341
ja不僅一口氣新增了10個模型,
0:18.341–0:20.409
ja還支持加載GGUF量化版,
0:20.409–0:22.000
ja並且落地了牛市生成。
0:22.000–0:31.500
ja甚至現在,你看到的這個語音輸入法,就是用它做的。
0:32.500–0:33.547
ja操作介面上,
0:33.547–0:34.769
ja基礎用法沒變,
0:34.769–0:37.213
ja主要改動是增加了多語言支持,
0:37.213–0:38.784
jaGGUF量化轉換,
0:38.784–0:40.180
ja還有音色庫管理。
0:40.700–0:43.157
ja接下來,我先挑幾個有特點的新模型,
0:43.157–0:44.312
ja直接給你看效果,
0:44.312–0:46.480
ja再詳細介紹前面那個語音輸入法。
0:46.480–0:48.813
ja然後是這次很重要的一個能力,
0:48.813–0:49.980
jaGGUF量化,
0:49.980–0:52.480
ja最後統一說一下整合包怎麼升級,
0:52.480–0:54.480
ja以及模型下載的一些細節。
0:54.480–0:56.980
ja上次沒講到的地方,這次一起補上。
0:56.980–1:01.980
ja先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
1:01.980–1:06.980
enTTS裡最有特點的是,Index TTS2和Supertonic3。
1:06.980–1:11.480
jaIndex TTS2,它支持從文本內容推斷語氣的聲音合成。
1:11.480–1:12.615
ja高級參數裡,
1:12.615–1:14.318
ja寫上情感參考文本,
1:14.318–1:17.156
ja模型會根據這段文本來推斷情緒,
1:17.156–1:18.480
ja然後合成語音。
1:18.480–1:23.480
ja比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
1:23.480–1:27.480
ja請把桌上的文件整理好,下午3點前交給我。
1:27.480–1:32.480
ja我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
1:32.480–1:36.480
ja請把桌上的文件整理好,下午3點前交給我。
1:36.480–1:41.480
ja如果去掉情感參考文本,勾選從朗讀文本推斷。
1:41.480–1:43.480
ja那合成出來的就是這種效果。
1:43.480–1:48.480
ja請把桌上的文件整理好,下午3點前交給我。
1:48.480–1:51.480
ja需要注意的是,Index TTS2比較吃顯存。
1:51.480–1:57.480
ja顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
1:57.480–2:01.480
jaSupertonic3的特點是速度快,而且支持流式生存。
2:01.480–2:03.480
ja生存模式切換到流式。
2:03.480–2:07.480
ja第一次生存會重載後台服務,會多出一段加載時間。
2:07.480–2:11.480
ja第二次就快了,所以建議第一次用一小段文本來預熱一下。
2:11.480–2:12.480
ja看,我明白你什麼想的。
2:12.480–2:14.480
ja他再次回到,
2:14.480–2:15.480
ja男人在金色衣服,
2:15.480–2:17.480
ja男人在走動的心靈跟一路復動的問題,
2:17.480–2:20.480
ja正在做一場文件,像是一場文件的議題。
2:20.480–2:23.480
ja流式的好處主要體現在長文本合成上,
2:23.480–2:25.480
ja可以邊合成邊輸出語音。
2:25.480–2:28.480
ja不用像離線模式那樣,要等所有文本合成結束,
2:28.480–2:30.480
ja才返回完整的語音。
2:30.480–2:32.480
ja需要注意的是,這個模型不支持中文。
2:32.480–2:36.480
ja中文的流式合成現在只有Vox CP-M2支持,
2:36.480–2:38.480
ja不過目前效果還在優化當中。
2:38.480–2:41.480
ja但首次延遲高,流式生存,
2:41.480–2:44.480
ja則邊接受文字,邊分段合成。
2:44.480–2:47.480
ja中間有卡頓,想使用中文流式可以再等等。
2:47.480–2:50.480
jaTTS說完,再看語音轉寫。
2:50.480–2:52.480
ja這次也新增了五個模型。
2:52.480–2:56.480
ja先說結論,中文轉寫推薦用千問3ASR 1.7B,
2:56.480–3:00.480
ja準確率相當高,顯存夠的話就用Vib Voice ASR,
3:00.480–3:03.480
ja能力更強,不精準還支持多人對話。
3:03.480–3:06.480
en要速度就用Limotron 3.5ASR 0.6B,
3:06.480–3:09.480
ja但它中文識別的準確率要差一些。
3:09.480–3:12.480
ja這是同一段音頻三個模型的識別對比,
3:12.480–3:14.480
ja我把他們的結果丟給AI打分。
3:14.480–3:17.480
ja最終判定千問3ASR 1.7B,
3:17.480–3:18.480
ja轉寫的最準確。
3:18.480–3:21.480
enLimotron 3.5ASR 0.6B,
3:21.480–3:23.480
ja同時支持離線和流式,
3:23.480–3:25.480
ja勾選最下面的流式轉寫,
3:25.480–3:27.480
ja它就會邊識別邊吐字。
3:27.480–3:29.480
ja這種模式非常適合語音輸入,
3:29.480–3:31.480
ja實施對話這些場景,
3:31.480–3:33.480
ja不用等音頻全部識別完才返回結果。
3:33.480–3:36.480
ja我本地的語音輸入就是拿它做的。
3:36.480–3:39.480
ja具體實施過程其實不複雜。
3:39.480–3:41.480
ja我先寫了一份大致需求,
3:41.480–3:43.480
ja描述下功能要求,
3:43.480–3:44.480
ja然後交給Codex。
3:44.480–3:46.480
ja因為服務端是現成的,
3:46.480–3:48.480
ja直接調用AudioCPP的服務。
3:48.480–3:50.480
ja代碼只需要做語音輸入發送,
3:50.480–3:51.480
ja顯示這一層。
3:51.480–3:53.480
ja大概半小時就完成了,
3:53.480–3:55.480
ja後面調適用了10分鐘左右。
3:55.480–3:57.480
ja具體用法,
3:57.480–4:00.480
en先啟動Run Server ASR Stream服務,
4:00.480–4:02.480
en再運行Speak Type。
4:02.480–4:05.480
ja按住Ctrl加Shift加空格,
4:05.480–4:06.480
ja打開麥克風。
4:06.480–4:08.480
ja然後把光標放進你的文本編輯軟件裡。
4:08.480–4:09.480
ja記事本,
4:09.480–4:10.480
enObsidian都可以,
4:10.480–4:11.480
ja對著麥克風說話,
4:11.480–4:13.480
ja內容就直接轉寫過來了。
4:13.480–4:15.480
ja這次升級真正重要的,
4:15.480–4:18.480
ja不是模型又多了幾個。
4:18.480–4:19.480
ja如果想換行,
4:19.480–4:21.480
ja期間你說完一句打個回車。
4:21.480–4:22.480
ja需要說明一點,
4:22.480–4:24.480
ja這程序只是個DEMO,
4:24.480–4:26.480
ja主要是為了驗證用AudioCPP,
4:26.480–4:28.480
ja開發落地應用的可能性。
4:28.480–4:31.480
ja在它上面可以開發出WebUI界面,
4:31.480–4:33.480
ja可以做實施語音對話,
4:33.480–4:35.480
ja可以接OpenAI風格的API,
4:35.480–4:37.480
ja往下還有剛才的語音輸入,
4:37.480–4:39.480
ja瀏覽器擴展以及其他桌面應用等等,
4:39.480–4:40.480
ja都可以做。
4:40.480–4:41.480
ja現在回過頭,
4:41.480–4:44.480
ja把這次介面上的幾個改動過一遍。
4:44.480–4:45.480
ja右上角語言,
4:45.480–4:47.480
ja現在支持繁體和英文,
4:47.480–4:49.480
ja切換時大概有一到兩秒的延時。
4:49.480–4:52.480
ja另一個新增功能是內置音頻管理。
4:52.480–4:54.480
ja上傳參考音頻,
4:54.480–4:55.480
ja寫好對應的文本,
4:55.480–4:57.480
ja然後點保存,
4:57.480–4:59.480
ja就會自動存到內置音頻列表裡。
4:59.480–5:01.480
ja不用的可以選中刪除。
5:01.480–5:04.480
ja界面上這次最大的功能更新,
5:04.480–5:05.480
ja是模型的量化管理。
5:05.480–5:07.480
en點開GGUF,
5:07.480–5:08.480
ja下面提示可轉換的,
5:08.480–5:10.480
ja就能進行量化。
5:10.480–5:11.480
ja先選幾位量化,
5:11.480–5:13.480
ja然後點轉換按鈕。
5:13.480–5:15.480
ja量化的好處是顯存佔用更小。
5:15.480–5:17.480
ja對於沒有顯卡的機器,
5:17.480–5:19.480
jaCPU運行量化板速度也更快。
5:19.480–5:21.480
ja比如這個VibeOS ASR模型,
5:21.480–5:23.480
ja原始模型加載後,
5:23.480–5:24.480
ja大概要占16G顯存。
5:24.480–5:26.480
ja8G顯存根本就跑不動。
5:26.480–5:28.480
ja但把它轉成Q4量化板以後,
5:28.480–5:30.480
ja加載就沒問題了。
5:30.480–5:32.480
ja但是大參數模型轉換比較慢,
5:32.480–5:34.480
ja像我這次用了20多分鐘。
5:34.480–5:36.480
ja當有GGUF時,
5:36.480–5:38.480
ja點這裡加載模型,
5:38.480–5:40.480
ja後台服務會優先加載量化板。
5:40.480–5:41.480
ja需要提醒一點,
5:41.480–5:45.480
ja目前AudioCPP並不支持其他框架轉換的GGUF,
5:45.480–5:47.480
ja並且也只有部分模型現在可以轉換。
5:47.480–5:49.480
ja在列表裡選模型時,
5:49.480–5:51.480
ja能不能轉換下面都有提示。
5:51.480–5:53.480
ja轉好的量化板不想用也可以直接轉換。
5:53.480–5:55.480
ja就能恢復原始權重。
5:55.480–5:59.480
ja目前AudioCPP已經完整支持30個語音模型。
5:59.480–6:01.480
ja所有模型的能力特點,
6:01.480–6:03.480
ja我都整理成了配套筆記。
6:03.480–6:05.480
ja可以通過這張表格來數查。
6:05.480–6:07.480
ja鏈接我放在評論區置頂。
6:07.480–6:09.480
ja最後說下整合包怎麼升級,
6:09.480–6:10.480
ja以及模型下載。
6:10.480–6:13.480
ja第一個鏈接是新的完整版整合包。
6:13.480–6:14.480
ja如果你之前沒安裝過,
6:14.480–6:15.480
ja就下這個。
6:15.480–6:16.480
ja上期安裝過的,
6:16.480–6:18.480
ja點第二個鏈接下載升級包。
6:18.480–6:19.480
ja解壓以後,
6:19.480–6:20.480
ja複製裡面的所有文件,
6:20.480–6:22.480
ja覆蓋到原來整合包目錄下。
6:22.480–6:24.480
ja然後全部替換,
6:24.480–6:25.480
ja就升級好了。
6:25.480–6:26.480
ja以後更新,
6:26.480–6:27.480
ja可以直接點update。
6:27.480–6:28.480
ja程序會自動檢測,
6:28.480–6:30.480
ja有新版本會自動下載。
6:30.480–6:32.480
ja雙擊Run WebUI打開界面。
6:32.480–6:34.480
ja這個啟動窗口第一次要等幾十秒。
6:34.480–6:36.480
ja程序加載完會自動打開網頁。
6:36.480–6:38.480
ja再說下模型下載。
6:38.480–6:40.480
ja目前AudioCPP的模型
6:40.480–6:42.480
ja都要從Hugging Face上下載。
6:42.480–6:44.480
ja並且不支持手動放模型。
6:44.480–6:46.480
ja國內網絡如果下載有問題,
6:46.480–6:48.480
ja可以試一下這裡填上代理地址。
6:48.480–6:49.480
ja另外有個別模型,
6:49.480–6:51.480
en像Stable Audio這個系列,
6:51.480–6:53.480
ja需要在Hugging Face上申請。
6:53.480–6:55.480
ja具體操作步驟是這樣。
6:55.480–6:57.480
ja先註册一個免費的Hugging Face帳號,
6:57.480–6:59.480
ja然後到這個地址填寫申請表單。
6:59.480–7:01.480
ja申請通過後,
7:01.480–7:03.480
ja在典禮的Hugging Face頭像,
7:03.480–7:04.480
ja菜單底部訪問Token。
7:04.480–7:06.480
ja創建一個新Token,
7:06.480–7:07.480
ja選紙讀。
7:07.480–7:09.480
ja複製創建的Token,
7:09.480–7:11.480
ja粘貼到WebUI的Token框裡,
7:11.480–7:13.480
ja就可以下載模型了。
7:13.480–7:15.480
ja模型下載機制,
7:15.480–7:16.480
ja是先在Modus目錄下,
7:16.480–7:18.480
ja創建一個臨時下載目錄,
7:18.480–7:19.480
ja就是這個文件夾。
7:19.480–7:21.480
ja既然能看到正在下載的模型。
7:21.480–7:23.480
ja全部下載完成後,
7:23.480–7:26.480
ja程序會自動創建重命名模型文件夾。
7:26.480–7:28.480
ja下載過程中中斷也沒關係。
7:28.480–7:30.480
ja繼續點下載按鈕,
7:30.480–7:31.480
ja會斷點續傳。
7:31.480–7:34.480
ja下載完成後點刷新,
7:34.480–7:35.480
ja就可以下載模型了。
7:35.480–7:37.480
ja程序也會自检模型文件
7:37.480–7:38.480
ja的完整性。
7:38.480–7:40.480
ja缺文件會提示模型不完整。
7:40.480–7:42.480
ja新商手的朋友,
7:42.480–7:44.480
ja想了解介面基礎操作,
7:44.480–7:45.480
ja以及其他常用模型,
7:45.480–7:48.480
ja可以看語音AI系統化的那期視頻。
7:48.480–7:50.480
ja本期視頻的配套筆記,
7:50.480–7:51.480
ja鏈接我放在評論區置頂。
7:51.480–7:53.480
ja整個包使用中的問題,
7:53.480–7:54.480
ja或者好的點子想法,
7:54.480–7:56.480
ja都可以在評論區留言。
7:56.480–7:58.480
ja我會定期收集整理,更新版本。
7:58.480–8:00.480
ja這裡是AI探索與發現,
8:00.480–8:01.480
ja感謝觀看,下期見。
8:07.480–8:09.016
ja我們在評論區,
0:00.000–0:03.000
請評估本項目加入中英文支持。
0:08.000–0:10.705
上期視頻我介紹了Audio CPP,
0:10.705–0:13.727
當時我把它比作音頻版的Nama CPP,
0:13.727–0:14.841
僅僅過了幾天,
0:14.841–0:16.114
它又一次大升級,
0:16.114–0:18.341
不僅一口氣新增了10個模型,
0:18.341–0:20.409
還支持加載GGUF量化版,
0:20.409–0:22.000
並且落地了牛市生成。
0:22.000–0:31.500
甚至現在,你看到的這個語音輸入法,就是用它做的。
0:32.500–0:33.547
操作介面上,
0:33.547–0:34.769
基礎用法沒變,
0:34.769–0:37.213
主要改動是增加了多語言支持,
0:37.213–0:38.784
GGUF量化轉換,
0:38.784–0:40.180
還有音色庫管理。
0:40.700–0:43.157
接下來,我先挑幾個有特點的新模型,
0:43.157–0:44.312
直接給你看效果,
0:44.312–0:46.480
再詳細介紹前面那個語音輸入法。
0:46.480–0:48.813
然後是這次很重要的一個能力,
0:48.813–0:49.980
GGUF量化,
0:49.980–0:52.480
最後統一說一下整合包怎麼升級,
0:52.480–0:54.480
以及模型下載的一些細節。
0:54.480–0:56.980
上次沒講到的地方,這次一起補上。
0:56.980–1:01.980
先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
1:01.980–1:06.980
TTS裡最有特點的是,Index TTS2和Supertonic3。
1:06.980–1:11.480
Index TTS2,它支持從文本內容推斷語氣的聲音合成。
1:11.480–1:12.615
高級參數裡,
1:12.615–1:14.318
寫上情感參考文本,
1:14.318–1:17.156
模型會根據這段文本來推斷情緒,
1:17.156–1:18.480
然後合成語音。
1:18.480–1:23.480
比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
1:23.480–1:27.480
請把桌上的文件整理好,下午3點前交給我。
1:27.480–1:32.480
我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
1:32.480–1:36.480
請把桌上的文件整理好,下午3點前交給我。
1:36.480–1:41.480
如果去掉情感參考文本,勾選從朗讀文本推斷。
1:41.480–1:43.480
那合成出來的就是這種效果。
1:43.480–1:48.480
請把桌上的文件整理好,下午3點前交給我。
1:48.480–1:51.480
需要注意的是,Index TTS2比較吃顯存。
1:51.480–1:57.480
顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
1:57.480–2:01.480
Supertonic3的特點是速度快,而且支持流式生存。
2:01.480–2:03.480
生存模式切換到流式。
2:03.480–2:07.480
第一次生存會重載後台服務,會多出一段加載時間。
2:07.480–2:11.480
第二次就快了,所以建議第一次用一小段文本來預熱一下。
2:11.480–2:12.480
看,我明白你什麼想的。
2:12.480–2:14.480
他再次回到,
2:14.480–2:15.480
男人在金色衣服,
2:15.480–2:17.480
男人在走動的心靈跟一路復動的問題,
2:17.480–2:20.480
正在做一場文件,像是一場文件的議題。
2:20.480–2:23.480
流式的好處主要體現在長文本合成上,
2:23.480–2:25.480
可以邊合成邊輸出語音。
2:25.480–2:28.480
不用像離線模式那樣,要等所有文本合成結束,
2:28.480–2:30.480
才返回完整的語音。
2:30.480–2:32.480
需要注意的是,這個模型不支持中文。
2:32.480–2:36.480
中文的流式合成現在只有Vox CP-M2支持,
2:36.480–2:38.480
不過目前效果還在優化當中。
2:38.480–2:41.480
但首次延遲高,流式生存,
2:41.480–2:44.480
則邊接受文字,邊分段合成。
2:44.480–2:47.480
中間有卡頓,想使用中文流式可以再等等。
2:47.480–2:50.480
TTS說完,再看語音轉寫。
2:50.480–2:52.480
這次也新增了五個模型。
2:52.480–2:56.480
先說結論,中文轉寫推薦用千問3ASR 1.7B,
2:56.480–3:00.480
準確率相當高,顯存夠的話就用Vib Voice ASR,
3:00.480–3:03.480
能力更強,不精準還支持多人對話。
3:03.480–3:06.480
要速度就用Limotron 3.5ASR 0.6B,
3:06.480–3:09.480
但它中文識別的準確率要差一些。
3:09.480–3:12.480
這是同一段音頻三個模型的識別對比,
3:12.480–3:14.480
我把他們的結果丟給AI打分。
3:14.480–3:17.480
最終判定千問3ASR 1.7B,
3:17.480–3:18.480
轉寫的最準確。
3:18.480–3:21.480
Limotron 3.5ASR 0.6B,
3:21.480–3:23.480
同時支持離線和流式,
3:23.480–3:25.480
勾選最下面的流式轉寫,
3:25.480–3:27.480
它就會邊識別邊吐字。
3:27.480–3:29.480
這種模式非常適合語音輸入,
3:29.480–3:31.480
實施對話這些場景,
3:31.480–3:33.480
不用等音頻全部識別完才返回結果。
3:33.480–3:36.480
我本地的語音輸入就是拿它做的。
3:36.480–3:39.480
具體實施過程其實不複雜。
3:39.480–3:41.480
我先寫了一份大致需求,
3:41.480–3:43.480
描述下功能要求,
3:43.480–3:44.480
然後交給Codex。
3:44.480–3:46.480
因為服務端是現成的,
3:46.480–3:48.480
直接調用AudioCPP的服務。
3:48.480–3:50.480
代碼只需要做語音輸入發送,
3:50.480–3:51.480
顯示這一層。
3:51.480–3:53.480
大概半小時就完成了,
3:53.480–3:55.480
後面調適用了10分鐘左右。
3:55.480–3:57.480
具體用法,
3:57.480–4:00.480
先啟動Run Server ASR Stream服務,
4:00.480–4:02.480
再運行Speak Type。
4:02.480–4:05.480
按住Ctrl加Shift加空格,
4:05.480–4:06.480
打開麥克風。
4:06.480–4:08.480
然後把光標放進你的文本編輯軟件裡。
4:08.480–4:09.480
記事本,
4:09.480–4:10.480
Obsidian都可以,
4:10.480–4:11.480
對著麥克風說話,
4:11.480–4:13.480
內容就直接轉寫過來了。
4:13.480–4:15.480
這次升級真正重要的,
4:15.480–4:18.480
不是模型又多了幾個。
4:18.480–4:19.480
如果想換行,
4:19.480–4:21.480
期間你說完一句打個回車。
4:21.480–4:22.480
需要說明一點,
4:22.480–4:24.480
這程序只是個DEMO,
4:24.480–4:26.480
主要是為了驗證用AudioCPP,
4:26.480–4:28.480
開發落地應用的可能性。
4:28.480–4:31.480
在它上面可以開發出WebUI界面,
4:31.480–4:33.480
可以做實施語音對話,
4:33.480–4:35.480
可以接OpenAI風格的API,
4:35.480–4:37.480
往下還有剛才的語音輸入,
4:37.480–4:39.480
瀏覽器擴展以及其他桌面應用等等,
4:39.480–4:40.480
都可以做。
4:40.480–4:41.480
現在回過頭,
4:41.480–4:44.480
把這次介面上的幾個改動過一遍。
4:44.480–4:45.480
右上角語言,
4:45.480–4:47.480
現在支持繁體和英文,
4:47.480–4:49.480
切換時大概有一到兩秒的延時。
4:49.480–4:52.480
另一個新增功能是內置音頻管理。
4:52.480–4:54.480
上傳參考音頻,
4:54.480–4:55.480
寫好對應的文本,
4:55.480–4:57.480
然後點保存,
4:57.480–4:59.480
就會自動存到內置音頻列表裡。
4:59.480–5:01.480
不用的可以選中刪除。
5:01.480–5:04.480
界面上這次最大的功能更新,
5:04.480–5:05.480
是模型的量化管理。
5:05.480–5:07.480
點開GGUF,
5:07.480–5:08.480
下面提示可轉換的,
5:08.480–5:10.480
就能進行量化。
5:10.480–5:11.480
先選幾位量化,
5:11.480–5:13.480
然後點轉換按鈕。
5:13.480–5:15.480
量化的好處是顯存佔用更小。
5:15.480–5:17.480
對於沒有顯卡的機器,
5:17.480–5:19.480
CPU運行量化板速度也更快。
5:19.480–5:21.480
比如這個VibeOS ASR模型,
5:21.480–5:23.480
原始模型加載後,
5:23.480–5:24.480
大概要占16G顯存。
5:24.480–5:26.480
8G顯存根本就跑不動。
5:26.480–5:28.480
但把它轉成Q4量化板以後,
5:28.480–5:30.480
加載就沒問題了。
5:30.480–5:32.480
但是大參數模型轉換比較慢,
5:32.480–5:34.480
像我這次用了20多分鐘。
5:34.480–5:36.480
當有GGUF時,
5:36.480–5:38.480
點這裡加載模型,
5:38.480–5:40.480
後台服務會優先加載量化板。
5:40.480–5:41.480
需要提醒一點,
5:41.480–5:45.480
目前AudioCPP並不支持其他框架轉換的GGUF,
5:45.480–5:47.480
並且也只有部分模型現在可以轉換。
5:47.480–5:49.480
在列表裡選模型時,
5:49.480–5:51.480
能不能轉換下面都有提示。
5:51.480–5:53.480
轉好的量化板不想用也可以直接轉換。
5:53.480–5:55.480
就能恢復原始權重。
5:55.480–5:59.480
目前AudioCPP已經完整支持30個語音模型。
5:59.480–6:01.480
所有模型的能力特點,
6:01.480–6:03.480
我都整理成了配套筆記。
6:03.480–6:05.480
可以通過這張表格來數查。
6:05.480–6:07.480
鏈接我放在評論區置頂。
6:07.480–6:09.480
最後說下整合包怎麼升級,
6:09.480–6:10.480
以及模型下載。
6:10.480–6:13.480
第一個鏈接是新的完整版整合包。
6:13.480–6:14.480
如果你之前沒安裝過,
6:14.480–6:15.480
就下這個。
6:15.480–6:16.480
上期安裝過的,
6:16.480–6:18.480
點第二個鏈接下載升級包。
6:18.480–6:19.480
解壓以後,
6:19.480–6:20.480
複製裡面的所有文件,
6:20.480–6:22.480
覆蓋到原來整合包目錄下。
6:22.480–6:24.480
然後全部替換,
6:24.480–6:25.480
就升級好了。
6:25.480–6:26.480
以後更新,
6:26.480–6:27.480
可以直接點update。
6:27.480–6:28.480
程序會自動檢測,
6:28.480–6:30.480
有新版本會自動下載。
6:30.480–6:32.480
雙擊Run WebUI打開界面。
6:32.480–6:34.480
這個啟動窗口第一次要等幾十秒。
6:34.480–6:36.480
程序加載完會自動打開網頁。
6:36.480–6:38.480
再說下模型下載。
6:38.480–6:40.480
目前AudioCPP的模型
6:40.480–6:42.480
都要從Hugging Face上下載。
6:42.480–6:44.480
並且不支持手動放模型。
6:44.480–6:46.480
國內網絡如果下載有問題,
6:46.480–6:48.480
可以試一下這裡填上代理地址。
6:48.480–6:49.480
另外有個別模型,
6:49.480–6:51.480
像Stable Audio這個系列,
6:51.480–6:53.480
需要在Hugging Face上申請。
6:53.480–6:55.480
具體操作步驟是這樣。
6:55.480–6:57.480
先註册一個免費的Hugging Face帳號,
6:57.480–6:59.480
然後到這個地址填寫申請表單。
6:59.480–7:01.480
申請通過後,
7:01.480–7:03.480
在典禮的Hugging Face頭像,
7:03.480–7:04.480
菜單底部訪問Token。
7:04.480–7:06.480
創建一個新Token,
7:06.480–7:07.480
選紙讀。
7:07.480–7:09.480
複製創建的Token,
7:09.480–7:11.480
粘貼到WebUI的Token框裡,
7:11.480–7:13.480
就可以下載模型了。
7:13.480–7:15.480
模型下載機制,
7:15.480–7:16.480
是先在Modus目錄下,
7:16.480–7:18.480
創建一個臨時下載目錄,
7:18.480–7:19.480
就是這個文件夾。
7:19.480–7:21.480
既然能看到正在下載的模型。
7:21.480–7:23.480
全部下載完成後,
7:23.480–7:26.480
程序會自動創建重命名模型文件夾。
7:26.480–7:28.480
下載過程中中斷也沒關係。
7:28.480–7:30.480
繼續點下載按鈕,
7:30.480–7:31.480
會斷點續傳。
7:31.480–7:34.480
下載完成後點刷新,
7:34.480–7:35.480
就可以下載模型了。
7:35.480–7:37.480
程序也會自检模型文件
7:37.480–7:38.480
的完整性。
7:38.480–7:40.480
缺文件會提示模型不完整。
7:40.480–7:42.480
新商手的朋友,
7:42.480–7:44.480
想了解介面基礎操作,
7:44.480–7:45.480
以及其他常用模型,
7:45.480–7:48.480
可以看語音AI系統化的那期視頻。
7:48.480–7:50.480
本期視頻的配套筆記,
7:50.480–7:51.480
鏈接我放在評論區置頂。
7:51.480–7:53.480
整個包使用中的問題,
7:53.480–7:54.480
或者好的點子想法,
7:54.480–7:56.480
都可以在評論區留言。
7:56.480–7:58.480
我會定期收集整理,更新版本。
7:58.480–8:00.480
這裡是AI探索與發現,
8:00.480–8:01.480
感謝觀看,下期見。
8:07.480–8:09.016
我們在評論區,
0:00.000–0:03.000
ja請評估本項目加入中英文支持。
請評估本項目加入中英文支持。
0:08.000–0:10.705
ja上期視頻我介紹了Audio CPP,
上期視頻我介紹了Audio CPP,
0:10.705–0:13.727
ja當時我把它比作音頻版的Nama CPP,
當時我把它比作音頻版的Nama CPP,
0:13.727–0:14.841
ja僅僅過了幾天,
僅僅過了幾天,
0:14.841–0:16.114
ja它又一次大升級,
它又一次大升級,
0:16.114–0:18.341
ja不僅一口氣新增了10個模型,
不僅一口氣新增了10個模型,
0:18.341–0:20.409
ja還支持加載GGUF量化版,
還支持加載GGUF量化版,
0:20.409–0:22.000
ja並且落地了牛市生成。
並且落地了牛市生成。
0:22.000–0:31.500
ja甚至現在,你看到的這個語音輸入法,就是用它做的。
甚至現在,你看到的這個語音輸入法,就是用它做的。
0:32.500–0:33.547
ja操作介面上,
操作介面上,
0:33.547–0:34.769
ja基礎用法沒變,
基礎用法沒變,
0:34.769–0:37.213
ja主要改動是增加了多語言支持,
主要改動是增加了多語言支持,
0:37.213–0:38.784
jaGGUF量化轉換,
GGUF量化轉換,
0:38.784–0:40.180
ja還有音色庫管理。
還有音色庫管理。
0:40.700–0:43.157
ja接下來,我先挑幾個有特點的新模型,
接下來,我先挑幾個有特點的新模型,
0:43.157–0:44.312
ja直接給你看效果,
直接給你看效果,
0:44.312–0:46.480
ja再詳細介紹前面那個語音輸入法。
再詳細介紹前面那個語音輸入法。
0:46.480–0:48.813
ja然後是這次很重要的一個能力,
然後是這次很重要的一個能力,
0:48.813–0:49.980
jaGGUF量化,
GGUF量化,
0:49.980–0:52.480
ja最後統一說一下整合包怎麼升級,
最後統一說一下整合包怎麼升級,
0:52.480–0:54.480
ja以及模型下載的一些細節。
以及模型下載的一些細節。
0:54.480–0:56.980
ja上次沒講到的地方,這次一起補上。
上次沒講到的地方,這次一起補上。
0:56.980–1:01.980
ja先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。
1:01.980–1:06.980
enTTS裡最有特點的是,Index TTS2和Supertonic3。
TTS裡最有特點的是,Index TTS2和Supertonic3。
1:06.980–1:11.480
jaIndex TTS2,它支持從文本內容推斷語氣的聲音合成。
Index TTS2,它支持從文本內容推斷語氣的聲音合成。
1:11.480–1:12.615
ja高級參數裡,
高級參數裡,
1:12.615–1:14.318
ja寫上情感參考文本,
寫上情感參考文本,
1:14.318–1:17.156
ja模型會根據這段文本來推斷情緒,
模型會根據這段文本來推斷情緒,
1:17.156–1:18.480
ja然後合成語音。
然後合成語音。
1:18.480–1:23.480
ja比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。
1:23.480–1:27.480
ja請把桌上的文件整理好,下午3點前交給我。
請把桌上的文件整理好,下午3點前交給我。
1:27.480–1:32.480
ja我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。
1:32.480–1:36.480
ja請把桌上的文件整理好,下午3點前交給我。
請把桌上的文件整理好,下午3點前交給我。
1:36.480–1:41.480
ja如果去掉情感參考文本,勾選從朗讀文本推斷。
如果去掉情感參考文本,勾選從朗讀文本推斷。
1:41.480–1:43.480
ja那合成出來的就是這種效果。
那合成出來的就是這種效果。
1:43.480–1:48.480
ja請把桌上的文件整理好,下午3點前交給我。
請把桌上的文件整理好,下午3點前交給我。
1:48.480–1:51.480
ja需要注意的是,Index TTS2比較吃顯存。
需要注意的是,Index TTS2比較吃顯存。
1:51.480–1:57.480
ja顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。
1:57.480–2:01.480
jaSupertonic3的特點是速度快,而且支持流式生存。
Supertonic3的特點是速度快,而且支持流式生存。
2:01.480–2:03.480
ja生存模式切換到流式。
生存模式切換到流式。
2:03.480–2:07.480
ja第一次生存會重載後台服務,會多出一段加載時間。
第一次生存會重載後台服務,會多出一段加載時間。
2:07.480–2:11.480
ja第二次就快了,所以建議第一次用一小段文本來預熱一下。
第二次就快了,所以建議第一次用一小段文本來預熱一下。
2:11.480–2:12.480
ja看,我明白你什麼想的。
看,我明白你什麼想的。
2:12.480–2:14.480
ja他再次回到,
他再次回到,
2:14.480–2:15.480
ja男人在金色衣服,
男人在金色衣服,
2:15.480–2:17.480
ja男人在走動的心靈跟一路復動的問題,
男人在走動的心靈跟一路復動的問題,
2:17.480–2:20.480
ja正在做一場文件,像是一場文件的議題。
正在做一場文件,像是一場文件的議題。
2:20.480–2:23.480
ja流式的好處主要體現在長文本合成上,
流式的好處主要體現在長文本合成上,
2:23.480–2:25.480
ja可以邊合成邊輸出語音。
可以邊合成邊輸出語音。
2:25.480–2:28.480
ja不用像離線模式那樣,要等所有文本合成結束,
不用像離線模式那樣,要等所有文本合成結束,
2:28.480–2:30.480
ja才返回完整的語音。
才返回完整的語音。
2:30.480–2:32.480
ja需要注意的是,這個模型不支持中文。
需要注意的是,這個模型不支持中文。
2:32.480–2:36.480
ja中文的流式合成現在只有Vox CP-M2支持,
中文的流式合成現在只有Vox CP-M2支持,
2:36.480–2:38.480
ja不過目前效果還在優化當中。
不過目前效果還在優化當中。
2:38.480–2:41.480
ja但首次延遲高,流式生存,
但首次延遲高,流式生存,
2:41.480–2:44.480
ja則邊接受文字,邊分段合成。
則邊接受文字,邊分段合成。
2:44.480–2:47.480
ja中間有卡頓,想使用中文流式可以再等等。
中間有卡頓,想使用中文流式可以再等等。
2:47.480–2:50.480
jaTTS說完,再看語音轉寫。
TTS說完,再看語音轉寫。
2:50.480–2:52.480
ja這次也新增了五個模型。
這次也新增了五個模型。
2:52.480–2:56.480
ja先說結論,中文轉寫推薦用千問3ASR 1.7B,
先說結論,中文轉寫推薦用千問3ASR 1.7B,
2:56.480–3:00.480
ja準確率相當高,顯存夠的話就用Vib Voice ASR,
準確率相當高,顯存夠的話就用Vib Voice ASR,
3:00.480–3:03.480
ja能力更強,不精準還支持多人對話。
能力更強,不精準還支持多人對話。
3:03.480–3:06.480
en要速度就用Limotron 3.5ASR 0.6B,
要速度就用Limotron 3.5ASR 0.6B,
3:06.480–3:09.480
ja但它中文識別的準確率要差一些。
但它中文識別的準確率要差一些。
3:09.480–3:12.480
ja這是同一段音頻三個模型的識別對比,
這是同一段音頻三個模型的識別對比,
3:12.480–3:14.480
ja我把他們的結果丟給AI打分。
我把他們的結果丟給AI打分。
3:14.480–3:17.480
ja最終判定千問3ASR 1.7B,
最終判定千問3ASR 1.7B,
3:17.480–3:18.480
ja轉寫的最準確。
轉寫的最準確。
3:18.480–3:21.480
enLimotron 3.5ASR 0.6B,
Limotron 3.5ASR 0.6B,
3:21.480–3:23.480
ja同時支持離線和流式,
同時支持離線和流式,
3:23.480–3:25.480
ja勾選最下面的流式轉寫,
勾選最下面的流式轉寫,
3:25.480–3:27.480
ja它就會邊識別邊吐字。
它就會邊識別邊吐字。
3:27.480–3:29.480
ja這種模式非常適合語音輸入,
這種模式非常適合語音輸入,
3:29.480–3:31.480
ja實施對話這些場景,
實施對話這些場景,
3:31.480–3:33.480
ja不用等音頻全部識別完才返回結果。
不用等音頻全部識別完才返回結果。
3:33.480–3:36.480
ja我本地的語音輸入就是拿它做的。
我本地的語音輸入就是拿它做的。
3:36.480–3:39.480
ja具體實施過程其實不複雜。
具體實施過程其實不複雜。
3:39.480–3:41.480
ja我先寫了一份大致需求,
我先寫了一份大致需求,
3:41.480–3:43.480
ja描述下功能要求,
描述下功能要求,
3:43.480–3:44.480
ja然後交給Codex。
然後交給Codex。
3:44.480–3:46.480
ja因為服務端是現成的,
因為服務端是現成的,
3:46.480–3:48.480
ja直接調用AudioCPP的服務。
直接調用AudioCPP的服務。
3:48.480–3:50.480
ja代碼只需要做語音輸入發送,
代碼只需要做語音輸入發送,
3:50.480–3:51.480
ja顯示這一層。
顯示這一層。
3:51.480–3:53.480
ja大概半小時就完成了,
大概半小時就完成了,
3:53.480–3:55.480
ja後面調適用了10分鐘左右。
後面調適用了10分鐘左右。
3:55.480–3:57.480
ja具體用法,
具體用法,
3:57.480–4:00.480
en先啟動Run Server ASR Stream服務,
先啟動Run Server ASR Stream服務,
4:00.480–4:02.480
en再運行Speak Type。
再運行Speak Type。
4:02.480–4:05.480
ja按住Ctrl加Shift加空格,
按住Ctrl加Shift加空格,
4:05.480–4:06.480
ja打開麥克風。
打開麥克風。
4:06.480–4:08.480
ja然後把光標放進你的文本編輯軟件裡。
然後把光標放進你的文本編輯軟件裡。
4:08.480–4:09.480
ja記事本,
記事本,
4:09.480–4:10.480
enObsidian都可以,
Obsidian都可以,
4:10.480–4:11.480
ja對著麥克風說話,
對著麥克風說話,
4:11.480–4:13.480
ja內容就直接轉寫過來了。
內容就直接轉寫過來了。
4:13.480–4:15.480
ja這次升級真正重要的,
這次升級真正重要的,
4:15.480–4:18.480
ja不是模型又多了幾個。
不是模型又多了幾個。
4:18.480–4:19.480
ja如果想換行,
如果想換行,
4:19.480–4:21.480
ja期間你說完一句打個回車。
期間你說完一句打個回車。
4:21.480–4:22.480
ja需要說明一點,
需要說明一點,
4:22.480–4:24.480
ja這程序只是個DEMO,
這程序只是個DEMO,
4:24.480–4:26.480
ja主要是為了驗證用AudioCPP,
主要是為了驗證用AudioCPP,
4:26.480–4:28.480
ja開發落地應用的可能性。
開發落地應用的可能性。
4:28.480–4:31.480
ja在它上面可以開發出WebUI界面,
在它上面可以開發出WebUI界面,
4:31.480–4:33.480
ja可以做實施語音對話,
可以做實施語音對話,
4:33.480–4:35.480
ja可以接OpenAI風格的API,
可以接OpenAI風格的API,
4:35.480–4:37.480
ja往下還有剛才的語音輸入,
往下還有剛才的語音輸入,
4:37.480–4:39.480
ja瀏覽器擴展以及其他桌面應用等等,
瀏覽器擴展以及其他桌面應用等等,
4:39.480–4:40.480
ja都可以做。
都可以做。
4:40.480–4:41.480
ja現在回過頭,
現在回過頭,
4:41.480–4:44.480
ja把這次介面上的幾個改動過一遍。
把這次介面上的幾個改動過一遍。
4:44.480–4:45.480
ja右上角語言,
右上角語言,
4:45.480–4:47.480
ja現在支持繁體和英文,
現在支持繁體和英文,
4:47.480–4:49.480
ja切換時大概有一到兩秒的延時。
切換時大概有一到兩秒的延時。
4:49.480–4:52.480
ja另一個新增功能是內置音頻管理。
另一個新增功能是內置音頻管理。
4:52.480–4:54.480
ja上傳參考音頻,
上傳參考音頻,
4:54.480–4:55.480
ja寫好對應的文本,
寫好對應的文本,
4:55.480–4:57.480
ja然後點保存,
然後點保存,
4:57.480–4:59.480
ja就會自動存到內置音頻列表裡。
就會自動存到內置音頻列表裡。
4:59.480–5:01.480
ja不用的可以選中刪除。
不用的可以選中刪除。
5:01.480–5:04.480
ja界面上這次最大的功能更新,
界面上這次最大的功能更新,
5:04.480–5:05.480
ja是模型的量化管理。
是模型的量化管理。
5:05.480–5:07.480
en點開GGUF,
點開GGUF,
5:07.480–5:08.480
ja下面提示可轉換的,
下面提示可轉換的,
5:08.480–5:10.480
ja就能進行量化。
就能進行量化。
5:10.480–5:11.480
ja先選幾位量化,
先選幾位量化,
5:11.480–5:13.480
ja然後點轉換按鈕。
然後點轉換按鈕。
5:13.480–5:15.480
ja量化的好處是顯存佔用更小。
量化的好處是顯存佔用更小。
5:15.480–5:17.480
ja對於沒有顯卡的機器,
對於沒有顯卡的機器,
5:17.480–5:19.480
jaCPU運行量化板速度也更快。
CPU運行量化板速度也更快。
5:19.480–5:21.480
ja比如這個VibeOS ASR模型,
比如這個VibeOS ASR模型,
5:21.480–5:23.480
ja原始模型加載後,
原始模型加載後,
5:23.480–5:24.480
ja大概要占16G顯存。
大概要占16G顯存。
5:24.480–5:26.480
ja8G顯存根本就跑不動。
8G顯存根本就跑不動。
5:26.480–5:28.480
ja但把它轉成Q4量化板以後,
但把它轉成Q4量化板以後,
5:28.480–5:30.480
ja加載就沒問題了。
加載就沒問題了。
5:30.480–5:32.480
ja但是大參數模型轉換比較慢,
但是大參數模型轉換比較慢,
5:32.480–5:34.480
ja像我這次用了20多分鐘。
像我這次用了20多分鐘。
5:34.480–5:36.480
ja當有GGUF時,
當有GGUF時,
5:36.480–5:38.480
ja點這裡加載模型,
點這裡加載模型,
5:38.480–5:40.480
ja後台服務會優先加載量化板。
後台服務會優先加載量化板。
5:40.480–5:41.480
ja需要提醒一點,
需要提醒一點,
5:41.480–5:45.480
ja目前AudioCPP並不支持其他框架轉換的GGUF,
目前AudioCPP並不支持其他框架轉換的GGUF,
5:45.480–5:47.480
ja並且也只有部分模型現在可以轉換。
並且也只有部分模型現在可以轉換。
5:47.480–5:49.480
ja在列表裡選模型時,
在列表裡選模型時,
5:49.480–5:51.480
ja能不能轉換下面都有提示。
能不能轉換下面都有提示。
5:51.480–5:53.480
ja轉好的量化板不想用也可以直接轉換。
轉好的量化板不想用也可以直接轉換。
5:53.480–5:55.480
ja就能恢復原始權重。
就能恢復原始權重。
5:55.480–5:59.480
ja目前AudioCPP已經完整支持30個語音模型。
目前AudioCPP已經完整支持30個語音模型。
5:59.480–6:01.480
ja所有模型的能力特點,
所有模型的能力特點,
6:01.480–6:03.480
ja我都整理成了配套筆記。
我都整理成了配套筆記。
6:03.480–6:05.480
ja可以通過這張表格來數查。
可以通過這張表格來數查。
6:05.480–6:07.480
ja鏈接我放在評論區置頂。
鏈接我放在評論區置頂。
6:07.480–6:09.480
ja最後說下整合包怎麼升級,
最後說下整合包怎麼升級,
6:09.480–6:10.480
ja以及模型下載。
以及模型下載。
6:10.480–6:13.480
ja第一個鏈接是新的完整版整合包。
第一個鏈接是新的完整版整合包。
6:13.480–6:14.480
ja如果你之前沒安裝過,
如果你之前沒安裝過,
6:14.480–6:15.480
ja就下這個。
就下這個。
6:15.480–6:16.480
ja上期安裝過的,
上期安裝過的,
6:16.480–6:18.480
ja點第二個鏈接下載升級包。
點第二個鏈接下載升級包。
6:18.480–6:19.480
ja解壓以後,
解壓以後,
6:19.480–6:20.480
ja複製裡面的所有文件,
複製裡面的所有文件,
6:20.480–6:22.480
ja覆蓋到原來整合包目錄下。
覆蓋到原來整合包目錄下。
6:22.480–6:24.480
ja然後全部替換,
然後全部替換,
6:24.480–6:25.480
ja就升級好了。
就升級好了。
6:25.480–6:26.480
ja以後更新,
以後更新,
6:26.480–6:27.480
ja可以直接點update。
可以直接點update。
6:27.480–6:28.480
ja程序會自動檢測,
程序會自動檢測,
6:28.480–6:30.480
ja有新版本會自動下載。
有新版本會自動下載。
6:30.480–6:32.480
ja雙擊Run WebUI打開界面。
雙擊Run WebUI打開界面。
6:32.480–6:34.480
ja這個啟動窗口第一次要等幾十秒。
這個啟動窗口第一次要等幾十秒。
6:34.480–6:36.480
ja程序加載完會自動打開網頁。
程序加載完會自動打開網頁。
6:36.480–6:38.480
ja再說下模型下載。
再說下模型下載。
6:38.480–6:40.480
ja目前AudioCPP的模型
目前AudioCPP的模型
6:40.480–6:42.480
ja都要從Hugging Face上下載。
都要從Hugging Face上下載。
6:42.480–6:44.480
ja並且不支持手動放模型。
並且不支持手動放模型。
6:44.480–6:46.480
ja國內網絡如果下載有問題,
國內網絡如果下載有問題,
6:46.480–6:48.480
ja可以試一下這裡填上代理地址。
可以試一下這裡填上代理地址。
6:48.480–6:49.480
ja另外有個別模型,
另外有個別模型,
6:49.480–6:51.480
en像Stable Audio這個系列,
像Stable Audio這個系列,
6:51.480–6:53.480
ja需要在Hugging Face上申請。
需要在Hugging Face上申請。
6:53.480–6:55.480
ja具體操作步驟是這樣。
具體操作步驟是這樣。
6:55.480–6:57.480
ja先註册一個免費的Hugging Face帳號,
先註册一個免費的Hugging Face帳號,
6:57.480–6:59.480
ja然後到這個地址填寫申請表單。
然後到這個地址填寫申請表單。
6:59.480–7:01.480
ja申請通過後,
申請通過後,
7:01.480–7:03.480
ja在典禮的Hugging Face頭像,
在典禮的Hugging Face頭像,
7:03.480–7:04.480
ja菜單底部訪問Token。
菜單底部訪問Token。
7:04.480–7:06.480
ja創建一個新Token,
創建一個新Token,
7:06.480–7:07.480
ja選紙讀。
選紙讀。
7:07.480–7:09.480
ja複製創建的Token,
複製創建的Token,
7:09.480–7:11.480
ja粘貼到WebUI的Token框裡,
粘貼到WebUI的Token框裡,
7:11.480–7:13.480
ja就可以下載模型了。
就可以下載模型了。
7:13.480–7:15.480
ja模型下載機制,
模型下載機制,
7:15.480–7:16.480
ja是先在Modus目錄下,
是先在Modus目錄下,
7:16.480–7:18.480
ja創建一個臨時下載目錄,
創建一個臨時下載目錄,
7:18.480–7:19.480
ja就是這個文件夾。
就是這個文件夾。
7:19.480–7:21.480
ja既然能看到正在下載的模型。
既然能看到正在下載的模型。
7:21.480–7:23.480
ja全部下載完成後,
全部下載完成後,
7:23.480–7:26.480
ja程序會自動創建重命名模型文件夾。
程序會自動創建重命名模型文件夾。
7:26.480–7:28.480
ja下載過程中中斷也沒關係。
下載過程中中斷也沒關係。
7:28.480–7:30.480
ja繼續點下載按鈕,
繼續點下載按鈕,
7:30.480–7:31.480
ja會斷點續傳。
會斷點續傳。
7:31.480–7:34.480
ja下載完成後點刷新,
下載完成後點刷新,
7:34.480–7:35.480
ja就可以下載模型了。
就可以下載模型了。
7:35.480–7:37.480
ja程序也會自检模型文件
程序也會自检模型文件
7:37.480–7:38.480
ja的完整性。
的完整性。
7:38.480–7:40.480
ja缺文件會提示模型不完整。
缺文件會提示模型不完整。
7:40.480–7:42.480
ja新商手的朋友,
新商手的朋友,
7:42.480–7:44.480
ja想了解介面基礎操作,
想了解介面基礎操作,
7:44.480–7:45.480
ja以及其他常用模型,
以及其他常用模型,
7:45.480–7:48.480
ja可以看語音AI系統化的那期視頻。
可以看語音AI系統化的那期視頻。
7:48.480–7:50.480
ja本期視頻的配套筆記,
本期視頻的配套筆記,
7:50.480–7:51.480
ja鏈接我放在評論區置頂。
鏈接我放在評論區置頂。
7:51.480–7:53.480
ja整個包使用中的問題,
整個包使用中的問題,
7:53.480–7:54.480
ja或者好的點子想法,
或者好的點子想法,
7:54.480–7:56.480
ja都可以在評論區留言。
都可以在評論區留言。
7:56.480–7:58.480
ja我會定期收集整理,更新版本。
我會定期收集整理,更新版本。
7:58.480–8:00.480
ja這裡是AI探索與發現,
這裡是AI探索與發現,
8:00.480–8:01.480
ja感謝觀看,下期見。
感謝觀看,下期見。
8:07.480–8:09.016
ja我們在評論區,
我們在評論區,