請評估本項目加入中英文支持。 上期視頻我介紹了Audio CPP,當時我把它比作音頻版的Nama CPP,僅僅過了幾天,它又一次大升級,不僅一口氣新增了10個模型,還支持加載GGUF量化版,並且落地了牛市生成。 甚至現在,你看到的這個語音輸入法,就是用它做的。 操作介面上,基礎用法沒變,主要改動是增加了多語言支持,GGUF量化轉換,還有音色庫管理。 接下來,我先挑幾個有特點的新模型,直接給你看效果,再詳細介紹前面那個語音輸入法。 然後是這次很重要的一個能力,GGUF量化,最後統一說一下整合包怎麼升級,以及模型下載的一些細節。 上次沒講到的地方,這次一起補上。 先看這次新增的模型,它們主要集中在TTS和ASR兩個標线下。 TTS裡最有特點的是,Index TTS2和Supertonic3。 Index TTS2,它支持從文本內容推斷語氣的聲音合成。 高級參數裡,寫上情感參考文本,模型會根據這段文本來推斷情緒,然後合成語音。 比如這段文本,合成出來的語音大概率會帶憤怒和失望的語氣。 請把桌上的文件整理好,下午3點前交給我。 我再把情感強度調成0.8,重新合成,語氣聽上去就會更強烈。 請把桌上的文件整理好,下午3點前交給我。 如果去掉情感參考文本,勾選從朗讀文本推斷。 那合成出來的就是這種效果。 請把桌上的文件整理好,下午3點前交給我。 需要注意的是,Index TTS2比較吃顯存。 顯卡配置低的話,就用MOS系列,或者上期介紹的千問3 TTS0.6b。 Supertonic3的特點是速度快,而且支持流式生存。 生存模式切換到流式。 第一次生存會重載後台服務,會多出一段加載時間。 第二次就快了,所以建議第一次用一小段文本來預熱一下。 看,我明白你什麼想的。 他再次回到, 男人在金色衣服, 男人在走動的心靈跟一路復動的問題, 正在做一場文件,像是一場文件的議題。 流式的好處主要體現在長文本合成上, 可以邊合成邊輸出語音。 不用像離線模式那樣,要等所有文本合成結束, 才返回完整的語音。 需要注意的是,這個模型不支持中文。 中文的流式合成現在只有Vox CP-M2支持, 不過目前效果還在優化當中。 但首次延遲高,流式生存, 則邊接受文字,邊分段合成。 中間有卡頓,想使用中文流式可以再等等。 TTS說完,再看語音轉寫。 這次也新增了五個模型。 先說結論,中文轉寫推薦用千問3ASR 1.7B, 準確率相當高,顯存夠的話就用Vib Voice ASR, 能力更強,不精準還支持多人對話。 要速度就用Limotron 3.5ASR 0.6B, 但它中文識別的準確率要差一些。 這是同一段音頻三個模型的識別對比, 我把他們的結果丟給AI打分。 最終判定千問3ASR 1.7B, 轉寫的最準確。 Limotron 3.5ASR 0.6B, 同時支持離線和流式, 勾選最下面的流式轉寫, 它就會邊識別邊吐字。 這種模式非常適合語音輸入, 實施對話這些場景, 不用等音頻全部識別完才返回結果。 我本地的語音輸入就是拿它做的。 具體實施過程其實不複雜。 我先寫了一份大致需求, 描述下功能要求, 然後交給Codex。 因為服務端是現成的, 直接調用AudioCPP的服務。 代碼只需要做語音輸入發送, 顯示這一層。 大概半小時就完成了, 後面調適用了10分鐘左右。 具體用法, 先啟動Run Server ASR Stream服務, 再運行Speak Type。 按住Ctrl加Shift加空格, 打開麥克風。 然後把光標放進你的文本編輯軟件裡。 記事本, Obsidian都可以, 對著麥克風說話, 內容就直接轉寫過來了。 這次升級真正重要的, 不是模型又多了幾個。 如果想換行, 期間你說完一句打個回車。 需要說明一點, 這程序只是個DEMO, 主要是為了驗證用AudioCPP, 開發落地應用的可能性。 在它上面可以開發出WebUI界面, 可以做實施語音對話, 可以接OpenAI風格的API, 往下還有剛才的語音輸入, 瀏覽器擴展以及其他桌面應用等等, 都可以做。 現在回過頭, 把這次介面上的幾個改動過一遍。 右上角語言, 現在支持繁體和英文, 切換時大概有一到兩秒的延時。 另一個新增功能是內置音頻管理。 上傳參考音頻, 寫好對應的文本, 然後點保存, 就會自動存到內置音頻列表裡。 不用的可以選中刪除。 界面上這次最大的功能更新, 是模型的量化管理。 點開GGUF, 下面提示可轉換的, 就能進行量化。 先選幾位量化, 然後點轉換按鈕。 量化的好處是顯存佔用更小。 對於沒有顯卡的機器, CPU運行量化板速度也更快。 比如這個VibeOS ASR模型, 原始模型加載後, 大概要占16G顯存。 8G顯存根本就跑不動。 但把它轉成Q4量化板以後, 加載就沒問題了。 但是大參數模型轉換比較慢, 像我這次用了20多分鐘。 當有GGUF時, 點這裡加載模型, 後台服務會優先加載量化板。 需要提醒一點, 目前AudioCPP並不支持其他框架轉換的GGUF, 並且也只有部分模型現在可以轉換。 在列表裡選模型時, 能不能轉換下面都有提示。 轉好的量化板不想用也可以直接轉換。 就能恢復原始權重。 目前AudioCPP已經完整支持30個語音模型。 所有模型的能力特點, 我都整理成了配套筆記。 可以通過這張表格來數查。 鏈接我放在評論區置頂。 最後說下整合包怎麼升級, 以及模型下載。 第一個鏈接是新的完整版整合包。 如果你之前沒安裝過, 就下這個。 上期安裝過的, 點第二個鏈接下載升級包。 解壓以後, 複製裡面的所有文件, 覆蓋到原來整合包目錄下。 然後全部替換, 就升級好了。 以後更新, 可以直接點update。 程序會自動檢測, 有新版本會自動下載。 雙擊Run WebUI打開界面。 這個啟動窗口第一次要等幾十秒。 程序加載完會自動打開網頁。 再說下模型下載。 目前AudioCPP的模型 都要從Hugging Face上下載。 並且不支持手動放模型。 國內網絡如果下載有問題, 可以試一下這裡填上代理地址。 另外有個別模型, 像Stable Audio這個系列, 需要在Hugging Face上申請。 具體操作步驟是這樣。 先註册一個免費的Hugging Face帳號, 然後到這個地址填寫申請表單。 申請通過後, 在典禮的Hugging Face頭像, 菜單底部訪問Token。 創建一個新Token, 選紙讀。 複製創建的Token, 粘貼到WebUI的Token框裡, 就可以下載模型了。 模型下載機制, 是先在Modus目錄下, 創建一個臨時下載目錄, 就是這個文件夾。 既然能看到正在下載的模型。 全部下載完成後, 程序會自動創建重命名模型文件夾。 下載過程中中斷也沒關係。 繼續點下載按鈕, 會斷點續傳。 下載完成後點刷新, 就可以下載模型了。 程序也會自检模型文件 的完整性。 缺文件會提示模型不完整。 新商手的朋友, 想了解介面基礎操作, 以及其他常用模型, 可以看語音AI系統化的那期視頻。 本期視頻的配套筆記, 鏈接我放在評論區置頂。 整個包使用中的問題, 或者好的點子想法, 都可以在評論區留言。 我會定期收集整理,更新版本。 這裡是AI探索與發現, 感謝觀看,下期見。 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區, 我們在評論區,