# 影片筆記:说话人识别详细使用教程—haoone 字幕软件 V11 上新,对齐 elevenlabs 的说话人识别功能 ## 一句話總結 本影片介紹 haoone 字幕軟體 V11 版本新增的「說話人識別」功能,詳細演示了從下載專屬模型、執行識別分割、註冊說話人到聲文庫,以及最終導出帶有說話人標籤 SRT 字幕的完整操作流程,並說明了當前版本在聲音相似或語句短小時可能存在的識別限制。 ## 核心重點 1. **功能更新背景**:回應用戶建議,新版本(V11)新增了類似 ElevenLabs 的說話人識別功能。 2. **模型下載機制**: * 需下載「轉入模型」。 * 提供「通院模型」與「英語專院模型」兩種選項。 * 老用戶需手動點擊下載;新用戶在下載轉入模型時,程序會自動下載「通院說話人識別模型」。 3. **識別與分割流程**: * 使用轉入功能生成字幕後,切換至「段落試圖」。 * 點擊「識別說話人」,設定說話人數量(可開啟自動識別數量)。 * 開啟「匹配已註冊說話人」功能並執行,系統將段落按照說話人進行分割。 4. **準確度與限制**: * 分割通常準確,但聲音相似者或語句過短時易出現識別錯誤。 * 開發者承諾未來版本將持續優化準確率。 5. **說話人管理**: * 可點擊說話人圖標修改名稱,修改後該句子及後續同說話人句子名稱會同步更新。 * 支持將說話人註冊至「聲文庫」。 * **重要限制**:不同說話人識別模型的聲文庫不通用。 6. **過濾與導出**: * 可透過「說話人選擇框」篩選顯示特定說話人的字幕(此過濾在「文稿章節試圖」亦生效)。 * 導出 SRT 時,開啟「說話人」開關,即可導出帶有說話人標籤的 SRT 字幕文件。 ## 詳細大綱 ### 1. 功能背景與前置準備 * **功能介紹**:影片主要介紹一款字幕軟體新增的「說話人識別」功能。 * **模型下載**: * 使用者需下載「轉入模型」。 * 系統提供兩種模型選項:「通院模型」與「英語專院模型」。 * **新老用戶差異**:老用戶需手動點擊下載;新用戶在下載轉入模型時,程序會自動下載「通院說話人識別模型」。 ### 2. 識別與分割操作步驟 * **進入識別模式**:使用轉入功能生成字幕後,切換至「段落試圖」。 * **執行識別**: 1. 點擊「識別說話人」。 2. 設定說話人數量(可選擇開啟自動識別數量)。 3. 開啟「匹配已註冊說話人」功能。 4. 點擊執行,系統將段落按照說話人進行分割。 ### 3. 識別準確度說明 * **一般情況**:分割通常準確。 * **例外情況**: * 聲音相似者難以準確識別。 * 語句過短易識別錯誤。 * **未來展望**:開發者承認目前版本存在上述問題,承諾未來版本將持續優化準確率。 ### 4. 說話人註冊與管理 * **名稱修改**:點擊說話人圖標可修改名稱。修改後,該句子及後續同說話人句子名稱會同步更新。 * **聲文庫註冊**: * 可選擇已註冊「聲文庫」的說話人。 * 點擊「註冊說話人」將其加入聲文庫。 * 識別時若開啟匹配開關,將自動匹配聲文庫中的說話人。 * **查看名單**:可在「設置」中的「說話人設置」查看已註冊名單。 * **模型限制**:不同說話人識別模型的聲文庫不通用。 ### 5. 過濾與導出功能 * **過濾顯示**: * 透過「說話人選擇框」,可篩選顯示特定說話人的字幕。 * 此過濾功能在「文稿章節試圖」亦生效。 * **常見用途**:複製指定說話人的文稿。 * **顯示選項**:可關閉「開始時間」與「顯示說話人」開關。 * **導出文稿**:點擊「導出內容」可導出純文稿。 * **導出 SRT**: * 點擊「導出」。 * 開啟「說話人」開關。 * 即可導出帶有說話人標籤的 SRT 字幕文件。 ## 工具 / 模型 / 名詞整理 * **軟體/平台名稱**: * haoone 字幕軟體 * Enever Labs(影片提及之對標或參考對象) * **功能/模型名稱**: * 轉入模型 * 通院模型 * 英語專院模型 * 通院說話人識別模型 * 聲文庫 * **介面/視圖名稱**: * 段落試圖 * 文稿章節試圖 * 說話人設置 * 說話人選擇框 * 字幕編輯器 * **文件格式**: * SRT ## 操作流程整理 1. **下載模型**: * 老用戶:手動點擊下載「轉入模型」。 * 新用戶:下載轉入模型時自動下載「通院說話人識別模型」。 2. **執行識別**: * 生成字幕後,切換至「段落試圖」。 * 點擊「識別說話人」。 * 設定說話人數量(可開啟自動識別)。 * 開啟「匹配已註冊說話人」。 * 點擊執行,完成段落分割。 3. **管理說話人(可選)**: * 點擊說話人圖標修改名稱(後續同名說話人會同步更新)。 * 點擊「註冊說話人」加入「聲文庫」。 * 在「設置」>「說話人設置」查看名單。 4. **過濾與導出**: * 使用「說話人選擇框」篩選特定說話人(適用於「段落試圖」與「文稿章節試圖」)。 * 點擊「導出」。 * 開啟「說話人」開關。 * 導出帶有說話人標籤的 SRT 字幕文件。 ## 值得注意的限制或風險 1. **識別準確度限制**: * 聲音相似者難以準確識別。 * 語句過短時易識別錯誤。 2. **聲文庫通用性限制**: * 不同說話人識別模型的聲文庫不通用,註冊後的說話人資訊無法跨模型使用。 3. **版本優化承諾**: * 目前版本在特定情況下(聲音相似、語句短)可能存在識別錯誤,準確率有待未來版本優化。 ## 逐字稿辨識疑點 * **轉入模型**:逐字稿多次提及「轉入模型」,疑為「轉錄模型」或特定軟體內部名稱之聽寫錯誤,需查證。 * **通院模型 / 英語專院模型**:疑為「通用模型」與「英語專用模型」之聽寫錯誤,需查證。 * **Enever Labs**:影片標題提及 "elevenlabs",但分段筆記中出現 "Enever Labs",疑為辨識錯誤,需確認是否指代 ElevenLabs。 * **木軟**:疑為「本軟體」或「本軟件」之聽寫錯誤,需查證。 * **藍人殺**:疑為影片名稱或特定內容之聽寫錯誤,需查證。 * **號數**:疑為「我們」或「軟體」之聽寫錯誤,需查證。 * **願選擇**:疑為「常見選擇」或「常見願景」之聽寫錯誤,需查證。 * **重複語句**:逐字稿末尾連續重複多次「點擊導出,打開說話人的SRT字幕文件了」,疑為錄音或轉錄時的重複片段。 ## 可延伸追問 1. 「轉入模型」具體是指哪種技術模型?是否為軟體內部的特定稱呼? 2. 「通院模型」是否確實為「通用模型」?「英語專院模型」是否為「英語專用模型」? 3. 不同說話人識別模型的聲文庫不通用,具體是基於什麼技術原因?未來是否會開放互通? 4. 對於聲音相似者或語句短小的識別錯誤,是否有手動修正的機制或建議? 5. Enever Labs 與 ElevenLabs 在說話人識別功能上的具體差異或對齊細節為何?