# 影片筆記:说话人识别详细使用教程—haoone 字幕软件 V11 上新,对齐 elevenlabs 的说话人识别功能 ## 一句話總結 本影片介紹了 haoone 字幕軟體 V11 版本新增的「說話人識別」功能,該功能參考了 Energy Labs 的設計,支援下載特定模型(如通院模型、英語專院模型)以自動分割字幕段落、註冊說話人至聲文庫,並提供基於說話人的字幕過濾與 SRT 導出功能,同時提醒用戶注意聲音相似或語句過短時的識別準確度問題。 ## 核心重點 1. **功能背景**:回應用戶建議,V11 版本新增了類似 Energy Labs 的說話人識別功能,旨在將字幕按說話人進行分割。 2. **模型下載機制**: * 用戶需手動下載說話人識別模型。 * 提供「通院模型」與「英語專院模型」兩種選擇。 * 新用戶在點擊下載轉入模型時,程序會自動下載「通院說話人識別模型」。 3. **識別操作流程**: * 生成字幕後切換至段落視圖,點擊「識別說話人」。 * 可設定說話人數量,並開啟「自動識別數量」或「匹配已註冊說話人」功能。 * 識別完成後,段落會按說話人分割。 4. **準確性與限制**: * 系統能大致準確識別(如以「藍人殺」7個說話人為例)。 * 常見錯誤情境包括:聲音相似者難以識別、語句較短時易識別錯誤。 * 號數表示未來版本將持續優化準確率。 5. **說話人管理與聲文庫**: * 可修改說話人名稱,修改後該句及後續該說話人的名稱會同步更新。 * 可將說話人「註冊」至聲文庫,識別時若開啟匹配開關,將匹配聲文庫中的說話人。 * **重要限制**:不同的說話人識別模型,其聲文庫不通用。 6. **字幕過濾與導出**: * 可透過說話人選擇框過濾顯示不同說話人的字幕(此過濾在文稿章節視圖亦生效)。 * 常見用途為複製指定說話人的文稿。 * 可關閉「顯示開始時間」與「顯示說話人」開關以簡化顯示。 * 導出帶有說話人的 SRT 文件:點擊導出並打開說話人開關即可。 ## 詳細大綱 ### 1. 功能背景與更新 * 回應用戶建議,新增類似 Energy Labs 的說話人識別功能。 * 新版本已整合此功能,可將字幕按說話人進行分割。 ### 2. 模型下載與準備 * 需先下載說話人識別模型。 * 提供兩種模型:通院模型、英語專院模型。 * 老用戶需手動點擊下載;新用戶在點擊下載轉入模型時,程序會自動下載通院說話人識別模型。 ### 3. 識別操作流程 * 使用轉入功能生成字幕後,切換至段落視圖。 * 點擊「識別說話人」,設定說話人數量(可開啟自動識別數量)。 * 預設開啟「匹配已註冊說話人」功能,可查看已註冊列表。 * 執行識別後,段落會按說話人分割完成。 ### 4. 識別準確性與限制 * 以藍人殺影片(7個說話人)為例,從第一號玩家開始發言,分割大致準確。 * 常見錯誤情境:聲音相似者難以準確識別、語句較短時易識別錯誤。 * 號數表示未來版本將持續優化準確率。 ### 5. 說話人註冊與管理 * 點擊說話人圖標可修改名稱,修改後該句及後續該說話人的名稱會同步更新。 * 可選擇已註冊聲文的說話人,點擊「註冊說話人」將其加入聲文庫。 * 識別時若開啟匹配開關,將匹配聲文庫中的說話人。 * 可在設置中找到說話人設置查看已註冊名單。 * **注意**:不同的說話人識別模型,其聲文庫不通用。 ### 6. 字幕過濾與導出 * 完成識別後,可再次識別該視頻或同類視頻以提高準確度。 * 透過說話人選擇框,可過濾顯示不同說話人的字幕(此過濾在文稿章節視圖亦生效)。 * 常見用途:複製指定說話人的文稿。 * 可關閉「顯示開始時間」與「顯示說話人」開關以簡化顯示。 * 點擊「導出字幕」可導出文稿。 * 導出帶有說話人的 SRT 文件:點擊導出並打開說話人開關即可。 ## 工具 / 模型 / 名詞整理 * **Energy Labs**:影片中提及作為功能參考對象的軟體或服務。 * **通院模型**:說話人識別模型之一,新用戶自動下載的模型。 * **英語專院模型**:說話人識別模型之一。 * **轉入模型**:程序自動下載的模型,新用戶點擊下載時觸發。 * **聲文庫**:用於註冊和匹配說話人的資料庫。 * **SRT**:字幕文件格式,支援導出帶有說話人標記的文件。 * **藍人殺**:影片中用於演示識別準確度的視頻名稱。 * **步圖**:逐字稿中出現的詞彙,意指分割字幕的依據或視圖,具體含義不明。 * **號數**:逐字稿中提及與準確率優化相關的詞彙,具體指代不明。 * **願途**:逐字稿中提及的詞彙,意指「用途」,但原文如此。 ## 操作流程整理 1. **下載模型**: * 老用戶:手動點擊下載說話人識別模型(通院模型或英語專院模型)。 * 新用戶:點擊下載轉入模型,程序自動下載通院說話人識別模型。 2. **生成與識別字幕**: * 使用轉入功能生成字幕。 * 切換至段落視圖。 * 點擊「識別說話人」。 * 設定說話人數量(可選擇開啟自動識別數量)。 * 確認開啟「匹配已註冊說話人」功能(預設開啟)。 * 執行識別,段落按說話人分割。 3. **管理說話人**: * 點擊說話人圖標修改名稱(同步更新該句及後續該說話人名稱)。 * 選擇已註冊聲文的說話人,點擊「註冊說話人」加入聲文庫。 * 在設置中查看說話人設置及已註冊名單。 4. **過濾與導出**: * 透過說話人選擇框過濾顯示不同說話人的字幕(文稿章節視圖亦生效)。 * (可選)關閉「顯示開始時間」與「顯示說話人」開關以簡化顯示。 * 點擊「導出字幕」,打開說話人開關,導出帶有說話人的 SRT 文件。 ## 值得注意的限制或風險 1. **聲文庫不通用**:不同的說話人識別模型,其聲文庫不通用,註冊的說話人無法跨模型使用。 2. **識別準確度限制**: * 聲音相似者難以準確識別。 * 語句較短時易識別錯誤。 3. **未來優化**:號數表示未來版本將持續優化準確率,暗示當前版本可能存在不完美之處。 ## 逐字稿辨識疑點 * **步圖**:逐字稿中出現「將字幕按照步圖說話人完成分割」,疑為「步圖」為聽寫錯誤,可能意指「步驟」或特定視圖名稱,但無法確認。 * **轉入模型**:逐字稿多次提及「下載轉入模型」、「程序會自動下載通院說話人識別模型」,其中「轉入」一詞在語境中稍顯突兀,疑為「轉錄」或特定模型名稱的聽誤,需查證。 * **通院模型 / 英語專院模型**:逐字稿中明確提及「通院」與「英語專院」,疑為「通用」與「英語專用」的聽誤,但依規則保留原樣。 * **藍人殺**:逐字稿中提及「這是一個藍人殺的視頻」,疑為特定影片名稱或聽誤(如「藍人秀」或其他),需查證。 * **號數**:逐字稿中提及「號數會在未來的版本中持續優化準確率」,疑為「準確率」或「識別率」的聽誤,但依規則保留原樣。 * **願途**:逐字稿中提及「常見的願途是用戶要複製出指定說話人的文稿」,疑為「用途」的聽誤,但依規則保留原樣。 ## 可延伸追問 1. 「通院模型」與「英語專院模型」的具體區別是什麼?是否僅限於語言差異? 2. 「轉入模型」是否為軟體內的特定功能名稱,還是聽誤? 3. 「藍人殺」具體是指哪部影片或哪種類型的內容? 4. 若識別錯誤,手動修正的具體操作步驟為何? 5. 聲文庫的數據是否會隨軟體更新而保留?