實際影片長度:3:36.967。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:01.830
点击一下识别说话人,
0:01.830–0:04.392
就会识别出视频的7个说话人,
0:04.392–0:07.320
并将字幕按照步图说话人完成分割。
0:08.220–0:09.656
不少小伙伴提建议,
0:09.656–0:11.091
请问好玩字幕软件,
0:11.091–0:14.760
增加类似Enever Labs的说话人识别功能。
0:15.260–0:19.040
新的版本已经加上了,接下来来看一下如何使用。
0:19.480–0:24.180
首先需要下载说话人识别模型,点击下载转入模型。
0:24.180–0:31.120
你会看到两个新的说话人识别模型,一个是通院模型,一个是英语专院模型。
0:31.740–0:33.660
老用户点击下载即可。
0:34.100–0:40.400
新用户的话,当你下载转入模型的时候,程序会自动下载通院说话人识别模型。
0:40.820–0:44.060
这是一个蓝人杀的视频,共有7个说话人。
0:44.500–0:47.180
先使用转入功能,转入出字幕。
0:51.380–0:53.220
可以切换到段落试图。
0:53.220–0:57.540
该视图操作跟Enever Labs的字幕编辑器很相似。
0:58.220–1:03.780
可以看到没有识别说话人之前,不同说话人的字幕是混在段落中的。
1:04.540–1:08.020
点击识别说话人,要设置说话人的数量。
1:08.480–1:11.000
你可以开启自动识别说话人的数量。
1:11.340–1:14.720
木软已经开启了匹配已注册说话人的功能。
1:15.300–1:18.120
点击这里可以查看已注册的说话人。
1:18.120–1:23.620
点击执行,等待一会儿,可以看到段落按照说话人分割完成了。
1:24.120–1:25.740
可以试听一下几个片段。
1:26.440–1:29.140
天亮了,昨天晚上是个平安夜。
1:29.440–1:35.440
哎呀,都是,哎呀,都是,都照我,都说人都会照我。
1:35.580–1:37.120
昨天晚上为什么没叫我起来?
1:37.640–1:38.500
就很奇怪。
1:38.500–1:44.220
可以看到分割是比较准确的,但是难免会有错误。
1:44.540–1:47.620
比如这两人的声音很像,就没有准确的识别。
1:48.240–1:52.760
另外,语音句子比较短的情况下面,也会容易识别错误。
1:53.140–1:56.220
号数会在未来的版本中持续优化准确率。
1:56.720–2:01.700
下一步就需要修改说话人,并将说话人注册到声文库中。
2:02.500–2:06.380
点击说话人图标,这里可以修改说话人的名称。
2:06.380–2:13.120
修改后,该句子以及后续该说话人的句子,说话人的名称都会被修改掉。
2:13.740–2:19.420
你也可以在这里选择说话人,也可以在这里选择已注册声文的说话人。
2:19.640–2:24.040
点击注册说话人,会将说话人注册到声文库中。
2:24.600–2:30.860
当你识别说话人的时候,开启匹配开关,就会匹配声文库中的说话人了。
2:31.440–2:36.360
你可以在设置中找到说话人设置,可以看到已注册的说话人。
2:36.380–2:41.180
注意,不同的说话人识别模型,声文库是不通用的。
2:41.400–2:45.220
了解了操作,就可以完成整个视频字幕的说话人修改。
2:45.980–2:49.836
完成后,再次识别该视频或者是同类的视频,
2:49.836–2:52.920
就会准确地识别出不同的说话人了。
2:53.340–2:56.220
那么如何过滤出不同说话人的字幕呢?
2:56.220–2:59.020
点击这里的说话人选择框。
2:59.020–3:01.900
你可以选择显示不同说话人的字幕。
3:01.900–3:06.060
这个过滤操作在文稿章节试图也是生效的。
3:06.060–3:10.360
常见的愿选择是,用户要复制出指定说话人的文稿。
3:12.660–3:18.340
如果你不希望显示开始时间与显示说话人,可以点这里的两个开关。
3:19.240–3:22.240
点击导出内容,就可以将文稿导出了。
3:23.540–3:26.540
如何导出带有说话人的SRT文件呢?
3:26.940–3:29.520
点击导出,打开说话人开关。
3:30.060–3:33.460
即可导出带说话人的SRT字幕文件了。
3:33.460–3:35.460
点击导出,打开说话人的SRT字幕文件了。
3:35.460–3:36.460
点击导出,打开说话人的SRT字幕文件了。
3:36.460–3:36.967
点击导出,打开说话人的SRT字幕文件了。
0:00.000–0:01.830
点击一下识别说话人,
0:01.830–0:04.392
就会识别出视频的7个说话人,
0:04.392–0:07.320
并将字幕按照步图说话人完成分割。
0:08.220–0:09.656
不少小伙伴提建议,
0:09.656–0:11.091
请问好玩字幕软件,
0:11.091–0:14.760
增加类似Enever Labs的说话人识别功能。
0:15.260–0:19.040
新的版本已经加上了,接下来来看一下如何使用。
0:19.480–0:24.180
首先需要下载说话人识别模型,点击下载转入模型。
0:24.180–0:31.120
你会看到两个新的说话人识别模型,一个是通院模型,一个是英语专院模型。
0:31.740–0:33.660
老用户点击下载即可。
0:34.100–0:40.400
新用户的话,当你下载转入模型的时候,程序会自动下载通院说话人识别模型。
0:40.820–0:44.060
这是一个蓝人杀的视频,共有7个说话人。
0:44.500–0:47.180
先使用转入功能,转入出字幕。
0:51.380–0:53.220
可以切换到段落试图。
0:53.220–0:57.540
该视图操作跟Enever Labs的字幕编辑器很相似。
0:58.220–1:03.780
可以看到没有识别说话人之前,不同说话人的字幕是混在段落中的。
1:04.540–1:08.020
点击识别说话人,要设置说话人的数量。
1:08.480–1:11.000
你可以开启自动识别说话人的数量。
1:11.340–1:14.720
木软已经开启了匹配已注册说话人的功能。
1:15.300–1:18.120
点击这里可以查看已注册的说话人。
1:18.120–1:23.620
点击执行,等待一会儿,可以看到段落按照说话人分割完成了。
1:24.120–1:25.740
可以试听一下几个片段。
1:26.440–1:29.140
天亮了,昨天晚上是个平安夜。
1:29.440–1:35.440
哎呀,都是,哎呀,都是,都照我,都说人都会照我。
1:35.580–1:37.120
昨天晚上为什么没叫我起来?
1:37.640–1:38.500
就很奇怪。
1:38.500–1:44.220
可以看到分割是比较准确的,但是难免会有错误。
1:44.540–1:47.620
比如这两人的声音很像,就没有准确的识别。
1:48.240–1:52.760
另外,语音句子比较短的情况下面,也会容易识别错误。
1:53.140–1:56.220
号数会在未来的版本中持续优化准确率。
1:56.720–2:01.700
下一步就需要修改说话人,并将说话人注册到声文库中。
2:02.500–2:06.380
点击说话人图标,这里可以修改说话人的名称。
2:06.380–2:13.120
修改后,该句子以及后续该说话人的句子,说话人的名称都会被修改掉。
2:13.740–2:19.420
你也可以在这里选择说话人,也可以在这里选择已注册声文的说话人。
2:19.640–2:24.040
点击注册说话人,会将说话人注册到声文库中。
2:24.600–2:30.860
当你识别说话人的时候,开启匹配开关,就会匹配声文库中的说话人了。
2:31.440–2:36.360
你可以在设置中找到说话人设置,可以看到已注册的说话人。
2:36.380–2:41.180
注意,不同的说话人识别模型,声文库是不通用的。
2:41.400–2:45.220
了解了操作,就可以完成整个视频字幕的说话人修改。
2:45.980–2:49.836
完成后,再次识别该视频或者是同类的视频,
2:49.836–2:52.920
就会准确地识别出不同的说话人了。
2:53.340–2:56.220
那么如何过滤出不同说话人的字幕呢?
2:56.220–2:59.020
点击这里的说话人选择框。
2:59.020–3:01.900
你可以选择显示不同说话人的字幕。
3:01.900–3:06.060
这个过滤操作在文稿章节试图也是生效的。
3:06.060–3:10.360
常见的愿选择是,用户要复制出指定说话人的文稿。
3:12.660–3:18.340
如果你不希望显示开始时间与显示说话人,可以点这里的两个开关。
3:19.240–3:22.240
点击导出内容,就可以将文稿导出了。
3:23.540–3:26.540
如何导出带有说话人的SRT文件呢?
3:26.940–3:29.520
点击导出,打开说话人开关。
3:30.060–3:33.460
即可导出带说话人的SRT字幕文件了。
3:33.460–3:35.460
点击导出,打开说话人的SRT字幕文件了。
3:35.460–3:36.460
点击导出,打开说话人的SRT字幕文件了。
3:36.460–3:36.967
点击导出,打开说话人的SRT字幕文件了。
0:00.000–0:01.830
点击一下识别说话人,
点击一下识别说话人,
0:01.830–0:04.392
就会识别出视频的7个说话人,
就会识别出视频的7个说话人,
0:04.392–0:07.320
并将字幕按照步图说话人完成分割。
并将字幕按照步图说话人完成分割。
0:08.220–0:09.656
不少小伙伴提建议,
不少小伙伴提建议,
0:09.656–0:11.091
请问好玩字幕软件,
请问好玩字幕软件,
0:11.091–0:14.760
增加类似Enever Labs的说话人识别功能。
增加类似Enever Labs的说话人识别功能。
0:15.260–0:19.040
新的版本已经加上了,接下来来看一下如何使用。
新的版本已经加上了,接下来来看一下如何使用。
0:19.480–0:24.180
首先需要下载说话人识别模型,点击下载转入模型。
首先需要下载说话人识别模型,点击下载转入模型。
0:24.180–0:31.120
你会看到两个新的说话人识别模型,一个是通院模型,一个是英语专院模型。
你会看到两个新的说话人识别模型,一个是通院模型,一个是英语专院模型。
0:31.740–0:33.660
老用户点击下载即可。
老用户点击下载即可。
0:34.100–0:40.400
新用户的话,当你下载转入模型的时候,程序会自动下载通院说话人识别模型。
新用户的话,当你下载转入模型的时候,程序会自动下载通院说话人识别模型。
0:40.820–0:44.060
这是一个蓝人杀的视频,共有7个说话人。
这是一个蓝人杀的视频,共有7个说话人。
0:44.500–0:47.180
先使用转入功能,转入出字幕。
先使用转入功能,转入出字幕。
0:51.380–0:53.220
可以切换到段落试图。
可以切换到段落试图。
0:53.220–0:57.540
该视图操作跟Enever Labs的字幕编辑器很相似。
该视图操作跟Enever Labs的字幕编辑器很相似。
0:58.220–1:03.780
可以看到没有识别说话人之前,不同说话人的字幕是混在段落中的。
可以看到没有识别说话人之前,不同说话人的字幕是混在段落中的。
1:04.540–1:08.020
点击识别说话人,要设置说话人的数量。
点击识别说话人,要设置说话人的数量。
1:08.480–1:11.000
你可以开启自动识别说话人的数量。
你可以开启自动识别说话人的数量。
1:11.340–1:14.720
木软已经开启了匹配已注册说话人的功能。
木软已经开启了匹配已注册说话人的功能。
1:15.300–1:18.120
点击这里可以查看已注册的说话人。
点击这里可以查看已注册的说话人。
1:18.120–1:23.620
点击执行,等待一会儿,可以看到段落按照说话人分割完成了。
点击执行,等待一会儿,可以看到段落按照说话人分割完成了。
1:24.120–1:25.740
可以试听一下几个片段。
可以试听一下几个片段。
1:26.440–1:29.140
天亮了,昨天晚上是个平安夜。
天亮了,昨天晚上是个平安夜。
1:29.440–1:35.440
哎呀,都是,哎呀,都是,都照我,都说人都会照我。
哎呀,都是,哎呀,都是,都照我,都说人都会照我。
1:35.580–1:37.120
昨天晚上为什么没叫我起来?
昨天晚上为什么没叫我起来?
1:37.640–1:38.500
就很奇怪。
就很奇怪。
1:38.500–1:44.220
可以看到分割是比较准确的,但是难免会有错误。
可以看到分割是比较准确的,但是难免会有错误。
1:44.540–1:47.620
比如这两人的声音很像,就没有准确的识别。
比如这两人的声音很像,就没有准确的识别。
1:48.240–1:52.760
另外,语音句子比较短的情况下面,也会容易识别错误。
另外,语音句子比较短的情况下面,也会容易识别错误。
1:53.140–1:56.220
号数会在未来的版本中持续优化准确率。
号数会在未来的版本中持续优化准确率。
1:56.720–2:01.700
下一步就需要修改说话人,并将说话人注册到声文库中。
下一步就需要修改说话人,并将说话人注册到声文库中。
2:02.500–2:06.380
点击说话人图标,这里可以修改说话人的名称。
点击说话人图标,这里可以修改说话人的名称。
2:06.380–2:13.120
修改后,该句子以及后续该说话人的句子,说话人的名称都会被修改掉。
修改后,该句子以及后续该说话人的句子,说话人的名称都会被修改掉。
2:13.740–2:19.420
你也可以在这里选择说话人,也可以在这里选择已注册声文的说话人。
你也可以在这里选择说话人,也可以在这里选择已注册声文的说话人。
2:19.640–2:24.040
点击注册说话人,会将说话人注册到声文库中。
点击注册说话人,会将说话人注册到声文库中。
2:24.600–2:30.860
当你识别说话人的时候,开启匹配开关,就会匹配声文库中的说话人了。
当你识别说话人的时候,开启匹配开关,就会匹配声文库中的说话人了。
2:31.440–2:36.360
你可以在设置中找到说话人设置,可以看到已注册的说话人。
你可以在设置中找到说话人设置,可以看到已注册的说话人。
2:36.380–2:41.180
注意,不同的说话人识别模型,声文库是不通用的。
注意,不同的说话人识别模型,声文库是不通用的。
2:41.400–2:45.220
了解了操作,就可以完成整个视频字幕的说话人修改。
了解了操作,就可以完成整个视频字幕的说话人修改。
2:45.980–2:49.836
完成后,再次识别该视频或者是同类的视频,
完成后,再次识别该视频或者是同类的视频,
2:49.836–2:52.920
就会准确地识别出不同的说话人了。
就会准确地识别出不同的说话人了。
2:53.340–2:56.220
那么如何过滤出不同说话人的字幕呢?
那么如何过滤出不同说话人的字幕呢?
2:56.220–2:59.020
点击这里的说话人选择框。
点击这里的说话人选择框。
2:59.020–3:01.900
你可以选择显示不同说话人的字幕。
你可以选择显示不同说话人的字幕。
3:01.900–3:06.060
这个过滤操作在文稿章节试图也是生效的。
这个过滤操作在文稿章节试图也是生效的。
3:06.060–3:10.360
常见的愿选择是,用户要复制出指定说话人的文稿。
常见的愿选择是,用户要复制出指定说话人的文稿。
3:12.660–3:18.340
如果你不希望显示开始时间与显示说话人,可以点这里的两个开关。
如果你不希望显示开始时间与显示说话人,可以点这里的两个开关。
3:19.240–3:22.240
点击导出内容,就可以将文稿导出了。
点击导出内容,就可以将文稿导出了。
3:23.540–3:26.540
如何导出带有说话人的SRT文件呢?
如何导出带有说话人的SRT文件呢?
3:26.940–3:29.520
点击导出,打开说话人开关。
点击导出,打开说话人开关。
3:30.060–3:33.460
即可导出带说话人的SRT字幕文件了。
即可导出带说话人的SRT字幕文件了。
3:33.460–3:35.460
点击导出,打开说话人的SRT字幕文件了。
点击导出,打开说话人的SRT字幕文件了。
3:35.460–3:36.460
点击导出,打开说话人的SRT字幕文件了。
点击导出,打开说话人的SRT字幕文件了。
3:36.460–3:36.967
点击导出,打开说话人的SRT字幕文件了。
点击导出,打开说话人的SRT字幕文件了。

影片筆記:说话人识别详细使用教程—haoone 字幕软件 V11 上新,对齐 elevenlabs 的说话人识别功能

一句話總結

本影片介紹 haoone 字幕軟體 V11 版本新增的「說話人識別」功能,詳細演示了從下載專屬模型、執行識別分割、註冊說話人到聲文庫,以及最終導出帶有說話人標籤 SRT 字幕的完整操作流程,並說明了當前版本在聲音相似或語句短小時可能存在的識別限制。

核心重點

  1. 功能更新背景:回應用戶建議,新版本(V11)新增了類似 ElevenLabs 的說話人識別功能。
  2. 模型下載機制
  • 需下載「轉入模型」。
  • 提供「通院模型」與「英語專院模型」兩種選項。
  • 老用戶需手動點擊下載;新用戶在下載轉入模型時,程序會自動下載「通院說話人識別模型」。
  1. 識別與分割流程
  • 使用轉入功能生成字幕後,切換至「段落試圖」。
  • 點擊「識別說話人」,設定說話人數量(可開啟自動識別數量)。
  • 開啟「匹配已註冊說話人」功能並執行,系統將段落按照說話人進行分割。
  1. 準確度與限制
  • 分割通常準確,但聲音相似者或語句過短時易出現識別錯誤。
  • 開發者承諾未來版本將持續優化準確率。
  1. 說話人管理
  • 可點擊說話人圖標修改名稱,修改後該句子及後續同說話人句子名稱會同步更新。
  • 支持將說話人註冊至「聲文庫」。
  • 重要限制:不同說話人識別模型的聲文庫不通用。
  1. 過濾與導出
  • 可透過「說話人選擇框」篩選顯示特定說話人的字幕(此過濾在「文稿章節試圖」亦生效)。
  • 導出 SRT 時,開啟「說話人」開關,即可導出帶有說話人標籤的 SRT 字幕文件。

詳細大綱

1. 功能背景與前置準備

  • 功能介紹:影片主要介紹一款字幕軟體新增的「說話人識別」功能。
  • 模型下載
  • 使用者需下載「轉入模型」。
  • 系統提供兩種模型選項:「通院模型」與「英語專院模型」。
  • 新老用戶差異:老用戶需手動點擊下載;新用戶在下載轉入模型時,程序會自動下載「通院說話人識別模型」。

2. 識別與分割操作步驟

  • 進入識別模式:使用轉入功能生成字幕後,切換至「段落試圖」。
  • 執行識別
  1. 點擊「識別說話人」。
  2. 設定說話人數量(可選擇開啟自動識別數量)。
  3. 開啟「匹配已註冊說話人」功能。
  4. 點擊執行,系統將段落按照說話人進行分割。

3. 識別準確度說明

  • 一般情況:分割通常準確。
  • 例外情況
  • 聲音相似者難以準確識別。
  • 語句過短易識別錯誤。
  • 未來展望:開發者承認目前版本存在上述問題,承諾未來版本將持續優化準確率。

4. 說話人註冊與管理

  • 名稱修改:點擊說話人圖標可修改名稱。修改後,該句子及後續同說話人句子名稱會同步更新。
  • 聲文庫註冊
  • 可選擇已註冊「聲文庫」的說話人。
  • 點擊「註冊說話人」將其加入聲文庫。
  • 識別時若開啟匹配開關,將自動匹配聲文庫中的說話人。
  • 查看名單:可在「設置」中的「說話人設置」查看已註冊名單。
  • 模型限制:不同說話人識別模型的聲文庫不通用。

5. 過濾與導出功能

  • 過濾顯示
  • 透過「說話人選擇框」,可篩選顯示特定說話人的字幕。
  • 此過濾功能在「文稿章節試圖」亦生效。
  • 常見用途:複製指定說話人的文稿。
  • 顯示選項:可關閉「開始時間」與「顯示說話人」開關。
  • 導出文稿:點擊「導出內容」可導出純文稿。
  • 導出 SRT
  • 點擊「導出」。
  • 開啟「說話人」開關。
  • 即可導出帶有說話人標籤的 SRT 字幕文件。

工具 / 模型 / 名詞整理

  • 軟體/平台名稱
  • haoone 字幕軟體
  • Enever Labs(影片提及之對標或參考對象)
  • 功能/模型名稱
  • 轉入模型
  • 通院模型
  • 英語專院模型
  • 通院說話人識別模型
  • 聲文庫
  • 介面/視圖名稱
  • 段落試圖
  • 文稿章節試圖
  • 說話人設置
  • 說話人選擇框
  • 字幕編輯器
  • 文件格式
  • SRT

操作流程整理

  1. 下載模型
  • 老用戶:手動點擊下載「轉入模型」。
  • 新用戶:下載轉入模型時自動下載「通院說話人識別模型」。
  1. 執行識別
  • 生成字幕後,切換至「段落試圖」。
  • 點擊「識別說話人」。
  • 設定說話人數量(可開啟自動識別)。
  • 開啟「匹配已註冊說話人」。
  • 點擊執行,完成段落分割。
  1. 管理說話人(可選)
  • 點擊說話人圖標修改名稱(後續同名說話人會同步更新)。
  • 點擊「註冊說話人」加入「聲文庫」。
  • 在「設置」>「說話人設置」查看名單。
  1. 過濾與導出
  • 使用「說話人選擇框」篩選特定說話人(適用於「段落試圖」與「文稿章節試圖」)。
  • 點擊「導出」。
  • 開啟「說話人」開關。
  • 導出帶有說話人標籤的 SRT 字幕文件。

值得注意的限制或風險

  1. 識別準確度限制
  • 聲音相似者難以準確識別。
  • 語句過短時易識別錯誤。
  1. 聲文庫通用性限制
  • 不同說話人識別模型的聲文庫不通用,註冊後的說話人資訊無法跨模型使用。
  1. 版本優化承諾
  • 目前版本在特定情況下(聲音相似、語句短)可能存在識別錯誤,準確率有待未來版本優化。

逐字稿辨識疑點

  • 轉入模型:逐字稿多次提及「轉入模型」,疑為「轉錄模型」或特定軟體內部名稱之聽寫錯誤,需查證。
  • 通院模型 / 英語專院模型:疑為「通用模型」與「英語專用模型」之聽寫錯誤,需查證。
  • Enever Labs:影片標題提及 "elevenlabs",但分段筆記中出現 "Enever Labs",疑為辨識錯誤,需確認是否指代 ElevenLabs。
  • 木軟:疑為「本軟體」或「本軟件」之聽寫錯誤,需查證。
  • 藍人殺:疑為影片名稱或特定內容之聽寫錯誤,需查證。
  • 號數:疑為「我們」或「軟體」之聽寫錯誤,需查證。
  • 願選擇:疑為「常見選擇」或「常見願景」之聽寫錯誤,需查證。
  • 重複語句:逐字稿末尾連續重複多次「點擊導出,打開說話人的SRT字幕文件了」,疑為錄音或轉錄時的重複片段。

可延伸追問

  1. 「轉入模型」具體是指哪種技術模型?是否為軟體內部的特定稱呼?
  2. 「通院模型」是否確實為「通用模型」?「英語專院模型」是否為「英語專用模型」?
  3. 不同說話人識別模型的聲文庫不通用,具體是基於什麼技術原因?未來是否會開放互通?
  4. 對於聲音相似者或語句短小的識別錯誤,是否有手動修正的機制或建議?
  5. Enever Labs 與 ElevenLabs 在說話人識別功能上的具體差異或對齊細節為何?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習