0:00.000–0:03.600
FireRed ASR就是11Labs语音识别的本地平替
0:03.600–0:06.160
普通话方言甚至唱歌都能识别
0:06.160–0:07.380
CPU就能跑
0:07.380–0:09.340
直接生成带时间轴的字幕
0:09.340–0:09.940
Hello大家好
0:09.940–0:11.580
这一期我们来做一个
0:11.580–0:14.520
Favorite ASR的整合包的使用教程
0:14.520–0:16.000
拿到整合包之后
0:16.000–0:18.360
你解压开之后就长这个样子
0:18.360–0:20.200
我们直接点击STAR
0:20.200–0:21.600
就可以直接开始
0:21.600–0:22.660
点击STAR之后
0:22.660–0:24.300
它会开一个浏览器
0:24.300–0:26.300
7867的一个端口
0:26.300–0:27.700
可以得到这样的一个界面
0:27.700–0:29.640
这个工作态度就很简单
0:29.640–0:31.280
你可以直接用工作台去做
0:31.280–0:35.040
但你也可以让AI去帮你去操作
0:35.040–0:38.140
也可以接入到Naroto AISpecLib
0:38.140–0:39.340
等项目里面去使用
0:39.340–0:43.100
我们先拿它这个UI界面来试一下
0:43.100–0:44.740
我们录了一个教程视频
0:44.740–0:46.220
我们先用它来试一下
0:46.220–0:48.040
直接点击开始识别
0:48.040–0:50.340
这个地方它就识别完成了
0:50.340–0:53.020
这个地方你可以大概看一下它的内容
0:53.020–0:55.740
基本上其实作弊字还是很少
0:55.740–0:58.540
我们可以下载这个SRT的文件
0:58.540–1:00.440
也可以去下载这个接线文件
1:00.440–1:02.540
这两个文件其实有什么区别呢
1:02.540–1:03.940
接线文件它里面会包含
1:03.940–1:06.540
吃鸡的这个时间轴
1:06.540–1:08.240
就它每一个字或每一段话
1:08.240–1:10.740
在下面它都会有一个时间轴的SRT
1:10.740–1:12.540
就是我们的正常的字母文件
1:12.540–1:14.340
我们这个地方会有一个Skill文件
1:14.340–1:16.440
然后我们也可以让Codex
1:16.440–1:18.940
或者Codecode这样的AI
1:18.940–1:21.040
教它去使用Fieldread
1:21.040–1:22.340
SR的功能
1:22.340–1:23.740
使用的方法也很简单
1:23.740–1:25.540
你就只需要把这个文件
1:25.540–1:29.540
copy到Codex的这个Skill的目录
1:29.540–1:31.740
我们就可以去换取我们的Codex
1:31.740–1:35.040
让它去帮我们完成字母提取
1:35.040–1:36.840
语音识别相关的一些功能
1:36.840–1:37.940
这期视频我们先到
1:37.940–1:39.340
如果这期对你有帮助
1:39.340–1:40.440
记得点赞关注
1:40.440–1:42.040
更多实用教程
1:42.040–1:43.514
我们下期见
0:00.000–0:03.600
FireRed ASR 是 11Labs 語音識別的本地替代方案
0:03.600–0:06.160
普通話、方言甚至唱歌都能識別
0:06.160–0:07.380
CPU 就能運行
0:07.380–0:09.340
直接生成帶時間軸的字幕
0:09.340–0:09.940
大家好
0:09.940–0:11.580
這一期我們來做一個
0:11.580–0:14.520
Favorite ASR 整合包的使用教程
0:14.520–0:16.000
拿到整合包之後
0:16.000–0:18.360
你解壓之後就會長這樣
0:18.360–0:20.200
我們直接點擊 STAR
0:20.200–0:21.600
就可以直接開始
0:21.600–0:22.660
點擊 STAR 之後
0:22.660–0:24.300
它會開啟一個瀏覽器
0:24.300–0:26.300
7867 的端口
0:26.300–0:27.700
可以得到這樣的介面
0:27.700–0:29.640
這個工作態度很簡單
0:29.640–0:31.280
你可以直接用工作台來操作
0:31.280–0:35.040
但你也可以讓 AI 幫你操作
0:35.040–0:38.140
也可以整合到 Naroto AISpecLib
0:38.140–0:39.340
等項目裡面去使用
0:39.340–0:43.100
我們先用它的 UI 介面來試試
0:43.100–0:44.740
我們錄了一個教程影片
0:44.740–0:46.220
我們先用它來試試
0:46.220–0:48.040
直接點擊開始識別
0:48.040–0:50.340
這裡就識別完成了
0:50.340–0:53.020
這裡你可以大概看一下它的內容
0:53.020–0:55.740
基本上其實錯字還很少
0:55.740–0:58.540
我們可以下載這個 SRT 檔案
0:58.540–1:00.440
也可以去下載這個 JSON 檔案
1:00.440–1:02.540
這兩個檔案其實有什麼區別呢
1:02.540–1:03.940
JSON 檔案裡面會包含
1:03.940–1:06.540
這個的時間軸
1:06.540–1:08.240
就是它每一個字或每一段話
1:08.240–1:10.740
在下面它都會有一個時間軸的 SRT
1:10.740–1:12.540
就是我們正常的字幕檔案
1:12.540–1:14.340
我們這裡會有一個 Skill 檔案
1:14.340–1:16.440
然後我們也可以讓 Codex
1:16.440–1:18.940
或者 Codecode 這樣的 AI
1:18.940–1:21.040
教它去使用 FireRed
1:21.040–1:22.340
ASR 的功能
1:22.340–1:23.740
使用方法也很簡單
1:23.740–1:25.540
你只需要將這個文件
1:25.540–1:29.540
複製到 Codex 的這個 Skill 目錄
1:29.540–1:31.740
我們就可以去獲取我們的 Codex
1:31.740–1:35.040
讓它幫我們完成字母提取
1:35.040–1:36.840
以及語音識別相關的一些功能
1:36.840–1:37.940
這集影片我們先到這裡
1:37.940–1:39.340
如果這集影片對你有幫助
1:39.340–1:40.440
記得按讚並訂閱
1:40.440–1:42.040
更多實用教程
1:42.040–1:43.514
我們下期再見
0:00.000–0:03.600
FireRed ASR就是11Labs语音识别的本地平替
FireRed ASR 是 11Labs 語音識別的本地替代方案
0:03.600–0:06.160
普通话方言甚至唱歌都能识别
普通話、方言甚至唱歌都能識別
0:06.160–0:07.380
CPU就能跑
CPU 就能運行
0:07.380–0:09.340
直接生成带时间轴的字幕
直接生成帶時間軸的字幕
0:09.340–0:09.940
Hello大家好
大家好
0:09.940–0:11.580
这一期我们来做一个
這一期我們來做一個
0:11.580–0:14.520
Favorite ASR的整合包的使用教程
Favorite ASR 整合包的使用教程
0:14.520–0:16.000
拿到整合包之后
拿到整合包之後
0:16.000–0:18.360
你解压开之后就长这个样子
你解壓之後就會長這樣
0:18.360–0:20.200
我们直接点击STAR
我們直接點擊 STAR
0:20.200–0:21.600
就可以直接开始
就可以直接開始
0:21.600–0:22.660
点击STAR之后
點擊 STAR 之後
0:22.660–0:24.300
它会开一个浏览器
它會開啟一個瀏覽器
0:24.300–0:26.300
7867的一个端口
7867 的端口
0:26.300–0:27.700
可以得到这样的一个界面
可以得到這樣的介面
0:27.700–0:29.640
这个工作态度就很简单
這個工作態度很簡單
0:29.640–0:31.280
你可以直接用工作台去做
你可以直接用工作台來操作
0:31.280–0:35.040
但你也可以让AI去帮你去操作
但你也可以讓 AI 幫你操作
0:35.040–0:38.140
也可以接入到Naroto AISpecLib
也可以整合到 Naroto AISpecLib
0:38.140–0:39.340
等项目里面去使用
等項目裡面去使用
0:39.340–0:43.100
我们先拿它这个UI界面来试一下
我們先用它的 UI 介面來試試
0:43.100–0:44.740
我们录了一个教程视频
我們錄了一個教程影片
0:44.740–0:46.220
我们先用它来试一下
我們先用它來試試
0:46.220–0:48.040
直接点击开始识别
直接點擊開始識別
0:48.040–0:50.340
这个地方它就识别完成了
這裡就識別完成了
0:50.340–0:53.020
这个地方你可以大概看一下它的内容
這裡你可以大概看一下它的內容
0:53.020–0:55.740
基本上其实作弊字还是很少
基本上其實錯字還很少
0:55.740–0:58.540
我们可以下载这个SRT的文件
我們可以下載這個 SRT 檔案
0:58.540–1:00.440
也可以去下载这个接线文件
也可以去下載這個 JSON 檔案
1:00.440–1:02.540
这两个文件其实有什么区别呢
這兩個檔案其實有什麼區別呢
1:02.540–1:03.940
接线文件它里面会包含
JSON 檔案裡面會包含
1:03.940–1:06.540
吃鸡的这个时间轴
這個的時間軸
1:06.540–1:08.240
就它每一个字或每一段话
就是它每一個字或每一段話
1:08.240–1:10.740
在下面它都会有一个时间轴的SRT
在下面它都會有一個時間軸的 SRT
1:10.740–1:12.540
就是我们的正常的字母文件
就是我們正常的字幕檔案
1:12.540–1:14.340
我们这个地方会有一个Skill文件
我們這裡會有一個 Skill 檔案
1:14.340–1:16.440
然后我们也可以让Codex
然後我們也可以讓 Codex
1:16.440–1:18.940
或者Codecode这样的AI
或者 Codecode 這樣的 AI
1:18.940–1:21.040
教它去使用Fieldread
教它去使用 FireRed
1:21.040–1:22.340
SR的功能
ASR 的功能
1:22.340–1:23.740
使用的方法也很简单
使用方法也很簡單
1:23.740–1:25.540
你就只需要把这个文件
你只需要將這個文件
1:25.540–1:29.540
copy到Codex的这个Skill的目录
複製到 Codex 的這個 Skill 目錄
1:29.540–1:31.740
我们就可以去换取我们的Codex
我們就可以去獲取我們的 Codex
1:31.740–1:35.040
让它去帮我们完成字母提取
讓它幫我們完成字母提取
1:35.040–1:36.840
语音识别相关的一些功能
以及語音識別相關的一些功能
1:36.840–1:37.940
这期视频我们先到
這集影片我們先到這裡
1:37.940–1:39.340
如果这期对你有帮助
如果這集影片對你有幫助
1:39.340–1:40.440
记得点赞关注
記得按讚並訂閱
1:40.440–1:42.040
更多实用教程
更多實用教程
1:42.040–1:43.514
我们下期见
我們下期再見
影片筆記:本地跑的 ElevenLabs ASR 平替!FireRedASR CPU 也能用
一句話總結
影片介紹了 FireRed ASR 作為 ElevenLabs 語音識別(ASR)的本地化平替方案,強調其僅需 CPU 即可運行,支援普通話、方言及唱歌識別,並展示了透過整合包啟動、生成 SRT 與時間軸文件,以及整合至 Codex AI 技能目錄的操作流程。
核心重點
- 本地化平替:FireRed ASR 定位為 ElevenLabs 語音識別的本地替代方案。
- 硬體需求低:僅需 CPU 即可運行,無需高階顯卡。
- 語言支援廣泛:支援普通話、方言以及唱歌識別。
- 操作簡便:透過解壓整合包並點擊啟動,自動開啟瀏覽器介面(端口 7867)。
- 輸出格式:
- SRT 文件:標準字幕文件。
- 接線文件:包含每個字或段落對應的時間軸資訊。
- AI 自動化整合:可將相關技能文件複製至 Codex 的 Skill 目錄,讓 AI 協助執行語音識別與字幕提取任務。
詳細大綱
1. 工具介紹與定位
- FireRed ASR 被介紹為 11Labs 語音識別的本地平替。
- 強調其硬體兼容性,普通 CPU 即可運行。
- 支援語言範圍包含普通話、方言及唱歌。
2. 安裝與啟動流程
- 下載並解壓整合包。
- 點擊「STAR」按鈕啟動程序。
- 程序啟動後自動開啟瀏覽器介面。
- 介面佔用端口 7867。
3. 介面操作與功能
- 介面設計簡潔,可直接在工作台操作。
- 支援接入 Naroto AISpecLib 等項目。
- 點擊「開始識別」進行語音轉文字。
- 辨識結果準確度較高,錯字較少。
4. 輸出文件類型
- SRT 文件:影片中被稱為「正常的字母文件」(疑似口誤或聽誤,應指字幕文件)。
- 接線文件:解釋為包含每個字或段落對應時間軸的文件(疑似指 Word-level JSON 或類似結構)。
- 提及「吃鸡的这个时间轴」(疑似口誤,可能意指每個字的时间轴)。
5. AI 整合應用
- 可將相關技能文件複製至 Codex 的 Skill 目錄。
- 利用 Codex 或 Codecode 等 AI 工具,自動化執行語音識別與字幕提取功能。
- 最後提及「教它去使用 Fieldread SR 的功能」(疑似 FireRed ASR 的口誤)。
工具 / 模型 / 名詞整理
- FireRed ASR:影片主要介紹的語音識別工具。
- ElevenLabs (11Labs):被對比的本雲端語音識別服務。
- STAR:啟動程序或按鈕的名稱。
- Naroto AISpecLib:介面中支援接入的項目。
- Codex:用於整合技能的 AI 工具。
- Codecode:與 Codex 交替出現的 AI 工具名稱。
- SRT:標準字幕文件格式。
- Skill:技能或插件目錄名稱。
- 接線文件:包含時間軸資訊的文件格式。
- 7867 端口:Web UI 佔用的端口號。
操作流程整理
- 準備環境:下載並解壓 FireRed ASR 整合包。
- 啟動服務:點擊「STAR」啟動程序,等待瀏覽器自動開啟。
- 確認端口:確認瀏覽器介面佔用端口 7867。
- 執行識別:
- 在工作台介面操作。
- 接入必要項目(如 Naroto AISpecLib)。
- 點擊「開始識別」按鈕。
- 獲取結果:
- 下載生成的 SRT 文件(字幕文件)。
- 下載生成的接線文件(含時間軸資訊)。
- AI 整合(可選):
- 將相關技能文件複製至 Codex 的 Skill 目錄。
- 配置 AI 工具(Codex/Codecode)以自動化執行識別任務。
值得注意的限制或風險
- 硬體效能:雖僅需 CPU,但未提及具體處理速度或大型檔案的處理限制。
- 識別準確度:雖宣稱準確度高、錯字少,但實際效果可能因口音、背景噪音或唱歌內容而異。
- 端口衝突:固定使用端口 7867,若本地有其他服務佔用此端口可能導致啟動失敗。
- 整合依賴:AI 自動化功能依賴 Codex/Codecode 的配置及 Skill 目錄的正確設置。
逐字稿辨識疑點
- Favorite ASR:逐字稿開頭提到「FireRed ASR」,但中間口誤說成「Favorite ASR」,需查證是否為同一工具的不同稱呼或口誤。
- 7867 端口:通常 Web UI 端口為 7860 或 7861,7867 需查證是否為特定設定或聽誤。
- 接线文件:逐字稿中多次提到「接线文件」並解釋其包含時間軸,但在語音識別領域常見對應詞為「JSON 文件」或「Word-level JSON」,「接线」疑似為聽寫錯誤。
- 吃鸡的这个时间轴:解釋接線文件時提到「吃鸡的这个时间轴」,疑似口誤,可能意指「每個字的這個時間軸」或特定術語。
- 字母文件:多次提到「SRT 就是我们的正常的字母文件」,在語境中應為「字幕文件」,「字母」疑似聽誤。
- Skill文件:提到「我们这个地方会有一个Skill文件」,需確認是否指代特定的技能配置文件。
- Codex / Codecode:逐字稿交替出現「Codex」與「Codecode」,需確認是否為同一個 AI 工具的不同稱呼或口誤。
- Fieldread SR:最後提到「教它去使用Fieldread SR的功能」,疑似為「FireRed ASR」的口誤或聽誤。
可延伸追問
- FireRed ASR 在 CPU 環境下的具體處理速度與資源佔用情況為何?
- 「接線文件」的具體格式結構是什麼?是否可被其他字幕編輯軟體直接讀取?
- Codex 或 Codecode 如何具體配置 Skill 目錄以調用 FireRed ASR?
- 對於方言和唱歌識別,是否有特定的語言包或模型需要額外下載?
- 端口 7867 是否可自定義修改?若衝突該如何解決?
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習