實際影片長度:10:45.446。原文、繁中、雙語可點擊句子跳轉影片。
0:00.600–0:04.460
zh大家好,今天咱们聊一个实用工具,它叫AudioCPP
0:04.460–0:09.300
zh传统的本地语音模型环境,配置起来很麻烦
0:09.300–0:13.560
zh庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
0:13.560–0:18.000
zh是不是很熟悉,就像Alama简化了大语言模型一样
0:18.000–0:21.460
zhAudioCPC解决了音频AI的部署难题
0:21.460–0:24.880
zh它是纯C++实现的原生二进制程序
0:24.880–0:29.380
zh开箱挤用非常轻量,APU版本仅8兆大小
0:29.380–0:31.660
zh他支持TTS声音克隆
0:31.660–0:32.125
enHello,
0:32.125–0:33.056
enthis is audio.
0:33.056–0:34.840
encpp speaking from a webpage
0:34.840–0:37.100
zh支持ASR语音转文字
0:37.100–0:44.380
zh支持批量合成语音
0:44.380–0:50.940
zh还有实时语音功能
0:50.940–0:53.940
zh我可以帮你回答问题
0:53.940–0:55.720
zh翻译语言,撰写文本
0:55.720–0:57.180
zh以及提供创意建议
0:57.180–1:02.920
zh并且自带命令行CLI和网页界面Web UI
1:02.920–1:05.740
zh咱们先看命令行工具
1:05.740–1:08.420
zh也就是CLI功能
1:08.420–1:10.360
zh举个例子
1:10.360–1:14.820
zh输入AudioCppClare后面跟多个参数
1:14.820–1:18.620
zhTask TTS表示任务是声音克隆
1:18.620–1:22.900
zhFamily Pocket TTS指定模型为Pocket TTS
1:22.900–1:26.760
zhModel后面写模型文件路径
1:26.760–1:29.880
zhBackend CPU表示用CPU推理
1:29.880–1:32.780
zh能使用GPU推理就写Cuda
1:32.780–1:35.680
zhText是你要合成的文字内容
1:35.680–1:38.460
zhVoice ID是参考音色文件
1:38.460–1:41.640
zhOut指定输出音频的位置
1:41.640–1:44.280
zh现在我们来实际操作一下
1:44.280–1:46.560
zh打开AudioX CPT文件夹
1:46.560–1:49.240
zh在地址栏里输入CMD回车
1:49.240–1:51.640
zh这样就打开了命令提示符
1:51.640–1:53.120
zh复制准备好的命令行
1:53.120–1:55.800
zh粘贴进去按回车
1:55.800–1:58.380
zh模型开始生成音频
1:58.380–1:59.540
zh请稍等
1:59.540–2:00.520
zh生成完毕
2:00.520–2:02.700
zh我们打开out文件夹
2:02.700–2:05.360
zh双击这个音频文件听一下
2:14.480–2:16.440
zh效果还不错
2:16.440–2:17.000
zh对吧
2:17.000–2:19.120
zh再看第二个例子
2:19.120–2:21.280
zh基本参数和前面一样
2:21.280–2:22.840
zh这次使用的模型是
2:22.840–2:23.960
enQuantTTS
2:23.960–2:28.580
zhVoice Reef是参考音频的位置
2:28.580–2:31.380
zhReference Text是对应的参考文本
2:31.380–2:35.640
zh复制这条命令切换到命令行窗口
2:35.640–2:37.160
zh拦贴回车
2:37.160–2:39.960
zh等待模型生成音频文件
2:39.960–2:47.040
zh好,打开Out文件夹
2:47.040–2:50.280
zh双击播放,听一下
2:53.960–2:58.520
zh你好,Audio CPP正在Windows CPU上运行
2:58.520–3:00.440
zh效果依然很棒
3:00.440–3:03.740
zh说完了Cli,咱们看看Web UI
3:03.740–3:05.640
zh有了命令行基础
3:05.640–3:07.400
zh网页操作就更简单了
3:07.400–3:11.140
zh首先,在模型列表里选择Pocket TTS
3:11.140–3:12.560
zh点击加载模型
3:12.560–3:14.640
zh然后选择一个参考音色文件
3:14.640–3:17.840
zh点击播放视听
3:17.840–3:28.660
zh在语音列表里选择英文
3:28.660–3:30.720
zh点击生成语音等待模型处理
3:38.320–3:39.140
zh生成完成
3:39.140–3:40.100
zh我们点击播放
3:40.100–3:41.820
zh听一下效果不错吧
3:41.820–3:46.580
zh点击向下的小箭头
3:46.580–3:48.360
zh可以下载音频文件
3:48.360–3:51.100
zh接着测试Q1-3TT-S模型
3:51.100–3:53.360
zh在模型列表里选择它
3:53.360–3:59.300
zh这次选一个中文参考音色
3:59.300–4:00.340
zh点击播放
4:00.340–4:03.520
zh以前我对这句话一致半解
4:03.520–4:05.080
zh现在好像有点懂了
4:05.080–4:07.020
zh因为你我开始留意很多
4:07.020–4:08.460
zh以前不曾关心的事
4:08.460–4:11.580
zh开始对这个世界有了更多的好奇和善意
4:11.580–4:14.020
zh在合成文本输入框里
4:14.020–4:15.220
zh填入你想说的话
4:15.220–4:17.280
zh语音列表里记得选中文
4:17.280–4:18.880
zh别忘记点击加载模型
4:18.880–4:22.520
zh然后点击生成语音
4:22.520–4:28.080
zh好 生成完成
4:28.080–4:30.320
zh点击播放听一下效果
4:30.320–4:34.020
zh千万3TTS覆盖十种主要语言中文英语
4:34.020–4:37.660
zh日语 韩语 德语 法语 俄语 葡萄牙语
4:37.660–4:39.300
zh西班牙语和意大利语
4:39.300–4:41.660
zh并提供多种方言语音配置
4:41.660–4:43.700
zh以满足全球应用需求
4:43.700–4:45.480
zh声音很自然
4:45.480–4:51.120
zh值得注意的是合成的文本不宜过长
4:51.120–4:54.060
zh不要超过100个字
4:54.060–4:55.600
zh生成语音速度会很慢
4:55.600–4:56.760
zh而且文本越长
4:56.760–4:58.420
zh合成音频的质量越差
4:58.420–5:00.560
zh如果有长文本需要处理怎么办
5:00.560–5:05.040
zhAudio CPP支持Batch P处理
5:05.040–5:07.600
zh我们来看一个P处理的例子
5:07.600–5:09.580
zh基本参数和前面一样
5:09.580–5:12.520
zhBatch Text File表示按行P处理
5:12.520–5:14.660
zh把文本拆分成多行
5:14.660–5:16.720
zh每行作为一段独立合成
5:16.720–5:19.680
enBatch Merge Audio Concrete
5:19.680–5:21.880
zh会自动将合成好的小段音频
5:21.880–5:23.780
zh合成为同一个完整文件
5:23.780–5:25.460
zh看看合成文本的内容
5:25.460–5:27.200
zh每一行是一个句子
5:27.200–5:28.420
zh布置这条命令
5:28.420–5:35.060
zh切换到命令型窗口
5:35.060–5:36.440
zh粘贴回车
5:36.440–5:39.460
zh等待模型生成音频文件
5:42.520–5:46.540
zh好,打开AUT文件夹,双击播放,听一下
5:46.540–5:52.600
zh好,咱们快速回顾一下
5:52.600–5:56.580
zhAudio CPP让本地语音AI部署变得非常简单
5:56.580–5:59.360
zhCLI和Web UI都支持
5:59.360–6:04.420
zh涵盖TTS特隆ASR转写音乐生成和实时对话
6:04.420–6:07.200
zh提供了统一的语音服务接口
6:07.200–6:10.780
zh安装也只需要下载模型文件即可
6:10.780–6:12.780
zh感兴趣的话,快去试试吧
6:12.780–6:14.100
zh效果不错
6:14.100–6:16.620
zh接下来是语音转写功能
6:16.620–6:17.940
zh也就是ASR
6:17.940–6:19.400
zh语音转文字
6:19.400–6:23.400
zh在模型列表里选择Qin3ASR模型
6:23.400–6:24.460
zh点击加载
6:24.460–6:26.380
zh上传一段音频文件
6:26.380–6:27.580
zh点击播放预览
6:27.580–6:29.740
zh我们浏览手机端页面
6:29.740–6:34.340
zhGLM5.2不具备视觉图像输入能力
6:34.340–6:36.240
zh它不能给网页添加图片
6:36.240–6:38.780
zh然后点击开始转写
6:38.780–6:39.900
zh模型开始处理
6:39.900–6:40.840
zh稍等一会儿
6:40.840–6:42.720
zh转写结果出现在文本框里
6:42.720–6:44.000
zh正确率非常高
6:44.000–6:49.040
zh再看音乐生成选项卡
6:49.040–6:51.860
zh玩法和其他语音模型类似
6:51.860–6:54.140
zh选择模型加载模型
6:54.140–6:56.000
zh如果模型没安装
6:56.000–6:57.400
zh点击下载即可
6:57.400–6:59.780
zh上传参考音频
6:59.780–7:00.920
zh输入提示词
7:00.920–7:03.000
zh最后点击生成音乐
7:03.000–7:04.920
zh这里我不做演示了
7:04.920–7:07.120
zh感兴趣的话可以自行尝试
7:07.120–7:10.700
zhAudio CPP可以作为服务提供方
7:10.700–7:13.180
zh共第三方应用调用
7:13.180–7:18.000
zh下面聊实时语音
7:18.000–7:20.800
zh它的工作原理是这样的
7:20.800–7:22.420
zh麦克风输入声音
7:22.420–7:25.300
zhASR模型转成文字
7:25.300–7:28.660
zh文字交给大语言模型处理
7:28.660–7:33.420
zh处理结果再通过TTS模型合成语音输出
7:33.883–7:36.303
zh实时语音比较消耗资源
7:36.303–7:41.323
zh因为后台同时加载了TTS和ASR两个模型
7:41.323–7:43.223
zh要使用这个功能
7:43.223–7:48.183
zh先双击RunWebBit开启WebUI服务
7:48.183–7:50.883
zh然后加载一个TTS模型
7:50.883–7:55.743
zh接着双击ASRBit加载ASR模型
7:55.743–8:00.623
zh最后双击RealtelBit打开实时语音页面
8:00.623–8:05.963
zh在设置里你可以配置LLM的接口地址
8:05.963–8:08.183
zh模型名称和API Key
8:08.183–8:09.303
zh点击对话
8:09.303–8:10.583
zh说一声你好
8:10.583–8:13.343
zh就可以看到实时交互效果了
8:13.343–8:16.823
zh你好
8:16.823–8:19.203
zh请问有什么
8:19.203–8:20.343
zh我可以帮你了吗
8:20.343–8:26.083
zh我可以帮你回答问题
8:26.083–8:26.963
zh翻译语言
8:26.963–8:27.863
zh撰写文本
8:27.863–8:29.343
zh以及提供创意建议
8:29.343–8:33.743
zh最后咱们说说怎么安装Audio CPP
8:33.743–8:36.263
zh打开它的GitHub页面
8:36.263–8:38.343
zh点击Releases
8:38.343–8:41.263
zh下载CPU版本的压缩包
8:41.263–8:44.103
zh解压后里面没有音频模型
8:44.103–8:48.463
zh我们需要自己创建一个Models玩件夹
8:48.463–8:50.863
zh用来存放所有模型文件
8:50.863–8:54.803
zh先安装Pocket TTS
8:54.803–8:57.943
zh打开Hugging Face上的模型页面
8:57.943–8:59.583
zh它只有1亿参数
8:59.583–9:00.383
zh非常轻量
9:00.383–9:02.983
zh不用GPU也能流畅运行
9:02.983–9:05.363
zh下载英文相关的模型文件
9:05.363–9:07.323
zh分磁器和参考音色
9:07.323–9:14.423
zh在Models下
9:14.423–9:16.583
zh创建Pocket TS文件夹
9:16.583–9:17.863
zh把文件放进去
9:17.863–9:22.843
zh再安装QVN3 TTS
9:22.843–9:24.783
zh打开摩塔社区
9:24.783–9:26.703
zh搜索QVN3 TTS
9:26.703–9:33.963
zh点击下载模型
9:33.963–9:37.983
zh推荐用GitLFS工具来下载
9:37.983–9:40.623
zh它是管理大文件的扩展
9:40.623–9:43.123
zh复制GitClone地址
9:43.123–9:46.043
zh在模型文件夹里打开CMD
9:46.043–9:47.283
zh粘贴并回车
9:47.283–9:51.483
zh如果已经下载过
9:51.483–9:52.563
zh会提示已存在
9:52.563–9:57.503
zh你也可以从Hugging Face的科问仓库下载
9:57.503–10:03.223
zh对于不想折腾的小伙伴
10:03.223–10:04.743
zh官方也提供了整合包
10:04.743–10:09.543
zh包含CPU、GPU和Web UI版本
10:09.543–10:11.843
zh常用音频模型都集成好了
10:11.843–10:13.783
zh直接用CPU就能跑
10:13.783–10:18.923
zh好,咱们快速回顾一下
10:18.923–10:23.263
zhAudio CPP让本地语音AI部署变得非常简单
10:23.263–10:27.316
zhCLI和Web UI都支持涵盖TTS、
10:27.316–10:27.991
zh特隆、
10:27.991–10:31.143
zhASR转写音乐生成和实时对话
10:31.143–10:33.763
zh提供了统一的语音服务接口
10:33.763–10:36.483
zh安装也只需要下载模型文件即可
10:36.483–10:38.263
zh感兴趣的话快去试试吧
10:38.263–10:39.063
zh感谢观看
10:39.063–10:40.203
zh我们下期再见
0:00.600–0:04.460
大家好,今天咱们聊一个实用工具,它叫AudioCPP
0:04.460–0:09.300
传统的本地语音模型环境,配置起来很麻烦
0:09.300–0:13.560
庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
0:13.560–0:18.000
是不是很熟悉,就像Alama简化了大语言模型一样
0:18.000–0:21.460
AudioCPC解决了音频AI的部署难题
0:21.460–0:24.880
它是纯C++实现的原生二进制程序
0:24.880–0:29.380
开箱挤用非常轻量,APU版本仅8兆大小
0:29.380–0:31.660
他支持TTS声音克隆
0:31.660–0:32.125
Hello,
0:32.125–0:33.056
this is audio.
0:33.056–0:34.840
cpp speaking from a webpage
0:34.840–0:37.100
支持ASR语音转文字
0:37.100–0:44.380
支持批量合成语音
0:44.380–0:50.940
还有实时语音功能
0:50.940–0:53.940
我可以帮你回答问题
0:53.940–0:55.720
翻译语言,撰写文本
0:55.720–0:57.180
以及提供创意建议
0:57.180–1:02.920
并且自带命令行CLI和网页界面Web UI
1:02.920–1:05.740
咱们先看命令行工具
1:05.740–1:08.420
也就是CLI功能
1:08.420–1:10.360
举个例子
1:10.360–1:14.820
输入AudioCppClare后面跟多个参数
1:14.820–1:18.620
Task TTS表示任务是声音克隆
1:18.620–1:22.900
Family Pocket TTS指定模型为Pocket TTS
1:22.900–1:26.760
Model后面写模型文件路径
1:26.760–1:29.880
Backend CPU表示用CPU推理
1:29.880–1:32.780
能使用GPU推理就写Cuda
1:32.780–1:35.680
Text是你要合成的文字内容
1:35.680–1:38.460
Voice ID是参考音色文件
1:38.460–1:41.640
Out指定输出音频的位置
1:41.640–1:44.280
现在我们来实际操作一下
1:44.280–1:46.560
打开AudioX CPT文件夹
1:46.560–1:49.240
在地址栏里输入CMD回车
1:49.240–1:51.640
这样就打开了命令提示符
1:51.640–1:53.120
复制准备好的命令行
1:53.120–1:55.800
粘贴进去按回车
1:55.800–1:58.380
模型开始生成音频
1:58.380–1:59.540
请稍等
1:59.540–2:00.520
生成完毕
2:00.520–2:02.700
我们打开out文件夹
2:02.700–2:05.360
双击这个音频文件听一下
2:14.480–2:16.440
效果还不错
2:16.440–2:17.000
对吧
2:17.000–2:19.120
再看第二个例子
2:19.120–2:21.280
基本参数和前面一样
2:21.280–2:22.840
这次使用的模型是
2:22.840–2:23.960
QuantTTS
2:23.960–2:28.580
Voice Reef是参考音频的位置
2:28.580–2:31.380
Reference Text是对应的参考文本
2:31.380–2:35.640
复制这条命令切换到命令行窗口
2:35.640–2:37.160
拦贴回车
2:37.160–2:39.960
等待模型生成音频文件
2:39.960–2:47.040
好,打开Out文件夹
2:47.040–2:50.280
双击播放,听一下
2:53.960–2:58.520
你好,Audio CPP正在Windows CPU上运行
2:58.520–3:00.440
效果依然很棒
3:00.440–3:03.740
说完了Cli,咱们看看Web UI
3:03.740–3:05.640
有了命令行基础
3:05.640–3:07.400
网页操作就更简单了
3:07.400–3:11.140
首先,在模型列表里选择Pocket TTS
3:11.140–3:12.560
点击加载模型
3:12.560–3:14.640
然后选择一个参考音色文件
3:14.640–3:17.840
点击播放视听
3:17.840–3:28.660
在语音列表里选择英文
3:28.660–3:30.720
点击生成语音等待模型处理
3:38.320–3:39.140
生成完成
3:39.140–3:40.100
我们点击播放
3:40.100–3:41.820
听一下效果不错吧
3:41.820–3:46.580
点击向下的小箭头
3:46.580–3:48.360
可以下载音频文件
3:48.360–3:51.100
接着测试Q1-3TT-S模型
3:51.100–3:53.360
在模型列表里选择它
3:53.360–3:59.300
这次选一个中文参考音色
3:59.300–4:00.340
点击播放
4:00.340–4:03.520
以前我对这句话一致半解
4:03.520–4:05.080
现在好像有点懂了
4:05.080–4:07.020
因为你我开始留意很多
4:07.020–4:08.460
以前不曾关心的事
4:08.460–4:11.580
开始对这个世界有了更多的好奇和善意
4:11.580–4:14.020
在合成文本输入框里
4:14.020–4:15.220
填入你想说的话
4:15.220–4:17.280
语音列表里记得选中文
4:17.280–4:18.880
别忘记点击加载模型
4:18.880–4:22.520
然后点击生成语音
4:22.520–4:28.080
好 生成完成
4:28.080–4:30.320
点击播放听一下效果
4:30.320–4:34.020
千万3TTS覆盖十种主要语言中文英语
4:34.020–4:37.660
日语 韩语 德语 法语 俄语 葡萄牙语
4:37.660–4:39.300
西班牙语和意大利语
4:39.300–4:41.660
并提供多种方言语音配置
4:41.660–4:43.700
以满足全球应用需求
4:43.700–4:45.480
声音很自然
4:45.480–4:51.120
值得注意的是合成的文本不宜过长
4:51.120–4:54.060
不要超过100个字
4:54.060–4:55.600
生成语音速度会很慢
4:55.600–4:56.760
而且文本越长
4:56.760–4:58.420
合成音频的质量越差
4:58.420–5:00.560
如果有长文本需要处理怎么办
5:00.560–5:05.040
Audio CPP支持Batch P处理
5:05.040–5:07.600
我们来看一个P处理的例子
5:07.600–5:09.580
基本参数和前面一样
5:09.580–5:12.520
Batch Text File表示按行P处理
5:12.520–5:14.660
把文本拆分成多行
5:14.660–5:16.720
每行作为一段独立合成
5:16.720–5:19.680
Batch Merge Audio Concrete
5:19.680–5:21.880
会自动将合成好的小段音频
5:21.880–5:23.780
合成为同一个完整文件
5:23.780–5:25.460
看看合成文本的内容
5:25.460–5:27.200
每一行是一个句子
5:27.200–5:28.420
布置这条命令
5:28.420–5:35.060
切换到命令型窗口
5:35.060–5:36.440
粘贴回车
5:36.440–5:39.460
等待模型生成音频文件
5:42.520–5:46.540
好,打开AUT文件夹,双击播放,听一下
5:46.540–5:52.600
好,咱们快速回顾一下
5:52.600–5:56.580
Audio CPP让本地语音AI部署变得非常简单
5:56.580–5:59.360
CLI和Web UI都支持
5:59.360–6:04.420
涵盖TTS特隆ASR转写音乐生成和实时对话
6:04.420–6:07.200
提供了统一的语音服务接口
6:07.200–6:10.780
安装也只需要下载模型文件即可
6:10.780–6:12.780
感兴趣的话,快去试试吧
6:12.780–6:14.100
效果不错
6:14.100–6:16.620
接下来是语音转写功能
6:16.620–6:17.940
也就是ASR
6:17.940–6:19.400
语音转文字
6:19.400–6:23.400
在模型列表里选择Qin3ASR模型
6:23.400–6:24.460
点击加载
6:24.460–6:26.380
上传一段音频文件
6:26.380–6:27.580
点击播放预览
6:27.580–6:29.740
我们浏览手机端页面
6:29.740–6:34.340
GLM5.2不具备视觉图像输入能力
6:34.340–6:36.240
它不能给网页添加图片
6:36.240–6:38.780
然后点击开始转写
6:38.780–6:39.900
模型开始处理
6:39.900–6:40.840
稍等一会儿
6:40.840–6:42.720
转写结果出现在文本框里
6:42.720–6:44.000
正确率非常高
6:44.000–6:49.040
再看音乐生成选项卡
6:49.040–6:51.860
玩法和其他语音模型类似
6:51.860–6:54.140
选择模型加载模型
6:54.140–6:56.000
如果模型没安装
6:56.000–6:57.400
点击下载即可
6:57.400–6:59.780
上传参考音频
6:59.780–7:00.920
输入提示词
7:00.920–7:03.000
最后点击生成音乐
7:03.000–7:04.920
这里我不做演示了
7:04.920–7:07.120
感兴趣的话可以自行尝试
7:07.120–7:10.700
Audio CPP可以作为服务提供方
7:10.700–7:13.180
共第三方应用调用
7:13.180–7:18.000
下面聊实时语音
7:18.000–7:20.800
它的工作原理是这样的
7:20.800–7:22.420
麦克风输入声音
7:22.420–7:25.300
ASR模型转成文字
7:25.300–7:28.660
文字交给大语言模型处理
7:28.660–7:33.420
处理结果再通过TTS模型合成语音输出
7:33.883–7:36.303
实时语音比较消耗资源
7:36.303–7:41.323
因为后台同时加载了TTS和ASR两个模型
7:41.323–7:43.223
要使用这个功能
7:43.223–7:48.183
先双击RunWebBit开启WebUI服务
7:48.183–7:50.883
然后加载一个TTS模型
7:50.883–7:55.743
接着双击ASRBit加载ASR模型
7:55.743–8:00.623
最后双击RealtelBit打开实时语音页面
8:00.623–8:05.963
在设置里你可以配置LLM的接口地址
8:05.963–8:08.183
模型名称和API Key
8:08.183–8:09.303
点击对话
8:09.303–8:10.583
说一声你好
8:10.583–8:13.343
就可以看到实时交互效果了
8:13.343–8:16.823
你好
8:16.823–8:19.203
请问有什么
8:19.203–8:20.343
我可以帮你了吗
8:20.343–8:26.083
我可以帮你回答问题
8:26.083–8:26.963
翻译语言
8:26.963–8:27.863
撰写文本
8:27.863–8:29.343
以及提供创意建议
8:29.343–8:33.743
最后咱们说说怎么安装Audio CPP
8:33.743–8:36.263
打开它的GitHub页面
8:36.263–8:38.343
点击Releases
8:38.343–8:41.263
下载CPU版本的压缩包
8:41.263–8:44.103
解压后里面没有音频模型
8:44.103–8:48.463
我们需要自己创建一个Models玩件夹
8:48.463–8:50.863
用来存放所有模型文件
8:50.863–8:54.803
先安装Pocket TTS
8:54.803–8:57.943
打开Hugging Face上的模型页面
8:57.943–8:59.583
它只有1亿参数
8:59.583–9:00.383
非常轻量
9:00.383–9:02.983
不用GPU也能流畅运行
9:02.983–9:05.363
下载英文相关的模型文件
9:05.363–9:07.323
分磁器和参考音色
9:07.323–9:14.423
在Models下
9:14.423–9:16.583
创建Pocket TS文件夹
9:16.583–9:17.863
把文件放进去
9:17.863–9:22.843
再安装QVN3 TTS
9:22.843–9:24.783
打开摩塔社区
9:24.783–9:26.703
搜索QVN3 TTS
9:26.703–9:33.963
点击下载模型
9:33.963–9:37.983
推荐用GitLFS工具来下载
9:37.983–9:40.623
它是管理大文件的扩展
9:40.623–9:43.123
复制GitClone地址
9:43.123–9:46.043
在模型文件夹里打开CMD
9:46.043–9:47.283
粘贴并回车
9:47.283–9:51.483
如果已经下载过
9:51.483–9:52.563
会提示已存在
9:52.563–9:57.503
你也可以从Hugging Face的科问仓库下载
9:57.503–10:03.223
对于不想折腾的小伙伴
10:03.223–10:04.743
官方也提供了整合包
10:04.743–10:09.543
包含CPU、GPU和Web UI版本
10:09.543–10:11.843
常用音频模型都集成好了
10:11.843–10:13.783
直接用CPU就能跑
10:13.783–10:18.923
好,咱们快速回顾一下
10:18.923–10:23.263
Audio CPP让本地语音AI部署变得非常简单
10:23.263–10:27.316
CLI和Web UI都支持涵盖TTS、
10:27.316–10:27.991
特隆、
10:27.991–10:31.143
ASR转写音乐生成和实时对话
10:31.143–10:33.763
提供了统一的语音服务接口
10:33.763–10:36.483
安装也只需要下载模型文件即可
10:36.483–10:38.263
感兴趣的话快去试试吧
10:38.263–10:39.063
感谢观看
10:39.063–10:40.203
我们下期再见
0:00.600–0:04.460
zh大家好,今天咱们聊一个实用工具,它叫AudioCPP
大家好,今天咱们聊一个实用工具,它叫AudioCPP
0:04.460–0:09.300
zh传统的本地语音模型环境,配置起来很麻烦
传统的本地语音模型环境,配置起来很麻烦
0:09.300–0:13.560
zh庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
0:13.560–0:18.000
zh是不是很熟悉,就像Alama简化了大语言模型一样
是不是很熟悉,就像Alama简化了大语言模型一样
0:18.000–0:21.460
zhAudioCPC解决了音频AI的部署难题
AudioCPC解决了音频AI的部署难题
0:21.460–0:24.880
zh它是纯C++实现的原生二进制程序
它是纯C++实现的原生二进制程序
0:24.880–0:29.380
zh开箱挤用非常轻量,APU版本仅8兆大小
开箱挤用非常轻量,APU版本仅8兆大小
0:29.380–0:31.660
zh他支持TTS声音克隆
他支持TTS声音克隆
0:31.660–0:32.125
enHello,
Hello,
0:32.125–0:33.056
enthis is audio.
this is audio.
0:33.056–0:34.840
encpp speaking from a webpage
cpp speaking from a webpage
0:34.840–0:37.100
zh支持ASR语音转文字
支持ASR语音转文字
0:37.100–0:44.380
zh支持批量合成语音
支持批量合成语音
0:44.380–0:50.940
zh还有实时语音功能
还有实时语音功能
0:50.940–0:53.940
zh我可以帮你回答问题
我可以帮你回答问题
0:53.940–0:55.720
zh翻译语言,撰写文本
翻译语言,撰写文本
0:55.720–0:57.180
zh以及提供创意建议
以及提供创意建议
0:57.180–1:02.920
zh并且自带命令行CLI和网页界面Web UI
并且自带命令行CLI和网页界面Web UI
1:02.920–1:05.740
zh咱们先看命令行工具
咱们先看命令行工具
1:05.740–1:08.420
zh也就是CLI功能
也就是CLI功能
1:08.420–1:10.360
zh举个例子
举个例子
1:10.360–1:14.820
zh输入AudioCppClare后面跟多个参数
输入AudioCppClare后面跟多个参数
1:14.820–1:18.620
zhTask TTS表示任务是声音克隆
Task TTS表示任务是声音克隆
1:18.620–1:22.900
zhFamily Pocket TTS指定模型为Pocket TTS
Family Pocket TTS指定模型为Pocket TTS
1:22.900–1:26.760
zhModel后面写模型文件路径
Model后面写模型文件路径
1:26.760–1:29.880
zhBackend CPU表示用CPU推理
Backend CPU表示用CPU推理
1:29.880–1:32.780
zh能使用GPU推理就写Cuda
能使用GPU推理就写Cuda
1:32.780–1:35.680
zhText是你要合成的文字内容
Text是你要合成的文字内容
1:35.680–1:38.460
zhVoice ID是参考音色文件
Voice ID是参考音色文件
1:38.460–1:41.640
zhOut指定输出音频的位置
Out指定输出音频的位置
1:41.640–1:44.280
zh现在我们来实际操作一下
现在我们来实际操作一下
1:44.280–1:46.560
zh打开AudioX CPT文件夹
打开AudioX CPT文件夹
1:46.560–1:49.240
zh在地址栏里输入CMD回车
在地址栏里输入CMD回车
1:49.240–1:51.640
zh这样就打开了命令提示符
这样就打开了命令提示符
1:51.640–1:53.120
zh复制准备好的命令行
复制准备好的命令行
1:53.120–1:55.800
zh粘贴进去按回车
粘贴进去按回车
1:55.800–1:58.380
zh模型开始生成音频
模型开始生成音频
1:58.380–1:59.540
zh请稍等
请稍等
1:59.540–2:00.520
zh生成完毕
生成完毕
2:00.520–2:02.700
zh我们打开out文件夹
我们打开out文件夹
2:02.700–2:05.360
zh双击这个音频文件听一下
双击这个音频文件听一下
2:14.480–2:16.440
zh效果还不错
效果还不错
2:16.440–2:17.000
zh对吧
对吧
2:17.000–2:19.120
zh再看第二个例子
再看第二个例子
2:19.120–2:21.280
zh基本参数和前面一样
基本参数和前面一样
2:21.280–2:22.840
zh这次使用的模型是
这次使用的模型是
2:22.840–2:23.960
enQuantTTS
QuantTTS
2:23.960–2:28.580
zhVoice Reef是参考音频的位置
Voice Reef是参考音频的位置
2:28.580–2:31.380
zhReference Text是对应的参考文本
Reference Text是对应的参考文本
2:31.380–2:35.640
zh复制这条命令切换到命令行窗口
复制这条命令切换到命令行窗口
2:35.640–2:37.160
zh拦贴回车
拦贴回车
2:37.160–2:39.960
zh等待模型生成音频文件
等待模型生成音频文件
2:39.960–2:47.040
zh好,打开Out文件夹
好,打开Out文件夹
2:47.040–2:50.280
zh双击播放,听一下
双击播放,听一下
2:53.960–2:58.520
zh你好,Audio CPP正在Windows CPU上运行
你好,Audio CPP正在Windows CPU上运行
2:58.520–3:00.440
zh效果依然很棒
效果依然很棒
3:00.440–3:03.740
zh说完了Cli,咱们看看Web UI
说完了Cli,咱们看看Web UI
3:03.740–3:05.640
zh有了命令行基础
有了命令行基础
3:05.640–3:07.400
zh网页操作就更简单了
网页操作就更简单了
3:07.400–3:11.140
zh首先,在模型列表里选择Pocket TTS
首先,在模型列表里选择Pocket TTS
3:11.140–3:12.560
zh点击加载模型
点击加载模型
3:12.560–3:14.640
zh然后选择一个参考音色文件
然后选择一个参考音色文件
3:14.640–3:17.840
zh点击播放视听
点击播放视听
3:17.840–3:28.660
zh在语音列表里选择英文
在语音列表里选择英文
3:28.660–3:30.720
zh点击生成语音等待模型处理
点击生成语音等待模型处理
3:38.320–3:39.140
zh生成完成
生成完成
3:39.140–3:40.100
zh我们点击播放
我们点击播放
3:40.100–3:41.820
zh听一下效果不错吧
听一下效果不错吧
3:41.820–3:46.580
zh点击向下的小箭头
点击向下的小箭头
3:46.580–3:48.360
zh可以下载音频文件
可以下载音频文件
3:48.360–3:51.100
zh接着测试Q1-3TT-S模型
接着测试Q1-3TT-S模型
3:51.100–3:53.360
zh在模型列表里选择它
在模型列表里选择它
3:53.360–3:59.300
zh这次选一个中文参考音色
这次选一个中文参考音色
3:59.300–4:00.340
zh点击播放
点击播放
4:00.340–4:03.520
zh以前我对这句话一致半解
以前我对这句话一致半解
4:03.520–4:05.080
zh现在好像有点懂了
现在好像有点懂了
4:05.080–4:07.020
zh因为你我开始留意很多
因为你我开始留意很多
4:07.020–4:08.460
zh以前不曾关心的事
以前不曾关心的事
4:08.460–4:11.580
zh开始对这个世界有了更多的好奇和善意
开始对这个世界有了更多的好奇和善意
4:11.580–4:14.020
zh在合成文本输入框里
在合成文本输入框里
4:14.020–4:15.220
zh填入你想说的话
填入你想说的话
4:15.220–4:17.280
zh语音列表里记得选中文
语音列表里记得选中文
4:17.280–4:18.880
zh别忘记点击加载模型
别忘记点击加载模型
4:18.880–4:22.520
zh然后点击生成语音
然后点击生成语音
4:22.520–4:28.080
zh好 生成完成
好 生成完成
4:28.080–4:30.320
zh点击播放听一下效果
点击播放听一下效果
4:30.320–4:34.020
zh千万3TTS覆盖十种主要语言中文英语
千万3TTS覆盖十种主要语言中文英语
4:34.020–4:37.660
zh日语 韩语 德语 法语 俄语 葡萄牙语
日语 韩语 德语 法语 俄语 葡萄牙语
4:37.660–4:39.300
zh西班牙语和意大利语
西班牙语和意大利语
4:39.300–4:41.660
zh并提供多种方言语音配置
并提供多种方言语音配置
4:41.660–4:43.700
zh以满足全球应用需求
以满足全球应用需求
4:43.700–4:45.480
zh声音很自然
声音很自然
4:45.480–4:51.120
zh值得注意的是合成的文本不宜过长
值得注意的是合成的文本不宜过长
4:51.120–4:54.060
zh不要超过100个字
不要超过100个字
4:54.060–4:55.600
zh生成语音速度会很慢
生成语音速度会很慢
4:55.600–4:56.760
zh而且文本越长
而且文本越长
4:56.760–4:58.420
zh合成音频的质量越差
合成音频的质量越差
4:58.420–5:00.560
zh如果有长文本需要处理怎么办
如果有长文本需要处理怎么办
5:00.560–5:05.040
zhAudio CPP支持Batch P处理
Audio CPP支持Batch P处理
5:05.040–5:07.600
zh我们来看一个P处理的例子
我们来看一个P处理的例子
5:07.600–5:09.580
zh基本参数和前面一样
基本参数和前面一样
5:09.580–5:12.520
zhBatch Text File表示按行P处理
Batch Text File表示按行P处理
5:12.520–5:14.660
zh把文本拆分成多行
把文本拆分成多行
5:14.660–5:16.720
zh每行作为一段独立合成
每行作为一段独立合成
5:16.720–5:19.680
enBatch Merge Audio Concrete
Batch Merge Audio Concrete
5:19.680–5:21.880
zh会自动将合成好的小段音频
会自动将合成好的小段音频
5:21.880–5:23.780
zh合成为同一个完整文件
合成为同一个完整文件
5:23.780–5:25.460
zh看看合成文本的内容
看看合成文本的内容
5:25.460–5:27.200
zh每一行是一个句子
每一行是一个句子
5:27.200–5:28.420
zh布置这条命令
布置这条命令
5:28.420–5:35.060
zh切换到命令型窗口
切换到命令型窗口
5:35.060–5:36.440
zh粘贴回车
粘贴回车
5:36.440–5:39.460
zh等待模型生成音频文件
等待模型生成音频文件
5:42.520–5:46.540
zh好,打开AUT文件夹,双击播放,听一下
好,打开AUT文件夹,双击播放,听一下
5:46.540–5:52.600
zh好,咱们快速回顾一下
好,咱们快速回顾一下
5:52.600–5:56.580
zhAudio CPP让本地语音AI部署变得非常简单
Audio CPP让本地语音AI部署变得非常简单
5:56.580–5:59.360
zhCLI和Web UI都支持
CLI和Web UI都支持
5:59.360–6:04.420
zh涵盖TTS特隆ASR转写音乐生成和实时对话
涵盖TTS特隆ASR转写音乐生成和实时对话
6:04.420–6:07.200
zh提供了统一的语音服务接口
提供了统一的语音服务接口
6:07.200–6:10.780
zh安装也只需要下载模型文件即可
安装也只需要下载模型文件即可
6:10.780–6:12.780
zh感兴趣的话,快去试试吧
感兴趣的话,快去试试吧
6:12.780–6:14.100
zh效果不错
效果不错
6:14.100–6:16.620
zh接下来是语音转写功能
接下来是语音转写功能
6:16.620–6:17.940
zh也就是ASR
也就是ASR
6:17.940–6:19.400
zh语音转文字
语音转文字
6:19.400–6:23.400
zh在模型列表里选择Qin3ASR模型
在模型列表里选择Qin3ASR模型
6:23.400–6:24.460
zh点击加载
点击加载
6:24.460–6:26.380
zh上传一段音频文件
上传一段音频文件
6:26.380–6:27.580
zh点击播放预览
点击播放预览
6:27.580–6:29.740
zh我们浏览手机端页面
我们浏览手机端页面
6:29.740–6:34.340
zhGLM5.2不具备视觉图像输入能力
GLM5.2不具备视觉图像输入能力
6:34.340–6:36.240
zh它不能给网页添加图片
它不能给网页添加图片
6:36.240–6:38.780
zh然后点击开始转写
然后点击开始转写
6:38.780–6:39.900
zh模型开始处理
模型开始处理
6:39.900–6:40.840
zh稍等一会儿
稍等一会儿
6:40.840–6:42.720
zh转写结果出现在文本框里
转写结果出现在文本框里
6:42.720–6:44.000
zh正确率非常高
正确率非常高
6:44.000–6:49.040
zh再看音乐生成选项卡
再看音乐生成选项卡
6:49.040–6:51.860
zh玩法和其他语音模型类似
玩法和其他语音模型类似
6:51.860–6:54.140
zh选择模型加载模型
选择模型加载模型
6:54.140–6:56.000
zh如果模型没安装
如果模型没安装
6:56.000–6:57.400
zh点击下载即可
点击下载即可
6:57.400–6:59.780
zh上传参考音频
上传参考音频
6:59.780–7:00.920
zh输入提示词
输入提示词
7:00.920–7:03.000
zh最后点击生成音乐
最后点击生成音乐
7:03.000–7:04.920
zh这里我不做演示了
这里我不做演示了
7:04.920–7:07.120
zh感兴趣的话可以自行尝试
感兴趣的话可以自行尝试
7:07.120–7:10.700
zhAudio CPP可以作为服务提供方
Audio CPP可以作为服务提供方
7:10.700–7:13.180
zh共第三方应用调用
共第三方应用调用
7:13.180–7:18.000
zh下面聊实时语音
下面聊实时语音
7:18.000–7:20.800
zh它的工作原理是这样的
它的工作原理是这样的
7:20.800–7:22.420
zh麦克风输入声音
麦克风输入声音
7:22.420–7:25.300
zhASR模型转成文字
ASR模型转成文字
7:25.300–7:28.660
zh文字交给大语言模型处理
文字交给大语言模型处理
7:28.660–7:33.420
zh处理结果再通过TTS模型合成语音输出
处理结果再通过TTS模型合成语音输出
7:33.883–7:36.303
zh实时语音比较消耗资源
实时语音比较消耗资源
7:36.303–7:41.323
zh因为后台同时加载了TTS和ASR两个模型
因为后台同时加载了TTS和ASR两个模型
7:41.323–7:43.223
zh要使用这个功能
要使用这个功能
7:43.223–7:48.183
zh先双击RunWebBit开启WebUI服务
先双击RunWebBit开启WebUI服务
7:48.183–7:50.883
zh然后加载一个TTS模型
然后加载一个TTS模型
7:50.883–7:55.743
zh接着双击ASRBit加载ASR模型
接着双击ASRBit加载ASR模型
7:55.743–8:00.623
zh最后双击RealtelBit打开实时语音页面
最后双击RealtelBit打开实时语音页面
8:00.623–8:05.963
zh在设置里你可以配置LLM的接口地址
在设置里你可以配置LLM的接口地址
8:05.963–8:08.183
zh模型名称和API Key
模型名称和API Key
8:08.183–8:09.303
zh点击对话
点击对话
8:09.303–8:10.583
zh说一声你好
说一声你好
8:10.583–8:13.343
zh就可以看到实时交互效果了
就可以看到实时交互效果了
8:13.343–8:16.823
zh你好
你好
8:16.823–8:19.203
zh请问有什么
请问有什么
8:19.203–8:20.343
zh我可以帮你了吗
我可以帮你了吗
8:20.343–8:26.083
zh我可以帮你回答问题
我可以帮你回答问题
8:26.083–8:26.963
zh翻译语言
翻译语言
8:26.963–8:27.863
zh撰写文本
撰写文本
8:27.863–8:29.343
zh以及提供创意建议
以及提供创意建议
8:29.343–8:33.743
zh最后咱们说说怎么安装Audio CPP
最后咱们说说怎么安装Audio CPP
8:33.743–8:36.263
zh打开它的GitHub页面
打开它的GitHub页面
8:36.263–8:38.343
zh点击Releases
点击Releases
8:38.343–8:41.263
zh下载CPU版本的压缩包
下载CPU版本的压缩包
8:41.263–8:44.103
zh解压后里面没有音频模型
解压后里面没有音频模型
8:44.103–8:48.463
zh我们需要自己创建一个Models玩件夹
我们需要自己创建一个Models玩件夹
8:48.463–8:50.863
zh用来存放所有模型文件
用来存放所有模型文件
8:50.863–8:54.803
zh先安装Pocket TTS
先安装Pocket TTS
8:54.803–8:57.943
zh打开Hugging Face上的模型页面
打开Hugging Face上的模型页面
8:57.943–8:59.583
zh它只有1亿参数
它只有1亿参数
8:59.583–9:00.383
zh非常轻量
非常轻量
9:00.383–9:02.983
zh不用GPU也能流畅运行
不用GPU也能流畅运行
9:02.983–9:05.363
zh下载英文相关的模型文件
下载英文相关的模型文件
9:05.363–9:07.323
zh分磁器和参考音色
分磁器和参考音色
9:07.323–9:14.423
zh在Models下
在Models下
9:14.423–9:16.583
zh创建Pocket TS文件夹
创建Pocket TS文件夹
9:16.583–9:17.863
zh把文件放进去
把文件放进去
9:17.863–9:22.843
zh再安装QVN3 TTS
再安装QVN3 TTS
9:22.843–9:24.783
zh打开摩塔社区
打开摩塔社区
9:24.783–9:26.703
zh搜索QVN3 TTS
搜索QVN3 TTS
9:26.703–9:33.963
zh点击下载模型
点击下载模型
9:33.963–9:37.983
zh推荐用GitLFS工具来下载
推荐用GitLFS工具来下载
9:37.983–9:40.623
zh它是管理大文件的扩展
它是管理大文件的扩展
9:40.623–9:43.123
zh复制GitClone地址
复制GitClone地址
9:43.123–9:46.043
zh在模型文件夹里打开CMD
在模型文件夹里打开CMD
9:46.043–9:47.283
zh粘贴并回车
粘贴并回车
9:47.283–9:51.483
zh如果已经下载过
如果已经下载过
9:51.483–9:52.563
zh会提示已存在
会提示已存在
9:52.563–9:57.503
zh你也可以从Hugging Face的科问仓库下载
你也可以从Hugging Face的科问仓库下载
9:57.503–10:03.223
zh对于不想折腾的小伙伴
对于不想折腾的小伙伴
10:03.223–10:04.743
zh官方也提供了整合包
官方也提供了整合包
10:04.743–10:09.543
zh包含CPU、GPU和Web UI版本
包含CPU、GPU和Web UI版本
10:09.543–10:11.843
zh常用音频模型都集成好了
常用音频模型都集成好了
10:11.843–10:13.783
zh直接用CPU就能跑
直接用CPU就能跑
10:13.783–10:18.923
zh好,咱们快速回顾一下
好,咱们快速回顾一下
10:18.923–10:23.263
zhAudio CPP让本地语音AI部署变得非常简单
Audio CPP让本地语音AI部署变得非常简单
10:23.263–10:27.316
zhCLI和Web UI都支持涵盖TTS、
CLI和Web UI都支持涵盖TTS、
10:27.316–10:27.991
zh特隆、
特隆、
10:27.991–10:31.143
zhASR转写音乐生成和实时对话
ASR转写音乐生成和实时对话
10:31.143–10:33.763
zh提供了统一的语音服务接口
提供了统一的语音服务接口
10:33.763–10:36.483
zh安装也只需要下载模型文件即可
安装也只需要下载模型文件即可
10:36.483–10:38.263
zh感兴趣的话快去试试吧
感兴趣的话快去试试吧
10:38.263–10:39.063
zh感谢观看
感谢观看
10:39.063–10:40.203
zh我们下期再见
我们下期再见

影片筆記:audio.cpp 音频 AI 领域的“Ollama” 本地部署音频AI模型,开箱即用,支持命令行 CLI 以及Web UI, TTS / 声音克隆、ASR /

一句話總結

影片介紹了一款名為 AudioCPP 的純 C++ 本地語音 AI 部署工具,旨在解決傳統 Python/Conda 環境配置繁瑣的問題,提供輕量級、開箱即用的體驗,支援 TTS(含聲音克隆)、ASR、音樂生成及即時語音對話,並同時提供 CLI 與 Web UI 介面。

核心重點

  1. 技術架構與優勢
  • 純 C++ 實現,原生二進制程序。
  • 輕量級(APU 版本僅 8MB),無需 Conda、Python 等複雜環境配置。
  • 開箱即用,簡化本地語音 AI 部署流程。
  1. 核心功能
  • TTS(文字轉語音):支援聲音克隆、批量合成、多語言(10種主要語言及方言)。
  • ASR(語音轉文字):支援語音轉寫。
  • 音樂生成:支援基於參考音頻和提示詞生成音樂。
  • 即時語音對話:結合 ASR、LLM 與 TTS 實現即時互動。
  1. 介面支援
  • 同時提供命令行介面(CLI)與網頁介面(Web UI)。
  1. 安裝與模型管理
  • 需手動下載模型文件至指定資料夾,或下載官方整合包。
  • 支援 CPU 與 GPU (Cuda) 推理後端。

詳細大綱

I. AudioCPP 簡介與優勢

  • 定位:簡化本地語音 AI 部署的實用工具。
  • 技術架構:純 C++ 實現,原生二進制程序。
  • 優點
  • 輕量級(APU 版本僅 8MB)。
  • 無需複雜環境配置(無須 Conda、Python 等)。
  • 開箱即用。

II. 核心功能與操作演示

A. 命令行介面 (CLI) 操作

  1. 基本參數結構
  • Task:指定任務類型(如 TTS)。
  • Family:指定模型系列(如 Pocket TTS, QuantTTS)。
  • Model:模型文件路徑。
  • Backend:推理後端(CPU 或 Cuda/GPU)。
  • Text:合成文字內容。
  • Voice ID:參考音色文件。
  • Out:輸出音頻位置。
  1. 實例演示 1 (Pocket TTS)
  • 使用 AudioCppClare 命令。
  • 設定 CPU 推理,輸入文字與參考音色。
  • 生成音頻並播放,效果良好。
  1. 實例演示 2 (QuantTTS)
  • 使用 QuantTTS 模型。
  • 設定 Voice Reef(參考音頻)與 Reference Text(參考文本)。
  • 生成並播放,確認在 Windows CPU 上運行效果佳。

B. 網頁介面 (Web UI) 操作

  1. TTS 聲音克隆測試
  • 選擇模型(Pocket TTS 或 Q1-3TT-S/QVN3 TTS)。
  • 加載模型,選擇參考音色(英文或中文)。
  • 輸入合成文本,選擇語言,點擊生成。
  • 播放聽取效果,支援下載音頻文件。
  1. 多語言支援
  • 覆蓋中文、英語、日語、韓語、德語、法語、俄語、葡萄牙語、西班牙語、義大利語。
  • 提供多種方言配置。
  1. 注意事項
  • 合成文本建議不超過 100 字,否則速度變慢且質量下降。

C. 批量處理 (Batch Processing)

  • 適用場景:處理長文本。
  • 操作方式
  • Batch Text File:按行處理,每行作為獨立段落合成。
  • Batch Merge Audio:自動將合成的小段音頻合併為完整文件。
  • 演示:將多行句子文本拆分合成後合併播放。

D. 語音轉寫 (ASR)

  • 模型選擇:Qin3ASR。
  • 操作:上傳音頻文件,點擊開始轉寫。
  • 結果:轉寫結果顯示於文本框,準確率高。

E. 音樂生成

  • 操作:選擇模型 -> 加載 -> 上傳參考音頻 -> 輸入提示詞 -> 點擊生成。
  • 備註:若模型未安裝可點擊下載,影片未做詳細演示。

F. 即時語音 (Real-time Voice)

  • 工作原理
  1. 麥克風輸入聲音。
  2. ASR 模型轉成文字。
  3. 文字交給大語言模型 (LLM) 處理。
  4. TTS 模型將處理結果合成語音輸出。
  • 資源消耗:較高(同時加載 TTS 和 ASR 模型)。
  • 啟動步驟
  1. 雙擊 RunWebBit 開啟 WebUI 服務。
  2. 加載 TTS 模型。
  3. 雙擊 ASRBit 加載 ASR 模型。
  4. 雙擊 RealtelBit 打開即時語音頁面。
  5. 配置 LLM 接口地址、模型名稱和 API Key。
  6. 點擊對話進行測試。

III. 安裝與模型下載指南

  1. 獲取主程序
  • 前往 GitHub Releases 頁面。
  • 下載 CPU 版本壓縮包。
  1. 模型文件配置
  • 主程序內無音頻模型,需自行創建 Models 資料夾。
  1. 特定模型安裝
  • Pocket TTS
  • 來源:Hugging Face。
  • 特點:1 億參數,輕量,無 GPU 亦可流暢運行。
  • 步驟:下載英文相關模型文件、分詞器、參考音色,放入 Models/Pocket TS 資料夾。
  • QVN3 TTS
  • 來源:摩塔社區 (MotA Community) 或 Hugging Face 倉庫。
  • 推薦工具:GitLFS(管理大文件擴展)。
  • 步驟:複製 GitClone 地址,在模型資料夾 CMD 中執行下載。
  1. 官方整合包
  • 提供包含 CPU、GPU 和 Web UI 版本的整合包。
  • 集成常用音頻模型,可直接使用 CPU 運行。

IV. 總結

  • AudioCPP 簡化了本地語音 AI 部署。
  • 支援 CLI 與 Web UI。
  • 功能涵蓋 TTS、ASR、音樂生成、即時對話。
  • 提供統一語音服務接口。
  • 安裝簡便,只需下載模型文件。

工具 / 模型 / 名詞整理

  • AudioCPP (影片主要介紹的工具)
  • Alama (逐字稿提及,用於簡化大語言模型,疑似指代某工具但名稱存疑)
  • Conda
  • Python
  • E-Lite
  • Pocket TTS
  • QuantTTS (CLI 參數中出現)
  • Q1-3TT-S (Web UI 測試中出現)
  • QVN3 TTS (安裝指南中出現)
  • Qin3ASR (ASR 功能中出現)
  • GLM5.2 (ASR 轉寫測試中提及)
  • RunWebBit (啟動 WebUI 服務程序)
  • ASRBit (加載 ASR 模型程序)
  • RealtelBit (打開即時語音頁面程序)
  • GitHub
  • Hugging Face
  • 摩塔社區
  • GitLFS
  • GitClone

操作流程整理

CLI 操作流程

  1. 打開命令行窗口。
  2. 執行 AudioCppClare 命令。
  3. 設定參數:
  • Task: TTS
  • Family: Pocket TTS 或 QuantTTS
  • Backend: CPU 或 Cuda
  • Text: 輸入合成文字
  • Voice ID: 指定參考音色文件
  • Out: 指定輸出音頻位置
  1. 執行命令生成音頻。
  2. 播放生成的音頻文件。

Web UI 操作流程

  1. 雙擊 RunWebBit 啟動服務。
  2. 在瀏覽器中打開 Web UI。
  3. TTS 聲音克隆
  • 選擇模型(Pocket TTS 或 Q1-3TT-S/QVN3 TTS)。
  • 加載模型。
  • 上傳參考音色文件。
  • 輸入合成文本。
  • 選擇語言。
  • 點擊生成並播放/下載。
  1. 批量處理
  • 上傳 Batch Text File
  • 系統按行拆分合成。
  • 使用 Batch Merge Audio 合併音頻。
  1. ASR 轉寫
  • 選擇 Qin3ASR 模型。
  • 上傳音頻文件。
  • 點擊開始轉寫,查看文本結果。
  1. 即時語音對話
  • 加載 TTS 模型。
  • 雙擊 ASRBit 加載 ASR 模型。
  • 雙擊 RealtelBit 打開即時語音頁面。
  • 配置 LLM 接口地址、模型名稱和 API Key。
  • 進行語音對話測試。

安裝與模型下載流程

  1. 前往 GitHub Releases 下載 CPU 版本壓縮包。
  2. 解壓後創建 Models 資料夾。
  3. 下載 Pocket TTS
  • 從 Hugging Face 下載英文相關模型文件、分詞器、參考音色。
  • 放入 Models/Pocket TS 資料夾。
  1. 下載 QVN3 TTS
  • 從摩塔社區或 Hugging Face 獲取 GitClone 地址。
  • 使用 GitLFS 在模型資料夾 CMD 中執行下載。
  1. 或使用官方整合包(包含 CPU/GPU/Web UI 及常用模型)。

值得注意的限制或風險

  1. 文本長度限制:Web UI 合成文本建議不超過 100 字,否則速度變慢且質量下降。
  2. 資源消耗:即時語音對話需同時加載 TTS 和 ASR 模型,資源消耗較高。
  3. 模型依賴:主程序內無音頻模型,需自行下載並配置模型文件,否則無法使用。
  4. 硬體要求:Pocket TTS 雖輕量(1 億參數),但其他模型可能需要 GPU (Cuda) 支援以獲得流暢體驗。

逐字稿辨識疑點

  • AudioCPP:逐字稿中出現 AudioCPPAudioCPCAudioX CPT 等多種寫法,需查證正確產品名稱。
  • Alama:逐字稿提及「就像 Alama 簡化了大語言模型一樣」,此名稱不常見,需查證是否為特定工具名稱或口誤。
  • E-Lite:逐字稿提及「Python, E-Lite 這些痛點」,需查證此名稱是否為特定庫或工具。
  • QuantTTS:CLI 參數中出現,需確認是否為正確模型名稱。
  • Q1-3TT-S:Web UI 測試中出現,需確認是否為正確模型名稱。
  • QVN3 TTS:安裝指南中出現,需確認是否為正確模型名稱。
  • Qin3ASR:ASR 功能中出現,需確認是否為正確模型名稱。
  • RunWebBitASRBitRealtelBit:這些程序名稱拼寫較為特殊(如 Bit 而非 Bit 或 UI),需查證是否為正確的可執行文件名稱。
  • 摩塔社區:需查證此名稱是否為正確的平台名稱。
  • 1 億參數:逐字稿稱 Pocket TTS 只有 1 億參數,需查證是否準確。
  • 8 兆大小:逐字稿稱 APU 版本僅 8 兆大小,需查證單位是否為 MB 或 KB。
  • Batch P 處理:逐字稿中出現「Batch P 處理」,疑為「Batch Processing」或「批量處理」的口誤或聽寫錯誤。
  • AUT 文件夾:逐字稿中出現「打開 AUT 文件夾」,疑為「Out 文件夾」的聽寫錯誤。
  • Commanding 窗口:逐字稿中出現「切換到命令型窗口」,疑為「命令行窗口」的口誤。
  • 特隆:逐字稿總結中出現「涵蓋 TTS 特隆 ASR 轉寫」,疑為「翻譯」或特定功能的口誤。
  • Voice Reef:CLI 參數中出現,疑為「Voice Ref」或「Voice Reference」的口誤。
  • Reference Text:CLI 參數中出現,需確認是否為正確參數名稱。
  • Task TTS:CLI 參數中出現,需確認是否為正確參數名稱。
  • Family Pocket TTS:CLI 參數中出現,需確認是否為正確參數名稱。
  • Backend CPU:CLI 參數中出現,需確認是否為正確參數名稱。
  • Cuda:CLI 參數中出現,需確認是否為正確參數名稱(通常為 CUDA)。
  • Voice ID:CLI 參數中出現,需確認是否為正確參數名稱。
  • Out:CLI 參數中出現,需確認是否為正確參數名稱。
  • Batch Text File:批量處理參數中出現,需確認是否為正確參數名稱。
  • Batch Merge Audio Concrete:批量處理參數中出現,需確認是否為正確參數名稱。
  • Models玩件夾:安裝指南中出現,疑為「Models 文件夾」的聽寫錯誤。
  • 分磁器:安裝指南中出現,疑為「分詞器」的聽寫錯誤。
  • 科問倉庫:安裝指南中出現,疑為「問答倉庫」或特定倉庫名稱的聽寫錯誤。

可延伸追問

  1. AudioCPP 的正確產品名稱及官方 GitHub 倉庫地址為何?
  2. 「Alama」、「E-Lite」、「摩塔社區」等名稱的具體指代對象及正確拼寫為何?
  3. CLI 參數中 Voice ReefBatch Merge Audio Concrete 等名稱的正確拼寫及完整參數列表為何?
  4. RunWebBitASRBitRealtelBit 等可執行文件的正確名稱及下載來源為何?
  5. Pocket TTS 的「1 億參數」與「8MB 大小」是否準確?是否有更詳細的技術規格?
  6. 官方整合包中是否包含所有列出的模型(Pocket TTS, QVN3 TTS, Qin3ASR 等)?
  7. 即時語音對話中,LLM 接口配置是否有推薦的模型或 API 提供商?
  8. 對於長文本批量處理,是否有更優化的參數設置建議?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習