0:00.600–0:04.460
zh大家好,今天咱们聊一个实用工具,它叫AudioCPP
0:04.460–0:09.300
zh传统的本地语音模型环境,配置起来很麻烦
0:09.300–0:13.560
zh庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
0:13.560–0:18.000
zh是不是很熟悉,就像Alama简化了大语言模型一样
0:18.000–0:21.460
zhAudioCPC解决了音频AI的部署难题
0:21.460–0:24.880
zh它是纯C++实现的原生二进制程序
0:24.880–0:29.380
zh开箱挤用非常轻量,APU版本仅8兆大小
0:29.380–0:31.660
zh他支持TTS声音克隆
0:31.660–0:32.125
enHello,
0:32.125–0:33.056
enthis is audio.
0:33.056–0:34.840
encpp speaking from a webpage
0:34.840–0:37.100
zh支持ASR语音转文字
0:37.100–0:44.380
zh支持批量合成语音
0:44.380–0:50.940
zh还有实时语音功能
0:50.940–0:53.940
zh我可以帮你回答问题
0:53.940–0:55.720
zh翻译语言,撰写文本
0:55.720–0:57.180
zh以及提供创意建议
0:57.180–1:02.920
zh并且自带命令行CLI和网页界面Web UI
1:02.920–1:05.740
zh咱们先看命令行工具
1:05.740–1:08.420
zh也就是CLI功能
1:08.420–1:10.360
zh举个例子
1:10.360–1:14.820
zh输入AudioCppClare后面跟多个参数
1:14.820–1:18.620
zhTask TTS表示任务是声音克隆
1:18.620–1:22.900
zhFamily Pocket TTS指定模型为Pocket TTS
1:22.900–1:26.760
zhModel后面写模型文件路径
1:26.760–1:29.880
zhBackend CPU表示用CPU推理
1:29.880–1:32.780
zh能使用GPU推理就写Cuda
1:32.780–1:35.680
zhText是你要合成的文字内容
1:35.680–1:38.460
zhVoice ID是参考音色文件
1:38.460–1:41.640
zhOut指定输出音频的位置
1:41.640–1:44.280
zh现在我们来实际操作一下
1:44.280–1:46.560
zh打开AudioX CPT文件夹
1:46.560–1:49.240
zh在地址栏里输入CMD回车
1:49.240–1:51.640
zh这样就打开了命令提示符
1:51.640–1:53.120
zh复制准备好的命令行
1:53.120–1:55.800
zh粘贴进去按回车
1:55.800–1:58.380
zh模型开始生成音频
1:58.380–1:59.540
zh请稍等
1:59.540–2:00.520
zh生成完毕
2:00.520–2:02.700
zh我们打开out文件夹
2:02.700–2:05.360
zh双击这个音频文件听一下
2:14.480–2:16.440
zh效果还不错
2:16.440–2:17.000
zh对吧
2:17.000–2:19.120
zh再看第二个例子
2:19.120–2:21.280
zh基本参数和前面一样
2:21.280–2:22.840
zh这次使用的模型是
2:22.840–2:23.960
enQuantTTS
2:23.960–2:28.580
zhVoice Reef是参考音频的位置
2:28.580–2:31.380
zhReference Text是对应的参考文本
2:31.380–2:35.640
zh复制这条命令切换到命令行窗口
2:35.640–2:37.160
zh拦贴回车
2:37.160–2:39.960
zh等待模型生成音频文件
2:39.960–2:47.040
zh好,打开Out文件夹
2:47.040–2:50.280
zh双击播放,听一下
2:53.960–2:58.520
zh你好,Audio CPP正在Windows CPU上运行
2:58.520–3:00.440
zh效果依然很棒
3:00.440–3:03.740
zh说完了Cli,咱们看看Web UI
3:03.740–3:05.640
zh有了命令行基础
3:05.640–3:07.400
zh网页操作就更简单了
3:07.400–3:11.140
zh首先,在模型列表里选择Pocket TTS
3:11.140–3:12.560
zh点击加载模型
3:12.560–3:14.640
zh然后选择一个参考音色文件
3:14.640–3:17.840
zh点击播放视听
3:17.840–3:28.660
zh在语音列表里选择英文
3:28.660–3:30.720
zh点击生成语音等待模型处理
3:38.320–3:39.140
zh生成完成
3:39.140–3:40.100
zh我们点击播放
3:40.100–3:41.820
zh听一下效果不错吧
3:41.820–3:46.580
zh点击向下的小箭头
3:46.580–3:48.360
zh可以下载音频文件
3:48.360–3:51.100
zh接着测试Q1-3TT-S模型
3:51.100–3:53.360
zh在模型列表里选择它
3:53.360–3:59.300
zh这次选一个中文参考音色
3:59.300–4:00.340
zh点击播放
4:00.340–4:03.520
zh以前我对这句话一致半解
4:03.520–4:05.080
zh现在好像有点懂了
4:05.080–4:07.020
zh因为你我开始留意很多
4:07.020–4:08.460
zh以前不曾关心的事
4:08.460–4:11.580
zh开始对这个世界有了更多的好奇和善意
4:11.580–4:14.020
zh在合成文本输入框里
4:14.020–4:15.220
zh填入你想说的话
4:15.220–4:17.280
zh语音列表里记得选中文
4:17.280–4:18.880
zh别忘记点击加载模型
4:18.880–4:22.520
zh然后点击生成语音
4:22.520–4:28.080
zh好 生成完成
4:28.080–4:30.320
zh点击播放听一下效果
4:30.320–4:34.020
zh千万3TTS覆盖十种主要语言中文英语
4:34.020–4:37.660
zh日语 韩语 德语 法语 俄语 葡萄牙语
4:37.660–4:39.300
zh西班牙语和意大利语
4:39.300–4:41.660
zh并提供多种方言语音配置
4:41.660–4:43.700
zh以满足全球应用需求
4:43.700–4:45.480
zh声音很自然
4:45.480–4:51.120
zh值得注意的是合成的文本不宜过长
4:51.120–4:54.060
zh不要超过100个字
4:54.060–4:55.600
zh生成语音速度会很慢
4:55.600–4:56.760
zh而且文本越长
4:56.760–4:58.420
zh合成音频的质量越差
4:58.420–5:00.560
zh如果有长文本需要处理怎么办
5:00.560–5:05.040
zhAudio CPP支持Batch P处理
5:05.040–5:07.600
zh我们来看一个P处理的例子
5:07.600–5:09.580
zh基本参数和前面一样
5:09.580–5:12.520
zhBatch Text File表示按行P处理
5:12.520–5:14.660
zh把文本拆分成多行
5:14.660–5:16.720
zh每行作为一段独立合成
5:16.720–5:19.680
enBatch Merge Audio Concrete
5:19.680–5:21.880
zh会自动将合成好的小段音频
5:21.880–5:23.780
zh合成为同一个完整文件
5:23.780–5:25.460
zh看看合成文本的内容
5:25.460–5:27.200
zh每一行是一个句子
5:27.200–5:28.420
zh布置这条命令
5:28.420–5:35.060
zh切换到命令型窗口
5:35.060–5:36.440
zh粘贴回车
5:36.440–5:39.460
zh等待模型生成音频文件
5:42.520–5:46.540
zh好,打开AUT文件夹,双击播放,听一下
5:46.540–5:52.600
zh好,咱们快速回顾一下
5:52.600–5:56.580
zhAudio CPP让本地语音AI部署变得非常简单
5:56.580–5:59.360
zhCLI和Web UI都支持
5:59.360–6:04.420
zh涵盖TTS特隆ASR转写音乐生成和实时对话
6:04.420–6:07.200
zh提供了统一的语音服务接口
6:07.200–6:10.780
zh安装也只需要下载模型文件即可
6:10.780–6:12.780
zh感兴趣的话,快去试试吧
6:12.780–6:14.100
zh效果不错
6:14.100–6:16.620
zh接下来是语音转写功能
6:16.620–6:17.940
zh也就是ASR
6:17.940–6:19.400
zh语音转文字
6:19.400–6:23.400
zh在模型列表里选择Qin3ASR模型
6:23.400–6:24.460
zh点击加载
6:24.460–6:26.380
zh上传一段音频文件
6:26.380–6:27.580
zh点击播放预览
6:27.580–6:29.740
zh我们浏览手机端页面
6:29.740–6:34.340
zhGLM5.2不具备视觉图像输入能力
6:34.340–6:36.240
zh它不能给网页添加图片
6:36.240–6:38.780
zh然后点击开始转写
6:38.780–6:39.900
zh模型开始处理
6:39.900–6:40.840
zh稍等一会儿
6:40.840–6:42.720
zh转写结果出现在文本框里
6:42.720–6:44.000
zh正确率非常高
6:44.000–6:49.040
zh再看音乐生成选项卡
6:49.040–6:51.860
zh玩法和其他语音模型类似
6:51.860–6:54.140
zh选择模型加载模型
6:54.140–6:56.000
zh如果模型没安装
6:56.000–6:57.400
zh点击下载即可
6:57.400–6:59.780
zh上传参考音频
6:59.780–7:00.920
zh输入提示词
7:00.920–7:03.000
zh最后点击生成音乐
7:03.000–7:04.920
zh这里我不做演示了
7:04.920–7:07.120
zh感兴趣的话可以自行尝试
7:07.120–7:10.700
zhAudio CPP可以作为服务提供方
7:10.700–7:13.180
zh共第三方应用调用
7:13.180–7:18.000
zh下面聊实时语音
7:18.000–7:20.800
zh它的工作原理是这样的
7:20.800–7:22.420
zh麦克风输入声音
7:22.420–7:25.300
zhASR模型转成文字
7:25.300–7:28.660
zh文字交给大语言模型处理
7:28.660–7:33.420
zh处理结果再通过TTS模型合成语音输出
7:33.883–7:36.303
zh实时语音比较消耗资源
7:36.303–7:41.323
zh因为后台同时加载了TTS和ASR两个模型
7:41.323–7:43.223
zh要使用这个功能
7:43.223–7:48.183
zh先双击RunWebBit开启WebUI服务
7:48.183–7:50.883
zh然后加载一个TTS模型
7:50.883–7:55.743
zh接着双击ASRBit加载ASR模型
7:55.743–8:00.623
zh最后双击RealtelBit打开实时语音页面
8:00.623–8:05.963
zh在设置里你可以配置LLM的接口地址
8:05.963–8:08.183
zh模型名称和API Key
8:08.183–8:09.303
zh点击对话
8:09.303–8:10.583
zh说一声你好
8:10.583–8:13.343
zh就可以看到实时交互效果了
8:13.343–8:16.823
zh你好
8:16.823–8:19.203
zh请问有什么
8:19.203–8:20.343
zh我可以帮你了吗
8:20.343–8:26.083
zh我可以帮你回答问题
8:26.083–8:26.963
zh翻译语言
8:26.963–8:27.863
zh撰写文本
8:27.863–8:29.343
zh以及提供创意建议
8:29.343–8:33.743
zh最后咱们说说怎么安装Audio CPP
8:33.743–8:36.263
zh打开它的GitHub页面
8:36.263–8:38.343
zh点击Releases
8:38.343–8:41.263
zh下载CPU版本的压缩包
8:41.263–8:44.103
zh解压后里面没有音频模型
8:44.103–8:48.463
zh我们需要自己创建一个Models玩件夹
8:48.463–8:50.863
zh用来存放所有模型文件
8:50.863–8:54.803
zh先安装Pocket TTS
8:54.803–8:57.943
zh打开Hugging Face上的模型页面
8:57.943–8:59.583
zh它只有1亿参数
8:59.583–9:00.383
zh非常轻量
9:00.383–9:02.983
zh不用GPU也能流畅运行
9:02.983–9:05.363
zh下载英文相关的模型文件
9:05.363–9:07.323
zh分磁器和参考音色
9:07.323–9:14.423
zh在Models下
9:14.423–9:16.583
zh创建Pocket TS文件夹
9:16.583–9:17.863
zh把文件放进去
9:17.863–9:22.843
zh再安装QVN3 TTS
9:22.843–9:24.783
zh打开摩塔社区
9:24.783–9:26.703
zh搜索QVN3 TTS
9:26.703–9:33.963
zh点击下载模型
9:33.963–9:37.983
zh推荐用GitLFS工具来下载
9:37.983–9:40.623
zh它是管理大文件的扩展
9:40.623–9:43.123
zh复制GitClone地址
9:43.123–9:46.043
zh在模型文件夹里打开CMD
9:46.043–9:47.283
zh粘贴并回车
9:47.283–9:51.483
zh如果已经下载过
9:51.483–9:52.563
zh会提示已存在
9:52.563–9:57.503
zh你也可以从Hugging Face的科问仓库下载
9:57.503–10:03.223
zh对于不想折腾的小伙伴
10:03.223–10:04.743
zh官方也提供了整合包
10:04.743–10:09.543
zh包含CPU、GPU和Web UI版本
10:09.543–10:11.843
zh常用音频模型都集成好了
10:11.843–10:13.783
zh直接用CPU就能跑
10:13.783–10:18.923
zh好,咱们快速回顾一下
10:18.923–10:23.263
zhAudio CPP让本地语音AI部署变得非常简单
10:23.263–10:27.316
zhCLI和Web UI都支持涵盖TTS、
10:27.316–10:27.991
zh特隆、
10:27.991–10:31.143
zhASR转写音乐生成和实时对话
10:31.143–10:33.763
zh提供了统一的语音服务接口
10:33.763–10:36.483
zh安装也只需要下载模型文件即可
10:36.483–10:38.263
zh感兴趣的话快去试试吧
10:38.263–10:39.063
zh感谢观看
10:39.063–10:40.203
zh我们下期再见
0:00.600–0:04.460
大家好,今天咱们聊一个实用工具,它叫AudioCPP
0:04.460–0:09.300
传统的本地语音模型环境,配置起来很麻烦
0:09.300–0:13.560
庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
0:13.560–0:18.000
是不是很熟悉,就像Alama简化了大语言模型一样
0:18.000–0:21.460
AudioCPC解决了音频AI的部署难题
0:21.460–0:24.880
它是纯C++实现的原生二进制程序
0:24.880–0:29.380
开箱挤用非常轻量,APU版本仅8兆大小
0:29.380–0:31.660
他支持TTS声音克隆
0:31.660–0:32.125
Hello,
0:32.125–0:33.056
this is audio.
0:33.056–0:34.840
cpp speaking from a webpage
0:34.840–0:37.100
支持ASR语音转文字
0:37.100–0:44.380
支持批量合成语音
0:44.380–0:50.940
还有实时语音功能
0:50.940–0:53.940
我可以帮你回答问题
0:53.940–0:55.720
翻译语言,撰写文本
0:55.720–0:57.180
以及提供创意建议
0:57.180–1:02.920
并且自带命令行CLI和网页界面Web UI
1:02.920–1:05.740
咱们先看命令行工具
1:05.740–1:08.420
也就是CLI功能
1:08.420–1:10.360
举个例子
1:10.360–1:14.820
输入AudioCppClare后面跟多个参数
1:14.820–1:18.620
Task TTS表示任务是声音克隆
1:18.620–1:22.900
Family Pocket TTS指定模型为Pocket TTS
1:22.900–1:26.760
Model后面写模型文件路径
1:26.760–1:29.880
Backend CPU表示用CPU推理
1:29.880–1:32.780
能使用GPU推理就写Cuda
1:32.780–1:35.680
Text是你要合成的文字内容
1:35.680–1:38.460
Voice ID是参考音色文件
1:38.460–1:41.640
Out指定输出音频的位置
1:41.640–1:44.280
现在我们来实际操作一下
1:44.280–1:46.560
打开AudioX CPT文件夹
1:46.560–1:49.240
在地址栏里输入CMD回车
1:49.240–1:51.640
这样就打开了命令提示符
1:51.640–1:53.120
复制准备好的命令行
1:53.120–1:55.800
粘贴进去按回车
1:55.800–1:58.380
模型开始生成音频
1:58.380–1:59.540
请稍等
1:59.540–2:00.520
生成完毕
2:00.520–2:02.700
我们打开out文件夹
2:02.700–2:05.360
双击这个音频文件听一下
2:14.480–2:16.440
效果还不错
2:16.440–2:17.000
对吧
2:17.000–2:19.120
再看第二个例子
2:19.120–2:21.280
基本参数和前面一样
2:21.280–2:22.840
这次使用的模型是
2:22.840–2:23.960
QuantTTS
2:23.960–2:28.580
Voice Reef是参考音频的位置
2:28.580–2:31.380
Reference Text是对应的参考文本
2:31.380–2:35.640
复制这条命令切换到命令行窗口
2:35.640–2:37.160
拦贴回车
2:37.160–2:39.960
等待模型生成音频文件
2:39.960–2:47.040
好,打开Out文件夹
2:47.040–2:50.280
双击播放,听一下
2:53.960–2:58.520
你好,Audio CPP正在Windows CPU上运行
2:58.520–3:00.440
效果依然很棒
3:00.440–3:03.740
说完了Cli,咱们看看Web UI
3:03.740–3:05.640
有了命令行基础
3:05.640–3:07.400
网页操作就更简单了
3:07.400–3:11.140
首先,在模型列表里选择Pocket TTS
3:11.140–3:12.560
点击加载模型
3:12.560–3:14.640
然后选择一个参考音色文件
3:14.640–3:17.840
点击播放视听
3:17.840–3:28.660
在语音列表里选择英文
3:28.660–3:30.720
点击生成语音等待模型处理
3:38.320–3:39.140
生成完成
3:39.140–3:40.100
我们点击播放
3:40.100–3:41.820
听一下效果不错吧
3:41.820–3:46.580
点击向下的小箭头
3:46.580–3:48.360
可以下载音频文件
3:48.360–3:51.100
接着测试Q1-3TT-S模型
3:51.100–3:53.360
在模型列表里选择它
3:53.360–3:59.300
这次选一个中文参考音色
3:59.300–4:00.340
点击播放
4:00.340–4:03.520
以前我对这句话一致半解
4:03.520–4:05.080
现在好像有点懂了
4:05.080–4:07.020
因为你我开始留意很多
4:07.020–4:08.460
以前不曾关心的事
4:08.460–4:11.580
开始对这个世界有了更多的好奇和善意
4:11.580–4:14.020
在合成文本输入框里
4:14.020–4:15.220
填入你想说的话
4:15.220–4:17.280
语音列表里记得选中文
4:17.280–4:18.880
别忘记点击加载模型
4:18.880–4:22.520
然后点击生成语音
4:22.520–4:28.080
好 生成完成
4:28.080–4:30.320
点击播放听一下效果
4:30.320–4:34.020
千万3TTS覆盖十种主要语言中文英语
4:34.020–4:37.660
日语 韩语 德语 法语 俄语 葡萄牙语
4:37.660–4:39.300
西班牙语和意大利语
4:39.300–4:41.660
并提供多种方言语音配置
4:41.660–4:43.700
以满足全球应用需求
4:43.700–4:45.480
声音很自然
4:45.480–4:51.120
值得注意的是合成的文本不宜过长
4:51.120–4:54.060
不要超过100个字
4:54.060–4:55.600
生成语音速度会很慢
4:55.600–4:56.760
而且文本越长
4:56.760–4:58.420
合成音频的质量越差
4:58.420–5:00.560
如果有长文本需要处理怎么办
5:00.560–5:05.040
Audio CPP支持Batch P处理
5:05.040–5:07.600
我们来看一个P处理的例子
5:07.600–5:09.580
基本参数和前面一样
5:09.580–5:12.520
Batch Text File表示按行P处理
5:12.520–5:14.660
把文本拆分成多行
5:14.660–5:16.720
每行作为一段独立合成
5:16.720–5:19.680
Batch Merge Audio Concrete
5:19.680–5:21.880
会自动将合成好的小段音频
5:21.880–5:23.780
合成为同一个完整文件
5:23.780–5:25.460
看看合成文本的内容
5:25.460–5:27.200
每一行是一个句子
5:27.200–5:28.420
布置这条命令
5:28.420–5:35.060
切换到命令型窗口
5:35.060–5:36.440
粘贴回车
5:36.440–5:39.460
等待模型生成音频文件
5:42.520–5:46.540
好,打开AUT文件夹,双击播放,听一下
5:46.540–5:52.600
好,咱们快速回顾一下
5:52.600–5:56.580
Audio CPP让本地语音AI部署变得非常简单
5:56.580–5:59.360
CLI和Web UI都支持
5:59.360–6:04.420
涵盖TTS特隆ASR转写音乐生成和实时对话
6:04.420–6:07.200
提供了统一的语音服务接口
6:07.200–6:10.780
安装也只需要下载模型文件即可
6:10.780–6:12.780
感兴趣的话,快去试试吧
6:12.780–6:14.100
效果不错
6:14.100–6:16.620
接下来是语音转写功能
6:16.620–6:17.940
也就是ASR
6:17.940–6:19.400
语音转文字
6:19.400–6:23.400
在模型列表里选择Qin3ASR模型
6:23.400–6:24.460
点击加载
6:24.460–6:26.380
上传一段音频文件
6:26.380–6:27.580
点击播放预览
6:27.580–6:29.740
我们浏览手机端页面
6:29.740–6:34.340
GLM5.2不具备视觉图像输入能力
6:34.340–6:36.240
它不能给网页添加图片
6:36.240–6:38.780
然后点击开始转写
6:38.780–6:39.900
模型开始处理
6:39.900–6:40.840
稍等一会儿
6:40.840–6:42.720
转写结果出现在文本框里
6:42.720–6:44.000
正确率非常高
6:44.000–6:49.040
再看音乐生成选项卡
6:49.040–6:51.860
玩法和其他语音模型类似
6:51.860–6:54.140
选择模型加载模型
6:54.140–6:56.000
如果模型没安装
6:56.000–6:57.400
点击下载即可
6:57.400–6:59.780
上传参考音频
6:59.780–7:00.920
输入提示词
7:00.920–7:03.000
最后点击生成音乐
7:03.000–7:04.920
这里我不做演示了
7:04.920–7:07.120
感兴趣的话可以自行尝试
7:07.120–7:10.700
Audio CPP可以作为服务提供方
7:10.700–7:13.180
共第三方应用调用
7:13.180–7:18.000
下面聊实时语音
7:18.000–7:20.800
它的工作原理是这样的
7:20.800–7:22.420
麦克风输入声音
7:22.420–7:25.300
ASR模型转成文字
7:25.300–7:28.660
文字交给大语言模型处理
7:28.660–7:33.420
处理结果再通过TTS模型合成语音输出
7:33.883–7:36.303
实时语音比较消耗资源
7:36.303–7:41.323
因为后台同时加载了TTS和ASR两个模型
7:41.323–7:43.223
要使用这个功能
7:43.223–7:48.183
先双击RunWebBit开启WebUI服务
7:48.183–7:50.883
然后加载一个TTS模型
7:50.883–7:55.743
接着双击ASRBit加载ASR模型
7:55.743–8:00.623
最后双击RealtelBit打开实时语音页面
8:00.623–8:05.963
在设置里你可以配置LLM的接口地址
8:05.963–8:08.183
模型名称和API Key
8:08.183–8:09.303
点击对话
8:09.303–8:10.583
说一声你好
8:10.583–8:13.343
就可以看到实时交互效果了
8:13.343–8:16.823
你好
8:16.823–8:19.203
请问有什么
8:19.203–8:20.343
我可以帮你了吗
8:20.343–8:26.083
我可以帮你回答问题
8:26.083–8:26.963
翻译语言
8:26.963–8:27.863
撰写文本
8:27.863–8:29.343
以及提供创意建议
8:29.343–8:33.743
最后咱们说说怎么安装Audio CPP
8:33.743–8:36.263
打开它的GitHub页面
8:36.263–8:38.343
点击Releases
8:38.343–8:41.263
下载CPU版本的压缩包
8:41.263–8:44.103
解压后里面没有音频模型
8:44.103–8:48.463
我们需要自己创建一个Models玩件夹
8:48.463–8:50.863
用来存放所有模型文件
8:50.863–8:54.803
先安装Pocket TTS
8:54.803–8:57.943
打开Hugging Face上的模型页面
8:57.943–8:59.583
它只有1亿参数
8:59.583–9:00.383
非常轻量
9:00.383–9:02.983
不用GPU也能流畅运行
9:02.983–9:05.363
下载英文相关的模型文件
9:05.363–9:07.323
分磁器和参考音色
9:07.323–9:14.423
在Models下
9:14.423–9:16.583
创建Pocket TS文件夹
9:16.583–9:17.863
把文件放进去
9:17.863–9:22.843
再安装QVN3 TTS
9:22.843–9:24.783
打开摩塔社区
9:24.783–9:26.703
搜索QVN3 TTS
9:26.703–9:33.963
点击下载模型
9:33.963–9:37.983
推荐用GitLFS工具来下载
9:37.983–9:40.623
它是管理大文件的扩展
9:40.623–9:43.123
复制GitClone地址
9:43.123–9:46.043
在模型文件夹里打开CMD
9:46.043–9:47.283
粘贴并回车
9:47.283–9:51.483
如果已经下载过
9:51.483–9:52.563
会提示已存在
9:52.563–9:57.503
你也可以从Hugging Face的科问仓库下载
9:57.503–10:03.223
对于不想折腾的小伙伴
10:03.223–10:04.743
官方也提供了整合包
10:04.743–10:09.543
包含CPU、GPU和Web UI版本
10:09.543–10:11.843
常用音频模型都集成好了
10:11.843–10:13.783
直接用CPU就能跑
10:13.783–10:18.923
好,咱们快速回顾一下
10:18.923–10:23.263
Audio CPP让本地语音AI部署变得非常简单
10:23.263–10:27.316
CLI和Web UI都支持涵盖TTS、
10:27.316–10:27.991
特隆、
10:27.991–10:31.143
ASR转写音乐生成和实时对话
10:31.143–10:33.763
提供了统一的语音服务接口
10:33.763–10:36.483
安装也只需要下载模型文件即可
10:36.483–10:38.263
感兴趣的话快去试试吧
10:38.263–10:39.063
感谢观看
10:39.063–10:40.203
我们下期再见
0:00.600–0:04.460
zh大家好,今天咱们聊一个实用工具,它叫AudioCPP
大家好,今天咱们聊一个实用工具,它叫AudioCPP
0:04.460–0:09.300
zh传统的本地语音模型环境,配置起来很麻烦
传统的本地语音模型环境,配置起来很麻烦
0:09.300–0:13.560
zh庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点
0:13.560–0:18.000
zh是不是很熟悉,就像Alama简化了大语言模型一样
是不是很熟悉,就像Alama简化了大语言模型一样
0:18.000–0:21.460
zhAudioCPC解决了音频AI的部署难题
AudioCPC解决了音频AI的部署难题
0:21.460–0:24.880
zh它是纯C++实现的原生二进制程序
它是纯C++实现的原生二进制程序
0:24.880–0:29.380
zh开箱挤用非常轻量,APU版本仅8兆大小
开箱挤用非常轻量,APU版本仅8兆大小
0:29.380–0:31.660
zh他支持TTS声音克隆
他支持TTS声音克隆
0:31.660–0:32.125
enHello,
Hello,
0:32.125–0:33.056
enthis is audio.
this is audio.
0:33.056–0:34.840
encpp speaking from a webpage
cpp speaking from a webpage
0:34.840–0:37.100
zh支持ASR语音转文字
支持ASR语音转文字
0:37.100–0:44.380
zh支持批量合成语音
支持批量合成语音
0:44.380–0:50.940
zh还有实时语音功能
还有实时语音功能
0:50.940–0:53.940
zh我可以帮你回答问题
我可以帮你回答问题
0:53.940–0:55.720
zh翻译语言,撰写文本
翻译语言,撰写文本
0:55.720–0:57.180
zh以及提供创意建议
以及提供创意建议
0:57.180–1:02.920
zh并且自带命令行CLI和网页界面Web UI
并且自带命令行CLI和网页界面Web UI
1:02.920–1:05.740
zh咱们先看命令行工具
咱们先看命令行工具
1:05.740–1:08.420
zh也就是CLI功能
也就是CLI功能
1:08.420–1:10.360
zh举个例子
举个例子
1:10.360–1:14.820
zh输入AudioCppClare后面跟多个参数
输入AudioCppClare后面跟多个参数
1:14.820–1:18.620
zhTask TTS表示任务是声音克隆
Task TTS表示任务是声音克隆
1:18.620–1:22.900
zhFamily Pocket TTS指定模型为Pocket TTS
Family Pocket TTS指定模型为Pocket TTS
1:22.900–1:26.760
zhModel后面写模型文件路径
Model后面写模型文件路径
1:26.760–1:29.880
zhBackend CPU表示用CPU推理
Backend CPU表示用CPU推理
1:29.880–1:32.780
zh能使用GPU推理就写Cuda
能使用GPU推理就写Cuda
1:32.780–1:35.680
zhText是你要合成的文字内容
Text是你要合成的文字内容
1:35.680–1:38.460
zhVoice ID是参考音色文件
Voice ID是参考音色文件
1:38.460–1:41.640
zhOut指定输出音频的位置
Out指定输出音频的位置
1:41.640–1:44.280
zh现在我们来实际操作一下
现在我们来实际操作一下
1:44.280–1:46.560
zh打开AudioX CPT文件夹
打开AudioX CPT文件夹
1:46.560–1:49.240
zh在地址栏里输入CMD回车
在地址栏里输入CMD回车
1:49.240–1:51.640
zh这样就打开了命令提示符
这样就打开了命令提示符
1:51.640–1:53.120
zh复制准备好的命令行
复制准备好的命令行
1:53.120–1:55.800
zh粘贴进去按回车
粘贴进去按回车
1:55.800–1:58.380
zh模型开始生成音频
模型开始生成音频
1:58.380–1:59.540
zh请稍等
请稍等
1:59.540–2:00.520
zh生成完毕
生成完毕
2:00.520–2:02.700
zh我们打开out文件夹
我们打开out文件夹
2:02.700–2:05.360
zh双击这个音频文件听一下
双击这个音频文件听一下
2:14.480–2:16.440
zh效果还不错
效果还不错
2:16.440–2:17.000
zh对吧
对吧
2:17.000–2:19.120
zh再看第二个例子
再看第二个例子
2:19.120–2:21.280
zh基本参数和前面一样
基本参数和前面一样
2:21.280–2:22.840
zh这次使用的模型是
这次使用的模型是
2:22.840–2:23.960
enQuantTTS
QuantTTS
2:23.960–2:28.580
zhVoice Reef是参考音频的位置
Voice Reef是参考音频的位置
2:28.580–2:31.380
zhReference Text是对应的参考文本
Reference Text是对应的参考文本
2:31.380–2:35.640
zh复制这条命令切换到命令行窗口
复制这条命令切换到命令行窗口
2:35.640–2:37.160
zh拦贴回车
拦贴回车
2:37.160–2:39.960
zh等待模型生成音频文件
等待模型生成音频文件
2:39.960–2:47.040
zh好,打开Out文件夹
好,打开Out文件夹
2:47.040–2:50.280
zh双击播放,听一下
双击播放,听一下
2:53.960–2:58.520
zh你好,Audio CPP正在Windows CPU上运行
你好,Audio CPP正在Windows CPU上运行
2:58.520–3:00.440
zh效果依然很棒
效果依然很棒
3:00.440–3:03.740
zh说完了Cli,咱们看看Web UI
说完了Cli,咱们看看Web UI
3:03.740–3:05.640
zh有了命令行基础
有了命令行基础
3:05.640–3:07.400
zh网页操作就更简单了
网页操作就更简单了
3:07.400–3:11.140
zh首先,在模型列表里选择Pocket TTS
首先,在模型列表里选择Pocket TTS
3:11.140–3:12.560
zh点击加载模型
点击加载模型
3:12.560–3:14.640
zh然后选择一个参考音色文件
然后选择一个参考音色文件
3:14.640–3:17.840
zh点击播放视听
点击播放视听
3:17.840–3:28.660
zh在语音列表里选择英文
在语音列表里选择英文
3:28.660–3:30.720
zh点击生成语音等待模型处理
点击生成语音等待模型处理
3:38.320–3:39.140
zh生成完成
生成完成
3:39.140–3:40.100
zh我们点击播放
我们点击播放
3:40.100–3:41.820
zh听一下效果不错吧
听一下效果不错吧
3:41.820–3:46.580
zh点击向下的小箭头
点击向下的小箭头
3:46.580–3:48.360
zh可以下载音频文件
可以下载音频文件
3:48.360–3:51.100
zh接着测试Q1-3TT-S模型
接着测试Q1-3TT-S模型
3:51.100–3:53.360
zh在模型列表里选择它
在模型列表里选择它
3:53.360–3:59.300
zh这次选一个中文参考音色
这次选一个中文参考音色
3:59.300–4:00.340
zh点击播放
点击播放
4:00.340–4:03.520
zh以前我对这句话一致半解
以前我对这句话一致半解
4:03.520–4:05.080
zh现在好像有点懂了
现在好像有点懂了
4:05.080–4:07.020
zh因为你我开始留意很多
因为你我开始留意很多
4:07.020–4:08.460
zh以前不曾关心的事
以前不曾关心的事
4:08.460–4:11.580
zh开始对这个世界有了更多的好奇和善意
开始对这个世界有了更多的好奇和善意
4:11.580–4:14.020
zh在合成文本输入框里
在合成文本输入框里
4:14.020–4:15.220
zh填入你想说的话
填入你想说的话
4:15.220–4:17.280
zh语音列表里记得选中文
语音列表里记得选中文
4:17.280–4:18.880
zh别忘记点击加载模型
别忘记点击加载模型
4:18.880–4:22.520
zh然后点击生成语音
然后点击生成语音
4:22.520–4:28.080
zh好 生成完成
好 生成完成
4:28.080–4:30.320
zh点击播放听一下效果
点击播放听一下效果
4:30.320–4:34.020
zh千万3TTS覆盖十种主要语言中文英语
千万3TTS覆盖十种主要语言中文英语
4:34.020–4:37.660
zh日语 韩语 德语 法语 俄语 葡萄牙语
日语 韩语 德语 法语 俄语 葡萄牙语
4:37.660–4:39.300
zh西班牙语和意大利语
西班牙语和意大利语
4:39.300–4:41.660
zh并提供多种方言语音配置
并提供多种方言语音配置
4:41.660–4:43.700
zh以满足全球应用需求
以满足全球应用需求
4:43.700–4:45.480
zh声音很自然
声音很自然
4:45.480–4:51.120
zh值得注意的是合成的文本不宜过长
值得注意的是合成的文本不宜过长
4:51.120–4:54.060
zh不要超过100个字
不要超过100个字
4:54.060–4:55.600
zh生成语音速度会很慢
生成语音速度会很慢
4:55.600–4:56.760
zh而且文本越长
而且文本越长
4:56.760–4:58.420
zh合成音频的质量越差
合成音频的质量越差
4:58.420–5:00.560
zh如果有长文本需要处理怎么办
如果有长文本需要处理怎么办
5:00.560–5:05.040
zhAudio CPP支持Batch P处理
Audio CPP支持Batch P处理
5:05.040–5:07.600
zh我们来看一个P处理的例子
我们来看一个P处理的例子
5:07.600–5:09.580
zh基本参数和前面一样
基本参数和前面一样
5:09.580–5:12.520
zhBatch Text File表示按行P处理
Batch Text File表示按行P处理
5:12.520–5:14.660
zh把文本拆分成多行
把文本拆分成多行
5:14.660–5:16.720
zh每行作为一段独立合成
每行作为一段独立合成
5:16.720–5:19.680
enBatch Merge Audio Concrete
Batch Merge Audio Concrete
5:19.680–5:21.880
zh会自动将合成好的小段音频
会自动将合成好的小段音频
5:21.880–5:23.780
zh合成为同一个完整文件
合成为同一个完整文件
5:23.780–5:25.460
zh看看合成文本的内容
看看合成文本的内容
5:25.460–5:27.200
zh每一行是一个句子
每一行是一个句子
5:27.200–5:28.420
zh布置这条命令
布置这条命令
5:28.420–5:35.060
zh切换到命令型窗口
切换到命令型窗口
5:35.060–5:36.440
zh粘贴回车
粘贴回车
5:36.440–5:39.460
zh等待模型生成音频文件
等待模型生成音频文件
5:42.520–5:46.540
zh好,打开AUT文件夹,双击播放,听一下
好,打开AUT文件夹,双击播放,听一下
5:46.540–5:52.600
zh好,咱们快速回顾一下
好,咱们快速回顾一下
5:52.600–5:56.580
zhAudio CPP让本地语音AI部署变得非常简单
Audio CPP让本地语音AI部署变得非常简单
5:56.580–5:59.360
zhCLI和Web UI都支持
CLI和Web UI都支持
5:59.360–6:04.420
zh涵盖TTS特隆ASR转写音乐生成和实时对话
涵盖TTS特隆ASR转写音乐生成和实时对话
6:04.420–6:07.200
zh提供了统一的语音服务接口
提供了统一的语音服务接口
6:07.200–6:10.780
zh安装也只需要下载模型文件即可
安装也只需要下载模型文件即可
6:10.780–6:12.780
zh感兴趣的话,快去试试吧
感兴趣的话,快去试试吧
6:12.780–6:14.100
zh效果不错
效果不错
6:14.100–6:16.620
zh接下来是语音转写功能
接下来是语音转写功能
6:16.620–6:17.940
zh也就是ASR
也就是ASR
6:17.940–6:19.400
zh语音转文字
语音转文字
6:19.400–6:23.400
zh在模型列表里选择Qin3ASR模型
在模型列表里选择Qin3ASR模型
6:23.400–6:24.460
zh点击加载
点击加载
6:24.460–6:26.380
zh上传一段音频文件
上传一段音频文件
6:26.380–6:27.580
zh点击播放预览
点击播放预览
6:27.580–6:29.740
zh我们浏览手机端页面
我们浏览手机端页面
6:29.740–6:34.340
zhGLM5.2不具备视觉图像输入能力
GLM5.2不具备视觉图像输入能力
6:34.340–6:36.240
zh它不能给网页添加图片
它不能给网页添加图片
6:36.240–6:38.780
zh然后点击开始转写
然后点击开始转写
6:38.780–6:39.900
zh模型开始处理
模型开始处理
6:39.900–6:40.840
zh稍等一会儿
稍等一会儿
6:40.840–6:42.720
zh转写结果出现在文本框里
转写结果出现在文本框里
6:42.720–6:44.000
zh正确率非常高
正确率非常高
6:44.000–6:49.040
zh再看音乐生成选项卡
再看音乐生成选项卡
6:49.040–6:51.860
zh玩法和其他语音模型类似
玩法和其他语音模型类似
6:51.860–6:54.140
zh选择模型加载模型
选择模型加载模型
6:54.140–6:56.000
zh如果模型没安装
如果模型没安装
6:56.000–6:57.400
zh点击下载即可
点击下载即可
6:57.400–6:59.780
zh上传参考音频
上传参考音频
6:59.780–7:00.920
zh输入提示词
输入提示词
7:00.920–7:03.000
zh最后点击生成音乐
最后点击生成音乐
7:03.000–7:04.920
zh这里我不做演示了
这里我不做演示了
7:04.920–7:07.120
zh感兴趣的话可以自行尝试
感兴趣的话可以自行尝试
7:07.120–7:10.700
zhAudio CPP可以作为服务提供方
Audio CPP可以作为服务提供方
7:10.700–7:13.180
zh共第三方应用调用
共第三方应用调用
7:13.180–7:18.000
zh下面聊实时语音
下面聊实时语音
7:18.000–7:20.800
zh它的工作原理是这样的
它的工作原理是这样的
7:20.800–7:22.420
zh麦克风输入声音
麦克风输入声音
7:22.420–7:25.300
zhASR模型转成文字
ASR模型转成文字
7:25.300–7:28.660
zh文字交给大语言模型处理
文字交给大语言模型处理
7:28.660–7:33.420
zh处理结果再通过TTS模型合成语音输出
处理结果再通过TTS模型合成语音输出
7:33.883–7:36.303
zh实时语音比较消耗资源
实时语音比较消耗资源
7:36.303–7:41.323
zh因为后台同时加载了TTS和ASR两个模型
因为后台同时加载了TTS和ASR两个模型
7:41.323–7:43.223
zh要使用这个功能
要使用这个功能
7:43.223–7:48.183
zh先双击RunWebBit开启WebUI服务
先双击RunWebBit开启WebUI服务
7:48.183–7:50.883
zh然后加载一个TTS模型
然后加载一个TTS模型
7:50.883–7:55.743
zh接着双击ASRBit加载ASR模型
接着双击ASRBit加载ASR模型
7:55.743–8:00.623
zh最后双击RealtelBit打开实时语音页面
最后双击RealtelBit打开实时语音页面
8:00.623–8:05.963
zh在设置里你可以配置LLM的接口地址
在设置里你可以配置LLM的接口地址
8:05.963–8:08.183
zh模型名称和API Key
模型名称和API Key
8:08.183–8:09.303
zh点击对话
点击对话
8:09.303–8:10.583
zh说一声你好
说一声你好
8:10.583–8:13.343
zh就可以看到实时交互效果了
就可以看到实时交互效果了
8:13.343–8:16.823
zh你好
你好
8:16.823–8:19.203
zh请问有什么
请问有什么
8:19.203–8:20.343
zh我可以帮你了吗
我可以帮你了吗
8:20.343–8:26.083
zh我可以帮你回答问题
我可以帮你回答问题
8:26.083–8:26.963
zh翻译语言
翻译语言
8:26.963–8:27.863
zh撰写文本
撰写文本
8:27.863–8:29.343
zh以及提供创意建议
以及提供创意建议
8:29.343–8:33.743
zh最后咱们说说怎么安装Audio CPP
最后咱们说说怎么安装Audio CPP
8:33.743–8:36.263
zh打开它的GitHub页面
打开它的GitHub页面
8:36.263–8:38.343
zh点击Releases
点击Releases
8:38.343–8:41.263
zh下载CPU版本的压缩包
下载CPU版本的压缩包
8:41.263–8:44.103
zh解压后里面没有音频模型
解压后里面没有音频模型
8:44.103–8:48.463
zh我们需要自己创建一个Models玩件夹
我们需要自己创建一个Models玩件夹
8:48.463–8:50.863
zh用来存放所有模型文件
用来存放所有模型文件
8:50.863–8:54.803
zh先安装Pocket TTS
先安装Pocket TTS
8:54.803–8:57.943
zh打开Hugging Face上的模型页面
打开Hugging Face上的模型页面
8:57.943–8:59.583
zh它只有1亿参数
它只有1亿参数
8:59.583–9:00.383
zh非常轻量
非常轻量
9:00.383–9:02.983
zh不用GPU也能流畅运行
不用GPU也能流畅运行
9:02.983–9:05.363
zh下载英文相关的模型文件
下载英文相关的模型文件
9:05.363–9:07.323
zh分磁器和参考音色
分磁器和参考音色
9:07.323–9:14.423
zh在Models下
在Models下
9:14.423–9:16.583
zh创建Pocket TS文件夹
创建Pocket TS文件夹
9:16.583–9:17.863
zh把文件放进去
把文件放进去
9:17.863–9:22.843
zh再安装QVN3 TTS
再安装QVN3 TTS
9:22.843–9:24.783
zh打开摩塔社区
打开摩塔社区
9:24.783–9:26.703
zh搜索QVN3 TTS
搜索QVN3 TTS
9:26.703–9:33.963
zh点击下载模型
点击下载模型
9:33.963–9:37.983
zh推荐用GitLFS工具来下载
推荐用GitLFS工具来下载
9:37.983–9:40.623
zh它是管理大文件的扩展
它是管理大文件的扩展
9:40.623–9:43.123
zh复制GitClone地址
复制GitClone地址
9:43.123–9:46.043
zh在模型文件夹里打开CMD
在模型文件夹里打开CMD
9:46.043–9:47.283
zh粘贴并回车
粘贴并回车
9:47.283–9:51.483
zh如果已经下载过
如果已经下载过
9:51.483–9:52.563
zh会提示已存在
会提示已存在
9:52.563–9:57.503
zh你也可以从Hugging Face的科问仓库下载
你也可以从Hugging Face的科问仓库下载
9:57.503–10:03.223
zh对于不想折腾的小伙伴
对于不想折腾的小伙伴
10:03.223–10:04.743
zh官方也提供了整合包
官方也提供了整合包
10:04.743–10:09.543
zh包含CPU、GPU和Web UI版本
包含CPU、GPU和Web UI版本
10:09.543–10:11.843
zh常用音频模型都集成好了
常用音频模型都集成好了
10:11.843–10:13.783
zh直接用CPU就能跑
直接用CPU就能跑
10:13.783–10:18.923
zh好,咱们快速回顾一下
好,咱们快速回顾一下
10:18.923–10:23.263
zhAudio CPP让本地语音AI部署变得非常简单
Audio CPP让本地语音AI部署变得非常简单
10:23.263–10:27.316
zhCLI和Web UI都支持涵盖TTS、
CLI和Web UI都支持涵盖TTS、
10:27.316–10:27.991
zh特隆、
特隆、
10:27.991–10:31.143
zhASR转写音乐生成和实时对话
ASR转写音乐生成和实时对话
10:31.143–10:33.763
zh提供了统一的语音服务接口
提供了统一的语音服务接口
10:33.763–10:36.483
zh安装也只需要下载模型文件即可
安装也只需要下载模型文件即可
10:36.483–10:38.263
zh感兴趣的话快去试试吧
感兴趣的话快去试试吧
10:38.263–10:39.063
zh感谢观看
感谢观看
10:39.063–10:40.203
zh我们下期再见
我们下期再见
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習