0:00.000–0:01.780
zh这个本地AI工具有点离谱
0:01.780–0:03.400
zh它能实时语音对话
0:03.400–0:05.320
zh哈喽 你能帮我做什么
0:05.320–0:07.560
zh你好 我可以帮你回答问题
0:07.560–0:09.440
zh提供信息 安排日程
0:09.440–0:11.000
zh还能声音克隆
0:11.000–0:13.120
zh大家好呀 要站在光里
0:13.120–0:14.720
zh不要光站在那里
0:14.720–0:16.240
zh不仅能声称AI音乐
0:16.240–0:21.040
zh还能换词翻唱
0:21.040–0:28.140
zh这一整套服务
0:28.140–0:30.620
zh全都跑在这台8G显存的笔记本上
0:30.620–0:32.420
zh不用云端语音平台
0:32.420–0:33.920
zh不需要联网语音服务
0:33.920–0:35.940
zh这个工具叫Audio CPP
0:35.940–0:39.140
zh你可以把它理解成音乐领域的Nama CPP
0:39.140–0:41.600
zh它想解决的不是某一个语音功能
0:41.600–0:43.300
zh而是把本地音频模型
0:43.300–0:45.400
zh统一到同一套云形方式里
0:45.400–0:47.980
zh以前我们想在本地部署语音模型
0:47.980–0:49.860
zh经常是一个模型一套环境
0:49.860–0:51.440
zh我自己这台机器上
0:51.440–0:52.740
zh就装过声音克龙
0:52.740–0:53.660
zh谈文本合成
0:53.660–0:54.480
zhAI翻唱
0:54.480–0:56.020
zh实施语音好几套环境
0:56.020–0:57.960
zh每一套都有不同的配声版本
0:57.960–0:59.000
zh不同的库大依赖
0:59.000–1:00.640
zh最后不是模型跑不动
1:00.640–1:02.360
zh是环境先把人劝退了
1:02.360–1:04.740
zhAudio CPP解决的就是这个问题
1:04.740–1:08.160
zh它把TTS,ASR,音乐生存,声音转换
1:08.160–1:09.700
zh都接近同一个后台
1:09.700–1:12.060
zh通过界面可以随时切换模型
1:12.060–1:15.460
zh就像你用Olama在本地跑大语音模型一样
1:15.460–1:19.640
zhAudio CPP能让你更简单的在本地跑各种语音模型
1:19.640–1:22.040
zh我这次演示的大部分核心功能
1:22.040–1:23.480
zh8G显存就能跑起来
1:23.480–1:25.660
zh有些小模型甚至不需要显卡
1:25.660–1:27.080
zh用CPU也能运行
1:27.080–1:29.280
zh它现在已经接入的模型家族
1:29.280–1:31.440
zh有21个可以直接下载使用
1:31.440–1:33.120
zh还有一批在测试当中
1:33.120–1:36.080
zh统一底座带来的另一个直接好处是
1:36.080–1:37.180
zh运行效率更高
1:37.180–1:40.480
zh这是官方在RTX5090上的速度对比
1:40.480–1:43.120
zh大部分模型在AudioCPP下运行
1:43.120–1:45.980
zh比他们用自己的推理框架快了1-3倍
1:45.980–1:47.780
zh有的甚至快了8-10倍
1:47.780–1:51.140
zh我也在本地用RTX4060做了测试
1:51.140–1:53.120
zh拿微软开源的Vive Voice对比
1:53.120–1:54.640
zh用官方自己的程序
1:54.640–1:56.440
zh合成1万字的小说朗读
1:56.440–1:58.000
zh耗时110分钟
1:58.000–1:59.100
zh而同样的文本
1:59.100–2:00.860
zh拿到AudioCPP下合成
2:00.860–2:02.120
zh仅用了29分钟
2:02.120–2:03.720
zh只有原来的四分之一
2:03.720–2:04.840
zh除了速度
2:04.840–2:06.720
zh这期还有我最想让你看的
2:06.720–2:08.340
zh它把一堆分散的语音能力
2:08.340–2:09.720
zh变成一套本地系统
2:09.720–2:11.600
zh前面那个实时语音系统
2:11.600–2:13.100
zh等会我会完整演示
2:13.100–2:15.800
zh后面还有一个更好玩的音乐生成能力
2:15.800–2:17.160
zh歌曲旋律不变
2:17.160–2:18.440
zh直接换词翻唱
2:18.440–2:20.180
zh最后过一遍声音转换
2:20.180–2:21.580
zh设计等扩展功能
2:21.580–2:23.340
zh以及整合包的下载和使用
2:23.340–2:24.320
zh先看TTS
2:24.320–2:25.800
zh也就是文本转语音
2:25.800–2:26.860
zh这里列的模型
2:26.860–2:31.160
zh整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
2:31.160–2:32.940
zh它们都支持参考音频
2:32.940–2:34.960
zh也就意味着可以做声音克隆
2:34.960–2:36.560
zh基本用法非常简单
2:36.560–2:37.620
zh选择模型
2:37.620–2:39.140
zh点击加载
2:39.140–2:41.060
zh加载完会有提示
2:41.060–2:43.060
zh然后选一段参考音频
2:43.060–2:45.120
zh再输入合成文本
2:45.120–2:46.400
zh点击生成
2:46.400–2:48.340
zh这种一句话的声音克隆
2:48.340–2:49.620
zh基本上是秒生成
2:49.620–2:51.960
enOpenAI launched GPT Live
2:51.960–2:54.680
enA full duplex voice system for chat GPT
2:54.680–2:55.560
zh不过要注意
2:55.560–2:57.360
zhPocket TTS不支持中文
2:57.360–2:58.880
zh要生成中文语音
2:58.880–3:01.600
zh可以换成千问3 TTS 0.6B
3:01.600–3:03.400
zh它的参数虽然不大
3:03.400–3:05.020
zh但合成效果相当不错
3:05.020–3:07.180
zh全双功语音系统
3:07.180–3:10.520
zh支持实时打断联网搜索和视觉理解
3:10.520–3:12.760
zh这两款模型显存占用都很小
3:12.760–3:14.300
zh非常适合低配显卡
3:14.300–3:15.860
zh以及没有独显的机器
3:15.860–3:16.980
zh刚上手
3:16.980–3:19.080
zh合成设置里的参数都可以不用管
3:19.080–3:19.880
zh保持默认
3:19.880–3:21.260
zh先把模型跑起来
3:21.260–3:22.520
zh听一下技术效果
3:22.520–3:24.020
zh熟悉之后再去调温度
3:24.020–3:25.020
zh采样这些参数
3:25.020–3:27.720
zh列表里还有两个模型比较有特点
3:27.720–3:29.460
zh一个是Vox CPM2
3:29.460–3:31.680
zh它好玩的地方是能生成方言
3:31.680–3:33.660
zh给一段方言参考音频
3:33.660–3:35.560
zh我们每个人都在做小丑
3:35.560–3:37.860
zh就可以合成相应的方言语音
3:37.860–3:38.940
zh错了你又不认
3:38.940–3:40.040
zh认了你又不改
3:40.040–3:42.360
zh它支持国内大部分方言
3:42.360–3:43.660
zh还能克隆语气
3:43.660–3:45.620
zh想深入了解这个模型的能力
3:45.620–3:48.960
zh可以翻译一下我之前专门做的Vox CPM那期视频
3:48.960–3:51.360
zh另一个有特点的是Voic Voice
3:51.360–3:53.760
zh就是开头速度对比的那个模型
3:53.760–3:55.660
zh那段近一万字的小说
3:55.660–3:58.240
zh合成期间显存占用没超过7G
3:58.240–4:00.820
zh生存出来的音频我全程听了一遍
4:00.820–4:02.640
zh没有明显的漏读和错读
4:02.640–4:05.040
zh忽然山腰里传来群马奔驰之声
4:05.040–4:06.280
zh提声越来越响
4:06.280–4:09.100
zh不久四面黄布大旗从山崖边升起
4:09.100–4:10.200
zh这里有个注意点
4:10.200–4:11.700
zh不管你用哪款模型
4:11.700–4:13.440
zh参考音频都不要太长
4:13.440–4:15.000
zh建议控制在10秒以内
4:15.000–4:17.700
zh否则会明显拖慢合成速度
4:17.700–4:18.780
zh另外还有个小技巧
4:18.780–4:20.860
zh如果有些参考音频你经常用
4:20.860–4:23.600
zh可以把它们放到WebUI下的Voice目标里
4:23.600–4:27.160
zh然后把文件名和对应的文本写到这个文件里
4:27.160–4:30.240
zh刷新列表就可以直接选了
4:30.240–4:32.020
zh临时上传的参考音频
4:32.020–4:34.300
zh下面对应的文本也不用手动输入
4:34.300–4:36.140
zh可以先到ASR标签里
4:36.140–4:38.020
zh把音频内容转写出来
4:38.020–4:40.920
zh这就引出了AudioCPP第二个核心能力
4:40.920–4:42.560
zhASR语音转文字
4:42.560–4:45.360
zh我个人常用的模型是千问3ASR
4:45.360–4:47.120
zh等会要演示的实时语音
4:47.120–4:48.860
zh我的声音转文本用的就是它
4:48.860–4:50.220
zh中英文都支持
4:50.220–4:51.300
zh速度也很快
4:51.300–4:52.640
zh这段音频两分多钟
4:52.640–4:54.320
zh转录只用了21秒
4:54.320–4:56.420
zh如果转录的是多人对话
4:56.420–4:58.540
zh要勾选对话模式
4:58.540–5:01.600
zh转出来的就是这种带说话人序列的文本
5:01.600–5:03.460
zh不过对话模式有长度限制
5:03.460–5:05.840
zh目前更适合较短的对话片段
5:05.840–5:08.300
zh单人语音转写没有长度限制
5:08.300–5:09.220
zh歌词也能识别
5:09.220–5:11.860
zh等下做AI翻唱要拿原曲歌词
5:11.860–5:14.120
zh就可以先到这里做一遍初步识别
5:14.120–5:15.220
zh再手动校对
5:15.220–5:17.660
zh有了TTS和ASR
5:17.660–5:19.500
zh现在我们可以把它们拼起来用
5:19.500–5:22.260
zh这是我认为Audio CPP最有价值的地方
5:22.260–5:23.840
zh本地实时语音系统
5:23.840–5:26.520
zh我正在测试一个实时语音系统
5:26.520–5:27.680
zh好的
5:27.680–5:30.280
zh我正在实时语音系统里和你对话
5:30.280–5:32.140
zh如果你想测试它的稳定性
5:32.140–5:33.540
zh延迟或其他功能
5:33.540–5:35.440
zh请随时提问或下达指令
5:35.440–5:38.560
zh语音识别和合成都是跑在本地的
5:38.560–5:39.960
zh明白了
5:39.960–5:42.240
zh本地运行意味着响应速度更快
5:42.240–5:43.980
zh同时数据也更安全
5:43.980–5:46.940
zh这是一个很注重隐私和效率的设计思路
5:46.940–5:48.640
zh大语言模型是云端
5:48.640–5:51.380
zh你觉得这个架构是否合理
5:51.380–5:53.840
zh这个架构是合理的
5:53.840–5:54.700
zh从我说完话
5:54.700–5:55.780
zh到它开始回答
5:55.780–5:56.940
zh中间大概一秒
5:56.940–5:58.520
zh如果是一问对话
5:58.520–5:59.800
zh这个颜色会更低
5:59.800–6:01.220
enWhat can you do for me
6:01.220–6:03.100
enI can answer questions
6:03.100–6:04.560
enSummarize information
6:04.560–6:05.920
zh整个流程就是
6:05.920–6:06.980
zh麦克风输入
6:06.980–6:08.340
zhASR转文本
6:08.340–6:09.840
zh大语言模型声称回答
6:09.840–6:11.440
zhTTS再把它朗读出来
6:11.440–6:12.300
zh这就是一个
6:12.300–6:13.700
zh本地语音交互系统的
6:13.700–6:14.700
zh基本形态
6:14.700–6:15.220
zh设置里
6:15.220–6:17.200
zh大语言模型这一步是活的
6:17.200–6:18.820
zh本地化的是语音这一层
6:18.820–6:20.120
zh你可以接本地
6:20.120–6:21.420
zh欧拉玛跑到语言模型
6:21.420–6:23.580
zh也可以接自己订阅的API
6:23.580–6:26.060
zhAudio CPP负责的是音频这一层
6:26.060–6:26.740
zh听和说
6:26.740–6:29.120
zh所以我说它不是一个声音克隆玩具
6:29.120–6:30.740
zh而是消费级显卡上的
6:30.740–6:32.120
zh本地AI语音底座
6:32.120–6:34.660
zh而且它用的是OpenAI兼容接口
6:34.660–6:36.280
zh你本地的其他应用
6:36.280–6:38.080
zh只要支持这种接口形式
6:38.080–6:39.560
zh就能直接调用服务
6:39.560–6:41.020
zh就像设置里这样写
6:41.020–6:42.320
zhTTS的地址
6:42.320–6:43.440
zh模型名称
6:43.440–6:45.080
zhASR的地址
6:45.080–6:46.460
zh模型名称
6:46.460–6:48.320
zh朗读的声音也可以自定义
6:48.320–6:51.320
zh比如我在这个OpenMagic AI应用里
6:51.320–6:53.940
zh直接调用AudioCPP的TTS服务
6:53.940–6:55.280
zh填写UIL
6:55.280–6:56.520
zh还有模型名称
6:56.520–6:58.800
zh由于这个应用没法填参考音频
6:58.800–7:02.120
zh所以我后台单独起一个AudioCPP服务
7:02.120–7:03.580
zh启动时带上参考音频
7:03.580–7:05.980
zh回到OpenMagic测试
7:05.980–7:07.840
zh你好 这是一段测试语音
7:07.840–7:09.480
zh能正确返回语音
7:09.480–7:10.600
zh这样就接好了
7:10.600–7:13.520
zh这就是一个完全免费的本地TTS服务
7:13.520–7:15.220
zh如果你在做本地Agent
7:15.220–7:16.820
zh或者想给自己的应用
7:16.820–7:18.320
zh加上语音输入输出
7:18.320–7:20.860
zhAudioCPP提供的接口就非常有用
7:20.860–7:22.840
zh接下来我们看音乐生成
7:22.840–7:26.200
zh这部分也是我觉得AudioCPP很强的地方
7:26.200–7:35.080
zh它不只是把TTS和ASR放到一起
7:35.080–7:36.940
zh连音乐生成换词翻唱
7:36.940–7:38.580
zh这些原本比较重的模型
7:38.580–7:40.340
zh也开始接近同一个底座里
7:40.340–7:43.180
zh这个ACE STEP我之前介绍过
7:43.180–7:45.780
zh当时我在本地8G显存上跑不动翻唱
7:45.780–7:47.540
zh最后是在Club上演示的
7:47.540–7:48.860
zh现在用AudioCPP
7:48.860–7:51.140
zh本地就能跑起来
7:51.140–8:02.200
zh翻唱可以按下面步骤操作
8:02.644–8:04.524
zh先上传要翻唱的歌曲
8:04.524–8:06.064
zh然后点分析
8:06.064–8:08.524
zh这个过程要等几十秒到几分钟
8:08.524–8:09.984
zh具体看歌曲长度
8:09.984–8:11.204
zh分析完成后
8:11.204–8:13.664
zh合成翻唱的时长改成-1
8:13.664–8:15.444
zh点开高级参数
8:15.444–8:17.224
zh操作类型选Remix
8:17.224–8:18.804
zh歌曲风格
8:18.804–8:19.684
zh曲谱信息
8:19.684–8:21.504
zh分析完以后就会自动填好
8:21.504–8:22.044
zh不用动
8:22.044–8:24.304
zh你只需要填上圆曲歌词
8:24.304–8:27.044
zh提示词直接复制上面的圆曲描述
8:27.044–8:29.084
zh最后填上你的翻唱歌词
8:29.084–8:30.884
zh可以看一下显存占用
8:30.884–8:32.484
zh虽然看上去超过8G
8:32.484–8:33.584
zh但不会爆显存
8:33.584–8:35.024
zh最后能顺利跑完
8:35.024–8:36.924
zh换词翻唱的随机性比较大
8:36.924–8:38.104
zh需要多试几次
8:38.104–8:39.124
zh如果音质不好
8:39.124–8:40.964
zh可以适当增加生存部署
8:40.964–8:43.004
zh要是新词唱不准或者唱不出来
8:43.004–8:45.044
zh可以调这个Flowedit参数
8:45.044–8:47.184
zh从0.7到0.9去尝试
8:47.184–8:49.304
zh如果你只想生成背景音乐
8:49.304–8:51.064
zh我推荐用Stable Audio
8:51.064–8:52.644
zh比ACE Stable更稳
8:52.644–8:55.624
zh声音转换相当于音色迁移
8:55.624–8:57.224
zh保持说话内容不变
8:57.224–8:58.284
zh语气不变
8:58.284–8:59.344
zh只把音色换掉
8:59.344–9:00.344
zh马匪
9:00.344–9:02.924
zh任何时候都要搅
9:02.924–9:04.164
zh不搅不行
9:04.164–9:05.864
zh马匪
9:05.864–9:08.324
zh任何时候都要搅
9:08.324–9:09.544
zh不搅不行
9:09.544–9:12.124
zh歌声转换也是类似逻辑
9:12.124–9:12.924
zh但我实测
9:12.924–9:14.504
zh如果你追求追踪质量
9:14.504–9:16.824
zh我更推荐之前那套RVC流程
9:16.824–9:18.184
zh做歌声转换之前
9:18.184–9:19.824
zh最好先做人声分离
9:19.824–9:21.304
zh音频分离标签下
9:21.304–9:22.544
zh就有相应的模型
9:22.544–9:25.064
zh再往下是音频分析这一组
9:25.064–9:26.644
zh它们都是工具类模型
9:26.644–9:28.744
zh比如这个是实时语音检测
9:28.744–9:30.724
zh下面这个是多人对话识别
9:30.724–9:32.424
zh最后一个是声音设计
9:32.424–9:33.504
zh这个挺有意思
9:33.504–9:35.084
zh它其实类似声音克隆
9:35.084–9:36.664
zh只是不需要参考音频
9:36.664–9:38.804
zh你直接用文字描述一个声音
9:38.804–9:40.564
zh比如磁性的中年男生
9:40.564–9:41.404
zh语速偏慢
9:41.404–9:42.044
zh波音枪
9:42.044–9:43.804
zh模型就会按描述生成
9:43.804–9:54.664
zh这个功能做临时配音比较好用
9:54.664–9:56.864
zh最后说一下整合包
9:56.864–9:59.264
zhAudio CPP本身是个C++项目
9:59.264–10:01.484
zh官方目前主要靠命令行来使用
10:01.484–10:03.484
zh对有经验的朋友来说问题不大
10:03.484–10:05.024
zh但对没技术基础的
10:05.024–10:06.584
zh这一步确实比较劝退
10:06.584–10:08.644
zh所以我做了带界面的整合包
10:08.644–10:09.744
zh解压就能用
10:09.744–10:11.804
zh支持16-50系列的N卡
10:11.804–10:14.064
zh目前A卡以及没有独显的机器
10:14.064–10:15.644
zh会自动走CPU模式
10:15.644–10:16.764
zh速度会慢一些
10:16.764–10:18.444
zh但跑几个轻量模型没问题
10:18.444–10:19.264
zh整合包里
10:19.264–10:21.304
zhRun Web UI是启动网页界面
10:21.304–10:22.484
zh想用哪个模型
10:22.484–10:23.884
zh界面里就能直接下载
10:23.884–10:25.844
zh想体验实时语音
10:25.844–10:27.644
zh先在Web UI里加载模型
10:27.644–10:29.744
zh再启动这个ASR服务
10:29.744–10:31.784
zh最后运行Run Real Time
10:31.784–10:34.264
zh配置里把接入的大模型改一下
10:34.264–10:35.824
zh如果你也用Deep Seek
10:35.824–10:38.124
zhAPI Key换成自己的就可以了
10:38.124–10:40.144
zh这一整套原代码我已经开完了
10:40.144–10:41.444
zh这是GitHub地址
10:41.444–10:43.344
zh使用中如果遇到问题
10:43.344–10:44.784
zh或者希望增加功能
10:44.784–10:46.444
zh可以在评论区告诉我
10:46.444–10:48.764
zh我会收集整理定期更新版本
10:48.764–10:49.704
zh总结一下
10:49.704–10:51.384
zhAudio CPP最大的意义
10:51.384–10:53.404
zh不是又多了一个声音客户工具
10:53.404–10:55.004
zh而是本地语音模型
10:55.004–10:57.264
zh开始变成一套统一的系统
10:57.264–10:58.804
zh大语言模型有Lama CPP
10:58.804–11:00.864
zh图片视频生成有Conf UI
11:00.864–11:02.964
zh语音模型现在也开始有了
11:02.964–11:04.324
zh自己的本地运行中心
11:04.324–11:05.904
zh对于普通用户来说
11:05.904–11:07.164
zh使用门槛更低了
11:07.164–11:08.424
zh对开发者来说
11:08.424–11:10.224
zh本地语音服务接入更容易
11:10.224–11:12.604
zh这也是我这期最想讲清楚的地方
11:12.604–11:14.644
zh本期视频用到的所有链接
11:14.644–11:16.124
zh我都放在评论区置顶
11:16.124–11:17.784
zh这里是AI探索已发现
11:17.784–11:18.624
zh感谢观看
11:18.624–11:19.204
zh下期见
0:00.000–0:01.780
这个本地AI工具有点离谱
0:01.780–0:03.400
它能实时语音对话
0:03.400–0:05.320
哈喽 你能帮我做什么
0:05.320–0:07.560
你好 我可以帮你回答问题
0:07.560–0:09.440
提供信息 安排日程
0:09.440–0:11.000
还能声音克隆
0:11.000–0:13.120
大家好呀 要站在光里
0:13.120–0:14.720
不要光站在那里
0:14.720–0:16.240
不仅能声称AI音乐
0:16.240–0:21.040
还能换词翻唱
0:21.040–0:28.140
这一整套服务
0:28.140–0:30.620
全都跑在这台8G显存的笔记本上
0:30.620–0:32.420
不用云端语音平台
0:32.420–0:33.920
不需要联网语音服务
0:33.920–0:35.940
这个工具叫Audio CPP
0:35.940–0:39.140
你可以把它理解成音乐领域的Nama CPP
0:39.140–0:41.600
它想解决的不是某一个语音功能
0:41.600–0:43.300
而是把本地音频模型
0:43.300–0:45.400
统一到同一套云形方式里
0:45.400–0:47.980
以前我们想在本地部署语音模型
0:47.980–0:49.860
经常是一个模型一套环境
0:49.860–0:51.440
我自己这台机器上
0:51.440–0:52.740
就装过声音克龙
0:52.740–0:53.660
谈文本合成
0:53.660–0:54.480
AI翻唱
0:54.480–0:56.020
实施语音好几套环境
0:56.020–0:57.960
每一套都有不同的配声版本
0:57.960–0:59.000
不同的库大依赖
0:59.000–1:00.640
最后不是模型跑不动
1:00.640–1:02.360
是环境先把人劝退了
1:02.360–1:04.740
Audio CPP解决的就是这个问题
1:04.740–1:08.160
它把TTS,ASR,音乐生存,声音转换
1:08.160–1:09.700
都接近同一个后台
1:09.700–1:12.060
通过界面可以随时切换模型
1:12.060–1:15.460
就像你用Olama在本地跑大语音模型一样
1:15.460–1:19.640
Audio CPP能让你更简单的在本地跑各种语音模型
1:19.640–1:22.040
我这次演示的大部分核心功能
1:22.040–1:23.480
8G显存就能跑起来
1:23.480–1:25.660
有些小模型甚至不需要显卡
1:25.660–1:27.080
用CPU也能运行
1:27.080–1:29.280
它现在已经接入的模型家族
1:29.280–1:31.440
有21个可以直接下载使用
1:31.440–1:33.120
还有一批在测试当中
1:33.120–1:36.080
统一底座带来的另一个直接好处是
1:36.080–1:37.180
运行效率更高
1:37.180–1:40.480
这是官方在RTX5090上的速度对比
1:40.480–1:43.120
大部分模型在AudioCPP下运行
1:43.120–1:45.980
比他们用自己的推理框架快了1-3倍
1:45.980–1:47.780
有的甚至快了8-10倍
1:47.780–1:51.140
我也在本地用RTX4060做了测试
1:51.140–1:53.120
拿微软开源的Vive Voice对比
1:53.120–1:54.640
用官方自己的程序
1:54.640–1:56.440
合成1万字的小说朗读
1:56.440–1:58.000
耗时110分钟
1:58.000–1:59.100
而同样的文本
1:59.100–2:00.860
拿到AudioCPP下合成
2:00.860–2:02.120
仅用了29分钟
2:02.120–2:03.720
只有原来的四分之一
2:03.720–2:04.840
除了速度
2:04.840–2:06.720
这期还有我最想让你看的
2:06.720–2:08.340
它把一堆分散的语音能力
2:08.340–2:09.720
变成一套本地系统
2:09.720–2:11.600
前面那个实时语音系统
2:11.600–2:13.100
等会我会完整演示
2:13.100–2:15.800
后面还有一个更好玩的音乐生成能力
2:15.800–2:17.160
歌曲旋律不变
2:17.160–2:18.440
直接换词翻唱
2:18.440–2:20.180
最后过一遍声音转换
2:20.180–2:21.580
设计等扩展功能
2:21.580–2:23.340
以及整合包的下载和使用
2:23.340–2:24.320
先看TTS
2:24.320–2:25.800
也就是文本转语音
2:25.800–2:26.860
这里列的模型
2:26.860–2:31.160
整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
2:31.160–2:32.940
它们都支持参考音频
2:32.940–2:34.960
也就意味着可以做声音克隆
2:34.960–2:36.560
基本用法非常简单
2:36.560–2:37.620
选择模型
2:37.620–2:39.140
点击加载
2:39.140–2:41.060
加载完会有提示
2:41.060–2:43.060
然后选一段参考音频
2:43.060–2:45.120
再输入合成文本
2:45.120–2:46.400
点击生成
2:46.400–2:48.340
这种一句话的声音克隆
2:48.340–2:49.620
基本上是秒生成
2:49.620–2:51.960
OpenAI launched GPT Live
2:51.960–2:54.680
A full duplex voice system for chat GPT
2:54.680–2:55.560
不过要注意
2:55.560–2:57.360
Pocket TTS不支持中文
2:57.360–2:58.880
要生成中文语音
2:58.880–3:01.600
可以换成千问3 TTS 0.6B
3:01.600–3:03.400
它的参数虽然不大
3:03.400–3:05.020
但合成效果相当不错
3:05.020–3:07.180
全双功语音系统
3:07.180–3:10.520
支持实时打断联网搜索和视觉理解
3:10.520–3:12.760
这两款模型显存占用都很小
3:12.760–3:14.300
非常适合低配显卡
3:14.300–3:15.860
以及没有独显的机器
3:15.860–3:16.980
刚上手
3:16.980–3:19.080
合成设置里的参数都可以不用管
3:19.080–3:19.880
保持默认
3:19.880–3:21.260
先把模型跑起来
3:21.260–3:22.520
听一下技术效果
3:22.520–3:24.020
熟悉之后再去调温度
3:24.020–3:25.020
采样这些参数
3:25.020–3:27.720
列表里还有两个模型比较有特点
3:27.720–3:29.460
一个是Vox CPM2
3:29.460–3:31.680
它好玩的地方是能生成方言
3:31.680–3:33.660
给一段方言参考音频
3:33.660–3:35.560
我们每个人都在做小丑
3:35.560–3:37.860
就可以合成相应的方言语音
3:37.860–3:38.940
错了你又不认
3:38.940–3:40.040
认了你又不改
3:40.040–3:42.360
它支持国内大部分方言
3:42.360–3:43.660
还能克隆语气
3:43.660–3:45.620
想深入了解这个模型的能力
3:45.620–3:48.960
可以翻译一下我之前专门做的Vox CPM那期视频
3:48.960–3:51.360
另一个有特点的是Voic Voice
3:51.360–3:53.760
就是开头速度对比的那个模型
3:53.760–3:55.660
那段近一万字的小说
3:55.660–3:58.240
合成期间显存占用没超过7G
3:58.240–4:00.820
生存出来的音频我全程听了一遍
4:00.820–4:02.640
没有明显的漏读和错读
4:02.640–4:05.040
忽然山腰里传来群马奔驰之声
4:05.040–4:06.280
提声越来越响
4:06.280–4:09.100
不久四面黄布大旗从山崖边升起
4:09.100–4:10.200
这里有个注意点
4:10.200–4:11.700
不管你用哪款模型
4:11.700–4:13.440
参考音频都不要太长
4:13.440–4:15.000
建议控制在10秒以内
4:15.000–4:17.700
否则会明显拖慢合成速度
4:17.700–4:18.780
另外还有个小技巧
4:18.780–4:20.860
如果有些参考音频你经常用
4:20.860–4:23.600
可以把它们放到WebUI下的Voice目标里
4:23.600–4:27.160
然后把文件名和对应的文本写到这个文件里
4:27.160–4:30.240
刷新列表就可以直接选了
4:30.240–4:32.020
临时上传的参考音频
4:32.020–4:34.300
下面对应的文本也不用手动输入
4:34.300–4:36.140
可以先到ASR标签里
4:36.140–4:38.020
把音频内容转写出来
4:38.020–4:40.920
这就引出了AudioCPP第二个核心能力
4:40.920–4:42.560
ASR语音转文字
4:42.560–4:45.360
我个人常用的模型是千问3ASR
4:45.360–4:47.120
等会要演示的实时语音
4:47.120–4:48.860
我的声音转文本用的就是它
4:48.860–4:50.220
中英文都支持
4:50.220–4:51.300
速度也很快
4:51.300–4:52.640
这段音频两分多钟
4:52.640–4:54.320
转录只用了21秒
4:54.320–4:56.420
如果转录的是多人对话
4:56.420–4:58.540
要勾选对话模式
4:58.540–5:01.600
转出来的就是这种带说话人序列的文本
5:01.600–5:03.460
不过对话模式有长度限制
5:03.460–5:05.840
目前更适合较短的对话片段
5:05.840–5:08.300
单人语音转写没有长度限制
5:08.300–5:09.220
歌词也能识别
5:09.220–5:11.860
等下做AI翻唱要拿原曲歌词
5:11.860–5:14.120
就可以先到这里做一遍初步识别
5:14.120–5:15.220
再手动校对
5:15.220–5:17.660
有了TTS和ASR
5:17.660–5:19.500
现在我们可以把它们拼起来用
5:19.500–5:22.260
这是我认为Audio CPP最有价值的地方
5:22.260–5:23.840
本地实时语音系统
5:23.840–5:26.520
我正在测试一个实时语音系统
5:26.520–5:27.680
好的
5:27.680–5:30.280
我正在实时语音系统里和你对话
5:30.280–5:32.140
如果你想测试它的稳定性
5:32.140–5:33.540
延迟或其他功能
5:33.540–5:35.440
请随时提问或下达指令
5:35.440–5:38.560
语音识别和合成都是跑在本地的
5:38.560–5:39.960
明白了
5:39.960–5:42.240
本地运行意味着响应速度更快
5:42.240–5:43.980
同时数据也更安全
5:43.980–5:46.940
这是一个很注重隐私和效率的设计思路
5:46.940–5:48.640
大语言模型是云端
5:48.640–5:51.380
你觉得这个架构是否合理
5:51.380–5:53.840
这个架构是合理的
5:53.840–5:54.700
从我说完话
5:54.700–5:55.780
到它开始回答
5:55.780–5:56.940
中间大概一秒
5:56.940–5:58.520
如果是一问对话
5:58.520–5:59.800
这个颜色会更低
5:59.800–6:01.220
What can you do for me
6:01.220–6:03.100
I can answer questions
6:03.100–6:04.560
Summarize information
6:04.560–6:05.920
整个流程就是
6:05.920–6:06.980
麦克风输入
6:06.980–6:08.340
ASR转文本
6:08.340–6:09.840
大语言模型声称回答
6:09.840–6:11.440
TTS再把它朗读出来
6:11.440–6:12.300
这就是一个
6:12.300–6:13.700
本地语音交互系统的
6:13.700–6:14.700
基本形态
6:14.700–6:15.220
设置里
6:15.220–6:17.200
大语言模型这一步是活的
6:17.200–6:18.820
本地化的是语音这一层
6:18.820–6:20.120
你可以接本地
6:20.120–6:21.420
欧拉玛跑到语言模型
6:21.420–6:23.580
也可以接自己订阅的API
6:23.580–6:26.060
Audio CPP负责的是音频这一层
6:26.060–6:26.740
听和说
6:26.740–6:29.120
所以我说它不是一个声音克隆玩具
6:29.120–6:30.740
而是消费级显卡上的
6:30.740–6:32.120
本地AI语音底座
6:32.120–6:34.660
而且它用的是OpenAI兼容接口
6:34.660–6:36.280
你本地的其他应用
6:36.280–6:38.080
只要支持这种接口形式
6:38.080–6:39.560
就能直接调用服务
6:39.560–6:41.020
就像设置里这样写
6:41.020–6:42.320
TTS的地址
6:42.320–6:43.440
模型名称
6:43.440–6:45.080
ASR的地址
6:45.080–6:46.460
模型名称
6:46.460–6:48.320
朗读的声音也可以自定义
6:48.320–6:51.320
比如我在这个OpenMagic AI应用里
6:51.320–6:53.940
直接调用AudioCPP的TTS服务
6:53.940–6:55.280
填写UIL
6:55.280–6:56.520
还有模型名称
6:56.520–6:58.800
由于这个应用没法填参考音频
6:58.800–7:02.120
所以我后台单独起一个AudioCPP服务
7:02.120–7:03.580
启动时带上参考音频
7:03.580–7:05.980
回到OpenMagic测试
7:05.980–7:07.840
你好 这是一段测试语音
7:07.840–7:09.480
能正确返回语音
7:09.480–7:10.600
这样就接好了
7:10.600–7:13.520
这就是一个完全免费的本地TTS服务
7:13.520–7:15.220
如果你在做本地Agent
7:15.220–7:16.820
或者想给自己的应用
7:16.820–7:18.320
加上语音输入输出
7:18.320–7:20.860
AudioCPP提供的接口就非常有用
7:20.860–7:22.840
接下来我们看音乐生成
7:22.840–7:26.200
这部分也是我觉得AudioCPP很强的地方
7:26.200–7:35.080
它不只是把TTS和ASR放到一起
7:35.080–7:36.940
连音乐生成换词翻唱
7:36.940–7:38.580
这些原本比较重的模型
7:38.580–7:40.340
也开始接近同一个底座里
7:40.340–7:43.180
这个ACE STEP我之前介绍过
7:43.180–7:45.780
当时我在本地8G显存上跑不动翻唱
7:45.780–7:47.540
最后是在Club上演示的
7:47.540–7:48.860
现在用AudioCPP
7:48.860–7:51.140
本地就能跑起来
7:51.140–8:02.200
翻唱可以按下面步骤操作
8:02.644–8:04.524
先上传要翻唱的歌曲
8:04.524–8:06.064
然后点分析
8:06.064–8:08.524
这个过程要等几十秒到几分钟
8:08.524–8:09.984
具体看歌曲长度
8:09.984–8:11.204
分析完成后
8:11.204–8:13.664
合成翻唱的时长改成-1
8:13.664–8:15.444
点开高级参数
8:15.444–8:17.224
操作类型选Remix
8:17.224–8:18.804
歌曲风格
8:18.804–8:19.684
曲谱信息
8:19.684–8:21.504
分析完以后就会自动填好
8:21.504–8:22.044
不用动
8:22.044–8:24.304
你只需要填上圆曲歌词
8:24.304–8:27.044
提示词直接复制上面的圆曲描述
8:27.044–8:29.084
最后填上你的翻唱歌词
8:29.084–8:30.884
可以看一下显存占用
8:30.884–8:32.484
虽然看上去超过8G
8:32.484–8:33.584
但不会爆显存
8:33.584–8:35.024
最后能顺利跑完
8:35.024–8:36.924
换词翻唱的随机性比较大
8:36.924–8:38.104
需要多试几次
8:38.104–8:39.124
如果音质不好
8:39.124–8:40.964
可以适当增加生存部署
8:40.964–8:43.004
要是新词唱不准或者唱不出来
8:43.004–8:45.044
可以调这个Flowedit参数
8:45.044–8:47.184
从0.7到0.9去尝试
8:47.184–8:49.304
如果你只想生成背景音乐
8:49.304–8:51.064
我推荐用Stable Audio
8:51.064–8:52.644
比ACE Stable更稳
8:52.644–8:55.624
声音转换相当于音色迁移
8:55.624–8:57.224
保持说话内容不变
8:57.224–8:58.284
语气不变
8:58.284–8:59.344
只把音色换掉
8:59.344–9:00.344
马匪
9:00.344–9:02.924
任何时候都要搅
9:02.924–9:04.164
不搅不行
9:04.164–9:05.864
马匪
9:05.864–9:08.324
任何时候都要搅
9:08.324–9:09.544
不搅不行
9:09.544–9:12.124
歌声转换也是类似逻辑
9:12.124–9:12.924
但我实测
9:12.924–9:14.504
如果你追求追踪质量
9:14.504–9:16.824
我更推荐之前那套RVC流程
9:16.824–9:18.184
做歌声转换之前
9:18.184–9:19.824
最好先做人声分离
9:19.824–9:21.304
音频分离标签下
9:21.304–9:22.544
就有相应的模型
9:22.544–9:25.064
再往下是音频分析这一组
9:25.064–9:26.644
它们都是工具类模型
9:26.644–9:28.744
比如这个是实时语音检测
9:28.744–9:30.724
下面这个是多人对话识别
9:30.724–9:32.424
最后一个是声音设计
9:32.424–9:33.504
这个挺有意思
9:33.504–9:35.084
它其实类似声音克隆
9:35.084–9:36.664
只是不需要参考音频
9:36.664–9:38.804
你直接用文字描述一个声音
9:38.804–9:40.564
比如磁性的中年男生
9:40.564–9:41.404
语速偏慢
9:41.404–9:42.044
波音枪
9:42.044–9:43.804
模型就会按描述生成
9:43.804–9:54.664
这个功能做临时配音比较好用
9:54.664–9:56.864
最后说一下整合包
9:56.864–9:59.264
Audio CPP本身是个C++项目
9:59.264–10:01.484
官方目前主要靠命令行来使用
10:01.484–10:03.484
对有经验的朋友来说问题不大
10:03.484–10:05.024
但对没技术基础的
10:05.024–10:06.584
这一步确实比较劝退
10:06.584–10:08.644
所以我做了带界面的整合包
10:08.644–10:09.744
解压就能用
10:09.744–10:11.804
支持16-50系列的N卡
10:11.804–10:14.064
目前A卡以及没有独显的机器
10:14.064–10:15.644
会自动走CPU模式
10:15.644–10:16.764
速度会慢一些
10:16.764–10:18.444
但跑几个轻量模型没问题
10:18.444–10:19.264
整合包里
10:19.264–10:21.304
Run Web UI是启动网页界面
10:21.304–10:22.484
想用哪个模型
10:22.484–10:23.884
界面里就能直接下载
10:23.884–10:25.844
想体验实时语音
10:25.844–10:27.644
先在Web UI里加载模型
10:27.644–10:29.744
再启动这个ASR服务
10:29.744–10:31.784
最后运行Run Real Time
10:31.784–10:34.264
配置里把接入的大模型改一下
10:34.264–10:35.824
如果你也用Deep Seek
10:35.824–10:38.124
API Key换成自己的就可以了
10:38.124–10:40.144
这一整套原代码我已经开完了
10:40.144–10:41.444
这是GitHub地址
10:41.444–10:43.344
使用中如果遇到问题
10:43.344–10:44.784
或者希望增加功能
10:44.784–10:46.444
可以在评论区告诉我
10:46.444–10:48.764
我会收集整理定期更新版本
10:48.764–10:49.704
总结一下
10:49.704–10:51.384
Audio CPP最大的意义
10:51.384–10:53.404
不是又多了一个声音客户工具
10:53.404–10:55.004
而是本地语音模型
10:55.004–10:57.264
开始变成一套统一的系统
10:57.264–10:58.804
大语言模型有Lama CPP
10:58.804–11:00.864
图片视频生成有Conf UI
11:00.864–11:02.964
语音模型现在也开始有了
11:02.964–11:04.324
自己的本地运行中心
11:04.324–11:05.904
对于普通用户来说
11:05.904–11:07.164
使用门槛更低了
11:07.164–11:08.424
对开发者来说
11:08.424–11:10.224
本地语音服务接入更容易
11:10.224–11:12.604
这也是我这期最想讲清楚的地方
11:12.604–11:14.644
本期视频用到的所有链接
11:14.644–11:16.124
我都放在评论区置顶
11:16.124–11:17.784
这里是AI探索已发现
11:17.784–11:18.624
感谢观看
11:18.624–11:19.204
下期见
0:00.000–0:01.780
zh这个本地AI工具有点离谱
这个本地AI工具有点离谱
0:01.780–0:03.400
zh它能实时语音对话
它能实时语音对话
0:03.400–0:05.320
zh哈喽 你能帮我做什么
哈喽 你能帮我做什么
0:05.320–0:07.560
zh你好 我可以帮你回答问题
你好 我可以帮你回答问题
0:07.560–0:09.440
zh提供信息 安排日程
提供信息 安排日程
0:09.440–0:11.000
zh还能声音克隆
还能声音克隆
0:11.000–0:13.120
zh大家好呀 要站在光里
大家好呀 要站在光里
0:13.120–0:14.720
zh不要光站在那里
不要光站在那里
0:14.720–0:16.240
zh不仅能声称AI音乐
不仅能声称AI音乐
0:16.240–0:21.040
zh还能换词翻唱
还能换词翻唱
0:21.040–0:28.140
zh这一整套服务
这一整套服务
0:28.140–0:30.620
zh全都跑在这台8G显存的笔记本上
全都跑在这台8G显存的笔记本上
0:30.620–0:32.420
zh不用云端语音平台
不用云端语音平台
0:32.420–0:33.920
zh不需要联网语音服务
不需要联网语音服务
0:33.920–0:35.940
zh这个工具叫Audio CPP
这个工具叫Audio CPP
0:35.940–0:39.140
zh你可以把它理解成音乐领域的Nama CPP
你可以把它理解成音乐领域的Nama CPP
0:39.140–0:41.600
zh它想解决的不是某一个语音功能
它想解决的不是某一个语音功能
0:41.600–0:43.300
zh而是把本地音频模型
而是把本地音频模型
0:43.300–0:45.400
zh统一到同一套云形方式里
统一到同一套云形方式里
0:45.400–0:47.980
zh以前我们想在本地部署语音模型
以前我们想在本地部署语音模型
0:47.980–0:49.860
zh经常是一个模型一套环境
经常是一个模型一套环境
0:49.860–0:51.440
zh我自己这台机器上
我自己这台机器上
0:51.440–0:52.740
zh就装过声音克龙
就装过声音克龙
0:52.740–0:53.660
zh谈文本合成
谈文本合成
0:53.660–0:54.480
zhAI翻唱
AI翻唱
0:54.480–0:56.020
zh实施语音好几套环境
实施语音好几套环境
0:56.020–0:57.960
zh每一套都有不同的配声版本
每一套都有不同的配声版本
0:57.960–0:59.000
zh不同的库大依赖
不同的库大依赖
0:59.000–1:00.640
zh最后不是模型跑不动
最后不是模型跑不动
1:00.640–1:02.360
zh是环境先把人劝退了
是环境先把人劝退了
1:02.360–1:04.740
zhAudio CPP解决的就是这个问题
Audio CPP解决的就是这个问题
1:04.740–1:08.160
zh它把TTS,ASR,音乐生存,声音转换
它把TTS,ASR,音乐生存,声音转换
1:08.160–1:09.700
zh都接近同一个后台
都接近同一个后台
1:09.700–1:12.060
zh通过界面可以随时切换模型
通过界面可以随时切换模型
1:12.060–1:15.460
zh就像你用Olama在本地跑大语音模型一样
就像你用Olama在本地跑大语音模型一样
1:15.460–1:19.640
zhAudio CPP能让你更简单的在本地跑各种语音模型
Audio CPP能让你更简单的在本地跑各种语音模型
1:19.640–1:22.040
zh我这次演示的大部分核心功能
我这次演示的大部分核心功能
1:22.040–1:23.480
zh8G显存就能跑起来
8G显存就能跑起来
1:23.480–1:25.660
zh有些小模型甚至不需要显卡
有些小模型甚至不需要显卡
1:25.660–1:27.080
zh用CPU也能运行
用CPU也能运行
1:27.080–1:29.280
zh它现在已经接入的模型家族
它现在已经接入的模型家族
1:29.280–1:31.440
zh有21个可以直接下载使用
有21个可以直接下载使用
1:31.440–1:33.120
zh还有一批在测试当中
还有一批在测试当中
1:33.120–1:36.080
zh统一底座带来的另一个直接好处是
统一底座带来的另一个直接好处是
1:36.080–1:37.180
zh运行效率更高
运行效率更高
1:37.180–1:40.480
zh这是官方在RTX5090上的速度对比
这是官方在RTX5090上的速度对比
1:40.480–1:43.120
zh大部分模型在AudioCPP下运行
大部分模型在AudioCPP下运行
1:43.120–1:45.980
zh比他们用自己的推理框架快了1-3倍
比他们用自己的推理框架快了1-3倍
1:45.980–1:47.780
zh有的甚至快了8-10倍
有的甚至快了8-10倍
1:47.780–1:51.140
zh我也在本地用RTX4060做了测试
我也在本地用RTX4060做了测试
1:51.140–1:53.120
zh拿微软开源的Vive Voice对比
拿微软开源的Vive Voice对比
1:53.120–1:54.640
zh用官方自己的程序
用官方自己的程序
1:54.640–1:56.440
zh合成1万字的小说朗读
合成1万字的小说朗读
1:56.440–1:58.000
zh耗时110分钟
耗时110分钟
1:58.000–1:59.100
zh而同样的文本
而同样的文本
1:59.100–2:00.860
zh拿到AudioCPP下合成
拿到AudioCPP下合成
2:00.860–2:02.120
zh仅用了29分钟
仅用了29分钟
2:02.120–2:03.720
zh只有原来的四分之一
只有原来的四分之一
2:03.720–2:04.840
zh除了速度
除了速度
2:04.840–2:06.720
zh这期还有我最想让你看的
这期还有我最想让你看的
2:06.720–2:08.340
zh它把一堆分散的语音能力
它把一堆分散的语音能力
2:08.340–2:09.720
zh变成一套本地系统
变成一套本地系统
2:09.720–2:11.600
zh前面那个实时语音系统
前面那个实时语音系统
2:11.600–2:13.100
zh等会我会完整演示
等会我会完整演示
2:13.100–2:15.800
zh后面还有一个更好玩的音乐生成能力
后面还有一个更好玩的音乐生成能力
2:15.800–2:17.160
zh歌曲旋律不变
歌曲旋律不变
2:17.160–2:18.440
zh直接换词翻唱
直接换词翻唱
2:18.440–2:20.180
zh最后过一遍声音转换
最后过一遍声音转换
2:20.180–2:21.580
zh设计等扩展功能
设计等扩展功能
2:21.580–2:23.340
zh以及整合包的下载和使用
以及整合包的下载和使用
2:23.340–2:24.320
zh先看TTS
先看TTS
2:24.320–2:25.800
zh也就是文本转语音
也就是文本转语音
2:25.800–2:26.860
zh这里列的模型
这里列的模型
2:26.860–2:31.160
zh整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
2:31.160–2:32.940
zh它们都支持参考音频
它们都支持参考音频
2:32.940–2:34.960
zh也就意味着可以做声音克隆
也就意味着可以做声音克隆
2:34.960–2:36.560
zh基本用法非常简单
基本用法非常简单
2:36.560–2:37.620
zh选择模型
选择模型
2:37.620–2:39.140
zh点击加载
点击加载
2:39.140–2:41.060
zh加载完会有提示
加载完会有提示
2:41.060–2:43.060
zh然后选一段参考音频
然后选一段参考音频
2:43.060–2:45.120
zh再输入合成文本
再输入合成文本
2:45.120–2:46.400
zh点击生成
点击生成
2:46.400–2:48.340
zh这种一句话的声音克隆
这种一句话的声音克隆
2:48.340–2:49.620
zh基本上是秒生成
基本上是秒生成
2:49.620–2:51.960
enOpenAI launched GPT Live
OpenAI launched GPT Live
2:51.960–2:54.680
enA full duplex voice system for chat GPT
A full duplex voice system for chat GPT
2:54.680–2:55.560
zh不过要注意
不过要注意
2:55.560–2:57.360
zhPocket TTS不支持中文
Pocket TTS不支持中文
2:57.360–2:58.880
zh要生成中文语音
要生成中文语音
2:58.880–3:01.600
zh可以换成千问3 TTS 0.6B
可以换成千问3 TTS 0.6B
3:01.600–3:03.400
zh它的参数虽然不大
它的参数虽然不大
3:03.400–3:05.020
zh但合成效果相当不错
但合成效果相当不错
3:05.020–3:07.180
zh全双功语音系统
全双功语音系统
3:07.180–3:10.520
zh支持实时打断联网搜索和视觉理解
支持实时打断联网搜索和视觉理解
3:10.520–3:12.760
zh这两款模型显存占用都很小
这两款模型显存占用都很小
3:12.760–3:14.300
zh非常适合低配显卡
非常适合低配显卡
3:14.300–3:15.860
zh以及没有独显的机器
以及没有独显的机器
3:15.860–3:16.980
zh刚上手
刚上手
3:16.980–3:19.080
zh合成设置里的参数都可以不用管
合成设置里的参数都可以不用管
3:19.080–3:19.880
zh保持默认
保持默认
3:19.880–3:21.260
zh先把模型跑起来
先把模型跑起来
3:21.260–3:22.520
zh听一下技术效果
听一下技术效果
3:22.520–3:24.020
zh熟悉之后再去调温度
熟悉之后再去调温度
3:24.020–3:25.020
zh采样这些参数
采样这些参数
3:25.020–3:27.720
zh列表里还有两个模型比较有特点
列表里还有两个模型比较有特点
3:27.720–3:29.460
zh一个是Vox CPM2
一个是Vox CPM2
3:29.460–3:31.680
zh它好玩的地方是能生成方言
它好玩的地方是能生成方言
3:31.680–3:33.660
zh给一段方言参考音频
给一段方言参考音频
3:33.660–3:35.560
zh我们每个人都在做小丑
我们每个人都在做小丑
3:35.560–3:37.860
zh就可以合成相应的方言语音
就可以合成相应的方言语音
3:37.860–3:38.940
zh错了你又不认
错了你又不认
3:38.940–3:40.040
zh认了你又不改
认了你又不改
3:40.040–3:42.360
zh它支持国内大部分方言
它支持国内大部分方言
3:42.360–3:43.660
zh还能克隆语气
还能克隆语气
3:43.660–3:45.620
zh想深入了解这个模型的能力
想深入了解这个模型的能力
3:45.620–3:48.960
zh可以翻译一下我之前专门做的Vox CPM那期视频
可以翻译一下我之前专门做的Vox CPM那期视频
3:48.960–3:51.360
zh另一个有特点的是Voic Voice
另一个有特点的是Voic Voice
3:51.360–3:53.760
zh就是开头速度对比的那个模型
就是开头速度对比的那个模型
3:53.760–3:55.660
zh那段近一万字的小说
那段近一万字的小说
3:55.660–3:58.240
zh合成期间显存占用没超过7G
合成期间显存占用没超过7G
3:58.240–4:00.820
zh生存出来的音频我全程听了一遍
生存出来的音频我全程听了一遍
4:00.820–4:02.640
zh没有明显的漏读和错读
没有明显的漏读和错读
4:02.640–4:05.040
zh忽然山腰里传来群马奔驰之声
忽然山腰里传来群马奔驰之声
4:05.040–4:06.280
zh提声越来越响
提声越来越响
4:06.280–4:09.100
zh不久四面黄布大旗从山崖边升起
不久四面黄布大旗从山崖边升起
4:09.100–4:10.200
zh这里有个注意点
这里有个注意点
4:10.200–4:11.700
zh不管你用哪款模型
不管你用哪款模型
4:11.700–4:13.440
zh参考音频都不要太长
参考音频都不要太长
4:13.440–4:15.000
zh建议控制在10秒以内
建议控制在10秒以内
4:15.000–4:17.700
zh否则会明显拖慢合成速度
否则会明显拖慢合成速度
4:17.700–4:18.780
zh另外还有个小技巧
另外还有个小技巧
4:18.780–4:20.860
zh如果有些参考音频你经常用
如果有些参考音频你经常用
4:20.860–4:23.600
zh可以把它们放到WebUI下的Voice目标里
可以把它们放到WebUI下的Voice目标里
4:23.600–4:27.160
zh然后把文件名和对应的文本写到这个文件里
然后把文件名和对应的文本写到这个文件里
4:27.160–4:30.240
zh刷新列表就可以直接选了
刷新列表就可以直接选了
4:30.240–4:32.020
zh临时上传的参考音频
临时上传的参考音频
4:32.020–4:34.300
zh下面对应的文本也不用手动输入
下面对应的文本也不用手动输入
4:34.300–4:36.140
zh可以先到ASR标签里
可以先到ASR标签里
4:36.140–4:38.020
zh把音频内容转写出来
把音频内容转写出来
4:38.020–4:40.920
zh这就引出了AudioCPP第二个核心能力
这就引出了AudioCPP第二个核心能力
4:40.920–4:42.560
zhASR语音转文字
ASR语音转文字
4:42.560–4:45.360
zh我个人常用的模型是千问3ASR
我个人常用的模型是千问3ASR
4:45.360–4:47.120
zh等会要演示的实时语音
等会要演示的实时语音
4:47.120–4:48.860
zh我的声音转文本用的就是它
我的声音转文本用的就是它
4:48.860–4:50.220
zh中英文都支持
中英文都支持
4:50.220–4:51.300
zh速度也很快
速度也很快
4:51.300–4:52.640
zh这段音频两分多钟
这段音频两分多钟
4:52.640–4:54.320
zh转录只用了21秒
转录只用了21秒
4:54.320–4:56.420
zh如果转录的是多人对话
如果转录的是多人对话
4:56.420–4:58.540
zh要勾选对话模式
要勾选对话模式
4:58.540–5:01.600
zh转出来的就是这种带说话人序列的文本
转出来的就是这种带说话人序列的文本
5:01.600–5:03.460
zh不过对话模式有长度限制
不过对话模式有长度限制
5:03.460–5:05.840
zh目前更适合较短的对话片段
目前更适合较短的对话片段
5:05.840–5:08.300
zh单人语音转写没有长度限制
单人语音转写没有长度限制
5:08.300–5:09.220
zh歌词也能识别
歌词也能识别
5:09.220–5:11.860
zh等下做AI翻唱要拿原曲歌词
等下做AI翻唱要拿原曲歌词
5:11.860–5:14.120
zh就可以先到这里做一遍初步识别
就可以先到这里做一遍初步识别
5:14.120–5:15.220
zh再手动校对
再手动校对
5:15.220–5:17.660
zh有了TTS和ASR
有了TTS和ASR
5:17.660–5:19.500
zh现在我们可以把它们拼起来用
现在我们可以把它们拼起来用
5:19.500–5:22.260
zh这是我认为Audio CPP最有价值的地方
这是我认为Audio CPP最有价值的地方
5:22.260–5:23.840
zh本地实时语音系统
本地实时语音系统
5:23.840–5:26.520
zh我正在测试一个实时语音系统
我正在测试一个实时语音系统
5:26.520–5:27.680
zh好的
好的
5:27.680–5:30.280
zh我正在实时语音系统里和你对话
我正在实时语音系统里和你对话
5:30.280–5:32.140
zh如果你想测试它的稳定性
如果你想测试它的稳定性
5:32.140–5:33.540
zh延迟或其他功能
延迟或其他功能
5:33.540–5:35.440
zh请随时提问或下达指令
请随时提问或下达指令
5:35.440–5:38.560
zh语音识别和合成都是跑在本地的
语音识别和合成都是跑在本地的
5:38.560–5:39.960
zh明白了
明白了
5:39.960–5:42.240
zh本地运行意味着响应速度更快
本地运行意味着响应速度更快
5:42.240–5:43.980
zh同时数据也更安全
同时数据也更安全
5:43.980–5:46.940
zh这是一个很注重隐私和效率的设计思路
这是一个很注重隐私和效率的设计思路
5:46.940–5:48.640
zh大语言模型是云端
大语言模型是云端
5:48.640–5:51.380
zh你觉得这个架构是否合理
你觉得这个架构是否合理
5:51.380–5:53.840
zh这个架构是合理的
这个架构是合理的
5:53.840–5:54.700
zh从我说完话
从我说完话
5:54.700–5:55.780
zh到它开始回答
到它开始回答
5:55.780–5:56.940
zh中间大概一秒
中间大概一秒
5:56.940–5:58.520
zh如果是一问对话
如果是一问对话
5:58.520–5:59.800
zh这个颜色会更低
这个颜色会更低
5:59.800–6:01.220
enWhat can you do for me
What can you do for me
6:01.220–6:03.100
enI can answer questions
I can answer questions
6:03.100–6:04.560
enSummarize information
Summarize information
6:04.560–6:05.920
zh整个流程就是
整个流程就是
6:05.920–6:06.980
zh麦克风输入
麦克风输入
6:06.980–6:08.340
zhASR转文本
ASR转文本
6:08.340–6:09.840
zh大语言模型声称回答
大语言模型声称回答
6:09.840–6:11.440
zhTTS再把它朗读出来
TTS再把它朗读出来
6:11.440–6:12.300
zh这就是一个
这就是一个
6:12.300–6:13.700
zh本地语音交互系统的
本地语音交互系统的
6:13.700–6:14.700
zh基本形态
基本形态
6:14.700–6:15.220
zh设置里
设置里
6:15.220–6:17.200
zh大语言模型这一步是活的
大语言模型这一步是活的
6:17.200–6:18.820
zh本地化的是语音这一层
本地化的是语音这一层
6:18.820–6:20.120
zh你可以接本地
你可以接本地
6:20.120–6:21.420
zh欧拉玛跑到语言模型
欧拉玛跑到语言模型
6:21.420–6:23.580
zh也可以接自己订阅的API
也可以接自己订阅的API
6:23.580–6:26.060
zhAudio CPP负责的是音频这一层
Audio CPP负责的是音频这一层
6:26.060–6:26.740
zh听和说
听和说
6:26.740–6:29.120
zh所以我说它不是一个声音克隆玩具
所以我说它不是一个声音克隆玩具
6:29.120–6:30.740
zh而是消费级显卡上的
而是消费级显卡上的
6:30.740–6:32.120
zh本地AI语音底座
本地AI语音底座
6:32.120–6:34.660
zh而且它用的是OpenAI兼容接口
而且它用的是OpenAI兼容接口
6:34.660–6:36.280
zh你本地的其他应用
你本地的其他应用
6:36.280–6:38.080
zh只要支持这种接口形式
只要支持这种接口形式
6:38.080–6:39.560
zh就能直接调用服务
就能直接调用服务
6:39.560–6:41.020
zh就像设置里这样写
就像设置里这样写
6:41.020–6:42.320
zhTTS的地址
TTS的地址
6:42.320–6:43.440
zh模型名称
模型名称
6:43.440–6:45.080
zhASR的地址
ASR的地址
6:45.080–6:46.460
zh模型名称
模型名称
6:46.460–6:48.320
zh朗读的声音也可以自定义
朗读的声音也可以自定义
6:48.320–6:51.320
zh比如我在这个OpenMagic AI应用里
比如我在这个OpenMagic AI应用里
6:51.320–6:53.940
zh直接调用AudioCPP的TTS服务
直接调用AudioCPP的TTS服务
6:53.940–6:55.280
zh填写UIL
填写UIL
6:55.280–6:56.520
zh还有模型名称
还有模型名称
6:56.520–6:58.800
zh由于这个应用没法填参考音频
由于这个应用没法填参考音频
6:58.800–7:02.120
zh所以我后台单独起一个AudioCPP服务
所以我后台单独起一个AudioCPP服务
7:02.120–7:03.580
zh启动时带上参考音频
启动时带上参考音频
7:03.580–7:05.980
zh回到OpenMagic测试
回到OpenMagic测试
7:05.980–7:07.840
zh你好 这是一段测试语音
你好 这是一段测试语音
7:07.840–7:09.480
zh能正确返回语音
能正确返回语音
7:09.480–7:10.600
zh这样就接好了
这样就接好了
7:10.600–7:13.520
zh这就是一个完全免费的本地TTS服务
这就是一个完全免费的本地TTS服务
7:13.520–7:15.220
zh如果你在做本地Agent
如果你在做本地Agent
7:15.220–7:16.820
zh或者想给自己的应用
或者想给自己的应用
7:16.820–7:18.320
zh加上语音输入输出
加上语音输入输出
7:18.320–7:20.860
zhAudioCPP提供的接口就非常有用
AudioCPP提供的接口就非常有用
7:20.860–7:22.840
zh接下来我们看音乐生成
接下来我们看音乐生成
7:22.840–7:26.200
zh这部分也是我觉得AudioCPP很强的地方
这部分也是我觉得AudioCPP很强的地方
7:26.200–7:35.080
zh它不只是把TTS和ASR放到一起
它不只是把TTS和ASR放到一起
7:35.080–7:36.940
zh连音乐生成换词翻唱
连音乐生成换词翻唱
7:36.940–7:38.580
zh这些原本比较重的模型
这些原本比较重的模型
7:38.580–7:40.340
zh也开始接近同一个底座里
也开始接近同一个底座里
7:40.340–7:43.180
zh这个ACE STEP我之前介绍过
这个ACE STEP我之前介绍过
7:43.180–7:45.780
zh当时我在本地8G显存上跑不动翻唱
当时我在本地8G显存上跑不动翻唱
7:45.780–7:47.540
zh最后是在Club上演示的
最后是在Club上演示的
7:47.540–7:48.860
zh现在用AudioCPP
现在用AudioCPP
7:48.860–7:51.140
zh本地就能跑起来
本地就能跑起来
7:51.140–8:02.200
zh翻唱可以按下面步骤操作
翻唱可以按下面步骤操作
8:02.644–8:04.524
zh先上传要翻唱的歌曲
先上传要翻唱的歌曲
8:04.524–8:06.064
zh然后点分析
然后点分析
8:06.064–8:08.524
zh这个过程要等几十秒到几分钟
这个过程要等几十秒到几分钟
8:08.524–8:09.984
zh具体看歌曲长度
具体看歌曲长度
8:09.984–8:11.204
zh分析完成后
分析完成后
8:11.204–8:13.664
zh合成翻唱的时长改成-1
合成翻唱的时长改成-1
8:13.664–8:15.444
zh点开高级参数
点开高级参数
8:15.444–8:17.224
zh操作类型选Remix
操作类型选Remix
8:17.224–8:18.804
zh歌曲风格
歌曲风格
8:18.804–8:19.684
zh曲谱信息
曲谱信息
8:19.684–8:21.504
zh分析完以后就会自动填好
分析完以后就会自动填好
8:21.504–8:22.044
zh不用动
不用动
8:22.044–8:24.304
zh你只需要填上圆曲歌词
你只需要填上圆曲歌词
8:24.304–8:27.044
zh提示词直接复制上面的圆曲描述
提示词直接复制上面的圆曲描述
8:27.044–8:29.084
zh最后填上你的翻唱歌词
最后填上你的翻唱歌词
8:29.084–8:30.884
zh可以看一下显存占用
可以看一下显存占用
8:30.884–8:32.484
zh虽然看上去超过8G
虽然看上去超过8G
8:32.484–8:33.584
zh但不会爆显存
但不会爆显存
8:33.584–8:35.024
zh最后能顺利跑完
最后能顺利跑完
8:35.024–8:36.924
zh换词翻唱的随机性比较大
换词翻唱的随机性比较大
8:36.924–8:38.104
zh需要多试几次
需要多试几次
8:38.104–8:39.124
zh如果音质不好
如果音质不好
8:39.124–8:40.964
zh可以适当增加生存部署
可以适当增加生存部署
8:40.964–8:43.004
zh要是新词唱不准或者唱不出来
要是新词唱不准或者唱不出来
8:43.004–8:45.044
zh可以调这个Flowedit参数
可以调这个Flowedit参数
8:45.044–8:47.184
zh从0.7到0.9去尝试
从0.7到0.9去尝试
8:47.184–8:49.304
zh如果你只想生成背景音乐
如果你只想生成背景音乐
8:49.304–8:51.064
zh我推荐用Stable Audio
我推荐用Stable Audio
8:51.064–8:52.644
zh比ACE Stable更稳
比ACE Stable更稳
8:52.644–8:55.624
zh声音转换相当于音色迁移
声音转换相当于音色迁移
8:55.624–8:57.224
zh保持说话内容不变
保持说话内容不变
8:57.224–8:58.284
zh语气不变
语气不变
8:58.284–8:59.344
zh只把音色换掉
只把音色换掉
8:59.344–9:00.344
zh马匪
马匪
9:00.344–9:02.924
zh任何时候都要搅
任何时候都要搅
9:02.924–9:04.164
zh不搅不行
不搅不行
9:04.164–9:05.864
zh马匪
马匪
9:05.864–9:08.324
zh任何时候都要搅
任何时候都要搅
9:08.324–9:09.544
zh不搅不行
不搅不行
9:09.544–9:12.124
zh歌声转换也是类似逻辑
歌声转换也是类似逻辑
9:12.124–9:12.924
zh但我实测
但我实测
9:12.924–9:14.504
zh如果你追求追踪质量
如果你追求追踪质量
9:14.504–9:16.824
zh我更推荐之前那套RVC流程
我更推荐之前那套RVC流程
9:16.824–9:18.184
zh做歌声转换之前
做歌声转换之前
9:18.184–9:19.824
zh最好先做人声分离
最好先做人声分离
9:19.824–9:21.304
zh音频分离标签下
音频分离标签下
9:21.304–9:22.544
zh就有相应的模型
就有相应的模型
9:22.544–9:25.064
zh再往下是音频分析这一组
再往下是音频分析这一组
9:25.064–9:26.644
zh它们都是工具类模型
它们都是工具类模型
9:26.644–9:28.744
zh比如这个是实时语音检测
比如这个是实时语音检测
9:28.744–9:30.724
zh下面这个是多人对话识别
下面这个是多人对话识别
9:30.724–9:32.424
zh最后一个是声音设计
最后一个是声音设计
9:32.424–9:33.504
zh这个挺有意思
这个挺有意思
9:33.504–9:35.084
zh它其实类似声音克隆
它其实类似声音克隆
9:35.084–9:36.664
zh只是不需要参考音频
只是不需要参考音频
9:36.664–9:38.804
zh你直接用文字描述一个声音
你直接用文字描述一个声音
9:38.804–9:40.564
zh比如磁性的中年男生
比如磁性的中年男生
9:40.564–9:41.404
zh语速偏慢
语速偏慢
9:41.404–9:42.044
zh波音枪
波音枪
9:42.044–9:43.804
zh模型就会按描述生成
模型就会按描述生成
9:43.804–9:54.664
zh这个功能做临时配音比较好用
这个功能做临时配音比较好用
9:54.664–9:56.864
zh最后说一下整合包
最后说一下整合包
9:56.864–9:59.264
zhAudio CPP本身是个C++项目
Audio CPP本身是个C++项目
9:59.264–10:01.484
zh官方目前主要靠命令行来使用
官方目前主要靠命令行来使用
10:01.484–10:03.484
zh对有经验的朋友来说问题不大
对有经验的朋友来说问题不大
10:03.484–10:05.024
zh但对没技术基础的
但对没技术基础的
10:05.024–10:06.584
zh这一步确实比较劝退
这一步确实比较劝退
10:06.584–10:08.644
zh所以我做了带界面的整合包
所以我做了带界面的整合包
10:08.644–10:09.744
zh解压就能用
解压就能用
10:09.744–10:11.804
zh支持16-50系列的N卡
支持16-50系列的N卡
10:11.804–10:14.064
zh目前A卡以及没有独显的机器
目前A卡以及没有独显的机器
10:14.064–10:15.644
zh会自动走CPU模式
会自动走CPU模式
10:15.644–10:16.764
zh速度会慢一些
速度会慢一些
10:16.764–10:18.444
zh但跑几个轻量模型没问题
但跑几个轻量模型没问题
10:18.444–10:19.264
zh整合包里
整合包里
10:19.264–10:21.304
zhRun Web UI是启动网页界面
Run Web UI是启动网页界面
10:21.304–10:22.484
zh想用哪个模型
想用哪个模型
10:22.484–10:23.884
zh界面里就能直接下载
界面里就能直接下载
10:23.884–10:25.844
zh想体验实时语音
想体验实时语音
10:25.844–10:27.644
zh先在Web UI里加载模型
先在Web UI里加载模型
10:27.644–10:29.744
zh再启动这个ASR服务
再启动这个ASR服务
10:29.744–10:31.784
zh最后运行Run Real Time
最后运行Run Real Time
10:31.784–10:34.264
zh配置里把接入的大模型改一下
配置里把接入的大模型改一下
10:34.264–10:35.824
zh如果你也用Deep Seek
如果你也用Deep Seek
10:35.824–10:38.124
zhAPI Key换成自己的就可以了
API Key换成自己的就可以了
10:38.124–10:40.144
zh这一整套原代码我已经开完了
这一整套原代码我已经开完了
10:40.144–10:41.444
zh这是GitHub地址
这是GitHub地址
10:41.444–10:43.344
zh使用中如果遇到问题
使用中如果遇到问题
10:43.344–10:44.784
zh或者希望增加功能
或者希望增加功能
10:44.784–10:46.444
zh可以在评论区告诉我
可以在评论区告诉我
10:46.444–10:48.764
zh我会收集整理定期更新版本
我会收集整理定期更新版本
10:48.764–10:49.704
zh总结一下
总结一下
10:49.704–10:51.384
zhAudio CPP最大的意义
Audio CPP最大的意义
10:51.384–10:53.404
zh不是又多了一个声音客户工具
不是又多了一个声音客户工具
10:53.404–10:55.004
zh而是本地语音模型
而是本地语音模型
10:55.004–10:57.264
zh开始变成一套统一的系统
开始变成一套统一的系统
10:57.264–10:58.804
zh大语言模型有Lama CPP
大语言模型有Lama CPP
10:58.804–11:00.864
zh图片视频生成有Conf UI
图片视频生成有Conf UI
11:00.864–11:02.964
zh语音模型现在也开始有了
语音模型现在也开始有了
11:02.964–11:04.324
zh自己的本地运行中心
自己的本地运行中心
11:04.324–11:05.904
zh对于普通用户来说
对于普通用户来说
11:05.904–11:07.164
zh使用门槛更低了
使用门槛更低了
11:07.164–11:08.424
zh对开发者来说
对开发者来说
11:08.424–11:10.224
zh本地语音服务接入更容易
本地语音服务接入更容易
11:10.224–11:12.604
zh这也是我这期最想讲清楚的地方
这也是我这期最想讲清楚的地方
11:12.604–11:14.644
zh本期视频用到的所有链接
本期视频用到的所有链接
11:14.644–11:16.124
zh我都放在评论区置顶
我都放在评论区置顶
11:16.124–11:17.784
zh这里是AI探索已发现
这里是AI探索已发现
11:17.784–11:18.624
zh感谢观看
感谢观看
11:18.624–11:19.204
zh下期见
下期见
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習