實際影片長度:11:26.005。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:01.780
zh这个本地AI工具有点离谱
0:01.780–0:03.400
zh它能实时语音对话
0:03.400–0:05.320
zh哈喽 你能帮我做什么
0:05.320–0:07.560
zh你好 我可以帮你回答问题
0:07.560–0:09.440
zh提供信息 安排日程
0:09.440–0:11.000
zh还能声音克隆
0:11.000–0:13.120
zh大家好呀 要站在光里
0:13.120–0:14.720
zh不要光站在那里
0:14.720–0:16.240
zh不仅能声称AI音乐
0:16.240–0:21.040
zh还能换词翻唱
0:21.040–0:28.140
zh这一整套服务
0:28.140–0:30.620
zh全都跑在这台8G显存的笔记本上
0:30.620–0:32.420
zh不用云端语音平台
0:32.420–0:33.920
zh不需要联网语音服务
0:33.920–0:35.940
zh这个工具叫Audio CPP
0:35.940–0:39.140
zh你可以把它理解成音乐领域的Nama CPP
0:39.140–0:41.600
zh它想解决的不是某一个语音功能
0:41.600–0:43.300
zh而是把本地音频模型
0:43.300–0:45.400
zh统一到同一套云形方式里
0:45.400–0:47.980
zh以前我们想在本地部署语音模型
0:47.980–0:49.860
zh经常是一个模型一套环境
0:49.860–0:51.440
zh我自己这台机器上
0:51.440–0:52.740
zh就装过声音克龙
0:52.740–0:53.660
zh谈文本合成
0:53.660–0:54.480
zhAI翻唱
0:54.480–0:56.020
zh实施语音好几套环境
0:56.020–0:57.960
zh每一套都有不同的配声版本
0:57.960–0:59.000
zh不同的库大依赖
0:59.000–1:00.640
zh最后不是模型跑不动
1:00.640–1:02.360
zh是环境先把人劝退了
1:02.360–1:04.740
zhAudio CPP解决的就是这个问题
1:04.740–1:08.160
zh它把TTS,ASR,音乐生存,声音转换
1:08.160–1:09.700
zh都接近同一个后台
1:09.700–1:12.060
zh通过界面可以随时切换模型
1:12.060–1:15.460
zh就像你用Olama在本地跑大语音模型一样
1:15.460–1:19.640
zhAudio CPP能让你更简单的在本地跑各种语音模型
1:19.640–1:22.040
zh我这次演示的大部分核心功能
1:22.040–1:23.480
zh8G显存就能跑起来
1:23.480–1:25.660
zh有些小模型甚至不需要显卡
1:25.660–1:27.080
zh用CPU也能运行
1:27.080–1:29.280
zh它现在已经接入的模型家族
1:29.280–1:31.440
zh有21个可以直接下载使用
1:31.440–1:33.120
zh还有一批在测试当中
1:33.120–1:36.080
zh统一底座带来的另一个直接好处是
1:36.080–1:37.180
zh运行效率更高
1:37.180–1:40.480
zh这是官方在RTX5090上的速度对比
1:40.480–1:43.120
zh大部分模型在AudioCPP下运行
1:43.120–1:45.980
zh比他们用自己的推理框架快了1-3倍
1:45.980–1:47.780
zh有的甚至快了8-10倍
1:47.780–1:51.140
zh我也在本地用RTX4060做了测试
1:51.140–1:53.120
zh拿微软开源的Vive Voice对比
1:53.120–1:54.640
zh用官方自己的程序
1:54.640–1:56.440
zh合成1万字的小说朗读
1:56.440–1:58.000
zh耗时110分钟
1:58.000–1:59.100
zh而同样的文本
1:59.100–2:00.860
zh拿到AudioCPP下合成
2:00.860–2:02.120
zh仅用了29分钟
2:02.120–2:03.720
zh只有原来的四分之一
2:03.720–2:04.840
zh除了速度
2:04.840–2:06.720
zh这期还有我最想让你看的
2:06.720–2:08.340
zh它把一堆分散的语音能力
2:08.340–2:09.720
zh变成一套本地系统
2:09.720–2:11.600
zh前面那个实时语音系统
2:11.600–2:13.100
zh等会我会完整演示
2:13.100–2:15.800
zh后面还有一个更好玩的音乐生成能力
2:15.800–2:17.160
zh歌曲旋律不变
2:17.160–2:18.440
zh直接换词翻唱
2:18.440–2:20.180
zh最后过一遍声音转换
2:20.180–2:21.580
zh设计等扩展功能
2:21.580–2:23.340
zh以及整合包的下载和使用
2:23.340–2:24.320
zh先看TTS
2:24.320–2:25.800
zh也就是文本转语音
2:25.800–2:26.860
zh这里列的模型
2:26.860–2:31.160
zh整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
2:31.160–2:32.940
zh它们都支持参考音频
2:32.940–2:34.960
zh也就意味着可以做声音克隆
2:34.960–2:36.560
zh基本用法非常简单
2:36.560–2:37.620
zh选择模型
2:37.620–2:39.140
zh点击加载
2:39.140–2:41.060
zh加载完会有提示
2:41.060–2:43.060
zh然后选一段参考音频
2:43.060–2:45.120
zh再输入合成文本
2:45.120–2:46.400
zh点击生成
2:46.400–2:48.340
zh这种一句话的声音克隆
2:48.340–2:49.620
zh基本上是秒生成
2:49.620–2:51.960
enOpenAI launched GPT Live
2:51.960–2:54.680
enA full duplex voice system for chat GPT
2:54.680–2:55.560
zh不过要注意
2:55.560–2:57.360
zhPocket TTS不支持中文
2:57.360–2:58.880
zh要生成中文语音
2:58.880–3:01.600
zh可以换成千问3 TTS 0.6B
3:01.600–3:03.400
zh它的参数虽然不大
3:03.400–3:05.020
zh但合成效果相当不错
3:05.020–3:07.180
zh全双功语音系统
3:07.180–3:10.520
zh支持实时打断联网搜索和视觉理解
3:10.520–3:12.760
zh这两款模型显存占用都很小
3:12.760–3:14.300
zh非常适合低配显卡
3:14.300–3:15.860
zh以及没有独显的机器
3:15.860–3:16.980
zh刚上手
3:16.980–3:19.080
zh合成设置里的参数都可以不用管
3:19.080–3:19.880
zh保持默认
3:19.880–3:21.260
zh先把模型跑起来
3:21.260–3:22.520
zh听一下技术效果
3:22.520–3:24.020
zh熟悉之后再去调温度
3:24.020–3:25.020
zh采样这些参数
3:25.020–3:27.720
zh列表里还有两个模型比较有特点
3:27.720–3:29.460
zh一个是Vox CPM2
3:29.460–3:31.680
zh它好玩的地方是能生成方言
3:31.680–3:33.660
zh给一段方言参考音频
3:33.660–3:35.560
zh我们每个人都在做小丑
3:35.560–3:37.860
zh就可以合成相应的方言语音
3:37.860–3:38.940
zh错了你又不认
3:38.940–3:40.040
zh认了你又不改
3:40.040–3:42.360
zh它支持国内大部分方言
3:42.360–3:43.660
zh还能克隆语气
3:43.660–3:45.620
zh想深入了解这个模型的能力
3:45.620–3:48.960
zh可以翻译一下我之前专门做的Vox CPM那期视频
3:48.960–3:51.360
zh另一个有特点的是Voic Voice
3:51.360–3:53.760
zh就是开头速度对比的那个模型
3:53.760–3:55.660
zh那段近一万字的小说
3:55.660–3:58.240
zh合成期间显存占用没超过7G
3:58.240–4:00.820
zh生存出来的音频我全程听了一遍
4:00.820–4:02.640
zh没有明显的漏读和错读
4:02.640–4:05.040
zh忽然山腰里传来群马奔驰之声
4:05.040–4:06.280
zh提声越来越响
4:06.280–4:09.100
zh不久四面黄布大旗从山崖边升起
4:09.100–4:10.200
zh这里有个注意点
4:10.200–4:11.700
zh不管你用哪款模型
4:11.700–4:13.440
zh参考音频都不要太长
4:13.440–4:15.000
zh建议控制在10秒以内
4:15.000–4:17.700
zh否则会明显拖慢合成速度
4:17.700–4:18.780
zh另外还有个小技巧
4:18.780–4:20.860
zh如果有些参考音频你经常用
4:20.860–4:23.600
zh可以把它们放到WebUI下的Voice目标里
4:23.600–4:27.160
zh然后把文件名和对应的文本写到这个文件里
4:27.160–4:30.240
zh刷新列表就可以直接选了
4:30.240–4:32.020
zh临时上传的参考音频
4:32.020–4:34.300
zh下面对应的文本也不用手动输入
4:34.300–4:36.140
zh可以先到ASR标签里
4:36.140–4:38.020
zh把音频内容转写出来
4:38.020–4:40.920
zh这就引出了AudioCPP第二个核心能力
4:40.920–4:42.560
zhASR语音转文字
4:42.560–4:45.360
zh我个人常用的模型是千问3ASR
4:45.360–4:47.120
zh等会要演示的实时语音
4:47.120–4:48.860
zh我的声音转文本用的就是它
4:48.860–4:50.220
zh中英文都支持
4:50.220–4:51.300
zh速度也很快
4:51.300–4:52.640
zh这段音频两分多钟
4:52.640–4:54.320
zh转录只用了21秒
4:54.320–4:56.420
zh如果转录的是多人对话
4:56.420–4:58.540
zh要勾选对话模式
4:58.540–5:01.600
zh转出来的就是这种带说话人序列的文本
5:01.600–5:03.460
zh不过对话模式有长度限制
5:03.460–5:05.840
zh目前更适合较短的对话片段
5:05.840–5:08.300
zh单人语音转写没有长度限制
5:08.300–5:09.220
zh歌词也能识别
5:09.220–5:11.860
zh等下做AI翻唱要拿原曲歌词
5:11.860–5:14.120
zh就可以先到这里做一遍初步识别
5:14.120–5:15.220
zh再手动校对
5:15.220–5:17.660
zh有了TTS和ASR
5:17.660–5:19.500
zh现在我们可以把它们拼起来用
5:19.500–5:22.260
zh这是我认为Audio CPP最有价值的地方
5:22.260–5:23.840
zh本地实时语音系统
5:23.840–5:26.520
zh我正在测试一个实时语音系统
5:26.520–5:27.680
zh好的
5:27.680–5:30.280
zh我正在实时语音系统里和你对话
5:30.280–5:32.140
zh如果你想测试它的稳定性
5:32.140–5:33.540
zh延迟或其他功能
5:33.540–5:35.440
zh请随时提问或下达指令
5:35.440–5:38.560
zh语音识别和合成都是跑在本地的
5:38.560–5:39.960
zh明白了
5:39.960–5:42.240
zh本地运行意味着响应速度更快
5:42.240–5:43.980
zh同时数据也更安全
5:43.980–5:46.940
zh这是一个很注重隐私和效率的设计思路
5:46.940–5:48.640
zh大语言模型是云端
5:48.640–5:51.380
zh你觉得这个架构是否合理
5:51.380–5:53.840
zh这个架构是合理的
5:53.840–5:54.700
zh从我说完话
5:54.700–5:55.780
zh到它开始回答
5:55.780–5:56.940
zh中间大概一秒
5:56.940–5:58.520
zh如果是一问对话
5:58.520–5:59.800
zh这个颜色会更低
5:59.800–6:01.220
enWhat can you do for me
6:01.220–6:03.100
enI can answer questions
6:03.100–6:04.560
enSummarize information
6:04.560–6:05.920
zh整个流程就是
6:05.920–6:06.980
zh麦克风输入
6:06.980–6:08.340
zhASR转文本
6:08.340–6:09.840
zh大语言模型声称回答
6:09.840–6:11.440
zhTTS再把它朗读出来
6:11.440–6:12.300
zh这就是一个
6:12.300–6:13.700
zh本地语音交互系统的
6:13.700–6:14.700
zh基本形态
6:14.700–6:15.220
zh设置里
6:15.220–6:17.200
zh大语言模型这一步是活的
6:17.200–6:18.820
zh本地化的是语音这一层
6:18.820–6:20.120
zh你可以接本地
6:20.120–6:21.420
zh欧拉玛跑到语言模型
6:21.420–6:23.580
zh也可以接自己订阅的API
6:23.580–6:26.060
zhAudio CPP负责的是音频这一层
6:26.060–6:26.740
zh听和说
6:26.740–6:29.120
zh所以我说它不是一个声音克隆玩具
6:29.120–6:30.740
zh而是消费级显卡上的
6:30.740–6:32.120
zh本地AI语音底座
6:32.120–6:34.660
zh而且它用的是OpenAI兼容接口
6:34.660–6:36.280
zh你本地的其他应用
6:36.280–6:38.080
zh只要支持这种接口形式
6:38.080–6:39.560
zh就能直接调用服务
6:39.560–6:41.020
zh就像设置里这样写
6:41.020–6:42.320
zhTTS的地址
6:42.320–6:43.440
zh模型名称
6:43.440–6:45.080
zhASR的地址
6:45.080–6:46.460
zh模型名称
6:46.460–6:48.320
zh朗读的声音也可以自定义
6:48.320–6:51.320
zh比如我在这个OpenMagic AI应用里
6:51.320–6:53.940
zh直接调用AudioCPP的TTS服务
6:53.940–6:55.280
zh填写UIL
6:55.280–6:56.520
zh还有模型名称
6:56.520–6:58.800
zh由于这个应用没法填参考音频
6:58.800–7:02.120
zh所以我后台单独起一个AudioCPP服务
7:02.120–7:03.580
zh启动时带上参考音频
7:03.580–7:05.980
zh回到OpenMagic测试
7:05.980–7:07.840
zh你好 这是一段测试语音
7:07.840–7:09.480
zh能正确返回语音
7:09.480–7:10.600
zh这样就接好了
7:10.600–7:13.520
zh这就是一个完全免费的本地TTS服务
7:13.520–7:15.220
zh如果你在做本地Agent
7:15.220–7:16.820
zh或者想给自己的应用
7:16.820–7:18.320
zh加上语音输入输出
7:18.320–7:20.860
zhAudioCPP提供的接口就非常有用
7:20.860–7:22.840
zh接下来我们看音乐生成
7:22.840–7:26.200
zh这部分也是我觉得AudioCPP很强的地方
7:26.200–7:35.080
zh它不只是把TTS和ASR放到一起
7:35.080–7:36.940
zh连音乐生成换词翻唱
7:36.940–7:38.580
zh这些原本比较重的模型
7:38.580–7:40.340
zh也开始接近同一个底座里
7:40.340–7:43.180
zh这个ACE STEP我之前介绍过
7:43.180–7:45.780
zh当时我在本地8G显存上跑不动翻唱
7:45.780–7:47.540
zh最后是在Club上演示的
7:47.540–7:48.860
zh现在用AudioCPP
7:48.860–7:51.140
zh本地就能跑起来
7:51.140–8:02.200
zh翻唱可以按下面步骤操作
8:02.644–8:04.524
zh先上传要翻唱的歌曲
8:04.524–8:06.064
zh然后点分析
8:06.064–8:08.524
zh这个过程要等几十秒到几分钟
8:08.524–8:09.984
zh具体看歌曲长度
8:09.984–8:11.204
zh分析完成后
8:11.204–8:13.664
zh合成翻唱的时长改成-1
8:13.664–8:15.444
zh点开高级参数
8:15.444–8:17.224
zh操作类型选Remix
8:17.224–8:18.804
zh歌曲风格
8:18.804–8:19.684
zh曲谱信息
8:19.684–8:21.504
zh分析完以后就会自动填好
8:21.504–8:22.044
zh不用动
8:22.044–8:24.304
zh你只需要填上圆曲歌词
8:24.304–8:27.044
zh提示词直接复制上面的圆曲描述
8:27.044–8:29.084
zh最后填上你的翻唱歌词
8:29.084–8:30.884
zh可以看一下显存占用
8:30.884–8:32.484
zh虽然看上去超过8G
8:32.484–8:33.584
zh但不会爆显存
8:33.584–8:35.024
zh最后能顺利跑完
8:35.024–8:36.924
zh换词翻唱的随机性比较大
8:36.924–8:38.104
zh需要多试几次
8:38.104–8:39.124
zh如果音质不好
8:39.124–8:40.964
zh可以适当增加生存部署
8:40.964–8:43.004
zh要是新词唱不准或者唱不出来
8:43.004–8:45.044
zh可以调这个Flowedit参数
8:45.044–8:47.184
zh从0.7到0.9去尝试
8:47.184–8:49.304
zh如果你只想生成背景音乐
8:49.304–8:51.064
zh我推荐用Stable Audio
8:51.064–8:52.644
zh比ACE Stable更稳
8:52.644–8:55.624
zh声音转换相当于音色迁移
8:55.624–8:57.224
zh保持说话内容不变
8:57.224–8:58.284
zh语气不变
8:58.284–8:59.344
zh只把音色换掉
8:59.344–9:00.344
zh马匪
9:00.344–9:02.924
zh任何时候都要搅
9:02.924–9:04.164
zh不搅不行
9:04.164–9:05.864
zh马匪
9:05.864–9:08.324
zh任何时候都要搅
9:08.324–9:09.544
zh不搅不行
9:09.544–9:12.124
zh歌声转换也是类似逻辑
9:12.124–9:12.924
zh但我实测
9:12.924–9:14.504
zh如果你追求追踪质量
9:14.504–9:16.824
zh我更推荐之前那套RVC流程
9:16.824–9:18.184
zh做歌声转换之前
9:18.184–9:19.824
zh最好先做人声分离
9:19.824–9:21.304
zh音频分离标签下
9:21.304–9:22.544
zh就有相应的模型
9:22.544–9:25.064
zh再往下是音频分析这一组
9:25.064–9:26.644
zh它们都是工具类模型
9:26.644–9:28.744
zh比如这个是实时语音检测
9:28.744–9:30.724
zh下面这个是多人对话识别
9:30.724–9:32.424
zh最后一个是声音设计
9:32.424–9:33.504
zh这个挺有意思
9:33.504–9:35.084
zh它其实类似声音克隆
9:35.084–9:36.664
zh只是不需要参考音频
9:36.664–9:38.804
zh你直接用文字描述一个声音
9:38.804–9:40.564
zh比如磁性的中年男生
9:40.564–9:41.404
zh语速偏慢
9:41.404–9:42.044
zh波音枪
9:42.044–9:43.804
zh模型就会按描述生成
9:43.804–9:54.664
zh这个功能做临时配音比较好用
9:54.664–9:56.864
zh最后说一下整合包
9:56.864–9:59.264
zhAudio CPP本身是个C++项目
9:59.264–10:01.484
zh官方目前主要靠命令行来使用
10:01.484–10:03.484
zh对有经验的朋友来说问题不大
10:03.484–10:05.024
zh但对没技术基础的
10:05.024–10:06.584
zh这一步确实比较劝退
10:06.584–10:08.644
zh所以我做了带界面的整合包
10:08.644–10:09.744
zh解压就能用
10:09.744–10:11.804
zh支持16-50系列的N卡
10:11.804–10:14.064
zh目前A卡以及没有独显的机器
10:14.064–10:15.644
zh会自动走CPU模式
10:15.644–10:16.764
zh速度会慢一些
10:16.764–10:18.444
zh但跑几个轻量模型没问题
10:18.444–10:19.264
zh整合包里
10:19.264–10:21.304
zhRun Web UI是启动网页界面
10:21.304–10:22.484
zh想用哪个模型
10:22.484–10:23.884
zh界面里就能直接下载
10:23.884–10:25.844
zh想体验实时语音
10:25.844–10:27.644
zh先在Web UI里加载模型
10:27.644–10:29.744
zh再启动这个ASR服务
10:29.744–10:31.784
zh最后运行Run Real Time
10:31.784–10:34.264
zh配置里把接入的大模型改一下
10:34.264–10:35.824
zh如果你也用Deep Seek
10:35.824–10:38.124
zhAPI Key换成自己的就可以了
10:38.124–10:40.144
zh这一整套原代码我已经开完了
10:40.144–10:41.444
zh这是GitHub地址
10:41.444–10:43.344
zh使用中如果遇到问题
10:43.344–10:44.784
zh或者希望增加功能
10:44.784–10:46.444
zh可以在评论区告诉我
10:46.444–10:48.764
zh我会收集整理定期更新版本
10:48.764–10:49.704
zh总结一下
10:49.704–10:51.384
zhAudio CPP最大的意义
10:51.384–10:53.404
zh不是又多了一个声音客户工具
10:53.404–10:55.004
zh而是本地语音模型
10:55.004–10:57.264
zh开始变成一套统一的系统
10:57.264–10:58.804
zh大语言模型有Lama CPP
10:58.804–11:00.864
zh图片视频生成有Conf UI
11:00.864–11:02.964
zh语音模型现在也开始有了
11:02.964–11:04.324
zh自己的本地运行中心
11:04.324–11:05.904
zh对于普通用户来说
11:05.904–11:07.164
zh使用门槛更低了
11:07.164–11:08.424
zh对开发者来说
11:08.424–11:10.224
zh本地语音服务接入更容易
11:10.224–11:12.604
zh这也是我这期最想讲清楚的地方
11:12.604–11:14.644
zh本期视频用到的所有链接
11:14.644–11:16.124
zh我都放在评论区置顶
11:16.124–11:17.784
zh这里是AI探索已发现
11:17.784–11:18.624
zh感谢观看
11:18.624–11:19.204
zh下期见
0:00.000–0:01.780
这个本地AI工具有点离谱
0:01.780–0:03.400
它能实时语音对话
0:03.400–0:05.320
哈喽 你能帮我做什么
0:05.320–0:07.560
你好 我可以帮你回答问题
0:07.560–0:09.440
提供信息 安排日程
0:09.440–0:11.000
还能声音克隆
0:11.000–0:13.120
大家好呀 要站在光里
0:13.120–0:14.720
不要光站在那里
0:14.720–0:16.240
不仅能声称AI音乐
0:16.240–0:21.040
还能换词翻唱
0:21.040–0:28.140
这一整套服务
0:28.140–0:30.620
全都跑在这台8G显存的笔记本上
0:30.620–0:32.420
不用云端语音平台
0:32.420–0:33.920
不需要联网语音服务
0:33.920–0:35.940
这个工具叫Audio CPP
0:35.940–0:39.140
你可以把它理解成音乐领域的Nama CPP
0:39.140–0:41.600
它想解决的不是某一个语音功能
0:41.600–0:43.300
而是把本地音频模型
0:43.300–0:45.400
统一到同一套云形方式里
0:45.400–0:47.980
以前我们想在本地部署语音模型
0:47.980–0:49.860
经常是一个模型一套环境
0:49.860–0:51.440
我自己这台机器上
0:51.440–0:52.740
就装过声音克龙
0:52.740–0:53.660
谈文本合成
0:53.660–0:54.480
AI翻唱
0:54.480–0:56.020
实施语音好几套环境
0:56.020–0:57.960
每一套都有不同的配声版本
0:57.960–0:59.000
不同的库大依赖
0:59.000–1:00.640
最后不是模型跑不动
1:00.640–1:02.360
是环境先把人劝退了
1:02.360–1:04.740
Audio CPP解决的就是这个问题
1:04.740–1:08.160
它把TTS,ASR,音乐生存,声音转换
1:08.160–1:09.700
都接近同一个后台
1:09.700–1:12.060
通过界面可以随时切换模型
1:12.060–1:15.460
就像你用Olama在本地跑大语音模型一样
1:15.460–1:19.640
Audio CPP能让你更简单的在本地跑各种语音模型
1:19.640–1:22.040
我这次演示的大部分核心功能
1:22.040–1:23.480
8G显存就能跑起来
1:23.480–1:25.660
有些小模型甚至不需要显卡
1:25.660–1:27.080
用CPU也能运行
1:27.080–1:29.280
它现在已经接入的模型家族
1:29.280–1:31.440
有21个可以直接下载使用
1:31.440–1:33.120
还有一批在测试当中
1:33.120–1:36.080
统一底座带来的另一个直接好处是
1:36.080–1:37.180
运行效率更高
1:37.180–1:40.480
这是官方在RTX5090上的速度对比
1:40.480–1:43.120
大部分模型在AudioCPP下运行
1:43.120–1:45.980
比他们用自己的推理框架快了1-3倍
1:45.980–1:47.780
有的甚至快了8-10倍
1:47.780–1:51.140
我也在本地用RTX4060做了测试
1:51.140–1:53.120
拿微软开源的Vive Voice对比
1:53.120–1:54.640
用官方自己的程序
1:54.640–1:56.440
合成1万字的小说朗读
1:56.440–1:58.000
耗时110分钟
1:58.000–1:59.100
而同样的文本
1:59.100–2:00.860
拿到AudioCPP下合成
2:00.860–2:02.120
仅用了29分钟
2:02.120–2:03.720
只有原来的四分之一
2:03.720–2:04.840
除了速度
2:04.840–2:06.720
这期还有我最想让你看的
2:06.720–2:08.340
它把一堆分散的语音能力
2:08.340–2:09.720
变成一套本地系统
2:09.720–2:11.600
前面那个实时语音系统
2:11.600–2:13.100
等会我会完整演示
2:13.100–2:15.800
后面还有一个更好玩的音乐生成能力
2:15.800–2:17.160
歌曲旋律不变
2:17.160–2:18.440
直接换词翻唱
2:18.440–2:20.180
最后过一遍声音转换
2:20.180–2:21.580
设计等扩展功能
2:21.580–2:23.340
以及整合包的下载和使用
2:23.340–2:24.320
先看TTS
2:24.320–2:25.800
也就是文本转语音
2:25.800–2:26.860
这里列的模型
2:26.860–2:31.160
整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
2:31.160–2:32.940
它们都支持参考音频
2:32.940–2:34.960
也就意味着可以做声音克隆
2:34.960–2:36.560
基本用法非常简单
2:36.560–2:37.620
选择模型
2:37.620–2:39.140
点击加载
2:39.140–2:41.060
加载完会有提示
2:41.060–2:43.060
然后选一段参考音频
2:43.060–2:45.120
再输入合成文本
2:45.120–2:46.400
点击生成
2:46.400–2:48.340
这种一句话的声音克隆
2:48.340–2:49.620
基本上是秒生成
2:49.620–2:51.960
OpenAI launched GPT Live
2:51.960–2:54.680
A full duplex voice system for chat GPT
2:54.680–2:55.560
不过要注意
2:55.560–2:57.360
Pocket TTS不支持中文
2:57.360–2:58.880
要生成中文语音
2:58.880–3:01.600
可以换成千问3 TTS 0.6B
3:01.600–3:03.400
它的参数虽然不大
3:03.400–3:05.020
但合成效果相当不错
3:05.020–3:07.180
全双功语音系统
3:07.180–3:10.520
支持实时打断联网搜索和视觉理解
3:10.520–3:12.760
这两款模型显存占用都很小
3:12.760–3:14.300
非常适合低配显卡
3:14.300–3:15.860
以及没有独显的机器
3:15.860–3:16.980
刚上手
3:16.980–3:19.080
合成设置里的参数都可以不用管
3:19.080–3:19.880
保持默认
3:19.880–3:21.260
先把模型跑起来
3:21.260–3:22.520
听一下技术效果
3:22.520–3:24.020
熟悉之后再去调温度
3:24.020–3:25.020
采样这些参数
3:25.020–3:27.720
列表里还有两个模型比较有特点
3:27.720–3:29.460
一个是Vox CPM2
3:29.460–3:31.680
它好玩的地方是能生成方言
3:31.680–3:33.660
给一段方言参考音频
3:33.660–3:35.560
我们每个人都在做小丑
3:35.560–3:37.860
就可以合成相应的方言语音
3:37.860–3:38.940
错了你又不认
3:38.940–3:40.040
认了你又不改
3:40.040–3:42.360
它支持国内大部分方言
3:42.360–3:43.660
还能克隆语气
3:43.660–3:45.620
想深入了解这个模型的能力
3:45.620–3:48.960
可以翻译一下我之前专门做的Vox CPM那期视频
3:48.960–3:51.360
另一个有特点的是Voic Voice
3:51.360–3:53.760
就是开头速度对比的那个模型
3:53.760–3:55.660
那段近一万字的小说
3:55.660–3:58.240
合成期间显存占用没超过7G
3:58.240–4:00.820
生存出来的音频我全程听了一遍
4:00.820–4:02.640
没有明显的漏读和错读
4:02.640–4:05.040
忽然山腰里传来群马奔驰之声
4:05.040–4:06.280
提声越来越响
4:06.280–4:09.100
不久四面黄布大旗从山崖边升起
4:09.100–4:10.200
这里有个注意点
4:10.200–4:11.700
不管你用哪款模型
4:11.700–4:13.440
参考音频都不要太长
4:13.440–4:15.000
建议控制在10秒以内
4:15.000–4:17.700
否则会明显拖慢合成速度
4:17.700–4:18.780
另外还有个小技巧
4:18.780–4:20.860
如果有些参考音频你经常用
4:20.860–4:23.600
可以把它们放到WebUI下的Voice目标里
4:23.600–4:27.160
然后把文件名和对应的文本写到这个文件里
4:27.160–4:30.240
刷新列表就可以直接选了
4:30.240–4:32.020
临时上传的参考音频
4:32.020–4:34.300
下面对应的文本也不用手动输入
4:34.300–4:36.140
可以先到ASR标签里
4:36.140–4:38.020
把音频内容转写出来
4:38.020–4:40.920
这就引出了AudioCPP第二个核心能力
4:40.920–4:42.560
ASR语音转文字
4:42.560–4:45.360
我个人常用的模型是千问3ASR
4:45.360–4:47.120
等会要演示的实时语音
4:47.120–4:48.860
我的声音转文本用的就是它
4:48.860–4:50.220
中英文都支持
4:50.220–4:51.300
速度也很快
4:51.300–4:52.640
这段音频两分多钟
4:52.640–4:54.320
转录只用了21秒
4:54.320–4:56.420
如果转录的是多人对话
4:56.420–4:58.540
要勾选对话模式
4:58.540–5:01.600
转出来的就是这种带说话人序列的文本
5:01.600–5:03.460
不过对话模式有长度限制
5:03.460–5:05.840
目前更适合较短的对话片段
5:05.840–5:08.300
单人语音转写没有长度限制
5:08.300–5:09.220
歌词也能识别
5:09.220–5:11.860
等下做AI翻唱要拿原曲歌词
5:11.860–5:14.120
就可以先到这里做一遍初步识别
5:14.120–5:15.220
再手动校对
5:15.220–5:17.660
有了TTS和ASR
5:17.660–5:19.500
现在我们可以把它们拼起来用
5:19.500–5:22.260
这是我认为Audio CPP最有价值的地方
5:22.260–5:23.840
本地实时语音系统
5:23.840–5:26.520
我正在测试一个实时语音系统
5:26.520–5:27.680
好的
5:27.680–5:30.280
我正在实时语音系统里和你对话
5:30.280–5:32.140
如果你想测试它的稳定性
5:32.140–5:33.540
延迟或其他功能
5:33.540–5:35.440
请随时提问或下达指令
5:35.440–5:38.560
语音识别和合成都是跑在本地的
5:38.560–5:39.960
明白了
5:39.960–5:42.240
本地运行意味着响应速度更快
5:42.240–5:43.980
同时数据也更安全
5:43.980–5:46.940
这是一个很注重隐私和效率的设计思路
5:46.940–5:48.640
大语言模型是云端
5:48.640–5:51.380
你觉得这个架构是否合理
5:51.380–5:53.840
这个架构是合理的
5:53.840–5:54.700
从我说完话
5:54.700–5:55.780
到它开始回答
5:55.780–5:56.940
中间大概一秒
5:56.940–5:58.520
如果是一问对话
5:58.520–5:59.800
这个颜色会更低
5:59.800–6:01.220
What can you do for me
6:01.220–6:03.100
I can answer questions
6:03.100–6:04.560
Summarize information
6:04.560–6:05.920
整个流程就是
6:05.920–6:06.980
麦克风输入
6:06.980–6:08.340
ASR转文本
6:08.340–6:09.840
大语言模型声称回答
6:09.840–6:11.440
TTS再把它朗读出来
6:11.440–6:12.300
这就是一个
6:12.300–6:13.700
本地语音交互系统的
6:13.700–6:14.700
基本形态
6:14.700–6:15.220
设置里
6:15.220–6:17.200
大语言模型这一步是活的
6:17.200–6:18.820
本地化的是语音这一层
6:18.820–6:20.120
你可以接本地
6:20.120–6:21.420
欧拉玛跑到语言模型
6:21.420–6:23.580
也可以接自己订阅的API
6:23.580–6:26.060
Audio CPP负责的是音频这一层
6:26.060–6:26.740
听和说
6:26.740–6:29.120
所以我说它不是一个声音克隆玩具
6:29.120–6:30.740
而是消费级显卡上的
6:30.740–6:32.120
本地AI语音底座
6:32.120–6:34.660
而且它用的是OpenAI兼容接口
6:34.660–6:36.280
你本地的其他应用
6:36.280–6:38.080
只要支持这种接口形式
6:38.080–6:39.560
就能直接调用服务
6:39.560–6:41.020
就像设置里这样写
6:41.020–6:42.320
TTS的地址
6:42.320–6:43.440
模型名称
6:43.440–6:45.080
ASR的地址
6:45.080–6:46.460
模型名称
6:46.460–6:48.320
朗读的声音也可以自定义
6:48.320–6:51.320
比如我在这个OpenMagic AI应用里
6:51.320–6:53.940
直接调用AudioCPP的TTS服务
6:53.940–6:55.280
填写UIL
6:55.280–6:56.520
还有模型名称
6:56.520–6:58.800
由于这个应用没法填参考音频
6:58.800–7:02.120
所以我后台单独起一个AudioCPP服务
7:02.120–7:03.580
启动时带上参考音频
7:03.580–7:05.980
回到OpenMagic测试
7:05.980–7:07.840
你好 这是一段测试语音
7:07.840–7:09.480
能正确返回语音
7:09.480–7:10.600
这样就接好了
7:10.600–7:13.520
这就是一个完全免费的本地TTS服务
7:13.520–7:15.220
如果你在做本地Agent
7:15.220–7:16.820
或者想给自己的应用
7:16.820–7:18.320
加上语音输入输出
7:18.320–7:20.860
AudioCPP提供的接口就非常有用
7:20.860–7:22.840
接下来我们看音乐生成
7:22.840–7:26.200
这部分也是我觉得AudioCPP很强的地方
7:26.200–7:35.080
它不只是把TTS和ASR放到一起
7:35.080–7:36.940
连音乐生成换词翻唱
7:36.940–7:38.580
这些原本比较重的模型
7:38.580–7:40.340
也开始接近同一个底座里
7:40.340–7:43.180
这个ACE STEP我之前介绍过
7:43.180–7:45.780
当时我在本地8G显存上跑不动翻唱
7:45.780–7:47.540
最后是在Club上演示的
7:47.540–7:48.860
现在用AudioCPP
7:48.860–7:51.140
本地就能跑起来
7:51.140–8:02.200
翻唱可以按下面步骤操作
8:02.644–8:04.524
先上传要翻唱的歌曲
8:04.524–8:06.064
然后点分析
8:06.064–8:08.524
这个过程要等几十秒到几分钟
8:08.524–8:09.984
具体看歌曲长度
8:09.984–8:11.204
分析完成后
8:11.204–8:13.664
合成翻唱的时长改成-1
8:13.664–8:15.444
点开高级参数
8:15.444–8:17.224
操作类型选Remix
8:17.224–8:18.804
歌曲风格
8:18.804–8:19.684
曲谱信息
8:19.684–8:21.504
分析完以后就会自动填好
8:21.504–8:22.044
不用动
8:22.044–8:24.304
你只需要填上圆曲歌词
8:24.304–8:27.044
提示词直接复制上面的圆曲描述
8:27.044–8:29.084
最后填上你的翻唱歌词
8:29.084–8:30.884
可以看一下显存占用
8:30.884–8:32.484
虽然看上去超过8G
8:32.484–8:33.584
但不会爆显存
8:33.584–8:35.024
最后能顺利跑完
8:35.024–8:36.924
换词翻唱的随机性比较大
8:36.924–8:38.104
需要多试几次
8:38.104–8:39.124
如果音质不好
8:39.124–8:40.964
可以适当增加生存部署
8:40.964–8:43.004
要是新词唱不准或者唱不出来
8:43.004–8:45.044
可以调这个Flowedit参数
8:45.044–8:47.184
从0.7到0.9去尝试
8:47.184–8:49.304
如果你只想生成背景音乐
8:49.304–8:51.064
我推荐用Stable Audio
8:51.064–8:52.644
比ACE Stable更稳
8:52.644–8:55.624
声音转换相当于音色迁移
8:55.624–8:57.224
保持说话内容不变
8:57.224–8:58.284
语气不变
8:58.284–8:59.344
只把音色换掉
8:59.344–9:00.344
马匪
9:00.344–9:02.924
任何时候都要搅
9:02.924–9:04.164
不搅不行
9:04.164–9:05.864
马匪
9:05.864–9:08.324
任何时候都要搅
9:08.324–9:09.544
不搅不行
9:09.544–9:12.124
歌声转换也是类似逻辑
9:12.124–9:12.924
但我实测
9:12.924–9:14.504
如果你追求追踪质量
9:14.504–9:16.824
我更推荐之前那套RVC流程
9:16.824–9:18.184
做歌声转换之前
9:18.184–9:19.824
最好先做人声分离
9:19.824–9:21.304
音频分离标签下
9:21.304–9:22.544
就有相应的模型
9:22.544–9:25.064
再往下是音频分析这一组
9:25.064–9:26.644
它们都是工具类模型
9:26.644–9:28.744
比如这个是实时语音检测
9:28.744–9:30.724
下面这个是多人对话识别
9:30.724–9:32.424
最后一个是声音设计
9:32.424–9:33.504
这个挺有意思
9:33.504–9:35.084
它其实类似声音克隆
9:35.084–9:36.664
只是不需要参考音频
9:36.664–9:38.804
你直接用文字描述一个声音
9:38.804–9:40.564
比如磁性的中年男生
9:40.564–9:41.404
语速偏慢
9:41.404–9:42.044
波音枪
9:42.044–9:43.804
模型就会按描述生成
9:43.804–9:54.664
这个功能做临时配音比较好用
9:54.664–9:56.864
最后说一下整合包
9:56.864–9:59.264
Audio CPP本身是个C++项目
9:59.264–10:01.484
官方目前主要靠命令行来使用
10:01.484–10:03.484
对有经验的朋友来说问题不大
10:03.484–10:05.024
但对没技术基础的
10:05.024–10:06.584
这一步确实比较劝退
10:06.584–10:08.644
所以我做了带界面的整合包
10:08.644–10:09.744
解压就能用
10:09.744–10:11.804
支持16-50系列的N卡
10:11.804–10:14.064
目前A卡以及没有独显的机器
10:14.064–10:15.644
会自动走CPU模式
10:15.644–10:16.764
速度会慢一些
10:16.764–10:18.444
但跑几个轻量模型没问题
10:18.444–10:19.264
整合包里
10:19.264–10:21.304
Run Web UI是启动网页界面
10:21.304–10:22.484
想用哪个模型
10:22.484–10:23.884
界面里就能直接下载
10:23.884–10:25.844
想体验实时语音
10:25.844–10:27.644
先在Web UI里加载模型
10:27.644–10:29.744
再启动这个ASR服务
10:29.744–10:31.784
最后运行Run Real Time
10:31.784–10:34.264
配置里把接入的大模型改一下
10:34.264–10:35.824
如果你也用Deep Seek
10:35.824–10:38.124
API Key换成自己的就可以了
10:38.124–10:40.144
这一整套原代码我已经开完了
10:40.144–10:41.444
这是GitHub地址
10:41.444–10:43.344
使用中如果遇到问题
10:43.344–10:44.784
或者希望增加功能
10:44.784–10:46.444
可以在评论区告诉我
10:46.444–10:48.764
我会收集整理定期更新版本
10:48.764–10:49.704
总结一下
10:49.704–10:51.384
Audio CPP最大的意义
10:51.384–10:53.404
不是又多了一个声音客户工具
10:53.404–10:55.004
而是本地语音模型
10:55.004–10:57.264
开始变成一套统一的系统
10:57.264–10:58.804
大语言模型有Lama CPP
10:58.804–11:00.864
图片视频生成有Conf UI
11:00.864–11:02.964
语音模型现在也开始有了
11:02.964–11:04.324
自己的本地运行中心
11:04.324–11:05.904
对于普通用户来说
11:05.904–11:07.164
使用门槛更低了
11:07.164–11:08.424
对开发者来说
11:08.424–11:10.224
本地语音服务接入更容易
11:10.224–11:12.604
这也是我这期最想讲清楚的地方
11:12.604–11:14.644
本期视频用到的所有链接
11:14.644–11:16.124
我都放在评论区置顶
11:16.124–11:17.784
这里是AI探索已发现
11:17.784–11:18.624
感谢观看
11:18.624–11:19.204
下期见
0:00.000–0:01.780
zh这个本地AI工具有点离谱
这个本地AI工具有点离谱
0:01.780–0:03.400
zh它能实时语音对话
它能实时语音对话
0:03.400–0:05.320
zh哈喽 你能帮我做什么
哈喽 你能帮我做什么
0:05.320–0:07.560
zh你好 我可以帮你回答问题
你好 我可以帮你回答问题
0:07.560–0:09.440
zh提供信息 安排日程
提供信息 安排日程
0:09.440–0:11.000
zh还能声音克隆
还能声音克隆
0:11.000–0:13.120
zh大家好呀 要站在光里
大家好呀 要站在光里
0:13.120–0:14.720
zh不要光站在那里
不要光站在那里
0:14.720–0:16.240
zh不仅能声称AI音乐
不仅能声称AI音乐
0:16.240–0:21.040
zh还能换词翻唱
还能换词翻唱
0:21.040–0:28.140
zh这一整套服务
这一整套服务
0:28.140–0:30.620
zh全都跑在这台8G显存的笔记本上
全都跑在这台8G显存的笔记本上
0:30.620–0:32.420
zh不用云端语音平台
不用云端语音平台
0:32.420–0:33.920
zh不需要联网语音服务
不需要联网语音服务
0:33.920–0:35.940
zh这个工具叫Audio CPP
这个工具叫Audio CPP
0:35.940–0:39.140
zh你可以把它理解成音乐领域的Nama CPP
你可以把它理解成音乐领域的Nama CPP
0:39.140–0:41.600
zh它想解决的不是某一个语音功能
它想解决的不是某一个语音功能
0:41.600–0:43.300
zh而是把本地音频模型
而是把本地音频模型
0:43.300–0:45.400
zh统一到同一套云形方式里
统一到同一套云形方式里
0:45.400–0:47.980
zh以前我们想在本地部署语音模型
以前我们想在本地部署语音模型
0:47.980–0:49.860
zh经常是一个模型一套环境
经常是一个模型一套环境
0:49.860–0:51.440
zh我自己这台机器上
我自己这台机器上
0:51.440–0:52.740
zh就装过声音克龙
就装过声音克龙
0:52.740–0:53.660
zh谈文本合成
谈文本合成
0:53.660–0:54.480
zhAI翻唱
AI翻唱
0:54.480–0:56.020
zh实施语音好几套环境
实施语音好几套环境
0:56.020–0:57.960
zh每一套都有不同的配声版本
每一套都有不同的配声版本
0:57.960–0:59.000
zh不同的库大依赖
不同的库大依赖
0:59.000–1:00.640
zh最后不是模型跑不动
最后不是模型跑不动
1:00.640–1:02.360
zh是环境先把人劝退了
是环境先把人劝退了
1:02.360–1:04.740
zhAudio CPP解决的就是这个问题
Audio CPP解决的就是这个问题
1:04.740–1:08.160
zh它把TTS,ASR,音乐生存,声音转换
它把TTS,ASR,音乐生存,声音转换
1:08.160–1:09.700
zh都接近同一个后台
都接近同一个后台
1:09.700–1:12.060
zh通过界面可以随时切换模型
通过界面可以随时切换模型
1:12.060–1:15.460
zh就像你用Olama在本地跑大语音模型一样
就像你用Olama在本地跑大语音模型一样
1:15.460–1:19.640
zhAudio CPP能让你更简单的在本地跑各种语音模型
Audio CPP能让你更简单的在本地跑各种语音模型
1:19.640–1:22.040
zh我这次演示的大部分核心功能
我这次演示的大部分核心功能
1:22.040–1:23.480
zh8G显存就能跑起来
8G显存就能跑起来
1:23.480–1:25.660
zh有些小模型甚至不需要显卡
有些小模型甚至不需要显卡
1:25.660–1:27.080
zh用CPU也能运行
用CPU也能运行
1:27.080–1:29.280
zh它现在已经接入的模型家族
它现在已经接入的模型家族
1:29.280–1:31.440
zh有21个可以直接下载使用
有21个可以直接下载使用
1:31.440–1:33.120
zh还有一批在测试当中
还有一批在测试当中
1:33.120–1:36.080
zh统一底座带来的另一个直接好处是
统一底座带来的另一个直接好处是
1:36.080–1:37.180
zh运行效率更高
运行效率更高
1:37.180–1:40.480
zh这是官方在RTX5090上的速度对比
这是官方在RTX5090上的速度对比
1:40.480–1:43.120
zh大部分模型在AudioCPP下运行
大部分模型在AudioCPP下运行
1:43.120–1:45.980
zh比他们用自己的推理框架快了1-3倍
比他们用自己的推理框架快了1-3倍
1:45.980–1:47.780
zh有的甚至快了8-10倍
有的甚至快了8-10倍
1:47.780–1:51.140
zh我也在本地用RTX4060做了测试
我也在本地用RTX4060做了测试
1:51.140–1:53.120
zh拿微软开源的Vive Voice对比
拿微软开源的Vive Voice对比
1:53.120–1:54.640
zh用官方自己的程序
用官方自己的程序
1:54.640–1:56.440
zh合成1万字的小说朗读
合成1万字的小说朗读
1:56.440–1:58.000
zh耗时110分钟
耗时110分钟
1:58.000–1:59.100
zh而同样的文本
而同样的文本
1:59.100–2:00.860
zh拿到AudioCPP下合成
拿到AudioCPP下合成
2:00.860–2:02.120
zh仅用了29分钟
仅用了29分钟
2:02.120–2:03.720
zh只有原来的四分之一
只有原来的四分之一
2:03.720–2:04.840
zh除了速度
除了速度
2:04.840–2:06.720
zh这期还有我最想让你看的
这期还有我最想让你看的
2:06.720–2:08.340
zh它把一堆分散的语音能力
它把一堆分散的语音能力
2:08.340–2:09.720
zh变成一套本地系统
变成一套本地系统
2:09.720–2:11.600
zh前面那个实时语音系统
前面那个实时语音系统
2:11.600–2:13.100
zh等会我会完整演示
等会我会完整演示
2:13.100–2:15.800
zh后面还有一个更好玩的音乐生成能力
后面还有一个更好玩的音乐生成能力
2:15.800–2:17.160
zh歌曲旋律不变
歌曲旋律不变
2:17.160–2:18.440
zh直接换词翻唱
直接换词翻唱
2:18.440–2:20.180
zh最后过一遍声音转换
最后过一遍声音转换
2:20.180–2:21.580
zh设计等扩展功能
设计等扩展功能
2:21.580–2:23.340
zh以及整合包的下载和使用
以及整合包的下载和使用
2:23.340–2:24.320
zh先看TTS
先看TTS
2:24.320–2:25.800
zh也就是文本转语音
也就是文本转语音
2:25.800–2:26.860
zh这里列的模型
这里列的模型
2:26.860–2:31.160
zh整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
整合包里自带了Pocket TTS和Chemun3 TTS 0.6B
2:31.160–2:32.940
zh它们都支持参考音频
它们都支持参考音频
2:32.940–2:34.960
zh也就意味着可以做声音克隆
也就意味着可以做声音克隆
2:34.960–2:36.560
zh基本用法非常简单
基本用法非常简单
2:36.560–2:37.620
zh选择模型
选择模型
2:37.620–2:39.140
zh点击加载
点击加载
2:39.140–2:41.060
zh加载完会有提示
加载完会有提示
2:41.060–2:43.060
zh然后选一段参考音频
然后选一段参考音频
2:43.060–2:45.120
zh再输入合成文本
再输入合成文本
2:45.120–2:46.400
zh点击生成
点击生成
2:46.400–2:48.340
zh这种一句话的声音克隆
这种一句话的声音克隆
2:48.340–2:49.620
zh基本上是秒生成
基本上是秒生成
2:49.620–2:51.960
enOpenAI launched GPT Live
OpenAI launched GPT Live
2:51.960–2:54.680
enA full duplex voice system for chat GPT
A full duplex voice system for chat GPT
2:54.680–2:55.560
zh不过要注意
不过要注意
2:55.560–2:57.360
zhPocket TTS不支持中文
Pocket TTS不支持中文
2:57.360–2:58.880
zh要生成中文语音
要生成中文语音
2:58.880–3:01.600
zh可以换成千问3 TTS 0.6B
可以换成千问3 TTS 0.6B
3:01.600–3:03.400
zh它的参数虽然不大
它的参数虽然不大
3:03.400–3:05.020
zh但合成效果相当不错
但合成效果相当不错
3:05.020–3:07.180
zh全双功语音系统
全双功语音系统
3:07.180–3:10.520
zh支持实时打断联网搜索和视觉理解
支持实时打断联网搜索和视觉理解
3:10.520–3:12.760
zh这两款模型显存占用都很小
这两款模型显存占用都很小
3:12.760–3:14.300
zh非常适合低配显卡
非常适合低配显卡
3:14.300–3:15.860
zh以及没有独显的机器
以及没有独显的机器
3:15.860–3:16.980
zh刚上手
刚上手
3:16.980–3:19.080
zh合成设置里的参数都可以不用管
合成设置里的参数都可以不用管
3:19.080–3:19.880
zh保持默认
保持默认
3:19.880–3:21.260
zh先把模型跑起来
先把模型跑起来
3:21.260–3:22.520
zh听一下技术效果
听一下技术效果
3:22.520–3:24.020
zh熟悉之后再去调温度
熟悉之后再去调温度
3:24.020–3:25.020
zh采样这些参数
采样这些参数
3:25.020–3:27.720
zh列表里还有两个模型比较有特点
列表里还有两个模型比较有特点
3:27.720–3:29.460
zh一个是Vox CPM2
一个是Vox CPM2
3:29.460–3:31.680
zh它好玩的地方是能生成方言
它好玩的地方是能生成方言
3:31.680–3:33.660
zh给一段方言参考音频
给一段方言参考音频
3:33.660–3:35.560
zh我们每个人都在做小丑
我们每个人都在做小丑
3:35.560–3:37.860
zh就可以合成相应的方言语音
就可以合成相应的方言语音
3:37.860–3:38.940
zh错了你又不认
错了你又不认
3:38.940–3:40.040
zh认了你又不改
认了你又不改
3:40.040–3:42.360
zh它支持国内大部分方言
它支持国内大部分方言
3:42.360–3:43.660
zh还能克隆语气
还能克隆语气
3:43.660–3:45.620
zh想深入了解这个模型的能力
想深入了解这个模型的能力
3:45.620–3:48.960
zh可以翻译一下我之前专门做的Vox CPM那期视频
可以翻译一下我之前专门做的Vox CPM那期视频
3:48.960–3:51.360
zh另一个有特点的是Voic Voice
另一个有特点的是Voic Voice
3:51.360–3:53.760
zh就是开头速度对比的那个模型
就是开头速度对比的那个模型
3:53.760–3:55.660
zh那段近一万字的小说
那段近一万字的小说
3:55.660–3:58.240
zh合成期间显存占用没超过7G
合成期间显存占用没超过7G
3:58.240–4:00.820
zh生存出来的音频我全程听了一遍
生存出来的音频我全程听了一遍
4:00.820–4:02.640
zh没有明显的漏读和错读
没有明显的漏读和错读
4:02.640–4:05.040
zh忽然山腰里传来群马奔驰之声
忽然山腰里传来群马奔驰之声
4:05.040–4:06.280
zh提声越来越响
提声越来越响
4:06.280–4:09.100
zh不久四面黄布大旗从山崖边升起
不久四面黄布大旗从山崖边升起
4:09.100–4:10.200
zh这里有个注意点
这里有个注意点
4:10.200–4:11.700
zh不管你用哪款模型
不管你用哪款模型
4:11.700–4:13.440
zh参考音频都不要太长
参考音频都不要太长
4:13.440–4:15.000
zh建议控制在10秒以内
建议控制在10秒以内
4:15.000–4:17.700
zh否则会明显拖慢合成速度
否则会明显拖慢合成速度
4:17.700–4:18.780
zh另外还有个小技巧
另外还有个小技巧
4:18.780–4:20.860
zh如果有些参考音频你经常用
如果有些参考音频你经常用
4:20.860–4:23.600
zh可以把它们放到WebUI下的Voice目标里
可以把它们放到WebUI下的Voice目标里
4:23.600–4:27.160
zh然后把文件名和对应的文本写到这个文件里
然后把文件名和对应的文本写到这个文件里
4:27.160–4:30.240
zh刷新列表就可以直接选了
刷新列表就可以直接选了
4:30.240–4:32.020
zh临时上传的参考音频
临时上传的参考音频
4:32.020–4:34.300
zh下面对应的文本也不用手动输入
下面对应的文本也不用手动输入
4:34.300–4:36.140
zh可以先到ASR标签里
可以先到ASR标签里
4:36.140–4:38.020
zh把音频内容转写出来
把音频内容转写出来
4:38.020–4:40.920
zh这就引出了AudioCPP第二个核心能力
这就引出了AudioCPP第二个核心能力
4:40.920–4:42.560
zhASR语音转文字
ASR语音转文字
4:42.560–4:45.360
zh我个人常用的模型是千问3ASR
我个人常用的模型是千问3ASR
4:45.360–4:47.120
zh等会要演示的实时语音
等会要演示的实时语音
4:47.120–4:48.860
zh我的声音转文本用的就是它
我的声音转文本用的就是它
4:48.860–4:50.220
zh中英文都支持
中英文都支持
4:50.220–4:51.300
zh速度也很快
速度也很快
4:51.300–4:52.640
zh这段音频两分多钟
这段音频两分多钟
4:52.640–4:54.320
zh转录只用了21秒
转录只用了21秒
4:54.320–4:56.420
zh如果转录的是多人对话
如果转录的是多人对话
4:56.420–4:58.540
zh要勾选对话模式
要勾选对话模式
4:58.540–5:01.600
zh转出来的就是这种带说话人序列的文本
转出来的就是这种带说话人序列的文本
5:01.600–5:03.460
zh不过对话模式有长度限制
不过对话模式有长度限制
5:03.460–5:05.840
zh目前更适合较短的对话片段
目前更适合较短的对话片段
5:05.840–5:08.300
zh单人语音转写没有长度限制
单人语音转写没有长度限制
5:08.300–5:09.220
zh歌词也能识别
歌词也能识别
5:09.220–5:11.860
zh等下做AI翻唱要拿原曲歌词
等下做AI翻唱要拿原曲歌词
5:11.860–5:14.120
zh就可以先到这里做一遍初步识别
就可以先到这里做一遍初步识别
5:14.120–5:15.220
zh再手动校对
再手动校对
5:15.220–5:17.660
zh有了TTS和ASR
有了TTS和ASR
5:17.660–5:19.500
zh现在我们可以把它们拼起来用
现在我们可以把它们拼起来用
5:19.500–5:22.260
zh这是我认为Audio CPP最有价值的地方
这是我认为Audio CPP最有价值的地方
5:22.260–5:23.840
zh本地实时语音系统
本地实时语音系统
5:23.840–5:26.520
zh我正在测试一个实时语音系统
我正在测试一个实时语音系统
5:26.520–5:27.680
zh好的
好的
5:27.680–5:30.280
zh我正在实时语音系统里和你对话
我正在实时语音系统里和你对话
5:30.280–5:32.140
zh如果你想测试它的稳定性
如果你想测试它的稳定性
5:32.140–5:33.540
zh延迟或其他功能
延迟或其他功能
5:33.540–5:35.440
zh请随时提问或下达指令
请随时提问或下达指令
5:35.440–5:38.560
zh语音识别和合成都是跑在本地的
语音识别和合成都是跑在本地的
5:38.560–5:39.960
zh明白了
明白了
5:39.960–5:42.240
zh本地运行意味着响应速度更快
本地运行意味着响应速度更快
5:42.240–5:43.980
zh同时数据也更安全
同时数据也更安全
5:43.980–5:46.940
zh这是一个很注重隐私和效率的设计思路
这是一个很注重隐私和效率的设计思路
5:46.940–5:48.640
zh大语言模型是云端
大语言模型是云端
5:48.640–5:51.380
zh你觉得这个架构是否合理
你觉得这个架构是否合理
5:51.380–5:53.840
zh这个架构是合理的
这个架构是合理的
5:53.840–5:54.700
zh从我说完话
从我说完话
5:54.700–5:55.780
zh到它开始回答
到它开始回答
5:55.780–5:56.940
zh中间大概一秒
中间大概一秒
5:56.940–5:58.520
zh如果是一问对话
如果是一问对话
5:58.520–5:59.800
zh这个颜色会更低
这个颜色会更低
5:59.800–6:01.220
enWhat can you do for me
What can you do for me
6:01.220–6:03.100
enI can answer questions
I can answer questions
6:03.100–6:04.560
enSummarize information
Summarize information
6:04.560–6:05.920
zh整个流程就是
整个流程就是
6:05.920–6:06.980
zh麦克风输入
麦克风输入
6:06.980–6:08.340
zhASR转文本
ASR转文本
6:08.340–6:09.840
zh大语言模型声称回答
大语言模型声称回答
6:09.840–6:11.440
zhTTS再把它朗读出来
TTS再把它朗读出来
6:11.440–6:12.300
zh这就是一个
这就是一个
6:12.300–6:13.700
zh本地语音交互系统的
本地语音交互系统的
6:13.700–6:14.700
zh基本形态
基本形态
6:14.700–6:15.220
zh设置里
设置里
6:15.220–6:17.200
zh大语言模型这一步是活的
大语言模型这一步是活的
6:17.200–6:18.820
zh本地化的是语音这一层
本地化的是语音这一层
6:18.820–6:20.120
zh你可以接本地
你可以接本地
6:20.120–6:21.420
zh欧拉玛跑到语言模型
欧拉玛跑到语言模型
6:21.420–6:23.580
zh也可以接自己订阅的API
也可以接自己订阅的API
6:23.580–6:26.060
zhAudio CPP负责的是音频这一层
Audio CPP负责的是音频这一层
6:26.060–6:26.740
zh听和说
听和说
6:26.740–6:29.120
zh所以我说它不是一个声音克隆玩具
所以我说它不是一个声音克隆玩具
6:29.120–6:30.740
zh而是消费级显卡上的
而是消费级显卡上的
6:30.740–6:32.120
zh本地AI语音底座
本地AI语音底座
6:32.120–6:34.660
zh而且它用的是OpenAI兼容接口
而且它用的是OpenAI兼容接口
6:34.660–6:36.280
zh你本地的其他应用
你本地的其他应用
6:36.280–6:38.080
zh只要支持这种接口形式
只要支持这种接口形式
6:38.080–6:39.560
zh就能直接调用服务
就能直接调用服务
6:39.560–6:41.020
zh就像设置里这样写
就像设置里这样写
6:41.020–6:42.320
zhTTS的地址
TTS的地址
6:42.320–6:43.440
zh模型名称
模型名称
6:43.440–6:45.080
zhASR的地址
ASR的地址
6:45.080–6:46.460
zh模型名称
模型名称
6:46.460–6:48.320
zh朗读的声音也可以自定义
朗读的声音也可以自定义
6:48.320–6:51.320
zh比如我在这个OpenMagic AI应用里
比如我在这个OpenMagic AI应用里
6:51.320–6:53.940
zh直接调用AudioCPP的TTS服务
直接调用AudioCPP的TTS服务
6:53.940–6:55.280
zh填写UIL
填写UIL
6:55.280–6:56.520
zh还有模型名称
还有模型名称
6:56.520–6:58.800
zh由于这个应用没法填参考音频
由于这个应用没法填参考音频
6:58.800–7:02.120
zh所以我后台单独起一个AudioCPP服务
所以我后台单独起一个AudioCPP服务
7:02.120–7:03.580
zh启动时带上参考音频
启动时带上参考音频
7:03.580–7:05.980
zh回到OpenMagic测试
回到OpenMagic测试
7:05.980–7:07.840
zh你好 这是一段测试语音
你好 这是一段测试语音
7:07.840–7:09.480
zh能正确返回语音
能正确返回语音
7:09.480–7:10.600
zh这样就接好了
这样就接好了
7:10.600–7:13.520
zh这就是一个完全免费的本地TTS服务
这就是一个完全免费的本地TTS服务
7:13.520–7:15.220
zh如果你在做本地Agent
如果你在做本地Agent
7:15.220–7:16.820
zh或者想给自己的应用
或者想给自己的应用
7:16.820–7:18.320
zh加上语音输入输出
加上语音输入输出
7:18.320–7:20.860
zhAudioCPP提供的接口就非常有用
AudioCPP提供的接口就非常有用
7:20.860–7:22.840
zh接下来我们看音乐生成
接下来我们看音乐生成
7:22.840–7:26.200
zh这部分也是我觉得AudioCPP很强的地方
这部分也是我觉得AudioCPP很强的地方
7:26.200–7:35.080
zh它不只是把TTS和ASR放到一起
它不只是把TTS和ASR放到一起
7:35.080–7:36.940
zh连音乐生成换词翻唱
连音乐生成换词翻唱
7:36.940–7:38.580
zh这些原本比较重的模型
这些原本比较重的模型
7:38.580–7:40.340
zh也开始接近同一个底座里
也开始接近同一个底座里
7:40.340–7:43.180
zh这个ACE STEP我之前介绍过
这个ACE STEP我之前介绍过
7:43.180–7:45.780
zh当时我在本地8G显存上跑不动翻唱
当时我在本地8G显存上跑不动翻唱
7:45.780–7:47.540
zh最后是在Club上演示的
最后是在Club上演示的
7:47.540–7:48.860
zh现在用AudioCPP
现在用AudioCPP
7:48.860–7:51.140
zh本地就能跑起来
本地就能跑起来
7:51.140–8:02.200
zh翻唱可以按下面步骤操作
翻唱可以按下面步骤操作
8:02.644–8:04.524
zh先上传要翻唱的歌曲
先上传要翻唱的歌曲
8:04.524–8:06.064
zh然后点分析
然后点分析
8:06.064–8:08.524
zh这个过程要等几十秒到几分钟
这个过程要等几十秒到几分钟
8:08.524–8:09.984
zh具体看歌曲长度
具体看歌曲长度
8:09.984–8:11.204
zh分析完成后
分析完成后
8:11.204–8:13.664
zh合成翻唱的时长改成-1
合成翻唱的时长改成-1
8:13.664–8:15.444
zh点开高级参数
点开高级参数
8:15.444–8:17.224
zh操作类型选Remix
操作类型选Remix
8:17.224–8:18.804
zh歌曲风格
歌曲风格
8:18.804–8:19.684
zh曲谱信息
曲谱信息
8:19.684–8:21.504
zh分析完以后就会自动填好
分析完以后就会自动填好
8:21.504–8:22.044
zh不用动
不用动
8:22.044–8:24.304
zh你只需要填上圆曲歌词
你只需要填上圆曲歌词
8:24.304–8:27.044
zh提示词直接复制上面的圆曲描述
提示词直接复制上面的圆曲描述
8:27.044–8:29.084
zh最后填上你的翻唱歌词
最后填上你的翻唱歌词
8:29.084–8:30.884
zh可以看一下显存占用
可以看一下显存占用
8:30.884–8:32.484
zh虽然看上去超过8G
虽然看上去超过8G
8:32.484–8:33.584
zh但不会爆显存
但不会爆显存
8:33.584–8:35.024
zh最后能顺利跑完
最后能顺利跑完
8:35.024–8:36.924
zh换词翻唱的随机性比较大
换词翻唱的随机性比较大
8:36.924–8:38.104
zh需要多试几次
需要多试几次
8:38.104–8:39.124
zh如果音质不好
如果音质不好
8:39.124–8:40.964
zh可以适当增加生存部署
可以适当增加生存部署
8:40.964–8:43.004
zh要是新词唱不准或者唱不出来
要是新词唱不准或者唱不出来
8:43.004–8:45.044
zh可以调这个Flowedit参数
可以调这个Flowedit参数
8:45.044–8:47.184
zh从0.7到0.9去尝试
从0.7到0.9去尝试
8:47.184–8:49.304
zh如果你只想生成背景音乐
如果你只想生成背景音乐
8:49.304–8:51.064
zh我推荐用Stable Audio
我推荐用Stable Audio
8:51.064–8:52.644
zh比ACE Stable更稳
比ACE Stable更稳
8:52.644–8:55.624
zh声音转换相当于音色迁移
声音转换相当于音色迁移
8:55.624–8:57.224
zh保持说话内容不变
保持说话内容不变
8:57.224–8:58.284
zh语气不变
语气不变
8:58.284–8:59.344
zh只把音色换掉
只把音色换掉
8:59.344–9:00.344
zh马匪
马匪
9:00.344–9:02.924
zh任何时候都要搅
任何时候都要搅
9:02.924–9:04.164
zh不搅不行
不搅不行
9:04.164–9:05.864
zh马匪
马匪
9:05.864–9:08.324
zh任何时候都要搅
任何时候都要搅
9:08.324–9:09.544
zh不搅不行
不搅不行
9:09.544–9:12.124
zh歌声转换也是类似逻辑
歌声转换也是类似逻辑
9:12.124–9:12.924
zh但我实测
但我实测
9:12.924–9:14.504
zh如果你追求追踪质量
如果你追求追踪质量
9:14.504–9:16.824
zh我更推荐之前那套RVC流程
我更推荐之前那套RVC流程
9:16.824–9:18.184
zh做歌声转换之前
做歌声转换之前
9:18.184–9:19.824
zh最好先做人声分离
最好先做人声分离
9:19.824–9:21.304
zh音频分离标签下
音频分离标签下
9:21.304–9:22.544
zh就有相应的模型
就有相应的模型
9:22.544–9:25.064
zh再往下是音频分析这一组
再往下是音频分析这一组
9:25.064–9:26.644
zh它们都是工具类模型
它们都是工具类模型
9:26.644–9:28.744
zh比如这个是实时语音检测
比如这个是实时语音检测
9:28.744–9:30.724
zh下面这个是多人对话识别
下面这个是多人对话识别
9:30.724–9:32.424
zh最后一个是声音设计
最后一个是声音设计
9:32.424–9:33.504
zh这个挺有意思
这个挺有意思
9:33.504–9:35.084
zh它其实类似声音克隆
它其实类似声音克隆
9:35.084–9:36.664
zh只是不需要参考音频
只是不需要参考音频
9:36.664–9:38.804
zh你直接用文字描述一个声音
你直接用文字描述一个声音
9:38.804–9:40.564
zh比如磁性的中年男生
比如磁性的中年男生
9:40.564–9:41.404
zh语速偏慢
语速偏慢
9:41.404–9:42.044
zh波音枪
波音枪
9:42.044–9:43.804
zh模型就会按描述生成
模型就会按描述生成
9:43.804–9:54.664
zh这个功能做临时配音比较好用
这个功能做临时配音比较好用
9:54.664–9:56.864
zh最后说一下整合包
最后说一下整合包
9:56.864–9:59.264
zhAudio CPP本身是个C++项目
Audio CPP本身是个C++项目
9:59.264–10:01.484
zh官方目前主要靠命令行来使用
官方目前主要靠命令行来使用
10:01.484–10:03.484
zh对有经验的朋友来说问题不大
对有经验的朋友来说问题不大
10:03.484–10:05.024
zh但对没技术基础的
但对没技术基础的
10:05.024–10:06.584
zh这一步确实比较劝退
这一步确实比较劝退
10:06.584–10:08.644
zh所以我做了带界面的整合包
所以我做了带界面的整合包
10:08.644–10:09.744
zh解压就能用
解压就能用
10:09.744–10:11.804
zh支持16-50系列的N卡
支持16-50系列的N卡
10:11.804–10:14.064
zh目前A卡以及没有独显的机器
目前A卡以及没有独显的机器
10:14.064–10:15.644
zh会自动走CPU模式
会自动走CPU模式
10:15.644–10:16.764
zh速度会慢一些
速度会慢一些
10:16.764–10:18.444
zh但跑几个轻量模型没问题
但跑几个轻量模型没问题
10:18.444–10:19.264
zh整合包里
整合包里
10:19.264–10:21.304
zhRun Web UI是启动网页界面
Run Web UI是启动网页界面
10:21.304–10:22.484
zh想用哪个模型
想用哪个模型
10:22.484–10:23.884
zh界面里就能直接下载
界面里就能直接下载
10:23.884–10:25.844
zh想体验实时语音
想体验实时语音
10:25.844–10:27.644
zh先在Web UI里加载模型
先在Web UI里加载模型
10:27.644–10:29.744
zh再启动这个ASR服务
再启动这个ASR服务
10:29.744–10:31.784
zh最后运行Run Real Time
最后运行Run Real Time
10:31.784–10:34.264
zh配置里把接入的大模型改一下
配置里把接入的大模型改一下
10:34.264–10:35.824
zh如果你也用Deep Seek
如果你也用Deep Seek
10:35.824–10:38.124
zhAPI Key换成自己的就可以了
API Key换成自己的就可以了
10:38.124–10:40.144
zh这一整套原代码我已经开完了
这一整套原代码我已经开完了
10:40.144–10:41.444
zh这是GitHub地址
这是GitHub地址
10:41.444–10:43.344
zh使用中如果遇到问题
使用中如果遇到问题
10:43.344–10:44.784
zh或者希望增加功能
或者希望增加功能
10:44.784–10:46.444
zh可以在评论区告诉我
可以在评论区告诉我
10:46.444–10:48.764
zh我会收集整理定期更新版本
我会收集整理定期更新版本
10:48.764–10:49.704
zh总结一下
总结一下
10:49.704–10:51.384
zhAudio CPP最大的意义
Audio CPP最大的意义
10:51.384–10:53.404
zh不是又多了一个声音客户工具
不是又多了一个声音客户工具
10:53.404–10:55.004
zh而是本地语音模型
而是本地语音模型
10:55.004–10:57.264
zh开始变成一套统一的系统
开始变成一套统一的系统
10:57.264–10:58.804
zh大语言模型有Lama CPP
大语言模型有Lama CPP
10:58.804–11:00.864
zh图片视频生成有Conf UI
图片视频生成有Conf UI
11:00.864–11:02.964
zh语音模型现在也开始有了
语音模型现在也开始有了
11:02.964–11:04.324
zh自己的本地运行中心
自己的本地运行中心
11:04.324–11:05.904
zh对于普通用户来说
对于普通用户来说
11:05.904–11:07.164
zh使用门槛更低了
使用门槛更低了
11:07.164–11:08.424
zh对开发者来说
对开发者来说
11:08.424–11:10.224
zh本地语音服务接入更容易
本地语音服务接入更容易
11:10.224–11:12.604
zh这也是我这期最想讲清楚的地方
这也是我这期最想讲清楚的地方
11:12.604–11:14.644
zh本期视频用到的所有链接
本期视频用到的所有链接
11:14.644–11:16.124
zh我都放在评论区置顶
我都放在评论区置顶
11:16.124–11:17.784
zh这里是AI探索已发现
这里是AI探索已发现
11:17.784–11:18.624
zh感谢观看
感谢观看
11:18.624–11:19.204
zh下期见
下期见

影片筆記:本地语音 AI 终于统一了! 实时对话、声音克隆、AI 翻唱8G 显存全跑通|audio.cpp|整合包

一句話總結

影片介紹了一款名為 Audio CPP 的本地 AI 音頻整合工具,旨在解決本地部署多個音頻模型時環境配置複雜的問題。該工具將 TTS、ASR、音樂生成等功能統一在同一底層架構中,提供帶 Web UI 的整合包,支持在低顯存(如 8GB)設備甚至 CPU 上運行,並演示了實時語音對話、聲音克隆、換詞翻唱等功能。

核心重點

  • 統一底座與易用性:Audio CPP 將分散的音頻能力(TTS、ASR、音樂生成、聲音轉換)整合至同一後台,類似於大語言模型領域的 Ollama 或圖片生成的 ComfyUI。提供帶 Web UI 的整合包,解壓即用,降低部署門檻。
  • 硬體兼容性與性能
  • 支持 Windows 16-50 系列 N 卡,A 卡及無獨顯設備可走 CPU 模式。
  • 核心功能可在 8GB 顯存筆記本上運行,部分小模型無需顯卡。
  • 官方宣稱在 RTX 5090 上運行速度比原生框架快 1-3 倍;實測在 RTX 4060 上,合成效率提升顯著(約 4 倍)。
  • 核心功能演示
  • TTS(文本轉語音):支持聲音克隆(需參考音頻),推薦 Pocket TTS(不支持中文)和千問 3 TTS 0.6B(支持中文)。
  • ASR(語音轉文字):支持中英文轉寫、對話模式識別及歌詞識別。
  • 實時語音系統:結合本地 ASR、大語言模型(可接 Ollama 或 API)和本地 TTS,實現低延遲、隱私安全的本地語音交互。
  • 音樂與聲音轉換:支持換詞翻唱(ACE STEP)、背景音樂生成(Stable Audio)、音色遷移(聲音轉換)及基於文字描述的「聲音設計」。

詳細大綱

I. Audio CPP 介紹與定位

  • 定義:本地 AI 音頻工具,被比喻為「音樂領域的 Nama CPP」(疑點:應指 Ollama 或類似工具)。
  • 解決痛點
  • 過去本地部署音頻模型需單獨配置環境、依賴庫,導致「環境把人勸退」。
  • Audio CPP 將 TTS、ASR、音樂生成、聲音轉換統一至同一後台。
  • 通過界面隨時切換模型,簡化本地運行各種語音模型的流程。

II. 性能與兼容性

  • 硬件要求
  • 核心功能可在 8GB 顯存筆記本上運行。
  • 部分小模型無需顯卡,可使用 CPU 運行。
  • 速度對比
  • 官方數據:在 RTX 5090 上,Audio CPP 運行效率比原生推理框架快 1-3 倍,部分模型快 8-10 倍。
  • 實測數據(RTX 4060):
  • 使用微軟開源模型(疑點:Vive Voice)合成 1 萬字小說朗讀。
  • 官方程序耗時 110 分鐘。
  • Audio CPP 耗時 29 分鐘(約為原來的 1/4)。

III. 核心功能詳解

1. TTS(文本轉語音)

  • 基本操作:選擇模型 -> 加載 -> 選擇參考音頻(用於聲音克隆) -> 輸入文本 -> 生成。
  • 推薦模型
  • Pocket TTS:支持參考音頻,聲音克隆秒級生成,但不支持中文
  • 千問 3 TTS 0.6B:參數小,效果不錯,支持中文。
  • 低配友好:上述模型顯存佔用小,適合低配顯卡或無獨顯機器。
  • 特色模型
  • Vox CPM2:支持方言生成與克隆(如國內大部分方言),可克隆語氣。
  • Voic Voice(疑點:前文提及 Vive Voice,此處名稱不一致):實測近萬字小說合成,顯存佔用未超 7G,無明顯漏讀錯讀。
  • 使用技巧
  • 參考音頻建議控制在 10 秒以內,避免拖慢速度。
  • 常用參考音頻可放入 WebUI 下的 Voice 目錄,並通過文件映射直接選擇。
  • 可通過 ASR 標籤將音頻轉寫為文本,避免手動輸入參考音頻對應文本。

2. ASR(語音轉文字)

  • 推薦模型:千問 3 ASR(支持中英文,速度快)。
  • 功能特點
  • 對話模式:支持多人對話識別,輸出帶說話人序列文本(有長度限制,適合短片段)。
  • 單人轉寫:無長度限制。
  • 歌詞識別:可用於 AI 翻唱前的初步識別與手動校對。
  • 實測數據:2 分多鐘音頻轉錄僅用 21 秒。

3. 本地實時語音系統

  • 架構流程:麥克風輸入 -> ASR 轉文本 -> 大語言模型生成回答 -> TTS 朗讀。
  • 優勢
  • 響應速度快(延遲約 1 秒)。
  • 數據安全,注重隱私。
  • 支持實時打斷、聯網搜索、視覺理解(疑點:需確認模型是否原生支持視覺)。
  • 靈活性
  • 語音層(聽與說)本地化。
  • 大語言模型層可接本地 Ollama 或訂閱的 API。
  • 使用 OpenAI 兼容接口,可被其他應用(如 OpenMagic AI)調用。

4. 音樂生成與聲音轉換

  • 換詞翻唱
  • 使用模型:ACE STEP(前文提及在本地 8G 顯存跑不動,現可本地運行)。
  • 流程:上傳歌曲 -> 分析(幾十秒至幾分鐘) -> 設置參數(Remix 模式,自動填好曲風/曲譜) -> 輸入新歌詞 -> 生成。
  • 調試:若音質不好增加「生存部署」(疑點:應為推理步數或類似參數);若新詞唱不准調試 Flowedit 參數(0.7-0.9)。
  • 背景音樂生成:推薦使用 Stable Audio,比 ACE Stable 更穩定。
  • 聲音轉換(音色遷移)
  • 保持內容與語氣不變,僅更換音色。
  • 實測建議追求高質量時,仍推薦使用之前的 RVC 流程,並建議先做人聲分離。
  • 聲音設計
  • 類似聲音克隆,但無需參考音頻。
  • 通過文字描述生成聲音(如「磁性的中年男生,語速偏慢」)。
  • 適用於臨時配音。

IV. 整合包與使用指南

  • 技術背景:Audio CPP 本身為 C++ 項目,官方主要支持命令行,對無技術基礎用戶有門檻。
  • 整合包特性
  • 帶 Web UI 界面,解壓即用。
  • 支持 Windows 16-50 系列 N 卡。
  • A 卡及無獨顯機器自動走 CPU 模式(速度較慢,但可運行輕量模型)。
  • 啟動流程
  1. 運行 Run Web UI 啟動網頁界面,下載所需模型。
  2. 若需實時語音,先在 Web UI 加載模型,再啟動 ASR 服務。
  3. 運行 Run Real Time
  4. 配置中修改接入的大模型 API Key(如 Deep Seek)。
  • 資源分享:源代碼已開源至 GitHub,整合包及鏈接見評論區。

工具 / 模型 / 名詞整理

  • Audio CPP:本影片介紹的核心本地 AI 音頻工具。
  • Nama CPP:逐字稿提及,疑點,可能指代 Ollama 或類似本地模型運行框架。
  • Ollama:用於本地運行大語言模型的工具。
  • Comfy UI:逐字稿提及,用於圖片視頻生成的本地運行中心。
  • OpenAI:提及兼容接口標準。
  • GPT Live:逐字稿提及 OpenAI 發布的全雙工語音系統。
  • Pocket TTS:推薦的 TTS 模型,支持聲音克隆,不支持中文。
  • 千問 3 TTS 0.6B:推薦的 TTS 模型,支持中文,參數小。
  • Vox CPM2:支持方言生成與克隆的 TTS 模型。
  • Vive Voice:實測中使用的微軟開源模型。
  • Voic Voice:逐字稿後段提及的模型名稱,與前文 Vive Voice 可能為同一模型或聽寫錯誤。
  • 千問 3 ASR:推薦的語音轉文字模型。
  • OpenMagic AI:用於測試調用 Audio CPP TTS 服務的應用。
  • ACE STEP:用於換詞翻唱的音樂生成模型。
  • Club:逐字稿提及,疑點,可能指雲端平台名稱。
  • Stable Audio:推薦用於生成背景音樂的模型。
  • ACE Stable:逐字稿提及,疑點,可能指代 ACE STEP 或 Stable Audio 的某種變體。
  • RVC:推薦用於高質量聲音轉換(音色遷移)的流程/工具。
  • Deep Seek:提及的大語言模型 API 提供商。
  • GitHub:源代碼開源平台。

操作流程整理

1. TTS 聲音克隆流程

  1. 在 Web UI 中選擇 TTS 模型(如 Pocket TTS 或千問 3 TTS)。
  2. 加載模型。
  3. 選擇參考音頻(建議 10 秒以內)。
  • *技巧*:可將常用參考音頻放入 WebUI 下的 Voice 目錄,通過文件映射直接選擇。
  • *技巧*:可通過 ASR 標籤將參考音頻轉寫為文本,避免手動輸入。
  1. 輸入目標文本。
  2. 點擊生成。

2. 本地實時語音系統搭建流程

  1. 運行 Run Web UI 啟動網頁界面,下載所需模型。
  2. 在 Web UI 中加載 ASR 模型(如千問 3 ASR)和 TTS 模型。
  3. 啟動 ASR 服務。
  4. 運行 Run Real Time
  5. 在配置中修改接入的大語言模型 API Key(如 Deep Seek 或本地 Ollama)。
  6. 通過麥克風輸入語音,系統將執行:ASR 轉文本 -> LLM 生成回答 -> TTS 朗讀。

3. 換詞翻唱流程 (ACE STEP)

  1. 上傳歌曲。
  2. 等待分析(幾十秒至幾分鐘)。
  3. 設置參數(Remix 模式,自動填好曲風/曲譜)。
  4. 輸入新歌詞。
  5. 點擊生成。
  • *調試*:若音質不好,增加「生存部署」(疑點:應為推理步數);若新詞唱不准,調試 Flowedit 參數(0.7-0.9)。

值得注意的限制或風險

  • 硬體限制:雖然支持低顯存設備,但部分功能(如高質量聲音轉換)仍建議使用 RVC 流程並先做人聲分離。CPU 模式下運行速度較慢。
  • 模型兼容性:不同模型對顯存佔用不同,需根據硬體選擇合適模型(如 Pocket TTS 和千問 3 TTS 適合低配)。
  • 功能確認:實時語音系統是否原生支持「視覺理解」需進一步確認。
  • 名稱一致性:部分模型名稱在逐字稿中存在不一致(如 Vive Voice 與 Voic Voice),可能影響準確查找。

逐字稿辨識疑點

  • Nama CPP:逐字稿稱 Audio CPP 是「音樂領域的 Nama CPP」。根據上下文推測應為 Ollama(大語言模型本地運行框架)或 ComfyUI 的聽寫錯誤,但逐字稿原文為 Nama CPP,故標記為疑點。
  • Vive Voice vs Voic Voice:前文實測速度對比時稱為「微軟開源的 Vive Voice」,後文介紹特色模型時稱為「Voic Voice」。兩者可能為同一模型,但名稱不一致,需查證。
  • GPT Live:逐字稿提及「OpenAI launched GPT Live, A full duplex voice system for chat GPT」。需確認此為官方正式名稱還是口誤。
  • 生存部署:在調試翻唱參數時,逐字稿提到「增加生存部署」。根據語境推測應為「推理步數」(Inference Steps)或類似參數的聽寫錯誤。
  • Club:逐字稿提到「最後是在 Club 上演示的」。此處指代不明,可能是某個雲端平台或社區的名稱,需查證。
  • ACE Stable:逐字稿推薦背景音樂生成時提到「比 ACE Stable 更穩」。此名稱與前文提到的 ACE STEP 不同,且 Stable Audio 已單獨提及,ACE Stable 可能是聽寫錯誤或特定模型變體,需查證。
  • 實時語音系統功能:逐字稿提到實時語音系統支持「視覺理解」。需確認該本地語音系統架構是否原生支持視覺輸入,或僅為口誤。

可延伸追問

  • Audio CPP 的源代碼和整合包具體下載鏈接為何?
  • 「Nama CPP」是否為特定社區或工具的暱稱?
  • 如何準確區分 Vive Voice 和 Voic Voice 這兩個模型名稱?
  • 實時語音系統中的「視覺理解」具體指什麼功能?
  • 「生存部署」具體對應哪個參數設置?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習