这个本地AI工具有点离谱 它能实时语音对话 哈喽 你能帮我做什么 你好 我可以帮你回答问题 提供信息 安排日程 还能声音克隆 大家好呀 要站在光里 不要光站在那里 不仅能声称AI音乐 还能换词翻唱 这一整套服务 全都跑在这台8G显存的笔记本上 不用云端语音平台 不需要联网语音服务 这个工具叫Audio CPP 你可以把它理解成音乐领域的Nama CPP 它想解决的不是某一个语音功能 而是把本地音频模型 统一到同一套云形方式里 以前我们想在本地部署语音模型 经常是一个模型一套环境 我自己这台机器上 就装过声音克龙 谈文本合成 AI翻唱 实施语音好几套环境 每一套都有不同的配声版本 不同的库大依赖 最后不是模型跑不动 是环境先把人劝退了 Audio CPP解决的就是这个问题 它把TTS,ASR,音乐生存,声音转换 都接近同一个后台 通过界面可以随时切换模型 就像你用Olama在本地跑大语音模型一样 Audio CPP能让你更简单的在本地跑各种语音模型 我这次演示的大部分核心功能 8G显存就能跑起来 有些小模型甚至不需要显卡 用CPU也能运行 它现在已经接入的模型家族 有21个可以直接下载使用 还有一批在测试当中 统一底座带来的另一个直接好处是 运行效率更高 这是官方在RTX5090上的速度对比 大部分模型在AudioCPP下运行 比他们用自己的推理框架快了1-3倍 有的甚至快了8-10倍 我也在本地用RTX4060做了测试 拿微软开源的Vive Voice对比 用官方自己的程序 合成1万字的小说朗读 耗时110分钟 而同样的文本 拿到AudioCPP下合成 仅用了29分钟 只有原来的四分之一 除了速度 这期还有我最想让你看的 它把一堆分散的语音能力 变成一套本地系统 前面那个实时语音系统 等会我会完整演示 后面还有一个更好玩的音乐生成能力 歌曲旋律不变 直接换词翻唱 最后过一遍声音转换 设计等扩展功能 以及整合包的下载和使用 先看TTS 也就是文本转语音 这里列的模型 整合包里自带了Pocket TTS和Chemun3 TTS 0.6B 它们都支持参考音频 也就意味着可以做声音克隆 基本用法非常简单 选择模型 点击加载 加载完会有提示 然后选一段参考音频 再输入合成文本 点击生成 这种一句话的声音克隆 基本上是秒生成 OpenAI launched GPT Live A full duplex voice system for chat GPT 不过要注意 Pocket TTS不支持中文 要生成中文语音 可以换成千问3 TTS 0.6B 它的参数虽然不大 但合成效果相当不错 全双功语音系统 支持实时打断联网搜索和视觉理解 这两款模型显存占用都很小 非常适合低配显卡 以及没有独显的机器 刚上手 合成设置里的参数都可以不用管 保持默认 先把模型跑起来 听一下技术效果 熟悉之后再去调温度 采样这些参数 列表里还有两个模型比较有特点 一个是Vox CPM2 它好玩的地方是能生成方言 给一段方言参考音频 我们每个人都在做小丑 就可以合成相应的方言语音 错了你又不认 认了你又不改 它支持国内大部分方言 还能克隆语气 想深入了解这个模型的能力 可以翻译一下我之前专门做的Vox CPM那期视频 另一个有特点的是Voic Voice 就是开头速度对比的那个模型 那段近一万字的小说 合成期间显存占用没超过7G 生存出来的音频我全程听了一遍 没有明显的漏读和错读 忽然山腰里传来群马奔驰之声 提声越来越响 不久四面黄布大旗从山崖边升起 这里有个注意点 不管你用哪款模型 参考音频都不要太长 建议控制在10秒以内 否则会明显拖慢合成速度 另外还有个小技巧 如果有些参考音频你经常用 可以把它们放到WebUI下的Voice目标里 然后把文件名和对应的文本写到这个文件里 刷新列表就可以直接选了 临时上传的参考音频 下面对应的文本也不用手动输入 可以先到ASR标签里 把音频内容转写出来 这就引出了AudioCPP第二个核心能力 ASR语音转文字 我个人常用的模型是千问3ASR 等会要演示的实时语音 我的声音转文本用的就是它 中英文都支持 速度也很快 这段音频两分多钟 转录只用了21秒 如果转录的是多人对话 要勾选对话模式 转出来的就是这种带说话人序列的文本 不过对话模式有长度限制 目前更适合较短的对话片段 单人语音转写没有长度限制 歌词也能识别 等下做AI翻唱要拿原曲歌词 就可以先到这里做一遍初步识别 再手动校对 有了TTS和ASR 现在我们可以把它们拼起来用 这是我认为Audio CPP最有价值的地方 本地实时语音系统 我正在测试一个实时语音系统 好的 我正在实时语音系统里和你对话 如果你想测试它的稳定性 延迟或其他功能 请随时提问或下达指令 语音识别和合成都是跑在本地的 明白了 本地运行意味着响应速度更快 同时数据也更安全 这是一个很注重隐私和效率的设计思路 大语言模型是云端 你觉得这个架构是否合理 这个架构是合理的 从我说完话 到它开始回答 中间大概一秒 如果是一问对话 这个颜色会更低 What can you do for me I can answer questions Summarize information 整个流程就是 麦克风输入 ASR转文本 大语言模型声称回答 TTS再把它朗读出来 这就是一个 本地语音交互系统的 基本形态 设置里 大语言模型这一步是活的 本地化的是语音这一层 你可以接本地 欧拉玛跑到语言模型 也可以接自己订阅的API Audio CPP负责的是音频这一层 听和说 所以我说它不是一个声音克隆玩具 而是消费级显卡上的 本地AI语音底座 而且它用的是OpenAI兼容接口 你本地的其他应用 只要支持这种接口形式 就能直接调用服务 就像设置里这样写 TTS的地址 模型名称 ASR的地址 模型名称 朗读的声音也可以自定义 比如我在这个OpenMagic AI应用里 直接调用AudioCPP的TTS服务 填写UIL 还有模型名称 由于这个应用没法填参考音频 所以我后台单独起一个AudioCPP服务 启动时带上参考音频 回到OpenMagic测试 你好 这是一段测试语音 能正确返回语音 这样就接好了 这就是一个完全免费的本地TTS服务 如果你在做本地Agent 或者想给自己的应用 加上语音输入输出 AudioCPP提供的接口就非常有用 接下来我们看音乐生成 这部分也是我觉得AudioCPP很强的地方 它不只是把TTS和ASR放到一起 连音乐生成换词翻唱 这些原本比较重的模型 也开始接近同一个底座里 这个ACE STEP我之前介绍过 当时我在本地8G显存上跑不动翻唱 最后是在Club上演示的 现在用AudioCPP 本地就能跑起来 翻唱可以按下面步骤操作 先上传要翻唱的歌曲 然后点分析 这个过程要等几十秒到几分钟 具体看歌曲长度 分析完成后 合成翻唱的时长改成-1 点开高级参数 操作类型选Remix 歌曲风格 曲谱信息 分析完以后就会自动填好 不用动 你只需要填上圆曲歌词 提示词直接复制上面的圆曲描述 最后填上你的翻唱歌词 可以看一下显存占用 虽然看上去超过8G 但不会爆显存 最后能顺利跑完 换词翻唱的随机性比较大 需要多试几次 如果音质不好 可以适当增加生存部署 要是新词唱不准或者唱不出来 可以调这个Flowedit参数 从0.7到0.9去尝试 如果你只想生成背景音乐 我推荐用Stable Audio 比ACE Stable更稳 声音转换相当于音色迁移 保持说话内容不变 语气不变 只把音色换掉 马匪 任何时候都要搅 不搅不行 马匪 任何时候都要搅 不搅不行 歌声转换也是类似逻辑 但我实测 如果你追求追踪质量 我更推荐之前那套RVC流程 做歌声转换之前 最好先做人声分离 音频分离标签下 就有相应的模型 再往下是音频分析这一组 它们都是工具类模型 比如这个是实时语音检测 下面这个是多人对话识别 最后一个是声音设计 这个挺有意思 它其实类似声音克隆 只是不需要参考音频 你直接用文字描述一个声音 比如磁性的中年男生 语速偏慢 波音枪 模型就会按描述生成 这个功能做临时配音比较好用 最后说一下整合包 Audio CPP本身是个C++项目 官方目前主要靠命令行来使用 对有经验的朋友来说问题不大 但对没技术基础的 这一步确实比较劝退 所以我做了带界面的整合包 解压就能用 支持16-50系列的N卡 目前A卡以及没有独显的机器 会自动走CPU模式 速度会慢一些 但跑几个轻量模型没问题 整合包里 Run Web UI是启动网页界面 想用哪个模型 界面里就能直接下载 想体验实时语音 先在Web UI里加载模型 再启动这个ASR服务 最后运行Run Real Time 配置里把接入的大模型改一下 如果你也用Deep Seek API Key换成自己的就可以了 这一整套原代码我已经开完了 这是GitHub地址 使用中如果遇到问题 或者希望增加功能 可以在评论区告诉我 我会收集整理定期更新版本 总结一下 Audio CPP最大的意义 不是又多了一个声音客户工具 而是本地语音模型 开始变成一套统一的系统 大语言模型有Lama CPP 图片视频生成有Conf UI 语音模型现在也开始有了 自己的本地运行中心 对于普通用户来说 使用门槛更低了 对开发者来说 本地语音服务接入更容易 这也是我这期最想讲清楚的地方 本期视频用到的所有链接 我都放在评论区置顶 这里是AI探索已发现 感谢观看 下期见