大家好,今天咱们聊一个实用工具,它叫AudioCPP 传统的本地语音模型环境,配置起来很麻烦 庞大的音频库,复杂的Conda,还有Python,E-Lite这些痛点 是不是很熟悉,就像Alama简化了大语言模型一样 AudioCPC解决了音频AI的部署难题 它是纯C++实现的原生二进制程序 开箱挤用非常轻量,APU版本仅8兆大小 他支持TTS声音克隆 Hello, this is audio.cpp speaking from a webpage 支持ASR语音转文字 支持批量合成语音 还有实时语音功能 我可以帮你回答问题 翻译语言,撰写文本 以及提供创意建议 并且自带命令行CLI和网页界面Web UI 咱们先看命令行工具 也就是CLI功能 举个例子 输入AudioCppClare后面跟多个参数 Task TTS表示任务是声音克隆 Family Pocket TTS指定模型为Pocket TTS Model后面写模型文件路径 Backend CPU表示用CPU推理 能使用GPU推理就写Cuda Text是你要合成的文字内容 Voice ID是参考音色文件 Out指定输出音频的位置 现在我们来实际操作一下 打开AudioX CPT文件夹 在地址栏里输入CMD回车 这样就打开了命令提示符 复制准备好的命令行 粘贴进去按回车 模型开始生成音频 请稍等 生成完毕 我们打开out文件夹 双击这个音频文件听一下 效果还不错 对吧 再看第二个例子 基本参数和前面一样 这次使用的模型是 QuantTTS Voice Reef是参考音频的位置 Reference Text是对应的参考文本 复制这条命令切换到命令行窗口 拦贴回车 等待模型生成音频文件 好,打开Out文件夹 双击播放,听一下 你好,Audio CPP正在Windows CPU上运行 效果依然很棒 说完了Cli,咱们看看Web UI 有了命令行基础 网页操作就更简单了 首先,在模型列表里选择Pocket TTS 点击加载模型 然后选择一个参考音色文件 点击播放视听 在语音列表里选择英文 点击生成语音等待模型处理 生成完成 我们点击播放 听一下效果不错吧 点击向下的小箭头 可以下载音频文件 接着测试Q1-3TT-S模型 在模型列表里选择它 这次选一个中文参考音色 点击播放 以前我对这句话一致半解 现在好像有点懂了 因为你我开始留意很多 以前不曾关心的事 开始对这个世界有了更多的好奇和善意 在合成文本输入框里 填入你想说的话 语音列表里记得选中文 别忘记点击加载模型 然后点击生成语音 好 生成完成 点击播放听一下效果 千万3TTS覆盖十种主要语言中文英语 日语 韩语 德语 法语 俄语 葡萄牙语 西班牙语和意大利语 并提供多种方言语音配置 以满足全球应用需求 声音很自然 值得注意的是合成的文本不宜过长 不要超过100个字 生成语音速度会很慢 而且文本越长 合成音频的质量越差 如果有长文本需要处理怎么办 Audio CPP支持Batch P处理 我们来看一个P处理的例子 基本参数和前面一样 Batch Text File表示按行P处理 把文本拆分成多行 每行作为一段独立合成 Batch Merge Audio Concrete 会自动将合成好的小段音频 合成为同一个完整文件 看看合成文本的内容 每一行是一个句子 布置这条命令 切换到命令型窗口 粘贴回车 等待模型生成音频文件 好,打开AUT文件夹,双击播放,听一下 好,咱们快速回顾一下 Audio CPP让本地语音AI部署变得非常简单 CLI和Web UI都支持 涵盖TTS特隆ASR转写音乐生成和实时对话 提供了统一的语音服务接口 安装也只需要下载模型文件即可 感兴趣的话,快去试试吧 效果不错 接下来是语音转写功能 也就是ASR 语音转文字 在模型列表里选择Qin3ASR模型 点击加载 上传一段音频文件 点击播放预览 我们浏览手机端页面 GLM5.2不具备视觉图像输入能力 它不能给网页添加图片 然后点击开始转写 模型开始处理 稍等一会儿 转写结果出现在文本框里 正确率非常高 再看音乐生成选项卡 玩法和其他语音模型类似 选择模型加载模型 如果模型没安装 点击下载即可 上传参考音频 输入提示词 最后点击生成音乐 这里我不做演示了 感兴趣的话可以自行尝试 Audio CPP可以作为服务提供方 共第三方应用调用 下面聊实时语音 它的工作原理是这样的 麦克风输入声音 ASR模型转成文字 文字交给大语言模型处理 处理结果再通过TTS模型合成语音输出 实时语音比较消耗资源 因为后台同时加载了TTS和ASR两个模型 要使用这个功能 先双击RunWebBit开启WebUI服务 然后加载一个TTS模型 接着双击ASRBit加载ASR模型 最后双击RealtelBit打开实时语音页面 在设置里你可以配置LLM的接口地址 模型名称和API Key 点击对话 说一声你好 就可以看到实时交互效果了 你好 请问有什么 我可以帮你了吗 我可以帮你回答问题 翻译语言 撰写文本 以及提供创意建议 最后咱们说说怎么安装Audio CPP 打开它的GitHub页面 点击Releases 下载CPU版本的压缩包 解压后里面没有音频模型 我们需要自己创建一个Models玩件夹 用来存放所有模型文件 先安装Pocket TTS 打开Hugging Face上的模型页面 它只有1亿参数 非常轻量 不用GPU也能流畅运行 下载英文相关的模型文件 分磁器和参考音色 在Models下 创建Pocket TS文件夹 把文件放进去 再安装QVN3 TTS 打开摩塔社区 搜索QVN3 TTS 点击下载模型 推荐用GitLFS工具来下载 它是管理大文件的扩展 复制GitClone地址 在模型文件夹里打开CMD 粘贴并回车 如果已经下载过 会提示已存在 你也可以从Hugging Face的科问仓库下载 对于不想折腾的小伙伴 官方也提供了整合包 包含CPU、GPU和Web UI版本 常用音频模型都集成好了 直接用CPU就能跑 好,咱们快速回顾一下 Audio CPP让本地语音AI部署变得非常简单 CLI和Web UI都支持涵盖TTS、特隆、ASR转写音乐生成和实时对话 提供了统一的语音服务接口 安装也只需要下载模型文件即可 感兴趣的话快去试试吧 感谢观看 我们下期再见