20260716-04 | 开源语音天花板 MOSS-TTS 1.5,太强却部署劝退?官方入场了。。。
來源:Youtube | 建立:2026-07-16T08:22:46 | HTML:2026-07-16T08:24:01
開啟原始影片 note.md transcript.txt transcript.vtt

影片筆記:开源语音天花板 MOSS-TTS 1.5,太强却部署劝退?官方入场了。。。

YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。

一句話總結

OpenMOSS 團隊開源了具備高保真與零樣本語音克隆能力的 MOSS-TTS 1.5 模型,並針對本地部署顯存不足的痛點,推出了瀏覽器端的一站式 AI 創作平台 MossLand,提供從語音合成、影片配音、數字人到多模型生成的完整工作流。

核心重點

詳細大綱

1. MOSS-TTS 1.5 模型介紹

2. MossLand 平台解決方案

3. 核心功能演示

工具 / 模型 / 名詞整理

操作流程整理

進入 MossLand 平台:通過瀏覽器訪問平台。

語音合成操作

影片配音流程

播客製作流程

數字人生成流程

影片與圖片生成流程

後期處理

開發者接入

值得注意的限制或風險

逐字稿辨識疑點

可延伸追問

逐字稿時間軸

右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。

00:00:00.166 → 00:00:03.200
前段时间我分享过开源的 MOSS-TTS 1.5
00:00:03.200 → 00:00:04.300
它的配音效果
00:00:04.300 → 00:00:06.466
足以比肩主流的闭源模型
00:00:06.466 → 00:00:08.033
先来听听这段效果
00:00:08.400 → 00:00:11.366
配一佐咸鲜的火腿同炖
00:00:11.600 → 00:00:13.400
汤色渐渐乳白
00:00:13.500 → 00:00:16.400
鲜味丝丝缕缕漫上舌尖
00:00:17.000 → 00:00:21.100
这是春天最温柔的一封回信
00:00:22.666 → 00:00:23.933
MOSS-TTS 是 OpenMOSS
00:00:23.933 → 00:00:26.800
团队开源的一个语音模型家族
00:00:26.800 → 00:00:28.500
支持零样本语音克隆
00:00:28.500 → 00:00:30.833
实时语音和 31 种语言
00:00:30.966 → 00:00:32.800
对话模型在主观评测中
00:00:32.800 → 00:00:35.266
甚至打赢了豆包和 Gemini 2.5 Pro
00:00:35.600 → 00:00:37.466
它的核心能力是高保真
00:00:37.466 → 00:00:39.700
最优性能的零样本语音克隆
00:00:39.800 → 00:00:42.166
支持长文本和长语音生成
00:00:42.166 → 00:00:45.466
支持拼音音标与时长精细控制
00:00:45.466 → 00:00:47.766
支持随时插入停顿等等
00:00:48.133 → 00:00:50.266
但很多人和我一样卡在同一个地方
00:00:51.200 → 00:00:53.000
本地根本跑不起来
00:00:53.000 → 00:00:54.400
今天官方下场
00:00:54.400 → 00:00:56.033
这个问题得到了解决
00:00:56.600 → 00:01:00.500
I'm always looking for one voice
00:01:01.566 → 00:01:04.800
Finally that voice came into the picture
00:01:05.533 → 00:01:09.200
With a thousand voices I have a thousand stories
00:01:10.800 → 00:01:13.666
MossLand 是一个以语音为核心的
00:01:13.666 → 00:01:14.766
一站式 AI 创作平台
00:01:14.766 → 00:01:17.800
最关键的是它已经接入了 MOSS-TTS 1.5
00:01:18.466 → 00:01:20.900
那个你在本地跑不动的顶级模型
00:01:20.900 → 00:01:23.233
现在打开浏览器就能直接用
00:01:23.300 → 00:01:25.500
而且它远不止一个 TTS 那么简单
00:01:25.966 → 00:01:28.233
我带你把它的核心功能过一遍
00:01:29.066 → 00:01:31.666
它基本把声音这件事的上下游
00:01:31.666 → 00:01:34.766
全包了 先看压箱底的语音合成
00:01:34.766 → 00:01:37.733
这也是整个平台效果最能打的地方
00:01:38.666 → 00:01:39.900
选一个音色 点
00:01:39.900 → 00:01:41.400
生成 一段自然
00:01:41.400 → 00:01:43.533
到不像 AI 的语音就出来了
00:01:43.533 → 00:01:45.200
它支持单人合成
00:01:45.200 → 00:01:47.600
比如这样 而在贝茜看来
00:01:47.600 → 00:01:49.400
铁证如山的事实面前
00:01:50.366 → 00:01:51.966
大卫·戈尔就是真凶
00:01:52.466 → 00:01:53.966
也支持多人对话合成
00:01:56.466 → 00:01:57.766
各位正在通勤
00:01:59.700 → 00:02:02.066
或者刚刚睁开眼睛的朋友们
00:02:02.200 → 00:02:03.966
这里是早安 101
00:02:06.500 → 00:02:08.666
今天又是充满可能性的一天
00:02:08.666 → 00:02:09.733
希望我们的声音
00:02:09.733 → 00:02:11.533
能陪你开启一个好心情
00:02:11.533 → 00:02:13.533
不知道你现在是在地铁上
00:02:14.866 → 00:02:17.500
还是一边喝咖啡一边收听节目呢
00:02:17.666 → 00:02:19.266
音色库里没有你要的音色
00:02:20.466 → 00:02:22.066
你可以上传一段音频
00:02:22.066 → 00:02:24.166
复刻出高度相似的音色
00:02:24.166 → 00:02:25.400
你也可以什么都不传
00:02:25.400 → 00:02:26.800
直接用一句话描述
00:02:26.800 → 00:02:30.266
比如低沉慵懒带点烟嗓的男声
00:02:30.500 → 00:02:32.666
让它给你生成对应的音色
00:02:32.700 → 00:02:34.500
造好的音色最后都能存进
00:02:34.500 → 00:02:35.833
你自己的音色库
00:02:36.066 → 00:02:39.133
再往上是一整套开箱即用的 AI 应用
00:02:39.133 → 00:02:41.133
包括视频配音 播客
00:02:42.400 → 00:02:44.766
比如这段视频 拿钱
00:02:48.066 → 00:02:49.766
还是继续竞选
00:02:51.900 → 00:02:53.400
里面有一个词说错了
00:02:53.400 → 00:02:55.700
现在只需要上传这段视频
00:02:55.700 → 00:02:57.066
等它识别出文字
00:02:57.066 → 00:02:58.733
把错误的地方一改
00:02:58.733 → 00:03:00.266
就能一键修正
00:03:00.600 → 00:03:02.733
模型会按照原视频的语气
00:03:02.733 → 00:03:04.100
情绪重新配音
00:03:04.100 → 00:03:06.166
效果是这样的
00:03:06.800 → 00:03:08.300
做我的女朋友
00:03:09.500 → 00:03:11.166
还是继续竞选
00:03:14.000 → 00:03:16.366
你还能给视频换上全新的音色
00:03:16.366 → 00:03:19.900
拿钱 做我的朋友
00:03:20.666 → 00:03:22.166
还是继续竞选
00:03:25.766 → 00:03:27.600
它能一键把中文视频
00:03:27.600 → 00:03:29.733
转成其他语言的配音版本
00:03:29.733 → 00:03:32.066
Take the cash, be my friend
00:03:33.966 → 00:03:36.833
Or keep running. Choose one.
00:03:39.200 → 00:03:40.733
你可以输入一个主题
00:03:40.733 → 00:03:42.166
它先帮你生成文案
00:03:42.166 → 00:03:44.966
你确认后一键生成配音 配乐
00:03:46.166 → 00:03:48.066
出来的就是能直接发布的成品
00:03:48.066 → 00:03:51.066
在数字人方面支持形象和动作控制
00:03:51.066 → 00:03:52.866
最高 1080P 规格
00:03:53.700 → 00:03:55.900
工具集里还提供了丰富的
00:03:55.900 → 00:03:58.066
一站式工具 一键添加字幕
00:04:00.100 → 00:04:02.400
以及视频图片格式转换等等
00:04:02.400 → 00:04:04.666
是的 它还支持图片和视频生成
00:04:04.666 → 00:04:06.200
接入了可灵 Seedance
00:04:06.200 → 00:04:07.966
即梦这些主流模型
00:04:08.066 → 00:04:09.933
我随手用它生成的几段视频
00:04:09.933 → 00:04:11.000
简单拼了一下
00:04:11.000 → 00:04:12.500
得到一个 30 秒的片子
00:04:12.500 → 00:04:14.000
大家直接看效果
00:04:19.266 → 00:04:21.433
你心里根本没有这个家
00:04:22.300 → 00:04:25.500
检测到行为异常 分析中
00:04:43.733 → 00:04:45.233
你自己也吃啊
00:04:52.400 → 00:04:54.900
最后所有这些能力它都开放了 API
00:04:54.900 → 00:04:56.166
想接入自己工作流的
00:04:56.166 → 00:04:58.400
开发者也能直接调用
00:04:59.166 → 00:05:01.000
以上就是今天视频的全部内容
00:05:01.000 → 00:05:02.266
欢迎关注订阅
00:05:03.366 → 00:05:05.033
咱们下个视频见