WEBVTT
Kind: captions
Language: zh-Hans

00:00:00.166 --> 00:00:03.200
前段时间我分享过开源的 MOSS-TTS 1.5

00:00:03.200 --> 00:00:04.300
它的配音效果

00:00:04.300 --> 00:00:06.466
足以比肩主流的闭源模型

00:00:06.466 --> 00:00:08.033
先来听听这段效果

00:00:08.400 --> 00:00:11.366
配一佐咸鲜的火腿同炖

00:00:11.600 --> 00:00:13.400
汤色渐渐乳白

00:00:13.500 --> 00:00:16.400
鲜味丝丝缕缕漫上舌尖

00:00:17.000 --> 00:00:21.100
这是春天最温柔的一封回信

00:00:22.666 --> 00:00:23.933
MOSS-TTS 是 OpenMOSS

00:00:23.933 --> 00:00:26.800
团队开源的一个语音模型家族

00:00:26.800 --> 00:00:28.500
支持零样本语音克隆

00:00:28.500 --> 00:00:30.833
实时语音和 31 种语言

00:00:30.966 --> 00:00:32.800
对话模型在主观评测中

00:00:32.800 --> 00:00:35.266
甚至打赢了豆包和 Gemini 2.5 Pro

00:00:35.600 --> 00:00:37.466
它的核心能力是高保真

00:00:37.466 --> 00:00:39.700
最优性能的零样本语音克隆

00:00:39.800 --> 00:00:42.166
支持长文本和长语音生成

00:00:42.166 --> 00:00:45.466
支持拼音音标与时长精细控制

00:00:45.466 --> 00:00:47.766
支持随时插入停顿等等

00:00:48.133 --> 00:00:50.266
但很多人和我一样卡在同一个地方

00:00:50.266 --> 00:00:51.200
显存不够

00:00:51.200 --> 00:00:53.000
本地根本跑不起来

00:00:53.000 --> 00:00:54.400
今天官方下场

00:00:54.400 --> 00:00:56.033
这个问题得到了解决

00:00:56.600 --> 00:01:00.500
I'm always looking for one voice

00:01:01.566 --> 00:01:04.800
Finally that voice came into the picture

00:01:05.533 --> 00:01:09.200
With a thousand voices I have a thousand stories

00:01:10.800 --> 00:01:13.666
MossLand 是一个以语音为核心的

00:01:13.666 --> 00:01:14.766
一站式 AI 创作平台

00:01:14.766 --> 00:01:17.800
最关键的是它已经接入了 MOSS-TTS 1.5

00:01:17.800 --> 00:01:18.466
也就是说

00:01:18.466 --> 00:01:20.900
那个你在本地跑不动的顶级模型

00:01:20.900 --> 00:01:23.233
现在打开浏览器就能直接用

00:01:23.300 --> 00:01:25.500
而且它远不止一个 TTS 那么简单

00:01:25.500 --> 00:01:25.966
接下来

00:01:25.966 --> 00:01:28.233
我带你把它的核心功能过一遍

00:01:28.333 --> 00:01:29.066
你会发现

00:01:29.066 --> 00:01:31.666
它基本把声音这件事的上下游

00:01:31.666 --> 00:01:34.766
全包了 先看压箱底的语音合成

00:01:34.766 --> 00:01:37.733
这也是整个平台效果最能打的地方

00:01:37.733 --> 00:01:38.666
输入文字

00:01:38.666 --> 00:01:39.900
选一个音色 点

00:01:39.900 --> 00:01:41.400
生成 一段自然

00:01:41.400 --> 00:01:43.533
到不像 AI 的语音就出来了

00:01:43.533 --> 00:01:45.200
它支持单人合成

00:01:45.200 --> 00:01:47.600
比如这样 而在贝茜看来

00:01:47.600 --> 00:01:49.400
铁证如山的事实面前

00:01:49.400 --> 00:01:50.366
毋庸置疑

00:01:50.366 --> 00:01:51.966
大卫·戈尔就是真凶

00:01:52.466 --> 00:01:53.966
也支持多人对话合成

00:01:53.966 --> 00:01:55.166
比如这段

00:01:55.300 --> 00:01:56.400
早上好呀

00:01:56.466 --> 00:01:57.766
各位正在通勤

00:01:57.800 --> 00:01:59.500
上学 晨跑

00:01:59.700 --> 00:02:02.066
或者刚刚睁开眼睛的朋友们

00:02:02.200 --> 00:02:03.966
这里是早安 101

00:02:03.966 --> 00:02:04.966
我是阿晨

00:02:05.133 --> 00:02:05.733
大家早安

00:02:05.733 --> 00:02:06.500
我是小夏

00:02:06.500 --> 00:02:08.666
今天又是充满可能性的一天

00:02:08.666 --> 00:02:09.733
希望我们的声音

00:02:09.733 --> 00:02:11.533
能陪你开启一个好心情

00:02:11.533 --> 00:02:13.533
不知道你现在是在地铁上

00:02:13.533 --> 00:02:14.666
公交车里

00:02:14.866 --> 00:02:17.500
还是一边喝咖啡一边收听节目呢

00:02:17.666 --> 00:02:19.266
音色库里没有你要的音色

00:02:19.266 --> 00:02:20.466
那就自己造

00:02:20.466 --> 00:02:22.066
你可以上传一段音频

00:02:22.066 --> 00:02:24.166
复刻出高度相似的音色

00:02:24.166 --> 00:02:25.400
你也可以什么都不传

00:02:25.400 --> 00:02:26.800
直接用一句话描述

00:02:26.800 --> 00:02:30.266
比如低沉慵懒带点烟嗓的男声

00:02:30.500 --> 00:02:32.666
让它给你生成对应的音色

00:02:32.700 --> 00:02:34.500
造好的音色最后都能存进

00:02:34.500 --> 00:02:35.833
你自己的音色库

00:02:36.066 --> 00:02:39.133
再往上是一整套开箱即用的 AI 应用

00:02:39.133 --> 00:02:41.133
包括视频配音 播客

00:02:41.133 --> 00:02:42.300
数字人等等

00:02:42.400 --> 00:02:44.766
比如这段视频 拿钱

00:02:45.933 --> 00:02:47.433
做我的朋友

00:02:48.066 --> 00:02:49.766
还是继续竞选

00:02:49.966 --> 00:02:51.233
你选一个

00:02:51.900 --> 00:02:53.400
里面有一个词说错了

00:02:53.400 --> 00:02:55.700
现在只需要上传这段视频

00:02:55.700 --> 00:02:57.066
等它识别出文字

00:02:57.066 --> 00:02:58.733
把错误的地方一改

00:02:58.733 --> 00:03:00.266
就能一键修正

00:03:00.600 --> 00:03:02.733
模型会按照原视频的语气

00:03:02.733 --> 00:03:04.100
情绪重新配音

00:03:04.100 --> 00:03:06.166
效果是这样的

00:03:06.800 --> 00:03:08.300
做我的女朋友

00:03:09.500 --> 00:03:11.166
还是继续竞选

00:03:11.400 --> 00:03:12.633
你选一个

00:03:14.000 --> 00:03:16.366
你还能给视频换上全新的音色

00:03:16.366 --> 00:03:19.900
拿钱 做我的朋友

00:03:20.666 --> 00:03:22.166
还是继续竞选

00:03:22.166 --> 00:03:23.500
你选一个

00:03:25.100 --> 00:03:25.766
更狠的是

00:03:25.766 --> 00:03:27.600
它能一键把中文视频

00:03:27.600 --> 00:03:29.733
转成其他语言的配音版本

00:03:29.733 --> 00:03:32.066
Take the cash, be my friend

00:03:33.966 --> 00:03:36.833
Or keep running. Choose one.

00:03:38.500 --> 00:03:39.200
在播客方面

00:03:39.200 --> 00:03:40.733
你可以输入一个主题

00:03:40.733 --> 00:03:42.166
它先帮你生成文案

00:03:42.166 --> 00:03:44.966
你确认后一键生成配音 配乐

00:03:44.966 --> 00:03:46.066
混音一条龙

00:03:46.166 --> 00:03:48.066
出来的就是能直接发布的成品

00:03:48.066 --> 00:03:51.066
在数字人方面支持形象和动作控制

00:03:51.066 --> 00:03:52.866
最高 1080P 规格

00:03:53.300 --> 00:03:53.700
另外

00:03:53.700 --> 00:03:55.900
工具集里还提供了丰富的

00:03:55.900 --> 00:03:58.066
一站式工具 一键添加字幕

00:03:58.066 --> 00:03:58.933
视频剪辑

00:03:58.933 --> 00:04:00.100
音频提取

00:04:00.100 --> 00:04:02.400
以及视频图片格式转换等等

00:04:02.400 --> 00:04:04.666
是的 它还支持图片和视频生成

00:04:04.666 --> 00:04:06.200
接入了可灵 Seedance

00:04:06.200 --> 00:04:07.966
即梦这些主流模型

00:04:08.066 --> 00:04:09.933
我随手用它生成的几段视频

00:04:09.933 --> 00:04:11.000
简单拼了一下

00:04:11.000 --> 00:04:12.500
得到一个 30 秒的片子

00:04:12.500 --> 00:04:14.000
大家直接看效果

00:04:19.266 --> 00:04:21.433
你心里根本没有这个家

00:04:22.300 --> 00:04:25.500
检测到行为异常 分析中

00:04:33.866 --> 00:04:34.666
早

00:04:43.733 --> 00:04:45.233
你自己也吃啊

00:04:52.400 --> 00:04:54.900
最后所有这些能力它都开放了 API

00:04:54.900 --> 00:04:56.166
想接入自己工作流的

00:04:56.166 --> 00:04:58.400
开发者也能直接调用

00:04:58.766 --> 00:04:59.166
好了各位

00:04:59.166 --> 00:05:01.000
以上就是今天视频的全部内容

00:05:01.000 --> 00:05:02.266
欢迎关注订阅

00:05:02.266 --> 00:05:03.366
点赞收藏

00:05:03.366 --> 00:05:05.033
咱们下个视频见

