影片筆記:开源语音天花板 MOSS-TTS 1.5,太强却部署劝退?官方入场了。。。
YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。
一句話總結
OpenMOSS 團隊開源了具備高保真與零樣本語音克隆能力的 MOSS-TTS 1.5 模型,並針對本地部署顯存不足的痛點,推出了瀏覽器端的一站式 AI 創作平台 MossLand,提供從語音合成、影片配音、數字人到多模型生成的完整工作流。
核心重點
- MOSS-TTS 1.5 模型能力:
- 由 OpenMOSS 團隊開發的開源語音模型家族。
- 核心優勢:高保真、最優性能的零樣本語音克隆。
- 功能支援:長文本/長語音生成、拼音音標與時長精細控制、隨時插入停頓。
- 多語言支援:支持 31 種語言對話。
- 性能表現:在主觀評測中擊敗豆包和 Gemini 2.5 Pro。
- MossLand 平台解決方案:
- 定位為以語音為核心的「一站式 AI 創作平台」。
- 解決過往本地運行需高顯存、難以跑動的痛點。
- 將 MOSS-TTS 1.5 接入瀏覽器端,用戶可直接使用。
- 核心功能演示:
- 語音合成 (TTS):支援單人/多人對話、音色庫自建(上傳音檔復刻或文字描述生成)。
- AI 應用場景:
- 影片配音:識別並修正影片文字,按原語氣重新配音,替換音色,或一鍵轉錄為其他語言。
- 播客製作:輸入主題生成文案,一鍵生成配音、配樂及混音成品。
- 數字人:支援形象和動作控制,最高 1080P 規格。
- 工具集:字幕添加、影片剪輯、音頻提取、格式轉換。
- 多模型整合:接入了可靈、Seedance、即夢等主流影片生成模型。
- 開發者支援:所有能力均開放 API。
詳細大綱
1. MOSS-TTS 1.5 模型介紹
- 背景:OpenMOSS 團隊開源的語音模型家族。
- 技術亮點:
- 具備高保真與最優性能的零樣本語音克隆能力。
- 支援長文本與長語音生成。
- 支援拼音音標與時長精細控制,可隨時插入停頓。
- 性能對比:
- 支持 31 種語言對話。
- 在主觀評測中表現優異,擊敗豆包和 Gemini 2.5 Pro。
- 過往痛點:本地運行需要高顯存,難以跑動。
2. MossLand 平台解決方案
- 平台定位:以語音為核心的一站式 AI 創作平台。
- 解決問題:已接入 MOSS-TTS 1.5,解決本地運行問題,用戶在瀏覽器即可直接使用。
3. 核心功能演示
- 語音合成 (TTS)
- 基本操作:輸入文字選擇音色生成自然語音。
- 模式支援:支援單人合成與多人對話合成。
- 音色庫自建:
- 上傳音檔:復刻高度相似音色。
- 文字描述生成:例如「低沉慵懶帶點煙嗓的男聲」。
- 生成後的音色可存入個人音色庫。
- AI 應用場景
- 影片配音:
- 識別影片文字並修正錯誤。
- 按原影片語氣情緒重新配音。
- 替換影片音色。
- 一鍵將中文影片轉為其他語言配音版本。
- 播客製作:
- 輸入主題生成文案。
- 確認後一鍵生成配音、配樂及混音。
- 輸出可直接發布的成品。
- 數字人:
- 支援形象和動作控制。
- 最高支援 1080P 規格。
- 一站式工具集
- 一鍵添加字幕。
- 影片剪輯。
- 音頻提取。
- 影片圖片格式轉換。
- 圖片與影片生成
- 接入了可靈、Seedance、即夢等主流模型。
- 演示生成影片片段並進行拼接。
- API 開放
- 所有能力開放 API,供開發者接入工作流。
工具 / 模型 / 名詞整理
- MOSS-TTS 1.5:OpenMOSS 團隊開源的語音模型家族。
- OpenMOSS:開發 MOSS-TTS 的團隊。
- MossLand:以語音為核心的一站式 AI 創作平台。
- 豆包:被提及對比的主觀評測對象。
- Gemini 2.5 Pro:被提及對比的主觀評測對象。
- 可靈:影片生成模型。
- Seedance:影片生成模型。
- 即夢:影片生成模型。
- 貝茜:逐字稿中出現的角色或人名。
- 早安 101:逐字稿中出現的節目名稱或特定稱呼。
- 阿晨:演示中的虛擬角色或主持人名字。
- 小夏:演示中的虛擬角色或主持人名字。
- David Gore / 大衛·戈爾:逐字稿中出現的角色名,疑為電影《大衛·戈爾的死亡》中的角色。
- Take the cash, be my friend / Or keep running. Choose one.:英文配音內容,疑為影片演示中的特定台詞。
操作流程整理
進入 MossLand 平台:通過瀏覽器訪問平台。
語音合成操作:
- 選擇單人或多人對話模式。
- 輸入文字或選擇現有音色。
- 自建音色:上傳音檔或輸入文字描述(如「低沉慵懶帶點煙嗓的男聲」)生成新音色,並存入個人音色庫。
影片配音流程:
- 上傳影片。
- 系統識別影片文字並進行修正。
- 選擇或生成新音色,按原語氣情緒重新配音。
- 可選擇替換音色或一鍵轉錄為其他語言版本。
播客製作流程:
- 輸入主題生成文案。
- 確認文案後,一鍵生成配音、配樂及混音。
- 輸出成品。
數字人生成流程:
- 設定形象與動作。
- 生成最高 1080P 規格的數字人影片。
影片與圖片生成流程:
- 使用接入了可靈、Seedance、即夢等模型的生成工具。
- 生成影片片段並進行拼接。
後期處理:
- 使用內建工具添加字幕、剪輯影片、提取音頻或轉換格式。
開發者接入:
- 通過 API 接入上述所有能力至個人工作流。
值得注意的限制或風險
- 本地部署門檻:影片指出 MOSS-TTS 1.5 在本地運行時存在顯存不足的問題,難以直接跑動,這促使了官方推出 MossLand 平台。
- 版本與名稱準確性:影片內容中提及的模型版本號(如 MOSS-TTS 1.5、Gemini 2.5 Pro)及特定模型名稱(如 Seedance)可能存在辨識疑點,需進一步查證。
- 角色名稱辨識:逐字稿中出現的「貝茜」、「早安 101」、「阿晨」、「小夏」、「David Gore」等名稱語境不明,可能為聽寫錯誤或特定演示內容,需確認是否為正確的名稱。
逐字稿辨識疑點
- MOSS-TTS 1.5:逐字稿中提及「MOSS-TTS 1.5」,請確認該版本號是否準確或為口誤。
- Gemini 2.5 Pro:逐字稿中提及「Gemini 2.5 Pro」,請確認該模型版本名稱是否準確。
- Seedance:逐字稿中提及「Seedance」,請確認該模型名稱拼寫是否正確(常見為 Seedance 或類似變體,需查證)。
- 貝茜:逐字稿中出現「而在貝茜看來」,語境不明,疑為人名或特定角色名,需查證是否為聽寫錯誤。
- 早安 101:逐字稿中出現「這裡是早安 101」,疑為節目名稱或特定稱呼,需查證是否為聽寫錯誤。
- 阿晨 / 小夏:逐字稿中出現「我是阿晨」、「我是小夏」,疑為演示中的虛擬角色或主持人名字。
- David Gore / 大衛·戈爾:逐字稿中出現「大衛·戈爾就是真凶」,疑為電影《大衛·戈爾的死亡》(The Life of David Gale) 中的角色名,需查證是否為聽寫錯誤。
- Take the cash, be my friend / Or keep running. Choose one.:英文配音內容,疑為影片演示中的特定台詞。
可延伸追問
- MossLand 平台目前是否完全免費?是否有額度限制?
- MOSS-TTS 1.5 的開源協議具體為何?是否允許商業用途?
- 針對「本地運行顯存不足」的問題,官方是否會推出更輕量級的本地部署版本?
- MossLand 平台支援的 31 種語言具體包含哪些語言?
- 開發者通過 API 接入時,目前的調用價格或限額是多少?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。
00:00:00.166 → 00:00:03.200
前段时间我分享过开源的 MOSS-TTS 1.5
00:00:03.200 → 00:00:04.300
它的配音效果
00:00:04.300 → 00:00:06.466
足以比肩主流的闭源模型
00:00:06.466 → 00:00:08.033
先来听听这段效果
00:00:08.400 → 00:00:11.366
配一佐咸鲜的火腿同炖
00:00:11.600 → 00:00:13.400
汤色渐渐乳白
00:00:13.500 → 00:00:16.400
鲜味丝丝缕缕漫上舌尖
00:00:17.000 → 00:00:21.100
这是春天最温柔的一封回信
00:00:22.666 → 00:00:23.933
MOSS-TTS 是 OpenMOSS
00:00:23.933 → 00:00:26.800
团队开源的一个语音模型家族
00:00:26.800 → 00:00:28.500
支持零样本语音克隆
00:00:28.500 → 00:00:30.833
实时语音和 31 种语言
00:00:30.966 → 00:00:32.800
对话模型在主观评测中
00:00:32.800 → 00:00:35.266
甚至打赢了豆包和 Gemini 2.5 Pro
00:00:35.600 → 00:00:37.466
它的核心能力是高保真
00:00:37.466 → 00:00:39.700
最优性能的零样本语音克隆
00:00:39.800 → 00:00:42.166
支持长文本和长语音生成
00:00:42.166 → 00:00:45.466
支持拼音音标与时长精细控制
00:00:45.466 → 00:00:47.766
支持随时插入停顿等等
00:00:48.133 → 00:00:50.266
但很多人和我一样卡在同一个地方
00:00:51.200 → 00:00:53.000
本地根本跑不起来
00:00:53.000 → 00:00:54.400
今天官方下场
00:00:54.400 → 00:00:56.033
这个问题得到了解决
00:00:56.600 → 00:01:00.500
I'm always looking for one voice
00:01:01.566 → 00:01:04.800
Finally that voice came into the picture
00:01:05.533 → 00:01:09.200
With a thousand voices I have a thousand stories
00:01:10.800 → 00:01:13.666
MossLand 是一个以语音为核心的
00:01:13.666 → 00:01:14.766
一站式 AI 创作平台
00:01:14.766 → 00:01:17.800
最关键的是它已经接入了 MOSS-TTS 1.5
00:01:18.466 → 00:01:20.900
那个你在本地跑不动的顶级模型
00:01:20.900 → 00:01:23.233
现在打开浏览器就能直接用
00:01:23.300 → 00:01:25.500
而且它远不止一个 TTS 那么简单
00:01:25.966 → 00:01:28.233
我带你把它的核心功能过一遍
00:01:29.066 → 00:01:31.666
它基本把声音这件事的上下游
00:01:31.666 → 00:01:34.766
全包了 先看压箱底的语音合成
00:01:34.766 → 00:01:37.733
这也是整个平台效果最能打的地方
00:01:38.666 → 00:01:39.900
选一个音色 点
00:01:39.900 → 00:01:41.400
生成 一段自然
00:01:41.400 → 00:01:43.533
到不像 AI 的语音就出来了
00:01:43.533 → 00:01:45.200
它支持单人合成
00:01:45.200 → 00:01:47.600
比如这样 而在贝茜看来
00:01:47.600 → 00:01:49.400
铁证如山的事实面前
00:01:50.366 → 00:01:51.966
大卫·戈尔就是真凶
00:01:52.466 → 00:01:53.966
也支持多人对话合成
00:01:56.466 → 00:01:57.766
各位正在通勤
00:01:59.700 → 00:02:02.066
或者刚刚睁开眼睛的朋友们
00:02:02.200 → 00:02:03.966
这里是早安 101
00:02:06.500 → 00:02:08.666
今天又是充满可能性的一天
00:02:08.666 → 00:02:09.733
希望我们的声音
00:02:09.733 → 00:02:11.533
能陪你开启一个好心情
00:02:11.533 → 00:02:13.533
不知道你现在是在地铁上
00:02:14.866 → 00:02:17.500
还是一边喝咖啡一边收听节目呢
00:02:17.666 → 00:02:19.266
音色库里没有你要的音色
00:02:20.466 → 00:02:22.066
你可以上传一段音频
00:02:22.066 → 00:02:24.166
复刻出高度相似的音色
00:02:24.166 → 00:02:25.400
你也可以什么都不传
00:02:25.400 → 00:02:26.800
直接用一句话描述
00:02:26.800 → 00:02:30.266
比如低沉慵懒带点烟嗓的男声
00:02:30.500 → 00:02:32.666
让它给你生成对应的音色
00:02:32.700 → 00:02:34.500
造好的音色最后都能存进
00:02:34.500 → 00:02:35.833
你自己的音色库
00:02:36.066 → 00:02:39.133
再往上是一整套开箱即用的 AI 应用
00:02:39.133 → 00:02:41.133
包括视频配音 播客
00:02:42.400 → 00:02:44.766
比如这段视频 拿钱
00:02:48.066 → 00:02:49.766
还是继续竞选
00:02:51.900 → 00:02:53.400
里面有一个词说错了
00:02:53.400 → 00:02:55.700
现在只需要上传这段视频
00:02:55.700 → 00:02:57.066
等它识别出文字
00:02:57.066 → 00:02:58.733
把错误的地方一改
00:02:58.733 → 00:03:00.266
就能一键修正
00:03:00.600 → 00:03:02.733
模型会按照原视频的语气
00:03:02.733 → 00:03:04.100
情绪重新配音
00:03:04.100 → 00:03:06.166
效果是这样的
00:03:06.800 → 00:03:08.300
做我的女朋友
00:03:09.500 → 00:03:11.166
还是继续竞选
00:03:14.000 → 00:03:16.366
你还能给视频换上全新的音色
00:03:16.366 → 00:03:19.900
拿钱 做我的朋友
00:03:20.666 → 00:03:22.166
还是继续竞选
00:03:25.766 → 00:03:27.600
它能一键把中文视频
00:03:27.600 → 00:03:29.733
转成其他语言的配音版本
00:03:29.733 → 00:03:32.066
Take the cash, be my friend
00:03:33.966 → 00:03:36.833
Or keep running. Choose one.
00:03:39.200 → 00:03:40.733
你可以输入一个主题
00:03:40.733 → 00:03:42.166
它先帮你生成文案
00:03:42.166 → 00:03:44.966
你确认后一键生成配音 配乐
00:03:46.166 → 00:03:48.066
出来的就是能直接发布的成品
00:03:48.066 → 00:03:51.066
在数字人方面支持形象和动作控制
00:03:51.066 → 00:03:52.866
最高 1080P 规格
00:03:53.700 → 00:03:55.900
工具集里还提供了丰富的
00:03:55.900 → 00:03:58.066
一站式工具 一键添加字幕
00:04:00.100 → 00:04:02.400
以及视频图片格式转换等等
00:04:02.400 → 00:04:04.666
是的 它还支持图片和视频生成
00:04:04.666 → 00:04:06.200
接入了可灵 Seedance
00:04:06.200 → 00:04:07.966
即梦这些主流模型
00:04:08.066 → 00:04:09.933
我随手用它生成的几段视频
00:04:09.933 → 00:04:11.000
简单拼了一下
00:04:11.000 → 00:04:12.500
得到一个 30 秒的片子
00:04:12.500 → 00:04:14.000
大家直接看效果
00:04:19.266 → 00:04:21.433
你心里根本没有这个家
00:04:22.300 → 00:04:25.500
检测到行为异常 分析中
00:04:43.733 → 00:04:45.233
你自己也吃啊
00:04:52.400 → 00:04:54.900
最后所有这些能力它都开放了 API
00:04:54.900 → 00:04:56.166
想接入自己工作流的
00:04:56.166 → 00:04:58.400
开发者也能直接调用
00:04:59.166 → 00:05:01.000
以上就是今天视频的全部内容
00:05:01.000 → 00:05:02.266
欢迎关注订阅
00:05:03.366 → 00:05:05.033
咱们下个视频见