實際影片長度:4:21.619。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:01.180
ja各位朋友大家好,
0:01.180–0:02.656
ja歡迎大家關注昆蓬特,
0:02.656–0:06.788
ja今天給大家介紹一個小模型叫SoloX DuPRO 0.6B,
0:06.788–0:09.591
ja那這個模型呢它是一個全商工的語音交互,
0:09.591–0:12.543
ja什麼叫全商工就是能夠實時對話的一個模型,
0:12.543–0:14.166
ja它的模型只有0.6B,
0:14.166–0:15.494
ja0.6B什麼概念?
0:15.494–0:19.478
ja就是你在手機上就能運行一個全本地的一個對話的一個模型,
0:19.478–0:21.396
ja那它的效果還是非常不錯的,
0:21.396–0:22.872
ja一會給大家演示一下,
0:22.872–0:24.200
ja我本地沒有去跑它。
0:24.200–0:25.738
ja首先第一個呢,
0:25.738–0:28.813
ja它是用來還是VD模型的這種,
0:28.813–0:37.600
ja然後它後面呢是用一個叫它那個語音模型是用了千問3的一個0.6B的一個模型應該是。
0:38.220–0:41.230
ja然後它安裝我們可以看一下它的安裝的方式,
0:41.230–0:43.487
ja它目前是Github一個倉庫,
0:43.487–0:46.346
ja然後在Github上可以去運行推理它,
0:46.346–0:49.656
ja因為目前對於這種全商工的這種推理的框架不多,
0:49.656–0:51.161
ja所以比如說NAMA.
0:51.161–0:51.913
jaCPP啊,
0:51.913–0:54.020
ja它可能也還沒有支持這種模型。
0:55.100–0:56.014
ja那前段時間,
0:56.014–0:58.908
jaOpenBnB他們開玩那個叫NAMA.
0:58.908–1:01.193
jaCPP-OMINI的一個模型,
1:01.193–1:03.478
ja那它那個裡面是能實現這些功能,
1:03.478–1:07.134
ja但是那個框架的可能也是OpenBnB他們剛出的,
1:07.134–1:08.200
ja然後不太通用。
1:08.200–1:09.483
ja那這個模型呢,
1:09.483–1:10.767
ja它的信息很少,
1:10.767–1:12.417
ja那我們可以看一下,
1:12.417–1:13.333
ja它底下呢,
1:13.333–1:16.083
ja說它致謝了一下這個千問的JM,
1:16.083–1:18.467
ja千問的這個LM和JM4的,
1:18.467–1:20.300
ja這應該是個TTS吧。
1:20.300–1:21.910
ja這相當於它是一個縫合怪,
1:21.910–1:22.580
ja那本身呢,
1:22.580–1:23.788
ja基於這種全商工呢,
1:23.788–1:24.593
ja它其實就是,
1:24.593–1:25.263
ja第一個呢,
1:25.263–1:26.202
ja是做語音識別,
1:26.202–1:27.007
ja類似於SR,
1:27.007–1:27.544
ja然後呢,
1:27.544–1:28.885
ja然後識別完了之後呢,
1:28.885–1:30.361
ja底層還有一個LM模型,
1:30.361–1:31.300
ja模型進行推理。
1:31.600–1:32.624
ja推理完成之後呢,
1:32.624–1:34.032
ja再用TTS給你讀出來,
1:34.032–1:35.184
ja就是這麼一個情況,
1:35.184–1:36.848
ja然後只不過它處理速度極快,
1:36.848–1:38.128
ja導致你以為是跟一個,
1:38.128–1:38.384
ja呃,
1:38.384–1:39.920
ja完整的一個模型進行對話。
1:39.920–1:41.920
ja那這個是它的一個Demo,我們來演示一下。
1:41.920–1:44.920
ja你好,你是誰?
1:44.920–1:46.920
ja嗯,占用時間了,咱們繼續。
1:46.920–1:52.920
ja嗯,抱歉,可能,我的麥克風被這個占用了,那我。
1:52.920–1:53.920
ja我聽著呢。
1:53.920–1:56.920
ja哦,不是,還是喊過來,我以為是我的麥克風占用了。
1:56.920–1:58.920
ja有什麼想知道的都可以問我哦。
1:58.920–2:02.920
ja你,你是什麼模型?
2:02.920–2:06.920
ja不完全是呢,我是Elva,我們都是阿里集團研發的語言模型。
2:06.920–2:08.920
ja但功能和特點可能有所不同。
2:08.920–2:11.920
jaElva,你確定嗎?你的語言模型不是簽文嗎?
2:11.920–2:14.920
ja我就咱們倆在聊天呢。
2:14.920–2:18.920
ja其他的就是根據需要調用不同的模型來提供幫助或者進行對話了。
2:18.920–2:22.920
jaElva,嗯,那你現在裡面都有哪幾個語言模型在裡面?
2:22.920–2:26.920
ja我能回答問題,講故事,提建議,還能陪你聊天,解解悶。
2:26.920–2:28.920
ja你想要聊些什麼?
2:29.920–2:32.920
ja哦,好的,那你都會哪些模型?
2:32.920–2:34.920
ja你,你會哪些模型的功能啊。
2:34.920–2:36.920
ja對,我的響應速度挺快的。
2:36.920–2:40.920
ja基本上是你說完我馬上就能接上話,不會讓你整太久。
2:40.920–2:42.920
ja有才事可以隨時跟我說。
2:42.920–2:44.920
ja說完話,它能夠實時,就能夠識別出來。
2:44.920–2:46.920
ja而且它還支持打斷。
2:46.920–2:49.920
ja那可能是當時的情況來特殊。
2:49.920–2:51.920
ja你看它,你中間在說話的時候,你可以把它打斷。
2:51.920–2:53.920
ja當然可以,你想說啥就直接告訴我吧。
2:53.920–2:57.920
ja哎,我記得,我記得我剛才跟他說話的時候能打斷的。
2:57.920–2:59.920
ja他這個好像剛才這個沒,沒生效。
2:59.920–3:02.920
ja現在呢,現在可以打斷嗎?
3:02.920–3:03.920
ja啊,對,應該。
3:03.920–3:05.920
ja嗯,好的。
3:05.920–3:08.920
ja那這個就是一個小模型。
3:08.920–3:10.920
ja那其實這個模型是可以在部署在手機上的。
3:10.920–3:12.920
ja那你Mac上也是完全可以的哦。
3:12.920–3:14.864
ja而且呢,如果你感興趣的話呢,
3:14.864–3:17.920
ja相當於我們過來給大家看一下這個模型它的文件。
3:17.920–3:21.920
ja你其實,如果你可以的話,你可以把這個模型。
3:21.920–3:22.920
en嗯,sorry。
3:22.920–3:23.920
ja不應該呀。
3:23.920–3:31.920
ja你都可以把這個模型它的,RM模型換成那個大模型。
3:31.920–3:35.920
ja那它相當於是,嗯,這是用了JM4的FoistTokenator。
3:35.920–3:40.920
ja這個是,嗯,這個是TTS嗎?好像不是TTS。
3:40.920–3:44.920
ja還真是用了千文三的Valba這個模型。
3:44.920–3:48.920
ja然後呢,它其實就相當於把幾個小模型的一個功能集成在一起。
3:48.920–3:52.920
ja然後通過工程的能力,然後把它們進行做了一個拼接。
3:52.920–4:03.920
ja嗯,那如果感興趣的話呢,可以來嘗試一下。這個模型還是非常小哈。
4:03.920–4:06.920
ja應該是可以在手機上去部署起來的。
4:06.920–4:08.236
ja當然呢,那可以等等,
4:08.236–4:10.209
ja應該會有一些第三方的一些工具,
4:10.209–4:11.920
ja會把這些產品模型提升起來。
4:11.920–4:14.920
ja能在本地運行。目前它這個模型沒有量化之前是7個G。
4:14.920–4:17.920
ja那比如說Q4的話,應該是在3、4個G左右的一個大小。
4:17.920–4:18.920
ja完全是可以在手機上跑起來的。
4:18.920–4:20.920
ja好的,今天就介紹在這兒。謝謝大家。
4:20.920–4:21.619
ja謝謝大家。
0:00.000–0:01.180
各位朋友大家好,
0:01.180–0:02.656
歡迎大家關注昆蓬特,
0:02.656–0:06.788
今天給大家介紹一個小模型叫SoloX DuPRO 0.6B,
0:06.788–0:09.591
那這個模型呢它是一個全商工的語音交互,
0:09.591–0:12.543
什麼叫全商工就是能夠實時對話的一個模型,
0:12.543–0:14.166
它的模型只有0.6B,
0:14.166–0:15.494
0.6B什麼概念?
0:15.494–0:19.478
就是你在手機上就能運行一個全本地的一個對話的一個模型,
0:19.478–0:21.396
那它的效果還是非常不錯的,
0:21.396–0:22.872
一會給大家演示一下,
0:22.872–0:24.200
我本地沒有去跑它。
0:24.200–0:25.738
首先第一個呢,
0:25.738–0:28.813
它是用來還是VD模型的這種,
0:28.813–0:37.600
然後它後面呢是用一個叫它那個語音模型是用了千問3的一個0.6B的一個模型應該是。
0:38.220–0:41.230
然後它安裝我們可以看一下它的安裝的方式,
0:41.230–0:43.487
它目前是Github一個倉庫,
0:43.487–0:46.346
然後在Github上可以去運行推理它,
0:46.346–0:49.656
因為目前對於這種全商工的這種推理的框架不多,
0:49.656–0:51.161
所以比如說NAMA.
0:51.161–0:51.913
CPP啊,
0:51.913–0:54.020
它可能也還沒有支持這種模型。
0:55.100–0:56.014
那前段時間,
0:56.014–0:58.908
OpenBnB他們開玩那個叫NAMA.
0:58.908–1:01.193
CPP-OMINI的一個模型,
1:01.193–1:03.478
那它那個裡面是能實現這些功能,
1:03.478–1:07.134
但是那個框架的可能也是OpenBnB他們剛出的,
1:07.134–1:08.200
然後不太通用。
1:08.200–1:09.483
那這個模型呢,
1:09.483–1:10.767
它的信息很少,
1:10.767–1:12.417
那我們可以看一下,
1:12.417–1:13.333
它底下呢,
1:13.333–1:16.083
說它致謝了一下這個千問的JM,
1:16.083–1:18.467
千問的這個LM和JM4的,
1:18.467–1:20.300
這應該是個TTS吧。
1:20.300–1:21.910
這相當於它是一個縫合怪,
1:21.910–1:22.580
那本身呢,
1:22.580–1:23.788
基於這種全商工呢,
1:23.788–1:24.593
它其實就是,
1:24.593–1:25.263
第一個呢,
1:25.263–1:26.202
是做語音識別,
1:26.202–1:27.007
類似於SR,
1:27.007–1:27.544
然後呢,
1:27.544–1:28.885
然後識別完了之後呢,
1:28.885–1:30.361
底層還有一個LM模型,
1:30.361–1:31.300
模型進行推理。
1:31.600–1:32.624
推理完成之後呢,
1:32.624–1:34.032
再用TTS給你讀出來,
1:34.032–1:35.184
就是這麼一個情況,
1:35.184–1:36.848
然後只不過它處理速度極快,
1:36.848–1:38.128
導致你以為是跟一個,
1:38.128–1:38.384
呃,
1:38.384–1:39.920
完整的一個模型進行對話。
1:39.920–1:41.920
那這個是它的一個Demo,我們來演示一下。
1:41.920–1:44.920
你好,你是誰?
1:44.920–1:46.920
嗯,占用時間了,咱們繼續。
1:46.920–1:52.920
嗯,抱歉,可能,我的麥克風被這個占用了,那我。
1:52.920–1:53.920
我聽著呢。
1:53.920–1:56.920
哦,不是,還是喊過來,我以為是我的麥克風占用了。
1:56.920–1:58.920
有什麼想知道的都可以問我哦。
1:58.920–2:02.920
你,你是什麼模型?
2:02.920–2:06.920
不完全是呢,我是Elva,我們都是阿里集團研發的語言模型。
2:06.920–2:08.920
但功能和特點可能有所不同。
2:08.920–2:11.920
Elva,你確定嗎?你的語言模型不是簽文嗎?
2:11.920–2:14.920
我就咱們倆在聊天呢。
2:14.920–2:18.920
其他的就是根據需要調用不同的模型來提供幫助或者進行對話了。
2:18.920–2:22.920
Elva,嗯,那你現在裡面都有哪幾個語言模型在裡面?
2:22.920–2:26.920
我能回答問題,講故事,提建議,還能陪你聊天,解解悶。
2:26.920–2:28.920
你想要聊些什麼?
2:29.920–2:32.920
哦,好的,那你都會哪些模型?
2:32.920–2:34.920
你,你會哪些模型的功能啊。
2:34.920–2:36.920
對,我的響應速度挺快的。
2:36.920–2:40.920
基本上是你說完我馬上就能接上話,不會讓你整太久。
2:40.920–2:42.920
有才事可以隨時跟我說。
2:42.920–2:44.920
說完話,它能夠實時,就能夠識別出來。
2:44.920–2:46.920
而且它還支持打斷。
2:46.920–2:49.920
那可能是當時的情況來特殊。
2:49.920–2:51.920
你看它,你中間在說話的時候,你可以把它打斷。
2:51.920–2:53.920
當然可以,你想說啥就直接告訴我吧。
2:53.920–2:57.920
哎,我記得,我記得我剛才跟他說話的時候能打斷的。
2:57.920–2:59.920
他這個好像剛才這個沒,沒生效。
2:59.920–3:02.920
現在呢,現在可以打斷嗎?
3:02.920–3:03.920
啊,對,應該。
3:03.920–3:05.920
嗯,好的。
3:05.920–3:08.920
那這個就是一個小模型。
3:08.920–3:10.920
那其實這個模型是可以在部署在手機上的。
3:10.920–3:12.920
那你Mac上也是完全可以的哦。
3:12.920–3:14.864
而且呢,如果你感興趣的話呢,
3:14.864–3:17.920
相當於我們過來給大家看一下這個模型它的文件。
3:17.920–3:21.920
你其實,如果你可以的話,你可以把這個模型。
3:21.920–3:22.920
嗯,sorry。
3:22.920–3:23.920
不應該呀。
3:23.920–3:31.920
你都可以把這個模型它的,RM模型換成那個大模型。
3:31.920–3:35.920
那它相當於是,嗯,這是用了JM4的FoistTokenator。
3:35.920–3:40.920
這個是,嗯,這個是TTS嗎?好像不是TTS。
3:40.920–3:44.920
還真是用了千文三的Valba這個模型。
3:44.920–3:48.920
然後呢,它其實就相當於把幾個小模型的一個功能集成在一起。
3:48.920–3:52.920
然後通過工程的能力,然後把它們進行做了一個拼接。
3:52.920–4:03.920
嗯,那如果感興趣的話呢,可以來嘗試一下。這個模型還是非常小哈。
4:03.920–4:06.920
應該是可以在手機上去部署起來的。
4:06.920–4:08.236
當然呢,那可以等等,
4:08.236–4:10.209
應該會有一些第三方的一些工具,
4:10.209–4:11.920
會把這些產品模型提升起來。
4:11.920–4:14.920
能在本地運行。目前它這個模型沒有量化之前是7個G。
4:14.920–4:17.920
那比如說Q4的話,應該是在3、4個G左右的一個大小。
4:17.920–4:18.920
完全是可以在手機上跑起來的。
4:18.920–4:20.920
好的,今天就介紹在這兒。謝謝大家。
4:20.920–4:21.619
謝謝大家。
0:00.000–0:01.180
ja各位朋友大家好,
各位朋友大家好,
0:01.180–0:02.656
ja歡迎大家關注昆蓬特,
歡迎大家關注昆蓬特,
0:02.656–0:06.788
ja今天給大家介紹一個小模型叫SoloX DuPRO 0.6B,
今天給大家介紹一個小模型叫SoloX DuPRO 0.6B,
0:06.788–0:09.591
ja那這個模型呢它是一個全商工的語音交互,
那這個模型呢它是一個全商工的語音交互,
0:09.591–0:12.543
ja什麼叫全商工就是能夠實時對話的一個模型,
什麼叫全商工就是能夠實時對話的一個模型,
0:12.543–0:14.166
ja它的模型只有0.6B,
它的模型只有0.6B,
0:14.166–0:15.494
ja0.6B什麼概念?
0.6B什麼概念?
0:15.494–0:19.478
ja就是你在手機上就能運行一個全本地的一個對話的一個模型,
就是你在手機上就能運行一個全本地的一個對話的一個模型,
0:19.478–0:21.396
ja那它的效果還是非常不錯的,
那它的效果還是非常不錯的,
0:21.396–0:22.872
ja一會給大家演示一下,
一會給大家演示一下,
0:22.872–0:24.200
ja我本地沒有去跑它。
我本地沒有去跑它。
0:24.200–0:25.738
ja首先第一個呢,
首先第一個呢,
0:25.738–0:28.813
ja它是用來還是VD模型的這種,
它是用來還是VD模型的這種,
0:28.813–0:37.600
ja然後它後面呢是用一個叫它那個語音模型是用了千問3的一個0.6B的一個模型應該是。
然後它後面呢是用一個叫它那個語音模型是用了千問3的一個0.6B的一個模型應該是。
0:38.220–0:41.230
ja然後它安裝我們可以看一下它的安裝的方式,
然後它安裝我們可以看一下它的安裝的方式,
0:41.230–0:43.487
ja它目前是Github一個倉庫,
它目前是Github一個倉庫,
0:43.487–0:46.346
ja然後在Github上可以去運行推理它,
然後在Github上可以去運行推理它,
0:46.346–0:49.656
ja因為目前對於這種全商工的這種推理的框架不多,
因為目前對於這種全商工的這種推理的框架不多,
0:49.656–0:51.161
ja所以比如說NAMA.
所以比如說NAMA.
0:51.161–0:51.913
jaCPP啊,
CPP啊,
0:51.913–0:54.020
ja它可能也還沒有支持這種模型。
它可能也還沒有支持這種模型。
0:55.100–0:56.014
ja那前段時間,
那前段時間,
0:56.014–0:58.908
jaOpenBnB他們開玩那個叫NAMA.
OpenBnB他們開玩那個叫NAMA.
0:58.908–1:01.193
jaCPP-OMINI的一個模型,
CPP-OMINI的一個模型,
1:01.193–1:03.478
ja那它那個裡面是能實現這些功能,
那它那個裡面是能實現這些功能,
1:03.478–1:07.134
ja但是那個框架的可能也是OpenBnB他們剛出的,
但是那個框架的可能也是OpenBnB他們剛出的,
1:07.134–1:08.200
ja然後不太通用。
然後不太通用。
1:08.200–1:09.483
ja那這個模型呢,
那這個模型呢,
1:09.483–1:10.767
ja它的信息很少,
它的信息很少,
1:10.767–1:12.417
ja那我們可以看一下,
那我們可以看一下,
1:12.417–1:13.333
ja它底下呢,
它底下呢,
1:13.333–1:16.083
ja說它致謝了一下這個千問的JM,
說它致謝了一下這個千問的JM,
1:16.083–1:18.467
ja千問的這個LM和JM4的,
千問的這個LM和JM4的,
1:18.467–1:20.300
ja這應該是個TTS吧。
這應該是個TTS吧。
1:20.300–1:21.910
ja這相當於它是一個縫合怪,
這相當於它是一個縫合怪,
1:21.910–1:22.580
ja那本身呢,
那本身呢,
1:22.580–1:23.788
ja基於這種全商工呢,
基於這種全商工呢,
1:23.788–1:24.593
ja它其實就是,
它其實就是,
1:24.593–1:25.263
ja第一個呢,
第一個呢,
1:25.263–1:26.202
ja是做語音識別,
是做語音識別,
1:26.202–1:27.007
ja類似於SR,
類似於SR,
1:27.007–1:27.544
ja然後呢,
然後呢,
1:27.544–1:28.885
ja然後識別完了之後呢,
然後識別完了之後呢,
1:28.885–1:30.361
ja底層還有一個LM模型,
底層還有一個LM模型,
1:30.361–1:31.300
ja模型進行推理。
模型進行推理。
1:31.600–1:32.624
ja推理完成之後呢,
推理完成之後呢,
1:32.624–1:34.032
ja再用TTS給你讀出來,
再用TTS給你讀出來,
1:34.032–1:35.184
ja就是這麼一個情況,
就是這麼一個情況,
1:35.184–1:36.848
ja然後只不過它處理速度極快,
然後只不過它處理速度極快,
1:36.848–1:38.128
ja導致你以為是跟一個,
導致你以為是跟一個,
1:38.128–1:38.384
ja呃,
呃,
1:38.384–1:39.920
ja完整的一個模型進行對話。
完整的一個模型進行對話。
1:39.920–1:41.920
ja那這個是它的一個Demo,我們來演示一下。
那這個是它的一個Demo,我們來演示一下。
1:41.920–1:44.920
ja你好,你是誰?
你好,你是誰?
1:44.920–1:46.920
ja嗯,占用時間了,咱們繼續。
嗯,占用時間了,咱們繼續。
1:46.920–1:52.920
ja嗯,抱歉,可能,我的麥克風被這個占用了,那我。
嗯,抱歉,可能,我的麥克風被這個占用了,那我。
1:52.920–1:53.920
ja我聽著呢。
我聽著呢。
1:53.920–1:56.920
ja哦,不是,還是喊過來,我以為是我的麥克風占用了。
哦,不是,還是喊過來,我以為是我的麥克風占用了。
1:56.920–1:58.920
ja有什麼想知道的都可以問我哦。
有什麼想知道的都可以問我哦。
1:58.920–2:02.920
ja你,你是什麼模型?
你,你是什麼模型?
2:02.920–2:06.920
ja不完全是呢,我是Elva,我們都是阿里集團研發的語言模型。
不完全是呢,我是Elva,我們都是阿里集團研發的語言模型。
2:06.920–2:08.920
ja但功能和特點可能有所不同。
但功能和特點可能有所不同。
2:08.920–2:11.920
jaElva,你確定嗎?你的語言模型不是簽文嗎?
Elva,你確定嗎?你的語言模型不是簽文嗎?
2:11.920–2:14.920
ja我就咱們倆在聊天呢。
我就咱們倆在聊天呢。
2:14.920–2:18.920
ja其他的就是根據需要調用不同的模型來提供幫助或者進行對話了。
其他的就是根據需要調用不同的模型來提供幫助或者進行對話了。
2:18.920–2:22.920
jaElva,嗯,那你現在裡面都有哪幾個語言模型在裡面?
Elva,嗯,那你現在裡面都有哪幾個語言模型在裡面?
2:22.920–2:26.920
ja我能回答問題,講故事,提建議,還能陪你聊天,解解悶。
我能回答問題,講故事,提建議,還能陪你聊天,解解悶。
2:26.920–2:28.920
ja你想要聊些什麼?
你想要聊些什麼?
2:29.920–2:32.920
ja哦,好的,那你都會哪些模型?
哦,好的,那你都會哪些模型?
2:32.920–2:34.920
ja你,你會哪些模型的功能啊。
你,你會哪些模型的功能啊。
2:34.920–2:36.920
ja對,我的響應速度挺快的。
對,我的響應速度挺快的。
2:36.920–2:40.920
ja基本上是你說完我馬上就能接上話,不會讓你整太久。
基本上是你說完我馬上就能接上話,不會讓你整太久。
2:40.920–2:42.920
ja有才事可以隨時跟我說。
有才事可以隨時跟我說。
2:42.920–2:44.920
ja說完話,它能夠實時,就能夠識別出來。
說完話,它能夠實時,就能夠識別出來。
2:44.920–2:46.920
ja而且它還支持打斷。
而且它還支持打斷。
2:46.920–2:49.920
ja那可能是當時的情況來特殊。
那可能是當時的情況來特殊。
2:49.920–2:51.920
ja你看它,你中間在說話的時候,你可以把它打斷。
你看它,你中間在說話的時候,你可以把它打斷。
2:51.920–2:53.920
ja當然可以,你想說啥就直接告訴我吧。
當然可以,你想說啥就直接告訴我吧。
2:53.920–2:57.920
ja哎,我記得,我記得我剛才跟他說話的時候能打斷的。
哎,我記得,我記得我剛才跟他說話的時候能打斷的。
2:57.920–2:59.920
ja他這個好像剛才這個沒,沒生效。
他這個好像剛才這個沒,沒生效。
2:59.920–3:02.920
ja現在呢,現在可以打斷嗎?
現在呢,現在可以打斷嗎?
3:02.920–3:03.920
ja啊,對,應該。
啊,對,應該。
3:03.920–3:05.920
ja嗯,好的。
嗯,好的。
3:05.920–3:08.920
ja那這個就是一個小模型。
那這個就是一個小模型。
3:08.920–3:10.920
ja那其實這個模型是可以在部署在手機上的。
那其實這個模型是可以在部署在手機上的。
3:10.920–3:12.920
ja那你Mac上也是完全可以的哦。
那你Mac上也是完全可以的哦。
3:12.920–3:14.864
ja而且呢,如果你感興趣的話呢,
而且呢,如果你感興趣的話呢,
3:14.864–3:17.920
ja相當於我們過來給大家看一下這個模型它的文件。
相當於我們過來給大家看一下這個模型它的文件。
3:17.920–3:21.920
ja你其實,如果你可以的話,你可以把這個模型。
你其實,如果你可以的話,你可以把這個模型。
3:21.920–3:22.920
en嗯,sorry。
嗯,sorry。
3:22.920–3:23.920
ja不應該呀。
不應該呀。
3:23.920–3:31.920
ja你都可以把這個模型它的,RM模型換成那個大模型。
你都可以把這個模型它的,RM模型換成那個大模型。
3:31.920–3:35.920
ja那它相當於是,嗯,這是用了JM4的FoistTokenator。
那它相當於是,嗯,這是用了JM4的FoistTokenator。
3:35.920–3:40.920
ja這個是,嗯,這個是TTS嗎?好像不是TTS。
這個是,嗯,這個是TTS嗎?好像不是TTS。
3:40.920–3:44.920
ja還真是用了千文三的Valba這個模型。
還真是用了千文三的Valba這個模型。
3:44.920–3:48.920
ja然後呢,它其實就相當於把幾個小模型的一個功能集成在一起。
然後呢,它其實就相當於把幾個小模型的一個功能集成在一起。
3:48.920–3:52.920
ja然後通過工程的能力,然後把它們進行做了一個拼接。
然後通過工程的能力,然後把它們進行做了一個拼接。
3:52.920–4:03.920
ja嗯,那如果感興趣的話呢,可以來嘗試一下。這個模型還是非常小哈。
嗯,那如果感興趣的話呢,可以來嘗試一下。這個模型還是非常小哈。
4:03.920–4:06.920
ja應該是可以在手機上去部署起來的。
應該是可以在手機上去部署起來的。
4:06.920–4:08.236
ja當然呢,那可以等等,
當然呢,那可以等等,
4:08.236–4:10.209
ja應該會有一些第三方的一些工具,
應該會有一些第三方的一些工具,
4:10.209–4:11.920
ja會把這些產品模型提升起來。
會把這些產品模型提升起來。
4:11.920–4:14.920
ja能在本地運行。目前它這個模型沒有量化之前是7個G。
能在本地運行。目前它這個模型沒有量化之前是7個G。
4:14.920–4:17.920
ja那比如說Q4的話,應該是在3、4個G左右的一個大小。
那比如說Q4的話,應該是在3、4個G左右的一個大小。
4:17.920–4:18.920
ja完全是可以在手機上跑起來的。
完全是可以在手機上跑起來的。
4:18.920–4:20.920
ja好的,今天就介紹在這兒。謝謝大家。
好的,今天就介紹在這兒。謝謝大家。
4:20.920–4:21.619
ja謝謝大家。
謝謝大家。

影片筆記:0.6B小模型,彻底解决AI语音对话“抢话”与“冷场”问题!SoulX-Duplug实机演示

一句話總結

影片介紹了名為 SoloX DuPRO 0.6B 的小型語音交互模型,該模型由多個小模型拼接而成(被稱為「縫合怪」),參數量僅 0.6B,可在手機或 Mac 等本地設備運行,並實機演示了其實時對話、快速響應及語音打斷功能。

核心重點

  • 模型架構:SoloX DuPRO 0.6B 被描述為「縫合怪」,由語音識別(SR)、底層語言模型(LM)及語音合成(TTS)等多個小模型拼接而成。
  • 本地部署能力:模型參數量極小(0.6B),原始大小約 7GB,量化後(Q4)約 3-4GB,理論上可在手機、Mac 等本地設備運行。
  • 實時對話功能:演示展示了實時識別、快速響應以及支持語音打斷(Interruption)的功能,旨在解決 AI 語音對話中的「搶話」與「冷場」問題。
  • 技術組成:提及使用了千問(Qwen)相關的 0.6B 模型、JM4 的 FoistTokenator 以及 Valba 模型。
  • 框架限制:目前主要在 GitHub 倉庫運行推理,框架支持有限,提及 llama.cpp 可能未完全支持,OpenBnB 推出的 llama.cpp-OMINI 框架通用性較低。

詳細大綱

  1. 模型介紹與特性
  • 名稱:SoloX DuPRO 0.6B。
  • 特性:被描述為「全商工」(實時對話),參數量僅 0.6B。
  • 運行環境:可在手機、Mac 等本地設備運行。
  1. 技術架構解析
  • 組成:包含語音識別(SR)、底層語言模型(LM)推理、語音合成(TTS)。
  • 評價:被稱為「縫合怪」,通過工程能力拼接小模型。
  • 性能:處理速度極快,模擬完整模型對話體驗。
  1. 安裝與框架支持
  • 來源:GitHub 倉庫。
  • 框架限制:llama.cpp 可能不支持;OpenBnB 推出的 llama.cpp-OMINI 框架剛出,通用性較低。
  1. 實時對話演示
  • 功能展示:實時識別、快速響應、支持語音打斷。
  • 對話內容:詢問模型身份、功能及內部組件。
  1. 部署與量化
  • 原始大小:約 7GB。
  • 量化後大小(Q4):約 3-4GB。
  • 未來展望:可能有第三方工具提升本地運行能力。

工具 / 模型 / 名詞整理

  • SoloX DuPRO 0.6B:影片介紹的小型語音交互模型。
  • 千問 3 (Qwen 3):提及使用的模型相關技術。
  • JM / JM4:在「千問的 JM」及「JM4」中出現,具體指代不明。
  • LM:語言模型(Language Model)。
  • TTS:語音合成(Text-to-Speech)。
  • SR:語音識別(Speech Recognition)。
  • Github:代碼托管平台。
  • NAMA.CPP:疑點,通常為 llama.cpp。
  • OpenBnB:提及的機構或框架相關名稱。
  • NAMA.CPP-OMINI:疑點,通常為 llama.cpp-OMINI。
  • Elva:提及的名稱。
  • 阿里集團:提及的相關機構。
  • Mac:運行環境之一。
  • RM模型:在「把這個模型它的 RM 模型換成那個大模型」中出現,具體指代不明。
  • FoistTokenator:提及「JM4 的 FoistTokenator」,疑為技術術語聽寫錯誤。
  • 千文三:疑點,應指千問。
  • Valba:提及「千文三的 Valba 這個模型」,具體模型名稱需查證。
  • Q4:量化格式。

操作流程整理

  1. 模型構建:將語音識別(SR)、底層語言模型(LM)及語音合成(TTS)等多個小模型拼接,形成 SoloX DuPRO 0.6B。
  2. 本地部署準備
  • 從 GitHub 倉庫獲取模型。
  • 考慮量化處理:原始模型約 7GB,量化為 Q4 格式後約 3-4GB,以適應手機或 Mac 等本地設備。
  1. 框架配置
  • 嘗試在本地運行推理。
  • 注意框架兼容性:llama.cpp 可能未完全支持;OpenBnB 推出的 llama.cpp-OMINI 框架通用性較低。
  1. 實機演示操作
  • 啟動實時對話功能。
  • 進行語音輸入,測試實時識別與快速響應。
  • 測試語音打斷(Interruption)功能。
  • 詢問模型身份、功能及內部組件以驗證效果。

值得注意的限制或風險

  • 框架兼容性不足:llama.cpp 可能不支持該模型;OpenBnB 推出的 llama.cpp-OMINI 框架剛推出,通用性較低。
  • 模型架構複雜性:被稱為「縫合怪」,由多個小模型拼接而成,可能涉及較高的工程維護成本或整合難度。
  • 本地運行資源需求:雖然量化後大小為 3-4GB,但仍需確認具體設備(手機、Mac)的實際運行穩定性與性能表現。
  • 第三方工具依賴:未來可能需要第三方工具來提升本地運行能力,目前支持有限。

逐字稿辨識疑點

  • 全商工:逐字稿多次提及,疑為「全端」或「全雙工」之聽寫錯誤。
  • NAMA.CPP:逐字稿提及,疑為 llama.cpp 之聽寫錯誤。
  • OpenBnB:逐字稿提及,疑為 OpenBMB 或相關機構名稱之聽寫錯誤。
  • NAMA.CPP-OMINI:疑為 llama.cpp-OMINI 之聽寫錯誤。
  • JM:在「千問的 JM」及「JM4」中出現,具體指代不明,疑為特定組件縮寫或聽寫錯誤。
  • FoistTokenator:逐字稿提及「JM4 的 FoistTokenator」,疑為 Fast Tokenizer 或其他技術術語之聽寫錯誤。
  • 千文三:疑為 千問 3 之聽寫錯誤。
  • Valba:逐字稿提及「千文三的 Valba 這個模型」,具體模型名稱需查證,疑為聽寫錯誤。
  • RM模型:在「把這個模型它的 RM 模型換成那個大模型」中出現,具體指代不明,疑為 LLMLM 之聽寫錯誤。

可延伸追問

  • SoloX DuPRO 0.6B 的「縫合怪」架構具體由哪些模型組成?各部分的比例或權重如何分配?
  • 量化為 Q4 格式後,模型的語音識別準確率和語音合成質量是否有顯著下降?
  • OpenBnB 推出的 llama.cpp-OMINI 框架具體支持哪些功能?為何通用性較低?
  • 在手機或 Mac 上運行該模型時,實際的延遲(Latency)和功耗表現如何?
  • 「JM4 的 FoistTokenator」具體是什麼技術?它在整個流程中起什麼作用?
  • 如何解決 llama.cpp 可能不支持該模型的問題?是否有替代方案或預計的更新計劃?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習