0:00.000–0:05.380
昨天晚上,月資暗面把KIMI K3正式開放了。
0:05.640–0:09.980
這個模型幹了兩件非常有衝擊力的事情。
0:10.240–0:16.120
第一,他把全球開源模型的參數記錄直接翻了一個倍。
0:16.120–0:20.220
K3模型的參數是2.8萬億。
0:20.480–0:26.880
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
0:26.880–0:29.700
K3的大小差不多是他的兩倍。
0:29.960–0:36.860
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
0:37.120–0:42.500
第一名和第二名分別是Cloud5和GPT5.6瘦。
0:42.760–0:47.620
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
0:48.120–0:52.740
開源模型第一次站到了B原刺旗艦模型的前面。
0:52.740–0:59.820
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
1:00.240–1:01.740
先來看一下時間線。
1:02.160–1:08.740
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
1:08.740–1:11.560
大家就知道可能有新的模型要上了。
1:11.940–1:16.420
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
1:16.420–1:20.800
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
1:21.040–1:27.300
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
1:27.580–1:29.700
這個時間點呢,也非常的微妙。
1:29.960–1:33.760
正好卡在上海的世界人工智能大會前面。
1:34.080–1:37.420
而且呢,月之岸面也正在談新的一輪融資。
1:37.760–1:40.280
估值呢,大約是315億美元。
1:40.280–1:44.220
KIMI K3這個成績單是給誰看的,就不用我多說了。
1:44.220–1:46.220
然後來看一下啊,規格。
1:46.220–1:49.820
2.8萬億這個參數呢,肯定是非常吸引眼球的。
1:49.820–1:55.340
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
1:55.340–2:00.340
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
2:00.340–2:05.420
一個叫KDA,KIMI Delta Tension混合線性注意力。
2:05.420–2:13.900
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
2:13.900–2:20.100
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
2:20.100–2:22.780
然後一層用完整的全注意力。
2:22.780–2:27.180
這裡省下來的算力,換成一個東西,100萬Token的上下文。
2:27.180–2:32.620
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
2:32.620–2:35.500
另外一個新的東西叫注意力殘差。
2:35.500–2:40.500
讓深層網絡把淺層的注意力信息呢,直接接力上來。
2:40.500–2:46.820
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
2:46.820–2:51.380
然後就是混合專家系統這塊,做的也非常非常的激進。
2:51.380–2:56.780
整個模型呢,有896個專家,每次推理呢只激活16個。
2:56.780–3:04.260
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
3:04.260–3:09.300
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
3:09.300–3:18.180
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
3:18.180–3:23.020
那麼K3呢,是拿了1687分,全球第三名。
3:23.020–3:30.820
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
3:30.820–3:34.500
是目前所有看源模型裡面得分最高的。
3:34.500–3:42.940
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
3:42.940–3:46.540
也是當時公開成績裡面最高的。
3:46.540–3:50.620
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
3:50.620–3:53.020
當然,測評呢也只能說明一半。
3:53.020–3:56.220
另一半呢,我們還要真實上手去測試。
3:56.220–3:58.220
這裡呢,我測試了兩個案例。
3:58.220–4:04.900
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
4:04.900–4:12.340
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
4:12.340–4:14.980
並且直接以網頁的形式展現。
4:14.980–4:18.780
那麼這個呢,就是它一次性完成的任務。
4:18.780–4:26.020
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
4:26.020–4:28.380
這是等於是PPT的封面。
4:28.380–4:30.900
然後它最主要的幾個參數。
4:30.900–4:38.060
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
4:38.060–4:43.300
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
4:43.300–4:46.740
而且內容非常的詳盡,非常的豐富。
4:46.740–4:52.780
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
4:52.780–4:56.340
目前看下來沒有找到很明顯的錯誤。
4:56.340–4:59.820
基本上可以達到一個直接使用的水平了。
4:59.820–5:08.700
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
5:08.700–5:10.020
這能力我覺得還是不錯的。
5:10.020–5:13.620
然後我在測試過程當中發現一個比較明顯的問題。
5:13.620–5:17.460
就是不算是現在使用的人比較多還是什麼的。
5:17.460–5:20.500
就是我發送了這樣一條Planter過去。
5:20.500–5:25.060
它整個完成這個任務的耗時,時間非常的長。
5:25.060–5:27.140
至少花費了十幾分鐘。
5:27.140–5:33.340
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
5:33.340–5:35.340
因為任務並不是特別的難。
5:35.340–5:37.220
然後它的內容也不是很多。
5:37.220–5:41.220
用KIMIKESA生成任務的時間是超出了我的預期的。
5:41.220–5:46.820
然後第二個任務呢,是我讓它基於我前面兩期視頻。
5:46.820–5:49.700
我是創建了一個體感遊戲。
5:49.700–5:55.100
用谷歌的模型,它可以監控我們人體的關節、部位。
5:55.100–5:57.900
首先我是做了一個體感監視器。
5:57.900–5:59.900
這個在上一期視頻已經講過了。
5:59.900–6:03.340
包括它的項目,我已經開運到KitaHub上面去了。
6:03.340–6:08.140
後面呢,我又用GPT5.64添加了幾個體感遊戲。
6:08.140–6:13.180
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
6:13.180–6:14.780
以及雙輪對打的遊戲。
6:14.780–6:18.060
這個是之前評測Fib5以及GPT5.6生成的。
6:18.060–6:25.140
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
6:25.140–6:29.940
那其實像這套框架,在我原來的項目裡面,它已經生成了。
6:29.940–6:33.420
也就是它的模型啊,它的底層邏輯啊,框架都有了。
6:33.420–6:37.060
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
6:37.060–6:39.660
那麼今天用KIMIKESA出現了兩個問題。
6:39.660–6:42.420
第一個問題呢,就是剛才我提到的。
6:42.420–6:44.740
它的耗時呢,非常非常的久。
6:44.740–6:48.260
運行了差不多十幾二十分鐘,都沒有完成。
6:48.260–6:54.740
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
6:54.740–6:57.420
也就是一個月是99塊錢。
6:57.420–7:02.420
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
7:02.420–7:04.540
如果你開通的是第一個等級的套餐,
7:04.540–7:08.740
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
7:08.740–7:11.580
完顺呢,我在測試第二個論文的時候,可以看到,
7:11.580–7:14.700
它給我羅列的To-Do裡面有這麼多步驟。
7:14.700–7:18.060
我覺得這個步驟是設計的有點過於冷餘的。
7:18.060–7:22.380
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
7:22.380–7:25.980
它五個小時的用量限制就已經達到了。
7:25.980–7:29.580
然後並且呢,週用量也達到了20%的使用。
7:29.580–7:35.100
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
7:35.100–7:36.460
第二個任務還沒有完成。
7:36.460–7:40.060
有可能是因為這個模型太大,然後現在用的人太多。
7:40.060–7:42.940
所以它整體的一個使用量限制比較少。
7:42.940–7:45.980
包括我開通的這個第二等級的會員啊,
7:45.980–7:48.940
它並不支持100萬的上下文。
7:48.940–7:50.460
只有256K。
7:50.460–7:53.660
那麼你必須是開通這個200塊錢一個月的啊,
7:53.660–7:56.940
才可以享受100萬的上下文長度。
7:56.940–7:59.340
給我的感覺還是不知道因為算力,
7:59.340–8:00.620
還是什麼其他原因啊。
8:00.620–8:02.620
誠意不是特別的夠。
8:02.620–8:04.620
接下來呢,說一下價格。
8:04.620–8:08.620
這個可能是對使用者、開發者殺傷力最大的部分。
8:08.620–8:13.100
輸入呢是3美元每100萬Token,輸出呢是15美元。
8:13.100–8:16.220
如果是緩存命中的話,輸入只要3毛。
8:16.220–8:19.100
這一塊呢,一直是KIMI做的比較好的地方。
8:19.100–8:22.220
OK,那麼強的地方呢已經說完了。
8:22.220–8:24.620
接下來呢,來泼兩盆冷水。
8:24.620–8:28.460
第一盤呢,全球最大開用模型的這個說法呢,
8:28.460–8:30.460
它現在還只是一個期貨。
8:30.460–8:31.980
模型能用是真的。
8:31.980–8:33.900
但是呢,權重還沒有開放。
8:33.900–8:36.780
官方是承諾在7月27號之前,
8:36.780–8:39.420
放出完整的權重和技術報告。
8:39.420–8:41.980
第二盤呢,就算是權重開放了,
8:41.980–8:44.460
我們自己本地電腦呢也是跑不動的。
8:44.460–8:46.460
2.8萬億參數呢,
8:46.460–8:49.900
就算你有1.5TB內存的Magic Dodo集群,
8:49.900–8:51.260
跑起來都夠欠。
8:51.260–8:53.580
這是一個數據中心級別的模型。
8:53.580–8:55.500
所以開源對於個人的意義呢,
8:55.500–8:58.940
更多是讓第三方平台能便宜的把它跑起來,
8:58.940–9:01.420
而不是說把它下載到本地自己去跑。
0:00.000–0:05.380
昨天晚上,月資暗面把KIMI K3正式開放了。
0:05.640–0:09.980
這個模型幹了兩件非常有衝擊力的事情。
0:10.240–0:16.120
第一,他把全球開源模型的參數記錄直接翻了一個倍。
0:16.120–0:20.220
K3模型的參數是2.8萬億。
0:20.480–0:26.880
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
0:26.880–0:29.700
K3的大小差不多是他的兩倍。
0:29.960–0:36.860
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
0:37.120–0:42.500
第一名和第二名分別是Cloud5和GPT5.6瘦。
0:42.760–0:47.620
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
0:48.120–0:52.740
開源模型第一次站到了B原刺旗艦模型的前面。
0:52.740–0:59.820
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
1:00.240–1:01.740
先來看一下時間線。
1:02.160–1:08.740
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
1:08.740–1:11.560
大家就知道可能有新的模型要上了。
1:11.940–1:16.420
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
1:16.420–1:20.800
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
1:21.040–1:27.300
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
1:27.580–1:29.700
這個時間點呢,也非常的微妙。
1:29.960–1:33.760
正好卡在上海的世界人工智能大會前面。
1:34.080–1:37.420
而且呢,月之岸面也正在談新的一輪融資。
1:37.760–1:40.280
估值呢,大約是315億美元。
1:40.280–1:44.220
KIMI K3這個成績單是給誰看的,就不用我多說了。
1:44.220–1:46.220
然後來看一下啊,規格。
1:46.220–1:49.820
2.8萬億這個參數呢,肯定是非常吸引眼球的。
1:49.820–1:55.340
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
1:55.340–2:00.340
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
2:00.340–2:05.420
一個叫KDA,KIMI Delta Tension混合線性注意力。
2:05.420–2:13.900
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
2:13.900–2:20.100
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
2:20.100–2:22.780
然後一層用完整的全注意力。
2:22.780–2:27.180
這裡省下來的算力,換成一個東西,100萬Token的上下文。
2:27.180–2:32.620
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
2:32.620–2:35.500
另外一個新的東西叫注意力殘差。
2:35.500–2:40.500
讓深層網絡把淺層的注意力信息呢,直接接力上來。
2:40.500–2:46.820
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
2:46.820–2:51.380
然後就是混合專家系統這塊,做的也非常非常的激進。
2:51.380–2:56.780
整個模型呢,有896個專家,每次推理呢只激活16個。
2:56.780–3:04.260
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
3:04.260–3:09.300
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
3:09.300–3:18.180
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
3:18.180–3:23.020
那麼K3呢,是拿了1687分,全球第三名。
3:23.020–3:30.820
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
3:30.820–3:34.500
是目前所有看源模型裡面得分最高的。
3:34.500–3:42.940
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
3:42.940–3:46.540
也是當時公開成績裡面最高的。
3:46.540–3:50.620
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
3:50.620–3:53.020
當然,測評呢也只能說明一半。
3:53.020–3:56.220
另一半呢,我們還要真實上手去測試。
3:56.220–3:58.220
這裡呢,我測試了兩個案例。
3:58.220–4:04.900
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
4:04.900–4:12.340
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
4:12.340–4:14.980
並且直接以網頁的形式展現。
4:14.980–4:18.780
那麼這個呢,就是它一次性完成的任務。
4:18.780–4:26.020
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
4:26.020–4:28.380
這是等於是PPT的封面。
4:28.380–4:30.900
然後它最主要的幾個參數。
4:30.900–4:38.060
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
4:38.060–4:43.300
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
4:43.300–4:46.740
而且內容非常的詳盡,非常的豐富。
4:46.740–4:52.780
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
4:52.780–4:56.340
目前看下來沒有找到很明顯的錯誤。
4:56.340–4:59.820
基本上可以達到一個直接使用的水平了。
4:59.820–5:08.700
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
5:08.700–5:10.020
這能力我覺得還是不錯的。
5:10.020–5:13.620
然後我在測試過程當中發現一個比較明顯的問題。
5:13.620–5:17.460
就是不算是現在使用的人比較多還是什麼的。
5:17.460–5:20.500
就是我發送了這樣一條Planter過去。
5:20.500–5:25.060
它整個完成這個任務的耗時,時間非常的長。
5:25.060–5:27.140
至少花費了十幾分鐘。
5:27.140–5:33.340
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
5:33.340–5:35.340
因為任務並不是特別的難。
5:35.340–5:37.220
然後它的內容也不是很多。
5:37.220–5:41.220
用KIMIKESA生成任務的時間是超出了我的預期的。
5:41.220–5:46.820
然後第二個任務呢,是我讓它基於我前面兩期視頻。
5:46.820–5:49.700
我是創建了一個體感遊戲。
5:49.700–5:55.100
用谷歌的模型,它可以監控我們人體的關節、部位。
5:55.100–5:57.900
首先我是做了一個體感監視器。
5:57.900–5:59.900
這個在上一期視頻已經講過了。
5:59.900–6:03.340
包括它的項目,我已經開運到KitaHub上面去了。
6:03.340–6:08.140
後面呢,我又用GPT5.64添加了幾個體感遊戲。
6:08.140–6:13.180
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
6:13.180–6:14.780
以及雙輪對打的遊戲。
6:14.780–6:18.060
這個是之前評測Fib5以及GPT5.6生成的。
6:18.060–6:25.140
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
6:25.140–6:29.940
那其實像這套框架,在我原來的項目裡面,它已經生成了。
6:29.940–6:33.420
也就是它的模型啊,它的底層邏輯啊,框架都有了。
6:33.420–6:37.060
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
6:37.060–6:39.660
那麼今天用KIMIKESA出現了兩個問題。
6:39.660–6:42.420
第一個問題呢,就是剛才我提到的。
6:42.420–6:44.740
它的耗時呢,非常非常的久。
6:44.740–6:48.260
運行了差不多十幾二十分鐘,都沒有完成。
6:48.260–6:54.740
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
6:54.740–6:57.420
也就是一個月是99塊錢。
6:57.420–7:02.420
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
7:02.420–7:04.540
如果你開通的是第一個等級的套餐,
7:04.540–7:08.740
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
7:08.740–7:11.580
完顺呢,我在測試第二個論文的時候,可以看到,
7:11.580–7:14.700
它給我羅列的To-Do裡面有這麼多步驟。
7:14.700–7:18.060
我覺得這個步驟是設計的有點過於冷餘的。
7:18.060–7:22.380
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
7:22.380–7:25.980
它五個小時的用量限制就已經達到了。
7:25.980–7:29.580
然後並且呢,週用量也達到了20%的使用。
7:29.580–7:35.100
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
7:35.100–7:36.460
第二個任務還沒有完成。
7:36.460–7:40.060
有可能是因為這個模型太大,然後現在用的人太多。
7:40.060–7:42.940
所以它整體的一個使用量限制比較少。
7:42.940–7:45.980
包括我開通的這個第二等級的會員啊,
7:45.980–7:48.940
它並不支持100萬的上下文。
7:48.940–7:50.460
只有256K。
7:50.460–7:53.660
那麼你必須是開通這個200塊錢一個月的啊,
7:53.660–7:56.940
才可以享受100萬的上下文長度。
7:56.940–7:59.340
給我的感覺還是不知道因為算力,
7:59.340–8:00.620
還是什麼其他原因啊。
8:00.620–8:02.620
誠意不是特別的夠。
8:02.620–8:04.620
接下來呢,說一下價格。
8:04.620–8:08.620
這個可能是對使用者、開發者殺傷力最大的部分。
8:08.620–8:13.100
輸入呢是3美元每100萬Token,輸出呢是15美元。
8:13.100–8:16.220
如果是緩存命中的話,輸入只要3毛。
8:16.220–8:19.100
這一塊呢,一直是KIMI做的比較好的地方。
8:19.100–8:22.220
OK,那麼強的地方呢已經說完了。
8:22.220–8:24.620
接下來呢,來泼兩盆冷水。
8:24.620–8:28.460
第一盤呢,全球最大開用模型的這個說法呢,
8:28.460–8:30.460
它現在還只是一個期貨。
8:30.460–8:31.980
模型能用是真的。
8:31.980–8:33.900
但是呢,權重還沒有開放。
8:33.900–8:36.780
官方是承諾在7月27號之前,
8:36.780–8:39.420
放出完整的權重和技術報告。
8:39.420–8:41.980
第二盤呢,就算是權重開放了,
8:41.980–8:44.460
我們自己本地電腦呢也是跑不動的。
8:44.460–8:46.460
2.8萬億參數呢,
8:46.460–8:49.900
就算你有1.5TB內存的Magic Dodo集群,
8:49.900–8:51.260
跑起來都夠欠。
8:51.260–8:53.580
這是一個數據中心級別的模型。
8:53.580–8:55.500
所以開源對於個人的意義呢,
8:55.500–8:58.940
更多是讓第三方平台能便宜的把它跑起來,
8:58.940–9:01.420
而不是說把它下載到本地自己去跑。
0:00.000–0:05.380
昨天晚上,月資暗面把KIMI K3正式開放了。
昨天晚上,月資暗面把KIMI K3正式開放了。
0:05.640–0:09.980
這個模型幹了兩件非常有衝擊力的事情。
這個模型幹了兩件非常有衝擊力的事情。
0:10.240–0:16.120
第一,他把全球開源模型的參數記錄直接翻了一個倍。
第一,他把全球開源模型的參數記錄直接翻了一個倍。
0:16.120–0:20.220
K3模型的參數是2.8萬億。
K3模型的參數是2.8萬億。
0:20.480–0:26.880
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
0:26.880–0:29.700
K3的大小差不多是他的兩倍。
K3的大小差不多是他的兩倍。
0:29.960–0:36.860
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
0:37.120–0:42.500
第一名和第二名分別是Cloud5和GPT5.6瘦。
第一名和第二名分別是Cloud5和GPT5.6瘦。
0:42.760–0:47.620
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
0:48.120–0:52.740
開源模型第一次站到了B原刺旗艦模型的前面。
開源模型第一次站到了B原刺旗艦模型的前面。
0:52.740–0:59.820
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
1:00.240–1:01.740
先來看一下時間線。
先來看一下時間線。
1:02.160–1:08.740
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
1:08.740–1:11.560
大家就知道可能有新的模型要上了。
大家就知道可能有新的模型要上了。
1:11.940–1:16.420
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
1:16.420–1:20.800
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
1:21.040–1:27.300
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
1:27.580–1:29.700
這個時間點呢,也非常的微妙。
這個時間點呢,也非常的微妙。
1:29.960–1:33.760
正好卡在上海的世界人工智能大會前面。
正好卡在上海的世界人工智能大會前面。
1:34.080–1:37.420
而且呢,月之岸面也正在談新的一輪融資。
而且呢,月之岸面也正在談新的一輪融資。
1:37.760–1:40.280
估值呢,大約是315億美元。
估值呢,大約是315億美元。
1:40.280–1:44.220
KIMI K3這個成績單是給誰看的,就不用我多說了。
KIMI K3這個成績單是給誰看的,就不用我多說了。
1:44.220–1:46.220
然後來看一下啊,規格。
然後來看一下啊,規格。
1:46.220–1:49.820
2.8萬億這個參數呢,肯定是非常吸引眼球的。
2.8萬億這個參數呢,肯定是非常吸引眼球的。
1:49.820–1:55.340
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
1:55.340–2:00.340
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
2:00.340–2:05.420
一個叫KDA,KIMI Delta Tension混合線性注意力。
一個叫KDA,KIMI Delta Tension混合線性注意力。
2:05.420–2:13.900
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
2:13.900–2:20.100
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
2:20.100–2:22.780
然後一層用完整的全注意力。
然後一層用完整的全注意力。
2:22.780–2:27.180
這裡省下來的算力,換成一個東西,100萬Token的上下文。
這裡省下來的算力,換成一個東西,100萬Token的上下文。
2:27.180–2:32.620
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
2:32.620–2:35.500
另外一個新的東西叫注意力殘差。
另外一個新的東西叫注意力殘差。
2:35.500–2:40.500
讓深層網絡把淺層的注意力信息呢,直接接力上來。
讓深層網絡把淺層的注意力信息呢,直接接力上來。
2:40.500–2:46.820
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
2:46.820–2:51.380
然後就是混合專家系統這塊,做的也非常非常的激進。
然後就是混合專家系統這塊,做的也非常非常的激進。
2:51.380–2:56.780
整個模型呢,有896個專家,每次推理呢只激活16個。
整個模型呢,有896個專家,每次推理呢只激活16個。
2:56.780–3:04.260
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
3:04.260–3:09.300
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
3:09.300–3:18.180
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
3:18.180–3:23.020
那麼K3呢,是拿了1687分,全球第三名。
那麼K3呢,是拿了1687分,全球第三名。
3:23.020–3:30.820
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
3:30.820–3:34.500
是目前所有看源模型裡面得分最高的。
是目前所有看源模型裡面得分最高的。
3:34.500–3:42.940
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
3:42.940–3:46.540
也是當時公開成績裡面最高的。
也是當時公開成績裡面最高的。
3:46.540–3:50.620
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
3:50.620–3:53.020
當然,測評呢也只能說明一半。
當然,測評呢也只能說明一半。
3:53.020–3:56.220
另一半呢,我們還要真實上手去測試。
另一半呢,我們還要真實上手去測試。
3:56.220–3:58.220
這裡呢,我測試了兩個案例。
這裡呢,我測試了兩個案例。
3:58.220–4:04.900
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
4:04.900–4:12.340
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
4:12.340–4:14.980
並且直接以網頁的形式展現。
並且直接以網頁的形式展現。
4:14.980–4:18.780
那麼這個呢,就是它一次性完成的任務。
那麼這個呢,就是它一次性完成的任務。
4:18.780–4:26.020
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
4:26.020–4:28.380
這是等於是PPT的封面。
這是等於是PPT的封面。
4:28.380–4:30.900
然後它最主要的幾個參數。
然後它最主要的幾個參數。
4:30.900–4:38.060
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
4:38.060–4:43.300
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
4:43.300–4:46.740
而且內容非常的詳盡,非常的豐富。
而且內容非常的詳盡,非常的豐富。
4:46.740–4:52.780
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
4:52.780–4:56.340
目前看下來沒有找到很明顯的錯誤。
目前看下來沒有找到很明顯的錯誤。
4:56.340–4:59.820
基本上可以達到一個直接使用的水平了。
基本上可以達到一個直接使用的水平了。
4:59.820–5:08.700
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
5:08.700–5:10.020
這能力我覺得還是不錯的。
這能力我覺得還是不錯的。
5:10.020–5:13.620
然後我在測試過程當中發現一個比較明顯的問題。
然後我在測試過程當中發現一個比較明顯的問題。
5:13.620–5:17.460
就是不算是現在使用的人比較多還是什麼的。
就是不算是現在使用的人比較多還是什麼的。
5:17.460–5:20.500
就是我發送了這樣一條Planter過去。
就是我發送了這樣一條Planter過去。
5:20.500–5:25.060
它整個完成這個任務的耗時,時間非常的長。
它整個完成這個任務的耗時,時間非常的長。
5:25.060–5:27.140
至少花費了十幾分鐘。
至少花費了十幾分鐘。
5:27.140–5:33.340
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
5:33.340–5:35.340
因為任務並不是特別的難。
因為任務並不是特別的難。
5:35.340–5:37.220
然後它的內容也不是很多。
然後它的內容也不是很多。
5:37.220–5:41.220
用KIMIKESA生成任務的時間是超出了我的預期的。
用KIMIKESA生成任務的時間是超出了我的預期的。
5:41.220–5:46.820
然後第二個任務呢,是我讓它基於我前面兩期視頻。
然後第二個任務呢,是我讓它基於我前面兩期視頻。
5:46.820–5:49.700
我是創建了一個體感遊戲。
我是創建了一個體感遊戲。
5:49.700–5:55.100
用谷歌的模型,它可以監控我們人體的關節、部位。
用谷歌的模型,它可以監控我們人體的關節、部位。
5:55.100–5:57.900
首先我是做了一個體感監視器。
首先我是做了一個體感監視器。
5:57.900–5:59.900
這個在上一期視頻已經講過了。
這個在上一期視頻已經講過了。
5:59.900–6:03.340
包括它的項目,我已經開運到KitaHub上面去了。
包括它的項目,我已經開運到KitaHub上面去了。
6:03.340–6:08.140
後面呢,我又用GPT5.64添加了幾個體感遊戲。
後面呢,我又用GPT5.64添加了幾個體感遊戲。
6:08.140–6:13.180
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
6:13.180–6:14.780
以及雙輪對打的遊戲。
以及雙輪對打的遊戲。
6:14.780–6:18.060
這個是之前評測Fib5以及GPT5.6生成的。
這個是之前評測Fib5以及GPT5.6生成的。
6:18.060–6:25.140
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
6:25.140–6:29.940
那其實像這套框架,在我原來的項目裡面,它已經生成了。
那其實像這套框架,在我原來的項目裡面,它已經生成了。
6:29.940–6:33.420
也就是它的模型啊,它的底層邏輯啊,框架都有了。
也就是它的模型啊,它的底層邏輯啊,框架都有了。
6:33.420–6:37.060
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
6:37.060–6:39.660
那麼今天用KIMIKESA出現了兩個問題。
那麼今天用KIMIKESA出現了兩個問題。
6:39.660–6:42.420
第一個問題呢,就是剛才我提到的。
第一個問題呢,就是剛才我提到的。
6:42.420–6:44.740
它的耗時呢,非常非常的久。
它的耗時呢,非常非常的久。
6:44.740–6:48.260
運行了差不多十幾二十分鐘,都沒有完成。
運行了差不多十幾二十分鐘,都沒有完成。
6:48.260–6:54.740
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
6:54.740–6:57.420
也就是一個月是99塊錢。
也就是一個月是99塊錢。
6:57.420–7:02.420
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
7:02.420–7:04.540
如果你開通的是第一個等級的套餐,
如果你開通的是第一個等級的套餐,
7:04.540–7:08.740
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
7:08.740–7:11.580
完顺呢,我在測試第二個論文的時候,可以看到,
完顺呢,我在測試第二個論文的時候,可以看到,
7:11.580–7:14.700
它給我羅列的To-Do裡面有這麼多步驟。
它給我羅列的To-Do裡面有這麼多步驟。
7:14.700–7:18.060
我覺得這個步驟是設計的有點過於冷餘的。
我覺得這個步驟是設計的有點過於冷餘的。
7:18.060–7:22.380
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
7:22.380–7:25.980
它五個小時的用量限制就已經達到了。
它五個小時的用量限制就已經達到了。
7:25.980–7:29.580
然後並且呢,週用量也達到了20%的使用。
然後並且呢,週用量也達到了20%的使用。
7:29.580–7:35.100
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
7:35.100–7:36.460
第二個任務還沒有完成。
第二個任務還沒有完成。
7:36.460–7:40.060
有可能是因為這個模型太大,然後現在用的人太多。
有可能是因為這個模型太大,然後現在用的人太多。
7:40.060–7:42.940
所以它整體的一個使用量限制比較少。
所以它整體的一個使用量限制比較少。
7:42.940–7:45.980
包括我開通的這個第二等級的會員啊,
包括我開通的這個第二等級的會員啊,
7:45.980–7:48.940
它並不支持100萬的上下文。
它並不支持100萬的上下文。
7:48.940–7:50.460
只有256K。
只有256K。
7:50.460–7:53.660
那麼你必須是開通這個200塊錢一個月的啊,
那麼你必須是開通這個200塊錢一個月的啊,
7:53.660–7:56.940
才可以享受100萬的上下文長度。
才可以享受100萬的上下文長度。
7:56.940–7:59.340
給我的感覺還是不知道因為算力,
給我的感覺還是不知道因為算力,
7:59.340–8:00.620
還是什麼其他原因啊。
還是什麼其他原因啊。
8:00.620–8:02.620
誠意不是特別的夠。
誠意不是特別的夠。
8:02.620–8:04.620
接下來呢,說一下價格。
接下來呢,說一下價格。
8:04.620–8:08.620
這個可能是對使用者、開發者殺傷力最大的部分。
這個可能是對使用者、開發者殺傷力最大的部分。
8:08.620–8:13.100
輸入呢是3美元每100萬Token,輸出呢是15美元。
輸入呢是3美元每100萬Token,輸出呢是15美元。
8:13.100–8:16.220
如果是緩存命中的話,輸入只要3毛。
如果是緩存命中的話,輸入只要3毛。
8:16.220–8:19.100
這一塊呢,一直是KIMI做的比較好的地方。
這一塊呢,一直是KIMI做的比較好的地方。
8:19.100–8:22.220
OK,那麼強的地方呢已經說完了。
OK,那麼強的地方呢已經說完了。
8:22.220–8:24.620
接下來呢,來泼兩盆冷水。
接下來呢,來泼兩盆冷水。
8:24.620–8:28.460
第一盤呢,全球最大開用模型的這個說法呢,
第一盤呢,全球最大開用模型的這個說法呢,
8:28.460–8:30.460
它現在還只是一個期貨。
它現在還只是一個期貨。
8:30.460–8:31.980
模型能用是真的。
模型能用是真的。
8:31.980–8:33.900
但是呢,權重還沒有開放。
但是呢,權重還沒有開放。
8:33.900–8:36.780
官方是承諾在7月27號之前,
官方是承諾在7月27號之前,
8:36.780–8:39.420
放出完整的權重和技術報告。
放出完整的權重和技術報告。
8:39.420–8:41.980
第二盤呢,就算是權重開放了,
第二盤呢,就算是權重開放了,
8:41.980–8:44.460
我們自己本地電腦呢也是跑不動的。
我們自己本地電腦呢也是跑不動的。
8:44.460–8:46.460
2.8萬億參數呢,
2.8萬億參數呢,
8:46.460–8:49.900
就算你有1.5TB內存的Magic Dodo集群,
就算你有1.5TB內存的Magic Dodo集群,
8:49.900–8:51.260
跑起來都夠欠。
跑起來都夠欠。
8:51.260–8:53.580
這是一個數據中心級別的模型。
這是一個數據中心級別的模型。
8:53.580–8:55.500
所以開源對於個人的意義呢,
所以開源對於個人的意義呢,
8:55.500–8:58.940
更多是讓第三方平台能便宜的把它跑起來,
更多是讓第三方平台能便宜的把它跑起來,
8:58.940–9:01.420
而不是說把它下載到本地自己去跑。
而不是說把它下載到本地自己去跑。