實際影片長度:9:02.000。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:05.380
昨天晚上,月資暗面把KIMI K3正式開放了。
0:05.640–0:09.980
這個模型幹了兩件非常有衝擊力的事情。
0:10.240–0:16.120
第一,他把全球開源模型的參數記錄直接翻了一個倍。
0:16.120–0:20.220
K3模型的參數是2.8萬億。
0:20.480–0:26.880
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
0:26.880–0:29.700
K3的大小差不多是他的兩倍。
0:29.960–0:36.860
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
0:37.120–0:42.500
第一名和第二名分別是Cloud5和GPT5.6瘦。
0:42.760–0:47.620
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
0:48.120–0:52.740
開源模型第一次站到了B原刺旗艦模型的前面。
0:52.740–0:59.820
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
1:00.240–1:01.740
先來看一下時間線。
1:02.160–1:08.740
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
1:08.740–1:11.560
大家就知道可能有新的模型要上了。
1:11.940–1:16.420
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
1:16.420–1:20.800
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
1:21.040–1:27.300
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
1:27.580–1:29.700
這個時間點呢,也非常的微妙。
1:29.960–1:33.760
正好卡在上海的世界人工智能大會前面。
1:34.080–1:37.420
而且呢,月之岸面也正在談新的一輪融資。
1:37.760–1:40.280
估值呢,大約是315億美元。
1:40.280–1:44.220
KIMI K3這個成績單是給誰看的,就不用我多說了。
1:44.220–1:46.220
然後來看一下啊,規格。
1:46.220–1:49.820
2.8萬億這個參數呢,肯定是非常吸引眼球的。
1:49.820–1:55.340
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
1:55.340–2:00.340
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
2:00.340–2:05.420
一個叫KDA,KIMI Delta Tension混合線性注意力。
2:05.420–2:13.900
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
2:13.900–2:20.100
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
2:20.100–2:22.780
然後一層用完整的全注意力。
2:22.780–2:27.180
這裡省下來的算力,換成一個東西,100萬Token的上下文。
2:27.180–2:32.620
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
2:32.620–2:35.500
另外一個新的東西叫注意力殘差。
2:35.500–2:40.500
讓深層網絡把淺層的注意力信息呢,直接接力上來。
2:40.500–2:46.820
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
2:46.820–2:51.380
然後就是混合專家系統這塊,做的也非常非常的激進。
2:51.380–2:56.780
整個模型呢,有896個專家,每次推理呢只激活16個。
2:56.780–3:04.260
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
3:04.260–3:09.300
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
3:09.300–3:18.180
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
3:18.180–3:23.020
那麼K3呢,是拿了1687分,全球第三名。
3:23.020–3:30.820
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
3:30.820–3:34.500
是目前所有看源模型裡面得分最高的。
3:34.500–3:42.940
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
3:42.940–3:46.540
也是當時公開成績裡面最高的。
3:46.540–3:50.620
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
3:50.620–3:53.020
當然,測評呢也只能說明一半。
3:53.020–3:56.220
另一半呢,我們還要真實上手去測試。
3:56.220–3:58.220
這裡呢,我測試了兩個案例。
3:58.220–4:04.900
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
4:04.900–4:12.340
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
4:12.340–4:14.980
並且直接以網頁的形式展現。
4:14.980–4:18.780
那麼這個呢,就是它一次性完成的任務。
4:18.780–4:26.020
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
4:26.020–4:28.380
這是等於是PPT的封面。
4:28.380–4:30.900
然後它最主要的幾個參數。
4:30.900–4:38.060
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
4:38.060–4:43.300
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
4:43.300–4:46.740
而且內容非常的詳盡,非常的豐富。
4:46.740–4:52.780
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
4:52.780–4:56.340
目前看下來沒有找到很明顯的錯誤。
4:56.340–4:59.820
基本上可以達到一個直接使用的水平了。
4:59.820–5:08.700
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
5:08.700–5:10.020
這能力我覺得還是不錯的。
5:10.020–5:13.620
然後我在測試過程當中發現一個比較明顯的問題。
5:13.620–5:17.460
就是不算是現在使用的人比較多還是什麼的。
5:17.460–5:20.500
就是我發送了這樣一條Planter過去。
5:20.500–5:25.060
它整個完成這個任務的耗時,時間非常的長。
5:25.060–5:27.140
至少花費了十幾分鐘。
5:27.140–5:33.340
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
5:33.340–5:35.340
因為任務並不是特別的難。
5:35.340–5:37.220
然後它的內容也不是很多。
5:37.220–5:41.220
用KIMIKESA生成任務的時間是超出了我的預期的。
5:41.220–5:46.820
然後第二個任務呢,是我讓它基於我前面兩期視頻。
5:46.820–5:49.700
我是創建了一個體感遊戲。
5:49.700–5:55.100
用谷歌的模型,它可以監控我們人體的關節、部位。
5:55.100–5:57.900
首先我是做了一個體感監視器。
5:57.900–5:59.900
這個在上一期視頻已經講過了。
5:59.900–6:03.340
包括它的項目,我已經開運到KitaHub上面去了。
6:03.340–6:08.140
後面呢,我又用GPT5.64添加了幾個體感遊戲。
6:08.140–6:13.180
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
6:13.180–6:14.780
以及雙輪對打的遊戲。
6:14.780–6:18.060
這個是之前評測Fib5以及GPT5.6生成的。
6:18.060–6:25.140
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
6:25.140–6:29.940
那其實像這套框架,在我原來的項目裡面,它已經生成了。
6:29.940–6:33.420
也就是它的模型啊,它的底層邏輯啊,框架都有了。
6:33.420–6:37.060
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
6:37.060–6:39.660
那麼今天用KIMIKESA出現了兩個問題。
6:39.660–6:42.420
第一個問題呢,就是剛才我提到的。
6:42.420–6:44.740
它的耗時呢,非常非常的久。
6:44.740–6:48.260
運行了差不多十幾二十分鐘,都沒有完成。
6:48.260–6:54.740
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
6:54.740–6:57.420
也就是一個月是99塊錢。
6:57.420–7:02.420
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
7:02.420–7:04.540
如果你開通的是第一個等級的套餐,
7:04.540–7:08.740
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
7:08.740–7:11.580
完顺呢,我在測試第二個論文的時候,可以看到,
7:11.580–7:14.700
它給我羅列的To-Do裡面有這麼多步驟。
7:14.700–7:18.060
我覺得這個步驟是設計的有點過於冷餘的。
7:18.060–7:22.380
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
7:22.380–7:25.980
它五個小時的用量限制就已經達到了。
7:25.980–7:29.580
然後並且呢,週用量也達到了20%的使用。
7:29.580–7:35.100
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
7:35.100–7:36.460
第二個任務還沒有完成。
7:36.460–7:40.060
有可能是因為這個模型太大,然後現在用的人太多。
7:40.060–7:42.940
所以它整體的一個使用量限制比較少。
7:42.940–7:45.980
包括我開通的這個第二等級的會員啊,
7:45.980–7:48.940
它並不支持100萬的上下文。
7:48.940–7:50.460
只有256K。
7:50.460–7:53.660
那麼你必須是開通這個200塊錢一個月的啊,
7:53.660–7:56.940
才可以享受100萬的上下文長度。
7:56.940–7:59.340
給我的感覺還是不知道因為算力,
7:59.340–8:00.620
還是什麼其他原因啊。
8:00.620–8:02.620
誠意不是特別的夠。
8:02.620–8:04.620
接下來呢,說一下價格。
8:04.620–8:08.620
這個可能是對使用者、開發者殺傷力最大的部分。
8:08.620–8:13.100
輸入呢是3美元每100萬Token,輸出呢是15美元。
8:13.100–8:16.220
如果是緩存命中的話,輸入只要3毛。
8:16.220–8:19.100
這一塊呢,一直是KIMI做的比較好的地方。
8:19.100–8:22.220
OK,那麼強的地方呢已經說完了。
8:22.220–8:24.620
接下來呢,來泼兩盆冷水。
8:24.620–8:28.460
第一盤呢,全球最大開用模型的這個說法呢,
8:28.460–8:30.460
它現在還只是一個期貨。
8:30.460–8:31.980
模型能用是真的。
8:31.980–8:33.900
但是呢,權重還沒有開放。
8:33.900–8:36.780
官方是承諾在7月27號之前,
8:36.780–8:39.420
放出完整的權重和技術報告。
8:39.420–8:41.980
第二盤呢,就算是權重開放了,
8:41.980–8:44.460
我們自己本地電腦呢也是跑不動的。
8:44.460–8:46.460
2.8萬億參數呢,
8:46.460–8:49.900
就算你有1.5TB內存的Magic Dodo集群,
8:49.900–8:51.260
跑起來都夠欠。
8:51.260–8:53.580
這是一個數據中心級別的模型。
8:53.580–8:55.500
所以開源對於個人的意義呢,
8:55.500–8:58.940
更多是讓第三方平台能便宜的把它跑起來,
8:58.940–9:01.420
而不是說把它下載到本地自己去跑。
0:00.000–0:05.380
昨天晚上,月資暗面把KIMI K3正式開放了。
0:05.640–0:09.980
這個模型幹了兩件非常有衝擊力的事情。
0:10.240–0:16.120
第一,他把全球開源模型的參數記錄直接翻了一個倍。
0:16.120–0:20.220
K3模型的參數是2.8萬億。
0:20.480–0:26.880
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
0:26.880–0:29.700
K3的大小差不多是他的兩倍。
0:29.960–0:36.860
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
0:37.120–0:42.500
第一名和第二名分別是Cloud5和GPT5.6瘦。
0:42.760–0:47.620
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
0:48.120–0:52.740
開源模型第一次站到了B原刺旗艦模型的前面。
0:52.740–0:59.820
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
1:00.240–1:01.740
先來看一下時間線。
1:02.160–1:08.740
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
1:08.740–1:11.560
大家就知道可能有新的模型要上了。
1:11.940–1:16.420
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
1:16.420–1:20.800
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
1:21.040–1:27.300
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
1:27.580–1:29.700
這個時間點呢,也非常的微妙。
1:29.960–1:33.760
正好卡在上海的世界人工智能大會前面。
1:34.080–1:37.420
而且呢,月之岸面也正在談新的一輪融資。
1:37.760–1:40.280
估值呢,大約是315億美元。
1:40.280–1:44.220
KIMI K3這個成績單是給誰看的,就不用我多說了。
1:44.220–1:46.220
然後來看一下啊,規格。
1:46.220–1:49.820
2.8萬億這個參數呢,肯定是非常吸引眼球的。
1:49.820–1:55.340
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
1:55.340–2:00.340
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
2:00.340–2:05.420
一個叫KDA,KIMI Delta Tension混合線性注意力。
2:05.420–2:13.900
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
2:13.900–2:20.100
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
2:20.100–2:22.780
然後一層用完整的全注意力。
2:22.780–2:27.180
這裡省下來的算力,換成一個東西,100萬Token的上下文。
2:27.180–2:32.620
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
2:32.620–2:35.500
另外一個新的東西叫注意力殘差。
2:35.500–2:40.500
讓深層網絡把淺層的注意力信息呢,直接接力上來。
2:40.500–2:46.820
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
2:46.820–2:51.380
然後就是混合專家系統這塊,做的也非常非常的激進。
2:51.380–2:56.780
整個模型呢,有896個專家,每次推理呢只激活16個。
2:56.780–3:04.260
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
3:04.260–3:09.300
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
3:09.300–3:18.180
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
3:18.180–3:23.020
那麼K3呢,是拿了1687分,全球第三名。
3:23.020–3:30.820
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
3:30.820–3:34.500
是目前所有看源模型裡面得分最高的。
3:34.500–3:42.940
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
3:42.940–3:46.540
也是當時公開成績裡面最高的。
3:46.540–3:50.620
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
3:50.620–3:53.020
當然,測評呢也只能說明一半。
3:53.020–3:56.220
另一半呢,我們還要真實上手去測試。
3:56.220–3:58.220
這裡呢,我測試了兩個案例。
3:58.220–4:04.900
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
4:04.900–4:12.340
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
4:12.340–4:14.980
並且直接以網頁的形式展現。
4:14.980–4:18.780
那麼這個呢,就是它一次性完成的任務。
4:18.780–4:26.020
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
4:26.020–4:28.380
這是等於是PPT的封面。
4:28.380–4:30.900
然後它最主要的幾個參數。
4:30.900–4:38.060
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
4:38.060–4:43.300
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
4:43.300–4:46.740
而且內容非常的詳盡,非常的豐富。
4:46.740–4:52.780
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
4:52.780–4:56.340
目前看下來沒有找到很明顯的錯誤。
4:56.340–4:59.820
基本上可以達到一個直接使用的水平了。
4:59.820–5:08.700
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
5:08.700–5:10.020
這能力我覺得還是不錯的。
5:10.020–5:13.620
然後我在測試過程當中發現一個比較明顯的問題。
5:13.620–5:17.460
就是不算是現在使用的人比較多還是什麼的。
5:17.460–5:20.500
就是我發送了這樣一條Planter過去。
5:20.500–5:25.060
它整個完成這個任務的耗時,時間非常的長。
5:25.060–5:27.140
至少花費了十幾分鐘。
5:27.140–5:33.340
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
5:33.340–5:35.340
因為任務並不是特別的難。
5:35.340–5:37.220
然後它的內容也不是很多。
5:37.220–5:41.220
用KIMIKESA生成任務的時間是超出了我的預期的。
5:41.220–5:46.820
然後第二個任務呢,是我讓它基於我前面兩期視頻。
5:46.820–5:49.700
我是創建了一個體感遊戲。
5:49.700–5:55.100
用谷歌的模型,它可以監控我們人體的關節、部位。
5:55.100–5:57.900
首先我是做了一個體感監視器。
5:57.900–5:59.900
這個在上一期視頻已經講過了。
5:59.900–6:03.340
包括它的項目,我已經開運到KitaHub上面去了。
6:03.340–6:08.140
後面呢,我又用GPT5.64添加了幾個體感遊戲。
6:08.140–6:13.180
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
6:13.180–6:14.780
以及雙輪對打的遊戲。
6:14.780–6:18.060
這個是之前評測Fib5以及GPT5.6生成的。
6:18.060–6:25.140
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
6:25.140–6:29.940
那其實像這套框架,在我原來的項目裡面,它已經生成了。
6:29.940–6:33.420
也就是它的模型啊,它的底層邏輯啊,框架都有了。
6:33.420–6:37.060
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
6:37.060–6:39.660
那麼今天用KIMIKESA出現了兩個問題。
6:39.660–6:42.420
第一個問題呢,就是剛才我提到的。
6:42.420–6:44.740
它的耗時呢,非常非常的久。
6:44.740–6:48.260
運行了差不多十幾二十分鐘,都沒有完成。
6:48.260–6:54.740
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
6:54.740–6:57.420
也就是一個月是99塊錢。
6:57.420–7:02.420
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
7:02.420–7:04.540
如果你開通的是第一個等級的套餐,
7:04.540–7:08.740
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
7:08.740–7:11.580
完顺呢,我在測試第二個論文的時候,可以看到,
7:11.580–7:14.700
它給我羅列的To-Do裡面有這麼多步驟。
7:14.700–7:18.060
我覺得這個步驟是設計的有點過於冷餘的。
7:18.060–7:22.380
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
7:22.380–7:25.980
它五個小時的用量限制就已經達到了。
7:25.980–7:29.580
然後並且呢,週用量也達到了20%的使用。
7:29.580–7:35.100
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
7:35.100–7:36.460
第二個任務還沒有完成。
7:36.460–7:40.060
有可能是因為這個模型太大,然後現在用的人太多。
7:40.060–7:42.940
所以它整體的一個使用量限制比較少。
7:42.940–7:45.980
包括我開通的這個第二等級的會員啊,
7:45.980–7:48.940
它並不支持100萬的上下文。
7:48.940–7:50.460
只有256K。
7:50.460–7:53.660
那麼你必須是開通這個200塊錢一個月的啊,
7:53.660–7:56.940
才可以享受100萬的上下文長度。
7:56.940–7:59.340
給我的感覺還是不知道因為算力,
7:59.340–8:00.620
還是什麼其他原因啊。
8:00.620–8:02.620
誠意不是特別的夠。
8:02.620–8:04.620
接下來呢,說一下價格。
8:04.620–8:08.620
這個可能是對使用者、開發者殺傷力最大的部分。
8:08.620–8:13.100
輸入呢是3美元每100萬Token,輸出呢是15美元。
8:13.100–8:16.220
如果是緩存命中的話,輸入只要3毛。
8:16.220–8:19.100
這一塊呢,一直是KIMI做的比較好的地方。
8:19.100–8:22.220
OK,那麼強的地方呢已經說完了。
8:22.220–8:24.620
接下來呢,來泼兩盆冷水。
8:24.620–8:28.460
第一盤呢,全球最大開用模型的這個說法呢,
8:28.460–8:30.460
它現在還只是一個期貨。
8:30.460–8:31.980
模型能用是真的。
8:31.980–8:33.900
但是呢,權重還沒有開放。
8:33.900–8:36.780
官方是承諾在7月27號之前,
8:36.780–8:39.420
放出完整的權重和技術報告。
8:39.420–8:41.980
第二盤呢,就算是權重開放了,
8:41.980–8:44.460
我們自己本地電腦呢也是跑不動的。
8:44.460–8:46.460
2.8萬億參數呢,
8:46.460–8:49.900
就算你有1.5TB內存的Magic Dodo集群,
8:49.900–8:51.260
跑起來都夠欠。
8:51.260–8:53.580
這是一個數據中心級別的模型。
8:53.580–8:55.500
所以開源對於個人的意義呢,
8:55.500–8:58.940
更多是讓第三方平台能便宜的把它跑起來,
8:58.940–9:01.420
而不是說把它下載到本地自己去跑。
0:00.000–0:05.380
昨天晚上,月資暗面把KIMI K3正式開放了。
昨天晚上,月資暗面把KIMI K3正式開放了。
0:05.640–0:09.980
這個模型幹了兩件非常有衝擊力的事情。
這個模型幹了兩件非常有衝擊力的事情。
0:10.240–0:16.120
第一,他把全球開源模型的參數記錄直接翻了一個倍。
第一,他把全球開源模型的參數記錄直接翻了一個倍。
0:16.120–0:20.220
K3模型的參數是2.8萬億。
K3模型的參數是2.8萬億。
0:20.480–0:26.880
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。
0:26.880–0:29.700
K3的大小差不多是他的兩倍。
K3的大小差不多是他的兩倍。
0:29.960–0:36.860
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。
0:37.120–0:42.500
第一名和第二名分別是Cloud5和GPT5.6瘦。
第一名和第二名分別是Cloud5和GPT5.6瘦。
0:42.760–0:47.620
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。
0:48.120–0:52.740
開源模型第一次站到了B原刺旗艦模型的前面。
開源模型第一次站到了B原刺旗艦模型的前面。
0:52.740–0:59.820
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪,價格又有多恒。
1:00.240–1:01.740
先來看一下時間線。
先來看一下時間線。
1:02.160–1:08.740
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。
1:08.740–1:11.560
大家就知道可能有新的模型要上了。
大家就知道可能有新的模型要上了。
1:11.940–1:16.420
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
那麼在16號,也就是昨天的晚上,KIMI K3正式上線。
1:16.420–1:20.800
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
分別在KIMI的APP以及KIMI Code裡面都可以使用了。
1:21.040–1:27.300
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。
1:27.580–1:29.700
這個時間點呢,也非常的微妙。
這個時間點呢,也非常的微妙。
1:29.960–1:33.760
正好卡在上海的世界人工智能大會前面。
正好卡在上海的世界人工智能大會前面。
1:34.080–1:37.420
而且呢,月之岸面也正在談新的一輪融資。
而且呢,月之岸面也正在談新的一輪融資。
1:37.760–1:40.280
估值呢,大約是315億美元。
估值呢,大約是315億美元。
1:40.280–1:44.220
KIMI K3這個成績單是給誰看的,就不用我多說了。
KIMI K3這個成績單是給誰看的,就不用我多說了。
1:44.220–1:46.220
然後來看一下啊,規格。
然後來看一下啊,規格。
1:46.220–1:49.820
2.8萬億這個參數呢,肯定是非常吸引眼球的。
2.8萬億這個參數呢,肯定是非常吸引眼球的。
1:49.820–1:55.340
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。
1:55.340–2:00.340
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。
2:00.340–2:05.420
一個叫KDA,KIMI Delta Tension混合線性注意力。
一個叫KDA,KIMI Delta Tension混合線性注意力。
2:05.420–2:13.900
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。
2:13.900–2:20.100
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。
2:20.100–2:22.780
然後一層用完整的全注意力。
然後一層用完整的全注意力。
2:22.780–2:27.180
這裡省下來的算力,換成一個東西,100萬Token的上下文。
這裡省下來的算力,換成一個東西,100萬Token的上下文。
2:27.180–2:32.620
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。
2:32.620–2:35.500
另外一個新的東西叫注意力殘差。
另外一個新的東西叫注意力殘差。
2:35.500–2:40.500
讓深層網絡把淺層的注意力信息呢,直接接力上來。
讓深層網絡把淺層的注意力信息呢,直接接力上來。
2:40.500–2:46.820
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。
2:46.820–2:51.380
然後就是混合專家系統這塊,做的也非常非常的激進。
然後就是混合專家系統這塊,做的也非常非常的激進。
2:51.380–2:56.780
整個模型呢,有896個專家,每次推理呢只激活16個。
整個模型呢,有896個專家,每次推理呢只激活16個。
2:56.780–3:04.260
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。
3:04.260–3:09.300
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
再來看一下成績單,我挑三個重點的在視頻裡面說一下。
3:09.300–3:18.180
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。
3:18.180–3:23.020
那麼K3呢,是拿了1687分,全球第三名。
那麼K3呢,是拿了1687分,全球第三名。
3:23.020–3:30.820
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
第二個呢,是GP2A Diamond的研究生級別的科學題,他的得分呢是93.5%。
3:30.820–3:34.500
是目前所有看源模型裡面得分最高的。
是目前所有看源模型裡面得分最高的。
3:34.500–3:42.940
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%。
3:42.940–3:46.540
也是當時公開成績裡面最高的。
也是當時公開成績裡面最高的。
3:46.540–3:50.620
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
那麼這一下呢,很明顯是吃到了100萬上下文的紅利。
3:50.620–3:53.020
當然,測評呢也只能說明一半。
當然,測評呢也只能說明一半。
3:53.020–3:56.220
另一半呢,我們還要真實上手去測試。
另一半呢,我們還要真實上手去測試。
3:56.220–3:58.220
這裡呢,我測試了兩個案例。
這裡呢,我測試了兩個案例。
3:58.220–4:04.900
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。
4:04.900–4:12.340
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇。
4:12.340–4:14.980
並且直接以網頁的形式展現。
並且直接以網頁的形式展現。
4:14.980–4:18.780
那麼這個呢,就是它一次性完成的任務。
那麼這個呢,就是它一次性完成的任務。
4:18.780–4:26.020
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
可以先從第一屏看一下,Kimi K3開月模型第一次摸到了B月模型次旗艦的門檻。
4:26.020–4:28.380
這是等於是PPT的封面。
這是等於是PPT的封面。
4:28.380–4:30.900
然後它最主要的幾個參數。
然後它最主要的幾個參數。
4:30.900–4:38.060
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的自動去完成的。
4:38.060–4:43.300
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
我覺得這個版面的佈局以及參數的提取,配色其實都做得非常好。
4:43.300–4:46.740
而且內容非常的詳盡,非常的豐富。
而且內容非常的詳盡,非常的豐富。
4:46.740–4:52.780
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。
4:52.780–4:56.340
目前看下來沒有找到很明顯的錯誤。
目前看下來沒有找到很明顯的錯誤。
4:56.340–4:59.820
基本上可以達到一個直接使用的水平了。
基本上可以達到一個直接使用的水平了。
4:59.820–5:08.700
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
而且是沒有創建任何Skill的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。
5:08.700–5:10.020
這能力我覺得還是不錯的。
這能力我覺得還是不錯的。
5:10.020–5:13.620
然後我在測試過程當中發現一個比較明顯的問題。
然後我在測試過程當中發現一個比較明顯的問題。
5:13.620–5:17.460
就是不算是現在使用的人比較多還是什麼的。
就是不算是現在使用的人比較多還是什麼的。
5:17.460–5:20.500
就是我發送了這樣一條Planter過去。
就是我發送了這樣一條Planter過去。
5:20.500–5:25.060
它整個完成這個任務的耗時,時間非常的長。
它整個完成這個任務的耗時,時間非常的長。
5:25.060–5:27.140
至少花費了十幾分鐘。
至少花費了十幾分鐘。
5:27.140–5:33.340
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。
5:33.340–5:35.340
因為任務並不是特別的難。
因為任務並不是特別的難。
5:35.340–5:37.220
然後它的內容也不是很多。
然後它的內容也不是很多。
5:37.220–5:41.220
用KIMIKESA生成任務的時間是超出了我的預期的。
用KIMIKESA生成任務的時間是超出了我的預期的。
5:41.220–5:46.820
然後第二個任務呢,是我讓它基於我前面兩期視頻。
然後第二個任務呢,是我讓它基於我前面兩期視頻。
5:46.820–5:49.700
我是創建了一個體感遊戲。
我是創建了一個體感遊戲。
5:49.700–5:55.100
用谷歌的模型,它可以監控我們人體的關節、部位。
用谷歌的模型,它可以監控我們人體的關節、部位。
5:55.100–5:57.900
首先我是做了一個體感監視器。
首先我是做了一個體感監視器。
5:57.900–5:59.900
這個在上一期視頻已經講過了。
這個在上一期視頻已經講過了。
5:59.900–6:03.340
包括它的項目,我已經開運到KitaHub上面去了。
包括它的項目,我已經開運到KitaHub上面去了。
6:03.340–6:08.140
後面呢,我又用GPT5.64添加了幾個體感遊戲。
後面呢,我又用GPT5.64添加了幾個體感遊戲。
6:08.140–6:13.180
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
比如有體感穿墻、星球互聯、還有這個切水果的遊戲。
6:13.180–6:14.780
以及雙輪對打的遊戲。
以及雙輪對打的遊戲。
6:14.780–6:18.060
這個是之前評測Fib5以及GPT5.6生成的。
這個是之前評測Fib5以及GPT5.6生成的。
6:18.060–6:25.140
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
然後今天呢,我是想用這個KIMIKESA去做一個體感消消樂的遊戲。
6:25.140–6:29.940
那其實像這套框架,在我原來的項目裡面,它已經生成了。
那其實像這套框架,在我原來的項目裡面,它已經生成了。
6:29.940–6:33.420
也就是它的模型啊,它的底層邏輯啊,框架都有了。
也就是它的模型啊,它的底層邏輯啊,框架都有了。
6:33.420–6:37.060
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
只是讓它在這個基礎上去增加一個體感消消樂的遊戲。
6:37.060–6:39.660
那麼今天用KIMIKESA出現了兩個問題。
那麼今天用KIMIKESA出現了兩個問題。
6:39.660–6:42.420
第一個問題呢,就是剛才我提到的。
第一個問題呢,就是剛才我提到的。
6:42.420–6:44.740
它的耗時呢,非常非常的久。
它的耗時呢,非常非常的久。
6:44.740–6:48.260
運行了差不多十幾二十分鐘,都沒有完成。
運行了差不多十幾二十分鐘,都沒有完成。
6:48.260–6:54.740
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
然後第二個問題呢,就是我目前開通的是KIMIKESA的第二個等級的套餐。
6:54.740–6:57.420
也就是一個月是99塊錢。
也就是一個月是99塊錢。
6:57.420–7:02.420
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
那麼是可以在KIMIKESA的裡面去使用這個KIMIKESA的模型。
7:02.420–7:04.540
如果你開通的是第一個等級的套餐,
如果你開通的是第一個等級的套餐,
7:04.540–7:08.740
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
目前在KIMIKESA的裡面是使用不了這個KESA的模型的。
7:08.740–7:11.580
完顺呢,我在測試第二個論文的時候,可以看到,
完顺呢,我在測試第二個論文的時候,可以看到,
7:11.580–7:14.700
它給我羅列的To-Do裡面有這麼多步驟。
它給我羅列的To-Do裡面有這麼多步驟。
7:14.700–7:18.060
我覺得這個步驟是設計的有點過於冷餘的。
我覺得這個步驟是設計的有點過於冷餘的。
7:18.060–7:22.380
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
然後在做第二個任務的時候,僅僅只是完成了第一條To-Do。
7:22.380–7:25.980
它五個小時的用量限制就已經達到了。
它五個小時的用量限制就已經達到了。
7:25.980–7:29.580
然後並且呢,週用量也達到了20%的使用。
然後並且呢,週用量也達到了20%的使用。
7:29.580–7:35.100
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
也就是我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。
7:35.100–7:36.460
第二個任務還沒有完成。
第二個任務還沒有完成。
7:36.460–7:40.060
有可能是因為這個模型太大,然後現在用的人太多。
有可能是因為這個模型太大,然後現在用的人太多。
7:40.060–7:42.940
所以它整體的一個使用量限制比較少。
所以它整體的一個使用量限制比較少。
7:42.940–7:45.980
包括我開通的這個第二等級的會員啊,
包括我開通的這個第二等級的會員啊,
7:45.980–7:48.940
它並不支持100萬的上下文。
它並不支持100萬的上下文。
7:48.940–7:50.460
只有256K。
只有256K。
7:50.460–7:53.660
那麼你必須是開通這個200塊錢一個月的啊,
那麼你必須是開通這個200塊錢一個月的啊,
7:53.660–7:56.940
才可以享受100萬的上下文長度。
才可以享受100萬的上下文長度。
7:56.940–7:59.340
給我的感覺還是不知道因為算力,
給我的感覺還是不知道因為算力,
7:59.340–8:00.620
還是什麼其他原因啊。
還是什麼其他原因啊。
8:00.620–8:02.620
誠意不是特別的夠。
誠意不是特別的夠。
8:02.620–8:04.620
接下來呢,說一下價格。
接下來呢,說一下價格。
8:04.620–8:08.620
這個可能是對使用者、開發者殺傷力最大的部分。
這個可能是對使用者、開發者殺傷力最大的部分。
8:08.620–8:13.100
輸入呢是3美元每100萬Token,輸出呢是15美元。
輸入呢是3美元每100萬Token,輸出呢是15美元。
8:13.100–8:16.220
如果是緩存命中的話,輸入只要3毛。
如果是緩存命中的話,輸入只要3毛。
8:16.220–8:19.100
這一塊呢,一直是KIMI做的比較好的地方。
這一塊呢,一直是KIMI做的比較好的地方。
8:19.100–8:22.220
OK,那麼強的地方呢已經說完了。
OK,那麼強的地方呢已經說完了。
8:22.220–8:24.620
接下來呢,來泼兩盆冷水。
接下來呢,來泼兩盆冷水。
8:24.620–8:28.460
第一盤呢,全球最大開用模型的這個說法呢,
第一盤呢,全球最大開用模型的這個說法呢,
8:28.460–8:30.460
它現在還只是一個期貨。
它現在還只是一個期貨。
8:30.460–8:31.980
模型能用是真的。
模型能用是真的。
8:31.980–8:33.900
但是呢,權重還沒有開放。
但是呢,權重還沒有開放。
8:33.900–8:36.780
官方是承諾在7月27號之前,
官方是承諾在7月27號之前,
8:36.780–8:39.420
放出完整的權重和技術報告。
放出完整的權重和技術報告。
8:39.420–8:41.980
第二盤呢,就算是權重開放了,
第二盤呢,就算是權重開放了,
8:41.980–8:44.460
我們自己本地電腦呢也是跑不動的。
我們自己本地電腦呢也是跑不動的。
8:44.460–8:46.460
2.8萬億參數呢,
2.8萬億參數呢,
8:46.460–8:49.900
就算你有1.5TB內存的Magic Dodo集群,
就算你有1.5TB內存的Magic Dodo集群,
8:49.900–8:51.260
跑起來都夠欠。
跑起來都夠欠。
8:51.260–8:53.580
這是一個數據中心級別的模型。
這是一個數據中心級別的模型。
8:53.580–8:55.500
所以開源對於個人的意義呢,
所以開源對於個人的意義呢,
8:55.500–8:58.940
更多是讓第三方平台能便宜的把它跑起來,
更多是讓第三方平台能便宜的把它跑起來,
8:58.940–9:01.420
而不是說把它下載到本地自己去跑。
而不是說把它下載到本地自己去跑。

影片筆記:Claude Code最强平替来了:Kimi K3超越Opus 4.8,登榜史上最大开源模型!

一句話總結

月之暗面(Moonshot AI)正式開放 KIMI K3 模型,以 2.8 萬億參數刷新開源記錄並在多項評測中超越閉源大廠模型,但實測顯示其生成耗時極長、上下文長度受限且價格對開發者殺傷力大,目前權重尚未開放,僅為雲端服務狀態。

核心重點

  1. 發布與規格:KIMI K3 於 7 月 16 日晚正式上線,擁有 2.8 萬億參數,採用 KDA(混合線性注意力)技術與 MoE(混合專家系統),官方宣稱支援 100 萬 Token 上下文。
  2. 評測表現優異:在 GPTWALL 真實工作任務評測中排名全球第三(僅次於 Cloud5 和 GPT5.6 瘦),並在 GP2A Diamond 科學題與 BlowComp 檢索任務中取得開源模型最高分,被視為開源模型首次站到大廠旗艦模型前面。
  3. 實測問題顯著
  • 耗時極長:生成 PPT 或開發遊戲等任務需耗時十幾分鐘至二十分鐘,遠慢於 GPT 或 Cloud 系列。
  • 限制嚴格:高階會員套餐仍受限於 256K 上下文(100 萬需更高階套餐),且用量限制嚴格(如五小時用量限制、週用量達 20%)。
  • 價格與開源現狀:輸入 3 美元/百萬 Token,輸出 15 美元/百萬 Token;權重未開放(承諾 7 月 27 日前放出),因參數龐大個人本地電腦無法運行,主要依賴雲端服務。

詳細大綱

一、 KIMI K3 發布背景與規格

  • 發布時間與渠道
  • 7 月 15 日促銷頁面泄露,7 月 16 日晚正式上線。
  • 可在 KIMI APP 及 KIMI Code 中使用。
  • 發布時機緊鄰上海世界人工智能大會,且公司處於新一輪融資談判中(估值約 315 億美元)。
  • 核心規格
  • 參數量:2.8 萬億(約為前開源最大模型 Deepseek 的 1.6 萬億的兩倍)。
  • 技術創新
  • KDA (KIMI Delta Tension 混合線性注意力):每四層中三層使用線性注意力,一層使用全注意力,解決上下文長度平方級計算量上漲問題。
  • 注意力殘差:讓深層網絡接力淺層注意力信息。
  • 訓練效率:官方宣稱達到 KIMI K2 的 2.5 倍。
  • 上下文長度:官方宣稱支援 100 萬 Token(此前 K2 為 256K)。
  • 混合專家系統 (MoE):總共 896 個專家,每次推理僅激活 16 個。

二、 評測成績單

  • GPTWALL 評測
  • 內容:44 個職業真實工作任務(非做題)。
  • 成績:1687 分,全球第三名。
  • 排名:第一名 Cloud5,第二名 GPT5.6 瘦,OPUS4.8 被擠至後面。
  • 意義:開源模型首次站到大廠旗艦模型前面。
  • GP2A Diamond 評測
  • 內容:研究生級別科學題。
  • 成績:93.5%,目前所有開源模型中得分最高。
  • BlowComp 評測
  • 內容:網上檢索問題答案。
  • 成績:91.2%,當時公開成績中最高。

三、 實測案例與問題

  • 案例一:生成 PPT 幻燈片
  • 任務:根據官方報導及整理文件,生成不低於 12 頁的 PPT,並以網頁形式展現。
  • 結果
  • 版面佈局、配色、數據提取、架構拆解圖表設計一次性完成,無明顯錯誤,達到直接使用水平。
  • 未創建任何 Skill,僅發送報告和 Planter 即可完成。
  • 問題:耗時極長,花費十幾分鐘(以往 GPT 或 Cloud 完成此類任務通常在 10 分鐘內)。
  • 案例二:體感消消樂遊戲開發
  • 任務:基於現有體感監視器框架,增加「體感消消樂」遊戲。
  • 結果
  • 耗時極長,運行十幾二十分鐘未完成。
  • To-Do 步驟設計過於繁瑣。
  • 僅完成第一條 To-Do,五小時用量限制即達標,週用量達 20%。
  • 會員限制問題
  • 第二等級套餐(99 元/月)無法使用 KESA 模型(需更高等級?註:原文語意模糊,僅提及第二等級可用但受限)。
  • 第二等級套餐不支援 100 萬上下文,僅支援 256K。
  • 需開通 200 元/月套餐方可享受 100 萬上下文長度。
  • 感受:誠意不足,可能因算力或用戶過多導致使用量限制嚴格。

四、 價格與開源現狀

  • 價格
  • 輸入:3 美元 / 100 萬 Token。
  • 輸出:15 美元 / 100 萬 Token。
  • 緩存命中:輸入僅 3 毛(KIMI 的優勢)。
  • 開源現狀(潑冷水)
  • 權重未開放:目前僅為「期貨」,承諾 7 月 27 日前放出完整權重和技術報告。
  • 本地無法運行:2.8 萬億參數為數據中心級別,即使擁有 1.5TB 內存的 Magic Dodo 集群也跑不動。
  • 開源意義:主要讓第三方平台能便宜地跑起來,而非個人下載本地運行。

工具 / 模型 / 名詞整理

  • 模型/產品
  • KIMI K3
  • KIMI K2
  • KIMI APP
  • KIMI Code
  • Deepseek (參數 1.6 萬億)
  • Cloud5
  • GPT5.6 瘦
  • OPUS4.8
  • KESA (模型名稱,出現在會員套餐描述中)
  • Magic Dodo (提及的集群名稱)
  • 評測/平台
  • GPTWALL (評測名稱)
  • GP2A Diamond (評測名稱)
  • BlowComp (評測名稱)
  • KitaHub (代碼託管平台)
  • 技術/概念
  • KDA (KIMI Delta Tension 混合線性注意力)
  • 注意力殘差
  • 混合專家系統 (MoE)
  • Token (上下文長度單位)
  • Skill (技能/插件)
  • Planter (提示詞/指令,原文用詞)
  • To-Do (任務列表)

操作流程整理

  1. 訪問與使用
  • 通過 KIMI APP 或 KIMI Code 訪問 KIMI K3 模型。
  1. 任務執行(以 PPT 生成為例)
  • 準備官方報導及整理文件。
  • 發送報告和 Planter(指令)給模型。
  • 等待模型生成不低於 12 頁的 PPT 網頁版(耗時約十幾分鐘)。
  • 確認版面佈局、配色、數據提取及架構拆解圖表設計無誤。
  1. 任務執行(以遊戲開發為例)
  • 基於現有體感監視器框架,提出增加「體感消消樂」遊戲的需求。
  • 模型生成 To-Do 步驟。
  • 執行 To-Do 步驟(耗時極長,可能超過五小時用量限制)。
  1. 會員與套餐選擇
  • 若需 100 萬上下文長度,需開通 200 元/月套餐。
  • 第二等級套餐(99 元/月)僅支援 256K 上下文,且可能受限於特定模型(如 KESA)的使用。

值得注意的限制或風險

  1. 生成效率低:相比 GPT 或 Cloud 系列,KIMI K3 在生成複雜任務(如 PPT、遊戲開發)時耗時極長(十幾分鐘至二十分鐘)。
  2. 上下文長度限制:官方宣稱支援 100 萬 Token,但高階會員套餐(第二等級)僅支援 256K,需更高階套餐才能享受 100 萬上下文。
  3. 用量限制嚴格:存在五小時用量限制及週用量限制(如達 20%),可能影響連續開發體驗。
  4. 本地運行不可行:2.8 萬億參數規模龐大,個人電腦無法運行,必須依賴雲端服務。
  5. 權重未開放:目前僅為「期貨」狀態,完整權重和技術報告承諾於 7 月 27 日前放出,當前無法進行本地部署或二次開發。
  6. 價格成本:輸入 3 美元/百萬 Token,輸出 15 美元/百萬 Token,對開發者而言成本較高。

逐字稿辨識疑點

  • 月資暗面:原文用詞,疑為「月之暗面」(Moonshot AI)的聽寫錯誤。
  • Cloud5:原文用詞,疑為某特定模型或評測版本名稱,需查證是否為常見模型變體。
  • GPT5.6 瘦:原文用詞,疑為模型版本或特定壓縮/精簡版名稱。
  • B原刺:原文用詞,疑為「大廠」或「閉源」的聽寫錯誤(結合上下文「開源模型第一次站到了...前面」)。
  • B月:原文用詞,疑為「大廠」或「閉源」的聽寫錯誤(結合上下文「摸到了...門檻」)。
  • :原文「價格又有多恒」,疑為「多低」或「多貴」的聽寫錯誤。
  • KDA:原文解釋為「KIMI Delta Tension 混合線性注意力」,需查證該縮寫是否為官方正式命名。
  • GPTWALL:評測名稱,需查證是否為標準評測基準名稱。
  • GP2A Diamond:評測名稱,需查證是否為標準評測基準名稱。
  • BlowComp:評測名稱,需查證是否為標準評測基準名稱。
  • Planter:原文指代輸入的報告或指令,疑為「Prompt」或「Plan」的聽寫錯誤。
  • KitaHub:原文指代代碼託管平台,疑為「GitHub」的聽寫錯誤。
  • Magic Dodo:原文指代集群,需查證是否為特定硬體或集群名稱。
  • KESA:原文在會員套餐描述中出現,疑為「KIMI」或特定模型代號的聽寫錯誤。
  • 冷餘:原文「步驟是設計的有點過於冷餘」,疑為「繁瑣」或「冗餘」的聽寫錯誤。
  • 開用:原文「全球最大開用模型」,疑為「開源」的聽寫錯誤。

可延伸追問

  1. KIMI K3 的 KDA(混合線性注意力)技術具體如何運作,與傳統注意力機制相比有何優勢?
  2. GPTWALL、GP2A Diamond、BlowComp 等評測基準的具體評分標準是什麼?
  3. 7 月 27 日放出的完整權重和技術報告將包含哪些內容?是否會開放給公眾下載?
  4. KIMI K3 的 MoE(混合專家系統)架構中,896 個專家與 16 個激活專家的具體分工是什麼?
  5. 針對開發者殺傷力大的價格策略,未來是否有調整計劃或更優惠的套餐?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習