昨天晚上,月資暗面把KIMI K3正式開放了。 這個模型幹了兩件非常有衝擊力的事情。 第一,他把全球開源模型的參數記錄直接翻了一個倍。 K3模型的參數是2.8萬億。 什麼概念呢?在之前的開源陣營裡面,最大的是Deepseek,只有1.6萬億。 K3的大小差不多是他的兩倍。 第二,在一項衡量真實知識工作的評測裡面,他排到了全球第三。 第一名和第二名分別是Cloud5和GPT5.6瘦。 而且要注意的是,Cloud是OPUS4.8被他擠到了後面一名。 開源模型第一次站到了B原刺旗艦模型的前面。 那麼這期視頻呢,我們就來詳細的了解一下KIMI K3,它到底強在哪?價格又有多恒? 先來看一下時間線。 其實在7月15號,KIMI的開放平台的一個促銷頁面已經提前泄露了。 大家就知道可能有新的模型要上了。 那麼在16號,也就是昨天的晚上,KIMI K3正式上線。 分別在KIMI的APP以及KIMI Code裡面都可以使用了。 現在只要進入網站APP,包括如果你是KIMI Code的會員,都可以正式使用KIMI K3了。 這個時間點呢,也非常的微妙。 正好卡在上海的世界人工智能大會前面。 而且呢,月之岸面也正在談新的一輪融資。 估值呢,大約是315億美元。 KIMI K3這個成績單是給誰看的,就不用我多說了。 然後來看一下啊,規格。 2.8萬億這個參數呢,肯定是非常吸引眼球的。 但是我覺得比大更值得看的,是他怎麼樣把這麼大的模型給他跑起來。 看官方放的這張結構圖呢,我們也可以看到有兩個新的東西。 一個叫KDA,KIMI Delta Tension混合線性注意力。 簡單解釋就是,傳統注意力的計算量呢,會隨著上下文長度平方級上漲,越長呢就越貴。 那麼K3的做法是呢,是每四層裡面,三層用便宜的線性注意力。 然後一層用完整的全注意力。 這裡省下來的算力,換成一個東西,100萬Token的上下文。 之前KIMI K2的上下文長度呢,只有256K,直接翻了4倍。 另外一個新的東西叫注意力殘差。 讓深層網絡把淺層的注意力信息呢,直接接力上來。 官方說,這套組合讓整體的訓練效率做到了KIMI K2的2.5倍。 然後就是混合專家系統這塊,做的也非常非常的激進。 整個模型呢,有896個專家,每次推理呢只激活16個。 也就是說,雖然總參數量是2.8萬億,但是真正幹活的每次呢,只是裡面很小的一部分。 再來看一下成績單,我挑三個重點的在視頻裡面說一下。 第一個呢,是剛才視頻開頭提到的GPTWALL,他測的呢不是做題,是44個職業裡面真實的工作任務。 那麼K3呢,是拿了1687分,全球第三名。 第二個呢,是GP2A Diamond,研究生級別的科學題,他的得分呢是93.5%,是目前所有看源模型裡面得分最高的。 第三個呢,我覺得是最實在的BlowComp,在網上檢索問題的答案,得分呢是91.2%,也是當時公開成績裡面最高的。 那麼這一下呢,很明顯是吃到了100萬上下文的紅利。 當然,測評呢也只能說明一半。 另一半呢,我們還要真實上手去測試。 這裡呢,我測試了兩個案例。 第一個測試呢,是讓它根據官方的報導,以及我自己整理的文件。 讓它直接幫我生成一份Kimi K3不低於12頁的一個PPT,幻燈篇,並且直接以網頁的形式展現。 那麼這個呢,就是它一次性完成的任務。 可以先從第一屏看一下,Kimi K3,它用模型第一次摸到了B原模型次旗艦的門檻。 這是等於是PPT的封面。 然後它最主要的幾個參數,它的配色,它的佈局,還有這些數據的提取,全部是Kimi K3的,自動去完成的。 我覺得這個版面的佈局,以及參數的提取,配色其實都做得非常好。 而且內容呢非常的詳盡,非常的豐富。 還有關於它的這個架構拆解,這種圖表設計,也全部是它一次性完成的。 目前看起來沒有找到很明顯的錯誤。 基本上可以達到一個直接使用的水平了。 而且是沒有創建任何Scale的前提下,只是給它發了一個簡單的報告,以及一個Planter,讓它生成PPT,就完成了。 這能力我覺得還是不錯的。 然後我在測試過程當中呢,發現一個比較明顯的問題。 就是不算是現在使用的人比較多還是什麼的。 就是我發送了這樣一條Planter過去,它整個完成這個任務的耗時,時間非常的長。 至少花費了十幾分鐘。 那這個任務如果以往是用GPT或者用Cloud去完成,我覺得這時間肯定是在10分鐘以內的。 因為任務並不是特別的難。 然後它的內容也不是很多。 用KimiK3生成任務的時間是超出了我的預期的。 然後第二個任務呢,是我讓它基於我前面兩期視頻。 我是創建了一個體感遊戲。 用谷歌的模型,它可以監控我們人體的關節、部位。 首先我是做了一個體感監視器。 這個在上期視頻已經講過了。 包括它的項目,我已經開運到KitaHub上面去了。 後面呢,我又用GPT5.64添加了幾個體感遊戲。 比如有體感穿墻、星球互聯、還有這個切水果的遊戲,以及雙輪對打的遊戲。 這個是之前評測Fibre5以及GPT5.6生成的。 然後今天呢,我是想用這個KimiK3去做一個體感消消樂的遊戲。 那其實像這套框架,在我原來的項目裡面,它已經生成了。 也就是它的模型、它的底層邏輯、框架都有了。 只是讓它在這個基礎上去增加一個體感消消樂的遊戲。 那麼今天用KimiK3出現了兩個問題。 第一個問題呢,就是剛才我提到的。 它的耗時呢,非常非常的久。 運行了差不多十幾二十分鐘,都沒有完成。 然後第二個問題呢,就是我目前開通的是Kimi的第二個等級的套餐。 也就是一個月是99塊錢。那麼是可以在KimiCode裡面去使用這個KimiK3的模型。 如果你開通的是第一個等級的套餐。 目前在KimiCode裡面是使用不了這個K3的模型的。 完事呢,我在測試第二個任務的時候,可以看到,它給我羅列的toDo裡面有這麼多步驟。 我覺得這個步驟是設計的有點過於冷餘的。 然後在做第二個任務的時候,僅僅只是完成了第一條toDo,它5個小時的用量限制就已經達到了。 然後並且呢,週用量也達到了20%的使用。 也就是說,我開通99塊錢一個月的會員,僅僅只是完成了一個多的任務。 第二個任務還沒有完成。 有可能是因為這個模型太大,然後現在用的人太多。 所以它整體的一個使用量限制比較少。 包括我開通的這個第二等級的會員,它並不支持100萬的上下文。 只有256K,那麼你必須是開通這個200塊錢一個月的,才可以享受100萬的上下文長度。 給我的感覺還是不知道因為算力,還是什麼其他原因啊。 誠意不是特別的夠。 接下來呢,說一下價格。 這個可能是對使用者、開發者殺傷力最大的部分。 輸入呢,是3美元每100萬Token,輸出呢是15美元。 如果是緩存命中的話,輸入只要3毛。 這一塊呢,一直是KIMI做的比較好的地方。 OK,那麼強的地方呢,已經說完了。 接下來呢,來潑兩盆冷水。 第一盤呢,全球最大開用模型的這個說法呢,它現在還只是一個期貨。 模型能用是真的,但是呢,權重還沒有開放。 官方是承諾在7月27號之前,放出完整的權重和技術報告。 第二盤呢,就算是權重開放了,我們自己本地電腦呢,也是跑不動的。 2.8萬億參數呢,就算你有1.5TB內存的MGDODO集群,跑起來都夠欠。 這是一個數據中心級別的模型。 所以,開源對於個人的意義呢,更多是讓第三方平台能便宜的把它跑起來,而不是說把它下載到本地自己去跑。