# 影片筆記:Kimi 3对战GPT-5.6,实测结果出乎意料 ## 一句話總結 影片實測對比了開源模型 **Kimi K3** 與閉源模型 **GPT-5.6** 在編寫網頁版中國象棋任務中的表現,結果顯示 GPT-5.6 在生成速度、修復效率及最終視覺效果上均優於 Kimi K3,儘管 Kimi K3 具備大參數與開源優勢,但在實際執行效能上仍遜色一籌。 ## 核心重點 1. **Kimi K3 規格與定位**: * 擁有 2.8T 參數規模,支援原生視覺(多模態)及 EM 級別上下文窗口。 * 官方承認其整體性能略低於 GPT-5.6 與 Claude 5,但在編碼、Agent 調用及視覺能力部分項目排名前三。 * 為完全開源模型,具備本地部署潛力。 2. **實測對比結果(中國象棋網頁版)**: * **生成速度**:GPT-5.6(8分鐘)快於 Kimi K3(11分鐘)。 * **功能可用性**:GPT-5.6 第一版雖有 UI 問題但可遊玩;Kimi K3 第一版存在嚴重 Bug(無法下棋)。 * **修復效率**:GPT-5.6 修復 Bug 僅需 1 分鐘;Kimi K3 修復耗時 12 分鐘(比初次生成還慢)。 * **視覺效果**:GPT-5.6 畫面飽和度與清晰度較佳;Kimi K3 使用 SVG 繪製,清晰度較低。 3. **使用途徑**: * Kimi K3 官方官網對非付費用戶資源有限制。 * 第三方平台 **Workbody** 提供免費積分機制,可用於實測。 ## 詳細大綱 ### 一、 Kimi K3 官方介紹與規格解析 * **技術參數**: * 訓練參數規模達 2.8T。 * 支援原生視覺模型,可處理圖片與視頻,功能多於 DeepSync 與 GLM。 * 支援 EM 級別上下文窗口,屬目前旗艦級別。 * **官方性能定位**: * 官方誠實公開數據,承認整體性能略低於 GPT-5.6 與 Cloud 5。 * **編碼能力**:排名前三,部分項目擊敗 GPT-5.6 與 Cloud Fibro5。 * **通用 Agent 調用**:排名前三,部分項目排名第一。 * **視覺能力**:排名第二,可擊敗 GPT-5.6。 ### 二、 Kimi K3 使用途徑與案例展示 * **使用方式**: * **官方官網**:提供 Kimi K3 及 Kimi K3 集群(多台旗艦模型),但非付費用戶資源不足,無法發送訊息,需升級會員。 * **第三方平台 Workbody**:註冊送 500 積分,每日可領取積分,相當於免費使用。 * **大神案例展示(視覺效果)**: * **影像生成**:展示黑洞、海浪鏡頭等光影效果,調整時間(如日出)後畫面真實感良好。 * **網頁模擬**:展示網頁版 Apple 操作系統模擬,包含菜單欄、圖標、垃圾回收、計算器(14x100=1400)、啟動台及文件管理,模擬效果真實。 ### 三、 實測對比:Kimi K3 vs. GPT-5.6(中國象棋網頁版) * **測試設定**: * 使用相同提示詞,生成具備音樂、難度選擇、輔助功能(提示可走位置)的網頁版中國象棋。 * 工具選擇:使用 Workbody 以獲取免費積分進行測試。 * **Kimi K3 表現**: * **生成速度**:第一版耗時 11 分鐘。 * **功能缺陷**:第一版無法遊玩(點擊後無法走棋)。 * **修復速度**:修復 Bug 耗時 12 分鐘(比生成更慢)。 * **視覺效果**:使用 SVG 繪製,清晰度不高,執行效果不清晰。 * **GPT-5.6 表現**: * **生成速度**:第一版耗時 8 分鐘。 * **功能缺陷**:座標未居中(UI 問題),但可正常遊玩。 * **修復速度**:修復 Bug 僅耗時 1 分鐘 0 秒。 * **視覺效果**:飽和度較高,清晰度較好。 * **功能完整性**:具備音效、將軍動畫、走法提示、難度選擇、回退功能,響應速度快。 * **綜合比較結論**: * **速度**:GPT-5.6 完勝(生成與修復均快於 Kimi K3)。 * **效果**:講者個人認為 GPT-5.6 的 UI 與生成效果更佳。 * **不確定因素**:Workbody 平台是否影響了 Kimi K3 的執行速度,標記為疑點。 ### 四、 總結與展望 * **開源優勢**:Kimi K3 為完全開源模型,具備良好伺服器者可部署至本地電腦。 * **對比閉源**:GPT 與 Anthropic Cloud 為完全閉源(註:逐字稿提及「必源」,疑為閉源)。 * **觀點**:考慮到開源屬性,Kimi K3 表現不錯,希望國產開源模型持續進步。 ## 工具 / 模型 / 名詞整理 * **Kimi K3**:影片主要測試的開源大語言模型,具備 2.8T 參數。 * **GPT-5.6**:對比測試的閉源大語言模型。 * **Workbody**:第三方 AI 使用平台,提供積分機制供用戶免費使用 Kimi K3。 * **DeepSync**:被提及為功能少於 Kimi K3 的模型。 * **GLM**:被提及為功能少於 Kimi K3 的模型。 * **Cloud 5 / Cloud Fibro5**:被提及為性能優於 Kimi K3 的模型。 * **XDBT**:文中提及為「也就是原来的Codex」。 * **SVG**:Kimi K3 生成象棋畫面所使用的繪製格式。 * **Apple 操作系統**:案例中模擬的網頁版操作系統。 * **EM 級別上下文窗口**:Kimi K3 支援的上下文窗口規格。 ## 操作流程整理 1. **準備階段**: * 註冊第三方平台 Workbody 以獲取免費積分。 * 確定測試目標:編寫具備音樂、難度選擇、輔助功能的網頁版中國象棋。 * 準備相同的提示詞(Prompt)。 2. **執行測試 - Kimi K3**: * 在 Workbody 輸入提示詞生成第一版代碼。 * 記錄生成時間(11分鐘)。 * 測試功能,發現無法下棋(Bug)。 * 輸入修復提示詞,記錄修復時間(12分鐘)。 * 評估最終畫面(SVG格式,清晰度低)。 3. **執行測試 - GPT-5.6**: * 在相同環境下輸入相同提示詞生成第一版代碼。 * 記錄生成時間(8分鐘)。 * 測試功能,發現座標未居中但可遊玩。 * 輸入修復提示詞,記錄修復時間(1分鐘)。 * 評估最終畫面(飽和度高,清晰度好)。 4. **結果對比與總結**: * 比較兩者的生成速度、修復速度、功能完整性及視覺效果。 * 得出 GPT-5.6 在執行速度與最終生成效果上具優勢的結論。 ## 值得注意的限制或風險 1. **平台影響效能**:實測使用第三方平台 Workbody,講者標記為疑點,不確定該平台是否影響了 Kimi K3 的執行速度。 2. **開源與閉源差異**:Kimi K3 為開源模型,GPT 與 Anthropic Cloud 為閉源模型,兩者在資源調度與優化上可能存在固有差異。 3. **官方性能承認**:Kimi K3 官方承認整體性能略低於 GPT-5.6 與 Claude 5,這在實測中得到了驗證。 4. **本地部署門檻**:雖然 Kimi K3 可本地部署,但需要具備良好的伺服器資源。 ## 逐字稿辨識疑點 * **K米K3 / KMIK3 / KIMI K3**:逐字稿中模型名稱拼寫不一致,疑為聽寫或口誤。 * **GPT5.6 / JPT5.6 / JPT**:逐字稿中交替使用 GPT 與 JPT,疑為聽寫錯誤。 * **Cloud的Fibro5**:與前文提到的 Cloud 5 不一致,疑為特定版本名稱或聽寫錯誤。 * **XDBT**:文中註解為「也就是原来的Codex」,XDBT 與 Codex 拼寫差異大,疑為聽寫錯誤或特定代號。 * **EM的上下纹**:疑為「EM 級別的上下文窗口」或類似專有名詞的聽寫錯誤。 * **Walkbody**:文中交替使用 Workbody 與 Walkbody,疑為同一平台的不同聽寫。 * **必源**:文中提到 GPT 模型是「完全必源的」,疑為「閉源」的聽寫錯誤。 * **亏一般而知全报**:疑為成語「管中窺豹」或「以一斑窺全豹」的聽寫錯誤。 * **中国相题**:疑為「中國象棋」的聽寫錯誤。 * **码**:文中提到「選擇了一個碼」,疑為「棋子」或「棋子代碼」的聽寫錯誤。 ## 可延伸追問 1. Workbody 平台對 Kimi K3 的具體性能影響有多大?是否有官方基準測試數據可供對比? 2. Kimi K3 的 2.8T 參數規模在本地部署時,對硬體資源(如顯存、算力)的具体要求為何? 3. GPT-5.6 在修復 Bug 時僅需 1 分鐘,其背後是否有特定的優化機制或上下文管理策略? 4. 除了中國象棋,Kimi K3 在其他複雜多模態任務(如視頻生成、複雜 Agent 調用)中的實際表現如何? 5. 開源模型在未來如何縮小與閉源模型在執行速度和最終效果上的差距?