# 影片筆記:DeepSeek V4 Pro Is Out Today And It's A Problem For Every AI Lab! ## 一句話總結 DeepSeek v4 Pro 與 SpaceX 發布的 Grok 4.6 正式發布,兩者皆以極低的價格提供匹敵頂級實驗室(如 Fable 5、GPT 5.6)的性能,標誌著 2026 年 AI 競爭關鍵從「最強性能」轉向極致的「性價比」。 ## 核心重點 1. **DeepSeek v4 Pro 正式發布 (GA)**: * 經過更多訓練,性能顯著提升,在 Terminal Bench、Cyber Gym、Automation Bench 等多項基準測試中表現優異,部分項目超越 Fable 5。 * 價格極具競爭力:輸入 43 美分/百萬 token,輸出 87 美分/百萬 token,據稱比 Fable 5 便宜約 57 倍。 * 驗證了此前根據洩露投資者報告所做的性價比預測。 2. **SpaceX Grok 4.6 發布**: * 被視為 SpaceX 團隊的重大進步,在 Artificial Analysis Intelligence Index、Code Val、Cursor Bench 等測試中與 Fable 5 和 GPT 5.6 打平或略勝。 * 價格極低:輸入約 2 美元/百萬 token,輸出約 6 美元/百萬 token,性能匹敵頂級模型但成本大幅降低。 * 已在 Cursor 和 Grok Build 平台可用,首週提供雙倍使用量優惠。 3. **市場趨勢轉變 (2025 vs 2026)**: * 2025 年:實驗室專注於打造最強模型,對成本較寬鬆。 * 2026 年:隨著 DeepSeek 和 SpaceX 等競爭對手以極低成本提供匹敵頂級性能的服務,「性價比 (Price to Performance)」成為用戶選擇模型的重要指標。 ## 詳細大綱 ### A. DeepSeek v4 Pro 正式發布與性價比革命 * **發布狀態**:DeepSeek v4 Pro 今日正式發布 (General Availability, GA)。此前雖已可用但非正式版本,此次發布代表模型經過更多訓練,性能更強。 * **基準測試表現**: * **Terminal Bench 2.1**:得分 87.9,僅落後 Fable 5 (88) 0.1 分;舊版為 72.1,Flash 版為 82.7。 * **Cyber Gym (網路安全)**:得分 83.3,超越 Fable 5 (83.1)。顯示該模型在網路安全領域具備強大能力,延續了 Flash 版的優勢。 * **Deep Software Engineering**:得分 62.7,落後 Fable 5 (70),但領先 GLM 5.2 和 Kimmy K3 (67.5)。相比預覽版的 12.8 有巨大提升。 * **Automation Bench**:得分 31.8,超越 Fable 5 (29.1)。 * **價格優勢**: * DeepSeek v4 Pro:輸入 43 美分/百萬 token,輸出 87 美分/百萬 token。 * 對比 Fable 5:輸入 10.50 美元,輸出 50 美元。 * 結論:DeepSeek v4 Pro 比 Fable 5 便宜約 57 倍。 * **預測驗證**:此前根據洩露的投資者報告預測其性價比,當時持懷疑態度,但今日基準測試結果證實了預測。 * **長期表現觀察**:目前僅基於基準測試,需觀察數週以確認生產環境中的長期穩定性,避免發布日表現好但隨後品質下降的情況。 ### B. SpaceX Grok 4.6 發布與評估 * **團隊轉變**:講者對 SpaceX 團隊在 2026 年的表現感到驚訝。2025 年發布的 Grok 4 等模型表現平平,但 2026 年的 Grok 4.5 和 4.6 顯示出競爭力。 * **基準測試表現**: * **Artificial Analysis Intelligence Index**:Grok 4.6 得分 61,與 Fable 5 (62) 和 GPT 5.6 (61, Max 設定) 打平或非常接近。 * **Code Val**:Grok 4.6 得分超越 Fable 5 (1741) 和 GPT 5.6 (1728)。 * **Deep Software Engineering**:得分 65.9,接近 Fable 5 (70) 和 GPT 5.6 (66)。 * **Cursor Bench**:得分 69.9,接近 Fable 5 (70.5),並超越 GPT 5.6。 * **Frontier Code**:接近 Fable 5,超越 GPT 5.6。 * **價格對比**: * Grok 4.6:輸入約 2 美元/百萬 token,輸出約 6 美元/百萬 token。 * Fable 5:輸入 10 美元,輸出 50 美元。 * 結論:Grok 4.6 性能匹敵頂級模型,但價格極低。 * **平台與合作**: * Grok 4.6 已在 Cursor 中可用。 * 提及 SpaceX 與 Cursor 的合作或收購關係有助於其在 AI 領域的進展。 * 預測 Grok Build 可能成為類似 Codeex 或 Cloud Code 的平台。 * **優惠**:首週在 Grok Build 和 Cursor 中提供雙倍使用量。 * **輸出範例**: * **Falcon 9 助推器返回序列模擬**:單個 HTML 文件生成,展現競爭力。 * **賽車遊戲**:使用 5 個字的提示詞 ("create a simple racing game in HTML"),Grok 4.6 在約 1 分鐘內生成。 * **成本分析**: * 運行 GPT 5.6 在 Artificial Analysis Index 上的完整測試成本約為 1.1K(講者重複提及 2.6 和 1.1Kish,語意稍顯混亂,但強調 GPT 成本較高)。 * Grok 4.6 提供相似性能但成本僅為一半或更低。 ### C. 市場總結與展望 * **競爭格局變化**: * 2025 年:實驗室 (OpenAI, Anthropic 等) 專注於打造最強模型,對成本較寬鬆,因競爭較少。 * 2026 年:出現智能模型雖未領先但能匹敵頂級性能且成本極低的競爭對手 (如 DeepSeek, SpaceX)。 * **指標轉變**:性價比 (Price to Performance Ratio) 成為 2026 年關鍵指標。 * **基準圖表更新**:新模型發布後,DeepSeek 和 Grok 在多個基準中匹配頂級性能,但 Opus 5 未被列入部分比較中 (講者疑惑為何未包含 Opus 5)。 ## 工具 / 模型 / 名詞整理 * **模型名稱**: * DeepSeek version 4 Pro (DeepSeek v4 Pro) * Grok 4.6 (Grok 4.6) * Grok 4.5 * Grok 4 * Fable 5 (講者多次提及,疑為某實驗室頂級模型名稱) * GPT 5.6 (講者提及,疑為 OpenAI 模型) * Opus 5 (講者提及 Anthropic 模型,但未列入部分比較) * GLM 5.2 * Kimmy K3 * Flash version (DeepSeek Flash) * **平台/工具**: * Cursor * Grok Build * Codeex * Cloud Code * Artificial Analysis Intelligence Index (Artificial Analysis 智能指數) * Terminal Bench 2.1 * Cyber Gym (Cyber Security 基準測試) * Deep Software Engineering (基準測試) * Cursor Bench * Frontier Code (基準測試) * Automation Bench * **其他專有名詞**: * SpaceX * Deepseek team * Frontier Labs (頂級實驗室) * OpenAI * Anthropic * Universe of AI newsletter (Universe of AI 通訊) * World of AI (頻道名稱) * X (平台) ## 操作流程整理 1. **評估 DeepSeek v4 Pro 性能**: * 查看 Terminal Bench 2.1 得分 (87.9)。 * 查看 Cyber Gym 得分 (83.3)。 * 查看 Deep Software Engineering 得分 (62.7)。 * 查看 Automation Bench 得分 (31.8)。 * 確認價格:輸入 43 美分/百萬 token,輸出 87 美分/百萬 token。 * 與 Fable 5 進行價格對比 (便宜約 57 倍)。 2. **評估 Grok 4.6 性能**: * 查看 Artificial Analysis Intelligence Index 得分 (61)。 * 查看 Code Val 得分 (超越 Fable 5 和 GPT 5.6)。 * 查看 Deep Software Engineering 得分 (65.9)。 * 查看 Cursor Bench 得分 (69.9)。 * 確認價格:輸入約 2 美元/百萬 token,輸出約 6 美元/百萬 token。 * 確認平台可用性:Cursor 和 Grok Build。 * 利用首週雙倍使用量優惠進行測試。 3. **生成範例測試**: * 使用 Grok 4.6 生成 Falcon 9 助推器返回序列模擬 (單個 HTML 文件)。 * 使用 5 字提示詞 ("create a simple racing game in HTML") 生成賽車遊戲,耗時約 1 分鐘。 4. **市場趨勢分析**: * 比較 2025 年與 2026 年的競爭重點 (性能 vs. 性價比)。 * 觀察 DeepSeek 和 Grok 在基準測試中與頂級模型 (Fable 5, GPT 5.6) 的表現對比。 * 關注生產環境中的長期穩定性。 ## 值得注意的限制或風險 1. **生產環境穩定性**:目前僅基於基準測試,需觀察數週以確認生產環境中的長期穩定性,避免發布日表現好但隨後品質下降的情況。 2. **基準測試的局限性**:基準測試結果可能無法完全反映實際生產環境中的表現,特別是長期運行的穩定性。 3. **模型名稱與版本的準確性**:影片中提及的多個模型名稱 (如 Fable 5, GPT 5.6, Kimmy K3, Opus 5) 和基準測試名稱可能存在辨識錯誤或為非標準命名,需進一步查證。 4. **價格單位的清晰度**:部分價格描述 (如 "1.1Kish", "2.6") 語意不清晰,可能影響對成本的準確評估。 5. **Opus 5 的缺席**:講者疑惑為何 Opus 5 未被列入部分比較中,這可能影響對整體競爭格局的完整理解。 ## 逐字稿辨識疑點 * **Fable 5**:逐字稿中多次出現 "Fable 5",並與 GPT 5.6、Opus 5 並列為頂級模型。此名稱在常見 AI 模型中較不常見,可能為聽寫錯誤(例如是否為 "Claude 3.5"、"Gemini 1.5 Pro" 或其他模型?),但根據規則僅標記為「需查證」。 * **GPT 5.6**:講者提及 "GPT 5.6",目前 OpenAI 主流模型版本號通常不以此格式出現(如 GPT-4o, GPT-4.5 等),此為「需查證」的模型名稱。 * **Kimmy K3**:講者提及 "Kimmy K3" 在 Deep Software Engineering 基準中得分 67.5。此名稱疑似為聽寫錯誤(可能指代某特定模型或實驗室產品),標記為「需查證」。 * **GLM 5.2**:講者提及 "GLM 5.2"。GLM 系列通常由智譜 AI 開發,版本號格式需查證是否準確。 * **Opus 5**:講者提及 "Opus 5" 為 Anthropic 的模型。目前 Anthropic 頂級模型為 Opus (Claude 3 Opus),"Opus 5" 可能為聽寫錯誤或未來預測名稱,標記為「需查證」。 * **1.1Kish / 2.6**:在描述運行 GPT 5.6 的成本時,講者重複提及 "2.6" 和 "1.1Kish",語意不清晰,可能指 1.1K (1100) 或其他單位,標記為「需查證」。 * **Deep Software Engineering one**:講者口語中出現 "Deep Software Engineering one",應指 "Deep Software Engineering" 基準測試,"one" 可能為口語贅字或聽誤。 * **Soul**:在 "GPT 5.6 six soul" 處,"soul" 可能為 "score"(得分)的聽寫錯誤,或特定術語,標記為「需查證」。 * **Enthropic**:講者口語中將 "Anthropic" 聽寫為 "Enthropic",標記為「需查證」。 * **Cursor Bench 3.2**:講者提及 "Cursor Bench 3.2",需查證該基準測試版本號是否準確。 * **Terminal Bench 2.1**:講者提及 "Terminal Bench 2.1",需查證該基準測試版本號是否準確。 * **Cyber Gym**:講者提及 "Cyber Gym" 作為網路安全基準,需查證該基準測試名稱是否準確。 * **Automation Bench**:講者提及 "Automation Bench",需查證該基準測試名稱是否準確。 * **Frontier Code**:講者提及 "Frontier Code" 作為基準,需查證該基準測試名稱是否準確。 * **Artificial Analysis Intelligence Index**:講者提及此指數,需查證其準確名稱是否為 "Artificial Analysis Intelligence Index" 或類似名稱。 * **Universe of AI newsletter**:講者提及通訊名稱,需查證是否為 "Universe of AI" 或 "World of AI" 相關通訊。 * **World of AI**:講者提及頻道名稱 "World of AI",需查證是否為正確頻道名稱。 * **X**:講者提及在 "X" 上關注,指推特平台,標記為「需查證」平台名稱。 * **SpaceX team**:講者將 Grok 開發團隊稱為 "SpaceX team",需查證是否準確指代 xAI 團隊。 * **Grok Build**:講者提及 "Grok Build" 平台,需查證是否為正確產品名稱。 * **Codeex**:講者提及 "Codeex" 平台,需查證是否為正確產品名稱。 * **Cloud Code**:講者提及 "Cloud Code" 平台,需查證是否為正確產品名稱。 * **Deepseek version 4 Pro GA**:講者提及 "GA" (General Availability),標記為「需查證」縮寫含義。 * **Investor report**:講者提及洩露的 "investor report",需查證具體報告名稱。 * **Falcon 9 booster return sequence simulation**:講者提及此模擬範例,標記為「需查證」具體內容描述。 * **HTML file**:講者提及生成單個 HTML 文件,標記為「需查證」技術細節。 * **5-word prompt**:講者提及 "fiveword prompt",標記為「需查證」提示詞長度描述。 * **Create a simple racing game in HTML**:講者提及此提示詞,標記為「需查證」具體提示詞內容。 * **1 minute**:講者提及生成賽車遊戲耗時約 1 分鐘,標記為「需查證」時間描述。 * **2 per million input tokens**:講者提及 Grok 4.6 輸入價格,標記為「需查證」價格單位。 * **6 per million output tokens**:講者提及 Grok 4.6 輸出價格,標記為「需查證」價格單位。 * **10 per million input tokens**:講者提及 Fable 5 輸入價格,標記為「需查證」價格單位。 * **50 per million output tokens**:講者提及 Fable 5 輸出價格,標記為「需查證」價格