# 影片筆記:DeepSeek V4 Flash 深度实测!冲进前五,这波是真正的王者归来! p01 中文配音 ## 一句話總結 DeepSeek 發布了 **V4 Flash 0731** 版本,透過「智能體後訓練」大幅提升 Agent 能力,在自建基準測試中展現出極高的性價比與強大的數學、長程任務推理能力,雖在純視覺打磨上表現一般,但已逼近頂尖模型水平,預示著即將發布的 V4 Pro 正式版將帶來更大衝擊。 ## 核心重點 1. **版本更新核心**:DeepSeek V4 Flash 0731 版本並非增加參數量,而是透過高强度的「智能體後訓練」(Agent Post-training)來提升能力。 2. **性能表現**: * 官方基準測試顯示,V4 Flash 0731 在 Terminal Bench 2.1 等指標上超越 V4 Pro 預覽版,並逼近 Opus 水平。 * 講者自建測試(Kinbench/TingBench)顯示,該模型在數學推理、長程智能體任務及部分 3D 生成上表現卓越,創下歷史高分。 * 在純視覺打磨(如 SVG 圖像、電梯動畫流暢度)上表現平平。 3. **技術規格與生態**: * V4 Flash 為混合專家模型(MoE),定位快速、低成本。 * 原生支持 Response API 格式,完全適配 **Codex** 框架,可直接接入 Cursor 等代碼工具。 4. **適用對象與建議**: * 該模型性價比極高,適合預算有限的開發者或學生用於智能體編程。 * 官方 DeepSeek V4 Pro 正式版即將發布,若將同樣的智能體後訓練應用於 1.6 萬億參數模型,將對閉源模型形成巨大衝擊。 ## 詳細大綱 ### I. DeepSeek V4 Flash 0731 更新介紹 * **發布內容**:DeepSeek V4 Flash 官方 API 開啟公測,版本號為 0731。 * **核心變化**: * 架構與參數量與預覽版完全一致(未變大)。 * 主要提升來自「智能體後訓練」(Agent Post-training)。 * 智能體能力測試分數遠超 V4 Pro 預覽版。 * **適用範圍**:僅限 DeepSeek V4 Flash API、V4 Pro API 及 App 端;網頁端模型未變。 * **未來預告**:DeepSeek V4 Pro 正式版本即將發布。 ### II. 技術細節與生態適配 * **模型規格(V4 Flash 系列)**: * 混合專家模型(MoE)。 * 總參數量:2000.0840 億(聽似有誤,疑點見下文)。 * 激活參數量:約 130 億。 * 上下文窗口:100 萬 Token。 * 定位:快速、低成本。 * **對比模型**:V4 Pro 為 1.6 萬億參數的旗艦大模型。 * **生態適配**: * 原生支持 Response API 格式。 * 完全適配 **Codex** 框架,可直接接入 Codex 風格工作流。 * GLM 及其他國內實驗室也在進行類似框架適配。 ### III. 官方基準測試數據 * **Terminal Bench 2.1**: * V4 Flash 0731:82.7 分。 * V4 Flash 預覽版:61.8 分。 * V4 Pro 預覽版:72.1 分。 * GLM-4-0520:81 分。 * Opus:85 分(價格更貴)。 * **SWBEC**: * 新版本:54.4 分。 * 預覽版:7.3 分。 * GLM4-0520:46.2 分。 * Opus:58 分。 * **其他指標提升**: * Cybergen:38.7 -> 76.7 分。 * CoderEval:49.7 -> 70.3 分。 * DSBench(全棧任務):37 -> 68.7 分。 * 高難度編碼智能體任務:25.8 -> 59.6 分。 * **測試條件註解**: * 使用了即將推出的 **Deep-C Harness** 框架。 * 運行於「極簡模式」,最高檔位。 * Top-p 設為 0.95,溫度(Temperature)設為 1。 * DeepSeek 強調測試框架選擇對結果影響巨大,數據僅供參考。 ### IV. 講者自建基準測試(Kinbench/TingBench) * **測試環境**:講者自建基準測試,涵蓋前端、動畫、Three.js、SVG、數學、長程智能體及 3D 任務。 * **評分標準**:每項滿分 10 分。 #### 測試題目與結果: 1. **電梯模擬(前端/動畫)**: * 任務:構建模擬程序,多電梯運行,懸停顯示目標樓層。 * 結果:5 分。基本框架有,但核心邏輯(乘客接駁)未跑通,動畫不流暢。 * 對比:Opus 10 分,Claude 3.5 與 Kimi k3 為 9 分。 2. **Three.js 隱形眼鏡盒(3D模型)**: * 任務:生成帶 L/R 標識蓋子的 3D 模型,點擊打開交互。 * 結果:8 分。外觀合格,交互有效。 * 對比:Qwen 2.5 Maths 並列,Opus 5 分(歷史第二),Claude 3.5 唯一滿分。 3. **FreeJF 折疊桌(3D動畫)**: * 任務:滑塊控制折疊/展開,無縫 3D 動畫。 * 結果:7 分。過渡基本自然但不完全流暢。 * 對比:Claude 3.5, Kimi, GLM4, Sonnet 3.5 為 9 分;Opus 僅 5 分。 4. **生成 SVG 吃漢堡的熊貓(視覺)**: * 任務:生成 SVG 圖像。 * 結果:5 分。構圖別扭,不像在吃漢堡。 * 對比:Kimi, Gemini 1.5, Qwen 2.5 Max 僅 8 分。 5. **弓箭模擬遊戲(遊戲邏輯)**: * 任務:四個靶子,最短時間擊中,排行榜功能。 * 結果:7 分。核心機制正常,手感與細節打磨未達頂尖。 * 對比:Groq 1.5, Qwen 2.5 Math, Opus 滿分。 6. **數學難題(推理)**: * 任務:計算有序隊排列數,答案 2460。 * 結果:10 分(滿分)。完美答對。 * 對比:與 Claude 3.5, Gemini Chat, Qwen Max, Opus 並列。 * 註:V4 Pro 預覽版也做對了,顯示 V4 系列推理能力強。 7. **長程智能體任務(全棧/微調)**: * 任務:生成熊貓數據集 -> 微調 Gemma 2B -> 構建本地 WebUI -> 隨機生成冷知識。全程自主、本地運行。 * 結果:10 分(滿分)。表現完美,無卡殼。 * 對比:預覽版遠不如現在可靠。 8. **3D 萬年曆(極難 3D)**: * 任務:功能完整的 3D 萬年曆,顯示時間(秒/分/針平滑轉動)、日期、雙時區。 * 結果:6 分。創下該題歷史記錄(此前最高為 GPT-4o 的 4 分)。 * 對比:擊敗了 Claude 3.5, Opus 及其他前沿模型。 ### V. 最終總結與結論 * **總分**:58 分,得分率 72.5%。 * **排名對比**: * 高於 GPT-4o-513 (71.25%)。 * 低於 Gemini 1.5 Pro (75%)。 * 低於 Kimi, OpenAI (77.5%)。 * 低於 GPT-4o-2024-05-13 (80%)。 * 低於 Qwen 2.5 Max (81.25%)。 * 低於 Claude 3.5 (82.5%)。 * **關鍵發現**: * V4 Flash 小模型得分率 (72.5%) 遠高於 V4 Pro 預覽版 (24.8%),提升近三倍。 * 在邏輯推理、長程 Agent 任務上表現完美。 * 在純視覺打磨(如 SVG、電梯動畫)上表現平平。 * 結論:針對智能體編程深度微調的模型。 * **建議**: * 目前性價比最高的模型之一。 * 可直接接入 Cursor 等代碼工具。 * 適合學生或預算有限的開發者。 * 雖無法擊敗 Claude 3.5 或 Opus 綜合表現,但考慮體量與價格已足夠驚艷。 * **未來展望**: * 官方 DeepSeek V4 Pro 即將發布。 * 若將同樣的智能體後訓練應用於 1.6 萬億參數模型,將對閉源模型形成「降維打擊」。 ## 工具 / 模型 / 名詞整理 * **DeepSeek 系列**: * DeepSeek V4 Flash (0731 版本) * DeepSeek V4 Pro (預覽版 / 即將發布的正式版) * **其他模型**: * Claude 3.5 * Opus (可能指 Claude Opus) * GLM-4-0520 / GLM4 * Kimi k3 / Kimi * Qwen 2.5 Maths / Qwen 2.5 Max * Sonnet 3.5 * Gemini 1.5 / Gemini Chat * GPT-4o-513 / GPT-4o-2024-05-13 * Groq 1.5 * Gemma 2B * **框架與工具**: * NVIDIA Link (用於免費使用) * Kinbench (講者自稱的基準測試名稱,後文又稱 TingBench) * Terminal Bench 2.1 * SWBEC * Cybergen * CoderEval * DSBench * Deep-C Harness (即將推出的框架) * Codex (框架/工作流) * Cursor (代碼工具) * Three.js * SVG * WebUI ## 操作流程整理 1. **獲取模型**:通過 DeepSeek V4 Flash API 或 App 端獲取 0731 版本模型。 2. **環境配置**: * 確保使用支持 Response API 格式的框架。 * 若使用 Codex 框架,可直接接入工作流。 * 若進行官方基準測試,需使用 Deep-C Harness 框架,設置 Top-p 為 0.95,溫度為 1,並運行於「極簡模式」。 3. **執行測試任務**: * **前端/動畫任務**:如電梯模擬、折疊桌動畫,測試邏輯與流暢度。 * **3D 生成任務**:如隱形眼鏡盒、萬年曆,測試模型生成與交互能力。 * **視覺生成任務**:如 SVG 圖像生成,測試視覺構圖能力。 * **數學推理任務**:如排列數計算,測試邏輯推理能力。 * **長程智能體任務**:如數據集生成、模型微調、WebUI 構建,測試全流程自主執行能力。 4. **評估與對比**: * 根據任務完成度、代碼質量、視覺效果進行評分(滿分 10 分)。 * 將結果與其他模型(如 Claude 3.5, Opus, GPT-4o 等)進行對比分析。 5. **應用建議**: * 對於預算有限的開發者,建議優先使用 V4 Flash 進行智能體編程與邏輯推理任務。 * 可將模型接入 Cursor 等代碼工具進行實際開發。 ## 值得注意的限制或風險 1. **參數量描述疑點**:影片中提到 V4 Flash 總參數量為「2000.0840 億」,此數字格式異常,可能為聽寫錯誤或口誤,實際數值需查證。 2. **測試名稱不一致**:講者先稱測試為「Kinbench」,後又稱「TingBench」,兩者可能為同一測試的不同稱呼或口誤,需查證正確名稱。 3. **模型名稱拼寫**:影片中出現「Cloud 3.5」,應指「Claude 3.5」,但依規則標為疑點。 4. **參數規模描述混淆**:影片中存在「2840 億參數的 Flash」與前文「2000 0840 億」及「130 億激活參數」的描述可能存在聽寫混淆,需查證 V4 Flash 的確切參數。 5. **溫度參數描述語意不通**:影片提到「溫度參數設為一可見」,「可見」二字語意不通,疑為口誤或聽寫錯誤。 6. **詞彙聽寫錯誤**:「重歸原矩」疑為「重回原點」或類似詞彙的聽寫錯誤。 7. **術語使用不常見**:「API 知識」在語境中可能指「API 接口」或特定功能,但「API 知識」一詞較不常見,疑為口誤。 ## 逐字稿辨識疑點 * **參數量描述**:「2000 0840 億的總參數量」。數字格式異常,疑為聽寫錯誤或口誤,實際數值需查證。 * **測試名稱不一致**:講者先稱測試為「Kinbench」,後又稱「TingBench」。兩者可能為同一測試的不同稱呼或口誤,需查證正確名稱。 * **模型名稱拼寫**:「Cloud 3.5」應指「Claude 3.5」,但依規則標為疑點。 * **參數規模描述**:「2840 億參數的 Flash」與前文「2000 0840 億」及「130 億激活參數」的描述可能存在聽寫混淆,需查證 V4 Flash 的確切參數。 * **溫度參數描述**:「溫度參數設為一可見」,「可見」二字語意不通,疑為口誤或聽寫錯誤。 * **重歸原矩**:「重歸原矩」疑為「重回原點」或類似詞彙的聽寫錯誤。 * **代碼工具名稱**:「API 知識」在語境中可能指「API 接口」或特定功能,但「API 知識」一詞較不常見,疑為口誤。 ## 可延伸追問 1. DeepSeek V4 Flash 0731 版本的確切參數量是多少?「2000.0840 億」是否為聽誤? 2. 「Kinbench」與「TingBench」是否為同一個基準測試?其正確名稱為何? 3. 「Cloud 3.5」是否確指「Claude 3.5」? 4. 「溫度參數設為一可見」中的「可見」具體指什麼?是否為「1.0」的聽誤? 5. 「重歸原矩」的正確詞彙為何? 6. 「API 知識」在影片語境中具體指代什麼功能或接口? 7. DeepSeek V4 Pro 正式版的具體發布時間與性能預期為何? 8. 如何通過 NVIDIA Link 免費使用 DeepSeek V4 Flash API?