# 影片筆記:DeepSeek V4正式版+Codex工业Agent开发实战!从零手搓AI数据分析Agent,Responses API调用流程与Codex核心功能详解! p02 02.DeepSeek-V4正式版模型入门介绍 ## 一句話總結 本段內容詳細介紹了 DeepSeek V4 正式版的發布歷程、技術架構(284B MOE 模型)、性能提升(Flash 版本提升 30%),並強調其全面兼容 OpenAI Responses API 以無縫接入 Codex 開發生態,同時提供了本地部署的硬體門檻參考及後續課程規劃。 ## 核心重點 * **發布時間線**:DeepSeek V4 於 4 月以 Preview(預覽版)亮相,7 月 31 日推出 V4 Flash 版本,近期正式發布 V4 正式版,結束了三個月的預覽期。 * **技術架構與性能**: * V4 正式版與預覽版架構無變化,仍為 284B 參數的 MOE(混合專家)模型。 * 每次推理激活參數約為 13B(註:筆記中提及口誤曾說 3B,後修正為 13B)。 * 正式版主要通過「後訓練」(Post-training)提升性能,Flash 版本性能較原版提升近 30%。 * 提及 Dspark 論文,在不改價格情況下推理速度提升 80%。 * **生態整合與 API**: * V4 正式版底層通信格式全面兼容 OpenAI 的 Responses API。 * 可無縫接入 Codex,解決了此前需透過第三方工具(如 CCSWITCH)轉換格式的痛點,有利於 Agent 開發。 * 未來 DeepSeek 可能推出自家 Harness Agent,但底層仍將兼容 Responses API。 * **本地部署硬體要求**: * 穩定運行條件:單節點 8 卡 A100 伺服器。 * 最小量化需求:Q2 量化,需佔用約 96G 顯存。 * 替代方案:具備 128G 統一記憶體的设备(如 Mac Studio 或特定 NVIDIA 伺服器)可運行 Q2 或 QR 量化版本。 * **測評表現**: * 對比 G2 5.2(年初國內旗艦開源大模型):全面領先。 * 對比 Op4.8:部分指標有微小差距,但在前端開發、命令行操作等關鍵 Agent 指標上表現類似。 * 與 GPT5.6 LUNA 中號模型對比:性能差別不大,屬於同一梯隊,但價格更便宜。 * Pro 模型預測:若 Flash 進步 30%,Pro 模型性能預期將超越 GPT5.6 及 OPPO4.8,強於 KMIK3。 ## 詳細大綱 ### 一、 DeepSeek V4 發布與迭代歷史 * **時間線**: * 4 月:首次亮相,名為 Preview(預覽版)。 * 7 月 31 日:上線 V4 Flash 版本。 * 近期:V4 正式版正式上線,結束三個月的預覽期。 * **市場反響**: * 國內開發者使用廣泛,普及深度廣。 * 正式版上線後,網上出現大量測評與性能評價。 ### 二、 技術架構與性能提升 * **模型規格**: * 參數量:284B。 * 架構類型:MOE(混合專家模型)。 * 推理激活參數:每次推理幾乎僅激活 3B(註:文中口誤提及 3B,後文修正為 13B,此處依原文記錄疑點)。 * 版本劃分:分為 Flash(小杯)與 Pro(大杯)。 * **性能變化**: * 架構無變化,核心底層功能未變。 * 主要變化在於「後訓練」(Post-training)環節,加入了新的訓練方法。 * **Flash 版本提升**:相比原版 Flash,性能提升近 30%。 * **推理速度**:提及 Dspark 論文,在不改價格情況下推理速度提升 80%。 * **測評表現**: * 對比 G2 5.2(年初國內旗艦開源大模型):全面領先。 * 對比 Op4.8:部分指標有微小差距,但在前端開發、命令行操作等關鍵 Agent 指標上表現類似。 * 基準測試:Terminal Bench、DeepSWE、Agent Last Exam 等。 * 邏輯推理與 SVG 代碼理解:透過「看它邏輯推理能力」及「SVG 代碼理解能力」測試。 * 與 GPT5.6 LUNA 中號模型對比:性能差別不大,屬於同一梯隊,但價格更便宜。 * Pro 模型預測:若 Flash 進步 30%,Pro 模型性能預期將超越 GPT5.6 及 OPPO4.8,強於 KMIK3。 ### 三、 開發生態與 API 整合 * **Responses API**: * 定義:OpenAI 於去年 3 月 11 日發布的 Agent 定義與通信範式,類似於 LongChain 或 Agent Loop。 * 作用:將模型、提示詞、工具綁定,快速搭建 Agent。 * V4 狀態:V4 正式版底層通信格式全面兼容 Responses API。 * **Codex 接入**: * 優勢:V4 正式版可無縫接入 Codex,無需中間轉換環節。 * 影響:對於國內開發者影響巨大,解決了此前 DeepSeek 缺乏官方 Harness Agent 的問題,允許開發者直接使用 Codex 進行開發。 * 對比:此前需透過 CCSWITCH 等工具接入,存在格式轉換瓶頸。 * **未來展望**: * DeepSeek 未來可能推出自家 Harness Agent(名稱未定,內測邀請已發,預計 8 月上線)。 * 即使推出自家工具,底層仍將兼容 Responses API,確保與 Codex 的互通性。 ### 四、 本地部署硬體要求 * **硬體門檻**: * 穩定運行條件:單節點 8 卡 A100 伺服器。 * 最小量化需求:Q2 量化,需佔用約 96G 顯存。 * 替代方案: * Mac Studio:具備 128G 統一記憶體,可運行 Q2 量化下的 DeepSig V4 Flash。 * NVIDIA 伺服器:具備 128G 統一記憶體,可運行 QR 量化下的 Dipsick V4 Flash。 * **資源獲取**: * 權重已開放,提供從 Q2 到 Q4 等不同量化版本的下載入口。 ### 五、 課程內容安排 * **第一部分**:DeepSeek V4 Flash (0731) 模型基本情況。 * **第二部分**:Responses API 接口的具體使用與底層交互協議。 * **第三部分**:Codex 開發實踐。 * 涵蓋桌面端 APP 使用。 * 重點講解 CLI(命令行環境)操作,強調其對靈活高效完成複雜系統開發的重要性。 ## 工具 / 模型 / 名詞整理 * **模型名稱**: * Deepseek v4 (Preview / 正式版) * Deepseek v4 Flash * Deepseek v4 Pro * Deepseek V1 * G2 5.2 * Op4.8 (或 OPPO4.8) * GPT5.6 (LUNA 地球模型 / 中號模型) * KIMI K3 (或 KMIK3) * **產品與工具**: * Codex (含桌面端 APP 及 CLI 命令行環境) * Responses API (OpenAI 發布) * LongChain (開發框架) * CCSWITCH (工具) * Dspark (論文/伺服器提及) * DeepseekTY (項目,後改名為 Resenix) * Resenix (項目) * Mac Studio (硬體) * A100 (顯卡/伺服器) * NVIDIA (硬體品牌) * **測試與基準**: * Terminal Bench * DeepSWE * Agent Last Exam * SVG 代碼理解能力測試 * 探索細胞結構測試 * 發動機結構拆解測試 ## 操作流程整理 * **模型選擇與部署流程**: 1. 根據硬體條件選擇模型版本: * 若擁有單節點 8 卡 A100 伺服器,可穩定運行。 * 若使用 Mac Studio 或具備 128G 統一記憶體的 NVIDIA 伺服器,可選擇 Q2 或 QR 量化版本。 2. 下載權重:從官方入口下載從 Q2 到 Q4 等不同量化版本的權重。 * **Agent 開發流程**: 1. 利用 DeepSeek V4 正式版底層對 Responses API 的兼容性。 2. 直接接入 Codex(桌面端或 CLI),無需透過 CCSWITCH 等第三方工具進行格式轉換。 3. 在 Codex 中綁定模型、提示詞與工具,快速搭建 Agent。 4. (未來選項)若 DeepSeek 推出自家 Harness Agent,仍可透過兼容 Responses API 的方式與 Codex 互通。 ## 值得注意的限制或風險 * **硬體門檻限制**: * 本地部署對硬體要求較高,穩定運行需單節點 8 卡 A100。 * 量化版本(Q2)仍需約 96G 顯存,僅具備 128G 統一記憶體的设备(如 Mac Studio)可運行,存在硬體兼容性限制。 * **性能預期風險**: * Pro 模型超越 GPT5.6 及 OPPO4.8 的預測基於 Flash 版本進步 30% 的假設,實際表現需視具體測評而定。 * **生態依賴風險**: * 目前高度依賴 OpenAI 的 Responses API 標準來實現與 Codex 的無縫接入,若 API 標準發生重大變更,可能影響開發流程。 ## 逐字稿辨識疑點 * **參數激活數量矛盾**: * 文中先提到「3B 的每次推理幾乎的參數量」,後文又提到「推理是 13 個檔位...推理是 13 個...激活 13B 的參數」。需查證 V4 Flash 實際激活參數為 3B 還是 13B。 * **模型名稱拼寫**: * 「DeepSig V4 Flash」:疑為 DeepSeek 的聽寫錯誤。 * 「Dipsick V4 Flash」:疑為 DeepSeek 的聽寫錯誤。 * 「OPPO4.8」:疑為 Op4.8 或特定模型名稱,需查證。 * 「KMIK3」:疑為 KIMI K3 的聽寫錯誤。 * 「GPT5.6」:需查證是否為 GPT-4o 或其他版本的口誤,或確實存在此版本。 * 「LUNA 地球模型」:需查證 GPT5.6 是否對應 LUNA 模型,或為口誤。 * **產品名稱**: * 「DeepseekTY」:需查證該項目確切名稱,文中提及後改名為 Resenix。 * 「Cloud code」:文中提及「Cloud Code」,需確認是否指 Google Cloud Code 或其他特定產品,或為口誤。 * 「Dspark」:文中提及「Dspark 這樣一篇論文」及「英偉達 Dspark 那樣的伺服器」,需查證 Dspark 具體指代何種技術或硬體。 * **技術術語**: * 「QR 量化」:需查證量化格式是否為 QR,通常常見為 Q4、Q5 等,QR 可能為口誤或特定格式。 * 「後訓練」:文中強調 V4 正式版僅在「後訓練」環節有變化,需確認此技術描述是否準確對應官方技術文檔。 ## 可延伸追問 * DeepSeek V4 Flash 版本的實際激活參數究竟是多少?是 3B 還是 13B? * 「GPT5.6」和「LUNA 地球模型」具體指代哪款模型?是否存在該版本號? * 「Dspark」論文或伺服器具體是指什麼技術?與 NVIDIA 的關係為何? * 「QR 量化」具體是什麼格式?與常見的 Q4_K_M 等格式有何區別? * DeepSeek 即將推出的自家 Harness Agent 預計何時正式上線?其與 Responses API 的具體兼容機制為何? * 對於普通開發者,使用 Mac Studio (128G) 運行 Q2 量化版本的 DeepSeek V4 Flash,在實際 Agent 開發中的體驗與性能表現如何?