# 影片筆記:DeepSeek V4 Flash终于能看图了?305B模型强行接上视觉能力!Hybrid Vision多模态版实测 ## 一句話總結 影片介紹了由社區開發者製作的 **DeepSeek V4 Flash 0731** 多模態版本,該版本通過將 **Qwen 3.5 35B** 中的 **MoonViT** 模塊移植到 DeepSeek V4 Flash 前面「套層」的方式實現視覺能力,在保持 305B 參數規模與極低性能損耗的同時,實現了低成本本地運行與億兆上下文支持。 ## 核心重點 * **非官方社區版本**:DeepSeek V4 Flash 0731 多模態版並非官方發布,而是由社區大佬製作。 * **技術實現路徑**:採用「套層」方式,將 **Qwen 3.5 35B** 的多模態模塊 **MoonViT** 移植到 DeepSeek V4 Flash 模型前端。 * **運行機制**:若輸入為圖片,系統會路由至視覺編碼器/解碼器處理;若為文字,則走原有邏輯。這與之前通過 Skills/Agent 進行後期邏輯合成的方式不同,屬於直接修改模型結構。 * **性能表現優異**: * 基準測試達到 **6.5** 的效果。 * 對原始 DeepSeek V4 Flash 模型的能力損失極小,幾乎可忽略。 * **部署與成本優勢**: * 參數仍為 **305B**,模型大小約 **168G**。 * 可在兩台 **DGX B100** 上運行,理論上 Mac 也可運行(講者未實際測試)。 * 實現完全本地運行,推理成本極低,並支持多模態及億兆上下文。 ## 詳細大綱 ### 1. 項目背景與介紹 * 本集影片介紹的是一個社區開發的多模態版本,名稱為 **DeepSeek V4 Flash 0731**。 * 強調該版本非官方發布,但由社區高手製作,具有較高價值。 ### 2. 技術原理詳解 * **核心思路**:在 DeepSeek V4 Flash 模型前面「套層」。 * **具體操作**: * 從 **Qwen 3.5 35B**(聽似千問)模型中提取多模態部分。 * 移植名為 **MoonViT** 的模塊。 * **區別於前作**: * 前幾期影片講解的是通過 Skills 或 Agent 進行後期合成(邏輯層面)。 * 本項目是直接修改模型結構(結構層面),屬於合成模型。 ### 3. 性能測試與評估 * **基準測試**:測試結果非常成功,提及達到 **6.5** 的效果。 * **模型損耗**:對 DeepSeek V4 Flash 本身模型的能力損失極小。 * **參數規模**:合併後的模型參數仍為 **305B**。 * **模型大小**:約 **168G**。 ### 4. 部署場景與講者觀點 * **硬體需求**: * 明確指出兩台 **DGX B100** 可以運行。 * 提及 Mac 理論上也可運行,但講者未實際測試。 * **優勢總結**: * 完全本地運行。 * 推理成本極低。 * 支持多模態及億兆上下文。 * **講者個人看法**: * 雖然非官方,但價值很高。 * 希望官方能推出此功能。 * 講者個人因已有 Skills 合併方案,故無強烈本地運行此模型的需求。 ## 工具 / 模型 / 名詞整理 * **DeepSeek V4 Flash 0731**:影片討論的核心模型版本,帶有「多模態」標籤。 * **Qwen 3.5 35B**:作為提供多模態能力的源模型,聽似「千問3.535B」。 * **MoonViT**:被移植的多模態模塊名稱,用於處理視覺信息。 * **DGX B100**:用於運行該模型的硬體設備。 * **Mac**:提及可運行的操作系統平台。 * **Skills**:講者提及用於後期合成多模態功能的技術/工具。 * **Agent**:提及用於實現多模態效果的環境。 * **6.5**:基準測試中提到的數值,指代某種效果或分數。 * **JM5.2**:講者提及的模型或技術名稱,需查證。 * **億兆上下文**:模型支持的上下文長度描述。 ## 操作流程整理 1. **模型選擇與準備**: * 獲取社區製作的 **DeepSeek V4 Flash 0731** 多模態版本。 2. **結構修改(套層)**: * 在原始 DeepSeek V4 Flash 模型前端套入 **Qwen 3.5 35B** 的多模態模塊 **MoonViT**。 3. **運行與路由**: * 當輸入為圖片時,數據路由至視覺編碼器/解碼器(MoonViT)處理。 * 當輸入為文字時,走原有 DeepSeek V4 Flash 邏輯。 4. **部署運行**: * 將約 168G 的模型部署於兩台 **DGX B100** 上(或理論上的 Mac 環境)。 5. **驗證效果**: * 進行基準測試,確認達到 **6.5** 的效果。 * 確認對原始模型能力損耗極小。 ## 值得注意的限制或風險 * **非官方版本**:該模型為社區製作,非 DeepSeek 官方發布,穩定性與長期維護需自行評估。 * **硬體門檻**:雖然參數為 305B,但仍需兩台 **DGX B100** 才能運行,對普通用戶而言硬體成本不低。 * **測試局限性**:講者提到 Mac 上理論可跑但未實際測試,實際兼容性存在不確定性。 * **技術複雜度**:涉及模型結構的直接修改與模塊移植,比後期通過 Agent/Skills 合成更為複雜。 ## 逐字稿辨識疑點 * **「Deepseek V4 Flash 0731」**:逐字稿中多次出現此名稱,需查證是否為準確的模型版本號或代碼。 * **「千问3.535B」**:聽似「Qwen 3.5 35B」,需查證是否為阿里通義千問系列模型及其參數規模。 * **「MoonViT」**:需查證此為視覺編碼器的準確名稱。 * **「6.5的一個效果」**:基準測試中提到的數值「6.5」,需查證具體指代的指標(如 MMLU、HumanEval 或其他基準分數)。 * **「JM5.2」**:講者提及「JM5.2给它加上多模态的一个效果」,需查證此模型或技術名稱是否為聽寫錯誤。 * **「亿兆上下文」**:需查證是否為「億萬」或特定上下文長度的準確描述。 ## 可延伸追問 * DeepSeek V4 Flash 0731 多模態版的具體開源地址或下載來源為何? * 「MoonViT」模塊的具體技術架構與 Qwen 3.5 35B 的關係為何? * 基準測試中「6.5」具體對應哪一項評估指標?與官方版本相比差距為何? * 在 Mac 上運行該模型具體需要什麼樣的硬體配置(如記憶體大小)? * 相比於 Skills/Agent 後期合成方案,直接修改模型結構在推理速度與準確率上有何具體優劣?