# 影片筆記:DeepSeek Harness 最新邪修!被吹成核弹的极简模式,真的夯吗?#ai #vibecoding #编程 #ai编程 #deepseek ## 一句話總結 影片實測 DeepSeek Harness 的「極簡模式」與「標準模式」,發現極簡模式雖能透過限制工具數量大幅提升執行速度並降低成本,但交付品質與功能完整性較差;同時揭示模型對初始工具結構敏感的特性,並介紹了透過「先極簡後標準」插件策略來優化跑分的方法。 ## 核心重點 1. **極簡模式 vs. 標準模式效能差異**: * **速度優勢**:極簡模式因限制工具數量,執行速度顯著快於標準模式(實測分別快 10 分鐘與 21 分鐘)。 * **成本優勢**:四次任務總計僅花費 3 塊錢。 * **品質劣勢**:極簡模式在交付品質、功能完整性及細節處理上不如標準模式,且缺乏直接聯網能力。 2. **極簡模式的本質與限制**: * 官方定位為模型基準測試用途,確保不同模型在乾淨環境下公平比較。 * 僅提供持續運行的終端與檔案編輯器,關閉其他能力,AI 表現像「啞巴」。 * 無法直接通過工具聯網,需透過終端腳本另闢蹊徑。 3. **模型對工具結構的敏感性(邪修策略)**: * DeepSeek V4 Pro 對首輪請求的工具結構極度敏感。 * 若首輪直接給 20 多個工具,模型會犯迷糊。 * **大神插件策略**:先沿用極簡模式(僅給終端與讀文件工具)讓模型進入狀態,第一次工具調用完成後,立即恢復全部工具,可在保留完整工具的前提下提升跑分。 4. **核心洞察**: * DeepSeek Harness 被稱為 DeepSeek 的「角色專武」。 * 模型能力釋放程度取決於給它的介面是否與訓練時見過的分布相似。 * 未來優化方向不在於單純增加或砍掉工具,而在於如何在啟動階段對齊訓練分布,喚醒模型最強執行狀態,再釋放完整能力。 ## 詳細大綱 ### 一、 DeepSeek Harness 模式介紹 * **標準模式**: * 預設使用模式。 * 提供 AI 工具應有的完整能力。 * 類似 Codex 的使用體驗。 * 會輸出文字說明 AI 的思考過程與準備動作。 * **極簡模式**: * 功能簡化,僅提供持續運行的終端與檔案編輯器。 * 關閉其他能力,無多餘輸出。 * AI 表現像「啞巴」,僅有思考、終端及字串替換工具調用。 * 官方定位:專門用於跑模型基準測試,確保不同模型在乾淨環境下公平比較。 ### 二、 實測任務一:開發 3D 第一人稱射擊遊戲 * **測試條件**:使用同一套提示詞,分別運行標準模式與極簡模式。 * **標準模式結果**: * 步驟:50 步。 * 耗時:33 分鐘。 * 功能:體驗順暢,移動、跳躍、疾跑、射擊、殺敵正常,包含 CF 風格的二段跳。 * 缺陷:敵人無法發射子彈,僅追擊玩家,無壓迫感;存在 Bug(敵人追擊後會逃跑);被擊倒時觸發倒地效果與視角,細節不錯。 * **極簡模式結果**: * 步驟:77 步。 * 耗時:23 分鐘(比標準模式快 10 分鐘)。 * Token 消耗:比標準模式多 70 萬 Tokens。 * 功能:介面更簡潔,背景牆更真實,敵人能發射子彈,壓迫感較強。 * 缺陷:被擊倒時身體仍站立,無倒地視角,細節稍遜。 * **結論**:成品效果半斤八兩,各有優缺;極簡模式在速度上略勝一籌。 ### 三、 實測任務二:開發 AI 寵物領養系統 * **測試條件**:需從電腦檔案獲取 DeepSeek 模型金鑰、聯網搜尋並下載圖片、開發前後端、調用 AI 模型。 * **標準模式結果**: * 步驟:59 步。 * 耗時:49 分鐘。 * 交付:成功找到電腦上的模型金鑰,全程未需使用者插手,直接交付成品。 * 功能:佈局良好,寵物卡片排版舒適;成功抓取鯨魚娘圖片並生成文案;點擊可領養,卡片樣式變化,具備篩選功能。 * 缺陷:右上角提示文字未對齊。 * **極簡模式結果**: * 步驟:87 步。 * 耗時:不到 28 分鐘(比標準模式快 21 分鐘)。 * Token 消耗:與標準模式相近。 * 交付:未能自動找到模型金鑰,需使用者手動填寫,可交付性較差。 * 功能:主頁面效果 OK,功能正常,但實用性差。 * 缺陷:無篩選功能,無法查看已領養寵物;卡片資訊簡陋;右上角顯示「AI 文案 DeepSeek 已生成」,不像面向用戶的正規產品。 * **結論**:極簡模式速度快但交付品質與完整性較差。 ### 四、 成本與綜合評估 * **成本**:四次任務總計花費 3 塊錢(被稱為漲價前最後的倔強)。 * **極簡模式優點**:執行速度快、說話直截了當、不繞彎子。 * 原因:不需裝載太多工具到上下文,AI 不需糾結選擇工具,注意力集中。 * **極簡模式缺點**: * AI 幾乎不匯報進度,使用者不知其進行狀態。 * 無法直接通過工具聯網,需透過終端腳本另闢蹊徑。 * 若任務強依賴特定工具(如理解圖片),差距會放大。 * 細節與完整度較差,對標 Fable 5 被認為有些誇張。 ### 五、 大神插件策略與深度分析 * **插件發現**:有大神開發插件,能在保留標準模式 20 多個工具的前提下,跑分略微反超極簡模式。 * **策略原理**: * DeepSeek V4 Pro 對首輪請求的工具結構極度敏感。 * 若首輪直接給 20 多個工具,模型會犯迷糊。 * 若首輪沿用極簡模式(僅給終端與讀文件工具),讓模型以極簡模式思維鏈進入狀態。 * 第一次工具調用完成後,立即恢復全部工具,跑分即提升。 * **核心洞察**: * DeepSeek Harness 被稱為 DeepSeek 的角色專武。 * 模型能力釋放程度取決於給它的介面是否與訓練時見過的分布相似。 * 未來優化方向:非單純增加或砍掉工具,而是搞清楚如何在啟動階段對齊訓練分布,喚醒模型最強執行狀態,再釋放完整能力。 ## 工具 / 模型 / 名詞整理 * **DeepSeek Harness**:影片主要測試的 AI 工具平台。 * **標準模式**:DeepSeek Harness 的預設模式,提供完整工具能力,類似 Codex 體驗。 * **極簡模式**:DeepSeek Harness 的一種模式,僅提供終端與檔案編輯器,用於基準測試,限制工具數量以提升速度。 * **DeepSeek V4 Pro**:影片中提及的模型版本,對首輪請求的工具結構極度敏感。 * **Codex**:被提及作為標準模式類比的產品/工具。 * **Fable 5**:被提及作為性能對標的級別(疑點:需查證此名稱是否為正確拼寫或特定內部代號)。 * **CF**:遊戲名稱縮寫(穿越火線),用於描述 3D 射擊遊戲風格。 * **角色專武**:形容 DeepSeek Harness 的詞彙,指其能發揮模型特定能力的工具。 ## 操作流程整理 ### 實測任務流程(標準模式 vs. 極簡模式) 1. **準備階段**: * 撰寫同一套提示詞。 * 選擇 DeepSeek Harness 的模式(標準模式 或 極簡模式)。 2. **執行階段**: * **標準模式**:AI 輸出思考過程,調用多種工具,耗時較長,但功能完整。 * **極簡模式**:AI 僅調用終端與字串替換工具,無多餘輸出,耗時較短,但需手動處理部分問題(如金鑰填寫)。 3. **結果評估**: * 比較步驟數、耗時、Token 消耗。 * 檢查交付成品的功能完整性、細節處理(如遊戲機制、UI 佈局)。 * 計算總成本。 ### 大神插件優化策略流程 1. **初始請求**: * 使用極簡模式配置(僅終端與讀文件工具)發送首輪請求。 * 目的:讓模型以極簡模式思維鏈進入狀態,避免工具過多導致混亂。 2. **第一次工具調用**: * 模型完成初步操作。 3. **恢復工具**: * 在第一次工具調用完成後,立即恢復標準模式下的 20 多個工具。 4. **後續執行**: * 模型在擁有完整工具的情況下繼續執行,跑分提升。 ## 值得注意的限制或風險 1. **極簡模式的交付品質限制**: * 無法自動找到電腦上的模型金鑰,需使用者手動填寫。 * 缺乏篩選功能,無法查看已領養寵物等完整功能。 * 細節處理較差(如遊戲中倒地視角缺失、UI 文字未對齊)。 * 右上角顯示「AI 文案 DeepSeek 已生成」,不像面向用戶的正規產品。 2. **聯網能力限制**: * 極簡模式無法直接通過工具聯網,需透過終端腳本另闢蹊徑。 * 若任務強依賴特定工具(如理解圖片),極簡模式的差距會放大。 3. **進度透明度低**: * AI 幾乎不匯報進度,使用者不知其進行狀態。 4. **成本單位不明**: * 四次任務總計花費「3 塊」,單位未明確說明(人民幣?美元?)。 ## 逐字稿辨識疑點 1. **Fable 5**:逐字稿提及「做到了 Fable 5 級別的效果」,此名稱在常見 AI 模型或基準測試中較少見,需查證是否為聽寫錯誤或特定產品名稱。 2. **3 塊錢**:四次任務總計花費「3 塊」,單位未明確說明(人民幣?美元?),需查證實際計費單位。 3. **角色專武**:形容 DeepSeek Harness 的詞彙,需確認是否為官方用語或創作者比喻。 4. **DeepSeek 已生成**:極簡模式成果中右上角顯示的文字,需確認是否為產品顯示錯誤或特定提示。 ## 可延伸追問 1. 大神開發的插件具體是如何實現「先極簡後標準」的技術細節?是否有開源代碼可供參考? 2. DeepSeek V4 Pro 對工具結構敏感的原理是什麼?這是否適用於其他大型語言模型? 3. 極簡模式在哪些特定類型的任務中表現最佳?是否有官方推薦的使用場景? 4. 「Fable 5」具體指代什麼?是否有相關的文獻或基準測試報告可以查證? 5. DeepSeek Harness 的計費單位「3 塊錢」具體是指什麼貨幣?漲價後的價格是多少?