# 影片筆記:Qwen3.8 27B + DeepSeek Harness实测:7900XTX本地跑Agent效率不错可以忘掉SG-Lang, Llama.cpp咸鱼翻身! ## ⚠️ 可先使用,仍有待修正項目 本筆記已完成可閱讀的逐字稿與時間跳轉;下列項目可能影響精確度,建議播放原片確認。 - 待修正:逐字稿品質檢核未完全通過(no_trustworthy_transcript_source) - 待修正:部分時間軸可能不精確(unit 209: 9 chars owns 15.878s (max 8.000s)) - 待修正:逐字稿品質檢核未完全通過({'stage': 'canonical_transcript_quality', 'action': 'publication_blocked', 'signals': ['long_low_density_block', 'transcript_selection_not_resolved']}) ## 一句話總結 在 DeepSeek 雲端服務漲價背景下,講者實測使用 AMD 7900XTX 顯卡搭配 `Llama.cpp` 與 `DeepSeek Harness` 本地部署 `Qwen3.8 27B` 模型,展現出高緩存命中率與優異的長鏈 Agent 開發能力,被認為是極具性價比的本地 AI 開發方案。 ## 核心重點 * **雲端服務漲價衝擊**:DeepSeek 服務漲價導致日常開發成本從每天 17-18 元激增至 40 元,促使開發者尋求本地部署方案。 * **本地部署架構**:採用 AMD Ryzen 5 5600 CPU、32G 記憶體及 AMD 7900XTX 顯卡,系統為 Ubuntu 26.04,推理引擎為 `Llama.cpp` (Vulkan 版本),模型為 `Qwen3.8 27B` (Q5 量化)。 * **DeepSeek Harness 表現**: * **速度與效率**:平均速度約 50 tokens/s,緩存命中率高達 96%-99%。 * **長鏈任務能力**:在 14 輪 90 步迭代中,平均 2.6 秒/token;在 14 輪 145 步多輪迭代中,成功開發出跳過 HTTPS 證書檢查的瀏覽器插件。 * **編程與圖形生成**:能處理數萬行代碼的 C++ 項目,生成網頁及 SVG 圖形(如八卦圖、阿基米德原理圖、薛定諤的貓圖),評分優於部分雲端模型。 * **限制與缺點**:關閉推理(Reasoning)後編程智力下降;長時間運行後需腳本清理顯存以防變卡;目前為 RC 版本,存在證書警告與彈框 Bug;多開能力有限。 ## 詳細大綱 ### 一、 雲端服務漲價與成本分析 * **漲價影響**:講者指出漲價是「萬惡之源」,日常開發消耗從每天 17-18 元激增至 40 元。 * **雲端模型對比**: * **DeepSeek Pro**:在多輪長鏈任務中上下文召回準確,注意力機制優於 Flash 版本,適合複雜 APP 開發,但成本高。 * **DeepSeek Flash**:適合簡單任務,但在超過 500-600 輪迭代後,注意力機制不如 Pro,體驗不夠「絲滑」。 * **GPT 系列**: * 批評 GPT 5.6 在長鏈任務中表現不佳(形容為「智障」)。 * 建議訂閱 GPT 的 Coding Plan(約 1000 元/月)或高價訂閱計劃,以應對高頻開發需求。 * **其他雲端選項**:提及小米 Memo、騰訊混元 3、字節跳動 Trae(國內版 1000 元/月,國際版 100 美金/月)。 ### 二、 本地部署硬體與軟體架構 * **硬體配置**: * **主要測試機**:AMD Ryzen 5 5600 CPU、32G 記憶體、AMD 7900XTX 顯卡(約 5000-6000 元台幣/人民幣價位的老顯卡)。 * **備用機**:NVIDIA 4090D 48G(因噪音大及用於 AI 視頻剪輯,不願用於本地 AI 推理)。 * **軟體組合**: * **系統**:Ubuntu 26.04。 * **推理引擎**:Llama.cpp(Vulkan 版本)。 * **核心工具**:DeepSeek Harness(被稱為論壇新大神 EXLLM 提出的方案)。 * **模型**:Qwen3.8 27B(Q5 量化版本)。 ### 三、 DeepSeek Harness 實測表現 * **性能指標**: * 平均速度:約 50 tokens/s(部分測試顯示 46-54 tokens/s)。 * 緩存命中率:高達 96%-99%。 * 響應速度:聊天響應快,長鏈任務平均 5 秒/token 左右。 * **功能測試**: * **基礎聊天**:響應迅速,無明顯延遲。 * **編程能力**: * 單輪編程:能處理數萬行代碼的 C++ 項目,生成網頁、SVG 圖形。 * 長鏈任務:14 輪 90 步迭代,平均 2.6 秒/token,緩存命中率 99%。 * 多輪迭代:14 輪 145 步,耗時 31 分鐘,平均 4.8 秒/token,成功開發出跳過 HTTPS 證書檢查的瀏覽器插件。 * **圖形生成**: * 八卦圖:評分 80 分,存在掛項位置 bug,但審美優於 DPC 家族。 * 阿基米德原理 SVG:評分 90 分,細節豐富,原理清晰,優於 DeepSeek V4 Pro。 * 薛定諤的貓 SVG:評分 80 分,準確把握實驗原理,但美觀度稍欠。 * **缺點與限制**: * 關閉推理(Reasoning)後編程智力下降。 * 長時間運行後會變卡,需腳本清理顯存。 * 目前為 RC 版本,存在證書警告、彈框 Bug 等問題。 * 相比 VLLM 或 SG-Lang 較輕量,但多開能力有限。 ### 四、 結論與建議 * **性價比極高**:5000 元級別的 7900XTX 顯卡驅動 Qwen3.8 27B,能實現 Agent 開發、大模型聊天及搜索工具整合。 * **開發策略**:建議將複雜項目拆解為模塊,上傳至 Git 服務器,利用本地模型逐模塊開發。 * **未來展望**:DeepSeek Harness 雖為 RC 版本,但前途不可限量,讓老顯卡大幅升值。 ## 工具 / 模型 / 名詞整理 * **模型 (Models)**: * DeepSeek Pro (文中亦寫作 VSPro, DeepSeekVisPro) * DeepSeek Flash (文中亦寫作 VSFlash, DeepSeekVisFlash) * GPT 5.6 * 小米 Memo * 騰訊混元 3 * Qwen3.8 27B (文中亦寫作 千萬3.8 27B, 清文家族, 千萬27B, 3.8 27B) * DeepSeek V4 Pro (文中亦寫作 DeepSigVisPro, DeepSick V4 Pro) * DeepSeek V4 Flux * Hermes * OpenCL (文中亦寫作 OpenCloud) * **工具/框架 (Tools/Frameworks)**: * DeepSeek Harness (文中亦寫作 DeepSigHarness, DeepSigVisPro 的替代方案) * Llama.cpp (Vulkan 版本) * SG-Lang (文中亦寫作 SG浪, SG-Lang) * VLLM * NAMD.CPP (文中提及,疑為筆誤) * Trae (字節跳動) * Chrome 瀏覽器 * **硬體 (Hardware)**: * AMD 7900XTX * NVIDIA 4090D 48G * Ryzen 5 5600 * **系統/平台 (Systems/Platforms)**: * Ubuntu 26.04 * Git 服務器 ## 操作流程整理 1. **環境準備**: * 硬體:AMD 7900XTX 顯卡,Ryzen 5 5600 CPU,32G 記憶體。 * 系統:安裝 Ubuntu 26.04。 * 軟體:安裝 Llama.cpp (Vulkan 版本) 及 DeepSeek Harness。 * 模型:加載 Qwen3.8 27B (Q5 量化版本)。 2. **基礎測試**: * 進行基礎聊天測試,確認響應速度與延遲。 * 監控平均速度(約 50 tokens/s)與緩存命中率(96%-99%)。 3. **編程能力實測**: * **單輪編程**:輸入數萬行代碼的 C++ 項目需求,生成網頁或 SVG 圖形。 * **長鏈任務**:執行 14 輪 90 步迭代,監控 token 生成速度(平均 2.6 秒/token)與緩存命中率。 * **多輪迭代**:執行 14 輪 145 步迭代,耗時約 31 分鐘,成功開發出跳過 HTTPS 證書檢查的瀏覽器插件。 4. **圖形生成實測**: * 生成八卦圖、阿基米德原理 SVG、薛定諤的貓 SVG。 * 評估生成結果的準確性、細節豐富度與美觀度,並與雲端模型(如 DeepSeek V4 Pro)進行對比評分。 5. **問題排查與優化**: * 觀察關閉推理(Reasoning)對編程智力的影響。 * 針對長時間運行後的變卡問題,使用腳本清理顯存。 * 處理 RC 版本存在的證書警告與彈框 Bug。 ## 值得注意的限制或風險 * **推理關閉影響**:關閉推理(Reasoning)功能後,模型的編程智力會下降。 * **顯存管理**:長時間運行後系統會變卡,需要依賴腳本定期清理顯存。 * **版本穩定性**:DeepSeek Harness 目前為 RC 版本,存在證書警告、彈框 Bug 等穩定性問題。 * **多開能力**:相比 VLLM 或 SG-Lang,該方案較輕量,但多開能力有限。 * **硬體依賴**:高度依賴 AMD 7900XTX 顯卡,其他硬體配置可能無法達到相同效果。 ## 逐字稿辨識疑點 * **DeepSeekVisPro / VSPro / VSFlash**:逐字稿中交替出現「DeepSeekVisPro」、「VSPro」、「VSFlash」、「DeepSigVisPro」、「DeepSick V4 Pro」。根據上下文推測應指 DeepSeek 的不同版本(Pro 與 Flash),但逐字稿存在多種寫法及疑似聽寫錯誤(如 DeepSig, DeepSick)。 * **Qwen3.8 27B / 千萬3.8 27B / 清文家族**:逐字稿中對該模型的稱呼不一致,「Qwen」被聽寫為「Qwen3.8」、「千萬」、「清文」。標準名稱應為 Qwen,但此處僅記錄為「Qwen3.8 27B」及其變體。 * **DeepSeek Harness / DeepSigHarness**:逐字稿中工具名稱寫作「DeepSeek Harness」及「DeepSigHarness」,疑為同一工具的不同聽寫。 * **SG-Lang / SG浪**:逐字稿中寫作「SG-Lang」及「SG浪」,疑為同一框架。 * **OpenCL / OpenCloud**:逐字稿中寫作「OpenCL」及「OpenCloud」,疑為同一框架或聽寫錯誤。 * **NAMD.CPP**:逐字稿中提及「沒有 NAMD.CPP 這麼輕量」,疑為「Llama.cpp」或其他推理引擎的聽寫錯誤,因上下文在討論推理框架。 * **GPT5.6**:目前 GPT 版本尚未到 5.6,此處可能為口誤或指代特定內部版本/模型,僅記錄為「GPT5.6」。 * **DPC 家族**:逐字稿中提及「DPC 家族」,疑為某個模型家族或開發者的代稱,無法確認具體指代。 * **Hermes**:逐字稿中提及「Hermes」,可能指代某個開源模型或框架,需查證具體指代何者。 * **小米 Memo**:逐字稿中提及「小米 Memo」,疑為小米相關產品或模型的稱呼,需查證。 * **Ubuntu 26.04**:目前 Ubuntu 主要版本為 22.04/24.04,26.04 可能為未來版本或口誤,僅記錄為「Ubuntu 26.04」。 * **4090D 48G**:標準 RTX 4090 為 24G 顯存,4090D 亦為 24G。逐字稿寫作「4090D 48G」,疑為顯存容量口誤或指代其他型號(如 4090D 24G 或 6000 Ada 64G 等),僅記錄為「4090D 48G」。 * **薛定諤的貓 / 薛頂爾德茂斯**:逐字稿中寫作「薛定諤的貓」及「薛頂爾德茂斯」,疑為同一概念的不同聽寫。 * **阿基米德原理 / 福利**:逐字稿中提及「阿基米德原理」及「福利」,疑為「浮力」的聽寫錯誤。 * **疊加碳 / 改革技術器**:逐字稿中描述 SVG 內容時出現「疊加碳」、「改革技術器」,疑為「疊加態」、「干涉儀」或相關物理術語的聽寫錯誤。 * **手token / 特格子 / 管存命中率 / 緩存命路率**:逐字稿中對「tokens」、「tokens/s」、「顯存命中率」、「緩存命中率」有多種聽寫變體,如「手token」、「特格子」、「管存命中率」、「緩存命路率」。 ## 可延伸追問 * DeepSeek Harness 的 RC 版本預計何時發布穩定版? * 針對 NVIDIA 顯卡用戶,是否有類似的本地部署方案能達到同等效能? * Qwen3.8 27B 的 Q5 量化版本在精度損失與性能提升之間的具體平衡點為何? * 如何優化腳本以自動清理顯存,避免長時間運行後的性能下降? * DeepSeek Pro 與 Flash 版本在注意力機制上的具體技術差異是什麼?