# 影片筆記:Would You Still Pay for Claude After Seeing This? (GLM 5.2 vs DeepSeek V4) ## 一句話總結 影片透過開源編碼代理程式 **Pi** 實測建構個人 CRM 系統,對比 **GLM 5.2** 與 **DeepSeq v4 Pro**(講者口語稱 DeepSeek)在成本、速度與產出品質上的差異,並進一步評估 **GLM 5.2** 與 **Opus 4.8** 的視覺與功能表現,結論認為 GLM 5.2 是具備高功能性且成本可控的前線模型可信替代品。 ## 核心重點 * **開源模型已具備實戰能力**:講者確認開源模型配合編碼代理程式(Coding Agents)已能建構真實世界專案。 * **工具架構**:使用開源代理程式 **Pi**,搭配 **GLM 5.2** (來自 ZAI/z.ai) 與 **DeepSeq v4 Pro**,透過 **OpenRouter** 調用。 * **專案管理方法**:採用 `agents.md` 檔案將專案拆解為多個階段(Phases),並設定明確的「成功標準」(Success Criteria),代理程式必須滿足所有標準才能宣告完成。 * **GLM 5.2 vs DeepSeq v4 Pro 對比**: * **DeepSeq v4 Pro**:成本較低 ($2.56)、速度較快 (約 1 小時),產出基礎功能完整的 CRM (Dashboard, Deals, Contacts, Kanban Board, SQLite 後端)。 * **GLM 5.2**:成本較高 ($4.15)、速度較慢 (1 小時 15 分),但講者認為其生成的介面與功能細節(數據視覺化、任務檢查清單、活動紀錄)更為出色。 * **GLM 5.2 vs Opus 4.8 對比**: * **Opus 4.8** (Ultra Code Mode):耗時一小時,成本極高 ($21.27),視覺效果僅比 GLM 5.2 略好一點點(如深色背景、拖放虛線提示)。 * **GLM 5.2**:被定位為前線模型(frontier models)的可信替代品,具備高能力,雖非最便宜也非最佳,但在兩者之間非常接近,且能一次生成成功(first time one shot)。 ## 詳細大綱 1. **開源模型與編碼代理程式的現狀** * 確認開源模型已可用於建構真實世界專案。 * 介紹工具組合:Pi (代理程式)、GLM 5.2、DeepSeq v4 Pro。 2. **模型評估指標:智能與成本** * 引用 `artificialanalysis.ai` 網站的「智能 vs 成本」圖表。 * 目標是尋找位於左上角綠色區域(高智能、低成本)的模型。 * 選擇 GLM 5.2 與 DeepSeq v4 Pro 作為邊界測試對象。 3. **編碼代理程式 Pi 的特性** * 設計理念:輕量、最小化、不綁定特定 LLM、允許插入任何開源模型。 * 預設功能簡單,但具備高度可擴展性。 4. **專案建構策略:階段性與成功標準** * 使用 `agents.md` 定義專案需求。 * 將專案拆解為 bite-sized phases (小階段)。 * 每個階段需包含業務描述與「成功標準」(Success Criteria)。 * 代理程式必須通過所有成功標準才能繼續或宣告完成。 * 需提供測試技能(如瀏覽器操作)以形成反饋迴圈。 5. **環境設置與執行準備** * 使用 VS Code 的 Dev Containers 建立沙盒環境。 * 安裝 `agent browser` 技能(來自 Vercel),賦予代理程式運行 Chrome 瀏覽器的能力。 * 透過 `pi --models` 命令啟動 Pi,並指定 GLM 5.2 與 DeepSeq v4 Pro。 * 設定推理層級(Reasoning Levels)為 Extra High。 6. **平行實測:GLM 5.2 vs DeepSeq v4 Pro** * 同時在兩個 Dev Containers 中執行相同的建構指令。 * 監控 OpenRouter 的日誌、活動圖表與成本消耗。 7. **實測結果初步分析** * **成本與速度**:DeepSeq v4 Pro 較便宜 ($2.56) 且較快 (約 1 小時);GLM 5.2 較貴 ($4.15) 且較慢 (1 小時 15 分)。 * **產出品質**: * DeepSeq v4 Pro 產出基礎功能完整的 CRM。 * GLM 5.2 產出被講者認為「更令人印象深刻」的版本,具備更豐富的數據視覺化、任務檢查清單及活動紀錄。 8. **GLM 5.2 生成結果評估** * 介面特徵:擁有 proper icons、contacts、deals 及帶有 badges 的 pipeline。 * 視覺評價:被形容為「gorgeous」、「sharp」,比另一個較單調的版本更好。 * 功能完整性:支援拖放(drag and drop),包含 stages、won 和 lost 的狀態。 * 成本與效率:成本相對較低,但並非最低。 9. **Opus 4.8 生成結果評估** * 測試條件:使用 Opus 4.8(被稱為目前地球上最強模型),並啟用 Ultra Code Mode。 * 成本與耗時:耗時一小時,若直接透過 API 使用需花費 21.27 美元(目前使用 Claude AI 帳戶)。 * 視覺與功能對比: * Dashboard:有圖表、相同數值、清單,深色背景看起來稍顯專業,但僅好「一點點」(by a hair)。 * Pipeline:同樣是 Kanban board,拖放時出現虛線(dotted line thing),被認為「稍微好一點」。 * 結論:Opus 4.8 的結果僅在細微處優於 GLM 5.2。 10. **最終總結與建議** * GLM 5.2 定位:既非最便宜也非最佳,但在兩者之間非常接近。 * 價值主張:具備高能力(capability),是前線模型的可信替代品(credible alternative),可用於個人專案。 * 成本效益:單次產品生成成本仍超過 4 美元,但功能豐富。 * 功能細節:支援編輯組織、聯絡人、日誌活動、點擊卡片等,所有功能首次生成即成功(first time one shot)。 ## 工具 / 模型 / 名詞整理 * **編碼代理程式 (Coding Agents)**: * **Pi** (講者強調其為開源、輕量、可擴展的代理程式) * **Claude Code** (作為對比參考) * **Open Code** (講者提及 Pi 類似於此類代理程式) * **大型語言模型 (LLMs)**: * **GLM 5.2** (來自 ZAI / z.ai) * **DeepSeq v4 Pro** (講者口語提及 DeepSeek,但筆稿為 DeepSeq) * **Opus 4.8** (被稱為目前地球上最強模型) * **Claude** (用於後續比較) * **平台與服務**: * **OpenRouter** (用於調用模型、查看日誌與成本) * **artificialanalysis.ai** (提供模型智能與成本數據的網站) * **Claude AI** (帳戶) * **YouTube** * **開發工具與環境**: * **VS Code** (Visual Studio Code) * **Dev Containers** (開發容器,用於沙盒化與安全執行) * **Docker** (容器技術) * **Agent Browser** (由 Vercel 提供的技能,用於讓代理程式運行瀏覽器) * **專案相關**: * `agents.md` (專案指令與成功標準檔案) * `readme` (環境設置說明) * `.env` (存放 OpenRouter Key) * **SQLite** (DeepSeq 版本使用的資料庫) * **Salesforce**, **Pipe Drive** (講者提及的商業 CRM 產品作為參考) * **Kanban board** * **Ultra Code Mode** * **API** ## 操作流程整理 1. **準備階段**: * 參考 `artificialanalysis.ai` 選擇高智能低成本的模型(GLM 5.2 與 DeepSeq v4 Pro)。 * 在 VS Code 中使用 Dev Containers 建立沙盒環境。 * 安裝 `agent browser` 技能(來自 Vercel)。 * 設定 `.env` 存放 OpenRouter Key。 2. **專案定義**: * 撰寫 `agents.md` 檔案,將專案拆解為 bite-sized phases。 * 為每個階段設定業務描述與「成功標準」(Success Criteria)。 3. **執行代理程式**: * 透過 `pi --models` 命令啟動 Pi。 * 指定模型為 GLM 5.2 與 DeepSeq v4 Pro。 * 設定推理層級(Reasoning Levels)為 Extra High。 * 在兩個 Dev Containers 中平行執行相同的建構指令。 4. **監控與評估**: * 監控 OpenRouter 的日誌、活動圖表與成本消耗。 * 比較產出結果: * DeepSeq v4 Pro:基礎功能完整,成本 $2.56,耗時約 1 小時。 * GLM 5.2:介面與細節更出色,成本 $4.15,耗時 1 小時 15 分。 * 後續測試 Opus 4.8 (Ultra Code Mode):耗時一小時,成本 $21.27,視覺效果僅略優於 GLM 5.2。 ## 值得注意的限制或風險 * **成本問題**:即使使用開源模型,單次產品生成成本仍超過 4 美元(GLM 5.2)甚至高達 21.27 美元(Opus 4.8),對於個人專案雖可接受,但並非最低成本方案。 * **速度限制**:生成完整專案耗時約 1 至 1.25 小時,速度相對較慢。 * **模型名稱不確定性**:影片中出現的模型名稱(如 GLM 5.2, DeepSeq v4 Pro, Opus 4.8)需查證其準確性與對應關係。 * **代理程式 Pi 的語境不明**:在部分段落中提及 "use Pi",但未明確解釋 Pi 為何物,可能存在特定工具或口誤的情況。 ## 逐字稿辨識疑點 * **DeepSeq v4 / DeepSeek**:逐字稿中多次出現「DeepSeq v4」及「DeepSeq v4 Pro」,但在講者口語部分提到「DeepSeek」。由於要求不得自行更正,故保留「DeepSeq」作為模型名稱,並標註講者口語提及「DeepSeek」為疑點。 * **ZAI / z.ai**:逐字稿中模型 GLM 5.2 的來源分別被稱為「ZAI」與「z.ai」。 * **agents.md**:講者口語中曾出現「Py」,但檔案名稱明確為 `agents.md`,且代理程式名稱為 Pi,此處「Py」可能為口誤或聽寫錯誤。 * **Ctrl-Shift-P / Command-Shift-P**:講者提及在 PC 上按 Ctrl-Shift-P,Mac 上按 Command-Shift-P 來開啟 Dev Containers,此為 VS Code 標準快捷鍵,但講者口語描述較為冗長。 * **0.7% of the 1 million context**:講者提及 GLM 5.2 使用了 100 萬上下文視窗的 0.7%,此數據具體但需查證該模型是否確實支援 1M 上下文。 * **Dell button**:講者在描述 DeepSeq 產出的 CRM 介面時,提到「edit and delete, a Dell button」,「Dell」疑似為「Delete」的聽寫錯誤或口誤。 * **Hot metrics**:講者描述 GLM 5.2 產出的介面時,提到「hot metrics」,此詞彙在 UI/UX 描述中較不常見,可能為「Key metrics」或「Hotspot metrics」的口誤,但保留原樣。 * **GLM 5.2**:逐字稿中多次出現此名稱,需查證是否為特定模型版本或口誤(常見模型為 GPT 或 Gemini 等,但嚴格遵循逐字稿保留)。 * **Opus 4.8**:需查證此模型名稱及版本號是否準確。 * **Pi**:在 "use Pi" 一詞中出現,語境不明,需查證是否為特定工具、平台或口誤。 * **called out kinds of numbers**:語意稍顯模糊,需查證是否為特定術語或口誤。 * **dotted line thing**:描述拖放時的視覺效果,用詞較為口語化,需查證是否為特定 UI 元件名稱。 ## 可延伸追問 * GLM 5.2、DeepSeq v4 Pro 與 Opus 4.8 的準確模型對應關係為何? * 代理程式 "Pi" 的具體技術架構與開源連結為何? * `agents.md` 的成功標準(Success Criteria)具體範例為何? * 如何進一步降低使用開源模型建構專案的成本與時間? * Agent Browser 技能在反饋迴圈中的具體運作機制為何?