# 影片筆記:DeepSeek V4 Pro Is HERE – Is THIS the BEST Open Model Yet? ## ⚠️ 可先使用,仍有待修正項目 本筆記已完成可閱讀的逐字稿與時間跳轉;下列項目可能影響精確度,建議播放原片確認。 - 待修正:逐字稿品質檢核未完全通過(no_trustworthy_transcript_source) - 待修正:部分時間軸可能不精確(unit 687: 5 chars owns 30.000s (max 8.000s)) - 待修正:逐字稿品質檢核未完全通過({'stage': 'canonical_transcript_quality', 'action': 'publication_blocked', 'signals': ['long_low_density_block', 'canonical_hallucination_detected', 'transcript_selection_not_resolved']}) ## 一句話總結 影片測試了 DeepSeek 最新發布的通用版本 **V4 Pro (0813)**,透過生成 C++ 遊戲、3D 引擎模型、前端網頁及街機遊戲等多項複雜任務,評估其基準測試數據躍升後的實際效能、研究深度與成本效益,並與先前預覽版及其他模型進行對比。 ## 核心重點 * **DeepSeek V4 Pro (0813) 發布與規格**: * 這是 DeepSeek 最新發布的通用版本(General Availability, GA),與之前的 V4 Flash (0731) 類似。 * 模型架構為混合專家模型(Mixture of Experts),擁有 **1.6 兆(1.6 trillion)參數**,其中活躍參數為 **490 億(49 billion)**。 * 支援可選的思考模式(Thinking modes),測試時選擇「最大努力」(Maximum effort)。 * 定價:輸入每百萬 token 4.35 美分,輸出每百萬 token 87 美分。 * **基準測試數據躍升**: * DeepSWE Score 從 **12.8** 躍升至 **62.7**。 * 據稱可能超越 Opus 4.8,且為開放權重(Open weight)。 * **實際效能測試結果**: * **C++ 滑板遊戲(Skate Game)**:模型成功生成代碼並運行遊戲。視覺效果參差不齊(樹木形狀被形容像「poo」,腿部動作像踢腿,文字方向錯誤),但相比預覽版「非常糟糕」的結果,能力躍升顯著。 * **地鐵射擊遊戲(Subway FPS)**:模型生成代碼後持續嘗試除錯,效能不佳。視覺上地鐵車廂被形容為「見過最好的地鐵車廂」,但缺乏敵人且無法定位玩家,最終判定測試失敗。 * **3D 引擎模型(RB26)**:模型產出了詳細的研究資料與 3D 模型,雖因渦輪增壓器方向問題無法直接列印,但研究者肯定其「研究過程」與「假設性符合規格」的嚴謹度。 * **前端網頁設計(手錶網站)**:成功建立具備電影感平移效果的手錶展示網站,3D 渲染良好,但存在皮帶遮擋視角等設計瑕疵。 * **遊戲開發**: * **敘事遊戲(Steve the PC Repairman)**:包含時間旅行元素與對話,雖有音效混亂與幾何問題,但整體體驗尚可。 * **街機遊戲(Street Eat)**:具有卡通風格與連擊系統,操作手感不錯,但存在物體方向與碰撞檢測問題。 * **總體評價與反思**: * 模型在「研究深度」與「細節打磨」上表現優於其他模型,音樂與場景契合度高。 * **主要挫折點**:模型在零樣本測試中過度消耗時間與資源進行自我檢查(如使用無頭瀏覽器截圖熱圖),因缺乏視覺能力,這被認為是浪費令狀(token)。 * **總成本**:整個測試總花費為 **$1.91**,研究者認為相當便宜。 ## 詳細大綱 ### 1. DeepSeek V4 Pro (0813) 發布資訊 * 通用版本(GA)發布,無官方 X (Twitter) 公告,但網站有提及。 * 支援可選的思考模式,測試時選擇「最大努力」。 * 與 V4 Flash (0731) 類似。 ### 2. 模型規格與基準測試數據 * **參數規模**:1.6 兆參數,490 億活躍參數。 * **DeepSWE Score**:從 12.8 躍升至 62.7。 * **競爭力**:據稱可能超越 Opus 4.8,且為開放權重。 * **價格**:輸入 4.35 美分/百萬 token,輸出 87 美分/百萬 token。 ### 3. 實際效能測試環境設定 * 使用 OpenAI Beta 應用程式作為介面,路由至 DeepSeek V4 Pro 0813。 * 驗證應用程式功能(視窗調整、右鍵選單、聲音效果等)。 ### 4. C++ 滑板遊戲(Skate Game)測試結果 * 模型成功生成代碼並運行遊戲。 * **視覺評價**: * 樹木形狀被形容像「poo」(糞便)。 * 腿部動作像踢腿。 * 文字方向錯誤。 * 水龍頭噴水效果有趣。 * **對比**:能力躍升顯著,預覽版結果被形容為「非常糟糕」。 ### 5. 地鐵射擊遊戲(Subway FPS)測試結果 * 模型生成代碼,但持續嘗試除錯,效能不佳。 * **視覺評價**: * 地鐵車廂被形容為「見過最好的地鐵車廂」。 * 缺乏敵人。 * 無法定位玩家位置。 * **結論**:遺憾地判定此測試失敗。 ### 6. 新任務:創建 RB26 直列六缸引擎的 3D 模型 * **要求**:可 3D 列印(少支援)、容納 N20 DC 馬達、用於 RC 車專案。 * **生成結果分析**: * **時間**:1 小時 10 分鐘。 * **內容**:包含大量研究資料、照片下載記錄及 intricate text 描述。 * **模型問題**: * 渦輪增壓器 (turbocharger) 方向錯誤 (sideways)。 * 模型無法直接列印 (not printable)。 * 在 OpenSCAD 中檢視發現由多個獨立部件組成。 * **正面評價**: * 研究過程詳細,試圖確保模型符合原始提示中的規格。 * 雖非完美,但作為渲染圖 (render) 來看,組裝效果尚可。 * 研究者認為「故事不在模型,而在研究過程」,這部分是 AI 常見的產出 (generic AI slop) 但確實做了大量工作。 ### 7. 前端網頁設計評估 (手錶網站) * **任務要求**:創建手錶網站,需具備電影感平移效果 (cinematic panning effect),手錶需為 3D 模型。 * **生成結果分析**: * **時間**:1 小時 30 分鐘。 * **視覺效果**: * 網站被評價為「非常接近優秀」(so close to excellent)。 * 背景為木質,手錶放置在皮革卡片或墊子上。 * 具備材質卡片 (material card),顯示藍寶石水晶 (sapphire crystal) 等細節。 * 展示兩款手錶:不鏽鋼選項與黃金選項,價格對應。 * 支持自由旋轉查看。 * **缺點**: * 皮帶 (watch strap) 突出,遮擋了對精美錶帶的視線。 * 皮革板 (leather slab) 抑制了觀看體驗。 * **文字內容**:包含 "quiet luxury measured in seconds", "sunburst dial" 等描述。 ### 8. 遊戲開發評估 * **遊戲一:Steve the PC Repairman (敘事/角色扮演)** * **開發時間**:約 65 分鐘。 * **遊戲內容**: * 涉及時間旅行元素 (1980 年日期錯誤)。 * 對話包含 "oatmeal cookies", "mr buttons" (貓) 等彩蛋。 * 角色頭部動作有前後擺動,而非奇怪的下巴動作。 * **問題**: * 音效混亂 (sounds totally messed up)。 * 存在幾何問題 (geometric issues)。 * 對話覆蓋自身 (speech overlays itself)。 * **評價**:儘管有缺陷,但整體相當不錯 (pretty decent)。 * **遊戲二:Street Eat (街機風格)** * **開發時間**:約 1 小時。 * **遊戲內容**: * 場景設定在邁阿密 (Miami),有棕櫚樹、濕度、壞人等元素。 * 卡通風格 (cartoonness) 處理得當。 * 包含連擊 (combo) 與分數系統。 * **問題**: * 物體方向不正確 (orientation not quite right),移動時會側向移動。 * 碰撞檢測問題:可以撞擊自行車、停車計時器,但不能撞擊建築物;可以吃雕像。 * 互動邏輯:物體彈回建築物並擊中路徑上的其他物品。 * **評價**:具有街機風格,可玩性 (playability) 不錯,音樂與場景契合。 ### 9. 總體反思與成本 * **模型表現總結**: * 相比之前測試的模型,此模型在研究深度與細節上表現更好 (definitely better than other models)。 * 在遊戲開發中,音樂與場景契合度高,卡通風格處理良好。 * 3D 引擎模型雖不可列印,但預覽效果尚可。 * **主要挫折點**: * **過度檢查 (Going all out)**:模型在嘗試確保每一步都正確時,花費過多時間與資源。 * **無效的實踐**:模型試圖使用無頭瀏覽器 (headless browser) 截圖熱圖來自我檢查,但因為沒有視覺能力 (can't actually see it),這被認為是浪費令狀 (token)。 * **建議改進**:在零樣本測試 (zero shot tests) 中,直接輸出腳本並測試修復,比模型自行進行大量內部檢查更有效率。 * **成本**: * 整個測試總花費:**$1.91**。 * 研究者認為這相當便宜 (pretty cheap)。 ### 10. API 價值與性能評估 * 目標:提升 API 價值。 * 觀點:雖然聲稱有改進,但實際體驗涉及多個價格層級。 * 性能對比:某些選項被描述為「比較 performant」(性能較好),但依然非常便宜。 * 成本疑問:提及「五次费的费」及「不仍然不仍然」,對成本結構或计费方式存在疑惑或口誤。 * 特定版本介紹:DeepSeek V4 Pro 被認為是目前的預線(預覽)版本,且被認為是「很新鮮」的。 ## 工具 / 模型 / 名詞整理 * **DeepSeek V4 Pro (0813)**:DeepSeek 最新發布的通用版本模型。 * **DeepSeek V4 Flash (0731)**:先前發布的模型版本。 * **DeepSeek V4 (Preview)**:V4 Pro 的預覽版本。 * **Opus 4.8**:被提及作為性能比較對象的模型。 * **Kimmy K3**:被提及作為參數規模比較對象的模型。 * **Quen 3.8 (Max)**:被多次提及作為視覺風格或性能比較的模型(聽寫可能為 Qwen 3.8)。 * **OpenAI Beta Application**:用於路由至 DeepSeek API 的桌面應用程式。 * **C++**:滑板遊戲使用的程式語言。 * **NeoFetch / Negula (Nebula)**:用於測試系統資訊顯示的命令或工具。 * **Calculator**:測試用的計算機應用程式。 * **Aurora / City**:應用程式的主題或風格名稱。 * **SKATENYC**:滑板遊戲的名稱。 * **Subway FPS**:地鐵射擊遊戲的名稱。 * **RB26 inline 6 engine**:測試任務中的引擎型號。 * **N20 motor**:測試任務中需容納的小型直流馬達。 * **Apple Vision Pro**:被用來形容全息卡片效果的參考設備。 * **Van Halen**:被提及的樂團(用於形容聲音效果)。 * **X**:社交媒體平台(原 Twitter)。 * **WeChat**:被提及的 DeepSeek 相關群組平台。 * **OpenSCAD**:用於檢視 3D 引擎模型的工具。 * **Steve the PC Repairman**:生成的遊戲名稱。 * **Street Eat**:生成的街機風格遊戲名稱。 * **Flash model**:研究者提及的另一個模型名稱,用於對比。 * **Sapphire crystal**:手錶網站中提到的材質名稱。 * **Intake plenum**:引擎部件名稱。 * **Downpipe**:引擎排氣部件名稱。 * **Turbocharger**:渦輪增壓器。 * **Azure Palm Job**:逐字稿中出現的名稱,疑點待查。 * **STL**:3D 列印檔案格式。 * **Slop**:AI 生成的低質量內容(網路用語)。 * **Zero shot tests**:零樣本測試。 * **Headless browser**:無頭瀏覽器。 * **Token**:AI 計費單位。 * **Reasoning mode**:模型的推理模式。 * **max test video**:可能為特定測試名稱或口誤。 ## 操作流程整理 1. **環境準備**: * 使用 OpenAI Beta 應用程式作為介面。 * 將請求路由至 DeepSeek V4 Pro 0813 API。 * 驗證應用程式基本功能(視窗調整、右鍵選單、聲音效果)。 2. **任務執行與監控**: * **滑板遊戲測試**:要求生成 C++ 代碼運行滑板遊戲,監控生成過程與視覺效果。 * **地鐵遊戲測試**:要求生成地鐵射擊遊戲代碼,監控除錯過程與遊戲邏輯。 * **3D 引擎任務**:要求生成符合特定尺寸(容納 N20 馬達)的 RB26 引擎 3D 模型,監控研究資料生成與模型結構。 * **前端網頁任務**:要求創建具備電影感平移效果的手錶展示網站,監控 3D 渲染與設計細節。 * **遊戲開發任務**:要求生成敘事遊戲(Steve the PC Repairman)與街機遊戲(Street Eat),監控遊戲邏輯、音效與碰撞檢測。 3. **結果評估**: * 檢查生成代碼的運行狀況與視覺呈現。 * 評估模型在研究深度、細節打磨及自我檢查機制上的表現。 * 計算總測試成本($1.91)。 4. **反思與總結**: * 對比預覽版與 V4 Pro 的效能差異。 * 分析模型在零樣本測試中的效率問題(過度檢查)。 * 總結模型在基準測試與實際應用中的競爭力。 ## 值得注意的限制或風險 * **視覺能力缺失導致效率低下**:模型在缺乏視覺能力的情况下,試圖使用無頭瀏覽器截圖熱圖來自我檢查,被認為是浪費令狀(token),在零樣本測試中效率過低。 * **3D 模型列印限制**:生成的 3D 引擎模型因渦輪增壓器方向錯誤及結構問題,無法直接列印,僅能作為渲染圖參考。 * **遊戲邏輯與碰撞檢測缺陷**:生成的遊戲存在物體方向不正確、碰撞檢測邏輯錯誤(如可撞擊自行車但不可撞擊建築物)等問題。 * **視覺效果參差不齊**:部分生成內容(如樹木形狀、腿部動作、文字方向)存在明顯瑕疵,雖相比預覽版有進步,但仍不完美。 * **成本與資源消耗**:雖然總成本 $1.91 被認為便宜,但模型在自我檢查上過度消耗時間與資源,可能影響實際應用效率。 ## 逐字稿辨識疑點 * **poo**:逐字稿中形容樹木形狀時使用,聽起來像是口誤或特定俚語,未確認是否為正確形容詞。 * **Quen 3.8**:逐字稿中多次出現此名稱,通常指代 Qwen 系列,但依規則保留原聽寫。 * **Kimmy K3**:模型名稱聽寫,需查證是否為正確模型名稱。 * **Negula**:在執行 NeoFetch 後出現的詞彙,可能是口誤或特定輸出名稱,需查證。 * **Aurora。OK。City。**:在討論應用程式風格時出現的斷續詞彙,語意不明,需查證是否為特定主題名稱。 * **0731 / 0813**:日期格式,指代模型發布版本編號,保留原樣。 * **1.6 trillion parameters / 49 billion active**:模型參數數據,保留原樣。 * **4.35 cents / 87 cents**:API 定價數據,保留原樣。 * **DeepSWE score**:基準測試分數名稱,保留原樣。 * **12.8 to 62.7**:基準測試分數變化數據,保留原樣。 *