# 影片筆記:比GPT-6更可怕?OpenAI秘密模型Doug曝光,AI圈炸裂!Scarier Than GPT-6? OpenAI's Secret Model 'Doug' Leaked! ## 一句話總結 影片盤點近期 AI 領域的激烈競爭與技術突破,重點揭露 OpenAI 內部代號混亂的超級預訓練模型(涉及 Bug/Dog/Astra 等),阿里代號 Kiana/Piano 模型在 3D 與代碼生成上的卓越表現,以及 Google 戰略調整與 Anthropic、Grok 等廠商的最新動態。 ## 核心重點 1. **OpenAI 內部模型代號混亂與超級預訓練**: * 爆料人 Chris 指出 GPT 5.5 並非最後一次大規模預訓練,年底將推出代號為 "Bug" 的超級模型,預訓練規模創新高。 * 博主 Tokengrammaring 反駁,認為 "Dog" 和 "Astra" 可能被混淆,"Dog" 可能只是 "Asha" (或 Astra) 早期研發階段的內部代號。 * OpenAI 內部代號(如 Milthree, Milfour)混亂,難以判斷 "Dug" (或 Bug/Dog) 是全新預訓練流還是同一批預訓練的不同檢查點。 * 圖像生成領域出現代號「蒙娜麗莎 1」的新模型,經 OpenAI 官方驗證工具檢測帶有專屬 Seed ID 隱形水印。 2. **阿里 (Alibaba) 新模型 Kiana / Piano 的強大實力**: * 在 LMArena Code Arena 測試中,代號 "Kiana" (或稱 "Piano") 的檢查點模型表現卓越。 * 在 3D 前端代碼生成、物理彈道測試中,與 Claude Opus S5、GPT 5.6 進行盲測對比時展現優勢。 * 案例包括 AIRO ONE 360 度互動耳機展示(Three.js 實現)、蒸汽朋克飛艇四方對比、黃昏莊園 3D 場景 PK,均顯示其設計合理性與複雜代碼構建能力。 * 業界推測極可能為阿里即將發布的 Qwen 4.0 或 Qwen 3.9 大更新的前哨檢查點。 3. **Google 的技術瓶頸與戰略調整**: * 報告結論:Gemini 3 Pro 已是谷歌技術高峰。 * 預測 Gemini 3.5 Pro 實力僅相當於 Opus 4.5,甚至不如 GLM 5.2。 * DeepMind 高層變動加劇內部焦慮。 * 原計劃推出的超大體量開源模型 Gemma V4 120B (1,230 億參數,262k 上下文窗口) 已被取消,顯示谷歌將資源集中於下一代閉源 Gemini。 4. **其他廠商與硬體創新**: * **Anthropic**:Opus 系列仍具競爭力,但面臨巨大壓力。 * **Grok Image 2.0**:马斯克旗下產品正式發布,在文生圖榜單高居第二,審美與文字渲染出色。 * **具身智能**:東京大學展示名為 "Dragon" 的空中變形飛行機器人,展現複雜空間下的具身智能潛力。 ## 詳細大綱 ### I. 行業概覽與預訓練模型競賽 * **OpenAI 的超級模型研發** * 爆料人 Chris 指出 GPT 5.5 並非最後一次大規模預訓練。 * 年底將推出代號為 "Bug" 的超級模型,預訓練規模創新高。 * 性能預測:可能讓之前的 "Fable" 顯得像原始玩具。 * **代號爭議**: * 博主 Tokengrammaring 反駁,認為 "Dog" 和 "Astra" 可能被混淆。 * "Dog" 可能只是 "Asha" (或 Astra) 早期研發階段的內部代號,而非全新迭代。 * OpenAI 內部代號混亂(如 Milthree, Milfour),難以精準判斷 "Dug" (或 Bug/Dog) 是全新預訓練流還是同一批預訓練的不同檢查點。 * **Google 的技術瓶頸與戰略調整** * 報告結論:Gemini 3 Pro 已是谷歌技術高峰。 * 預測 Gemini 3.5 Pro 實力僅相當於 Opus 4.5,甚至不如 GLM 5.2。 * DeepMind 高層變動加劇內部焦慮。 * **Gemma V4 120B 取消**: * 原計劃擁有 1,230 億參數及 262k 上下文窗口。 * 已被標記為取消,不再面向公眾發布。 * 推測谷歌將資源集中於下一代閉源 Gemini。 ### II. 阿里 (Alibaba) 新模型實測:代號 Kiana / Piano * **測試環境**:LMArena 的 Code Arena。 * **模型表現**: * 在 3D 前端代碼生成、物理彈道測試中表現驚艷。 * 與 Claude Opus S5、GPT 5.6 進行盲測對比。 * **案例 1:AIRO ONE 360 度互動耳機展示** * UI 精緻,黑金風格。 * 支持鼠標全向拖拽、旋轉、縮放。 * 點擊按鈕觸發精準技術參數標籤。 * 底部動態配色切換,Three.js 代碼實現水平超越多數對手。 * **案例 2:蒸汽朋克飛艇四方對比** * 對比對象:Claude Opus 5, Qwen, Claude Fastr 5 High, Qwen 3.8 Max。 * Kiana 生成的飛艇在網格、金屬管道、懸掛吊艙細節上碾壓 Fastr 5 High。 * 雖 Opus 5 在材質紋理略勝,但 Kiana 的設計合理性與複雜代碼構建能力足以與 Opus 正面交鋒。 * **案例 3:黃昏莊園 3D 場景 PK** * 對比對象:Kiana vs. Qwen 3.8 Max。 * Kiana 生成的莊園在彩燈、光影、花壇、森林層次感上遠超老版本。 * **測試方法**:LMArena Beta Mode 盲測,隨機抽取模型進行投票。 * **業界推測**:極可能為阿里即將發布的 Qwen 4.0 或 Qwen 3.9 大更新的前哨檢查點。 ### III. 圖像生成領域進展 * **OpenAI 圖像模型** * LMArena 出現代號「蒙娜麗莎 1」的新模型。 * **關鍵證據**:使用 OpenAI 官方驗證工具檢測,圖片帶有 OpenAI 專屬 Seed ID 隱形水印。 * 預測未來版本(ChatGPT Image 2.5 或 3.0)在畫質與控圖能力上有質飛躍。 * **Grok Image 2.0** * 马斯克旗下產品正式發布。 * 在文生圖榜單高居第二。 * 範例包括波普風海報、細膩紡織紋理、素描步驟拆解,文字渲染與審美排版出色。 ### IV. 具身智能與硬體創新 * **東京大學 "Dragon" 項目** * 空中變形飛行機器人。 * 打破傳統無人機固定形態限制。 * 能在空中完成複雜自由變體運動,改變關節構形。 * 能靈活抓取並包裹移動懸掛物體。 * 結合 AI 控制算法,展示具身智能在複雜空間下的潛力。 ## 工具 / 模型 / 名詞整理 * **模型與產品名稱**: * OpenAI (公司) * GPT 5.5 * GPT 6 * Bug (OpenAI 新模型代號) * Fable (疑似舊模型名稱) * Dog (OpenAI 內部代號) * Astra / Asha (OpenAI 內部代號,文中混用) * Milthree / Milfour (OpenAI 內部代號) * Dug (文中提及,疑為 Bug 或 Dog 的聽寫錯誤) * Gemini 3.5 Flash (Google) * Gemini 3 Pro (Google) * Gemini 3.5 Pro (Google) * Opus 4.5 (Anthropic) * GLM 5.2 (智譜 AI?) * Kiana / Piano (阿里新模型代號,文中混用) * Claude Opus S5 (Anthropic) * GPT 5.6 (OpenAI) * AIRO ONE (案例中的產品名) * Three.js (前端庫) * Claude Fastr 5 High (Anthropic) * Qwen 3.8 Max (阿里) * Qwen 4.0 / Qwen 3.9 (阿里) * 蒙娜麗莎 1 (OpenAI 圖像模型代號) * ChatGPT Image 2.5 / 3.0 (預測中的 OpenAI 產品) * Gemma V4 120B (Google 開源模型) * Grok Image 2.0 (马斯克旗下) * Dragon (東京大學飛行機器人) * LMArena / Code Arena (測試平台) * Beta Mode (LMArena 測試模式) * **工具與技術**: * OpenAI 官方驗證工具 (用於檢測水印) * Seed ID 隱形水印 * 3D 渲染 * 前端代碼生成 * 物理彈道測試 * 預訓練 (Pre-training) * 檢查點 (Checkpoint) * 具身智能 (Embodied AI) ## 操作流程整理 1. **OpenAI 新模型水印檢測流程**: * 在 LMArena 發現代號「蒙娜麗莎 1」的新模型。 * 使用 OpenAI 官方驗證工具對生成的圖片進行檢測。 * 確認圖片帶有 OpenAI 專屬 Seed ID 隱形水印,證實其為 OpenAI 官方模型。 2. **阿里 Kiana/Piano 模型盲測流程**: * 進入 LMArena 的 Code Arena。 * 選擇 Beta Mode 進行盲測,隨機抽取模型。 * 針對特定場景(如 AIRO ONE 耳機、蒸汽朋克飛艇、黃昏莊園)進行 3D 前端代碼生成與物理模擬測試。 * 將 Kiana 的輸出與 Claude Opus S5、GPT 5.6、Qwen 3.8 Max 等進行對比投票。 * 評估指標包括 UI 精緻度、代碼複雜度、物理合理性、光影效果等。 ## 值得注意的限制或風險 1. **模型代號與版本混亂**: * OpenAI 內部代號(Bug, Dog, Dug, Astra, Asha, Milthree, Milfour)使用混亂,難以準確對應實際發布的模型版本。 * 阿里模型代號 Kiana 與 Piano 混用,需確認是否為同一模型的不同階段名稱。 * 多個模型版本號(如 GPT 5.5/5.6, Gemini 3.5 Pro, Opus 4.5/S5, GLM 5.2, Qwen 3.8 Max/4.0)在影片中出現,需查證是否為真實發布名稱或口誤。 2. **數據與參數描述不一致**: * Gemma V4 的參數數量在文中分別描述為 "120B" 和 "1,230 億" (或 "1,200 億"),數值對應存在疑義。 * "262k 上下文窗口" 與 "超百萬" 的描述需進一步確認是否為同一數值的不同表述。 3. **技術細節查證需求**: * OpenAI 是否確實使用 "Seed ID" 作為隱形水印技術名稱。 * 東京大學 "Dragon" 飛行機器人項目是否真實存在且名稱準確。 * Grok Image 2.0 是否已正式發布並確實高居文生圖榜單第二。 * LMArena 的 "Beta Mode" 是否為真實存在的測試功能名稱。 ## 逐字稿辨識疑點 * **代號名稱混亂與聽寫錯誤**: * 文中多次出現代號不一致,如 "Bug"、"Dog"、"Dug"、"Astra"、"Asha"。博主 Tokengrammaring 指出報告將 "Dog" 和 "Astra" 搞混,但逐字稿中這些名稱交替出現,無法確定最終正確代號。 * "Dug" 出現於 "Dug 到底代表著...",疑為 "Bug" 或 "Dog" 的聽寫錯誤。 * "Kiana" 與 "Piano" 指代同一個阿里模型,文中交替使用。 * "Fable" 作為 OpenAI 舊模型名稱,需查證是否為 "GPT-4" 或其他模型的誤聽。 * "Opus 4.5"、"GLM 5.2"、"GPT 5.6"、"Claude Opus S5"、"Claude Fastr 5 High" 等版本號與命名組合,需查證是否為真實發布名稱或口誤(例如 Fastr 可能為 Fast)。 * "120B" 與 "1,230 億" 參數描述,文中先說 120B 後說 1,230 億,數值對應需查證。 * "262k 超百萬級上下文窗口",262k 通常指 262,000,與 "超百萬" 描述一致,但需確認是否為 262k 或 1M+ 的誤述。 * "Seed ID" 水印,需查證 OpenAI 是否確實使用此特定名稱的隱形水印技術。 * "Dragon" 機器人,需查證東京大學是否確實發布此名稱的項目。 * "Qwen 3.8 Max",需查證 Qwen 系列是否有此具體版本號。 * "Milthree", "Milfour",需查證是否為 OpenAI 內部真實代號。 * "Tokengrammaring",需查證博主真實名稱。 * "Chris",需查證爆料人真實身份。 * "SEMI analysis",需查證是否為 "SemiAnalysis" 的誤聽。 * "言報",疑為 "研报" 的聽寫錯誤。 * "提亞娜",疑為 "Kiana" 的聽寫錯誤。 * "1,200 億" 與 "120B",文中先說 120B 後說 1,200 億,數值單位需查證。 * "Gemma V4 1,200 億",文中先說 Gemma V4 120B 後說 1,200 億,需查證是否為同一模型的不同參數描述或誤述。 * "Openai since day 水印",疑為 "OpenAI 官方驗證工具檢測出的 Seed ID 隱形水印" 的誤述或聽寫錯誤。 * "蒙娜麗莎已現身競技場",需查證是否為真實發布的模型代號。 * "Grok image 2.0",需查證是否已正式發布。 * "Dragon 空中變形飛行機器人",需查證是否為真實項目。 * "東京大學",需查證是否為該項目的發布機構。 * "具身智能",需查證是否為該項目的正確技術分類。 * "大雷早上好",需查證是否為頻道名稱或主播名稱。 * "LLM Arena" 與 "LMArena",需查證是否為同一平台的不同稱呼。 * "Code Arena",需查證是否為 LMArena 的特定模塊。 * "Beta mode 盲測模式",需查證是否為 LMArena 的真實功能名稱。 * "Prompt",需查證是否為 "提示詞" 的英文混用。 * "UI",需查證是否為 "用戶界面" 的縮寫。 * "Three.js",需查證是否為正確的前端庫名稱。 * "Steam Punk" (蒸汽朋克),需查證是否為案例中的正確風格描述。 * "Touch Control Disc 按鈕",需查證是否為案例中的正確 UI 元素名稱。 * "Seed ID",需查證是否為