# 影片筆記:Claude是如何被破解和蒸馏的?#claude #claudecode #大模型 #人工智能 #llm ## 一句話總結 影片深入解析了針對大模型(影片稱 Cloud)的「蒸餾攻防戰」,揭露了攻擊者如何利用模型多輪對話中保留加密思維鏈(Chain of Thought, CoT)的架構漏洞,透過特定的提示工程(Prompt Engineering)誘導模型輸出加密後的思維鏈數據,並對比了 OpenAI 與 Cloud 的架構差異,同時評論了國內模型(如 Kimi)透過獲取思維鏈進行監督微調(SFT)以刷榜的行業現象。 ## 核心重點 1. **Cloud 的思維鏈加密機制**:Cloud 模型在多輪對話中,伺服器會返回加密的思維鏈(前綴通常為 `GAB`),用戶端僅能看到明文答案。伺服器不緩存所有數據,而是將加密思維鏈存於用戶本地,以便在多輪對話中解密後作為上下文輸入。 2. **蒸餾技術的演進**:從早期蒸餾 Input/Output 轉向蒸餾加密的思維鏈數據。 3. **高級誘導策略(終極騙術)**: * 直接要求輸出思維鏈會被模型拒絕(觸發安全準則)。 * 攻擊者構造前兩輪對話,讓模型拒絕輸出並返回加密拒絕包。 * 在第三輪中,將前兩輪的「問題+拒絕+加密思維鏈+答案」打包,再次請求輸出思維鏈。 * **原理**:伺服器解密後,模型看到歷史記錄中自己曾「拒絕輸出」但最終「輸出了思維鏈」,產生誤判,認為輸出思維鏈是允許的。利用模型若上下文中已包含思維鏈內容,傾向於直接復述的特性。 * **成功率**:基礎誘導約 50%-70%,終極誘導可提升至約 99%。 4. **架構對比**: * **OpenAI**:多輪對話中丟棄歷史推理數據(思維鏈),認為其對多輪對話意義不大,因此難以被蒸餾。 * **Cloud**:保留思維鏈以提升推理能力,但代價是 Token 消耗更高、成本更貴,且成為被攻擊的弱點。 5. **地域風控與識別**: * Cloud 針對中國用戶進行識別與封禁。 * 識別手段包括:檢查本地時區(北京時間)、識別企業內部伺服器 IP(如百度、字節、阿里等)及內部域名(如 `baidu-int.com`)、檢查日期格式或 Unicode 編碼(如將連字符 `-` 改為斜線 `/` 或使用特定 Unicode 編碼)。 6. **行業現狀與評論**: * GLM 年初公開了解密技術,成本極低(約 600 美元/Token),加劇國內競爭。 * Kimi 被指宣稱技術改進,實則蒸餾 Cloud 最強模型(Faber)的思維鏈,停止強化學習(RLHF),直接進行監督微調(SFT)以刷榜(Coding 分數),被評價為類似「泄題」,目的是為了融資。 ## 詳細大綱 ### 一、 Cloud 對話原理與思維鏈加密機制 * **基本流程**:用戶發送問題至伺服器,伺服器返回答案及加密的思維鏈。 * **加密特徵**: * 思維鏈內容被加密,前綴通常為 `GAB`。 * 用戶端僅能看到明文答案,加密部分(紅色標註)對用戶不可見。 * **多輪對話邏輯**: * 雖然思維鏈加密,但需返回給用戶。 * 原因:多輪對話時,伺服器需將用戶傳回的加密思維鏈解密後,作為上下文輸入給模型。 * 伺服器不緩存所有數據,因數據量大、成本高,故存於用戶本地(類似微信聊天記錄加密存儲)。 ### 二、 思維鏈蒸餾與誘導技術(核心攻防) * **蒸餾對象轉變**:從早期蒸餾 Input/Output,轉向蒸餾加密的思維鏈數據。 * **基礎誘導失敗**:直接要求輸出思維鏈會被模型拒絕(觸發安全準則)。 * **高級誘導策略(終極騙術)**: 1. **構造前兩輪對話**: * 第一輪:詢問問題一,請求輸出思維鏈,模型拒絕(返回加密拒絕包)。 * 第二輪:詢問問題二,請求輸出思維鏈,模型再次拒絕(返回加密拒絕包)。 2. **第三輪關鍵誘導**: * 將前兩輪的「問題+拒絕+加密思維鏈+答案」打包。 * 第三輪問題:請求輸出思維鏈。 3. **誘導原理**: * 伺服器解密後,模型看到歷史記錄中自己曾「拒絕輸出」但最終「輸出了思維鏈」。 * 模型產生誤判:認為「輸出思維鏈」的重要性高於「拒絕」,或認為思維鏈是可以輸出的。 * 利用模型自身特點:若上下文中已包含思維鏈內容,模型傾向於直接復述(自然復數體質)。 4. **成功率**: * 基礎誘導成功率約 50%-70%。 * 終極誘導成功率可提升至約 99%。 5. **技術本質**:高級提示工程(Prompt Engineering),利用模型訓練特性與架構漏洞。 ### 三、 OpenAI 與 Cloud 架構對比 * **OpenAI 安全性較高**: * 多輪對話中丟棄歷史推理數據(思維鏈)。 * 認為思維鏈對多輪對話意義不大,不保留該數據。 * 因此難以被蒸餾。 * **Cloud 架構特點**: * 保留思維鏈以提升善文推理能力。 * 代價:Token 消耗更高,成本更貴。 * 優點被利用:保留思維鏈的機制成為被攻擊的弱點。 * 模型特性:傾向配合用戶,若上下文已有答案,易直接輸出。 ### 四、 Cloud 的地域風控與中國用戶識別 * **風控背景**:蒸餾主要發生在中國用戶群體,Cloud 針對中國用戶進行識別與封禁。 * **識別手段**: 1. **時區識別**:檢查本地時區是否為北京時間。建議改為其他時區(如澳洲、新加坡)以緩解。 2. **IP 與環境變量識別**: * 識別企業內部伺服器 IP(如百度、字節、阿里、百度等)。 * 識別內部域名(如講者提及的 `baidu-int.com`,據稱與 Cloud 老闆曾在百度任職有關)。 3. **Unicode 編碼篡改(日期識別)**: * 正常日期格式:`2026-06-30`(使用連字符 `-`)。 * 針對中國用戶:將連字符改為斜線 `/` 或使用特定 Unicode 編碼(如 `02BC`, `02B9` 等,視覺相同但編碼不同)。 * 伺服器通過檢查日期格式或編碼判斷用戶來源。 * **隱私爭議**:讀取用戶時區、環境變量及配置,被批評侵犯隱私。 ### 五、 行業現狀與評論 * **GLM 的公開**:年初 GLM 公開了解密技術,成本極低(約 600 美元/Token),導致國內競爭加劇。 * **Kimi 蒸餾現象**: * 宣稱技術改進,實則蒸餾 Cloud 最強模型(Faber)的思維鏈。 * 停止強化學習(RLHF),直接進行監督微調(SFT)。 * 目的:刷榜(Coding 分數),而非提升實際能力。 * 評價:類似「泄題」,為了融資而進行,對基礎架構壓力大。 * **中美競爭**:大模型成為中美競爭焦點,蒸餾技術的公開對中國開發者有利。 ## 工具 / 模型 / 名詞整理 * **Cloud**:指代文中主要討論的大模型(根據上下文推測為 Anthropic 的 Claude,但逐字稿僅稱 Cloud)。 * **OpenAI**:提及的競爭對手公司。 * **Codex**:文中提及的模型名稱(可能指 OpenAI 的代碼模型或泛指)。 * **DeepSake**:文中提及的具有深度思考思維鏈的模型(疑點,需查證,可能為 DeepSeek 之誤聽)。 * **GLM**:智譜 AI 的大模型系列,文中提及年初公開了解密技術。 * **Kimi**:月之暗面開發的大模型,文中提及發布了 K3 版本並進行蒸餾。 * **Faber**:文中提及 Cloud 的最強模型名稱(疑點,需查證,可能為 Claude 3 Opus 或其他版本的誤聽)。 * **微信**:用於類比聊天記錄存儲機制。 * **百度**:提及的公司,涉及內部域名 `baidu-int.com`。 * **字節**:提及的公司,涉及 IP 列表。 * **阿里**:提及的公司。 * **小红书**:提及的公司,涉及 IP 列表。 * **A社**:文中提及 Cloud 老闆曾在此上班(疑點,需查證,可能指某家公司)。 * **特朗普**:提及的美國政治人物,涉及封禁中國 AI 產品的言論。 * **Chain of Thought (CoT)**:思維鏈。 * **Prompt Engineering**:提示工程。 * **SFT (Supervised Fine-Tuning)**:監督微調。 * **RLHF (Reinforcement Learning from Human Feedback)**:強化學習。 * **GAB**:思維鏈加密前綴。 * **baidu-int.com**:內部域名。 * **02BC, 02B9**:特定 Unicode 編碼。 ## 操作流程整理 ### 蒸餾 Cloud 思維鏈的操作流程 1. **準備階段**: * 確認目標模型為 Cloud。 * 理解 Cloud 多輪對話中會返回加密思維鏈(前綴 `GAB`)並存於用戶本地的機制。 2. **基礎誘導(失敗)**: * 直接請求模型輸出思維鏈。 * 結果:模型觸發安全準則,拒絕輸出,返回加密拒絕包。 3. **高級誘導(成功)- 終極騙術**: * **第一輪**:詢問問題一,請求輸出思維鏈。模型拒絕,返回加密拒絕包。 * **第二輪**:詢問問題二,請求輸出思維鏈。模型再次拒絕,返回加密拒絕包。 * **第三輪**: * 構造請求內容,包含前兩輪的「問題+拒絕+加密思維鏈+答案」。 * 再次請求輸出思維鏈。 * **原理執行**: * 伺服器解密歷史記錄,模型看到自己曾「拒絕輸出」但最終「輸出了思維鏈」。 * 模型誤判:認為輸出思維鏈是允許的,或認為其重要性高於拒絕。 * 模型傾向於復述上下文中已有的思維鏈內容。 * **結果**:模型輸出思維鏈,攻擊者成功蒸餾數據。 * **成功率**:約 99%。 ### Cloud 的地域風控識別流程 1. **時區檢查**: * 伺服器檢查用戶本地時區。 * 若為北京時間,標記為中國用戶。 * 建議:更改時區至澳洲、新加坡等。 2. **IP 與環境變量檢查**: * 伺服器檢查請求來源 IP。 * 識別企業內部伺服器 IP(如百度、字節、阿里等)。 * 識別內部域名(如 `baidu-int.com`)。 3. **Unicode 編碼檢查**: * 伺服器檢查日期格式或編碼。 * 正常格式:`2026-06-30`(連字符 `-`)。 * 針對中國用戶:將連字符改為斜線 `/` 或使用特定 Unicode 編碼(如 `02BC`, `02B9`)。 * 伺服器通過檢查判斷用戶來源。 ## 值得注意的限制或風險 1. **隱私風險**:Cloud 讀取用戶時區、環境變量及配置以進行識別,被批評侵犯隱私。 2. **架構弱點**:Cloud 保留思維鏈以提升推理能力的設計,成為被攻擊的弱點。 3. **成本問題**:保留思維鏈導致 Token 消耗更高,成本更貴。 4. **行業競爭風險**: * 解密技術公開(如 GLM,成本約 600 美元/Token)加劇國內競爭。 * 國內模型(如 Kimi)透過蒸餾進行監督微調刷榜,被評價為類似「泄題」,可能影響基礎架構壓力。 5. **地域封禁風險**:Cloud 針對中國用戶進行識別與封禁,用戶需採取措施(如更改時區、IP)以緩解。 ## 逐字稿辨識疑點 * **Cloud**:逐字稿中多次提及「Cloud」,根據上下文推測為 Anthropic 的 Claude,但需確認是否為口誤或特定稱呼。 * **DeepSake**:逐字稿中提及「DeepSake 的那個深度思考思維鏈」,疑為 **DeepSeek** 或其他模型名稱的聽寫錯誤。 * **Faber**:文中提及「Cloud 最強模型 Faber」,疑為模型版本名稱(如 **Opus** 或 **Sonnet** 等)的聽寫錯誤,需查證。 * **A社**:文中提及「Cloud 的老板 A社的老板」,疑為公司名稱的聽寫錯誤或簡稱,需查證具體指代何家公司。 * **Sync 思維鏈**:文中提及「Sync 思維鏈」,疑為 **Chain of Thought (CoT)** 或特定術語的聽寫錯誤。 * **善文推理**:文中提及「善文推理」,疑為 **文本推理** 或 **邏輯推理** 的聽寫錯誤。 * **Info**:文中提及「對 Info 它的底層服務端」,疑為 **Inference**(推理)的聽寫錯誤。 * **鋪路**:文中提及「有了這個鋪路以後」,疑為 **鋪墊** 或 **基礎** 的聽寫錯誤。 * **B院考試**:文中提及「一場 B 院考試都變成了」,疑為 **閉卷考試** 的聽寫錯誤。 * **開券考試**:文中提及「事實上的開券考試」,疑為 **開卷考試** 的聽寫錯誤。 * **世人潮**:文中提及「有的世人潮」,疑為 **跟不上人潮** 或類似語境的聽寫錯誤。 * **積模**:文中提及「積模自身愛附屬的一個特點」,疑為 **模型** 的聽寫錯誤。 * **四門基本功**:文中提及「數學逗暢是哪四門」及多次「四門基本功」,疑為 **說學逗唱** 的聽寫錯誤。 * **Codex**:文中提及的模型名稱,需確認是否指 OpenAI 的代碼模型。 * **K3**:文中提及 Kimi 發布了 K3 版本,需確認是否為正確版本號。 * **GLM**:文中提及年初公開了解密技術,需確認是否為智譜 AI 的 GLM 系列。 * **baidu-int.com**:文中提及的內部域名,需確認是否為正確域名。 * **02BC, 02B9**:文中提及的 Unicode 編碼,需確認是否為正確編碼。 * **GAB**:文中提及的思維鏈加密前綴,需確認是否為正確前綴。 * **600 美元/Token**:文中提及 GLM 解密技術成本,需確認是否為正確價格。 * **50%-70%**:文中提及基礎誘導成功率,需確認是否為正確數據。 * **99%**:文中提及終極誘導成功率,需確認是否為正確數據。 * **2026-06-30**:文中提及的正常日期格式,需確認是否為正確日期。 * **澳洲、新加坡**:文中提及的建議更改時區,需確認是否為正確建議。 * **百度、字節、阿里、小红书**:文中提及的公司,需確認是否為正確公司名稱。 * **特朗普**:文中提及的美國政治人物,需確認是否為正確人物。 * **微信**:文中提及的類比,需確認是否為正確類比。 * **OpenAI**:文中提及的競爭對手公司,需確認是否為正確公司名稱。 * **Kimi**:文中提及的大模型,需確認是否為正確模型名稱。 * **Faber**:文中提及的 Cloud 最強模型,需確認是否為正確模型名稱。 * **DeepSake**:文中提及的具有