# 影片筆記:America Banned Nvidia Chips to Stop China's AI - It Backfired ## 一句話總結 美國透過出口管制(特別是禁止 NVIDIA 晶片)試圖遏制中國 AI 發展,但中國透過本土晶片製造(華為、SMIC)、軟體架構創新(DeepSeek 的 MoE 與 MLA 技術)以及國家級算力基礎設施建設,成功降低了成本並建立生態系統,反而加速了競爭。 ## 核心重點 1. **競賽本質轉變**:AI 競賽已從單純的技術競爭轉變為全球權力、經濟實力與基礎設施的競爭。 2. **硬體去 NVIDIA 化**:儘管美國實施出口管制,中國透過華為昇騰晶片、SMIC 製造及走私途徑,逐步實現供應鏈獨立。 3. **軟體架構創新**:中國公司(如 DeepSeek)透過 MoE(專家混合)與 MLA(多頭潛注意力)技術,在較弱硬體上實現高效能,大幅降低訓練與推理成本。 4. **數據與生態系統優勢**:中國擁有龐大的數位生態系統(抖音、微信等)提供海量多模態數據;透過「開放權重」策略,將模型作為獲客入口,最終透過雲端服務與基礎設施獲利。 5. **國家戰略佈局**:中國將 AI 發展列為國家任務,整合算力網絡,並由國家科學技術部指定企業分工,形成完整的產業生態鏈。 6. **全球影響**:中國模型已滲透美國公司(如 Airbnb、Pinterest、Cursor)的底層基礎設施;影片呼籲歐洲、印度等國家建立「主權 AI」生態系統以避免依賴。 ## 詳細大綱 ### A. 中美 AI 競賽現狀與美國管制 * **領先地位爭議**: * 影片主張美國在 AI 領域領先,但中國正在快速追趕。 * 預測最終勝者僅可能是美國或中國。 * 數據顯示,中國 AI 模型佔據美國公司近 60% 的 AI 使用量。 * 提及 Pinterest、Airbnb、Coinbase 等美國公司已使用中國 AI 模型。 * **熱門中國模型**: * **Kimi K3**:被稱為全球最大的開源 AI 模型,據稱在某些基準測試中擊敗了 GPT 5.6 和 Fable 5。 * **QEN 3.8**:阿里巴巴發布的強大模型。 * 特點:免費使用、需求爆發導致註冊暫停。 * **美國出口管制 (2022年10月)**: * 禁止中國購買 NVIDIA 最先進的 AI 晶片。 * 邏輯:無先進晶片 -> 較弱 AI 模型 -> 中國落後。 * 管制對象:華為及其他數十家中國公司被列入禁令名單。 * 管制範圍:不僅禁止購買晶片,也禁止出售製造晶片所需的先進機器。 * 美國透過 **Foreign Direct Product Rule (外國直接產品規則)** 控制非美國公司(因使用美國技術/IP)。 * **NVIDIA 的應對**: * 推出降級版晶片 **H20** 以合法售予中國。 * NVIDIA 試圖解鎖中國市場的高階晶片銷售。 ### B. 硬體供應鏈與本土製造突破 * **供應鏈依賴結構**: * 過去由三家公司控制: 1. **NVIDIA**:設計晶片。 2. **TSMC (台灣)**:製造晶片。 3. **ASML (荷蘭)**:製造製造晶片所需的複雜機器。 * **華為與 5G 突破**: * 華為推出 **Ascent 晶片** 並搭載於 **Mate 60 Pro** 手機。 * 實現 5G 連接,打破預期(預期將停留在 4G)。 * 對比:Apple 耗時較長才實現自製晶片以停止向 Qualcomm 付費。 * **SMIC (中芯國際)**: * 中國最大的半導體製造商。 * 在無世界最佳機器的情況下,利用較舊設備製造先進晶片。 * 效率與成本不如 TSMC,但實現了「不再依賴他人」的目標。 * **走私與獲取途徑**: * 透過馬來西亞、日本、香港等地走私。 * 甚至使用人體運送(例如學生從新加坡攜帶晶片回中國)。 ### C. 軟體效率與架構創新 (DeepSeek 案例) * **核心問題**: * 本土晶片速度慢於 NVIDIA。 * 出口限制導致晶片獲取困難。 * 目標:不追求更大更快的硬體,而是追求更聰明的 AI。 * **DeepSeek 的創新技術**: * **Mixture of Experts (MoE, 專家混合)**: * 傳統模型:每次提問調動整個模型(所有計算資源),成本高。 * DeepSeek 做法:將模型切片為 256 個超專業微型專家。 * 運作方式:針對特定問題(如編碼),僅激活極少數專家(如 8 個),其餘休眠。 * 效益:大幅降低計算成本。 * 成本對比: * GPT/Claude 輸入成本:$5 - $10 / 百萬 token。 * DeepSeek 輸入成本:$0.4 / 百萬 token。 * GPT/Claude 輸出成本:$30 - $50。 * DeepSeek 輸出成本:$0.87。 * **Multi-Head Latent Attention (MLA, 多頭潛注意力)**: * 問題:長對話需要大量短期記憶(Key-Value Cache),導致運行昂貴。 * 解決方案:壓縮記憶體,將大量細節轉為少量摘要。 * 效益:減少超過 90% 的短期記憶體需求,支持更長對話,降低運算功率。 * **成本效益對比**: * DeepSeek 訓練世界級模型成本據報低於 600 萬美元。 * 對比 Anthropic 等大公司耗資數十億美元。 * 性能對比:DeepSeek V4 Pro Max 與 Opus 4.6 Max、GPT 5.4、Gemini 3.1 Pro 性能相當。 ### D. 硬體基礎設施與國家算力網絡 * **數據中心現狀**: * 新建數據中心利用率不足。 * 數據中心定義:包含伺服器、AI 晶片、儲存、網路、備用電源及冷卻系統的實體設施。 * **國家整合算力網絡 (National Integrated Computing Power Network)**: * 目標:預計於 2030 年或更早建成。 * 策略:將 AI 基礎設施視為公共基礎設施(類似道路或電力)。 * 建設地點:土地便宜、可再生能源豐富、空間充足的區域。 * 運作方式: * 透過高速光纖網絡連接各地數據中心。 * 企業、大學、研究人員可線上租賃運算能力。 * 範例:上海小型 AI 初創公司上傳代碼與數據,平台從遠端數據中心調配晶片進行訓練,工程師遠端監控並下載完成模型。 * 現狀:尚未完全連接成單一國家算力網,但為既定目標。 ### E. 數據優勢與商業模式差異 * **數據的重要性**: * 智能模型若無足夠數據則無用。 * 下一代 AI 需要理解視頻、物理世界行為(如物體互動、光影變化),僅靠文字訓練不足。 * **中國的數據優勢**: * 擁有全球最大的數位生態系統之一。 * 平台(Douyin, WeChat, TikTok 等)每日產生海量文本、圖像、音頻和視頻數據。 * 企業(如 ByteDance)不僅擁有視頻內容,還擁有用戶反饋數據(觀看時長、流失點等),這是有價值的訓練數據。 * 結論:如果晶片是引擎,數據就是燃料。 * **變現邏輯差異**: * **西方模式**:直接銷售智能訪問權(訂閱、API 調用、Token 消耗)。 * **中國模式**:模型僅是「入口點(entry point)」,銷售的是更大的生態系統。 * **具體案例**: * **Alibaba**:不僅希望用戶使用 Quen 模型,更希望企業在 Alibaba Cloud 上運行應用。 * **Tencent**:不僅希望測試 Hanuan 模型,更希望企業使用 Tencent Cloud、企業軟件及整個商業生態系統。 * **獲利點**:雲端託管、諮詢、自定義 AI 解決方案、GPU、服務器、存儲、安全、監控及技術支持。 * **結論**:模型是免費的,但可靠運行所需的基礎設施不是。模型是「客戶獲取策略(customer acquisition strategy)」。 ### F. 分發策略與市場佔有 * **開放權重(Open Weight)策略**: * 中國模型免費且開放權重,開發者可下載、在自有服務器運行、修改及微調。 * **案例**:零售公司可將模型微調至內部政策與產品目錄,用於客服查詢。 * **網路效應與轉換成本**: * 開發者投入時間學習、編寫代碼及整合系統後,較少切換競爭對手模型(類似 Twitter 與 Threads 的關係)。 * 研究者可輕鬆研究模型並發布改進技術,形成正向循環。 * 類似 Android 的成功邏輯:讓製造商和開發者圍繞平台構建。 * **市場佔有率數據**: * 2026 年 5 月至 6 月間,中國 AI 模型的月 Token 使用量超過美國模型。 * **Alibaba's QEN**:今年下載量突破 10 億次。 * **美國公司的依賴**: * **Airbnb**:使用其 AI 客服系統。 * **Pinterest**:自定義 QEN 模型,據稱在某些負載下成本降低高達 90%。 * **Cursor**:其編碼模型 Composer2 基於中國公司 Moonshot AI 的 Kimi K2.5 基礎模型構建。 * **結論**:中國模型已成為美國公司構建自有產品的基礎設施。 ### G. 國家任務與隱私爭議 * **2017 年國家戰略**: * 國務院發布《新一代人工智能發展規劃》,目標是 2030 年成為全球 AI 創新中心。 * 大學擴展 AI 與計算機科學項目。 * 政府資助實驗室與研究項目。 * 城市與省份建立 AI 創新區,提供資金、基礎設施及政策支持。 * 鼓勵海外研究人員回國。 * **企業分工**: * 國家科學技術部指定主要企業負責特定領域: * **Baidu**:自動駕駛開放創新平台。 * **Alibaba**:智慧城市。 * **Tencent**:醫學影像。 * **iFlytech**:智能語音技術。 * 企業間仍保持競爭,但方向一致。 * **反駁「偷竊論」**: * 雖然存在蒸餾(distillation)技術爭議及 Nvidia 晶片走私指控(如 Supermicro 聯合創始人被起訴),但這些無法解釋數千名研究人員、大型數據中心及生態系統的建立。 * 中國在研究上投入巨大,並找到讓較弱硬體表現更好的方法。 * 應以相同標準評判雙方,不應將中國進步全部歸結為偷竊。 * **反駁「隱私威脅論」**: * 西方 AI 同樣存在隱私問題: * **ChatGPT**:默認訓練用戶對話。 * **Gemini**:合併用戶提示與 Gmail、YouTube 及 Google 歷史。 * **Claude**:更改隱私政策,默認用戶選擇加入 5 年數據保留。 * 「中國 AI 是威脅,西方 AI 是安全選擇」的觀點是錯誤的。 ### H. 給世界的教訓 1. **主權 AI(Sovereign AI)**: * 各國需對 AI 未來擁有控制權。 * 並非要求每個國家自建所有晶片和模型,而是擁有足夠的算力、人才、數據、模型及基礎設施,避免完全依賴他國。 * 若美國或中國限制最佳模型的使用權,依賴國(如印度)將面臨技術斷供風險。 * AI 已滲透教育、醫療、國防、科學、編碼、製造等領域。 * 依賴外國 AI 的國家在地緣政治中將始終脆弱。 2. **生態系統勝過單一模型**: * 比較模型分數(Benchmark)僅是可見部分。 * 強 AI 需要:晶片、電力、數據中心、大學工程師、研究實驗室、雲端公司及商業應用。 * 中國在這些方面均有佈局。 3. **全球呼籲**: * 歐洲、印度及其他開發中國家必須加緊腳步建立類似的生態系統,以確保未來。 ## 工具 / 模型 / 名詞整理 * **AI 模型/產品**: * Kimi K3 * GPT 5.6 * Fable 5 * QEN 3.8 / Quen (Alibaba) * ChatGPT * DeepSeek (提及 DeepSeq 疑點) * GPT (提及 GPT 5.4) * Claude * Opus 4.6 Max * Gemini 3.1 Pro * H100 (NVIDIA 晶片) * H20 (NVIDIA 降級晶片) * Ascent 晶片 (華為) * Mate 60 Pro (華為手機) * V4 Pro Max (DeepSeek 模型版本疑點) * C-Dance (ByteDance 擁有的 AI 平台) * Dooyan (疑點:原文拼寫) * GLM (Z.AI) * Hanuan (Tencent) * Composer2 (Cursor 的編碼模型) * Kimi K2.5 (Moonshot AI 的基礎模型) * **公司/機構**: * NVIDIA * TSMC (台灣積體電路製造) * ASML * Huawei (華為) * SMIC (中芯國際) * Samsung * MediaTek * Qualcomm * Apple * OpenAI * Anthropic * Alibaba (阿里巴巴) * Pinterest * Airbnb * Coinbase * ByteDance * Tencent * Baidu * iFlytech * Moonshot AI * Z.AI * Cursor * Supermicro * **技術/術語**: * Foreign Direct Product Rule (外國直接產品規則) * Mixture of Experts (MoE, 專家混合) * Multi-Head Latent Attention (MLA, 多頭潛注意力) * Key-Value Cache (鍵值緩存) * National Integrated Computing Power Network (國家整合算力網絡) * 5G / 4G * GPU * Token (輸入/輸出成本單位) * Open Weight (開放權重) * Distillation (蒸餾) * Sovereign AI (主權 AI) * Benchmark (基準測試) ## 操作流程整理 1. **硬體獲取與製造**: * 中國企業(如華為、SMIC)在受限情況下,利用較舊設備或走私途徑獲取先進晶片技術。 * 華為推出搭載 Ascent 晶片的手機,實現 5G 連接。 2. **軟體架構優化**: * 採用 MoE 技術,將模型切片為多個專家,僅激活相關專家以降低計算成本。 * 採用 MLA 技術,壓縮短期記憶(Key-Value Cache),減少記憶體需求。 3. **數據收集與訓練**: * 利用抖音、微信等平台的海量多模態數據(文本、圖像、視頻、用戶反饋)進行模型訓練。 * 國家整合算力網絡提供遠端運算能力,企業上傳代碼與數據進行訓練。 4. **商業分發與生態構建**: * 提供免費且開放權重的模型,吸引開發者下載、微調及部署。 * 透過模型作為入口,引導企業使用雲端服務、基礎設施及諮詢服務獲利。 * 建立網路效應,增加開發者轉換成本,使中國模型成為美國公司底層基礎設施。 ## 值得注意的限制或風險 1. **硬體性能差距**:本土晶片(如華為昇騰)速度仍慢於 NVIDIA 先進晶片,需透過軟體創新彌補。 2. **供應鏈依賴**:儘管有走私和本土製造,但完全獨立於西方技術(如 ASML 機器、TSMC 製造)仍具挑戰。 3.