# 影片筆記:Refurbished 64GB VRAM AI Server for Local AI: 4x NVIDIA V100/P100, AMD MI25 ## 一句話總結 影片透過實測翻新資料中心伺服器(配備 4x P100/V100/MI25),驗證其在預算有限(約 2,000-3,000 英鎊)下運行本地大語言模型(LLM)的可行性,並比較 Lama CPP 與 VLLM 在舊硬體上的效能差異與限制。 ## 核心重點 * **性價比優勢**:自建多 GPU 系統(主機板、電源、散熱、機殼)基礎成本高昂(約 $4,000-$5,000),翻新資料中心伺服器(如 Supermicro DGQ)提供極高性價比,能以約 2,000 英鎊獲得 64GB VRAM 配置。 * **硬體規格與限制**: * 使用 PCIe Gen 3 與 DDR4 記憶體,頻寬較低,可能成為多卡同步或模型卸載至 CPU 時的瓶頸。 * 資料中心 GPU(P100/V100/MI25)多為被動散熱(Passively Cooled),依賴機箱高風量風扇,導致運轉噪音極大。 * **GPU 效能比較**: * **V100**:具備 Tensor Cores 與高記憶體頻寬(900 GB/s),在推論效能上優於 P100 與 MI25。 * **P100 & MI25**:無 Tensor Cores 支援,頻寬較低(MI25 僅 484 GB/s),整體效能較差,但在 Lama CPP 上仍具可用性。 * 舊款 GPU 不原生支援 BF16/FP8,需轉換為 FP16,可能導致精度損失。 * **軟體生態建議**: * **Lama CPP**:推薦用於舊硬體,生態系統統一,相容性佳,支援多種量化格式。 * **VLLM**:對架構敏感,缺乏特定核心支援,載入模型慢,不建議在舊硬體上使用。 * **適用場景**:適合預算在 2,000-3,000 英鎊,需要 64GB VRAM 運行小型模型(如 27B 參數量化版)的用戶,或作為進階升級前的過渡方案。 ## 詳細大綱 ### 1. 前言與合作聲明 * 本影片為「翻新資料中心 GPU」系列的延續,探討如何利用翻新硬體降低本地 AI 運算成本。 * **合作關係**:與 **Bargain Hardware** 合作,但非贊助影片。創作者未獲直接報酬,僅為獲取硬體進行實驗。 * **折扣資訊**:提供觀眾專屬折扣碼 `DONATO10`(非聯盟連結),可獲得 GPU 10% 折扣。 * **市場背景**: * 過去(去年 8 月)可花約 $2,000 購買 128GB Strixello 機器,現在價格翻倍。 * 記憶體與 GPU 短缺狀況可能持續,促使探索翻新硬體作為替代方案。 ### 2. 自建系統的成本挑戰 * 多 GPU 系統不僅是 GPU 的成本,還包含主機系統建置成本。 * 參考之前的 Dual Radio 9700 影片,64GB RAM 配置成本約 $4,000-$5,000。 * 四張雙槽(Dual-slot)GPU 所需基礎設施: * 支援物理安裝的主機板。 * 足夠 PCIe 頻寬以避免頻寬瓶頸(Lane starvation)。 * 高容量電源供應器。 * 具備適當散熱的機殼。 * 系統記憶體(System RAM)。 * 結論:從零開始自建基礎系統成本高昂,翻新資料中心伺服器提供極高性價比。 ### 3. Bargain Hardware 線上組裝示範 * **目標配置**:四卡 GPU 配置(Quad GPU Configuration)。 * **硬體選擇步驟**: 1. **主機板/伺服器**:選擇 Supermicro 第 12 代伺服器。 2. **CPU**:選擇兩顆 Intel Xeon 18 核心 CPU(價格低廉)。 3. **散熱器**:已包含在內。 4. **記憶體**:選擇四根 16GB DDR4 記憶體條(DDR4 庫存充足且價格優)。 5. **儲存**:選擇兩顆 480GB SATA SSD(總計近 1TB,適合 LLM 權重下載)。 6. **GPU 加速器**: * 本配置選擇四張 P100(每張 16GB,總計 64GB)。 * 影片中也測試了 V100 和 AMD MI25。 * 其他即將到貨選項:RTX 3080, 3090, Quadro RTX 5000, Quadro M6000, A100, RTX 8000。 7. **額外配件**:Super Micro NVMe Enablement Kit。 * **價格與折扣**: * 總價約 2000 英鎊(英國國內運費)。 * 可使用折扣碼 `Donato 10` 獲得 GPU 10% 折扣。 ### 4. 倉庫翻新流程導覽 * **入庫(Inbound)**: * 伺服器、工作站、組件通過貨車抵達。 * 從歐洲及全球各地採購設備。 * 暫存於機架中。 * **清潔(Cleaning)**: * 使用空氣壓縮機吹除灰塵。 * 部分世代伺服器進行重新貼皮(Reskinning)以去除刮痕。 * 即使是單獨購買的驅動器、CPU 或 GPU 也需測試。 * **組件測試與拆解(Component Testing & Disassembly)**: * 測試後的機器進行拆解。 * 取出 CPU、RAM、GPU 及其他卡片。 * 將機殼、PSU 及基礎組件作為庫存儲存,以便後續客製化組裝。 * **揀貨(Picking)**: * 收到線上訂單後,根據清單揀選組件。 * 將組件裝上推車。 * 倉庫整潔有序,DDR4 記憶體庫存豐富。 * **組裝(Assembly)**: * 將揀選的組件組裝成訂單配置的伺服器。 * **測試與包裝(Testing & Packaging)**: * 組裝後的機器進行測試。 * 提供保修服務。 * 投資於紙箱與泡沫襯墊,確保運輸安全。 * **出貨(Outbound)**: * 最後的出貨部門處理發運。 ### 5. 最終硬體規格與噪音測試 * **硬體規格詳情**(由 Lead Engineer Toby Sheriff 展示): * **機型**:Supermicro DGQ in CSE 118 chassis。 * **擴充能力**:支援四張雙寬全高(Double wide full height)卡片。 * **CPU**:支援可擴展 CPU(Intel 1st & 2nd Gen),目前安裝兩顆 Gold 6150(18 核心,支援超執行緒)。 * **記憶體**:DDR4 Registered DIMMs,每 CPU 最多 6 根。目前安裝 64GB(4x 16GB DIMMs),運行於 2666 MHz(受 CPU 限制,第 2 代 CPU 可達 2933 MHz)。 * **網路**:內建 10 Gig NIC(主機板整合)。 * **PCIe 插槽**:後方有兩個備用 PCIe 插槽(部分依賴 CPU2)。 * **儲存**: * 前方背板內建兩個 NVMe 端口(支援 U.2 / 2.5 英寸 NVMe 驅動器)。 * 背板後方內建兩個 SATA 插槽。 * **散熱與噪音**: * 資料中心 GPU 為被動散熱(Passively Cooled),無風扇。 * 依賴機箱前方大量風扇強制風扇通過散熱片堆疊。 * **噪音極大**:開機時非常吵雜,後續稍安靜但仍顯著,需考慮環境噪音問題。 * **測試計畫**: * 目前安裝四張 P100。 * 影片將展示 AMD MI-50/MI-25 及 V100 的性能基準測試。 * 將與現代 GPU(如 R9700 AI Pro, RTX 5090)進行價格與性能對比。 ### 6. 硬體規格關鍵差異比較 * **記憶體頻寬 (Memory Bandwidth)** * 推論時生成每個 token 需頻繁讀取模型權重,頻寬直接限制每秒生成的 token 數量。 * **V100**: 900 GB/s(表現最佳,高於現代 R9700)。 * **R9700**: 640 GB/s。 * **MI25**: 484 GB/s(顯著較低)。 * **資料格式支援 (Data Format Support)** * 現代 GPU 原生支援 BF16 和 FP8(當前 LLM 標準精度)。 * 舊款三張卡(V100, P100, MI25)均**不原生支援** BF16/FP8。 * 支援 FP16(16-bit),但範圍不如 BF16廣。 * **風險**:將 BF16 權重轉換為 FP16 時可能發生溢位或精度損失,導致輸出品質下降。 * **硬體加速單元** * **V100**: 具備 **Tensor Cores**(針對機器學習矩陣運算優化的硬體),效能較佳。 * **P100 & MI25**: 無此等效支援,基準測試中表現較差。 ### 7. 伺服器環境設定與部署 * **基礎架構** * 使用 **Docker container**(稱為 toolbox)。 * 後端選擇:**CUDA**(Nvidia 卡幾乎總是最佳選擇)或 **Vulkan**。 * 工具來源:從 Docker Hub 拉取預先建構的 toolbox(內含 Lama CPP)。 * **Lama CPP 部署流程** * 確認裝置:運行 `Lama CLI, list devices` 確認 CUDA 後端識別到四張 V100(每張 16GB VRAM)。 * 模型下載:從 Hugging Face 下載 GGUF 格式權重。 * 執行伺服器: * 使用 `Lama server` 命令。 * 指定模型(例如 QAN 3.6,270 億參數,Q4 KXL 或 Q8 量化)。 * 啟用 **Flash Attention**。 * 設定上下文大小(Context size)。 * 網路轉發:透過 SSH 將伺服器埠(如 8080)轉發至主機埠(如 8081)。 * 介面:使用 **Lama CPP web UI** 進行提示輸入。 * 效能觀察:270 億參數稠密模型約 31 tokens/秒,表現良好。 * **VLLM 部署流程** * 建立 VLLM toolbox。 * 使用提供的 `start VLLM script` 啟動伺服器。 * 設定參數:Tensor Parallelism 4、並發請求數、上下文大小、GPU 利用率。 * **缺點**: * 載入模型時間長(受 PCIe 3.0 限制)。 * 尋找注意力後端(Attention backend),最終可能回退至 PyTorch SDPA attention,效能不如現代硬體。 * 不建議在舊硬體上使用 VLLM。 ### 8. 軟體推薦與生態系統比較 * **Lama CPP** * **推薦原因**:生態系統更統一,幾乎適用於所有支援的硬體(V100, P100, MI25)。 * **優勢**:支援幾乎所有模型與量化格式(Quantization)。 * **必要性**:舊硬體記憶體有限(如 64GB),必須使用量化才能運行大參數模型(如 270 億參數)。 * **VLLM** * **限制**:對不同 GPU 架構非常敏感,需要特定核心(Kernels)。 * **問題**:許多舊卡缺乏可用核心,無法像 Lama CPP 那樣自由選擇模型。 * **例外**:在 MI25 上若有可用核心,效能可能高於 P100,但整體不建議使用。 ### 9. 基準測試 (Benchmarks) 結果分析 * **測試對象**:現代 LLM(QAN 3.5/3.6 系列,適合 32-64GB RAM 的代理工作流與編碼)。 * **V100 表現** * **提示處理 (Prompt Processing)**:最佳表現者。 * 270 億參數模型 (Q4 量化):約 852 tokens/秒。 * 上下文擴展至 32,000 tokens:仍維持約 622 tokens/秒。 * **Token 生成 (Token Generation)**: * 270 億參數稠密模型:約 28 tokens/秒。 * 對於 PI 編碼代理(PI coding agent)用途足夠。 * **原因**:現代架構 + Tensor Cores 優化矩陣乘法。 * **MI25 表現** * 在 Lama CPP 上表現接近但略低於 P100。 * 整體給出最低效能。 * 部分模型測試缺失(因早期測試未包含所有模型)。 * **VLLM 在舊卡上的表現** * MI25 在有核心支援時,效能可能優於 P100。 * 但整體不建議使用,因許多模型無法輕鬆運行。 * V100 可運行 QAN 3.6 270 億參數模型的 GPT-Q 4-bit 量化版本。 ### 10. 缺點與權衡 (Caveats and Trade-offs) 1. **架構限制** * P100 (Pascal) 與 MI25 (Vega) 無現代機器學習硬體路徑。 * V100 雖有 Tensor Cores,但相較現代 GPU 仍為舊架構,吞吐量無法匹敵。 * 反映在價格上:便宜但效能有限。 2. **噪音問題** * 被動散熱卡(Passive cards)需高風量風扇冷卻。 * 系統噪音大,不適合放在書桌下,建議放置於車庫、地下室或專用房間。 3. **系統匯流排 (System Bus)** * 使用 **PCIe Gen 3** 插槽。 * 理論頻寬約 16GB/秒(現代 PCIe Gen 5 為 64GB/秒,四倍速度)。 * **單卡影響**:載入模型權重時僅增加幾秒延遲。 * **多卡影響**:GPU 間需頻繁交換資訊與同步活動,頻寬可能成為瓶頸。 ### 11. 舊規格硬體對效能的影響與總結 * **PCIe 3.0 限制**:資訊交換較慢,限制整體吞吐量(throughput)與 token 生成效能。 * **記憶體頻寬比較**: * DDR4:運作於 2400 至 3200 megatransfer per second。 * DDR5:起跳 4800 megatransfer,頻寬幾乎翻倍。 * **瓶頸情境**:若模型完全放入 GPU 記憶體,影響不大;但若需卸載(offloading)至 CPU 或系統記憶體,舊規格會成為瓶頸。 * **硬體選擇的取捨與升級選項**: * **低成本方案**:選擇 PCIe 3.0 與 DDR4 是為了展示最便宜的可行組裝方案。 * **高階硬體選項**:若尋找便宜硬體(bargain hardware),可找到配備 DDR5 與 PCIe 4/5 的伺服器與工作站。 * **具體範例**:Dell Precision 7960(價格較高,但配備 DDR5 與 PCIe 5.0)。 * **目標受眾與解決方案價值**: * **預算範圍**:2,000 至 3,000 英鎊。 * **需求**:需要 64GB VRAM 來運行特定模型。 * **推薦