# 影片筆記:Demo超神、上線全崩?AI專案失敗真相終於曝光?40%的AI專案都失敗!企業第一步就做錯了?|三立財經iNEWS ## 一句話總結 企業導入 AI 不應盲目追求最大模型,而應透過「選對大腦、持續餵知識、建立評測標準、地端部署」四部曲,打造懂企業需求的專屬 AI,以避免 40% 的專案因題目選錯、價值不清或成本失控而失敗。 ## 核心重點 1. **AI 導入四部曲**: * **選對大腦 (LOM/LLM)**:不盲目追求最大模型,需選擇適合的基座模型。 * **持續餵知識 (RAG)**:利用檢索增強生成技術整合企業知識庫,解決幻覺問題並保護機密。 * **建立評測標準 (Benchmark)**:自建題庫與標準答案,避免依賴已外洩的公開榜單,確保 AI 表現符合實際業務。 * **地端部署**:將成熟任務移至本地伺服器,確保資料不出場、自主可控。 2. **專案失敗現狀**:約 40% 的 AI 專案預計在 2027 年被取消,主因包括題目選錯、價值(ROI)說不清、成本失控,以及盲目追求大模型卻缺乏適當訓練資料。 3. **成功關鍵**:資料治理、明確目標防護欄、培養既懂領域又懂 AI 的人才。最終目標是打造「懂你的 AI」而非單純追求「更大的 AI」。 4. **技術演進**:RAG 技術從僅處理文字演進至可處理表格、圖片、工程圖及手寫批註;Graph RAG 則針對抽象或跨檔案問題,透過建立網路結構來聚合回答。 ## 詳細大綱 ### I. 講者背景與專案經驗 * **講者簡介**:蔡宗翰,國立中央大學資訊工程系教授、中英院人社中心研究員。 * **主要專案經驗**: * **TIDE 專案**:2023年起參與臺灣最大規模生成式 AI 專案,研發臺灣自有大型語言模型(主權 AI),擔任模型訓練組召集人。 * **AI 華語拍檔**:針對全球華語老師,生成符合臺灣教育部標準的專業教材(如半導體產業相關華語),解決傳統教材(如端午節、小籠包)與現代職場需求脫節的問題。 * **Write AI**:針對臺灣學測作文評分標準訓練的模型。解決通用模型(如 ChatGPT)評分虛高問題,達到與人類老師評分平均差距僅 0.9 分的精準度,並提供具體修改建議。 * **科普推廣**:撰寫《寫給中學生看的 AI 課》,獲 2024 年吳大猷科學普及著作獎。 ### II. 企業導入 AI 的常見陷阱與數據 * **專案失敗率**:約 40% 的 AI 專案預計在 2027 年被取消。 * **失敗原因**: * 題目選錯。 * 價值說不清(ROI 不明)。 * 成本失控。 * 盲目追求最大模型,缺乏適當訓練資料,導致「智商高但無專業訓練」。 * **資料外洩風險**:使用雲端服務時,核心配方、客戶資料可能外洩,即便有保證,仍存在駭客風險。 ### III. AI 匯入四部曲 (Four Sessions) #### 第一課:選對 AI 的大腦 (LOM - Large Language Model) * **基座模型選擇**:不盲目追求最大,需選擇適合的基座(如國科會的臺德模型)。 * **專才訓練**:將通才訓練為專才。 * **案例 - AI 華語拍檔**:灌入教育部各集教材資料,讓 AI 學習教學標準。 * **案例 - Write AI**:收集並擴充一萬份至二十萬份學測作文資料進行後訓練 (Post-training),使模型懂臺灣學測標準。 * **案例 - 半導體製程模型**:針對工程師急迫需求,訓練模型精準回答製程問題,避免冗長不切重點的回答。 #### 第二課:持續餵給知識 (RAG - Retrieval Augmented Generation) * **解決幻覺問題**:結合搜尋技術與大型語言模型生成能力。先檢索相關資料,再結合問題生成帶有證據的答案。 * **技術演進**: * 早期 RAG 僅能處理文字。 * 現在可處理表格、圖片、工程圖、手寫批註。 * **Graph RAG**:針對抽象或跨檔案問題,抽取核心概念建立網路結構,比對相關資訊後聚合回答。 * **應用價值**: * 將生產資料、SOP、裝置維修紀錄、規格書放入企業大腦。 * 防止老師傅退休後知識流失。 * **案例**:臺大臺湖系統(臺灣史資料庫)、國圖博碩士論文網升級為 AI 搜尋。 #### 第三課:量測表現 (Benchmarking) * **公開榜單的局限性**: * 如 MMLU 等榜單題庫已外洩,各公司皆知曉題目。 * 新模型分數必然高於舊模型,且廠商會控制分數增長幅度以維持競爭敘事。 * 與實際應用場景差距大。 * **自建評測標準**: * 收集公司內部使用者實際提問與標準答案。 * 驗證匯入 AI 後的實際表現,防止 Demo 很神、上線就崩。 * 評估哪一模型對特定題目最準、最划算。 #### 第四課:地端部署與專屬模型 * **地端模型的好處**: * 資料不出場。 * 自主可控。 * 20B 左右的大模型能力已足夠強大。 * **部署策略**: * 初期可使用雲端大模型。 * 熟悉應用場域後,建立公司專用模型。 * 區分「廠端大模型」與「個人端/裝置端專用模型」(如瑕疵檢測)。 * **國際趨勢參考**: * **歐洲 (AI Foreign)**:強調原生 LLM 僅預測下一個字,本質不可控,需靠明確目標、防護欄及評測才能上產線。 * **新加坡**:國家 AI 策略強調全面匯入與場景盤點,培養懂領域又懂 AI 的雙語人才。 * **ASML**:製造業正常是工業 AI,擁有的世界級製造資料是最大資產,需從需求驅動匯入。 ### IV. 決策圖與總結 * **避開地雷**: * 為做而做。 * Demo 很美,上線就垮。 * 無資料治理(資料亂七八糟的 PDF)。 * ROI 說不清。 * **AI 匯入決策流程**: 1. 盤點適合場景。 2. 建立 Benchmark。 3. 使用 RAG 快速建立可回本的應用(90天內)。 4. 轉為專屬模型或地端部署以深化應用。 * **核心結論**:AI 匯入 = 你的資料 × 對的方法。 * 選對大腦 (LOM)。 * 給知識 (RAG)。 * 驗測表現 (Benchmark)。 * 地端保護資料。 * 不追更大的 AI,打造更懂你的 AI。 ## 工具 / 模型 / 名詞整理 * **TIDE**:臺灣最大規模生成式 AI 專案,研發臺灣自有大型語言模型。 * **AI 華語拍檔**:協助華語老師生成教材的專案。 * **Write AI**:針對學測作文評分與批改的模型/專案。 * **ChatGPT**:通用大型語言模型,講者指出其改作文時容易給出虛高分數。 * **臺德模型**:國科會推出的基座模型。 * **Gimini**:Google 推出的模型(提及於榜單討論)。 * **MMLU**:大型語言模型評測榜單/題庫。 * **RAG (Retrieval Augmented Generation)**:檢索增強生成技術。 * **Graph RAG**:基於圖結構的 RAG 技術。 * **臺湖系統**:臺大系統,將臺灣史資料作為知識庫。 * **國圖**:國家圖書館,升級博碩士論文網為 AI 搜尋。 * **ASML**:歐洲最大半導體製造商。 * **AI Foreign**:歐洲舉辦的 AI 相關活動/論壇。 * **LOM**:講者提及「選對 AI 的大腦 (LOM)」,疑為 LLM (Large Language Model) 之聽寫錯誤。 * **RIG**:講者提及「用 RIG 來給它知識」,疑為 RAG 之聽寫錯誤。 * **Graph Rack**:講者提及「Graph Rack」,疑為 Graph RAG 之聽寫錯誤。 * **Rack**:講者提及「透過這個 Rack 的方式」,疑為 RAG 之聽寫錯誤。 * **Yana Khun**:被提及為 AI 大神(講者口述名稱,疑點見下)。 ## 操作流程整理 1. **盤點場景**:識別適合導入 AI 的企業應用場景。 2. **建立評測標準 (Benchmark)**: * 收集公司內部使用者實際提問與標準答案。 * 驗證 AI 表現,防止 Demo 很神、上線就崩。 3. **選擇基座模型 (LOM/LLM)**: * 不盲目追求最大模型,選擇適合的基座。 * 進行專才訓練(後訓練 Post-training),將通才訓練為專才。 4. **導入檢索增強生成 (RAG)**: * 將生產資料、SOP、維修紀錄、規格書等知識庫整合進 AI。 * 解決幻覺問題,防止知識隨老師傅退休而流失。 * 可處理文字、表格、圖片、工程圖及手寫批註。 5. **地端部署**: * 將成熟任務移至本地伺服器執行。 * 確保資料不出場、自主可控。 * 區分廠端大模型與個人端/裝置端專用模型。 ## 值得注意的限制或風險 * **專案失敗率高**:約 40% 的 AI 專案預計在 2027 年被取消。 * **資料外洩風險**:使用雲端服務時,核心配方、客戶資料可能外洩,即便有保證,仍存在駭客風險。 * **公開榜單局限性**:如 MMLU 等榜單題庫已外洩,新模型分數必然高於舊模型,且廠商會控制分數增長幅度以維持競爭敘事,與實際應用場景差距大。 * **Demo 與上線落差**:若無自建評測標準,易出現 Demo 很神、上線就崩的情況。 * **成本與 ROI**:選錯模型可能導致成本失控,價值(ROI)說不清。 * **資料治理問題**:資料亂七八糟的 PDF 等無效資料治理會導致專案失敗。 * **技術本質限制**:原生 LLM 僅預測下一個字,本質不可控,需靠明確目標、防護欄及評測才能上產線。 ## 逐字稿辨識疑點 * **能工智慧學會**:講者自稱代表「中華民國能工智慧學會」,疑為「人工智慧」之聽寫錯誤或口誤。 * **和平**:講者提到在中英院「來做和平」,疑為「來做研究」或特定職位名稱之聽寫錯誤。 * **生成4A**:講者提到「生成4A的專案」,疑為「生成式 AI」之聽寫錯誤。 * **歐基電**:講者提到台積電帶領廠商前往歐洲變成「歐基電」,疑為「歐洲」或特定公司/組織名稱之聽寫錯誤。 * **鼎泰峰式小籠包**:講者提到「來臺灣這個鼎泰峰式小籠包」,語意稍顯突兀,疑為口誤或特定比喻。 * **北域女**:講者提到「我跟北域女的國文學科中心的老師」,疑為「北一女」(北一女中)之聽寫錯誤。 * **Chair GBT / ChairGPT**:講者多次提到「Chair GBT」或「ChairGPT」,疑為「ChatGPT」之聽寫錯誤。 * **五倍女**:講者提到「我跟北域女的...大概一般北域女大概只會有一個20分」,語意重複且「北域女」疑為「北一女」。 * **大考中心**:講者提到「由這個大考中心的教授親自帶領」,指臺灣大學學科能力測驗中心。 * **post training**:講者提到「做一些post training後訓練」,為英文術語混用。 * **run AI 的專案**:講者提到「run AI 的專案」,疑為「進行」或「執行」之口語化表達或聽寫錯誤。 * **3721**:講者提到「不管3721先把最大的模型給上去」,為成語「不管三七二十一」之聽寫錯誤。 * **樂樂等**:講者提到「講一大堆樂樂等」,疑為「囉哩囉唆」或「零零落落」等形容冗長之聽寫錯誤。 * **自成配方**:講者提到「問他自成」,疑為「上下文」或「資料」之聽寫錯誤。 * **公司賴企業賴**:講者提到「防止你的這個你這個公司賴企業賴生存的機密」,疑為「公司、企業賴以生存」之聽寫錯誤。 * **通才訓練成一個專才**:語意通順,但「通才」與「專才」為對比概念。 * **簡合方式**:講者提到「定義了一個簡合方式 Benchmark」,疑為「結合方式」或「檢驗方式」之聽寫錯誤。 * **TrackGPT**:講者提到「改用TrackGPT來改」,疑為「ChatGPT」之聽寫錯誤。 * **製程的know how**:講者提到「製程的know how」,為英文術語混用。 * **斷掰**:講者提到「他不知道他就開始斷掰」,為台語口語,意指胡亂編造。 * **升一些墨水分數**:講者提到「想辦法升一些墨水分數」,疑為「生一些沒有的東西」或「編造」之聽寫錯誤。 * **interview**:講者提到「如果去interview」,為英文術語混用。 * **大型元模型**:講者提到「大型元模型的生成能力」,疑為「大型語言模型」之聽寫錯誤。 * **S光片**:講者提到「工程圖 S光片」,疑為「手寫片」或特定文件類型之聽寫錯誤。 * **手寫批著**:講者提到「手寫批著都可以看得懂」,疑為「手寫批註」之聽寫錯誤。 * **Graph Rack**:講者提到「Graph Rack」,疑為「Graph RAG」之聽寫錯誤。 * **Rack**:講者提到「透過這個Rack的方式」,疑為「RAG」之聽寫錯誤。 * **量子**:講者提到「我們要自己去建這個量子」,疑為「題庫」或「量測標準」之聽寫錯誤。 * **demo很神上線就崩**:講者提到「防止demo很神上線就崩」,為口語化表達。 * **五十倍的錢**:講者提到「選錯模型多少五十倍的錢」,疑為「省掉」或「省下」之聽寫錯誤。 * **地端**:講者多次提到「地端模型」、「地端部署」,疑為「端端」或「本地端 (On-premise)」之聽寫錯誤。 * **loading**:講者提到「他自己的loading就增加了」,為英文術語混用,意指負擔。 * **AI foreign**:講者提到「歐洲的AI foreign」,疑為活動名稱或特定術語。 * **Yana Khun**:講者提到「邀請AI大神Yana Khun」,疑為特定講者姓名,需查證。 * **LOM**:講者提到「選對 AI 的大腦 (LOM)」,疑為「LLM (Large Language Model)」之聽寫錯誤,因前文多次使用 LLM。 * **RIG**:講者提到「用RIG來給它知識」,疑為「RAG」之聽寫錯誤。 * **兩尺**:講者提到「裝上兩尺」,疑為「兩側」或特定術語之聽寫錯誤,或為「兩全」之誤。 ## 可延伸追問 * 如何