AI 方法論知識地圖 · 部署與維運
模型優化
壓縮/量化/蒸餾
觀念教學
為了在邊緣裝置或生產環境高效運行,需透過剪枝、量化、知識蒸餾減少模型大小與推論時間。
知識蒸餾(Knowledge Distillation)
讓大模型(Teacher)把知識教給小模型(Student),小模型更輕更快但盡量保留效果。
為什麼要蒸餾?(考試常考)
- 降低推論成本(GPU 費用砍半甚至更多)
- 方便部署到邊緣設備(手機、IoT、嵌入式)
- 提升推論速度(延遲從秒級降到毫秒級)
原理:Soft Label 的秘密
- Hard Label:答案是「貓」(0 或 1)
- Soft Label:Teacher 說「80% 貓、15% 老虎、5% 狗」
- Student 學的是 Soft Label,因為它包含類別之間的相似關係(貓跟老虎比較像),比 Hard Label 資訊量更豐富
代表案例
- DistilBERT:BERT 的蒸餾版,參數少 40%,速度快 60%,效果保留 97%
- TinyBERT、MobileBERT:更小更快的變體
剪枝(Pruning)
砍掉模型中不重要的權重或神經元,像修剪樹枝,留下主幹。
量化(Quantization)
把權重從 FP32 降到 INT8 或 FP16,精度微降但速度和記憶體大幅改善。
比喻:蒸餾 = 老師教學生精華筆記;剪枝 = 刪掉廢話;量化 = 把精裝書改成口袋書。
LoRA(Low-Rank Adaptation)
參數高效率微調(PEFT)的代表方法,不重訓整個大模型,只加少量可訓練的低秩矩陣。
核心原理
原始權重 W 凍結不動,旁邊插入兩個小矩陣 A 和 B(低秩分解),只訓練 A 和 B。
推論時合併回去:W' = W + A×B,不增加推論延遲。
為什麼用 LoRA?(考試重點)
- 不是從零訓練,也不是改掉整個模型
- 訓練參數量只有原模型的 0.1%~1%
- GPU 記憶體需求大幅降低(一張消費級顯卡就能微調 7B 模型)
- 可以針對不同任務訓練不同 LoRA,像換衣服一樣切換
常見變體
- QLoRA:LoRA + 4-bit 量化,記憶體再省一半
- DoRA:分解方向和大小,效果更好
- Adapter:類似概念,在層之間插入小模組
比喻:LoRA 像在課本頁邊寫筆記,課本本身不動,但加了你的理解。不同科目寫不同筆記,換科目只要換筆記本。
應用場景
評估指標
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
在大型 Transformer 模型的效能優化過程中,常見的方法之一是「剪枝(Pruning)」。下列哪一項最符合該方法的核心概念?
- A將模型中所有權重按比例縮小,使其值更接近零,以降低計算量
- B移除模型中影響較小或冗餘的部分權重參數,以減少模型大小並提升推理效率
- C在訓練時僅更新部分權重而將其他權重凍結,從而減少需要調整的參數數量
- D根據注意力分數動態跳過處理部分輸入 Token,以減少每次前向傳播的計算
看正解與逐選項詳解
正解:B
某AI科技公司在工業缺陷檢測領域已有成熟的辨識產品經驗。現欲與新客戶合作 開發一項類似產品的表面瑕疵檢測系統,但因新產品量產不久,標註樣本極為稀 少且專家標註成本高昂。在不大幅增加標註預算的前提下,下列哪一種做法最能 利用該公司既有的技術優勢來提升模型表現?
- A增加模型參數規模,使模型具備更強表達能力
- B透過資料增強(Data Augmentation)擴展影像變化,以提升模型穩定性
- C重新蒐集大量影像並進行完整人工標註
- D採用遷移學習(Transfer Learning),利用既有預訓練模型進行調整
看正解與逐選項詳解
正解:D
在進行大型語言模型 (LLM) 企業專屬知識的Fine-tuning時,若內部 GPU 運算資源與記憶體嚴重受限,下列哪一種參數高效微調(PEFT, Parameter Efficient Fine-Tuning)技術最能在維持模型效能的前提下,顯著降低需更新的參數數量?
- A知識蒸餾(Knowledge Distillation)
- B提示詞工程(Prompt Engineering)
- C梯度凍結(Gradient Freezing)
- D低秩適配(Low-Rank Adaptation)
看正解與逐選項詳解
正解:D
某企業建置檢索增強生成(Retrieval-augmented generation, RAG)系統支援內部知識查詢。隨著使用量提升,團隊發現模型回覆品質穩定,但推論延遲與運算成本逐漸增加。專案規劃在維持回覆品質前提下進行效能優化。在此情境下,若採用知識蒸餾(Knowledge Distillation),下列敘述何者最為合理?
- A將檢索資料轉換為結構化規則以取代模型
- B僅透過增加檢索文件數量改善效能
- C停用生成模型以避免延遲問題
- D使小型模型學習大型模型行為,以降低推論成本
看正解與逐選項詳解
正解:D
某智慧製造公司在產線上部署工業相機進行即時外觀瑕疵檢測,原先將影像傳至雲端進行 AI 推論,但因網路延遲與連線不穩導致系統無法滿足即時需求(需低於200ms)。工程師因此改為將模型部署於產線端的邊緣裝置後,但仍未達系統需求。在不更換硬體設備的前提下,下列哪一組技術最能有效降低推論延遲,同時維持合理準確率?
- A減少訓練資料的使用數量,並重新訓練模型以提升推論效率
- B使用批次推論(Batch Inference)處理多張影像以提升計算效率
- C採用模型集成(Model Ensemble),透過多模型投票提升準確率
- D將模型由 FP32 量化為INT8,並進行推論加速優化
看正解與逐選項詳解
正解:D
某工程師將一個大型預訓練模型部署至資源受限的行動裝置,發現模型體積過大且推論效率不足。為降低模型大小並提升推論速度,他將原本 32-bit 浮點數權重轉換為8-bit 整數。在不重新訓練模型的前提下,請問此過程稱為何?
- A知識蒸餾(Knowledge Distillation)
- B權重剪枝(Pruning)
- C張量分解(Tensor Decomposition)
- D模型量化(Quantization)
看正解與逐選項詳解
正解:D