AI 方法論知識地圖 · 部署與維運

模型優化

壓縮/量化/蒸餾

在互動地圖中開啟 回AI 方法論知識地圖

觀念教學

為了在邊緣裝置或生產環境高效運行,需透過剪枝、量化、知識蒸餾減少模型大小與推論時間。

知識蒸餾(Knowledge Distillation)

讓大模型(Teacher)把知識教給小模型(Student),小模型更輕更快但盡量保留效果。

為什麼要蒸餾?(考試常考)

  • 降低推論成本(GPU 費用砍半甚至更多)
  • 方便部署到邊緣設備(手機、IoT、嵌入式)
  • 提升推論速度(延遲從秒級降到毫秒級)

原理:Soft Label 的秘密

  • Hard Label:答案是「貓」(0 或 1)
  • Soft Label:Teacher 說「80% 貓、15% 老虎、5% 狗」
  • Student 學的是 Soft Label,因為它包含類別之間的相似關係(貓跟老虎比較像),比 Hard Label 資訊量更豐富

代表案例

  • DistilBERT:BERT 的蒸餾版,參數少 40%,速度快 60%,效果保留 97%
  • TinyBERT、MobileBERT:更小更快的變體

剪枝(Pruning)

砍掉模型中不重要的權重或神經元,像修剪樹枝,留下主幹。

量化(Quantization)

把權重從 FP32 降到 INT8 或 FP16,精度微降但速度和記憶體大幅改善。

比喻:蒸餾 = 老師教學生精華筆記;剪枝 = 刪掉廢話;量化 = 把精裝書改成口袋書。

LoRA(Low-Rank Adaptation)

參數高效率微調(PEFT)的代表方法,不重訓整個大模型,只加少量可訓練的低秩矩陣。

核心原理
原始權重 W 凍結不動,旁邊插入兩個小矩陣 A 和 B(低秩分解),只訓練 A 和 B。
推論時合併回去:W' = W + A×B,不增加推論延遲。

為什麼用 LoRA?(考試重點)

  • 不是從零訓練,也不是改掉整個模型
  • 訓練參數量只有原模型的 0.1%~1%
  • GPU 記憶體需求大幅降低(一張消費級顯卡就能微調 7B 模型)
  • 可以針對不同任務訓練不同 LoRA,像換衣服一樣切換

常見變體

  • QLoRA:LoRA + 4-bit 量化,記憶體再省一半
  • DoRA:分解方向和大小,效果更好
  • Adapter:類似概念,在層之間插入小模組
比喻:LoRA 像在課本頁邊寫筆記,課本本身不動,但加了你的理解。不同科目寫不同筆記,換科目只要換筆記本。

應用場景

剪枝 (Pruning)量化 (INT8/FP16)知識蒸餾LoRA / QLoRAONNX 轉換

評估指標

模型大小推論速度準確率損失

iPAS 歷屆考題詳解(6 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

第四梯次初級AI應用規劃師第一科人工智慧基礎概論 第27題

在大型 Transformer 模型的效能優化過程中,常見的方法之一是「剪枝(Pruning)」。下列哪一項最符合該方法的核心概念?

  1. A將模型中所有權重按比例縮小,使其值更接近零,以降低計算量
  2. B移除模型中影響較小或冗餘的部分權重參數,以減少模型大小並提升推理效率
  3. C在訓練時僅更新部分權重而將其他權重凍結,從而減少需要調整的參數數量
  4. D根據注意力分數動態跳過處理部分輸入 Token,以減少每次前向傳播的計算
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 剪枝(Pruning)的核心概念是辨識並移除模型中影響較小或冗餘的權重參數(亦可及於整個神經元、注意力頭或通道),使模型變得稀疏或更精簡,以縮小模型體積並提升推理效率,同時盡量維持原有效能。常見作法包括依權重絕對值大小移除的 Magnitude Pruning、依訓練中權重變化趨勢移除的 Movement Pruning 等;剪枝後通常再進行微調以回復精度,故 (B) 正確。 【為何其他選項錯了?】 - (A):將所有權重按比例縮小、使其接近零,是 L2 正則化(權重衰減)的效果;權重數量並未減少,計算量不變。剪枝是實際移除權重,而非整體縮小數值。 - (C):凍結大部分權重、僅更新少部分參數是參數高效微調(如 LoRA、PEFT)的作法,目的在降低訓練成本;被凍結的權重仍保留於模型中,與剪枝的永久移除不同。 - (D):依注意力分數動態跳過部分輸入 Token 屬於稀疏注意力或動態計算縮減技術,作用對象是輸入序列的計算路徑,並非移除模型本身的權重參數,模型大小也未縮減。 提示:剪枝移除的是模型權重;縮小權重數值是正則化,凍結權重是高效微調,跳過 Token 是動態稀疏計算,四者作用對象不同。
115年第一次初級AI應用規劃師第一科人工智慧基礎概論 第49題

某AI科技公司在工業缺陷檢測領域已有成熟的辨識產品經驗。現欲與新客戶合作 開發一項類似產品的表面瑕疵檢測系統,但因新產品量產不久,標註樣本極為稀 少且專家標註成本高昂。在不大幅增加標註預算的前提下,下列哪一種做法最能 利用該公司既有的技術優勢來提升模型表現?

  1. A增加模型參數規模,使模型具備更強表達能力
  2. B透過資料增強(Data Augmentation)擴展影像變化,以提升模型穩定性
  3. C重新蒐集大量影像並進行完整人工標註
  4. D採用遷移學習(Transfer Learning),利用既有預訓練模型進行調整
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹是典型的小樣本情境,且公司在類似領域已有成熟的辨識產品經驗,正是遷移學習(Transfer Learning)的適用時機。其核心作法是以既有大量資料訓練出的成熟模型(預訓練模型)為基礎,再以新產品的少量標註樣本進行微調(Fine-tuning),讓模型沿用過去學到的通用特徵辨識能力,快速適應新任務。如此能在不大幅增加標註預算的前提下,充分利用公司既有技術優勢達到良好效果,故 (D) 正確。 【為何其他選項錯了?】 - (A):在小樣本上增加模型參數規模,極易導致嚴重過擬合,且未利用既有技術資產。 - (B):資料增強是有用的輔助手段,但僅擴充影像的變化,無法引入既有領域知識;遷移學習直接轉移已學得的特徵,效益通常更大。 - (C):重新蒐集大量影像並完整人工標註,直接違反題目「不大幅增加標註預算」的前提,成本過高。 提示:題幹同時出現「標註樣本稀少」與「既有成熟經驗」時,對應遷移學習;資料增強屬輔助手段,重新標註違反成本限制。
115年第一次初級AI應用規劃師第二科生成式AI應用與規劃 第2題

在進行大型語言模型 (LLM) 企業專屬知識的Fine-tuning時,若內部 GPU 運算資源與記憶體嚴重受限,下列哪一種參數高效微調(PEFT, Parameter Efficient Fine-Tuning)技術最能在維持模型效能的前提下,顯著降低需更新的參數數量?

  1. A知識蒸餾(Knowledge Distillation)
  2. B提示詞工程(Prompt Engineering)
  3. C梯度凍結(Gradient Freezing)
  4. D低秩適配(Low-Rank Adaptation)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 參數高效微調(PEFT)的目標是在資源有限的情況下,以最小代價微調大型模型。低秩適配(Low-Rank Adaptation, LoRA)是 PEFT 的代表性技術:凍結 LLM 原有的全部參數,在特定位置(通常是注意力層的權重矩陣)加入兩個小型低秩矩陣,訓練時僅更新這些新增矩陣。需更新的參數量可降至原模型的千分之一以下,顯著降低 GPU 記憶體與運算需求,同時維持接近全參數微調的效能,故 (D) 正確。 【名詞白話語典】 - PEFT:一系列旨在以更少資源微調大型模型的技術統稱,共同特徵是僅更新少量參數。 - LoRA:可比喻為在一本厚重的教科書(大模型)上附加數張輕薄的便利貼(低秩矩陣),筆記僅寫在便利貼上,不更動書本原有內容。 【為何其他選項錯了?】 - (A):知識蒸餾是訓練小型學生模型模仿大型教師模型的行為,產出的是全新的小模型,並非微調大模型本身,不屬於 PEFT 技術。 - (B):提示詞工程完全不更動模型參數,僅透過設計輸入文本引導模型輸出,不涉及微調。 - (C):梯度凍結是凍結部分參數的寬泛概念;LoRA 是在凍結全模型的基礎上外加低秩矩陣的具體高效實作,就題目所問的 PEFT 技術而言,(D) 更精準。 提示:題幹關鍵詞「PEFT、顯著降低需更新的參數量」直接對應 LoRA;蒸餾產出新模型、提示工程不動參數,皆非微調技術。
115年第一次初級AI應用規劃師第二科生成式AI應用與規劃 第10題

某企業建置檢索增強生成(Retrieval-augmented generation, RAG)系統支援內部知識查詢。隨著使用量提升,團隊發現模型回覆品質穩定,但推論延遲與運算成本逐漸增加。專案規劃在維持回覆品質前提下進行效能優化。在此情境下,若採用知識蒸餾(Knowledge Distillation),下列敘述何者最為合理?

  1. A將檢索資料轉換為結構化規則以取代模型
  2. B僅透過增加檢索文件數量改善效能
  3. C停用生成模型以避免延遲問題
  4. D使小型模型學習大型模型行為,以降低推論成本
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 知識蒸餾(Knowledge Distillation)是一種模型壓縮技術:以表現優異但運算成本高的大型教師模型為對象,訓練輕量的學生模型模仿其輸出行為(例如輸出的機率分布),使學生模型在特定任務上的表現接近教師模型。訓練完成後,以規模小、推論快的學生模型提供服務,即可在維持回覆品質的前提下,降低推論延遲與運算成本,正符合題幹 RAG 系統的優化目標,故 (D) 正確。 【為何其他選項錯了?】 - (A):將檢索資料轉為結構化規則以取代模型,是放棄生成模型的規則系統作法,與知識蒸餾無關,亦難以維持原有回覆品質。 - (B):增加檢索文件數量會加長輸入內容與處理負擔,通常使延遲與成本上升,與優化目標相反,也與蒸餾無關。 - (C):RAG 的架構是檢索加生成,停用生成模型等於移除系統的核心功能,並非效能優化手段。 提示:知識蒸餾的固定敘述模式是「小模型學習大模型行為以降低推論成本」;取消模型或增加負擔的選項皆可排除。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第40題

某智慧製造公司在產線上部署工業相機進行即時外觀瑕疵檢測,原先將影像傳至雲端進行 AI 推論,但因網路延遲與連線不穩導致系統無法滿足即時需求(需低於200ms)。工程師因此改為將模型部署於產線端的邊緣裝置後,但仍未達系統需求。在不更換硬體設備的前提下,下列哪一組技術最能有效降低推論延遲,同時維持合理準確率?

  1. A減少訓練資料的使用數量,並重新訓練模型以提升推論效率
  2. B使用批次推論(Batch Inference)處理多張影像以提升計算效率
  3. C採用模型集成(Model Ensemble),透過多模型投票提升準確率
  4. D將模型由 FP32 量化為INT8,並進行推論加速優化
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題幹限制為不更換硬體、需降低推論延遲並維持合理準確率。將模型權重與運算由 FP32 量化(Quantization)為 INT8,計算量與記憶體頻寬需求大幅下降;再配合推論引擎最佳化(如 TensorRT、ONNX Runtime、OpenVINO 的算子融合與硬體加速),在邊緣裝置上通常可獲得數倍加速,且分類與檢測任務的精度損失多在可接受範圍,必要時可用量化感知訓練(QAT)回復精度。此為邊緣部署降低延遲的標準作法,故 (D) 正確。 【為何其他選項錯了?】 - (A):減少訓練資料僅影響訓練階段;推論速度由模型結構與運算精度決定,縮減資料無助於降低延遲,反而可能降低準確率。 - (B):批次推論以累積多張影像換取吞吐量(Throughput)提升,但單張影像需等待湊批,單次延遲(Latency)反而增加,與即時檢測需求相反。 - (C):模型集成需執行多個模型再彙整結果,計算量成倍增加,延遲隨之上升,與降低延遲的目標背道而馳。 提示:邊緣推論加速的常用組合為量化、剪枝、蒸餾,第一步通常是 INT8 量化搭配推論引擎最佳化;吞吐量與延遲是不同指標,批次處理提升吞吐量但增加單次延遲。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第21題

某工程師將一個大型預訓練模型部署至資源受限的行動裝置,發現模型體積過大且推論效率不足。為降低模型大小並提升推論速度,他將原本 32-bit 浮點數權重轉換為8-bit 整數。在不重新訓練模型的前提下,請問此過程稱為何?

  1. A知識蒸餾(Knowledge Distillation)
  2. B權重剪枝(Pruning)
  3. C張量分解(Tensor Decomposition)
  4. D模型量化(Quantization)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 將 32-bit 浮點權重轉換為 8-bit 整數表示,可使模型體積約降為四分之一,並利用整數運算加速推論,此過程即模型量化(Quantization)。題幹強調不重新訓練,對應訓練後量化(Post-Training Quantization, PTQ),是行動裝置與邊緣部署常用的模型壓縮手段,故 (D) 正確。 【為何其他選項錯了?】 - (A):知識蒸餾是訓練小型學生模型模仿大型教師模型的輸出,需要額外的訓練流程,改變的是模型結構與規模,而非數值精度。 - (B):權重剪枝是移除不重要的權重或通道,使網路稀疏化,更動的是連接數量,不是每個數值的位元寬度。 - (C):張量分解是將大型權重矩陣拆解為低秩因子的乘積以減少參數量,同樣不涉及數值精度的轉換。 提示:模型壓縮四類手法:量化改變數值精度、剪枝減少連接、蒸餾轉移知識、分解重組矩陣;題幹出現「FP32 轉 INT8、不重新訓練」即對應訓練後量化。

相關節點