觀念教學
GPT (Generative Pre-trained Transformer) 是 Decoder-only 架構,擅長文本生成。是 ChatGPT、Claude 等大型語言模型的基礎架構。
RLHF 訓練三階段
GPT 從「會說話」到「說得好」靠的就是 RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習):
階段 1:預訓練(Pre-training)
用大量文本學會語言能力,此時模型只會「接話」,不懂好壞。
階段 2:監督微調(SFT)
用人類標註的高品質問答範例微調,讓模型學會「怎麼回答比較好」。
階段 3:RLHF 強化學習微調
- 人類對模型的多個回答排序偏好
- 訓練一個獎勵模型(Reward Model)學會人類偏好
- 用 PPO 演算法讓模型朝「人類喜歡的方向」優化
比喻:預訓練 = 讀萬卷書 → SFT = 拜師學藝 → RLHF = 聽觀眾回饋改進演出
iPAS 歷屆考題詳解(46 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
為提升生成式AI系統回應的語境一致性,常會結合哪類模型技術?
- A決策樹分類器(Decision Tree Classifier)
- B條件語言模型 (Conditional Language Model)
- C強化學習 Q-learning 函數模型
- D基因演算法(Genetic Algorithm)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
條件語言模型(Conditional Language Model)以「給定條件下生成下一個 token」的方式建模,即 P(下一個 token | 前文脈絡、系統提示、使用者輸入)。現代生成式 AI 的大型語言模型本質上皆屬此類:透過上下文視窗納入對話歷史、以系統提示固定角色與語氣,生成內容便能與先前語境保持一致。要提升回應的語境一致性,核心即是強化生成時所依據的條件資訊,故 (B) 正確。
【為何其他選項錯了?】
- (A):決策樹分類器適用於輸出離散類別的分類問題,不具備序列生成能力,也沒有維繫對話上下文的機制。
- (C):Q-learning 學習「狀態-行動」的長期報酬函數,適用於下棋、控制等決策問題;生成式 AI 的語境一致性依靠條件機率建模,強化學習(如 RLHF)僅是後續微調的輔助,並非核心生成機制。
- (D):基因演算法以選擇、交叉、突變搜尋最佳解,常用於超參數或架構搜尋等最佳化問題,與依前文條件生成連貫文字無關。
提示:題幹關鍵詞「語境一致性」對應「以前文為條件」的生成方式;分類器、強化學習、演化演算法皆非語言生成的核心建模技術。
在保持 GPT-OSS 模型架構不變的前提下,如果將模型參數量從 20 億提升至 120 億,並假設有足夠的訓練資料支撐,下列敘述何者最正確?
- A模型參數增加會線性提升效能,且即使訓練資料不變也不會遇到瓶頸
- B參數越多模型推理越快,因為每層可以並行計算更多參數
- C較大的參數量能提升模型的表達能力與預測效能,但需足夠訓練資料支持
- D增加參數量不影響記憶體使用,只會影響計算速度
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
依據縮放法則(Scaling Law),在架構不變的前提下擴大參數量,可提升模型的表達能力,使其捕捉更複雜的語言模式,進而改善預測效能;但前提是訓練資料量須與參數規模相匹配,否則大模型無法被充分訓練,效益將受限。題幹已假設「有足夠的訓練資料支撐」,因此「較大參數量提升表達能力與效能,但需足夠資料支持」的敘述最正確。
【為何其他選項錯了?】
- (A):效能隨參數量的提升是次線性的,存在邊際效益遞減;且若訓練資料不變,模型與資料規模失衡,將遭遇瓶頸,「線性提升且無瓶頸」不成立。
- (B):參數越多,前向傳播的矩陣運算量越大,推理延遲越高;平行計算是硬體層面的能力,不會因參數增加而使推理變快。
- (D):模型參數須載入記憶體,參數量增加會直接推升記憶體用量,同時增加計算量;「不影響記憶體使用」與事實不符。
提示:縮放法則的重點是「模型規模與資料規模須匹配」;宣稱線性提升、推理更快、記憶體不變的選項皆違反基本原理。
某企業考慮將開源大型語言模型(GPT OSS)自行部署在本地伺服器以取代雲端服務。下列何者最能代表本地部署對企業的實際好處?
- A可以達到無運算成本,因為本地部署模型不會產生額外的資源消耗
- B模型的預測能力會比在雲端運行時更精度,因為本地環境更加可靠
- C可確保輸入模型的敏感資料不會傳輸給第三方,提升資料隱私和自主控制
- D以上皆是
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
本地部署最核心且最實際的效益在於資料主權:輸入模型的查詢內容與敏感資料全程留在企業自有環境,不會傳輸給第三方雲端服務,可降低個資與營業祕密外洩風險,並利於符合金融、醫療、政府等產業的法規遵循要求。對高度重視隱私與自主控制的企業,這是自行部署開源大型語言模型的主要動機。
【為何其他選項錯了?】
- (A):本地部署仍需負擔 GPU 伺服器、電力、散熱、維護與硬體折舊等成本,「無運算成本」與事實不符,整體持有成本未必低於雲端服務。
- (B):模型的預測能力取決於模型權重與推理設定,同一模型在本地與雲端執行的精度基本相同;部署地點不會提升預測能力,且雲端服務在可用性與容錯上通常更有保障。
- (D):因 (A)、(B) 的敘述皆錯誤,「以上皆是」不成立。
提示:本地部署的考點固定圍繞「資料隱私與自主控制」;宣稱零成本或精度提升的選項可直接排除。
關於 GitHub Copilot,下列敘述何者正確?
- AGitHub Copilot 基於程式碼片段查詢工具,透過後端搜尋大型程式碼資料庫提供建議
- BGitHub Copilot 僅適用於 GitHub 上的開源專案,無法在私有程式碼庫或本地環境中提供程式碼補全建議
- CGitHub Copilot 利用靜態分析技術分析程式碼,根據邏輯流程推導下一步應寫的程式碼
- DGitHub Copilot 由 OpenAI 的 Codex 模型提供技術支援,可即時在開發者編輯程式碼時給出整行或整個函式建議
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
GitHub Copilot 推出時由 OpenAI 的 Codex 模型(以 GPT 系列為基礎、針對程式碼特化的模型)提供技術支援,能在開發者編輯程式碼的當下,即時給出整行乃至整個函式的補全建議,這是其最具代表性的功能定位。後續版本雖陸續更換與擴充底層模型,但「以大型語言模型即時生成程式碼建議」的核心運作方式不變,故 (D) 為正確敘述。
【為何其他選項錯了?】
- (A):Copilot 是生成式模型,依據上下文「生成」最可能的程式碼,而非在後端資料庫中搜尋相似程式碼片段後回傳。
- (B):Copilot 可在 VS Code、JetBrains 等本地開發環境使用,亦支援私有程式碼庫與企業版方案,並非僅限 GitHub 上的開源專案。
- (C):以靜態分析依邏輯流程推導後續程式碼是傳統 IDE 智慧提示的作法;Copilot 依據訓練得到的機率分布生成建議,並非靜態分析推導。
提示:掌握兩組對比:生成式補全 vs 資料庫搜尋、機率生成 vs 靜態分析;Copilot 皆屬前者。
某電商公司導入 Agentic AI 處理客服,發現 Agent 回答 FAQ 常出錯,且無法修改訂單。最可能是缺少哪兩項工具或技術?
- AAPI 調用(API Calling)+ 任務規劃器(Task Planner)
- B向量資料庫檢索(Vector Retrieval)+API 調用(API Calling)
- C向量資料庫檢索(Vector Retrieval)+任務規劃器(Task Planner)
- D任務規劃器(Task Planner)+溫度參數(Temperature)設定
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹有兩個症狀:其一,FAQ 回答常出錯,屬於知識不足或不正確,對應的解方是向量資料庫檢索(Vector Retrieval),即以檢索增強生成(RAG)讓 Agent 從 FAQ、政策文件等知識庫中取得正確且最新的內容再作答;其二,無法修改訂單,屬於缺乏執行能力,對應的解方是 API 調用(API Calling),讓 Agent 能實際呼叫後台系統查詢與變更訂單。兩項技術分別對應兩個痛點,(B) 為正確組合。
【為何其他選項錯了?】
- (A):具備 API 調用與任務規劃器,仍缺乏知識來源,Agent 無法取得正確的 FAQ 內容,回答出錯的問題依然存在。
- (C):具備檢索可改善 FAQ 正確性,但任務規劃器只負責拆解與安排步驟,無法實際執行訂單修改,仍缺少操作後台系統的能力。
- (D):溫度參數僅影響生成內容的隨機性與多樣性,無法補足知識缺口,也不能賦予系統操作訂單的能力,與兩個症狀皆無關。
提示:先將症狀分類:答錯=缺知識(檢索/RAG),做不到=缺工具(API 調用);逐一對應即可鎖定組合。
某客服自動回應系統希望依客戶群體調整回覆風格,需兼顧即時性與效果,下列哪一種方案最適合?
- A直接微調預訓練模型針對每個客戶群體分別訓練不同風格模型
- B利用控制變量(Control Tokens)或風格標籤在同一模型內動態調整風格
- C利用生成對抗網路(GAN)生成不同風格文本,並透過人工篩選最終答案
- D採用規則式替換方法,替換回覆詞彙以符合不同風格要求
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
控制變量(Control Tokens)或風格標籤的作法,是在輸入中加入代表目標風格的特殊標記,使同一個模型能在推理時依標籤動態切換回覆風格。此方案只需維護單一模型,切換風格幾乎不增加延遲,部署與維運成本低,同時能穩定產生對應風格的輸出,兼顧題幹要求的即時性與效果,是多風格客服系統的合理選擇。
【為何其他選項錯了?】
- (A):為每個客戶群體分別微調並部署一個模型,訓練與維運成本隨群體數量倍增,模型切換與版本管理複雜,不符合即時性與成本效益。
- (C):GAN 主要應用於影像等資料的生成,用於文本風格控制並不成熟;且流程仰賴人工篩選,無法滿足客服系統的即時回覆需求。
- (D):規則式詞彙替換僅能處理表層用詞,無法呈現語氣、句式等整體風格差異,規則數量隨需求膨脹,且易產生語意不自然的結果。
提示:「多風格+即時+單一系統」的需求,對應同一模型內以條件標籤控制生成;多模型與人工流程皆與即時性衝突。
某公司部署結合 Fine tuning 與檢索增強生成(RAG)的語言模型系統作為內部文件助理。系統需同時確保回覆語氣一致、能即時查詢每日新增文件、維持效能穩定,並避免頻繁重新訓練。在長期維護與效能平衡下,下列哪一種策略最合適?
- A每週重新 Fine-tune 模型,將新文件整合進模型知識,逐步取代 RAG 模組
- B完全依靠基礎模型與 RAG,不進行 Fine-tune,僅透過提示設計控制語氣
- C每日進行增量 Fine-tune,讓模型即時學習新文件內容,避免依賴檢索
- D保留語氣相關 Fine-tuning,僅透過檢索系統更新文件內容,不頻繁改動模型
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
本題考 Fine-tuning 與 RAG 的分工原則:語氣、風格屬於穩定不變的需求,適合以一次性的微調固定於模型;文件內容每日新增,屬於高頻變動的知識,適合交由檢索系統即時更新。保留語氣相關微調、僅透過檢索系統更新文件內容,模型本體不需頻繁改動,即可同時達成語氣一致、知識即時、效能穩定與低維護成本,最符合長期維運的平衡。
【為何其他選項錯了?】
- (A):每週重新微調的訓練與部署成本高,模型行為隨版本變動而不穩定;且以微調吸收新文件的時效性遠不如檢索,逐步取代 RAG 的方向不合理。
- (B):完全不微調而僅靠提示設計控制語氣,一致性難以長期維持,面對多樣查詢時語氣容易漂移,不符合「回覆語氣一致」的要求。
- (C):每日增量微調成本極高,且頻繁更新權重易引發災難性遺忘(Catastrophic Forgetting),破壞既有能力與語氣,穩定性風險最大。
提示:分工原則:穩定的風格交給微調,變動的知識交給檢索;凡以頻繁重訓取代檢索的選項皆違反維運成本考量。
某客服系統在回覆「訂單取消政策」時,即使生成溫度固定為 0.6,回覆品質仍常出現差異。調查發現檢索到的政策內容有時是最新版本、有時是過時文件,Prompt 約束不足,微調語料也有模糊描述。若要優先改善品質波動,應先解決哪一項問題?
- A調整溫度參數,降低生成隨機性
- B加強 Prompt 設計,限制模型表達方式
- C優化微調語料,減少含糊描述
- D提升檢索系統品質,確保取得的政策內容正確且最新
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題幹已指出品質波動的根源:檢索到的政策內容時而最新、時而過時。生成溫度固定仍出現品質差異,代表變異來自輸入模型的參考內容,而非生成隨機性。檢索階段若提供過時或錯誤的文件,後續無論提示設計或微調語料多完善,模型都會以錯誤資料為依據作答。因此應優先改善檢索系統品質,例如文件版本控制、索引更新與重排序機制,確保模型每次都取得正確且最新的政策內容。
【為何其他選項錯了?】
- (A):降低溫度僅減少生成的隨機性;檢索內容本身不一致時,即使完全確定性生成,答案仍會隨檢索結果而變動。
- (B):提示約束規範的是表達方式與回答格式,無法修正檢索回來的事實錯誤,參考內容過時的問題依然存在。
- (C):微調語料主要影響語氣與表達習慣,政策細節這類事實層級的知識仍依賴檢索;優化語料無法解決文件版本混亂造成的波動。
提示:發現品質波動先追資料源頭;檢索錯誤屬上游問題,溫度、提示、微調皆屬下游,無法彌補上游的錯誤輸入。
某醫院規劃 AI 專案,希望從胸腔 X 光判斷是否有肺炎徵兆,但誤將生成式 AI 模型用於影像診斷。下列哪一項最可能成為主要風險?
- A模型在生成報告時語句流暢,但僅在文字表達上有差異,對診斷結果沒有重大影響
- B模型若資料不足,僅會降低生成報告的完整性,而非影響判斷病灶的正確性
- C模型偏向生成內容而非分類,但此差異僅影響效率,不會造成誤診風險
- D模型可能生成與實際影像不符的診斷結論,導致誤判並引發醫療與法律風險
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
生成式 AI 的訓練目標是產生看似合理的內容,而非對影像進行嚴謹的分類判讀,存在幻覺(Hallucination)風險:可能生成與實際影像不符的病灶描述或診斷結論,且以流暢、肯定的語句呈現。胸腔 X 光判讀屬於高風險、低容錯的臨床場景,錯誤的診斷結論可能導致延誤治療或過度治療,進而引發醫療糾紛與法律責任,故 (D) 為主要風險。影像診斷應採用分類、偵測或分割模型,而非生成式模型。
【為何其他選項錯了?】
- (A):生成式模型的問題不僅是文字表達差異,而是可能虛構影像中不存在的病灶或結論,對診斷結果有直接影響。
- (B):資料不足時,生成式模型不只降低報告完整性,更可能以虛構內容填補缺口,直接影響病灶判斷的正確性。
- (C):「偏向生成內容」正是誤診風險的來源,生成式模型可能輸出未經影像佐證的診斷,影響的是病人安全而非僅是效率。
提示:生成式 AI 用於高風險診斷的核心風險是幻覺;凡宣稱「僅影響表達、完整性或效率」的選項都低估了錯誤結論的後果。
某智慧車載語音助理,可透過語音辨識(ASR)辨識駕駛語音,再由 LLM 生成回答並查詢車載 API。測試中發現:ASR 對汽車專業術語辨識錯誤率高;LLM 的回覆常不精確;系統回覆延遲雖存在但仍可接受。若目標是「優先提升準確性與回答品質」,下列改進步驟的最合理執行順序為何?1. 擴充並標註汽車領域語音資料,微調 ASR 模型 2. 微調 LLM 並加入檢索增強(RAG)3. 優化系統架構,引入批次推論降低延遲 4. 動態調整生成溫度,平衡準確度與多樣性
- A1 → 2 → 4 → 3
- B2 → 1 → 3 → 4
- C1 → 3 → 2 → 4
- D3 → 1 → 2 → 4
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
目標是優先提升準確性與回答品質,且題幹說明延遲仍可接受。語音助理為串接系統,上游錯誤會向下游傳遞:ASR 將專業術語辨識錯誤,LLM 便是在回答錯誤的問題,因此第一步應擴充並標註汽車領域語音資料、微調 ASR(步驟 1);上游修正後,再微調 LLM 並加入 RAG,提升回答的專業度與精確性(步驟 2);溫度調整屬於生成品質的細部調校,應在模型能力到位後進行(步驟 4);延遲優化並非當前優先目標,排在最後(步驟 3)。故順序為 1 → 2 → 4 → 3。
【為何其他選項錯了?】
- (B):先微調 LLM 再修 ASR,順序顛倒;ASR 輸出仍錯誤時,LLM 端的改善無從發揮,必須先解決上游問題。
- (C):將延遲優化(步驟 3)提前至第二位,違反題幹「延遲仍可接受、優先提升準確性」的條件。
- (D):以延遲優化為第一步,資源配置與題幹目標完全不符,準確性問題被延後處理。
提示:串接系統的改善順序由上游到下游:先修輸入端(ASR),再修生成端(LLM),參數細調其後,非優先目標(延遲)最後。
某顧問公司使用生成式 AI 協助撰寫數據分析報告,模型表現優異,但報告多半只套用固定段落結構與替換數值,未展現多樣化推理與分析。最合理的解釋為何?
- A模型缺乏對字體與排版的優化能力,因此無法展現分析邏輯
- B測試資料涵蓋過多統計圖表,導致模型無法專注於文字內容的多樣化表達
- C模型過度依賴訓練語料中的常見報告範式,導致生成結果以樣板化結構取代真正的推理
- D模型因無法正確辨識報告中的頁碼與標題層級,才出現樣板化的結果
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
大型語言模型以最大化訓練語料的似然為目標,而商業報告語料的結構高度雷同,模型因此傾向重現最常見的報告範式:固定的段落架構、套用語句並替換數值。這是對訓練分布的模式依賴,模型優先輸出統計上最常見的樣板,而非針對個案進行多樣化的推理與分析,正是題幹「結構固定、缺乏推理多樣性」現象的最合理解釋。
【為何其他選項錯了?】
- (A):字體與排版屬於文件呈現層,與生成內容的推理深度無關;樣板化是內容生成模式的問題,不是排版能力問題。
- (B):測試資料中的統計圖表數量不會使模型喪失文字推理的多樣性;樣板化源自訓練語料的範式分布,而非圖表干擾。
- (D):頁碼與標題層級屬於格式辨識問題,題幹描述的是推理與分析的多樣性不足,兩者層次不同,並無因果關聯。
提示:題幹關鍵詞「固定段落結構、替換數值」指向模型複製訓練語料的常見範式;排版、圖表、頁碼皆屬格式層,與推理深度無關。
某保險公司計畫導入生成式 AI 的內部合約查詢系統,協助業務員與法務部門快速解讀保單條款與理賠規範。高層特別強調客戶資料隱私與合規風險控管,即使需要投入較多資源,也必須確保資料不會外洩。在此情況下,下列哪一種策略最符合公司的資料安全與合規優先考量?
- A導入開源模型並由 IT 團隊自建,後續再逐步補強隱私與合規控管
- B在需求確認階段即納入法遵與稽核單位,設定準確率 KPI,並透過 MVP 驗證成效
- C優先使用雲端大型 API 模型快速部署,並根據使用數據持續調整
- D投入資源自訓並私有化部署 LLM,並同步建立自動化風控機制
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題幹的優先條件明確:客戶資料隱私與合規風險控管優先,且公司願意投入較多資源。自行訓練並私有化部署 LLM,可確保保單條款、理賠與客戶資料全程留在企業自有環境,不經第三方服務,從架構層面杜絕資料外流;同步建立自動化風控機制,則涵蓋存取控管、輸出監測與稽核,兼顧上線後的持續合規。此策略最直接對應「資料不得外洩」的硬性要求。
【為何其他選項錯了?】
- (A):先自建再逐步補強隱私與合規,代表導入初期存在控管空窗,與「必須確保資料不外洩」的前提矛盾,屬先上線後補救的作法。
- (B):納入法遵稽核、設定 KPI 與 MVP 驗證是良好的專案治理流程,但未處理部署架構層面的資料外洩風險;若底層仍使用外部服務,資料保護並無保障。
- (C):雲端大型 API 模型會將查詢內容傳輸至第三方伺服器,敏感保單與客戶資料離開企業環境,直接違反題幹的資料安全前提。
提示:題幹給定「隱私優先+資源充足」,即指向私有化部署;雲端 API 與事後補強皆與資料不外洩的硬性條件牴觸。
某電商平台希望商品描述在風格與用詞上保持一致,但不需要新增專業知識。下列哪種方法最適合?
- A擴充語料庫並微調模型,使風格統一
- B增加提示詞複雜度,引導模型風格一致
- C降低生成溫度,以減少隨機性並提升風格一致性
- D使用全連接神經網路對生成結果後期篩選
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
生成溫度(Temperature)控制取樣的隨機性:溫度越低,模型越傾向選擇高機率詞彙,輸出越保守,句型與用詞越一致。題幹需求僅是商品描述的風格與用詞一致,且明確不需新增專業知識,降低溫度即可直接減少生成的隨機變異,達成風格一致性,無需額外訓練或系統改造,成本最低且立即見效,是最適合的方法。
【為何其他選項錯了?】
- (A):擴充語料並微調模型是為了注入新知識或大幅調整模型行為;題幹已排除新增專業知識的需求,微調的成本與工程規模與需求不成比例。
- (B):增加提示詞複雜度雖可引導風格,但無法消除取樣本身的隨機性,一致性不穩定,且提示維護成本隨時間增加,效果不如直接降低隨機性來源。
- (D):以全連接神經網路對生成結果做後期篩選,需另行建置與訓練篩選模型,流程複雜且不穩定,對單純的風格一致需求屬過度設計。
提示:先分辨需求層級:僅要求輸出穩定一致、不需新知識時,調整解碼參數(降低溫度)即可;微調與後篩選皆屬過度工程。
某企業已建置 AI 語音記錄系統,希望整合生成式 AI 提供「會議即時摘要」,下列哪一種策略最能提升摘要的語意品質與使用價值?
- A使用語音轉文字模型即時輸出逐字稿並轉入 GPT 摘要
- B將語音逐段切分並建立關鍵字索引,以利摘要模型從中擷取核心內容生成會議重點
- C將語音轉文字後標註發言角色與主題邊界,結合語意分群進行動態摘要
- D將所有語音內容儲存為完整紀錄,提供事後人工摘要比對用
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
會議摘要的價值在於呈現「誰,在哪個議題上,說了什麼,形成什麼決議」。將語音轉文字後標註發言角色(如語者分離)與主題邊界,再以語意分群將同主題的發言聚合,語言模型即可針對各主題群組進行有結構的動態摘要,產出包含發言者觀點與議題脈絡的會議重點,語意品質與使用價值最高,故 (C) 最佳。
【為何其他選項錯了?】
- (A):直接將冗長且含贅詞的逐字稿送入模型摘要,缺乏角色與主題結構,重要決議易被稀釋,摘要品質受限,僅屬最基本的流程串接。
- (B):關鍵字索引只能擷取高頻詞彙,無法呈現發言脈絡、決議內容與責任歸屬,產出接近關鍵詞列表,語意層次不足。
- (D):僅儲存完整紀錄供事後人工比對,未運用生成式 AI 進行即時摘要,不符合題幹「會議即時摘要」的目標。
提示:比較各選項的結構化程度:角色+主題邊界+語意分群提供最完整的摘要素材;逐字稿直送與關鍵字索引皆缺乏語意結構。
某大型物流公司導入 AI 改善客服與配送效率,專案團隊規劃以下步驟:1. 建立符合公司服務流程的 AI 對話邏輯與應答範本 2. 明確定義導入 AI 的目標並設定 KPI 3. 蒐集與清理過往客服紀錄與配送相關資料 4. 評估並選擇合適的 AI 技術供應商或開源方案。正確執行順序為何?
- A2 → 3 → 4 → 1
- B3 → 2 → 1 → 4
- C2 → 1 → 3 → 4
- D1 → 4 → 3 → 2
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
AI 導入專案的標準順序由目標驅動:先明確定義導入目標並設定 KPI(步驟 2),確立衡量成效的基準;再依目標蒐集與清理相關資料(步驟 3),因為目標決定所需資料的範圍與品質要求;接著依據目標與資料現況評估並選擇技術方案(步驟 4);最後才建立符合服務流程的對話邏輯與應答範本(步驟 1),因為話術設計依賴前述目標、真實資料的洞察與所選技術的能力邊界。故正確順序為 2 → 3 → 4 → 1。
【為何其他選項錯了?】
- (B):以蒐集資料為第一步,缺乏目標指引,無從判斷應蒐集何種資料與清理標準,容易造成資源浪費。
- (C):在資料與技術方案確定前先設計對話邏輯,話術缺乏真實資料佐證,也無法確認所選技術能否支撐,設計恐需重工。
- (D):先設計應答範本、再選技術,最後才定目標,順序完全顛倒;沒有目標與 KPI,前面所有工作都缺乏依據與驗收標準。
提示:專案類排序題的通則:目標與 KPI 最先,資料次之,技術選型第三,應用層設計最後。
某跨國電商企業導入生成式 AI,協助處理顧客服務請求,並根據顧客歷史訂單提供個人化建議。資安與法遵部門擔心 AI 在回覆時可能洩漏顧客個資,若要在導入初期優先避免觸法風險,下列哪一項措施最符合要求?
- A在加密環境下導入完整的顧客訂單與行為資料,並透過嚴格存取控管降低洩漏風險
- B實施資料最小化與去識別化,確保 AI 在訓練與生成過程中不直接處理或暴露敏感個資
- C強化模型的回覆審查流程,透過自動過濾與人工抽查結合,降低個資外洩的機率
- D設定 AI 的角色與回覆範圍,讓其專注於客服相關內容,避免回答其他敏感議題
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹要求「導入初期優先避免觸法風險」。資料最小化(Data Minimization)與去識別化是個資保護法規的核心原則:僅蒐集與處理必要範圍的資料,並將可識別個人的欄位移除或轉換,使 AI 在訓練與生成過程中根本不接觸可識別的敏感個資。從源頭消除個資暴露的可能性,是最符合法遵要求的預防性作法,故 (B) 正確。
【為何其他選項錯了?】
- (A):加密與存取控管屬必要的資安措施,但完整個資仍進入模型的處理範圍,模型輸出或遭受攻擊時仍可能暴露,未從源頭消除法遵風險。
- (C):回覆審查與人工抽查屬事後防線,前提是模型已處理並可能輸出個資;在「處理個資即有法遵風險」的法規架構下,事後過濾的保障弱於源頭控管。
- (D):限制角色與回覆範圍只能減少離題回答,無法阻止模型在客服情境內輸出其已接觸的個資,未解決根本問題。
提示:法遵題比較「源頭預防 vs 事後補救」:資料最小化與去識別化屬源頭手段,優先級最高。
在企業導入 MLOps 的過程中,除了模型部署與維運挑戰外,仍可能面臨其他推動上的困難。下列何者為 No Code 平台最能有效解決的挑戰?
- A自動化大量資料的標註與前處理,以降低數據準備成本
- B提升運算基礎設施的可擴展性,以因應大規模服務需求
- C透過可視化建模介面,降低技術門檻並促進跨部門協作
- D提供進階特徵工程能力,優化高維度數據的處理效率
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
No Code 平台的核心價值在於以可視化建模介面取代程式撰寫:使用者透過拖放元件與流程設定即可完成建模、訓練與部署,大幅降低技術門檻,使業務、產品等非技術部門能直接參與模型開發與驗證,促進跨部門協作。這正對應 MLOps 推動時常見的困難:資料科學人力有限、業務單位的需求難以快速落地,故 (C) 為 No Code 平台最能有效解決的挑戰。
【為何其他選項錯了?】
- (A):大量資料的標註與前處理仰賴專門的標註工具與資料工程流程,並非 No Code 平台的強項。
- (B):運算基礎設施的可擴展性由底層雲端平台與容器編排技術決定,No Code 平台本身不提供基礎設施的擴展能力。
- (D):進階特徵工程需要領域知識與程式彈性,No Code 平台提供的多為基礎自動化功能,難以優化高維度資料的處理效率。
提示:No Code 的關鍵詞是「可視化、低門檻、非技術人員可用」;涉及基礎設施、進階特徵工程的選項皆超出其定位。
某醫療機構導入生成式 AI 協助撰寫病歷摘要,在技術測試階段,為確保系統能安全應用於臨床,最應優先關注哪一項指標?
- A資料儲存與存取架構的完整性,確保長期運作過程中的數據可追溯性
- B生成內容的醫療準確性與臨床一致性,避免出現錯誤或誤導性資訊
- C模型在不同病例語境下的泛化能力,確保不因個別樣本而偏差
- D系統回應時間的穩定性,以支援醫療場域中可能的即時需求
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
醫療場域屬高風險應用,病歷摘要若出現錯誤或誤導性資訊,可能直接影響後續診療判斷,造成延誤治療、用藥錯誤等後果,並衍生醫療糾紛與法律責任。因此技術測試階段的首要驗證項目,是生成內容的醫療準確性與臨床一致性:內容必須忠於原始病歷並符合臨床邏輯,這是系統能否安全進入臨床的先決條件,其餘指標皆在此門檻之後。
【為何其他選項錯了?】
- (A):資料儲存架構與可追溯性屬長期維運與合規議題,固然重要,但在內容正確性尚未確立前,並非測試階段的優先重點。
- (C):泛化能力是模型成熟度指標,通常在基本準確性達標後才擴大測試範圍;準確性未過關前談泛化,順序顛倒。
- (D):回應時間影響使用體驗,但病歷摘要多屬事後整理情境,速度的優先級遠低於內容正確性;快速而錯誤的輸出在醫療場域不可接受。
提示:高風險領域(醫療、金融、法律)的測試題,優先順序固定:內容正確性與安全性最先,效能與體驗其後。
在即時客服系統的效能測試中,若針對延遲測試(Latency Testing)進行評估,下列哪一項指標最能反映系統是否符合用戶即時互動需求?
- AAI 模型在同一分鐘內可完成的回覆訊息數量
- B客戶從輸入問題到收到第一個完整回應所需的時間
- C客服系統能連續提供服務的運行時長
- DAI 產生回答時用詞的多樣性與表達創意程度
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
延遲(Latency)衡量的是單一請求從送出到獲得回應所經歷的時間。就即時客服而言,最能反映用戶互動體驗的指標,即是「客戶輸入問題後,到收到第一個完整回應所需的時間」,實務上常再細分為首個 token 出現時間(Time to First Token)與完整回應時間;此時間越短,越接近真人對話的即時感,故 (B) 正確。
【為何其他選項錯了?】
- (A):單位時間內可完成的回覆數量是吞吐量(Throughput)指標,衡量系統整體處理容量;吞吐量高不代表單一用戶的等待時間短,兩者為不同維度。
- (C):系統可連續運行的時長屬於可用性(Availability)或穩定性指標,與單次互動的回應速度無關。
- (D):用詞多樣性與表達創意屬於生成品質的評估,與延遲測試衡量的時間性能無關。
提示:效能指標三分法:延遲看單次等待時間,吞吐量看單位時間處理量,可用性看持續服務能力;題幹問延遲,選回應等待時間。
在評估 7B、13B、175B 等不同參數規模的語言模型時,模型規模對基準測試(Benchmark)結果的影響,下列說法何者最為恰當?
- A小模型在正確調整下能超越大模型,因此模型大小並不重要
- B大模型在多數情境下表現較好,但在特定任務上略遜於小模型
- C模型規模與基準測試結果完全無關,影響主要來自測試設計
- D模型越大,Benchmark 結果可能提升,但幅度取決於訓練數據品質與資源配置
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題幹比較 7B、13B、175B 等不同參數規模對基準測試(Benchmark)結果的影響。依縮放定律(Scaling Law)的實證結果,在資料與運算資源配置得當的前提下,模型規模擴大通常伴隨基準分數提升;但提升幅度並非由參數量單獨決定,訓練資料的品質與數量、運算資源與參數量的配比(如 Chinchilla 研究所示的最適配置)都會影響最終表現。資料品質不佳或資源配置失衡時,較大的模型未必勝過訓練充分的較小模型。(D) 同時涵蓋「規模可能帶來提升」與「幅度取決於資料品質與資源配置」兩層條件,是最恰當的敘述。
【為何其他選項錯了?】
- (A):小模型經良好調校後,僅在少數特定任務可能接近或超越大模型,屬於特例;在 MMLU、HumanEval 等多數通用基準上,大模型仍具明顯優勢,不能據此推論「模型大小不重要」。
- (B):此敘述把「特定任務略遜於小模型」當成普遍現象,實際上多發生於少數垂直領域;且它未指出影響幅度的關鍵變數(資料品質與資源配置),完整性不如 (D)。
- (C):「完全無關」與縮放定律的大量實證結果矛盾;模型規模與基準表現具明確正相關,測試設計並非影響結果的主要來源。
提示:題幹問「最為恰當」,應選同時承認規模效應、又指出資料品質與資源配置為關鍵變數的完整敘述。
下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專門用於數學推理或中文專業知識?
- AMMLU
- BGSM8K
- CMATH
- DC-Eval
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題幹要求「多領域、多任務語言理解」,且明確排除「專門用於數學推理」與「中文專業知識」兩類基準。MMLU(Massive Multitask Language Understanding)涵蓋 57 個科目,橫跨人文(歷史、哲學)、科學(物理、化學)、社會科學(經濟學、心理學)與專業領域(法律、醫學),以選擇題形式測驗模型的跨領域知識與理解能力,正符合題幹描述,故 (A) 正確。
【為何其他選項錯了?】
- (B):GSM8K(Grade School Math 8K)由約八千題小學程度數學應用題組成,專門評測多步驟數學推理,不涉及人文與社會科學領域。
- (C):MATH 資料集收錄競賽等級的數學問題,涵蓋代數、幾何、機率等主題,同樣是專測數學推理的基準,與多領域語言理解無關。
- (D):C-Eval 是以中文命題的綜合評測基準,取材自中學至專業等級的考試科目,重點在中文情境下的專業知識,正是題幹排除的類型。
提示:抓住題幹的排除條件:GSM8K 與 MATH 專測數學,C-Eval 專測中文知識,多領域語言理解對應 MMLU。
某智慧工廠導入生成式 AI 協助工程師產生維修指引與操作建議。下列哪一項並非在系統設計中加入 Guardrails(防護機制)的主要目的?
- A檢查工程師輸入內容,避免觸發錯誤或危險需求
- B過濾與驗證 AI 輸出的維修指引,確保符合安全標準
- C確保生成的操作建議符合法規與產業安全規範
- D完整重建並追蹤 AI 模型的全部推理過程
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
Guardrails(防護機制)的功能定位,是在生成式 AI 系統的輸入與輸出兩端設置安全檢查點:在輸入端過濾危險或不當的請求,在輸出端驗證內容是否符合安全標準與法規要求,避免系統產生有害或違規的建議。在智慧工廠這類高風險情境中,(A)(B)(C) 分別對應輸入檢查、輸出過濾與合規確保,都是 Guardrails 的主要目的。至於「完整重建並追蹤模型的全部推理過程」屬於可追蹤性(Traceability)與可觀測性範疇,通常由日誌記錄、監控與 MLOps 工具實作,並非 Guardrails 的設計目標,故 (D) 為正確答案。
【為何其他選項錯了?】
- (A):檢查使用者輸入、攔截錯誤或危險的需求,是 Guardrails 在輸入端的核心功能,屬於其主要目的。
- (B):過濾與驗證模型輸出,確保維修指引符合安全標準,是 Guardrails 在輸出端的核心功能,屬於其主要目的。
- (C):確保生成建議符合法規與產業安全規範,是 Guardrails 在合規面向的典型功能,屬於其主要目的。
提示:題幹問「並非主要目的」;Guardrails 負責輸入輸出的安全把關,推理過程的完整追蹤屬於可觀測性與 MLOps 的工作。
小明想開發一個部落格寫作工具,讓用戶輸入文章開頭後,系統自動續寫內容,例如輸入「今天去了台北木柵動物園...」,系統就能續寫。若要實現這樣的功能,最適合選擇哪一類任務?
- A序列到序列建模(Sequence-to-Sequence Modeling),透過輸入序列產生新的輸出序列
- B遮罩語言建模(Masked Language Modeling),補齊文字中缺失的詞語或片段
- C生成式語言建模(Text Generation),依據上下文持續產生新的內容
- D文本分類(Text Classification),針對輸入文本判斷情感、主題或標籤
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹需求是「輸入文章開頭,系統自動續寫後文」,屬於開放式的文字接續任務。生成式語言建模(Text Generation)以自迴歸方式運作:模型依據既有上下文逐一預測下一個 token,並將新生成的內容併入上下文繼續生成,因此能從「今天去了台北木柵動物園」這樣的開頭,持續產出語意連貫的後續段落。現代文章續寫與寫作輔助工具即以此類自迴歸語言模型為核心,故 (C) 最符合需求。
【為何其他選項錯了?】
- (A):序列到序列建模適合「完整輸入對應完整輸出」的轉換任務,如機器翻譯與摘要;題幹要的是依開頭不斷延伸的開放式續寫,任務型態不同。
- (B):遮罩語言建模是在文句中挖空後預測缺漏詞語,屬於 BERT 類模型的預訓練目標,適合完形填空式的補齊,無法持續產生長篇後續內容。
- (D):文本分類是判斷輸入文字的情感、主題或標籤,輸出為類別而非新文字,與續寫需求完全不同。
提示:「給開頭、往下寫」對應自迴歸文字生成;翻譯與摘要屬 Seq2Seq,補齊缺漏詞屬遮罩語言建模,判斷情感主題屬文本分類。
某國際銀行導入生成式 AI,用於彙整不同國家金融監管機構的合規規範,建立跨國合規知識庫。由於各國條文表述方式不同,且監管要求具有高度專業性與隱含邏輯,若要確保知識庫在後續查詢與生成報告時能維持正確性與一致性,下列哪一項 AI 能力最為關鍵?
- A具備跨語言專業術語對齊與條文語意抽取能力,能正確辨識不同國家規範間的對應與差異
- B能自動最佳化文件檢索效率,縮短跨國法規查詢的延遲時間,提升合規部門使用體驗
- C能將合規文件轉換為多種輸出形式(如簡報、摘要或法規清單),以符合不同決策層級需求
- D具備根據歷史案例生成合規解釋的能力,協助新進員工快速理解法規在實務上的應用
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題幹條件有三:各國條文表述方式不同、監管要求具高度專業性與隱含邏輯、知識庫在查詢與生成報告時須維持正確性與一致性。跨國合規的同一概念常以不同語言與術語呈現,例如洗錢防制在美國、歐盟、新加坡與台灣各有不同的法規名稱與架構,客戶盡職調查(CDD)等要求的定義範圍與門檻也因法域而異。若 AI 不具備跨語言專業術語對齊與條文語意抽取能力,就無法正確辨識各國規範間的對應與差異,後續的查詢與報告會建立在錯誤的知識基礎上,甚至把某一法域的標準誤套到另一法域。因此 (A) 是維持知識庫正確性與一致性的最關鍵能力。
【為何其他選項錯了?】
- (B):檢索效率影響使用體驗,但題幹的核心風險是內容錯誤或不一致;若術語對應錯誤,檢索再快也只是更快取得錯誤結果,速度屬加分項而非關鍵能力。
- (C):多形式輸出屬於呈現層能力;底層條文對應若錯誤,轉成簡報或摘要仍是錯誤內容,無法解決正確性與一致性問題。
- (D):案例式合規解釋是進階應用,其品質完全依賴知識庫本身的正確性;術語與語意對應未先做好,生成的解釋反而會放大錯誤。
提示:題幹關鍵詞是「表述方式不同」與「正確性與一致性」,直接對應跨語言術語對齊與語意抽取;效率、輸出形式、案例應用都是其後的加值能力。
某零售企業在建置機器學習模型預測顧客購買機率時, 資料同時包含大量稀疏類 別特徵與數值型特徵。 團隊希望模型既能學習過去已出現的特徵組合規律,也能 對未出現的特徵組合做出合理預測。下列哪一種模型架構最適合此類需求?
- A線性迴歸(Linear Regression)
- B決策樹(Decision Tree)
- C支援向量機(Support Vector Machine, SVM)
- D寬深模型(Wide and Deep)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題幹有兩項需求:一是學習「過去已出現的特徵組合規律」,即記憶(Memorization)能力;二是對「未出現的特徵組合」做出合理預測,即泛化(Generalization)能力。寬深模型(Wide and Deep)正是為同時滿足這兩種需求而設計:Wide 部分以線性模型搭配特徵交叉,直接記憶已出現的共現規律;Deep 部分以深度神經網路將稀疏類別特徵嵌入低維向量學習抽象表徵,對未見過的特徵組合仍能合理推估。此架構亦適合同時處理大量稀疏類別特徵與數值型特徵,故 (D) 最符合題幹需求。
【名詞白話語典】
- 寬深模型(Wide and Deep):由 Google 提出的混合模型架構,Wide 部分(線性模型)負責記憶已見過的特徵組合,Deep 部分(深度神經網路)負責泛化到未見過的組合,常用於推薦系統與點擊率預測。
【為何其他選項錯了?】
- (A):線性迴歸只能學習特徵與目標間的線性關係,除非人工建構交叉特徵,否則難以捕捉組合規律,對未見組合的泛化能力也有限。
- (B):決策樹依訓練資料切分規則,擅長記憶既有模式,但對訓練中未出現的特徵組合缺乏平滑的推估能力,泛化表現較弱。
- (C):支援向量機是通用分類器,面對大量高維稀疏類別特徵時,特徵工程與運算負擔大,也沒有針對「記憶與泛化並重」需求的專門設計。
提示:題幹同時出現「已出現組合的規律」與「未出現組合的預測」,即記憶與泛化並重,對應 Wide and Deep 架構。
某企業導入生成式 AI (Generative AI)系統自動產出會議摘要,並規劃額外建置 一套AI 系統,用於評估摘要內容的正確性與完整性。下列何者為此 AI 系統的核 心目標?
- A自動新增專業名詞與技術指標
- B判斷摘要是否遺漏關鍵資訊或出現語意錯誤
- C調整語音轉文字結果
- D自動標註摘要的關鍵字與主題標籤
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹規劃的第二套 AI 系統,定位是「評估摘要內容的正確性與完整性」。完整性對應「是否遺漏原文的關鍵資訊」,正確性對應「是否出現扭曲原意的語意錯誤」,因此該系統的核心目標就是判斷摘要有無遺漏關鍵資訊或語意錯誤,(B) 直接對應題幹的兩項評估面向。這種以另一套 AI 檢核生成內容品質的設計,是生成式 AI 品質保證的常見做法。
【為何其他選項錯了?】
- (A):自動新增專業名詞與技術指標屬於內容擴寫或潤飾功能,會改動摘要本身,而非評估既有摘要的品質。
- (C):調整語音轉文字結果屬於語音辨識(ASR)階段的修正工作,與摘要品質評估是不同階段的任務。
- (D):自動標註關鍵字與主題標籤屬於關鍵詞擷取,可作為評估流程的輔助環節,但其本身不是「判斷正確性與完整性」的核心目標。
提示:題幹關鍵詞是「評估正確性與完整性」,對應「遺漏關鍵資訊」與「語意錯誤」的檢查;擴寫、轉寫、標註都不是評估。
ChatGPT、Gemini 等對話型生成式 AI 工具所依據的基礎模型技術,下列何者正 確?
- A決策樹(Decision Tree)
- B大型語言模型(Large Language Model, LLM)
- C生成對抗網路(Generative Adversarial Network, GAN)
- D圖卷積網路(Graph Convolutional Network, GCN)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
ChatGPT、Gemini 等對話型生成式 AI 的基礎技術是大型語言模型(Large Language Model, LLM)。這類模型以 Transformer 架構為骨幹,在大規模文本語料上進行預訓練,學習語言規律、事實知識與推理模式,再經指令微調與對齊訓練後,能執行對話、摘要、翻譯、寫作等多種自然語言任務,故 (B) 正確。
【名詞白話語典】
- 大型語言模型(Large Language Model, LLM):在巨量文本上訓練、參數規模龐大的語言模型,是目前自然語言處理領域的主流技術,對話型生成式 AI 皆以其為核心。
【為何其他選項錯了?】
- (A):決策樹是傳統機器學習模型,以樹狀規則進行分類或迴歸決策,不具備理解與生成流暢自然語言的能力。
- (C):生成對抗網路(GAN)以生成器與判別器對抗訓練,主要應用於影像等內容生成,並非對話型語言模型的基礎架構。
- (D):圖卷積網路(GCN)專門處理圖結構資料,如社群網路與分子結構,與長文本語言建模的任務型態不同。
提示:對話型生成式 AI 的技術基礎對應 LLM;決策樹是傳統分類模型,GAN 主攻影像生成,GCN 處理圖資料。
某企業導入大型語言模型作為客服助理。模型已具備穩定語言能力,但在回覆偏 好一致性與組織規範遵循方面仍需優化,團隊因此規劃導入人類反饋強化學習 (RLHF)流程,下列何者最不屬於 RLHF 階段的典型技術活動?
- A透過人工評估方式建立偏好資料,使模型的不同候選輸出可反映人類主觀品質 差異
- B訓練一個能依據人類偏好判斷輸出品質的模型,作為模型優化過程中的回饋依 據
- C依據品質評估結果,調整模型生成策略,使其輸出更符合偏好導向的行為表 現
- D以未標註語料為主進行長週期表示學習訓練,以提升模型基礎語言建模能力
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習)是在已完成預訓練的模型上進行的對齊(Alignment)流程,典型包含三個階段:先由人工對模型的多個候選輸出進行排序或評分,建立偏好資料;再以偏好資料訓練獎勵模型(Reward Model),使其能為任意輸出評定品質分數;最後以強化學習演算法(如 PPO)依獎勵訊號調整模型的生成策略,使輸出更符合人類偏好。選項 (D) 所述「以未標註語料進行長週期表示學習」是預訓練(Pre-training)階段的工作,目的在建立基礎語言建模能力,發生於 RLHF 之前,不屬於 RLHF 的典型技術活動,故為正確答案。
【為何其他選項錯了?】
- (A):以人工評估建立偏好資料,使候選輸出反映人類品質判斷,是 RLHF 第一階段的標準活動。
- (B):訓練能依人類偏好判斷輸出品質的獎勵模型,是 RLHF 第二階段的核心工作。
- (C):依品質評估結果調整模型生成策略,使行為符合偏好導向,正是 RLHF 第三階段強化學習微調的內容。
提示:題幹問「最不屬於」;RLHF 三部曲為偏好資料、獎勵模型、策略優化,無標註大語料的預訓練屬於更前期的階段。
在大型語言模型(LLM)的效能優化中,Flash Attention 常被用來改善 Transformer 注意力機制的運算效率。關於 Flash Attention 的主要效益,下列敘述何者最正確?
- A透過忽略影響較小的注意力權重,減少模型需要計算的關聯數量,以降低運算 成本
- B透過調整注意力計算與資料處理方式,減少中間結果的儲存需求,進而改善速 度與資源使用效率
- C透過增加注意力計算的並行程度,使模型可同時處理更多注意力頭部
- D透過將注意力結果暫存於高速快取記憶體,以避免重複計算造成延遲
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
標準注意力機制需先算出完整的注意力分數矩陣並寫入 GPU 高頻寬記憶體(HBM),序列越長,矩陣規模呈平方成長,HBM 的大量讀寫成為效能瓶頸。Flash Attention 透過分塊(Tiling)與重排計算順序,將注意力計算拆成小區塊,逐塊載入速度更快的晶片內 SRAM 完成運算,全程不需在 HBM 中生成與儲存巨大的中間注意力矩陣,大幅減少記憶體讀寫量,同時改善速度與記憶體使用效率。其結果與標準注意力數學等價,屬於精確注意力的效率優化,(B) 的描述最符合。
【為何其他選項錯了?】
- (A):忽略影響較小的注意力權重是稀疏注意力(Sparse Attention)的思路,屬於近似方法;Flash Attention 不省略任何權重計算,結果與標準注意力一致。
- (C):Flash Attention 的核心貢獻在優化記憶體存取模式,而非增加注意力頭的並行數量;多頭並行是 Transformer 原本就有的設計。
- (D):其關鍵是重排計算以「避免產生」巨大的中間矩陣,而不是把注意力結果暫存於快取以避免重複計算。
提示:Flash Attention 的關鍵詞是「減少中間結果儲存、降低 HBM 讀寫」;看到「忽略部分權重」應想到稀疏注意力,兩者思路不同。
某企業導入生成式AI系統,希望自動產出客服回覆與內部文件摘要。系統需能理解使用者輸入的完整語句內容,並在回覆中維持語意連貫,即使對話內容較長仍能保持上下文一致性。基於上述需求,下列何種模型架構最為適合?
- A卷積神經網路(Convolutional Neural Network, CNN)
- B遞迴神經網路(Recurrent Neural Network, RNN)
- C基於 Transformer 架構的自迴歸模型(Autoregressive Model)
- D生成對抗網路(Generative Adversarial Network, GAN)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹需求為理解完整語句、生成語意連貫的回覆,且在較長對話中維持上下文一致性。基於 Transformer 的自迴歸模型正對應這些條件:自注意力機制(Self-Attention)讓模型處理每個 token 時同時關注序列中所有位置,能有效捕捉長距離依賴,維持長對話的上下文一致;自迴歸生成則逐 token 產生文字,每一步都以完整前文為條件,確保輸出語意連貫。GPT 系列等主流生成式模型即採此架構,故 (C) 最適合。
【為何其他選項錯了?】
- (A):CNN 以局部卷積核擷取特徵,主要應用於影像處理;雖可用於部分文字任務,但不擅長捕捉長序列的全域語意依賴。
- (B):RNN 依序處理序列,存在長期依賴問題,距離較遠的前文資訊容易流失,長對話的上下文一致性表現不如 Transformer。
- (D):GAN 以生成器與判別器對抗訓練,主要用於影像生成;在離散文字上訓練不穩定,並非語言生成任務的主流架構。
提示:「長上下文一致+連貫生成」指向 Transformer 自迴歸模型;RNN 受限於長期依賴,CNN 與 GAN 的主場在影像。
在生成式 AI文字生成模型設計中,Encoder–Decoder 與 Decoder-only 為常見架構。下列何者最能正確說明兩者在資訊處理與生成機制上的核心差異?
- AEncoder-Decoder 透過編碼與解碼階段處理序列,Decoder-only 則以單一模型完成處理
- BEncoder-Decoder 區分輸入理解與內容生成階段,Decoder-only 以單一模型同時處理上下文與生成
- CDecoder-only 架構主要依賴外部知識檢索,Encoder-Decoder 則不需要
- DEncoder-Decoder 架構僅適用於翻譯任務,Decoder-only 架構較適合對話任務
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
兩種架構的核心差異在資訊處理與生成的分工方式。Encoder-Decoder 將流程明確分成兩階段:編碼器先完整讀取輸入序列並轉換為語意表徵,解碼器再依據該表徵逐步生成輸出,「輸入理解」與「內容生成」由不同模組負責,典型如 T5 與傳統機器翻譯模型。Decoder-only 則沒有獨立編碼器,以單一模型同時承擔兩種角色:將輸入與已生成內容視為同一段連續上下文,生成每個新 token 時回看全部前文,如 GPT 系列。(B) 準確描述「理解與生成分階段」對比「單一模型同時處理上下文與生成」的機制差異。
【為何其他選項錯了?】
- (A):敘述停留在模組組成的表面差異,且 Encoder-Decoder 本身也是單一端到端訓練的模型;它未說明兩者在輸入理解與內容生成上的分工機制,精確度不如 (B)。
- (C):是否搭配外部知識檢索(如 RAG)是系統層的設計選擇,兩種架構都可以搭配檢索,與底層架構差異無關。
- (D):應用場景並非如此劃分;Encoder-Decoder 也能用於對話與摘要,Decoder-only 同樣能執行翻譯,不能以任務類型界定兩者本質。
提示:考架構差異抓「機制」而非「用途」;Encoder-Decoder 是理解與生成分階段,Decoder-only 是同一模型邊看上下文邊生成。
關於 ChatGPT、Anthropic Claude、GitHub Copilot 等 AI 程式碼輔助工具的運作原理,下列敘述何者正確?
- A這些工具基於大型語言模型,經由大量程式碼與文本訓練,透過預測下一個符號來生成程式碼,但不保證產生程式碼的正確性
- BGitHub Copilot 會在提供程式碼建議前執行並驗證該程式碼,確保其執行結果正確無誤
- CAnthropic Claude 的程式碼建議並非即時生成,而是從事先整理的已知解答資料庫中檢索而得
- DChatGPT 內建完整的編譯器,可在輸出程式碼前自動編譯並更正所有語法與邏輯錯誤
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
ChatGPT、Claude、GitHub Copilot 等工具的共同基礎是大型語言模型:在大量程式碼與自然語言文本上訓練,以自迴歸方式依據上下文預測下一個 token 來生成程式碼。由於本質是機率性的序列預測,而非對程式邏輯的執行或形式驗證,生成的程式碼可能含有語法錯誤、邏輯缺陷或安全漏洞,正確性必須由開發者自行編譯、測試與審查,故 (A) 的描述正確。
【為何其他選項錯了?】
- (B):GitHub Copilot 提供建議前不會實際執行或驗證程式碼,它只是依上下文即時生成候選片段;驗證與測試仍是開發者的責任。
- (C):Claude 的程式碼建議由模型即時生成,並非從事先整理的解答資料庫中檢索;檢索式系統與生成式模型是不同的技術路線。
- (D):ChatGPT 並未內建編譯器,無法在輸出前自動編譯並修正所有語法與邏輯錯誤;其輸出仍可能無法通過編譯。
提示:AI 程式碼助理的通則是「機率預測生成、不保證正確」;出現「先執行驗證」「內建編譯器」「資料庫檢索解答」等敘述即與原理不符。
某新創公司採用 MVP (Minimum Viable Product)策略,導入 Vibe Coding 以加速開發,雖然初期能快速產出可運作功能,但技術主管提醒,在正式上線前仍可能存在程式碼品質與安全風險。下列哪一項措施最合理,以降低品質與安全問題?
- A直接沿用 AI 生成程式碼至正式環境,以降低開發成本
- B持續優化提示詞,即可避免大部分品質問題
- C將生成程式碼納入審查、重構與安全測試流程
- D限制開發者修改 AI 生成之程式碼架構,以維持一致性
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹情境是以 Vibe Coding 快速產出 MVP,但技術主管指出正式上線前仍有程式碼品質與安全風險。AI 生成的程式碼應視為初稿:可能存在缺陷、效能問題、安全漏洞或不符團隊規範之處。最合理的措施是將生成程式碼納入標準軟體開發流程,經程式碼審查(Code Review)、重構(Refactoring)與安全測試(如靜態掃描、弱點檢測)後再部署,兼顧開發速度與上線品質,故 (C) 正確。
【為何其他選項錯了?】
- (A):未經審查與測試就將 AI 生成程式碼投入正式環境,等於直接承擔潛在缺陷與漏洞的風險,節省的開發成本遠低於事故代價。
- (B):優化提示詞可提升生成品質,但作用在生成端,無法保證輸出正確與安全,不能取代審查與測試等驗證機制。
- (D):AI 產出的架構未必合理,限制開發者修改會阻礙缺陷修復與最佳化;一致性應靠編碼規範與審查達成,而非凍結程式碼。
提示:AI 生成程式碼的治理原則是「生成可以快,驗證不可省」;答案通常落在納入審查、重構與測試流程的選項。
在規劃生成式 AI 解決方案時,下列何種應用場景最適合採用 GPT-Realtime 類型模型?
- A需長時間批次處理的大規模報表生成任務
- B即時資料查詢與結構化資訊檢索系統
- C即時語音客服與互動式 AI 代理
- D以高一致性為優先的法規文件自動摘要
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
GPT-Realtime 類型模型的設計核心是低延遲(Low Latency)的即時互動,能在極短時間內回應使用者輸入,常用於語音對話等需要即時往返的場景。即時語音客服與互動式 AI 代理正是對回應延遲最敏感的應用:使用者說完話後,期望系統近乎即時接話,明顯停頓會嚴重破壞對話流暢感與使用體驗,故 (C) 是最適合採用此類模型的場景。
【為何其他選項錯了?】
- (A):大規模批次報表生成對延遲不敏感,重點在總處理量與單位成本,適合以離線批次或非即時模型處理,採用即時模型不符成本效益。
- (B):結構化資訊檢索可由資料庫查詢或搜尋引擎高效完成,重點在檢索正確性,並非低延遲生成式模型的主要價值所在。
- (D):法規文件摘要以正確性與一致性為優先,而非回應速度,適合採用能力更強的通用大型模型,延遲較高亦可接受。
提示:Realtime 的定位是低延遲即時互動;批次任務看吞吐量,檢索任務看查詢技術,合規文件看正確性,皆非即時模型的主場。
關於 2025 年 OpenAI 提供的 AgentKit,下列何者最能描述其主要用途?
- A建立強化式學習(Reinforcement Learning)訓練所需的互動式模擬環境
- B提供代理(Agent)模型的大規模預訓練與權重優化機制
- C「Agent-to-Agent」的代理通訊協議
- D支援 Agents 的建構、工具整合與任務流程開發
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
AgentKit 是 OpenAI 於 2025 年推出的 AI 代理開發工具組,定位是降低代理(Agent)應用的開發門檻:提供以視覺化方式編排代理任務流程的能力,支援外部工具與資料來源的整合串接,並涵蓋代理應用的評估與迭代。換言之,它服務的是「代理的建構、工具整合與任務流程開發」這一應用開發層需求,故 (D) 最能描述其主要用途。
【為何其他選項錯了?】
- (A):建立強化學習所需的互動式模擬環境,是 Gymnasium 等 RL 環境框架的功能;AgentKit 不是訓練用的模擬環境。
- (B):AgentKit 不提供基礎模型的大規模預訓練或權重優化;模型訓練屬於基礎模型層,AgentKit 作用在其上的應用開發層。
- (C):「Agent-to-Agent」代理間通訊協議是另一類互通標準的定位,並非 AgentKit 的主要用途。
提示:AgentKit 定位在「開發代理應用」;看到預訓練、RL 模擬環境、代理通訊協議等描述即可排除。
某市政府交通局計劃導入生成式 AI 技術來自動生成公車到站時間預測的文字報告,每日需處理約50萬筆交通資料並生成 1000 份報告。在評估導入成本時,團隊希望進行 Token Economics 分析(指模型推理與生成過程中,Token 使用量及其費用)。下列何者不屬於 Token Economics 的考量範圍?
- A每次 API 呼叫所需的輸入 Token 數量
- B生成報告內容所消耗的輸出 Token 費用
- CAI 模型訓練階段使用 Token 數量所需的 GPU 記憶體成本
- D模型推理過程中的 Token 使用量統計
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹將 Token Economics 定義為「模型推理與生成過程中,Token 使用量及其費用」的分析,範圍限定在推論(Inference)階段。主流 LLM API 以輸入與輸出 Token 數量計費,因此每次呼叫的輸入 Token 數、生成報告消耗的輸出 Token 費用,以及推理過程的 Token 用量統計,都是估算每日 50 萬筆資料、1,000 份報告營運成本的核心項目。選項 (C) 的「模型訓練階段的 GPU 記憶體成本」屬於模型開發期的訓練成本,與推論階段的 Token 計費是兩本不同的帳,不在 Token Economics 的考量範圍,故為正確答案。
【為何其他選項錯了?】
- (A):輸入 Token 數直接決定每次 API 呼叫的計費基礎,是 Token Economics 的核心考量。
- (B):輸出 Token 通常單價較輸入更高,生成報告的輸出量是推論成本的主要組成,屬於考量範圍。
- (D):統計推理過程的 Token 使用量,是估算與優化整體費用的必要工作,屬於考量範圍。
提示:題幹問「不屬於」;Token Economics 只計推論階段的輸入與輸出 Token 費用,訓練階段的硬體成本是另一個成本科目。
某企業導入大型語言模型(LLM)進行客服自動化,並已透過 Fine-Tuning 學習企業標準問答範例,但在實務運作中仍出現回應策略未符合服務優先順序及語氣與品牌風格不一致的情況,因此技術團隊建議再導入 Reinforcement Fine-tuning(RFT)機制進行優化,其主要目的為何?
- A擴展模型的知識涵蓋範圍與資料記憶能力
- B透過 reward 訊號調整模型回應策略與行為偏好
- C提升模型推論速度與降低回應延遲
- D降低 prompt 設計複雜度並取代訓練流程
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹指出模型已完成 Fine-Tuning、具備標準問答知識,但「回應策略未符服務優先順序」與「語氣與品牌風格不一致」,問題出在行為與偏好層面。Reinforcement Fine-tuning(RFT)的做法是定義獎勵(reward)訊號:當回應符合期望行為(如優先處理緊急案件、語氣符合品牌風格)時給予較高獎勵,再以強化學習更新模型,使生成策略朝高獎勵方向調整。因此 RFT 的主要目的是透過 reward 訊號調整模型的回應策略與行為偏好,(B) 正確。
【為何其他選項錯了?】
- (A):擴充知識涵蓋範圍與資料記憶,主要靠監督式微調或以 RAG 引入外部資料;RFT 針對的是行為偏好,不是知識注入。
- (C):RFT 改變的是輸出行為,不會提升推論速度或降低延遲;延遲優化屬於模型量化、蒸餾與服務架構層面的工作。
- (D):RFT 是訓練後的行為對齊手段,無法取代訓練流程,也不是為了降低 prompt 設計複雜度而存在。
提示:「知識不足」找 SFT 或 RAG,「行為與偏好不對」找 RFT;reward 訊號是辨識強化式微調的關鍵詞。
某智慧製造廠導入語音互動 AI 助理,作業人員可透過語音查詢設備狀態與操作指引。系統流程包含語音轉文字、語言模型生成回覆,以及即時查詢內部系統資料。測試結果顯示:語音轉文字在專業設備術語上錯誤率偏高;語言模型回覆偶有內容不夠精準;系統整體回應速度略慢但仍在可接受範圍。若專案目標為優先確保正確執行指令,下列改進措施的執行順序何者最合理?
- A優化語言模型 → 強化語音模型 → 優化系統效能 → 調整生成參數
- B強化語音模型 → 優化語言模型與知識補充 → 調整生成參數 → 優化系統效能
- C優化系統效能 → 強化語音模型 → 優化語言模型與知識補充 → 調整生成參數
- D強化語音模型 → 優化系統效能 → 優化語言模型與知識補充 → 調整生成參數
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
專案目標是「優先確保正確執行指令」,改進順序應沿資訊流從源頭往下修正。系統管線為語音轉文字、語言模型生成、查詢內部資料:第一段 ASR 在專業設備術語上錯誤率偏高,轉出的文字若錯,後續所有處理都建立在錯誤輸入上,必須最優先強化語音模型;其次優化語言模型並補充領域知識(如以 RAG 引入設備操作手冊),解決回覆不夠精準的問題;再調整生成參數(如溫度)收斂輸出的穩定性;最後才優化系統效能,因為題幹明言回應速度「仍在可接受範圍」,其優先級最低。此順序即 (B)。
【為何其他選項錯了?】
- (A):將優化語言模型排在強化語音模型之前;輸入文字尚未修正,語言模型再強也是基於錯誤輸入運作,違反「先修源頭」原則。
- (C):把系統效能放在第一位;速度尚在可接受範圍,不是正確性瓶頸,最不應優先處理。
- (D):語音模型優先正確,但第二步即優化系統效能,把直接影響正確性的語言模型與知識補強往後排,與「優先確保正確」的目標不符。
提示:管線式 AI 系統的除錯順序先看資料流源頭;正確性優先於速度,速度「可接受」時效能優化一律殿後。
某AI 研究團隊採用GRPO(Group Relative Policy Optimization)作為一種基於強化學習的模型優化方法,用於提升大型語言模型的表現。請問GRPO 最適合用來強化模型在哪一類任務上的表現?
- A判斷客服留言的情緒傾向,將每則訊息快速歸類為正面、負面或中性;
- B將客服電話錄音即時轉換為文字,供後續人工審閱使用;
- C針對數學應用題或邏輯謎題,逐步推導出正確解答;
- D分析商品圖片的外觀特徵,自動辨識類別與品項
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
GRPO(Group Relative Policy Optimization)是一種強化學習式的模型優化方法:針對同一問題讓模型產生一組候選解答,以組內相對評分估計優勢並更新策略,不需另外訓練價值模型。這類方法最典型的應用,是提升大型語言模型在數學與邏輯問題上的逐步推導品質,例如 DeepSeek 系列即以 GRPO 強化數學推理能力。數學應用題與邏輯謎題有明確可驗證的對錯,適合作為獎勵訊號來源,故 (C) 是 GRPO 最適合強化的任務類型。
【為何其他選項錯了?】
- (A):情緒傾向分類屬於一般監督式分類任務,以標註資料訓練即可,不是以強化學習改善逐步推理的典型場景。
- (B):語音轉文字屬於語音辨識任務,核心在聲學與語言轉換品質,與強化逐步推導能力無關。
- (D):商品圖片辨識屬於電腦視覺分類任務,同樣以監督式學習為主,不是 GRPO 在大型語言模型上的典型應用。
提示:GRPO 與數學、邏輯、逐步推理連在一起記;分類與辨識任務走監督式學習即可。
小明在2025 年使用AI 模型,將自己的照片轉換為公仔風格影像。該模型在維持生成品質的同時,也能在模型規模較大的情況下兼顧運算效率。下列何者最能敘述此模型可能採用的設計方式?
- A基於單一稠密Transformer 架構,每次運算都使用全部模型參數;
- B採用稀疏專家混合(Sparse Mixture-of-Experts)架構,每次僅使用部分模型來提升效率;
- C採用生成對抗網路(GAN),透過兩個模型互相比較來提升影像品質;
- D採用卷積神經網路(CNN),直接進行影像轉換
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹關鍵條件是「模型規模較大」與「兼顧運算效率」並存。稀疏專家混合(Sparse Mixture-of-Experts, MoE)架構將模型組織為多個專家子網路,推理時由路由機制依輸入僅啟用少數專家,因此模型總參數量可以很大(容量高、生成品質好),但單次推理只動用部分參數,計算成本明顯低於同規模的稠密模型,正符合「規模大仍有效率」的描述,故 (B) 正確。
【為何其他選項錯了?】
- (A):稠密 Transformer 每次推理使用全部參數,規模越大單次運算成本越高,無法解釋題幹「規模大仍兼顧效率」的特性。
- (C):GAN 以生成器與判別器對抗訓練提升影像品質,但不涉及「每次僅啟用部分參數」的效率設計,未回應題幹的核心條件。
- (D):CNN 可執行影像處理與轉換,但同樣是每次使用全部參數的稠密架構,無法說明大規模模型下的稀疏啟用效率。
提示:「模型很大、每次只用一部分」是稀疏 MoE 的標準敘述;稠密架構每次全參數參與運算。
某大型語言模型(LLM)在訓練過程中,研究人員發現模型在生成文本時,長期集中產生少數幾種相似的回應形式,缺乏多樣性。下列何者最能說明此現象及其可能原因?
- A過度擬合(Overfitting);
- B模式崩潰(Mode Collapse);
- C梯度消失(Vanishing Gradient);
- D模型收斂速度(Convergence Rate)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹現象是模型長期集中產生少數幾種相似的回應形式、缺乏多樣性,這正是模式崩潰(Mode Collapse)的定義:生成模型的輸出塌縮到資料分布中的少數模式,無法覆蓋應有的多樣性。此術語源自 GAN 的訓練問題;語言模型生成內容單一化、反覆落入相同句式時,同樣以此概念描述,故 (B) 正確。
【為何其他選項錯了?】
- (A):過度擬合指模型過度貼合訓練資料而泛化能力下降,判斷重點是訓練與測試表現的落差,並非專指輸出形式單一的現象。
- (C):梯度消失是深層網路反向傳播時梯度逐層縮小、導致前層難以更新的訓練問題,與輸出多樣性不足沒有直接對應。
- (D):收斂速度描述訓練損失下降的快慢,是訓練效率指標,不用來說明生成內容集中於少數形式。
提示:「輸出集中在少數相似形式、缺乏多樣性」即模式崩潰;過擬合看泛化落差,梯度消失看訓練更新,收斂速度看訓練快慢。
某保險公司導入具備延伸推理(Extended Thinking)功能的推理型語言模型,用於處理理賠申請的合規審查。審查團隊發現:簡單案件只需快速比對幾項條款,但複雜案件需要多層次的法規詮釋與過往案例比對。產品負責人希望系統能依案件複雜度自動調整模型的推理深度,以在品質與成本之間取得最佳平衡。此需求最核心涉及的系統設計概念是什麼?
- A針對不同案件調整模型的溫度參數(Temperature),以控制回應的隨機性與多樣性;
- B針對複雜案件改用參數規模更大的模型版本,以確保推理品質;
- C依案件複雜度動態設定模型在推理過程中可使用的最大思考資源上限(如Token 預算),以平衡推理深度與成本效率;
- D在提示詞(Prompt)中增加更多說明與範例內容,以提升模型對複雜案件的理解能力
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹需求是「依案件複雜度自動調整推理深度,在品質與成本之間取得平衡」。具延伸推理(Extended Thinking)能力的模型,其推理深度與消耗的思考 Token 量直接相關;對應的系統設計概念,就是依案件複雜度動態設定推理資源上限(如思考 Token 預算):簡單案件配置較低預算,快速比對條款即可;複雜案件放寬預算,讓模型進行多層次法規詮釋與案例比對。以資源上限作為調節機制,即可在回應品質與推理成本間取得最佳配置,故 (C) 正確。
【為何其他選項錯了?】
- (A):溫度參數控制取樣的隨機性與輸出多樣性,不影響模型投入多少推理步驟或思考資源,與推理深度無關。
- (B):改用更大模型屬於模型選擇策略,並非題幹所指「同一系統依複雜度自動調整推理深度」的機制,且維運多套模型的成本與複雜度更高。
- (D):增補提示說明與範例可改善模型理解,但屬於輸入內容設計,無法作為依複雜度自動分配推理資源的機制。
提示:「依複雜度調整推理深度、平衡品質與成本」對應思考 Token 預算;溫度管隨機性,大模型管能力上限,提示管輸入品質。
某使用者在操作ChatGPT 時,要求系統「產生一張簡報架構圖」。模型隨即輸出一段具有固定語法規則的結構化文字(例如可用來描述流程或架構的標記語言),並可進一步渲染為圖表,而非僅生成文字描述。請問此能力最主要源自模型在預訓練階段大量接觸下列哪一類型的資料?
- A大量不同風格的繪畫與平面設計作品;
- B大量文件與文章內容;
- C大量表格資料與半結構化報表;
- D大量程式碼與結構化標記語言文本
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
模型能輸出「具固定語法規則、可進一步渲染為圖表的結構化文字」,代表它學會了機器可解析的語法結構。這項能力來自預訓練語料中大量的程式碼與結構化標記語言文本,例如各類程式語言、Markdown、Mermaid、HTML、JSON 等;模型從中習得嚴格的語法規則與巢狀、縮排等結構慣例,才能生成可被渲染引擎正確解析的流程或架構描述,故 (D) 正確。
【為何其他選項錯了?】
- (A):繪畫與平面設計作品屬於影像資料,主要用於訓練影像生成模型,無法讓語言模型學會固定語法的文字標記結構。
- (B):一般文件與文章提供自然語言知識與表達能力,但自然語言語法鬆散,無法解釋模型輸出嚴格結構化、可機器解析的標記語言。
- (C):表格與半結構化報表有助於理解欄列資料,但其結構型態單一,不足以支撐流程圖、架構圖等標記語言的完整語法生成能力。
提示:「輸出可渲染的結構化語法」指向程式碼與標記語言語料;文章給知識,圖片給視覺,表格給欄列,都給不了語法規則。
一家新創公司希望對 Llama3 70B 模型進行領域微調(Domain Fine-Tuning)以建立企業專用助理,但 GPU記憶體有限,無法支撐完整模型的反向傳播梯度計算。工程師希望凍結(freeze)原模型權重、僅訓練少量額外參數的前提下,評估採用LoRA(Low-Rank Adaptation)方案。請問 LoRA在此場景下的主要優勢為何?
- A透過知識蒸餾(Knowledge Distillation)將70B 模型壓縮為較小的學生模型
- B對原始模型各層權重進行剪枝(Pruning),移除低重要性參數後再進行微調
- C凍結原始預訓練權重,僅在各層加入低秩分解的可訓練矩陣,大幅降低可訓練參數量與 GPU記憶體需求
- D將模型中的注意力機制改為稀疏注意力(Sparse Attention),以降低長序列計算成本
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
LoRA(Low-Rank Adaptation)的做法是凍結原始預訓練權重 W,在指定層旁加入一組低秩分解矩陣 A 與 B(秩 r 遠小於原維度),訓練時只更新這一小組新增參數。可訓練參數量因此從 70B 等級降到百萬等級,反向傳播需保存的梯度與優化器狀態(如 Adam 的動量與二階矩)同步大幅縮減,GPU 記憶體需求驟降,正好解決題幹「記憶體不足以支撐完整模型反向傳播」的限制;推論時可將低秩矩陣乘積合併回原權重,不增加額外延遲,故 (C) 正確。
【為何其他選項錯了?】
- (A):知識蒸餾是訓練較小的學生模型模仿大模型行為,產物是另一個模型,與「凍結原權重、外加低秩模組」的 LoRA 機制不同。
- (B):剪枝是移除低重要性參數的模型壓縮技術,會更動原模型結構;LoRA 完全不動原權重,只增加旁路的可訓練矩陣。
- (D):稀疏注意力是降低長序列注意力計算成本的架構改動,目標在計算量,與減少可訓練參數、節省微調記憶體無關。
提示:LoRA 的重點是凍結本體、僅訓練低秩旁路;節省的是可訓練參數的梯度與優化器狀態所占的 GPU 記憶體。
某工程師計劃將通用 LLM 在醫療問答語料上進行監督微調(Supervised Fine- Tuning, SFT),但發生了災難性遺忘(Catastrophic Forgetting)問題。在計算資源有限的情況下,工程師希望透過調整微調策略來緩解此問題。下列哪一種訓練設計最能有效率地學習新任務的同時保留原有能力?
- A凍結大部分預訓練參數,僅對少量新增模組(如 LoRA層)進行微調,並控制更新範圍以減少對原有知識的干擾
- B提高學習率(Learning Rate)並縮短訓練步數,使模型快速收斂至新任務,避免長時間訓練造成遺忘
- C僅使用醫療語料進行多輪訓練,強化模型對新任務的專注程度
- D增加批次大小(Batch Size)以穩定梯度更新,使模型同時保留舊知識與學習新知識
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
災難性遺忘的成因,是新任務的梯度大範圍覆寫預訓練權重,使原有能力隨之流失。對應的解法是限制參數更新範圍:凍結絕大多數預訓練參數,僅訓練少量新增模組(如 LoRA 低秩旁路),原有知識保存在凍結權重中不受干擾,新領域知識則寫入新增模組。這類參數高效微調的可訓練參數量極低,計算資源需求小,同時滿足題幹「資源有限」與「保留原有能力」兩項條件,故 (A) 最有效。
【為何其他選項錯了?】
- (B):提高學習率使每步更新幅度更大,對原有權重的覆寫更劇烈,反而加重遺忘;縮短訓練步數也不是保護舊知識的機制。
- (C):僅以醫療語料反覆多輪訓練,梯度完全由新領域主導,是最容易引發災難性遺忘的做法,與題幹目標相反。
- (D):加大批次可讓梯度估計更穩定,但更新方向仍完全由新任務資料決定,原有知識照樣被覆寫,無法解決遺忘問題。
提示:緩解災難性遺忘的關鍵是「縮小更新範圍」;凍結本體搭配 LoRA 等參數高效微調,是資源有限時的標準解法。
某團隊使用 LoRA微調大型語言模型進行法律摘要任務,發現模型在複雜條款的摘要上常出現內容遺漏,但 GPU 顯存已接近上限。下列哪種調整方式最能在不明顯增加記憶體使用的前提下改善模型表現?
- A提高 LoRA rank 以增強模型表達能力
- B改用完整微調(Full Fine-tuning)以學習更多細節
- C降低 LoRA rank以釋放記憶體並增加 Batch Size
- D降低 LoRA rank 但套用到更多層,保持 trainable總參數不變
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
LoRA 的可訓練參數量約與「rank 乘以掛載層數」成正比,GPU 記憶體壓力主要來自可訓練參數及其優化器狀態。降低單層 rank、同時把 LoRA 套用到更多層(例如同時覆蓋注意力的 Q、K、V、O 投影與 FFN 層),可在可訓練參數總量不變、記憶體不明顯增加的前提下,讓適配訊號注入模型更多位置。對「複雜條款摘要遺漏」這類能力面不足的問題,擴大適配的覆蓋廣度通常比單點加深更有效,故 (D) 是符合記憶體限制又能改善表現的調整方式。
【為何其他選項錯了?】
- (A):直接提高 rank 會增加可訓練參數與優化器狀態,記憶體用量隨之上升;GPU 記憶體已接近上限,此法不可行。
- (B):完整微調需為全部參數保存梯度與優化器狀態,記憶體需求較 LoRA 高出數倍,在題幹的資源條件下無法採用。
- (C):降低 rank 換取更大批次雖可釋放記憶體,但模型適配容量下降,內容遺漏問題可能惡化,與改善表現的目標相反。
提示:LoRA 容量有兩個旋鈕:rank(單層深度)與套用層數(覆蓋廣度);記憶體吃緊時,以降 rank 換多層覆蓋是常見策略。