iPAS 歷屆考題 · 中級
114年第二梯次中級AI應用規劃師 人工智慧技術應用與規劃
第一科 · 共 50 題 · 每題附正解與逐選項詳解,「觀念複習」直達對應教學節點。
50 題
中級第一科
建議先自行作答再展開詳解;每題可透過「觀念複習」回到掛載該題的知識節點。試題著作權屬原主辦單位,本站解析僅供考生學習之用。
某電商企業希望利用自然語言處理(NLP)技術,分析顧客在社群平台與商品評論中的文字內容,以即時掌握顧客對產品的滿意度變化。若採用情感分析(Sentiment Analysis)模型,其主要目的為何?
A 預測顧客使用的語言風格與語氣
B 判斷文本中所表達的情感傾向
C 將顧客留言自動翻譯成企業內部指定語言
D 產生顧客評論的自動化摘要內容
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
情感分析(Sentiment Analysis)是自然語言處理(NLP)中的文本分類任務,目標是判斷一段文字所表達的情感傾向,常見輸出為正面、負面、中性,或更細緻的情緒強度分數。對電商而言,將大量評論自動歸類為正負面後,即可追蹤滿意度隨時間的變化趨勢,正符合題幹「即時掌握顧客滿意度變化」的需求。
【為何其他選項錯了?】
- (A):預測語言風格與語氣屬於風格分析或作者剖析(Author Profiling)的範疇,重點在表達方式;情感分析關注的是文字傳達的態度傾向,兩者目標不同。
- (C):自動翻譯是機器翻譯(Machine Translation)的任務,僅轉換語言,無法直接產出顧客滿意與否的判斷結果。
- (D):產生摘要是文本摘要(Text Summarization)任務,輸出為濃縮後的文字內容,而非情感傾向的分類標籤。
提示:題幹關鍵詞「滿意度變化」對應情感傾向分類;風格分析、翻譯、摘要皆非態度判斷任務。
本題掛載於「NLP 與 LLM 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某跨國金融科技公司導入 Transformer 架構開發多語客服系統,以提升長篇金融文件的自動翻譯品質。下列何者為該模型能顯著改善翻譯準確度的主要原因?
A 透過自注意力機制(Self-Attention Mechanism)捕捉長距離語境依賴關係
B 透過卷積運算(Convolution Operation)加速訓練過程
C 透過強化學習(Reinforcement Learning)自動調整語句生成策略
D 透過資料增強(Data Augmentation)平衡多語語料比例
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
Transformer 的核心是自注意力機制(Self-Attention Mechanism):序列中每個詞都能直接與任意位置的詞計算關聯權重,資訊傳遞路徑長度為常數,因此能有效捕捉長距離語境依賴。金融長文中,代名詞指涉與條款引用經常橫跨大量句子,自注意力能將相隔很遠的語意直接連結,翻譯準確度因此顯著提升,這也是其優於 RNN 逐步傳遞架構的關鍵。
【為何其他選項錯了?】
- (B):Transformer 架構不使用卷積運算(Convolution Operation),卷積是 CNN 的機制;且加速訓練與翻譯準確度提升之間並無直接因果關係。
- (C):強化學習(Reinforcement Learning)並非 Transformer 架構的內建成分;RLHF 等技術屬於後續的對齊訓練,不是該架構改善翻譯品質的主因。
- (D):資料增強(Data Augmentation)是資料層面的通用手法,任何模型皆可採用,並非 Transformer 本身的架構優勢。
提示:題幹問「架構層面的主因」,直接對應自注意力與長距離依賴;卷積、強化學習、資料增強皆非 Transformer 的核心機制。
本題掛載於「Transformer 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業計畫應用 BERT(Bidirectional Encoder Representations from Transformers)模型分析大量顧客意見,以強化客服自動回覆系統。在BERT 的預訓練過程中,「遮罩語言模型(Masked Language Model, MLM)」的主要訓練策略為何?
A 依序遮罩句尾詞語,讓模型從左到右逐步生成完整句子
B 隨機遮罩部分詞語,並讓模型根據雙向上下文(Bidirectional Context)預測被遮罩的詞
C 透過對抗訓練(Adversarial Training)生成語意相似的擾動樣本以提升泛化性
D 以未遮罩的詞為條件,使用解碼器(Decoder)結構重建整句內容
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
BERT 預訓練的遮罩語言模型(Masked Language Model, MLM)會隨機遮罩輸入中約 15% 的詞元(token),再讓模型同時利用左右兩側的上下文預測被遮罩的原詞。由於預測時可取得雙向資訊,BERT 學到的語意表徵特別適合理解型任務,例如文本分類、問答與顧客意見分析,正符合題幹的應用情境。
【為何其他選項錯了?】
- (A):「依序遮罩句尾、從左到右逐步生成」描述的是自迴歸語言模型(如 GPT)的訓練方式;BERT 是雙向編碼器,不進行逐步生成。
- (C):對抗訓練(Adversarial Training)以擾動樣本提升模型穩健性,屬於另一類技術,與 MLM 的遮罩填空策略無關。
- (D):BERT 僅有編碼器(Encoder),沒有以解碼器重建整句的設計;以 Decoder 重建的描述較接近 Seq2Seq 或 BART 等去噪自編碼架構。
提示:MLM 的兩個關鍵詞是「隨機遮罩」與「雙向上下文預測」;出現「由左至右生成」即屬 GPT 類自迴歸模型。
本題掛載於「BERT 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在詞向量(Word Embedding)訓練方法中,GloVe(Global Vectors for Word Representation)與Word2Vec 的主要差異為何?
A Word2Vec 以詞頻權重訓練詞向量,而 GloVe以隨機初始化向量進行學習
B Word2Vec 以全局統計矩陣為基礎,而 GloVe採用神經網路進行上下文預測
C Word2Vec 為基於預測的模型,而 GloVe為基於共現統計的模型
D Word2Vec 僅能用於靜態文本語料,而 GloVe可應用於即時語料更新
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
Word2Vec 是基於預測(Prediction-based)的模型,以滑動視窗搭配 Skip-gram 或 CBOW,用淺層神經網路執行上下文預測任務來學習詞向量;GloVe(Global Vectors)則是基於計數(Count-based)的模型,先統計整個語料的詞共現矩陣(Co-occurrence Matrix),再以加權目標函數分解出詞向量。一者依靠局部視窗的預測,一者依靠全局共現統計,此為兩者最本質的差異。
【為何其他選項錯了?】
- (A):兩者皆以隨機初始化的向量開始迭代學習,「詞頻權重訓練 vs 隨機初始化」並非兩者的分野。
- (B):敘述恰好顛倒:以全局統計矩陣為基礎的是 GloVe,以神經網路進行上下文預測的是 Word2Vec。
- (D):兩者訓練完成後皆為靜態詞向量(一詞對應一向量),皆未特別支援即時語料更新;需要動態語意表徵應採用 ELMo、BERT 等情境化模型。
提示:記住對應關係:Word2Vec=預測式(局部視窗),GloVe=共現統計式(全局矩陣);將兩者對調即是常見陷阱選項。
本題掛載於「詞嵌入 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業以詞頻–逆文件頻率(Term Frequency–Inverse Document Frequency, TF-IDF)方法分析顧客意見內容,但發現模型在處理篇幅較長的回饋文本時,無法準確反映關鍵詞的重要性。下列何者為造成此現象的主要原因?
A 長文本中的詞頻偏高,導致常見詞權重被過度放大
B 長文本中缺乏明確句子邊界,造成 TF-IDF 無法計算詞頻
C TF-IDF 無法同時處理多份文件
D 長文本會改變 IDF(Inverse Document Frequency)的計算,使所有詞權重趨於相近
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
TF-IDF 的詞頻(TF)項與文件長度直接相關:文章越長,常見詞出現次數越多,若未進行長度正規化,這些詞的 TF 值會被過度放大,壓過真正具鑑別力的關鍵詞,使長文本的權重計算失真。實務上常以 TF 正規化(除以文件總詞數或取對數)或 BM25 的文件長度懲罰機制緩解此問題。
【為何其他選項錯了?】
- (B):TF-IDF 以「詞」為統計單位,計算詞頻不需要句子邊界資訊,文本即使缺乏明確句界仍可正常計算。
- (C):TF-IDF 本質上即是跨文件集合的方法,IDF 便是由整個文件集合統計而得,「無法同時處理多份文件」與事實相反。
- (D):IDF 以「包含該詞的文件數」計算,單一文件變長不會改變文件集合層級的 IDF 值,也不會使所有詞權重趨於相近;問題出在 TF 端,而非 IDF 端。
提示:區分 TF 與 IDF 的計算來源:TF 受單一文件長度影響,IDF 由整個文件集合決定;長文本失真發生在 TF 端。
本題掛載於「NLP 與 LLM 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業嘗試以 N-gram語言模型(N-gram Language Model)建立客服自動回覆系統,但發現模型生成的句子雖在片段上合理,卻缺乏整體語意連貫性。此問題最可能源自 N-gram 模型的哪一項限制?
A N-gram 模型在訓練過程中需要龐大計算量,導致長句無法收斂
B N-gram 模型僅根據固定長度的前序詞建立機率估計,難以捕捉長距離依賴關係(Long-range Dependencies)
C N-gram 模型缺乏語意嵌入(Semantic Embedding)層,因此無法表徵詞語間的語意相似度
D N-gram 模型假設詞與詞之間相互獨立,導致無法建構上下文語意關聯
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
N-gram 語言模型基於馬可夫假設(Markov Assumption),僅以前 N-1 個詞估計下一個詞的機率,固定視窗之外的資訊完全無法納入。因此生成結果在 N 個詞的片段範圍內通順,但跨句、跨段的主題一致性與長距離依賴關係(Long-range Dependencies)無法建模,正好對應題幹「片段合理、整體語意不連貫」的現象。
【為何其他選項錯了?】
- (A):N-gram 以統計計數與查表方式估計機率,計算量小;「收斂」是神經網路迭代訓練的概念,並非 N-gram 模型的限制。
- (C):缺乏語意嵌入(Semantic Embedding)確實是 N-gram 的限制之一,但題幹描述現象的直接原因是固定視窗截斷了上下文資訊,而非語意相似度無法表徵。
- (D):N-gram 並非假設詞與詞完全獨立,它建模的正是與前 N-1 個詞的條件依賴;完全獨立是 unigram 或詞袋模型(Bag-of-Words)的假設。
提示:N-gram 的上下文記憶僅限前 N-1 個詞,視窗外資訊一律遺失,故無法處理長距離依賴。
本題掛載於「NLP 與 LLM 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在企業導入的智慧監控系統中,模型以物件偵測(Object Detection)方式自動辨識影像中的人物與車輛。若評估指標採用平均精確率(Mean Average Precision, mAP),其中 IoU(Intersection over Union)閾值設定較高時,代表下列哪一項意義?
A 預測邊界框與真實邊界框的重疊程度越高,模型偵測結果越精準
B 預測邊界框與真實邊界框的誤差越大,導致 mAP數值上升
C 模型整體精確率(Precision)降低,但召回率(Recall)上升
D 預測邊界框的評估結果不受真實框大小影響
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
IoU(Intersection over Union)衡量預測邊界框與真實邊界框的重疊比例(交集面積除以聯集面積)。計算 mAP 時,先以 IoU 閾值判定每個偵測結果是否算「命中」;閾值設定越高,代表只有重疊度非常高的預測框才被視為正確,等於以更嚴格的標準要求定位精準度。能在高 IoU 閾值下仍維持高 mAP 的模型,定位就越精準。
【為何其他選項錯了?】
- (B):預測誤差越大,IoU 越低,在高閾值下更容易被判為錯誤,mAP 通常下降而非上升,因果關係顛倒。
- (C):閾值變嚴時,原本判為命中的框可能變成漏偵測,召回率(Recall)一般是下降,不會上升。
- (D):IoU 是交集除以聯集,真實框的大小當然影響計算結果,不可能不受影響。
提示:IoU 閾值代表判定命中的嚴格程度:閾值越高,對定位精準度的要求越高。
本題掛載於「評估指標 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
關於Softmax 與Max-Pooling,下列敘述何者正確?
A Softmax 與Max-Pooling都會將特徵張量壓縮為單一最大值
B Max-Pooling 會對輸入進行機率分佈的轉換
C Softmax 會保留所有輸入資訊,但以比例表示;Max-Pooling 只保留區域最大值
D Softmax 主要用於特徵降維,而Max-Pooling用於分類輸出
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
Softmax 把一組輸入分數轉換成總和為 1 的機率分布,每個輸入都被保留,只是改以相對比例呈現,常用於分類層的輸出;Max-Pooling 則是在特徵圖的每個局部區域只取最大值、捨棄其餘數值,用於下採樣並保留顯著特徵。一個是「全數保留、改為比例」,一個是「只留區域最大、其餘捨棄」,選項 (C) 正確描述了這組對比。
【為何其他選項錯了?】
- (A):Softmax 不會壓縮成單一最大值,它輸出與輸入等長的機率向量;取最大值的是 Max-Pooling,且是每個區域各取一個,不是整張特徵圖只留一個。
- (B):Max-Pooling 只做區域取最大值,不涉及機率分布轉換;做機率轉換的是 Softmax。
- (D):兩者角色對調:負責降維(下採樣)的是 Max-Pooling,用於分類輸出的是 Softmax。
提示:Softmax 全數保留並轉為比例;Max-Pooling 僅保留區域最大值,用於下採樣。
本題掛載於「CNN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業在訓練生成式 AI模型時,導入資料增強(Data Augmentation)技術以擴充訓練資料,但觀察到模型效能反而下降。下列哪一項最可能的原因與對應改善策略最為正確?
A 增強樣本未經隨機初始化,導致模型梯度更新不穩定,應重新設計訓練啟動流程
B 增強後資料的特徵分佈與原始資料不一致,影響模型的泛化能力,應檢查並調整增強策略以維持語意一致性
C 增強樣本的比例過高,造成模型對特定資料產生偏好,應適度提高增強比例並調整學習率
D 增強後資料的標註可信度下降,導致訓練訊號偏差,應以半監督學習方式重新校正資料
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
資料增強(Data Augmentation)的前提是增強後樣本仍屬於原始資料的分佈,語意與標籤維持不變。若增強策略過於激進,例如過度裁切、雜訊過強或改寫至語意變質,增強資料的特徵分佈會偏離真實分佈,模型學到的是失真樣本的規律,在真實測試資料上的效能反而下降。正確的改善方向是檢查增強前後的分佈一致性,調整增強種類與強度,維持語意一致,故 (B) 的原因診斷與對策皆正確。
【為何其他選項錯了?】
- (A):隨機初始化是權重層面的概念,資料樣本並無初始化的問題;此選項將資料處理與權重初始化混為一談,診斷不成立。
- (C):敘述前後矛盾:既診斷增強樣本比例過高造成偏好,改善策略卻是再提高增強比例,會使問題加劇而非緩解。
- (D):多數增強手法(旋轉、翻轉、同義改寫)沿用原標籤,標註可信度下降並非效能下降的典型主因;以半監督學習重新校正亦非對應此問題的處置。
提示:判斷增強策略是否失當,先檢查增強樣本與原始資料的分佈與語意一致性;選項內部邏輯矛盾者可直接排除。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
如果希望同時兼顧「精確率(Precision)」和「召回率(Recall)」,下列哪一個指標可以作為綜合評估的標準?
A 準確率(Accuracy)
B 均方根誤差(RMSE)
C 均方誤差(MSE)
D F1分數(F1 Score)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
F1 分數(F1 Score)是精確率(Precision)與召回率(Recall)的調和平均數(Harmonic Mean),公式為 F1 = 2PR/(P+R)。調和平均對較低的一方特別敏感,僅當兩者同時夠高時 F1 才會高,因此是同時兼顧查準(Precision)與查全(Recall)的綜合評估指標,特別適合類別不平衡的分類任務。
【為何其他選項錯了?】
- (A):準確率(Accuracy)僅看整體答對比例,在不平衡資料下嚴重失真:若 99% 樣本為負類,全部預測負類即有 99% 準確率,並未兼顧 Precision 與 Recall。
- (B):均方根誤差(RMSE)是迴歸任務的誤差指標,衡量預測值與實際值的差距,與分類的查準查全無關。
- (C):均方誤差(MSE)同為迴歸誤差指標,是 RMSE 未開根號的版本,同樣無法評估 Precision 與 Recall。
提示:同時兼顧 Precision 與 Recall 的綜合指標為 F1;調和平均受較低值主導,任一方偏低 F1 即偏低。
本題掛載於「模型評估 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
企業資料分析團隊使用 DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法進行顧客行為分群,並希望模型能自動區分主要群集與雜訊資料。在此演算法中,決定聚類結果的兩個主要超參數為下列何者?
A 特徵數與學習率
B K 值與距離閾值
C 鄰域半徑(Epsilon ε)與最小點數(MinPts)
D 交叉熵(Cross Entropy)與權重初始化
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
DBSCAN 是密度式分群演算法,核心邏輯為:以每個點為圓心、半徑 ε(Epsilon)界定鄰域,鄰域內點數達到最小點數(MinPts)者成為核心點,再由核心點的密度可達性擴張成群;無法歸入任何群的點則標記為雜訊(Noise)。因此 ε 與 MinPts 這兩個超參數直接決定群集的形狀、數量與雜訊判定,是 DBSCAN 最主要的超參數。
【為何其他選項錯了?】
- (A):特徵數是資料本身的屬性而非超參數;學習率屬於梯度下降類演算法的設定,DBSCAN 不使用梯度最佳化。
- (B):K 值是 K-means 或 KNN 的參數,DBSCAN 的特點之一正是不需預先指定群數;「距離閾值」僅對應 ε,缺少密度條件 MinPts,敘述不完整。
- (D):交叉熵是分類任務的損失函數,權重初始化屬於神經網路訓練;DBSCAN 沒有損失函數與權重的概念。
提示:DBSCAN 記兩個超參數:ε 界定鄰域範圍,MinPts 定義密度門檻,密度足夠才成群。
本題掛載於「DBSCAN / HDBSCAN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融科技公司建立房價預測模型,使用多項特徵(如建坪、房齡、樓層、總價等)進行線性迴歸分析(Linear Regression Analysis)。資料分析師發現多個特徵之間存在高度相關性,導致模型係數不穩定、預測誤差上升。為解決此問題,下列哪一種方法最適合?
A 繼續保留所有特徵,不進行任何處理
B 使用主成分分析(PCA)將相關特徵轉換為彼此獨立的主成分
C 新增更多原始變數以提升模型表現
D 改用分類模型進行預測
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
多個特徵高度相關即為多重共線性(Multicollinearity),會使線性迴歸的係數估計變異數膨脹、數值不穩定。主成分分析(PCA)對原特徵進行正交轉換,產生彼此不相關的主成分,再以主成分作為迴歸輸入,可從根本上消除共線性,同時保留大部分變異資訊,是處理此問題的經典手法;實務上亦常先以變異數膨脹因子(VIF)確認共線性的嚴重程度,再決定降維策略。
【為何其他選項錯了?】
- (A):不進行任何處理,係數不穩定與預測誤差上升的問題會持續存在,無法改善。
- (C):共線性的根源是特徵之間資訊重疊;再新增更多原始變數只會使重疊更嚴重,惡化問題。
- (D):房價為連續數值,任務本質是迴歸;改用分類模型是改變了任務型態,並未解決共線性問題。
提示:特徵高度相關(共線性)可用 PCA 轉為正交主成分;VIF 是診斷共線性的常用指標。
本題掛載於「PCA 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
下列何者為 Kubernetes在AI模型部署與運行中的核心功能?
A 自動化管理模型的訓練流程與參數調校
B 管理與協調模型服務的部署、擴展與運行環境
C 提供AI 模型的資料儲存與版本控管功能
D 負責深度學習推論的 GPU 加速運算
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
Kubernetes 是容器編排(Container Orchestration)平台,在 AI 模型部署中的核心職責是管理與協調模型服務的運行:容器化服務的部署、自動擴縮(Scaling)、負載平衡、滾動更新與故障自癒,確保推論服務在叢集環境中穩定運行。其管理的層次是「服務如何部署、如何擴展、故障如何恢復」,屬於運行環境的協調者。
【為何其他選項錯了?】
- (A):訓練流程管理與參數調校屬機器學習框架及實驗管理工具(如 MLflow、Kubeflow Pipelines)的職責;Kubernetes 僅提供運行環境,不涉及調參。
- (C):資料儲存與模型版本控管由物件儲存服務與模型註冊庫(Model Registry)負責,Kubernetes 本身不是版本控管系統。
- (D):GPU 加速運算由 GPU 硬體與 CUDA 等運算函式庫達成;Kubernetes 只負責將 GPU 資源排程分配給容器,不執行運算本身。
提示:Kubernetes 的關鍵字是部署、擴縮、調度與自癒;訓練調參、版本控管、加速運算各有專責工具。
本題掛載於「部署與服務化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在調整模型超參數(Hyperparameters)時,若希望避免因過度調整參數而導致過擬合,下列哪一種做法最有效提升模型的泛化能力?
A 採用交叉驗證(Cross-Validation)於多組參數組合間反覆評估,選擇在驗證資料上表現最穩定的設定
B 使用早期停止機制(Early Stopping)監控訓練誤差並在收斂前停止訓練,以防模型學習過度
C 對輸入特徵進行標準化以減少特徵值差異帶來的過擬合風險
D 提高模型複雜度並使用更多超參數搜尋範圍,以確保模型能充分學習資料特徵
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
超參數調整最大的風險,是參數組合恰好迎合某一份特定的驗證資料。交叉驗證(Cross-Validation)將資料切為多折,每組參數組合都在多個訓練與驗證切分上重複評估,以平均表現作為選擇依據,可大幅降低單次切分的隨機性,選出表現最穩定、泛化能力最佳的設定,是超參數選擇的標準做法,故 (A) 最有效。
【為何其他選項錯了?】
- (B):早期停止(Early Stopping)控制的是單次訓練的輪數,且正規做法是監控「驗證誤差」而非選項所述的訓練誤差;它防止的是訓練過度,無法處理超參數選擇本身造成的過擬合。
- (C):特徵標準化是使數值尺度一致、幫助收斂的前處理步驟,與過度調參造成的過擬合沒有直接關聯。
- (D):提高模型複雜度並擴大搜尋範圍,會使模型更容易記憶訓練資料,過擬合風險升高,與題目的目標方向相反。
提示:調參應搭配交叉驗證,以多折平均表現決定參數;單一驗證集上的好成績可能只是切分運氣。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在企業導入的 MLOps(Machine Learning Operations)流程中,Model Registry 最常用於哪一個階段?
A 用於設定運算資源與執行環境以確保訓練穩定
B 用於建立可重複使用的資料與特徵版本
C 用於集中管理模型版本、訓練紀錄與部署狀態
D 用於追蹤模型上線後的表現與漂移情況
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
Model Registry(模型註冊庫)是 MLOps 流程中集中管理模型資產的元件:登錄每一個模型版本、關聯其訓練紀錄與評估指標、標記所處階段(如 Staging、Production、Archived),並控管簽核與部署狀態。它銜接訓練與部署兩端,讓團隊能隨時掌握線上運行的是哪一版模型、該版本由哪次訓練產生,故 (C) 正確。
【為何其他選項錯了?】
- (A):設定運算資源與執行環境屬基礎設施與資源編排工具(如 Kubernetes、雲端資源配置)的職責,不是 Model Registry 的功能。
- (B):資料與特徵的版本管理屬於 Feature Store 或資料版本控制工具(如 DVC)的範疇;Model Registry 管理的對象是模型,不是資料與特徵。
- (D):追蹤模型上線後的表現與漂移(Drift)是模型監控(Model Monitoring)系統的工作;Registry 記錄部署狀態,但不負責線上效能監測。
提示:Registry 管模型版本與部署狀態,Feature Store 管特徵,Monitoring 管上線後表現,三者職責分明。
本題掛載於「MLOps 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
下列哪一種情境中最適合使用「序列到序列(Seq2Seq)」模型?
A 預測銷售趨勢曲線,輸出未來數值序列
B 辨識文本中出現的人名、地名與組織名稱等實體資訊
C 對輸入文本中的關鍵字進行頻率統計與可視化
D 將輸入文字轉換成語意等價的另一段文字,如自動翻譯或摘要生成
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
序列到序列(Seq2Seq)模型由編碼器(Encoder)讀入一段輸入序列,再由解碼器(Decoder)生成另一段輸出序列,輸入與輸出的長度可以不同。其典型應用即機器翻譯、文本摘要、對話生成等「將一段文字轉換為語意對應的另一段文字」的任務,正是 (D) 的描述。
【為何其他選項錯了?】
- (A):銷售趨勢預測屬於時間序列迴歸問題,常以 ARIMA 或輸出數值的 LSTM 迴歸模型處理,輸出為數值而非語言序列,並非 Seq2Seq 的典型應用。
- (B):辨識人名、地名、組織名是命名實體辨識(NER),屬於序列標註(Sequence Labeling)任務,輸入與輸出逐詞對齊,不需要 Encoder-Decoder 的生成架構。
- (C):關鍵字頻率統計與可視化屬於統計分析工作,不涉及序列生成,無須使用 Seq2Seq 模型。
提示:Seq2Seq 的特徵是「一段序列輸入、另一段序列輸出、長度可不同」,代表應用為翻譯與摘要。
本題掛載於「RNN / LSTM 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在自然語言處理中,檢索增強生成(Retrieval-Augmented Generation, RAG)是一種結合語言模型與向量搜尋的技術,可有效減少模型知識過時與產生幻覺的問題。若要建立一套高效能的 RAG系統,下列何者為在「檢索階段」最關鍵的挑戰?
A 確保檢索到的文件能被完整納入語言模型的上下文視窗(Context Window)中進行生成
B 選擇使用 Faiss或ScaNN等近似最近鄰搜尋函式庫
C 降低嵌入模型(Embedding Model)在高維空間中的計算成本與記憶體占用
D 避免向量檢索結果僅具語意相似但與查詢意圖無實質關聯的情況
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
RAG 的檢索品質決定生成品質的上限。向量檢索依賴嵌入空間的語意相似度,但「語意相似」不等於「符合查詢意圖」:查詢退款流程,可能檢索回大量討論退款政策沿革的文件,表面相似卻無助於作答。這種相關性(Relevance)與相似度(Similarity)之間的落差,正是檢索階段最關鍵的挑戰,實務上須以查詢改寫、重排序(Re-ranking)、混合檢索等手段緩解。
【為何其他選項錯了?】
- (A):檢索文件能否完整納入上下文視窗(Context Window)屬於生成階段的工程限制,不是檢索階段的核心挑戰。
- (B):Faiss 或 ScaNN 是近似最近鄰搜尋的工具選型,解決的是速度與規模;選用哪套函式庫並非檢索品質的關鍵。
- (C):嵌入模型的計算成本與記憶體占用屬效能議題,資源節省不代表檢索結果更切題。
提示:檢索階段的核心風險是找到「語意相似」卻「與意圖無關」的內容;效能與工具選型皆屬次要議題。
本題掛載於「RAG 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
當Transformer 模型發生「注意力分布過於平均(Attention Collapse)」的情形時,導致模型無法有效聚焦於關鍵資訊,下列哪一項策略可有效改善此問題?
A 提高Query-Key點積(Dot Product)的縮放常數
B 在Softmax 前加入高斯雜訊(Gaussian Noise)
C 使用 ReLU 函數取代 Softmax
D 對注意力權重施加稀疏化約束(Sparsity Constraint)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
注意力分布過於平均,代表 Softmax 之後的權重接近均勻分布,模型對各位置的關注度幾乎相同,等於失去聚焦能力。對注意力權重施加稀疏化約束(Sparsity Constraint),例如 Sparsemax、Entmax 或稀疏正則化項,可迫使大部分位置的權重趨近於零、僅保留少數關鍵位置的權重,直接針對「分布過平」的問題處理,使注意力重新集中於關鍵資訊。
【為何其他選項錯了?】
- (A):縮放點積注意力將 QK 點積除以縮放常數(根號 d);若再提高縮放常數,logits 數值變得更小,Softmax 輸出更趨平坦,注意力反而更平均,與目標相反。
- (B):在 Softmax 前加入高斯雜訊(Gaussian Noise)僅增加隨機性,無法保證權重集中,還可能使分布更混亂。
- (C):以 ReLU 取代 Softmax 會失去權重歸一化為機率分布的性質,且 ReLU 本身不具備使權重集中的機制,無法解決分布平均的問題。
提示:注意力過平的對策是稀疏化;提高縮放常數會使分布更平坦,方向相反,是本題主要陷阱。
本題掛載於「注意力機制 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某研究團隊正在訓練一個針對低資源語言(如少數民族語言)的語言模型,但該語言僅有約 1萬筆語料可用。在訓練過程中出現明顯的過擬合現象,若希望在不新增真實語料的前提下提升模型的泛化能力,採用下列哪一種方法最為適合?
A 將Transformer 的隱藏層維度擴增至 1024,以提升表徵能力
B 採用反向翻譯(Back-Translation)技術,以生成額外目標語句的偽平行語料(Pseudo‑Parallel Corpus)
C 對詞嵌入矩陣(Embedding Matrix),施加L1正則化以壓縮模型參數
D 將多語言 BERT(mBERT)中所有Transformer 層全部凍結以保留預訓練知識
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
低資源語言的核心瓶頸是語料不足。反向翻譯(Back-Translation)利用現有翻譯模型,將目標語言的單語資料翻譯回來源語言,生成偽平行語料(Pseudo-Parallel Corpus),等於在不新增真實語料的前提下擴充訓練資料,是低資源機器翻譯與語言模型常用的資料增強手法,可直接緩解資料不足導致的過擬合並提升泛化能力。
【為何其他選項錯了?】
- (A):語料僅約一萬筆卻將隱藏層擴增至 1024 維,參數更多而資料不變,模型容量與資料量的落差擴大,過擬合只會更嚴重,方向完全相反。
- (C):對詞嵌入矩陣施加 L1 正則化雖有抑制過擬合的效果,但屬於治標手段;根本原因是資料量不足,正則化的效益遠不如直接擴充訓練資料。
- (D):將 mBERT 所有 Transformer 層凍結,模型將無法針對目標語言調整參數,難以適應低資源語言的特性;實務上通常凍結底層、微調上層。
提示:題幹限制「不新增真實語料」且要解決過擬合,對應以模型自產資料的增強手法,即反向翻譯。
本題掛載於「NLP 與 LLM 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在使用生成對抗網路(GAN)進行人臉影像生成時,若出現「模式崩潰」(Mode Collapse)現象,下列哪一種方法最常被用來有效解決此問題?
A 在鑑別器中加入梯度懲罰(Gradient Penalty)以穩定訓練過程
B 採用 Wasserstein 距離(WGAN 損失)替代原始的 GAN 損失函數
C 對生成器輸入的潛在向量加入隨機擾動
D 使用多尺度鑑別器架構以提高對多樣性的判別能力
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
模式崩潰(Mode Collapse)指生成器只學會產生少數幾種樣本、輸出多樣性喪失的現象。其根源之一是原始 GAN 的損失函數對應 JS 散度,當生成分佈與真實分佈幾乎不重疊時梯度趨近消失,生成器得不到有效的更新訊號。WGAN 改以 Wasserstein 距離作為損失函數,即使兩分佈不重疊仍能提供平滑且有意義的梯度,使訓練更穩定、生成器能覆蓋更多資料模式,是文獻中對抗模式崩潰最具代表性的解法。
【為何其他選項錯了?】
- (A):梯度懲罰(Gradient Penalty)是 WGAN-GP 為滿足 Lipschitz 條件而設計的配套技巧,屬於穩定訓練的輔助手段,核心仍是 Wasserstein 損失本身。
- (C):對潛在向量加入隨機擾動僅增加輸入雜訊,生成器仍可能把不同輸入映射到相同的少數輸出,無法解決崩潰問題。
- (D):多尺度鑑別器主要用於提升高解析度影像的細節品質,並非解決模式崩潰的代表性方法。
提示:模式崩潰的教科書解法是 WGAN:以 Wasserstein 距離取代原始損失,維持有效梯度。
本題掛載於「GAN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在多模態 AI 模型訓練或推論過程中,遇到某一模態資料缺失(例如僅有影像資料但缺少文本說明),下列哪一種策略最有效維持模型效能?
A 以零向量或固定向量填充缺失模態輸入
B 訓練具備模態缺失感知能力的模型,使其適應缺失狀況
C 利用生成模型(如 GAN 或自迴歸模型)預測並補全缺失模態資料
D 直接捨棄缺少模態的樣本,避免干擾訓練或推論
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
多模態系統在實務中經常遇到某一模態缺席(例如僅有影像而缺少文本說明)。最穩健的策略是讓模型在訓練階段就具備模態缺失感知能力:例如以模態隨機丟棄(Modality Dropout)模擬缺失情境,或設計具缺失感知的融合機制,使模型學會在各種模態組合下運作。如此推論時遇到缺失仍能維持效能,泛化能力也最佳。
【為何其他選項錯了?】
- (A):以零向量或固定向量填充,模型可能將填充值視為真實訊號,引入系統性偏差,效果不穩定。
- (C):以生成模型補全缺失模態是可行方向,但補全品質難以保證,生成誤差會傳遞至下游任務,推論成本也顯著增加,不如讓模型本身具備耐缺失能力。
- (D):直接捨棄缺失樣本會浪費大量訓練資料;推論階段面對缺失輸入更無法拒絕處理,此策略不可行。
提示:與其事後填補或捨棄,不如在訓練階段納入缺失情境,建立模態缺失感知能力。
本題掛載於「深度學習 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電商平台開發的顧客流失預測模型在上線數月後,預測準確率明顯下降。專案團隊懷疑顧客行為模式改變,導致模型輸入特徵的分佈與原始訓練資料不同,出現典型的資料漂移(Data Drift)問題。為了偵測並確認資料分佈是否發生變化,下列哪一種作法最合適?
A 定期重新訓練模型以應對外部變化
B 提升模型複雜度以捕捉更多資料變異性
C 增加測試資料量以提高評估準確度
D 計算輸入特徵分佈間的 KL散度(KL Divergence)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題目問的是「偵測並確認資料分佈是否發生變化」。KL 散度(KL Divergence)可量化訓練資料與近期輸入資料兩個分佈之間的差異,數值越大代表偏移越明顯,搭配門檻值即可確認資料漂移(Data Drift)是否發生,是漂移檢測的標準統計工具;同類指標還有 PSI 與 KS 檢定。
【為何其他選項錯了?】
- (A):定期重新訓練是「因應」漂移的處置,不是「偵測」;未經偵測就重訓,無法確認漂移是否存在,也難以定位問題來源。
- (B):提升模型複雜度是修改模型,無助於判斷輸入分佈是否改變,且可能引入過擬合。
- (C):增加測試資料量能使效能評估更穩定,但評估的是模型表現,並非直接量測兩個分佈之間的差異,無法回答題目的問題。
提示:偵測資料漂移使用分佈距離指標:KL 散度、PSI、KS 檢定。
本題掛載於「Data Drift 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某大型醫院即將部署一套輔助診斷的 AI系統,為降低對臨床流程的衝擊,同時確保風險可控與回饋可收斂,應採取何種『漸進式部署』(Phased Rollout)策略最為合適?
A 從單一專科(如放射科)或特定病房開始啟用,逐步擴展至全院
B 先部署於病例量較高的急診單位,加速收集高頻使用回饋
C 僅在夜班或離峰時段啟用,避免影響主要臨床工作負載
D 在使用者界面啟用提示模式,讓全院同步體驗但不影響診斷流程
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
漸進式部署(Phased Rollout)的原則是小範圍先行、風險可控、回饋收斂後再擴大。從單一專科(如放射科)或特定病房開始啟用,使用者群體固定、案例類型集中,回饋容易歸因與收斂;若系統出現問題,影響範圍也被限制在小場域內。驗證穩定後再逐步擴展至全院,是醫療這類高風險場域導入 AI 系統的標準路徑,故 (A) 正確。
【為何其他選項錯了?】
- (B):急診病例量大、時間壓力高、病況複雜,首階段即部署於急診,等於將風險最高的流程當作試驗場;高頻回饋雖多但情境混雜,難以歸因,風險亦不可控。
- (C):僅在夜班或離峰時段啟用,樣本量少且情境偏頗,無法收集具代表性的回饋,後續擴展的決策依據薄弱。
- (D):全院同步體驗即使僅是提示模式,本質仍是一次性全面上線,違背漸進式部署的風險隔離原則;一旦系統有誤,影響範圍及於全院。
提示:漸進式部署的判斷要點:試點範圍小、回饋可歸因、風險可隔離,驗證後再逐步擴大。
本題掛載於「階段 3 系統部署 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融機構的 AI風控系統遭受對抗性攻擊,駭客透過對輸入特徵進行微小但惡意的擾動,成功欺騙了模型。為了從根本上解決模型自身對這類攻擊的脆弱性,下列何者並非針對此種攻擊型態的技術手段?
A 強化資料前處理,用以過濾掉格式不符或數值極端異常的輸入
B 在模型訓練階段導入對抗樣本訓練,以提升模型對惡意特徵擾動的辨識與防禦能力
C 於推論後階段使用規則引擎,以確保模型的預測結果不違反既有的業務硬性規定
D 在模型部署環境中強化網路防火牆,以阻擋來自未授權來源的網路連線
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題目要找「並非」針對對抗性攻擊(Adversarial Attack)的技術手段。對抗性攻擊是對輸入特徵施加微小惡意擾動使模型誤判,防禦必須作用在資料與模型層,例如輸入淨化、對抗訓練、輸出防護。強化網路防火牆阻擋的是未授權的網路連線,屬於基礎設施安全;攻擊者若透過合法管道送出精心擾動的輸入,防火牆無從辨識內容,因此 (D) 不是針對此攻擊型態的手段,為本題答案。
【為何其他選項錯了?】
- (A):強化資料前處理、過濾格式不符或數值極端異常的輸入屬於輸入淨化(Input Sanitization)防線,可攔截部分惡意樣本,是針對此攻擊的相關防禦環節。
- (B):對抗樣本訓練(Adversarial Training)把攻擊樣本納入訓練,直接提升模型對惡意擾動的辨識與防禦能力,是最核心的防禦手段。
- (C):推論後以規則引擎把關,即使模型被欺騙,輸出仍不得違反業務硬性規定,屬於輸出端防護,同樣是降低攻擊影響的技術手段。
提示:對抗性攻擊經由合法輸入管道夾帶惡意擾動;防火牆只管連線來源,管不到輸入內容本身。
本題掛載於「對抗式攻擊防禦 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業部署生成式 AI系統協助行銷與內容產出,但近期遭質疑部分生成內容可能涉及著作權侵權。為降低企業在法律層面的潛在責任與風險,下列哪一項策略最能有效預防侵權問題產生?
A 對生成內容進行語意相似度比對,自動標註可能涉及既有著作的輸出結果,以降低侵權風險
B 建立訓練資料篩選與授權驗證機制,排除未授權或高風險資料來源
C 在訓練與微調過程中採用差分隱私技術,避免模型記憶特定受著作權保護的樣本
D 在模型輸出端嵌入浮水印(Watermarking)或數位指紋(Digital Fingerprint)技術,以確保生成內容可追溯
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
生成式 AI 著作權風險的源頭在訓練資料:模型接觸過未經授權的作品,才可能生成與其高度相似的侵權內容。建立訓練資料篩選與授權驗證機制,從源頭排除未授權或高風險資料來源,是「預防」侵權最根本且有效的策略,也符合各國 AI 治理框架對資料來源合法性的要求,故 (B) 正確。
【為何其他選項錯了?】
- (A):語意相似度比對是在內容生成之後進行偵測與標註,屬事後把關;未被偵測到的內容仍可能流出,預防效果有限。
- (C):差分隱私可降低模型記憶特定樣本的程度,但屬隱私保護技術,無法保證生成內容不近似受著作權保護的作品,更不能使未授權利用變為合法。
- (D):浮水印(Watermarking)與數位指紋(Digital Fingerprint)解決的是內容可追溯性,便於事後舉證與歸責,對「避免生成侵權內容」本身沒有預防作用。
提示:題幹關鍵詞是「預防」;事前的資料源頭治理才是預防,相似度比對與浮水印皆屬事後措施。
本題掛載於「治理與倫理 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在房價預測任務中,若發現特徵如「房間數」與「坪數」存在高度多重共線性(Multicollinearity),為降低共線性對模型參數估計的負面影響,應優先選擇下列哪種模型?
A 不受多重共線性影響的決策樹模型
B 傳統線性迴歸模型,不含正則化項
C 支持向量機搭配線性核函數
D 含L1正則化的 LASSO迴歸模型
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
多重共線性(Multicollinearity)會使迴歸係數的估計變異數暴增、數值不穩定。LASSO 迴歸在損失函數加入 L1 正則化項,會把部分係數直接壓縮到零,等於自動在高度相關的特徵之間做選擇、剔除冗餘變數,同時抑制係數膨脹,能有效降低共線性對參數估計的負面影響,是四個選項中最合適的模型。
【為何其他選項錯了?】
- (A):決策樹的預測對共線性確實較不敏感,但「不受影響」的說法過於絕對;且題目關注參數估計的穩定性,樹模型不提供迴歸係數,無法回應題目需求。
- (B):不含正則化的傳統線性迴歸正是受共線性影響最嚴重的模型,係數不穩定的問題完全沒有處理。
- (C):線性核 SVM 沒有針對共線性的處理機制,也不以係數估計與解釋見長,無法解決題目的問題。
提示:高度共線且需要穩定參數估計時採用正則化迴歸;L1 可將冗餘特徵係數壓至零,兼具特徵選擇。
本題掛載於「Lasso (L1) 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業需分析半結構化的系統日誌(JSON格式),以提取關鍵的時序特徵供故障預測模型使用。考量日誌結構複雜且包含巢狀欄位(Nested Fields),下列哪一種策略最有效且實務可行?
A 先將JSON 資料扁平化轉成CSV,再對欄位計算統計量(如均值、次數)作為特徵
B 使用遞歸神經網路(RNN)直接輸入原始 JSON字串進行時序特徵抽取
C 設計遞迴函式展開巢狀欄位,並基於時間窗口(Time Window)進行聚合與特徵萃取
D 只保留時間戳記欄位,忽略其他巢狀內容以簡化特徵工程
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
JSON 日誌的巢狀欄位(Nested Fields)需以遞迴方式展開,才能完整取出各層級的資訊;而故障預測需要的是時序特徵,因此展開後應以時間窗口(Time Window)聚合,例如每五分鐘的錯誤次數、延遲平均與峰值、事件間隔統計等。遞迴展開結合時間窗聚合,兼顧結構完整性與時序資訊,是實務上最有效且可行的特徵工程策略,故 (C) 正確。
【為何其他選項錯了?】
- (A):直接扁平化成 CSV 後計算全域統計量(如均值、次數),會失去時間軸上的變化資訊;故障前兆通常表現為指標隨時間的趨勢變化,僅保留整體統計量無法捕捉。
- (B):RNN 無法直接以原始 JSON 字串作為輸入,仍須先解析結構並轉為數值表徵;將結構解析工作交由模型處理,既低效也不可行。
- (D):僅保留時間戳記、捨棄其他巢狀內容,等於丟棄最具預測力的事件與狀態資訊,無法支撐故障預測。
提示:巢狀日誌的特徵工程兩步驟:遞迴展開取得完整欄位,再以時間窗聚合保留趨勢;故障前兆藏在時序變化之中。
本題掛載於「特徵工程 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在一個同時包含連續型特徵與類別型特徵的資料集中,若希望透過適當的特徵工程流程來提升模型整體表現,下列哪一種作法最為合適?
A 將類別型特徵使用標籤編碼(Label Encoding)轉換後,與連續特徵直接合併進行模型訓練
B 將連續特徵進行離散化(Discretization)或分桶(Binning)轉為類別型特徵,統一以類別方式處理
C 對連續特徵做標準化(Standardization),類別特徵採用目標編碼(Target Encoding),並生成交互特徵提升模型表現
D 只保留連續特徵,忽略類別型變量以簡化模型
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
混合型資料的特徵工程應依資料型態分別處理:連續特徵做標準化(Standardization)統一尺度,有利於距離計算與梯度收斂;類別特徵採用目標編碼(Target Encoding)等方式轉為帶資訊量的數值,避免高基數 One-hot 造成維度爆炸;再生成交互特徵(Interaction Features)捕捉變數間的聯合效應。三者並用,最能提升模型整體表現。
【為何其他選項錯了?】
- (A):標籤編碼(Label Encoding)會替類別加上人為的大小順序,對線性模型與距離型模型會引入虛假的順序關係,直接合併訓練容易誤導模型。
- (B):把連續特徵全部離散化會損失數值資訊與排序精度,為了統一格式而犧牲資訊量,並不合適。
- (D):直接捨棄類別特徵等於放棄一整塊資訊來源,過度簡化,模型表現通常因此下降。
提示:連續特徵標準化、類別特徵目標編碼、再加交互特徵,混合型資料應分別採用合適的處理方式。
本題掛載於「7. 特徵建模 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某AI開發團隊為提升模型開發效率及品質控制,計畫實施持續整合(Continuous Integration, CI)流程。下列哪一項做法最符合 CI的核心實踐,且能有效減少整合風險?
A 在主分支(Main Branch)每日固定時間手動合併並執行完整測試流程
B 每次程式碼提交(Commit)後自動觸發建置、單元測試及靜態程式碼分析
C 於模型訓練完成後,定期安排開發團隊回顧並合併程式碼
D 透過自動化部署腳本,將模型在特定時間點批次釋出到測試環境
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
持續整合(Continuous Integration, CI)的核心實踐是:每次程式碼提交(Commit)即自動觸發建置(Build)、單元測試與靜態程式碼分析,使整合問題在最小變更範圍內立即顯現,定位與修復成本最低。「自動化」與「高頻率」是 CI 的兩大關鍵;依賴人工作業或批次累積變更,都會使問題擴大並延後暴露,故 (B) 最符合 CI 的核心實踐並能有效減少整合風險。
【為何其他選項錯了?】
- (A):每日固定時間以人工方式合併與測試,頻率低且依賴手動作業,問題可能累積一整天才被發現,正是 CI 要改善的工作模式。
- (C):待模型訓練完成才定期回顧與合併,整合週期過長,衝突與缺陷集中在後期一次處理,違背「持續」整合的精神。
- (D):以自動化腳本在特定時間點批次釋出至測試環境屬於部署(CD)範疇,且批次釋出不符合每次提交即時驗證的 CI 要求。
提示:CI 的判斷準則:每次提交、自動觸發、快速回饋;人工、定期、批次皆為反面特徵。
本題掛載於「建立 CI/CD 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某銀行計劃將 AI詐欺偵測模組整合至核心交易系統,主管機關要求全流程必須符合金融監管對「不可否認性(Non-repudiation)」的資訊安全規範,以確保日後能進行法務追蹤與稽核。下列哪一項措施最能確保此要求的落實?
A 為每筆 AI模型推論記錄其輸入與輸出結果的加密雜湊值(Hash),並簽署數位簽章以確保不可竄改性
B 優化模型效能以降低平均推論延遲至 100ms以下,提升使用者體驗
C 增加主機備援數量,以確保系統在故障時持續可用
D 將模型推論請求導入負載平衡器,避免單點壅塞導致服務延遲
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
不可否認性(Non-repudiation)指行為人事後無法否認其行為與相關紀錄。對每筆推論記錄輸入與輸出的加密雜湊值(Hash),可驗證紀錄未被竄改,確保完整性;再以數位簽章(Digital Signature)綁定簽署者身分,即可在法務追蹤與稽核時證明「這筆紀錄確實由該系統產生且未經修改」,直接落實金融監管要求的不可否認性,故 (A) 正確。
【為何其他選項錯了?】
- (B):降低推論延遲屬於效能優化,與事後能否舉證、稽核無關。
- (C):增加主機備援提升的是可用性(Availability),屬於資安 CIA 三要素中的另一個軸線,無法達成不可否認性。
- (D):負載平衡解決流量分配問題,同樣屬於效能與可用性議題,對法務追蹤與稽核沒有貢獻。
提示:不可否認性的落實方式是雜湊確保完整性、數位簽章綁定身分;效能與可用性類選項皆不對題。
本題掛載於「安全與防禦 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某AI服務系統每次推論請求需約 1秒完成,且必須支撐高達 10,000次請求每秒(RPS)的流量。為確保系統具備高可用性且能穩定應付流量峰值,下列哪一種架構方案最為合適?
A 依賴單台超高效能伺服器進行垂直擴展,提升硬體規格
B 採用容器化部署並水平擴展服務實例,結合自動彈性伸縮機制(Auto Scaling)
C 限制最大併發連線數,以避免系統過載
D 增加批次處理大小,一次同時處理上千筆請求
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
每秒 10,000 次請求且單次推論約 1 秒,代表系統隨時有上萬個請求同時在處理,單一伺服器無論規格多高都無法承載,且存在單點故障風險。容器化部署搭配水平擴展(Horizontal Scaling),將服務複製為多個實例分攤流量,再結合自動彈性伸縮(Auto Scaling)依流量峰谷增減實例數量,同時滿足高可用性、峰值承載與成本效率,是雲原生架構的標準解法。
【為何其他選項錯了?】
- (A):垂直擴展受單機硬體上限限制,難以支撐上萬併發;且單一伺服器故障即造成服務全面中斷,不具高可用性。
- (C):限制最大併發連線數是過載保護機制,超額請求會被拒絕;流量峰值時等於縮減服務,無法達成「穩定應付流量峰值」的要求。
- (D):加大批次可提升吞吐量,但會拉長單筆請求的等待延遲;且未解決單點架構的可用性問題,無法滿足高可用要求。
提示:高流量+高可用的標準組合:容器化、水平擴展、自動伸縮;垂直擴展有上限,限流是保護而非承載,加大批次犧牲延遲。
本題掛載於「部署與服務化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業已將 AI模型部署於生產環境,為確保系統持續穩定運作,並能提前偵測模型效能可能衰退,技術團隊希望透過監控指標進行預警。下列哪一項監控指標最具預測效力,能提早發現模型效能下滑風險?
A 系統CPU 與記憶體使用率波動幅度
B 模型推論結果的置信度(Confidence)分佈變化趨勢
C API平均回應時間與延遲百分位數變化
D 輸入特徵與訓練資料分布差異的 PSI(Population Stability Index)指數
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
模型效能衰退最常見的前兆,是線上輸入資料的分佈逐漸偏離訓練資料分佈。PSI(Population Stability Index)直接比較線上輸入特徵與訓練資料的分佈差異,能在預測效能尚未明顯惡化、真實標籤尚未回收之前偵測到漂移,屬於領先指標(Leading Indicator),對「提早發現效能下滑風險」的預測效力最強。
【為何其他選項錯了?】
- (A):CPU 與記憶體使用率反映基礎設施健康度;系統可以運行順暢而模型預測品質已劣化,兩者關聯薄弱,無法預警模型效能。
- (B):置信度分佈變化是有用的訊號,但屬模型輸出端的「症狀」,通常在漂移已影響模型後才顯現,預警時機晚於直接監測輸入分佈。
- (C):API 回應時間與延遲百分位數屬服務品質指標,衡量的是回應速度,與預測準確度無關。
提示:要提早偵測模型效能下滑,監控輸入分佈;PSI 是領先指標,置信度變化是落後症狀,系統資源指標與準確度無關。
本題掛載於「監控與維護 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
企業團隊在使用 Word2Vec模型訓練客服文本語料時,若訓練資料量龐大且希望模型能更有效捕捉罕見詞的語意關聯,下列哪一種訓練策略最為適合?
A 採用Skip-gram模型,但以隨機初始化權重加快高頻詞的訓練收斂
B 採用CBOW 模型(Continuous Bag of Words Model)並結合 TF- IDF權重以強化低頻詞表示
C 採用Skip-gram模型,利用中心詞預測周圍詞語,能更有效學習低頻詞關係
D 採用CBOW 模型(Continuous Bag of Words Model),利用周圍詞預測中心詞,能提升罕見詞的語意穩定度
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
Skip-gram 以中心詞預測周圍詞,語料中每個詞(含罕見詞)都會輪流作為中心詞,每次出現可產生多筆(中心詞, 上下文詞)訓練樣本,罕見詞因此獲得較充足的梯度更新,能學到品質較好的向量表示;搭配負採樣(Negative Sampling)亦可在大規模語料上高效訓練。題幹「資料量龐大且重視罕見詞語意」的條件,正對應 Skip-gram 的適用情境。
【為何其他選項錯了?】
- (A):雖然選用 Skip-gram 方向正確,但「以隨機初始化權重加快高頻詞收斂」並無意義,權重本來即為隨機初始化;且題幹重點是罕見詞,而非高頻詞的收斂速度。
- (B):CBOW 以周圍詞的平均預測中心詞,罕見詞的訊號易被平均稀釋,對低頻詞先天不利;結合 TF-IDF 權重亦非 Word2Vec 的標準訓練機制。
- (D):敘述與事實相反:CBOW 訓練速度快、對高頻詞友善,罕見詞的表現不如 Skip-gram,無法提升罕見詞的語意穩定度。
提示:罕見詞表示品質優先選 Skip-gram;CBOW 的上下文平均會稀釋低頻詞訊號,兩者特性勿混淆。
本題掛載於「詞嵌入 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在自駕車影像辨識系統中,開發團隊希望模型能同時辨識每個像素所屬的物件類別(例如道路、建築、行人),又能區分出同類物件的不同個體(例如多位行人)。此時最適合採用下列哪一項電腦視覺技術?
A 語義分割(Semantic Segmentation)
B 物件偵測(Object Detection)
C 實例分割(Instance Segmentation)
D 全景分割(Panoptic Segmentation)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題目同時要求兩件事:每個像素都要有類別標籤(連道路、建築這類不可數的背景「stuff」也要標),又要能區分同類物件的不同個體(行人甲與行人乙)。全景分割(Panoptic Segmentation)等於語義分割加實例分割的整合:對可數物件(things)給實例級標註、對背景區域給語義標註,是唯一同時滿足兩項需求的技術。
【為何其他選項錯了?】
- (A):語義分割(Semantic Segmentation)只給像素類別,同類的多位行人會合併為同一塊「行人」區域,無法區分個體。
- (B):物件偵測(Object Detection)只輸出邊界框,沒有像素級標註;道路、天空這類背景更不在偵測範圍內。
- (C):實例分割(Instance Segmentation)能區分個體,但通常只處理可數物件,不對道路、建築等背景做完整像素分類,缺少「每個像素都有類別」的另一半需求。
提示:語義分割覆蓋全圖類別、實例分割區分個體;兩項需求兼具即為全景分割。
本題掛載於「影像分割 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某媒體公司計畫導入 CLIP(Contrastive Language–Image Pre- training)模型,以協助大量影像自動標註與搜尋,並希望在無需新增標訓資料的情況下,僅透過文字提示(Text Prompt)即可識別影像內容。請問此應用情境中,CLIP能夠達成的關鍵技術特性為何?
A 透過圖文對比式學習(Contrastive Learning)將影像與文字映射至共同嵌入空間(Shared Embedding Space),可直接以語意相似度進行零樣本分類
B 透過影像增強與特徵擴散降低標訓資料需求
C 以監督式學習結合多層感知器(Multilayer Perceptron, MLP)進行影像特徵分類
D 以自迴歸生成模型(Autoregressive Model)逐步生成文字標籤描述影像內容
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
CLIP 以對比式學習(Contrastive Learning)在數億組圖文配對上訓練,讓影像編碼器與文字編碼器把成對的圖與文映射到共同嵌入空間(Shared Embedding Space)中相近的位置。分類時只要把「一張某某的照片」這類文字提示編碼成向量,和影像向量計算語意相似度,就能完成零樣本分類(Zero-shot Classification),不需新增標註資料,正符合題目「僅用文字提示識別影像」的需求。
【為何其他選項錯了?】
- (B):影像增強與特徵擴散是資料層技巧,不是 CLIP 的核心機制,也無法解釋「以文字當標籤直接分類」的能力。
- (C):CLIP 的預訓練不是傳統監督式分類,不依賴固定類別標籤,MLP 分類頭也不是它的關鍵特性。
- (D):逐步生成文字描述是影像描述(Image Captioning)或自迴歸模型的作法;CLIP 以相似度比對做判別,不生成文字。
提示:CLIP 將影像與文字映射到共同向量空間,文字提示即可作為分類標籤,故能零樣本分類。
本題掛載於「電腦視覺 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某資料科學團隊在開發預測模型時,針對多種模型設定(如學習率、樹深度、正則化係數等)進行系統化測試,希望找出在驗證資料上表現最穩定的組合。此過程最可能採用下列哪一種方法?
A 使用交叉驗證(Cross Validation)反覆評估模型以降低過擬合風險
B 透過網格搜尋(Grid Search)在多組超參數設定中進行系統化搜尋與評估
C 以隨機搜尋(Random Search)快速探索部分參數空間以提升搜尋效率
D 採用貝葉斯優化(Bayesian Optimization)根據歷次結果動態調整搜尋方向
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題幹關鍵是「針對多種模型設定進行系統化測試」。網格搜尋(Grid Search)將每個超參數的候選值列成清單,窮舉所有組合逐一訓練與評估,正是系統化搜尋與評估的定義;它保證涵蓋整個預先定義的參數網格,適合在多組設定中找出驗證表現最穩定組合的情境。實務上常與交叉驗證結合為 GridSearchCV,以網格搜尋列舉組合、以交叉驗證評估每組表現。
【為何其他選項錯了?】
- (A):交叉驗證(Cross Validation)是評估「單一組設定」表現好壞的方法,常與網格搜尋搭配使用,但其本身不負責在多組超參數之間進行搜尋。
- (C):隨機搜尋(Random Search)在參數空間中隨機抽樣,以抽樣效率換取覆蓋完整性,不符合題幹「系統化」窮舉的描述。
- (D):貝葉斯優化(Bayesian Optimization)依據歷次結果動態決定下一組嘗試點,屬於自適應搜尋策略,同樣不是題幹描述的系統化逐一測試。
提示:「系統化窮舉所有組合」對應網格搜尋;「隨機抽樣」對應隨機搜尋;「依歷史結果調整方向」對應貝葉斯優化;「評估單組設定」對應交叉驗證。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某公司正在訓練一個大型語音合成模型,開發團隊使用多台 GPU 進行訓練,但經常出現 GPU 記憶體不足問題。由於模型架構已固定且無法更換硬體,團隊希望在維持模型效能與收斂品質的前提下,下列哪一種方法最有效降低單張 GPU 的記憶體壓力?
A 減少訓練資料量以降低記憶體使用
B 採用較小的批次大小(Batch Size)並搭配資料分片(Data Sharding)分散訓練負載
C 增加學習率(Learning Rate)以加快收斂速度
D 改用測試資料集(Test Set)進行部分訓練以節省空間
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
GPU 記憶體的主要占用來自模型參數、梯度、優化器狀態與激活值,其中激活值的大小與批次大小(Batch Size)成正比。縮小批次可立即降低單卡的記憶體壓力;搭配資料分片(Data Sharding)將資料切分至多卡分散訓練負載,必要時再配合梯度累積(Gradient Accumulation)維持等效批次大小,即可在不更動模型架構與硬體的前提下,兼顧記憶體限制與收斂品質,故 (B) 為最有效的做法。
【為何其他選項錯了?】
- (A):減少訓練資料量降低的是總訓練時間與儲存需求;單一訓練步驟的記憶體占用主要取決於批次大小與模型規模,縮減資料還會犧牲模型效能。
- (C):學習率影響收斂速度與穩定性,與記憶體占用無關;學習率過大反而可能使訓練發散。
- (D):以測試資料集參與訓練會造成資料洩漏,使最終評估失去效力,且節省的記憶體極為有限,是評估流程上不可接受的做法。
提示:單卡記憶體不足的標準處置:縮小批次、資料分片,再以梯度累積補回等效批次大小。
本題掛載於「模型訓練與調參 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某影像設計團隊在使用 Stable Diffusion 生成4K級產品圖時,發現影像邊緣與細節存在顆粒化與模糊現象。若僅能在生成階段進行調整,希望提升畫面清晰度與紋理層次,同時避免過度平滑,下列哪一項作法最適合?
A 降低取樣步數,以縮短生成時間
B 增加取樣步數並選擇高品質取樣器,以強化細節還原度
C 提高CFG(Classifier-Free Guidance)值,使生成結果更具創意與多樣性
D 改用低解析度輸入以降低計算成本
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
擴散模型生成影像是從純雜訊逐步去噪(Denoising)的過程:取樣步數(Sampling Steps)越多,每一步去噪越精細,細節與紋理的還原度越高;搭配高品質取樣器(如 DPM++ 系列)可在細節與效率之間取得更好的平衡。邊緣顆粒化與模糊正是步數不足或取樣器品質不佳的典型症狀,增加取樣步數並選用高品質取樣器可直接提升清晰度與紋理層次,同時避免過度平滑,是生成階段的正確調整。
【為何其他選項錯了?】
- (A):降低取樣步數是反方向操作,去噪不完全會使顆粒感更明顯,以畫質換取生成時間,與題目目標相悖。
- (C):提高 CFG 值會使生成結果更貼近提示語,過高反而導致過飽和與偽影;且 CFG 的實際作用是收斂於提示、降低多樣性,與選項所稱「更具創意與多樣性」相反。
- (D):改用低解析度輸入直接損失像素資訊,與 4K 產品圖的細節要求背道而馳。
提示:清晰度與紋理不足時,優先檢視取樣步數與取樣器品質;CFG 控制的是貼合提示的程度,不是畫質。
本題掛載於「Diffusion 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業的資料科學團隊利用 ARIMA模型(AutoRegressive Integrated Moving Average Model)預測每週產品銷售量。模型建立完成後,分析人員發現預測誤差隨時間呈現週期性波動,且自相關函數(ACF)顯示殘差在多個時滯(Lag)上仍顯著不為零。根據上述現象,最合理的模型診斷結論為何?
A 模型殘差符合白噪音(White Noise)假設,預測表現穩定
B 模型殘差雖有輕微異常,但可視為隨機誤差忽略不計
C 模型存在配適不足(Underfitting)問題,需重新調整 p 或 q參數以捕捉時間依賴性
D 殘差特性不影響預測結果,無須進一步修正
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
ARIMA 模型配適良好時,殘差應接近白噪音(White Noise):無自相關、無規律可循。題目中預測誤差呈週期性波動,且自相關函數(ACF)顯示殘差在多個時滯(Lag)仍顯著不為零,代表資料中還有時間依賴結構未被模型吸收,這就是配適不足(Underfitting)。正確處置是重新識別模型階數,調整自迴歸階數 p 或移動平均階數 q,必要時加入季節項(SARIMA),把殘留的週期結構納入模型。
【為何其他選項錯了?】
- (A):殘差存在顯著自相關,正好違反白噪音假設,「符合白噪音、表現穩定」與題目給的證據直接矛盾。
- (B):多個時滯顯著自相關且呈週期性,是系統性訊號而非隨機誤差;忽略它等於放任模型漏學可預測的資訊。
- (D):殘差存在結構代表點估計與預測區間都會失真,「不影響預測結果、無須修正」忽視了殘差診斷提供的證據。
提示:配適良好的殘差應如白噪音;ACF 在多個時滯仍顯著,表示時間結構尚未學完,應回頭調整 p、q。
本題掛載於「回歸問題 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
下列哪一項最正確地描述了 VAE(Variational Autoencoder)、GAN(Generative Adversarial Network)與擴散模型(Diffusion Model)在多模態潛在空間對齊(Latent Alignment)與生成策略上的根本差異?
A VAE透過顯式潛在變數建模實現跨模態對齊,適合捕捉整體語意結構但生成解析度有限;GAN透過對抗損失(Adversarial Loss)在不同模態間學習分佈映射,生成品質高但穩定性差;擴散模型則以條件化噪聲反推(Conditional Denoising)方式實現高保真跨模態生成,兼具穩定性與多樣性
B VAE與Diffusion Model均屬隱式生成架構,主要依賴對抗式訓練實現跨模態對齊;GAN則以顯式後驗估計方式提升樣本一致性
C VAE與GAN 均使用馬爾可夫鏈(Markov Chain)進行跨模態轉換;Diffusion Model 則透過 KL散度最小化學習語意對應。
D 三者在多模態應用中皆依賴同一潛在表徵空間(Shared Latent Space),僅在解碼器結構不同而已
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
選項 (A) 正確刻劃三者本質:VAE 以顯式潛在變數(Explicit Latent Variable)與變分推斷建模,潛在空間結構清晰,利於跨模態語意對齊,但生成影像偏模糊、解析度有限;GAN 以對抗損失(Adversarial Loss)隱式學習分佈之間的映射,樣本銳利、品質高,但訓練不穩定、易發生模式崩潰;擴散模型以條件化去噪(Conditional Denoising)逐步生成,訓練穩定且樣本多樣,是目前高保真跨模態生成的主流路線。
【為何其他選項錯了?】
- (B):VAE 與擴散模型皆不依賴對抗式訓練,對抗訓練是 GAN 的特徵;GAN 也沒有顯式後驗估計,敘述完全顛倒。
- (C):VAE 與 GAN 都不使用馬可夫鏈(Markov Chain),逐步馬可夫過程是擴散模型的特徵;KL 散度最小化屬 VAE 目標函數的成分,整句概念錯置。
- (D):三者的潛在空間設計與訓練目標本質不同,並非共用同一潛在表徵空間、僅解碼器結構相異。
提示:VAE 顯式潛變數、GAN 對抗映射、Diffusion 條件去噪,三條技術路線各有取捨。
本題掛載於「生成式 AI 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在進行超參數調校(Hyperparameter Tuning)時,若直接在K-Fold交叉驗證(Cross-Validation)的資料上同時調整模型參數並評估效能,最可能導致下列哪一種問題?
A 模型的交叉驗證結果出現過度樂觀偏差(Over-optimistic Bias),因測試摺資料間接參與參數選擇,造成資料洩漏(Data Leakage)
B 模型會在每一摺(Fold)內反覆調整參數,導致訓練不穩與過度正則化
C 因交叉驗證資料被重複使用,造成效能方差增大,無法獲得穩定估計
D K-Fold 交叉驗證的假設與超參數搜尋相衝突,導致驗證過程失效
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
超參數選擇本身是一種學習行為。若在同一份 K-Fold 交叉驗證資料上,既用它挑選最佳參數,又以同一批分數宣稱模型效能,測試折的資訊已透過「選參數」的動作滲入模型決策,構成資料洩漏(Data Leakage),回報的效能因此帶有過度樂觀偏差(Over-optimistic Bias)。正確做法是巢狀交叉驗證(Nested Cross-Validation):內圈負責選參數、外圈負責估計效能,或保留一份從未參與調參的獨立測試集,故 (A) 正確。
【為何其他選項錯了?】
- (B):此做法不必然導致過度正則化或訓練不穩;問題出在效能「評估偏差」,而非訓練過程本身。
- (C):重複使用資料的核心問題是估計值系統性偏高(偏差),而非方差增大;即使估計方差很小,樂觀偏誤依然存在。
- (D):K-Fold 與超參數搜尋並不衝突,兩者搭配是常規做法;關鍵在以巢狀結構把「選參數」與「估效能」分離。
提示:同一份驗證資料同時用於選參數與報告效能,分數必然高估;以巢狀交叉驗證或獨立測試集將兩者隔開。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
若部署一個深度學習模型至金融風控系統,該模型採用鑑別式架構(如Transformer Classifier)。然而上線後,模型對新樣本的分類錯誤率顯著上升,經檢查發現,輸入資料分佈已與原訓練集明顯不同。針對此情形,下列哪一種應對策略最為適合?
A 改用生成對抗網路(GAN)生成新樣本並混入訓練集
B 改用邏輯迴歸模型(Logistic Regression)以提升穩定性
C 增加模型容量(Model Capacity),以學習更多樣本差異
D 使用變分自編碼器(VAE)監控潛在空間分佈,偵測輸入資料偏移
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
題目情境是輸入資料分佈已與訓練集明顯不同,即資料偏移(Data Drift),當務之急是建立偵測機制。變分自編碼器(VAE)可在訓練資料上學習輸入的潛在分佈;上線後持續將新樣本編碼,監控其潛在空間分佈與重建誤差,一旦輸入偏離訓練分佈,潛在表徵與重建誤差會出現明顯異常,即可及時偵測偏移、觸發告警與重訓流程。這是針對「發現並確認分佈偏移」最合適的策略。
【為何其他選項錯了?】
- (A):GAN 生成的樣本仍源自模型已學到的舊分佈,無法保證貼近新的真實分佈,以生成資料混入訓練集並不能解決分佈偏移問題。
- (B):換用邏輯迴歸只是簡化模型;輸入分佈改變時,簡單模型同樣失準,穩定性不會因此提升。
- (C):增加模型容量處理的是模型學習能力不足的問題;目前的問題是資料分佈改變,容量再大也無法涵蓋訓練時未出現的新分佈。
提示:面對分佈偏移,第一步是建立偵測機制;VAE 的重建誤差與潛在分佈是常用的漂移監控指標。
本題掛載於「VAE 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融科技公司欲導入 AI模型協助客服郵件自動分類(投訴、詢問、表揚)。團隊同時考慮兩種模型設計:方案 A(生成式路徑):採用 VAE建構潛在語意空間,再結合下游分類器進行標籤預測;方案 B(鑑別式路徑):採用 BERT Classifier 直接根據輸入文本進行監督式分類。現有標註資料約 2,000 筆,資料分佈均勻但擴充成本高。若團隊希望公平比較兩種模型的資料利用效率與泛化能力,下列哪一種實驗設計最能突顯兩者的本質差異?
A 在完整資料集上分別訓練兩者,並比較其分類準確率(Accuracy)與推論時間
B 在低資源情境(Low-resource Setting)下,逐步減少標註比例(100%、50%、10%),比較其F1-score
C 使用GAN 自動生成文本樣本補足資料,觀察兩模型在資料增強後的精確率(Precision)差異
D 在相同訓練資料上固定輸入維度,僅調整模型參數量,比較其對過擬合的敏感度
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
生成式路徑(VAE 建構潛在語意空間)的理論優勢是利用資料的潛在結構,對標註量的依賴較低;鑑別式路徑(BERT Classifier)在標註充足時通常準確率較高,但標註減少時表現衰退較明顯。要突顯兩者在資料利用效率與泛化能力上的本質差異,應設計低資源梯度實驗:將標註比例由 100% 逐步降至 50%、10%,比較各階段的 F1-score 衰退曲線,即可清楚觀察何者在資料稀少時仍能維持表現。
【為何其他選項錯了?】
- (A):僅在完整資料集上比較準確率與推論時間,無法呈現標註量變化對兩種路徑的影響,回答不了資料利用效率的問題。
- (C):以 GAN 生成文本補足資料會引入「生成品質」這個混淆變數,實驗結果混雜了資料增強效果,無法歸因於兩種模型路徑的本質差異。
- (D):固定資料僅調整參數量,檢驗的是模型容量與過擬合的關係,與資料利用效率是不同議題。
提示:比較資料利用效率的標準做法,是逐步縮減標註比例並觀察指標衰退曲線。
本題掛載於「生成式 AI 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電信公司希望建立一個模型來預測顧客是否即將流失,並進一步模擬不同促銷或服務策略下顧客的行為變化,以生成多樣化的虛擬樣本資料進行A/B 測試與行銷策略評估。若要同時兼顧預測與資料生成的需求,最適合採用下列哪一種方法?
A 使用傳統隨機森林(Random Forest)
B 使用邏輯迴歸(Logistic Regression)模型
C 使用變分自編碼器(Variational Autoencoder, VAE)或生成對抗網路(Generative Adversarial Network, GAN)
D 使用強化學習代理(Reinforcement Learning Agent)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題目同時提出兩類需求:預測顧客是否流失(判別能力),以及模擬不同策略下的行為變化、生成多樣化虛擬樣本供 A/B 測試(生成能力)。VAE 與 GAN 皆為生成模型,能學習顧客行為資料的分佈並取樣產生逼真的合成資料;VAE 的潛在空間還可進行情境操控,調整潛在向量以模擬不同策略下的行為變化,搭配下游分類器亦可支援流失預測,是唯一能同時兼顧預測與資料生成的選項。
【為何其他選項錯了?】
- (A):隨機森林是判別式模型,適合流失預測,但不具備學習資料分佈並生成新樣本的能力,無法滿足模擬資料的需求。
- (B):邏輯迴歸同屬判別式模型,只能輸出流失機率,無法生成虛擬顧客行為資料。
- (D):強化學習代理處理的是序列決策優化,例如學習最佳促銷策略本身,並非用於行為資料的生成與流失預測。
提示:題幹同時要求「預測」與「生成資料」時,指向 VAE、GAN 等生成模型;判別式模型只能輸出預測結果。
本題掛載於「生成式 AI 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
進行影像分類任務時,研究團隊嘗試利用主成分分析(Principal Component Analysis, PCA)將輸入特徵從 1024維降至100維,並將降維後的資料輸入支持向量機(Support Vector Machine, SVM)模型進行訓練。關於此作法,下列哪一項描述最為合理?
A PCA保留的主成分必然能提升 SVM 的分類準確率
B 使用原始高維資料通常更能保留資訊,因此 PCA沒有實際意義
C PCA可讓 SVM自動適用於非線性(Nonlinear)資料集
D 降維後可降低訓練時間並減少過擬合(Overfitting)風險
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
PCA 將特徵從 1024 維壓縮至 100 維後,特徵數大幅減少,SVM 的訓練計算量與記憶體需求隨之下降;同時濾除了低變異方向與部分雜訊,模型的自由度降低,有助於減少過擬合(Overfitting)風險。「降低訓練時間並減少過擬合風險」是對此作法最合理且未過度承諾的描述。
【為何其他選項錯了?】
- (A):「必然提升準確率」的說法過於絕對:PCA 只保留高變異方向,若關鍵判別資訊位於低變異成分,降維反而可能使準確率下降。
- (B):高維資料伴隨維度災難與高計算成本,PCA 在壓縮、去噪與加速上具有明確價值,「沒有實際意義」的論斷過於武斷。
- (C):PCA 是線性轉換,不會使資料變得線性可分;SVM 處理非線性資料依靠的是核技巧(Kernel Trick),並非 PCA 的功能。
提示:PCA 降維的可靠效益是計算加速與降低過擬合風險;「必然、保證提升準確率」之類的絕對化敘述通常是陷阱。
本題掛載於「降維 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業的AI 模型已部署於線上服務環境中,用於即時預測顧客流失機率。近期團隊注意到模型預測準確率逐漸下降,但系統運作正常且未出現錯誤訊息。經分析發現,近期輸入資料的分布與模型訓練資料相比出現顯著偏移。若要在 MLOps流程中主動偵測並預警此類問題,最應採用下列哪項措施?
A 建立即時的資料漂移(Data Drift)與概念漂移(Concept Drift)監測機制
B 將模型轉換為量化版本以降低延遲
C 增加模型超參數調整次數以強化適應性
D 使用固定隨機種子(Random Seed)確保訓練穩定
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題幹特徵:預測準確率逐漸下降、系統運作正常且無錯誤訊息、輸入資料分布與訓練資料出現顯著偏移,是典型的漂移場景。MLOps 的正解是建立即時監測機制:以 PSI、KL 散度等統計量監測輸入特徵分佈變化(資料漂移, Data Drift),以滾動視窗效能追蹤監測特徵與標籤關係的改變(概念漂移, Concept Drift),並設定告警門檻,超標即觸發調查或自動重訓,將被動發現轉為主動預警。
【為何其他選項錯了?】
- (B):模型量化是壓縮與加速手段,可降低延遲與資源需求,但無法處理資料分布改變造成的準確率下滑。
- (C):增加超參數調整次數仍是在既有訓練資料上優化;輸入分佈偏移的根本原因未處理,調參無法恢復效能。
- (D):固定隨機種子僅確保實驗結果可重現,與偵測線上資料分佈變化無關。
提示:「準確率漸降+系統無錯誤+分布偏移」即指向漂移監測;量化、調參、固定隨機種子都不是偵測機制。
本題掛載於「監控與維護 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融科技公司導入多任務學習架構,讓單一 Transformer 模型同時執行OCR(Optical Character Recognition)後的文檔分類以及命名實體辨識(Named Entity Recognition, NER)任務,以協助自動歸檔與抽取關鍵金融資訊。在部署初期,團隊發現當模型的NER準確率(Accuracy)提升時,文檔分類準確率反而下降。若模型架構正確且資料品質良好,下列哪一項最可能是造成此現象的原因?
A 模型架構無法同時支援文字分類與序列標註任務(Sequence Labeling)
B 文檔分類任務不需要語意化表徵(Contextualized Representation)
C 損失函數(Loss Function)未進行權重平衡,導致任務間競爭
D 所使用的 BERT模型無法支援多任務輸出頭(Multi-Head Outputs)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
多任務學習(Multi-task Learning)中,各任務共享同一套模型參數,總損失通常是各任務損失的加權和。若損失函數(Loss Function)未做權重平衡,量級較大或梯度較強的任務(此例的 NER)會主導參數更新方向,擠壓另一個任務的學習空間,出現一個進步、一個退步的此消彼長現象,也就是任務間競爭。解法包括手動調整損失權重、不確定性加權(Uncertainty Weighting)、GradNorm 或 PCGrad 等梯度調和技術。
【為何其他選項錯了?】
- (A):Transformer 共享編碼器加多個輸出頭,同時做分類與序列標註(Sequence Labeling)是成熟作法;題目也明說架構正確,此選項與前提矛盾。
- (B):文檔分類同樣仰賴語意化表徵(Contextualized Representation),說它不需要是明顯錯誤的敘述。
- (D):BERT 完全支援多任務輸出頭(Multi-Head Outputs),一個共享編碼器接多個輸出頭是標準設計。
提示:多任務中一個任務進步、另一個退步,是損失權重失衡的典型訊號;先做損失加權平衡或梯度調和。
本題掛載於「損失函數 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某數據工程師使用 DBSCAN演算法對一份數百萬筆的高維顧客資料進行聚類分析,但發現程式執行速度極慢,甚至出現記憶體不足的情況。若要在不改變演算法核心邏輯的前提下,最有效提升其運算效率的作法為何?
A 改用以平均連結(Average Linkage)為基礎的階層式群集法(Hierarchical Clustering)
B 採用高效率的距離索引結構(Distance Index Structure),例如KD-Tree 或 Ball Tree
C 將 ε(Epsilon)參數調得極小,以減少鄰近點的數量
D 在資料前處理時增加標準化後的特徵維度數
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
DBSCAN 的效能瓶頸在鄰域查詢:樸素實作需對每個點進行全對全的距離計算,時間複雜度為 O(n²),數百萬筆資料自然執行緩慢且消耗大量記憶體。導入 KD-Tree、Ball Tree 等高效率的距離索引結構(Distance Index Structure),可將單次鄰域查詢降至近似對數時間,大幅提升整體效率,且不改變 DBSCAN 的核心邏輯與聚類結果,正符合題目「不改演算法邏輯、只提升效率」的要求。
【為何其他選項錯了?】
- (A):改用平均連結的階層式群集法等於更換演算法,違反「不改變核心邏輯」的前提;且階層式分群的計算複雜度更高,無助於效率。
- (C):將 ε 調到極小雖會減少鄰近點數量,但聚類結果將徹底改變,幾乎所有點會被判為雜訊;這是改變了分析結果,而非提升運算效率。
- (D):增加特徵維度只會加重距離計算負擔並加劇維度災難,與提升效率的目標背道而馳。
提示:DBSCAN 執行過慢時優先導入空間索引(KD-Tree/Ball Tree),邏輯與結果不變、查詢加速。
本題掛載於「DBSCAN / HDBSCAN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電商平台導入 AI情感分析模型,用以自動偵測顧客評論中的負面情緒並觸發客服機制。然而,上線後發現模型在面對不同語言或族群書寫風格的評論時表現不一致,例如部分語氣強烈的正面評論被誤判為負面,而禮貌但含批評意圖的評論卻被判為中性。若從技術與資料治理的角度分析,下列哪一項描述不正確?
A 模型未啟用詞嵌入正規化(Embedding Normalization)可能造成語意距離不穩定,導致預測誤差
B 訓練語料若偏向特定文化或語氣特徵,可能使模型產生內隱偏誤(Implicit Bias)
C 模型若訓練資料來源不平衡,容易導致對不同語言或族群風格的情緒判斷不準確
D Transformer 架構能捕捉上下文語意,但若訓練資料偏差仍存在,模型仍可能學習到偏誤判斷
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題目要求挑出「不正確」的敘述。模型對不同語言、族群書寫風格表現不一致,根本原因是訓練語料的文化與語氣分佈偏差,屬於資料治理與公平性(Fairness)議題。選項 (A) 將問題歸因於「未啟用詞嵌入正規化(Embedding Normalization)」,但那只是數值處理細節,並非情感誤判的典型主因,更無法解釋「特定族群風格被系統性誤判」的模式;把資料偏差問題歸咎於單一技術設定,因此是錯誤敘述,為本題答案。
【為何其他選項錯了?】
- (B):此敘述正確,故非本題答案。語料偏向特定文化或語氣時,模型會把該文化的表達習慣當成通用標準,形成內隱偏誤(Implicit Bias)。
- (C):此敘述正確,故非本題答案。資料來源不平衡使少數風格樣本不足,對這些風格的情緒判斷自然失準,正是題目現象的合理解釋。
- (D):此敘述正確,故非本題答案。Transformer 架構雖能捕捉上下文語意,但模型學習的對象是資料;訓練資料存在偏差,模型仍會學到偏誤判斷。
提示:模型偏見的根源多在資料分佈;此類挑錯題,先找出把資料問題錯誤歸因於單一技術細節的選項。
本題掛載於「公平性與去偏見 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某設計師使用公司內部建置的生成式 AI工具製作行銷素材,並輸入提示語(Prompt):「請生成一張模特兒手持品牌飲料、背景為海邊夕陽的照片」。系統能正確生成主要主題與場景,但輸出的圖像中,品牌標誌顏色常有誤差,或人物手部姿勢顯得不自然。若從多模態生成模型的技術機制分析,此現象最可能是下列哪一項原因所造成?
A 擴散式生成模型的去雜訊過程出現隨機梯度漂移,導致影像像素錯誤
B 提示語過長造成 Transformer 的位置編碼超出上下文限制,導致生成混亂
C CLIP 模型中的文字編碼器與影像編碼器在語意嵌入空間未充分對齊,導致跨模態理解偏差
D 模型未採用對比學習(Contrastive Learning)損失函數,無法建立多模態語意關聯
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
文生圖系統(如 Stable Diffusion)依賴 CLIP 類的文字編碼器將提示語轉為語意向量,引導擴散過程生成影像。若文字編碼器與影像編碼器的語意嵌入空間對齊不充分,細粒度語意(品牌標誌的特定顏色、手部的精細結構)在跨模態轉換時容易失真,呈現「整體主題與場景正確、局部細節出錯」的典型症狀,與題幹中標誌色偏、手部姿勢不自然的現象一致,故 (C) 是最可能的原因。
【為何其他選項錯了?】
- (A):「隨機梯度漂移」並非擴散模型去噪過程的既有機制;去噪由訓練完成的雜訊預測網路執行,不存在此選項所述的現象。
- (B):題幹的提示語相當簡短,遠未超出上下文限制;位置編碼超限造成的是整體生成混亂,而非僅細節出錯、主體正常。
- (D):CLIP 本身就是以對比學習(Contrastive Learning)訓練的模型,「未採用對比學習」與事實不符;問題在於對齊的充分程度,而非有無使用。
提示:文生圖「大方向正確、細節失準」的症狀,優先考慮 CLIP 圖文嵌入空間對齊不足。
本題掛載於「Diffusion 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。