iPAS 歷屆考題 · 中級
114年第二梯次中級AI應用規劃師 大數據處理分析與應用
第二科 · 共 50 題 · 每題附正解與逐選項詳解,「觀念複習」直達對應教學節點。
50 題
中級第二科
建議先自行作答再展開詳解;每題可透過「觀念複習」回到掛載該題的知識節點。試題著作權屬原主辦單位,本站解析僅供考生學習之用。
若某數據點的Z 分數(Z-Score)= 2,請問代表下列哪一種意涵?
A 代表該數據點之原始數值為 2
B 該數據點比平均值低 2個標準差
C 代表數據為異常值
D 該數據點比平均值高 2個標準差
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
Z 分數的定義是 Z = (原始值 − 平均值) ÷ 標準差,代表該數據點距離平均值幾個標準差。Z = 2 表示這個點落在平均值之上 2 個標準差的位置;若低於平均值,Z 會是負數。Z 分數把不同單位、不同尺度的資料換算到同一基準,是標準化與異常值判斷的基礎工具。
【為何其他選項錯了?】
- (A):Z 分數是「相對位置」而非原始數值本身,Z = 2 不代表原始值等於 2;原始值須由平均值與標準差換算還原。
- (B):方向相反。比平均值低 2 個標準差的點,其 Z 分數是 −2;正負號正是 Z 分數的方向資訊。
- (C):Z = 2 只能說明數值偏高,尚不足以判定異常。實務上常以 |Z| ≥ 3 作為異常值門檻;常態分佈下 Z = 2 以外仍約有 2.3% 的資料,直接判為異常過於武斷。
提示:Z 分數 = (x − μ)/σ,正號在平均值之上、負號在平均值之下,數值即偏離的標準差個數。
本題掛載於「標準化 / Robust 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
使用Python的 pandas套件處理各商品銷售數據(變數為 df)時,若需計算「總銷售額」欄位的敘述性統計量(如平均值、標準差等),應使用下列哪一種語法?
A df['總銷售額'].sum()
B df['總銷售額'].describe()
C df['總銷售額'].sort_values()
D df['總銷售額'].stats()
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
pandas 的 describe() 會一次輸出欄位的敘述性統計量:筆數(count)、平均值(mean)、標準差(std)、最小值、四分位數與最大值,正是題目所需「平均值、標準差等敘述統計」的完整摘要。對數值欄位進行探索性分析時,df['欄位'].describe() 是最直接的方法,一行程式碼即可取得該欄位的整體統計輪廓。
【為何其他選項錯了?】
- (A):sum() 只回傳總和一個數值,屬於聚合運算,無法取得平均值與標準差等統計摘要。
- (C):sort_values() 只是將資料由小到大排序,不會產生任何統計量。
- (D):pandas 的 Series 並沒有 stats() 這個方法,執行會拋出 AttributeError。
提示:要一次取得 count、mean、std、min、四分位數、max,使用 describe()。
本題掛載於「5. 探索分析 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某資料之分佈圖(直方圖搭配密度曲線)顯示:峰值位於 Value 約 40 處,分佈右側在 60 附近即快速下降截止,左側則有一條長尾一路延伸至約 -20。此資料之偏態(Skewness)值較有可能為下列哪個選項?
A Skewness < 0
B Skewness > 0
C Skewness = 0
D 無法計算 Skewness
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
偏態(Skewness)的方向由長尾延伸的方向決定。本題分佈的峰值在右側(約 40 處),左側有一條長尾一路延伸至約 -20,屬於左偏(負偏)分佈,Skewness < 0。判斷要領:尾巴在左為負偏、尾巴在右為正偏,與峰的位置無關;峰看起來偏右,正是因為長尾被拉往左側,判讀時不可被峰的位置誤導。
【為何其他選項錯了?】
- (B):Skewness > 0 是右偏分佈,長尾應延伸向右側(大值方向),例如所得分配常見的右尾拖長形狀,與本圖相反。
- (C):Skewness = 0 代表左右對稱(如常態分佈);本圖左尾明顯長於右尾,並不對稱。
- (D):偏態是三階動差統計量,只要有數值資料即可計算,不存在「無法計算」的情形。
提示:偏態方向跟著尾巴走:左尾長為負偏(< 0),右尾長為正偏(> 0)。
本題掛載於「分佈 / 偏態 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
累積分佈函數(Cumulative Distribution Function, CDF)可用於描述隨機變數的機率分佈特性,其數學定義為下列何者?
A 機率密度函數(Probability Density Function, PDF)的平均值
B 機率密度函數(Probability Density Function, PDF)的積分
C 機率密度函數(Probability Density Function, PDF)的離散總和
D 機率密度函數(Probability Density Function, PDF)的標準差
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
累積分佈函數 CDF 的定義是 F(x) = P(X ≤ x),即隨機變數小於等於 x 的機率。對連續型隨機變數而言,F(x) 等於機率密度函數 PDF 從負無窮大積分到 x 的結果;反過來說,PDF 是 CDF 的微分。這組「積分與微分」的互逆關係是機率論的基本性質,也是理解連續分佈的關鍵。
【為何其他選項錯了?】
- (A):PDF 的平均值並無對應的機率意義;期望值的定義是 x 乘上 f(x) 後積分,並非對密度函數本身取平均。
- (C):離散總和是離散型隨機變數以 PMF(機率質量函數)累加的做法;題目所指為 PDF(連續型),應使用積分而非加總。
- (D):標準差描述分佈的離散程度,與 CDF 的定義無關。
提示:連續型:CDF 為 PDF 的積分,PDF 為 CDF 的微分;離散型才以 PMF 加總。
本題掛載於「分佈 / 偏態 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在進行資料前處理時,若使用 Label Encoding 將類別變數轉換為數字型態,下列何者為最常見的潛在風險?
A 無法處理缺值
B 會引入類別之間的虛假順序關係
C 無法擴展至新資料
D 記憶體佔用過高
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
Label Encoding 把類別直接對應成 0、1、2 等整數。問題在於整數天生有大小順序,若原本的類別是無序的(如紅、綠、藍),模型(尤其是線性模型與距離型演算法)會誤以為「藍 > 綠 > 紅」,或認為某兩類的距離比另外兩類更遠。這種憑空產生的順序關係就是虛假順序,會誤導模型學習,是 Label Encoding 最常見的潛在風險。
【為何其他選項錯了?】
- (A):缺值處理與編碼方式是兩回事;Label Encoding 前後都可以另行補值,這不是它特有的風險。
- (C):新資料出現未見過的類別確實會使編碼器出錯,但這是所有編碼方法共同的工程問題(可用 unknown 類別處理),並非 Label Encoding 特有且最常見的核心風險。
- (D):Label Encoding 每個類別只佔一個整數欄位,記憶體用量反而最低;佔用記憶體的是 One-Hot 將單欄展開成大量欄位的情況。
提示:無序類別使用 Label Encoding 會引入虛假順序;無序用 One-Hot,有序才考慮 Label Encoding。
本題掛載於「One-hot / Label 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在進行資料分析時,會遇到類別型(Categorical)與數值型(Numerical) 資料格式。關於這兩種資料格式的處理,下列敘述何者不正確?
A One-Hot編碼(One-Hot Encoding)會將類別變數轉換為多維二元向量,適用於無序(Nominal)類別資料,但在高基數(High Cardinality)特徵下可能造成維度爆炸問題
B 標籤編碼(Label Encoding)會以整數表示不同類別,若應用於無序(Nominal)資料,可能導致模型誤將編碼值解讀為具數值大小關係的特徵
C 標準化(Standardization)透過將資料平移與縮放,使其平均值為0、標準差為 1,可在多數距離型演算法中改善收斂速度,並同時將數值範圍壓縮至 0 至 1 之間
D 對連續變數進行分箱(Binning)可提升模型可解釋性,但若分段方式未依據資料分佈特性設計,可能導致資訊損失或邊界偏誤
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
本題選「不正確」的敘述。標準化(Standardization)是把資料減去平均值再除以標準差,轉換後平均值為 0、標準差為 1,但數值範圍「沒有」被限制在 0 到 1 之間,理論上任何實數皆可能出現。把範圍壓縮到 0 至 1 的是 Min-Max 正規化(Normalization)。選項 (C) 前半段正確,最後一句把兩種方法混為一談,因此是不正確的敘述,即為本題答案。
【為何其他選項錯了?】
- (A):此敘述正確:One-Hot 編碼把類別展開成二元向量,適用於無序資料;類別數量多(高基數)時會造成維度爆炸。
- (B):此敘述正確:Label Encoding 以整數代表類別,套用在無序資料上,模型可能誤讀出不存在的大小關係。
- (D):此敘述正確:分箱能提升可解釋性,但切點未依資料分佈設計時,會損失資訊或產生邊界偏誤。
提示:Standardization 轉換後 μ=0、σ=1、範圍不設限;Min-Max 才把數值壓縮到 [0,1],兩者定義須嚴格區分。
本題掛載於「標準化 / Robust 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在資料庫的ACID 特性中,下列何者為「原子性(Atomicity)」的正確定義?
A 所有資料欄位必須為相同型別
B 每次交易需以批次方式執行
C 交易不可分割,需完全成功或完全失敗
D 系統會自動同步交易資料至所有節點
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
原子性(Atomicity)指交易(Transaction)是不可分割的最小工作單位:交易內的所有操作必須全部成功提交,只要其中一步失敗,整筆交易即回復(Rollback)至交易前狀態,不允許「執行一半」的中間狀態存在。經典例子是轉帳:扣款與入帳必須同時生效或同時取消,不能只扣款而未入帳,故 (C) 正確。
【為何其他選項錯了?】
- (A):欄位型別是否一致屬於資料表結構(Schema)設計議題,不在 ACID 四項特性的範疇內。
- (B):批次執行是排程與效能策略;交易可以單筆執行,原子性的要求與是否批次無關。
- (D):自動同步交易資料至所有節點是分散式系統的複寫(Replication)機制,與可用性、持久性較相關,並非原子性的定義。
提示:ACID 四特性:原子性為全有或全無、一致性為規則不被破壞、隔離性為交易互不干擾、持久性為提交後永久保存。
本題掛載於「ACID / Schema 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
資料科學家為分析顧客行為,利用現有欄位「銷售金額」與「瀏覽次數」,計算出新變數「銷售金額/瀏覽次數」。此動作屬於下列哪一類特徵工程方法?
A 特徵選擇(Feature Selection)
B 特徵衍生(Feature Derivation)
C 特徵轉換(Feature Transformation)
D 分箱處理(Binning)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
以既有欄位「銷售金額」與「瀏覽次數」相除,創造出原本不存在的新欄位「單次瀏覽平均銷售額」,這種「由既有特徵組合運算產生新特徵」的做法就是特徵衍生(Feature Derivation),也常稱特徵建構(Feature Construction)。它為模型補上原始欄位未直接表達的資訊(此處為轉換效率),是特徵工程中常見的加值手法。
【為何其他選項錯了?】
- (A):特徵選擇是「從現有特徵中挑選重要者、移除不重要者」,做的是刪減;本題是產生新欄位,方向相反。
- (C):特徵轉換是對特徵做數學變換(如取對數、標準化),語意不變、僅改變尺度或分布;本題是兩個欄位運算出語意全新的欄位。
- (D):分箱是把連續數值切成區間(如年齡分組),與兩欄相除產生新變數無關。
提示:選擇是挑減特徵、轉換是變換尺度、衍生是以既有欄位計算出新欄位。
本題掛載於「7. 特徵建模 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在進行數值特徵的標準化(Normalization)時,若資料中存在極端值(Outliers),下列哪一種方法最適合使用?
A Min-Max正規化(Min-Max Scaling)
B Z-score標準化(Z-score Normalization)
C 穩健縮放(Robust Scaling)
D 標準分箱(Standard Binning)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
穩健縮放(Robust Scaling)以中位數與四分位距(IQR)進行縮放:(x − 中位數) ÷ IQR。中位數與 IQR 都是對極端值不敏感的穩健統計量,因此即使資料中存在數筆極端離群值,大多數資料的縮放結果也不會受其影響,是含離群值資料的首選縮放方法。
【為何其他選項錯了?】
- (A):Min-Max 以最大值與最小值決定縮放範圍,而極端值往往就是最大值或最小值,單一離群值即可把其餘資料壓縮到極窄的區間,是對離群值最敏感的縮放法。
- (B):Z-score 以平均值與標準差計算,兩者皆會被極端值影響(平均值被拉偏、標準差被撐大),縮放結果同樣失真,只是影響程度略低於 Min-Max。
- (D):分箱是離散化手段,不屬於標準化或縮放方法,與題目需求不符。
提示:資料含離群值時,採用以中位數與 IQR 為基礎的 Robust Scaling。
本題掛載於「標準化 / Robust 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
下列哪一種情境最適合應用異常偵測(Anomaly Detection)技術?
A 根據歷史銷售資料預測特定商品在旺季期間是否會出現供貨短缺,以提前調整庫存策略
B 透過信用風險模型預測顧客是否可能發生違約,以輔助核貸決策
C 即時分析金融交易資料流,偵測與平常交易行為明顯不同的可疑交易紀錄
D 監控線上服務平台的使用者登入次數,預測次日的登入量變化趨勢
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
異常偵測(Anomaly Detection)的任務是找出與大多數樣本行為模式明顯不同的個體,異常樣本通常極少、甚至沒有標籤,重點在衡量樣本偏離常態模式的程度。即時分析交易資料流、偵測與平常行為明顯不同的可疑交易(如盜刷、洗錢),正是異常偵測的典型應用場景。
【為何其他選項錯了?】
- (A):預測旺季是否缺貨屬於需求預測與時間序列預測問題,目標是估計未來數值,不是找出異常個體。
- (B):信用違約預測是典型的監督式二元分類,有歷史標籤(違約/未違約)可供學習,建模邏輯與異常偵測不同。
- (D):預測次日登入量屬於趨勢預測(迴歸或時間序列),關注整體數量的走勢,而非偵測單筆異常行為。
提示:「找出與多數樣本明顯不同的個體」對應異常偵測;「預測未來數值」對應預測模型。
本題掛載於「離群值偵測 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
若一家公司需即時監控大量物聯網裝置的異常行為,下列哪一種組合最適合此應用?
A 傳統關聯式資料庫+圖形視覺化
B 批次資料處理+雲端備份
C 大數據平台+即時資料分析技術
D Word文件+手動標註
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題幹有兩個關鍵條件:「大量物聯網裝置」與「即時監控」。大量裝置持續回傳資料,資料量(Volume)與產生速度(Velocity)遠超過傳統單機系統的負荷,需要大數據平台提供分散式儲存與運算能力;「即時」偵測異常行為則需要串流處理(Stream Processing)等即時資料分析技術,在資料抵達時立即運算與告警。兩者組合才能同時滿足規模與時效需求,故 (C) 正確。
【為何其他選項錯了?】
- (A):傳統關聯式資料庫在高頻寫入與巨量資料場景下,效能與擴充性不足;圖形視覺化只是呈現手段,無法解決處理能力問題。
- (B):批次處理的運作模式是累積資料後定期執行,與「即時監控」的需求相矛盾;雲端備份屬資料保全機制,不具分析能力。
- (D):Word 文件與手動標註是人工作業方式,面對大量裝置持續產生的資料流,在速度與規模上皆不具可行性。
提示:題幹同時出現「巨量」與「即時」,對應大數據平台加串流即時分析的組合。
本題掛載於「階段 4 大數據/ML 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在處理分類問題時,若某一類樣本數明顯少於其他類別,研究人員可能採用隨機過採樣(Random Oversampling)以平衡資料比例,此方法最常造成下列哪一種問題?
A 增加過擬合風險
B 降低模型的收斂速度
C 減少資料總筆數數量
D 導致訓練資料欄位缺失
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
隨機過採樣是把少數類樣本原封不動地複製,直到類別比例平衡。同一批樣本重複出現多次,模型會反覆看到完全相同的資料點,容易記憶這些特定樣本的細節,而非學到少數類的一般化模式,因此過擬合(Overfitting)風險上升是它最常見的問題。SMOTE 之類的合成方法正是為了緩解此問題而提出。
【為何其他選項錯了?】
- (B):過採樣增加了訓練樣本數,訓練時間可能拉長,但「收斂速度降低」不是它的典型副作用,更不是最常見的問題。
- (C):過採樣是複製樣本,資料總筆數只會增加不會減少;會減少筆數的是欠採樣(Undersampling)。
- (D):複製既有樣本不會產生缺失欄位,資料完整性不受影響。
提示:隨機過採樣=重複複製少數類,重複越多越容易被模型記憶,導致過擬合;欠採樣=丟棄多數類,造成資訊損失。
本題掛載於「樣本不平衡 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
下列何者為同態加密(Homomorphic Encryption)技術的核心特性?
A 將資料轉換為匿名識別碼以隱藏身分
B 對資料進行標準化處理以提升模型精度
C 自動偵測與排除異常值
D 可直接在加密狀態下進行數據運算
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
同態加密(Homomorphic Encryption)的核心特性是:資料加密後仍可直接在密文上執行運算,運算結果解密後與對明文執行相同運算的結果一致。這使雲端服務商能在看不到原始資料的前提下代為計算,兼顧運算外包與隱私保護,是隱私強化技術(PETs)中的重要成員。
【為何其他選項錯了?】
- (A):把資料換成匿名識別碼屬於匿名化/假名化(Pseudonymization)的作法,資料本身仍是明文,與「加密狀態下運算」無關。
- (B):標準化是特徵縮放的前處理手段,目的在改善模型訓練,與加密技術屬於不同領域。
- (C):自動偵測與排除異常值屬於資料清理與異常偵測的工作,與同態加密無關。
提示:題幹關鍵在「加密狀態下直接運算」;匿名化、標準化、異常值處理皆與密文運算無關。
本題掛載於「隱私 / 治理 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某組資料共 10 項標籤如下:A, A, A, A, A, B, B, B, B, B。若該標籤僅有 A、B 兩種,請問這組資料的「正規化吉尼不純度(Normalized Gini impurity)」為何?
A 0
B 0.42
C 0.84
D 1
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
吉尼不純度的公式為 Gini = 1 − Σp²。本題 A、B 兩類各 5 筆,p(A) = p(B) = 0.5,故 Gini = 1 − (0.25 + 0.25) = 0.5。正規化吉尼不純度(Normalized Gini Impurity)是再除以該類別數之下的最大可能值:二類別時最大不純度發生在兩類各半的情形,值為 0.5,因此 Normalized Gini = 0.5 ÷ 0.5 = 1。兩類完全均勻混合是不純度最高的狀態,正規化後即為最大值 1。
【為何其他選項錯了?】
- (A):0 代表節點完全純淨,即全部樣本同屬一類(例如 10 筆皆為 A);本題兩類各半,是最混雜而非最純的情況,恰為另一個極端。
- (B):0.42 對不上正確計算;兩類比例為 7:3 時未正規化的 Gini 才約為 0.42,本題比例是 5:5。
- (C):0.84 同樣沒有計算依據;本題未正規化的 Gini 為 0.5,正規化後為 1,兩者皆非 0.84。
提示:二元分類的 Gini 最大值為 0.5,發生在兩類各半;正規化即除以最大值,故兩類各半時 Normalized Gini = 1。
本題掛載於「決策樹/隨機森林 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某家客服中心統計資料發現,平均每小時會接到約 20通顧客來電,但每分鐘的來電數量不固定,可能為 0、1、2 通不等。這些來電事件彼此獨立,且在短時間內,發生的機率與時間長短成正比。若要以機率模型描述「每分鐘接到幾通來電」的機率分佈,下列哪一種最適合使用?
A 均勻分佈(Uniform distribution)
B 指數分佈(Exponential distribution)
C 卜瓦松分佈(Poisson distribution)
D 常態分佈(Normal distribution)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
題目描述的正是卜瓦松分佈的經典適用條件:計數型隨機變數(每分鐘來電「幾通」)、事件彼此獨立、短時間內發生機率與時間長短成正比,且平均發生率固定(每小時約 20 通)。卜瓦松分佈專門描述「單位時間(或空間)內事件發生次數」的機率,如來電數、瑕疵數、事故數,本題情境完全符合。
【為何其他選項錯了?】
- (A):均勻分佈假設每個值出現機率相同,但各種來電數量的發生機率顯然不同,不符合情境。
- (B):指數分佈描述的是「兩次事件之間的等待時間」,屬連續型,而非「單位時間內的發生次數」(離散型);兩者是卜瓦松過程的一體兩面,須注意區分。
- (D):常態分佈是連續型且允許負值,來電數是非負整數的計數資料,本質不符;只有在平均數很大時才適合以常態近似。
提示:「單位時間發生幾次」用卜瓦松分佈;「等多久才發生下一次」用指數分佈。
本題掛載於「分佈 / 偏態 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融科技公司以 Z分數(Z-Score)監控交易金額異常狀況。若交易金額平均為新台幣 2,000 元,標準差為400 元,某筆交易金額為 3,200元,且公司以|Z| ≥ 3 判定為異常值(Outlier),下列判斷何者最為正確?
A 該筆交易的 Z分數為 3,應標記為異常值
B 該筆交易的 Z分數為 2.5,屬於合理變異範圍
C 該筆交易的 Z分數為 2,顯示模型標準差估計過高
D 該筆交易的 Z分數為 1.5,無須納入異常檢測
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
直接代入公式:Z = (3200 − 2000) ÷ 400 = 1200 ÷ 400 = 3。公司的判定規則為 |Z| ≥ 3 即為異常值,Z = 3 恰好落在門檻上,由於門檻包含等號,仍符合判定條件,因此該筆交易應標記為異常。本題的關鍵在於門檻含等號,「恰好等於 3」即已達標,不可誤判為未超過門檻。
【為何其他選項錯了?】
- (B):Z 值計算錯誤,(3200 − 2000) ÷ 400 = 3,並非 2.5;Z 值既然錯誤,「屬於合理變異範圍」的後續推論也不成立。
- (C):Z = 2 同樣是計算錯誤;且「標準差估計過高」是題目資訊無法支持的推論,題幹並未提供任何關於估計品質的線索。
- (D):Z = 1.5 仍是計算錯誤;若 Z 值確實只有 1.5 固然不構成異常,但該前提與正確計算結果不符。
提示:Z = (x − μ)/σ;判定異常時須確認門檻是「>」還是「≥」,邊界值正是本題的判斷重點。
本題掛載於「離群值偵測 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電商公司欲利用顧客行為資料建立消費預測模型,其中「會員等級」欄位包含「一般、白金、黑卡」三種類別。若模型採用梯度提升樹(Gradient Boosting Tree)演算法,資料科學家在進行特徵編碼時應特別注意下列何種情況?
A 應優先採用獨熱編碼(One-Hot Encoding),以減少類別之間的相依性與記憶體使用量
B 直接使用標籤編碼(Label Encoding)可能使模型誤判類別間存在順序關係,導致特徵重要性偏誤
C 使用目標編碼(Target Encoding)會自動消除過擬合(Overfitting)風險
D 若類別數量較少,建議先使用主成分分析(Principal Component Analysis, PCA)進行降維
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
「一般、白金、黑卡」雖有隱含等級,但若未經確認就直接使用 Label Encoding,編碼出的整數會被模型當成可比較、可加減的數值;若編碼順序與真實等級或貢獻不一致,樹模型分裂時就可能產生系統性偏差,並扭曲特徵重要性的解讀。因此使用標籤編碼時必須特別注意此風險,(B) 是最貼近實務的提醒。
【為何其他選項錯了?】
- (A):One-Hot 是把一欄拆成多欄,維度與記憶體是增加而非減少;對樹模型還會稀釋單一特徵的分裂效益,「優先採用」與「減少記憶體」兩點皆不成立。
- (C):目標編碼以容易過擬合聞名(尤其是小樣本類別),需搭配平滑或交叉驗證緩解;「自動消除過擬合風險」把它的主要缺點誤述為優點。
- (D):PCA 用於連續數值特徵降維;類別只有三種並無降維需求,也不適合直接對類別變數做 PCA。
提示:標籤編碼一經編號即隱含排序;樹模型雖相對耐受,仍應驗證編碼順序與真實等級是否一致。
本題掛載於「One-hot / Label 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某人工智慧團隊使用分散式資料庫(Distributed Database)儲存模型訓練資料,並在更新訓練樣本時啟用多節點交易。若其中一個節點在交易過程中發生錯誤,但系統仍確保整體資料不會出現部分更新、最終狀態維持一致,下列何者最能說明此現象?
A 系統透過原子性(Atomicity)確保交易必須全部成功或全部回復(Rollback)
B 系統透過一致性(Consistency)確保交易完成後資料符合完整性規則
C 系統透過隔離性(Isolation)避免多筆交易同時存取或修改相同資料
D 系統透過持久性(Durability)確保交易一旦提交,其結果將永久保留於資料庫中
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題幹關鍵句是「其中一個節點發生錯誤,但系統確保整體資料不會出現部分更新」。這正是原子性(Atomicity)的作用:交易是全有或全無的工作單位,任一步驟失敗,整筆交易回復(Rollback)至交易前狀態,不留下部分更新的中間結果。分散式交易協定(如兩階段提交)要保障的正是跨節點的原子性,故 (A) 正確。
【為何其他選項錯了?】
- (B):一致性(Consistency)描述交易前後資料皆滿足完整性規則(如餘額不得為負),是原子性等機制共同達成的結果狀態;題幹強調「不部分更新、全部回復」的機制本身,核心是原子性。
- (C):隔離性(Isolation)處理「多筆交易並行」時互不干擾的問題;題幹是單筆交易執行中出錯,沒有並行衝突情境。
- (D):持久性(Durability)保證「已提交」的交易結果永久保存;本題交易未成功提交而回復,不涉及持久性。
提示:失敗即全部回復、不留部分更新對應原子性;並行互不干擾對應隔離性;提交後不遺失對應持久性。
本題掛載於「ACID / Schema 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某製造企業導入上萬台物聯網(IoT)感測器以進行設備健康監測。系統需在毫秒級回應異常事件,並同時將完整資料保留於雲端供後續 AI 模型訓練與分析。若企業希望兼顧即時性、資料完整性與可擴展性,下列哪一種資料流程設計最符合此目標?
A 感測器 → 雲端 API Gateway → 分散式資料庫 → 批次特徵工程 → 模型推論
B 感測器 → MQTT Broker → 雲端資料倉儲 → 即時儀表板 → 模型再訓練
C 感測器 → 邊緣運算節點 → 流式資料處理框架(Stream Processing Framework)→ 雲端資料湖 → 模型推論
D 感測器 → 本地快取層 → RESTful API → 雲端報表系統 → 模型批次更新
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
需求拆解:毫秒級回應異常,運算必須靠近資料來源,由邊緣運算節點就地執行即時初步處理與告警;持續不斷的感測資料流,以流式資料處理框架(如 Kafka 搭配 Flink 或 Spark Streaming)進行即時分析;完整資料保留供後續模型訓練,落地於雲端資料湖,保存原始明細且易於水平擴展。「邊緣、串流、資料湖、推論」的組合同時滿足即時性、資料完整性與可擴展性,是 IoT 即時架構的標準設計,故 (C) 正確。
【為何其他選項錯了?】
- (A):流程中的「批次特徵工程」與毫秒級即時回應互斥,異常事件須等待下一個批次才會被處理,無法滿足設備健康監測的即時需求。
- (B):MQTT Broker 收集資料可行,但直接寫入資料倉儲屬於結構化批次分析路線;即時儀表板供人員檢視,無法達成毫秒級的自動異常回應。
- (D):本地快取、RESTful API 與報表系統整條路徑皆為請求回應與報表思維,缺少串流處理與資料湖,即時性與擴展性均不足。
提示:IoT 即時監測三要件:邊緣運算(低延遲)、串流處理(即時分析)、資料湖(完整保留原始資料)。
本題掛載於「ETL / ELT 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某銀行計畫將信用風險評估模型部署至雲端平台,以便即時分析客戶交易行為。由於涉及大量敏感金融資料,銀行要求雲端服務商在不解密原始資料的情況下仍能執行模型運算。為達成此目標,最適合採用下列哪一項技術?
A 在上傳資料前進行匿名化(Anonymization),僅保留可識別代碼供比對使用
B 利用雜湊(Hash)函數轉換資料,以確保模型可追蹤但無法還原個資
C 採用資料本地化(Data Localization)策略,將所有模型訓練限制於內部伺服器中
D 透過同態加密(Homomorphic Encryption),讓雲端系統能直接在加密資料上執行運算,解密後結果與原始資料一致
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
銀行的核心需求是「雲端服務商在不解密原始資料的情況下仍能執行模型運算」。同態加密(Homomorphic Encryption)正是為此設計:資料以密文形式上傳,雲端直接對密文執行運算,結果回傳後由銀行解密,且解密後的結果與對明文執行相同運算的結果一致。資料在傳輸、儲存、運算全程維持加密,雲端自始至終接觸不到明文,故 (D) 正確。
【為何其他選項錯了?】
- (A):匿名化只是移除或替換識別欄位,其餘交易資料仍為明文,雲端仍可讀取內容,且匿名化資料存在重新識別風險,不符「不解密仍能運算」的要求。
- (B):雜湊是單向轉換,雜湊值僅適合比對用途,無法用於有意義的數值模型運算,滿足不了「執行模型運算」的需求。
- (C):資料本地化是將運算全部保留在內部伺服器,等於放棄雲端即時分析,未回應題幹「部署至雲端」的目標。
提示:「不解密也要能運算」是同態加密的專屬特徵;匿名化防識別、雜湊供比對、本地化不上雲,皆不符合此需求。
本題掛載於「隱私保護技術 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某資料分析師設計在業務績效報告時,希望單一頁面中同時呈現多區域、不同產品線的銷售趨勢變化,並確保主管能在短時間內掌握整體資料走向。若依據 Edward Rolf Tufte 的數據密度(Data Density) 原則,下列哪一種設計方式最能符合該概念?
A 將每個區域的銷售資料分成多張獨立折線圖,以避免資訊重疊
B 使用顏色區分產品線,於同一圖表中整合多區域趨勢線,保持比例一致且標註清晰
C 移除所有輔助線與標籤,僅保留主要折線以凸顯趨勢
D 將資料轉換為表格形式,確保數值精確呈現並取代圖表視覺化
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
Tufte 的數據密度(Data Density)原則主張:在同樣版面中呈現越多「有效」資訊越好,同時維持清晰可讀,以最少的墨水、最小的空間傳達最多的資料。把多區域、多產品線的趨勢用顏色區分、整合在同一張比例一致、標註清晰的圖表中,單位面積承載的資訊量最高,主管能在單一畫面比較整體走向,正是高數據密度的實踐。
【為何其他選項錯了?】
- (A):拆成多張獨立小圖會稀釋版面的資訊密度,且各圖比例尺不一致時難以互相比較,違背「單一頁面快速掌握整體」的目標。
- (C):將輔助線與標籤全部移除是誤解了 Tufte 的「去除圖表垃圾(Chartjunk)」概念,應刪除的是無意義的裝飾,而非有助判讀的必要標註;刪除過度會使圖表失去可讀性。
- (D):表格適合精確查詢數值,但要觀察「趨勢走向」時,人眼難以從大量數字中辨識變化,這正是視覺化的價值所在。
提示:Data Density 等於單位面積的有效資訊量;刪裝飾不刪資訊,整合而不雜亂。
本題掛載於「視覺化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某投資研究員希望分析四檔科技類股(A、B、C、D)每日報酬率的變化趨勢,以判斷這些股票之間是否存在高度相關性與共變動性,並評估投資組合分散風險的程度。若研究員希望以單一圖表快速呈現各股票間的關聯強度與方向,下列哪一種視覺化呈現方式最適合?
A 為每檔股票各自繪製直方圖(Histogram)以比較報酬率分佈
B 針對任兩檔股票繪製散佈圖並加上趨勢線(Regression Line)
C 使用雙軸折線圖(Dual-axis Line Chart)同時顯示四檔股價變化
D 熱力圖(Heatmap)配合相關係數矩陣(Correlation Matrix)
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
需求是以「單一圖表」同時呈現「四檔股票兩兩之間」的關聯強度與方向。四檔股票共有 6 組配對,先計算相關係數矩陣,再以熱力圖用顏色深淺編碼強度、色系區分正負,一張圖即可完整呈現 6 組關係,也能直接檢視投資組合的分散程度(相關性越低越分散),是多變數相關分析的標準呈現方式。
【為何其他選項錯了?】
- (A):直方圖只能觀察「單檔」報酬率的分佈形狀,無法呈現股票「之間」的關聯。
- (B):散佈圖加趨勢線一次只能觀察一對股票,6 組配對需要 6 張圖,不符合「單一圖表快速呈現」的要求。
- (C):雙軸折線圖顯示的是價格時間序列,「看起來同漲同跌」只是主觀印象,無法量化關聯強度與方向,且四條序列擠在兩條軸上判讀困難。
提示:多變數兩兩相關用相關係數矩陣加熱力圖;單變數分佈用直方圖;單一配對關係用散佈圖。
本題掛載於「相關 / 關聯 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某研究團隊以單樣本 t檢定(one-sample t-test)檢驗「新行銷策略後的平均月銷售額是否與原本的 100 萬元不同」,顯著水準設定為 α =0.05。檢定結果顯示:p值=0.08,且95%信賴區間為 [95 萬元, 108 萬元]。根據上述結果,下列敘述何者正確?
A 因p值< 0.05,可拒絕虛無假設
B 若顯著水準改為 0.10,仍不顯著
C 因100 萬元落在信賴區間內,無法拒絕虛無假設
D 信賴區間寬度僅與顯著水準有關
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
信賴區間與假設檢定是一體兩面:95% 信賴區間 [95 萬, 108 萬] 包含虛無假設的值 100 萬元,等價於「在 α = 0.05 下無法拒絕 H0」;p 值 = 0.08 > 0.05 也給出相同結論。兩項證據互相印證:目前資料不足以宣稱新策略後的平均月銷售額與 100 萬元不同。
【為何其他選項錯了?】
- (A):p = 0.08 大於 0.05,結論是「無法拒絕」虛無假設;「p 值 < 0.05」與題目給定的數據直接矛盾。
- (B):若顯著水準放寬為 0.10,則 p = 0.08 < 0.10,反而成為「顯著、可拒絕 H0」;選項稱「仍不顯著」方向錯誤。
- (D):信賴區間寬度由信心水準、樣本變異(標準差)與樣本數共同決定,並非只與顯著水準有關。
提示:H0 的值落在信賴區間內等價於無法拒絕 H0;p 值與 α 的比較,和信賴區間的判讀結論必然一致。
本題掛載於「假設檢定 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業建置生成式 AI 系統,利用大量客服紀錄與產品評論資料訓練語言模型,以自動生成客服回覆與知識摘要。由於資料來源多樣,且包含非結構化文字、影像與表格資訊,團隊希望在不降低模型效能的前提下,提升資料處理效率與一致性,下列哪一種資料處理策略最適合?
A 建立資料湖(Data Lake)結構,並以 Apache Spark或Ray進行分散式資料預處理與特徵抽取,再串接至模型訓練管線(Pipeline)
B 採用單節點高效能伺服器搭配批次處理模式,集中執行資料清理與格式轉換
C 將所有文字資料轉換為向量,並以資料庫索引方式直接餵入語言模型訓練
D 使用生成式模型先行自動清理資料內容,再將結果輸入至下游訓練流程
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
情境特徵:資料來源多樣(非結構化文字、影像、表格)、資料量大,且用於生成式 AI 訓練。資料湖(Data Lake)專為容納各種格式的原始資料而設計;Apache Spark 或 Ray 提供分散式的資料預處理與特徵抽取能力,可水平擴展處理大量資料;再串接模型訓練管線(Pipeline)確保流程自動化與一致性。此組合兼顧處理效率、格式彈性與流程一致性,是生成式 AI 資料工程的標準作法,故 (A) 正確。
【為何其他選項錯了?】
- (B):單節點伺服器效能再高也有物理上限,面對多模態大量資料缺乏水平擴展能力,集中批次處理也難以支撐持續更新的訓練需求。
- (C):「所有文字直接轉向量餵入訓練」跳過了清理、去重與品質控管等關鍵步驟;影像與表格的異質性也無法僅以向量化解決一致性問題。
- (D):以生成式模型自動清理資料,其輸出本身帶有幻覺與偏差風險,未經驗證即輸入下游訓練,可能將錯誤內容混入訓練資料,反而損害模型品質。
提示:多模態、大量、訓練用途的組合,對應資料湖儲存原始資料、Spark/Ray 分散式前處理、Pipeline 串接訓練。
本題掛載於「DW / Lake 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電商資料團隊繪製顧客單筆消費金額的箱型圖後發現:四分位距(IQR)範圍極小,但上鬚線拉得很長,且在高金額區域有多筆離群值。若希望協助行銷部門依據消費層級設計分群策略,下列哪一種視覺化方式最有助於凸顯不同消費層級間的差異?
A 以對數刻度繪製箱型圖或長條圖,放大高金額消費族群的變化差異
B 移除所有離群值,確保資料呈現集中分布
C 採用等距分箱(Equal-Width Binning)方式分群
D 改以折線圖(Line Chart)觀察時間變化趨勢
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
IQR 極小、上鬚很長、高金額端有多筆離群值,代表消費金額嚴重右偏:多數顧客消費金額低,少數顧客金額極高。在線性刻度下,大部分資料被壓縮在圖的低值區,層級差異難以辨識。改用對數刻度後,低、中、高消費層級在視覺上被拉開,跨數量級的差異變得可讀,最有助於觀察不同消費層級的結構,支援分群策略設計。
【為何其他選項錯了?】
- (B):高金額離群值正是高消費客群,是分群策略中最具價值的目標族群;將其移除等於刪去關鍵分析對象,與「依消費層級分群」的目的直接矛盾。
- (C):等距分箱在右偏資料上會使絕大多數樣本集中於第一箱,其餘箱幾乎無資料,分群缺乏鑑別度;右偏資料較適合等頻分箱或對數分箱。
- (D):折線圖觀察的是時間趨勢,題目問的是消費「層級結構」的差異,分析維度不符。
提示:嚴重右偏、跨數量級的金額資料,改用對數刻度即可呈現層級結構。
本題掛載於「視覺化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某串流影音平台運用關聯規則學習(Association Rule Learning)分析用戶的觀影行為,發現若使用者觀看了科幻影集,則有較高機率接著觀看超級英雄電影。分析顯示,同時觀看這兩種類型的使用者約佔全部觀影紀錄的12%,而觀看科幻影集的使用者中,有 50%也觀看了超級英雄電影,該規則的提升度(Lift)為1.8。根據上述資訊,下列哪一項推論最為正確?
A 支持度(Support)過低,代表此規則不具任何商業價值
B 提升度(Lift)大於 1 表示兩種類型內容無關,僅屬於隨機重疊
C 信賴度(Confidence)為 50%,代表觀看科幻影集者有明顯傾向觀看超級英雄電影
D 同時觀看比例僅 12%,代表兩種類型互相排斥
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
三個指標各有定義:支持度(Support)12% 表示兩類內容同時出現於全部紀錄的比例;信賴度(Confidence)50% 表示「觀看科幻影集者中有一半也觀看超級英雄電影」,呈現明顯的條件傾向;提升度(Lift)1.8 大於 1,表示這種共同觀看並非隨機巧合,而是比兩者獨立時高出 80% 的正向關聯。選項 (C) 對信賴度的解讀正確,且與提升度的訊息互相印證。
【為何其他選項錯了?】
- (A):支持度 12% 在推薦情境並不算低(約每 8 筆紀錄即有 1 筆),且商業價值須與信賴度、提升度合併判讀,不能僅憑支持度否定規則價值。
- (B):敘述方向相反:提升度等於 1 才代表兩者獨立無關;大於 1 代表正相關,1.8 屬於相當明確的正向關聯。
- (D):「互相排斥」意味著幾乎不同時出現且提升度小於 1;本題有 12% 的共現比例加上提升度 1.8,與互斥的特徵完全相反。
提示:Lift = 1 為獨立、> 1 為正相關、< 1 為負相關;Confidence 是條件機率 P(B|A),Support 是共同出現比例。
本題掛載於「相關 / 關聯 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融科技公司分析每日上億筆交易資料,以監控客戶轉帳金額分佈與異常波動。由於資料量極大,為兼顧效率與準確度,團隊決定採用「近似分位數(Approximate Quantile)」方法進行資料摘要統計。下列何者最能正確反映該技術的核心目的?
A 確保每個分位值的結果完全精確,即使計算時間較長
B 利用機器學習模型預測分位數位置,以減少統計計算量
C 僅能對結構化資料進行批次處理,無法應用於即時資料流
D 在可容忍誤差範圍內,快速估算分位值以支援即時分析
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
上億筆資料要計算精確分位數,需要全域排序或多次掃描,在即時監控場景下成本過高。近似分位數演算法(如 t-digest、GK 演算法)以單次掃描、少量記憶體維護資料摘要,在可容忍的誤差範圍內快速估算分位值,以可控的精度損失換取大幅的效能提升,支撐即時分析需求。這正是大數據摘要統計的核心取捨:在誤差可控的前提下優先確保計算效率。
【為何其他選項錯了?】
- (A):「每個分位值完全精確、即使計算時間較長」與近似方法的定位相反;近似分位數的設計目的就是放棄絕對精確以換取效率。
- (B):近似分位數依靠確定性的資料結構與演算法,並具有誤差上界保證,並非以機器學習模型預測分位數位置。
- (C):敘述恰好相反,近似分位數演算法多為單遍(one-pass)串流演算法,本來就是為即時資料流設計,不限於批次處理。
提示:大數據摘要統計的取捨原則:犧牲可控的小誤差,換取串流式、即時、低記憶體的計算能力。
本題掛載於「5. 探索分析 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
若在高維度(>500 維)的資料上應用DBSCAN(Density-Based Spatial Clustering of Applications with Noise)演算法,卻發現所有資料點皆被判定為雜訊(Noise),下列何者為最有可能的原因?
A 高維下距離變化趨同,導致 ε(Epsilon)閾值選擇失效
B 使用錯誤的距離函數(Distance Function)
C MinPts參數設得太小
D 資料過度標準化導致特徵消失
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
這是維度詛咒(Curse of Dimensionality)的典型症狀:維度極高時,任意兩點間的距離趨於相近(距離集中現象),「近鄰」與「遠點」的差異被抹平。DBSCAN 依賴「ε 半徑內至少有 MinPts 個鄰居」定義核心點,當所有點之間的距離都相差無幾時,任何 ε 都難以圈出足夠鄰居,結果沒有點能成為核心點,全部被判為雜訊。
【為何其他選項錯了?】
- (B):距離函數選擇不當會使結果變差,但不會系統性地讓「全部」點變成雜訊;且高維之下即使更換距離函數,距離集中的本質問題依然存在。
- (C):MinPts 設得太小反而使核心點更容易成立,應會產生更多群集而非全數雜訊,與題目現象的方向相反。
- (D):標準化只是將各維度尺度拉齊,不會使特徵消失,也不是高維情境下 DBSCAN 失效的主因。
提示:高維資料搭配距離型演算法會遭遇距離集中問題;先降維(PCA、UMAP)再進行密度分群。
本題掛載於「DBSCAN / HDBSCAN 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某團隊在開發風險評估模型時,使用主成分分析(Principal Component Analysis, PCA)進行降維。輸入資料包含三個數值欄位:「交易金額(單位:新台幣)」、「交易次數(次/月)」與「年齡(歲)」,其數值量級分別約為10⁵、10¹與 10²。分析人員直接將原始數據帶入 PCA,結果第一主成分(PC1)幾乎完全由「交易金額」主導。下列哪一項作法或判斷最合理?
A 這是正常現象,金額本身變異較大,應主導主要成分
B 若改用特徵選擇法,可自動解決變數量級問題
C 可刪除「交易金額」欄位以平衡各主成分的影響
D 在進行PCA前應先進行標準化(Standardization),以避免因數值尺度差異造成特徵偏誤
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
PCA 以「變異數最大化」尋找主成分,而變異數有單位與量級:交易金額量級為 10⁵,其變異數可能是年齡(10²)與交易次數(10¹)的數百萬倍以上,第一主成分自然被交易金額完全主導。正確作法是先進行標準化(將各欄位轉換為平均 0、標準差 1),使每個變數在相同尺度上比較,PCA 才能反映真正的資料結構而非單位量級差異。實務上,對相關係數矩陣進行 PCA 即等價於先標準化再分解。
【為何其他選項錯了?】
- (A):金額的變異大主要來自其單位量級,不代表其資訊量確實較大;未標準化即讓量綱主導主成分,是分析偏誤而非可接受的正常現象。
- (B):特徵選擇是挑選變數子集,不會改變留下的變數之間量級懸殊的事實,無法解決尺度問題。
- (C):直接刪除交易金額會捨棄重要資訊;問題出在尺度差異,不在變數本身。
提示:PCA 對尺度敏感,分析前先標準化;對相關係數矩陣做 PCA 等價於自帶標準化。
本題掛載於「PCA 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某行銷團隊想了解「廣告預算」與「銷售金額」之間的關聯程度。經繪製散佈圖後發現兩者呈現明顯線性趨勢,且資料中無明顯離群值(Outliers)。若希望衡量兩者之間線性關係的強度與方向,下列哪一種方法最適合?
A 均方根誤差(Root Mean Squared Error, RMSE)
B 共變異數(Covariance)
C 皮爾森相關係數(Pearson Correlation Coefficient)
D 平均絕對誤差(Mean Absolute Error, MAE)
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
皮爾森相關係數(Pearson Correlation Coefficient)專門用於衡量兩連續變數線性關係的強度與方向:值域為 −1 到 1,正負號表示方向,絕對值表示強度,且無單位、不受變數尺度影響。題目已確認兩變數關係近似線性且無明顯離群值,完全符合皮爾森相關係數的適用前提。
【為何其他選項錯了?】
- (A):RMSE 是預測模型的誤差指標,衡量預測值與實際值的差距,前提是已建立模型;它不衡量兩變數之間的關聯。
- (B):共變異數的正負號可表示方向,但數值大小受變數單位影響(金額單位由元改為萬元,共變異數即隨之改變),無法標準化比較「強度」;相關係數正是共變異數除以兩變數標準差後的標準化版本。
- (D):MAE 同樣是模型誤差指標,與變數間關聯強度無關。
提示:「兩變數線性關聯的強度與方向」對應皮爾森相關係數;共變異數只有方向、缺乏可比較的強度。
本題掛載於「相關 / 關聯 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電商團隊觀察到,每位顧客對廣告推播的點擊行為可視為一次伯努利試驗(Bernoulli Trial),單次點擊成功機率為 p=0.4。當推播對象擴增至 5,000 位顧客時,團隊想快速預估「成功點擊總數」的分佈情形,以進行模型效能模擬與預測。若希望以常態分佈(Normal Distribution)近似原始分佈,下列哪一項判斷最為合理?
A 因樣本數極大,可直接以常態分佈近似二項分佈(Binomial Distribution)
B 只有當 np 與 n(1-p) 皆大於 5 時,才能以常態分佈作近似
C 常態近似只適用於 p=0.5 的情況
D 無論樣本數多大,二項分佈都不能以常態分佈近似
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
成功點擊總數服從二項分佈 B(n=5000, p=0.4)。二項分佈能否以常態近似,教科書判準是 np 與 n(1−p) 都要夠大(常用門檻為皆大於 5,部分教材採 10)。本題 np = 2000、n(1−p) = 3000,皆遠超門檻,近似成立。此條件同時考慮樣本數與機率的極端程度:n 很大但 p 極小時,np 仍可能很小,常態近似會失真,此時應改用卜瓦松近似。
【為何其他選項錯了?】
- (A):「樣本數極大即可直接近似」忽略了 p 的影響;若 p = 0.0001,n = 5000 時 np 僅 0.5,常態近似完全不適用。判準必須同時檢查 np 與 n(1−p),不能只看 n。
- (C):p = 0.5 只是近似效果最好的情況(分佈左右對稱),並非必要條件;只要 np 與 n(1−p) 夠大,p 偏離 0.5 仍可近似。
- (D):棣美弗-拉普拉斯定理(中央極限定理的特例)保證二項分佈在條件滿足時可用常態近似,「無論如何都不能」與理論相矛盾。
提示:二項分佈近似常態的判準:np > 5 且 n(1−p) > 5,兩個條件都要滿足,不能只看樣本數。
本題掛載於「分佈 / 偏態 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某電信公司導入生成式 AI客服系統,利用過去對話紀錄與用戶行為資料訓練語言模型,在資料治理與合規審查過程中,團隊發現模型可能會在回答中生成包含真實姓名、電話或交易資訊的內容。為確保系統符合個資法及生成式AI的安全與隱私要求,下列哪一項作法最符合實務可行及法規原則?
A 在訓練資料前進行資料匿名化(Anonymization)或偽匿名化(Pseudonymization)處理,並建立輸出內容稽核機制
B 改以強化學習(Reinforcement Learning)微調模型,使模型學習避免產出真實資訊
C 採用同態加密(Homomorphic Encryption)以加密所有文字輸入,確保模型無法辨識任何個資
D 僅設定模型回覆時不顯示用戶姓名,即可視為隱私防護完成
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
個資保護應從源頭落實:訓練前先對資料進行匿名化(Anonymization)或偽匿名化(Pseudonymization),移除或替換可識別個人的資訊,使模型自始學不到真實個資;再配合輸出內容稽核機制(個資偵測、過濾與紀錄)形成雙重防線。此作法符合個資法的資料最小化原則與 Privacy by Design 精神,也是生成式 AI 治理實務上可落地的標準做法,故 (A) 正確。
【為何其他選項錯了?】
- (B):強化學習微調只能降低模型輸出個資的傾向,個資仍儲存於模型參數中,可能被惡意設計的提示誘導而洩漏;僅靠此法不符合源頭治理的法遵要求。
- (C):同態加密保護的是運算過程中資料不被窺見,模型仍會將內容學入參數;且對大型語言模型的完整訓練流程施作同態加密,現階段運算成本過高而不可行。
- (D):僅設定不顯示姓名,電話與交易資訊仍可能被生成,模型內部依然保有個資,屬表面遮蔽而非實質的隱私防護。
提示:生成式 AI 個資防護採雙重防線:訓練前去識別化(源頭)加上輸出稽核(出口),缺一不可。
本題掛載於「治理與倫理 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某金融機構的量化分析師在建立資產風險評估模型時,發現報酬率資料分佈明顯非對稱,且出現多次極端損失事件,使得傳統假設常態分佈的模型無法準確反映真實風險。若希望在不依賴常態分佈假設的前提下,採取更能捕捉資料極端情況的建模策略,下列哪一種方法最為合適?
A 採用線性迴歸模型(Linear Regression Model),以常態分佈殘差(Residuals)為基礎進行推估
B 使用平均數(Mean)與標準差(Standard Deviation)估計波動範圍
C 將資料裁剪至 ±3σ 範圍內以排除異常值影響
D 採用分位數回歸模型(Quantile Regression Model),聚焦於尾部分位(Tail Quantiles)以評估極端風險
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
分位數迴歸不對誤差分佈做常態假設,而是直接對條件分位數(如第 5、第 95 百分位)建模,能刻畫報酬率分佈的尾部行為,而極端損失正是發生在尾部。對非對稱、厚尾的金融資料,聚焦尾部分位的建模比只描述平均行為的傳統模型更能反映真實風險,也與 VaR(風險值)等風險管理指標直接接軌,完全符合題目「不依賴常態假設、捕捉極端情況」的要求。
【為何其他選項錯了?】
- (A):線性迴歸以常態殘差假設為推估基礎,題目明確要求不依賴常態分佈假設,直接不符前提。
- (B):平均數與標準差只描述分佈的中心與整體離散程度,無法反映厚尾與不對稱,極端事件的資訊會在平均化過程中消失。
- (C):將 ±3σ 以外的資料裁掉,等於刪除最需要分析的極端損失事件,使模型系統性低估尾部風險。
提示:題幹關鍵詞「不依賴常態假設、捕捉極端情況」對應分位數迴歸;裁剪異常值會直接刪除研究對象。
本題掛載於「回歸問題 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
在圖形資料庫(Graph Database)中建模社群平台資料時,若每筆「按讚」行為都包含時間戳記(Timestamp)與裝置類型(Device Type)等資訊。若希望同時保留使用者與貼文之間的互動關係,並能有效查詢「按讚」的行為屬性,下列哪一種設計方式最為合適?
A 將「按讚」視為節點(Node),與使用者建立邊(Edge)
B 將「按讚」資訊作為邊的屬性(Property)儲存,連結使用者與被按讚的貼文節點
C 把「按讚」資訊直接寫入使用者節點中作為屬性
D 建立「按讚紀錄表」並將資料存入關聯式資料庫
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
屬性圖(Property Graph)的建模慣例:實體(使用者、貼文)建為節點,互動關係(按讚)建為邊,而關係本身的附加資訊(時間戳記、裝置類型)存為邊的屬性(Property)。如此使用者與貼文的關聯結構清晰,查詢「誰在何時以何種裝置對哪篇貼文按讚」時,沿著邊讀取屬性即可,同時保留關係結構與行為屬性的查詢效率,故 (B) 正確。
【為何其他選項錯了?】
- (A):把每次按讚都建成獨立節點會產生大量中介節點,查詢使用者與貼文的直接關係還需多跳一層;這種關係具體化通常保留給多方關係或關係本身還要被其他關係連結的情況,本題並不需要。
- (C):把按讚資訊寫入使用者節點屬性,等於以節點儲存一份清單,遺失了與貼文之間的邊,無法從貼文端反向查詢,浪費圖資料庫的關聯查詢優勢。
- (D):另建關聯式資料表等於放棄圖資料庫的原生關聯能力,兩套系統還需同步資料,多層關係查詢又回到多表 JOIN 的效能負擔。
提示:屬性圖建模原則:實體為節點、關係為邊、關係的附加資訊為邊的屬性。
本題掛載於「DB / API 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某企業欲建構知識圖譜(Knowledge Graph),以整合內部的研究報告、專利資料與專家知識,並支援語意查詢與關聯推理。若希望模型能具備良好的語意擴展性與高效推理能力,下列哪一種圖模型設計最為合適?
A 僅以節點(Node)與邊(Edge)表示,所有資訊存放於節點屬性中
B 將資料結構建為 RDF(Resource Description Framework)三元組(Subject–Predicate–Object)
C 使用文件型資料庫儲存內容,並以標籤(Tag)連接節點
D 採用關聯式資料庫儲存對應關係,並搭配預建索引加速查詢
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
知識圖譜要支援「語意查詢與關聯推理」,RDF 三元組(Subject-Predicate-Object,主詞-述詞-受詞)正是為此制定的標準:每筆知識都是一條機器可理解的陳述(如「專利X-引用-論文Y」),搭配 RDFS/OWL 本體論(Ontology)定義類別與關係的語意階層,再以 SPARQL 查詢語言與推理引擎進行邏輯推導。語意擴展性(可隨時新增關係型別)與推理能力兼備,屬 W3C 語意網標準體系的核心,故 (B) 正確。
【為何其他選項錯了?】
- (A):把所有資訊放在節點屬性中,關係語意未被顯式建模,推理引擎無從依據關係型別進行推導,新增語意型別也困難。
- (C):文件型資料庫加標籤只能做粗略的關聯查詢,標籤缺乏形式化語意定義,無法支援語意推理與擴展。
- (D):關聯式資料庫雖可儲存對應關係,但多層關聯查詢需要逐層 JOIN,效能隨推理深度惡化,且缺乏原生的本體論與推理引擎支援。
提示:語意查詢與關聯推理的需求對應 RDF 三元組加 SPARQL;屬性圖適合營運型關聯查詢,RDF 適合語意與推理。
本題掛載於「DB / API 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某研究人員欲使用線性迴歸模型(Linear Regression Model)分析變數Y與X之間的關係,但發現 Y的分佈明顯右偏,且其變異數隨 X 的增大而增加。為滿足模型假設並提升配適效果,下列哪一種前處理方法最為合適?
A 對X進行標準化(Standardization)
B 對Y進行Box–Cox轉換(Box–Cox Transformation)
C 對資料進行一次差分(First Differencing)
D 將Y中變異較大的樣本移除
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
題目指出兩個問題:Y 明顯右偏、變異數隨 X 增大(異質變異)。Box–Cox 轉換透過冪次轉換族(對數轉換是其特例)對 Y 做變換,可同時處理兩者:壓縮右尾使分佈更接近常態,並穩定變異數(Variance Stabilizing),讓線性迴歸的常態性與等變異假設更能成立,是處理此類問題的標準方法。
【為何其他選項錯了?】
- (A):標準化 X 僅是線性平移與縮放,不會改變 Y 的偏態,也無法處理變異數隨 X 增大的問題。
- (C):差分是時間序列去趨勢、處理非定態的手法;題目沒有時間結構,適用場合錯誤。
- (D):移除變異較大的樣本是選擇性刪除資料,會引入偏誤;異質變異是結構性現象,刪樣本無法解決,且傷害推論效度。
提示:Y 右偏且變異數隨均值增大,對 Y 做 Box–Cox 或對數轉換;Box–Cox 僅適用正值,含零或負值需先平移。
本題掛載於「線性回歸 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
若開發一個用於罕見疾病自動診斷的分類模型,目前資料集中確診樣本僅佔不到1%,且因為標註成本高,短期內無法取得更多資料。在此情況下,若希望提升模型對少數類的偵測能力,同時避免過擬合,下列哪一種策略最為合理?
A 對少數類進行隨機過採樣(Random Oversampling)
B 對多數類進行欠採樣(Random Undersampling)
C 使用SMOTE(Synthetic Minority Over-sampling Technique)生成合成少數類樣本後再訓練分類模型
D 僅使用現有資料調整模型決策閾值(Decision Threshold)以提升召回率
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
確診樣本不到 1% 且短期無法再蒐集,若用隨機過採樣直接複製,模型會過度記憶那一小批重複樣本而過擬合;SMOTE 改在少數類樣本與其近鄰之間以內插方式生成新的合成樣本,增加少數類的多樣性而非重複性,能在提升少數類偵測能力的同時,比單純複製更能抑制過擬合,正符合題目「提升偵測能力+避免過擬合」的雙重要求。
【為何其他選項錯了?】
- (A):隨機過採樣僅是複製既有樣本,少數類樣本被重複記憶,過擬合風險最高,正是題目要求避免的情況。
- (B):欠採樣需丟棄大量多數類樣本,在資料本就珍貴的醫療場景會損失多數類的重要模式,不利模型學習。
- (D):調整決策閾值只是移動查全率與查準率的取捨點,可拉高召回率,但模型並未學到更多少數類特徵,對偵測能力的本質提升有限。
提示:極度不平衡且無法增補資料時採用 SMOTE 合成內插;複製增加重複性,合成增加多樣性。
本題掛載於「樣本不平衡 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
一家製造廠評估新生產線推出後,產品良率是否較原生產線提升。工程師分別從兩條生產線各抽樣 100 件產品,原生產線良率為 95%,新生產線為 97%。若欲檢定兩條生產線良率的差異是否具有統計意義,下列哪一種方法最為合適?
A 雙樣本平均數 t 檢定(Two-sample t-test)
B 雙比例 Z 檢定(Two-proportion Z-test)
C 卡方檢定(Chi-square test)
D 變異數分析(ANOVA)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
良率是「比例」型資料:每件產品只有良品或不良品兩種結果,兩條產線各抽 100 件,得到兩個樣本比例(95%、97%)。要檢定「兩個母體比例是否有差異」,標準工具是雙比例 Z 檢定(Two-proportion Z-test):以合併比例估計標準誤,計算兩比例差的 Z 統計量;樣本數各 100 件亦大致滿足常態近似條件。
【為何其他選項錯了?】
- (A):雙樣本 t 檢定比較的是兩組「連續變數的平均數」(如平均重量、平均尺寸);良率是二元結果的比例,不是連續量測值。
- (C):卡方檢定以 2×2 列聯表進行獨立性檢定,其雙尾結論與雙比例 Z 檢定在數學上等價;但題目問「最合適」,直接針對比例差設計、且可進行單尾檢定(檢定「是否提升」)的雙比例 Z 檢定更符合需求。
- (D):ANOVA 用於比較三組以上的平均數;本題只有兩組,且比較對象是比例而非平均數,兩個條件皆不符。
提示:兩組平均數用 t 檢定;兩組比例用雙比例 Z 檢定;三組以上平均數用 ANOVA。
本題掛載於「假設檢定 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
若評估一個新開發的腫瘤分類模型,其資料集中有 80%的樣本來自良性病例。若直接使用 5-fold交叉驗證(Cross-Validation) 進行模型評估,可能導致模型效能評估出現偏差,為避免此問題,下列哪一種作法最合適?
A 降低K值以減少交叉驗證次數
B 改為使用拔靴法(Bootstrap)
C 調整測試集使良性樣本比例更高,以模擬真實分佈
D 使用分層交叉驗證(Stratified K-Fold Cross-Validation),以確保每折類別比例一致
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
資料集 80% 為良性、20% 為惡性,一般 5-fold 隨機切割時,部分折的惡性樣本可能特別少甚至接近零,各折類別分布不一致,效能估計因此波動並產生偏差。分層交叉驗證(Stratified K-Fold Cross-Validation)在切割時使每一折的類別比例與整體一致(各折皆維持 80:20),每次驗證都在相同的類別結構下進行,評估結果更穩定可靠,是類別不平衡資料進行交叉驗證的標準做法,故 (D) 最合適。
【為何其他選項錯了?】
- (A):降低 K 值使每折樣本變多,但隨機切割造成的類別比例波動仍然存在,問題根源未解決。
- (B):拔靴法(Bootstrap)以有放回方式重抽樣,同樣不保證每次抽樣的類別比例一致,對類別不平衡造成的評估偏差沒有針對性。
- (C):人為調整測試集的類別比例會改變資料分布,使評估結果偏離真實情境,方向錯誤。
提示:類別不平衡加上交叉驗證,直接對應 Stratified K-Fold;讓每折比例與母體一致,評估才具可比性。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
以下虛擬程式碼(pseudocode)最可能是在描述何種驗證法?
Input:
- data_set:包含 N 筆資料的資料集
- model_training_function:用來訓練模型的函式
- model_evaluation_function:用來評估模型的函式(如計算誤差或準確率)
Output:
- 平均評估指標(如平均準確率或平均誤差)
Algorithm:
1. 初始化評估指標列表 metrics = []
2. 對 i = 1 到 N:
a. 將第 i 筆資料作為測試集 test_data
b. 將其餘 N-1 筆資料作為訓練集 train_data
c. 使用 model_training_function 在 train_data 上訓練模型
d. 使用訓練好的模型對 test_data 做預測,計算評估指標 metric_i
e. 將 metric_i 加入 metrics
3. 計算 metrics 的平均值 mean_metric
4. 回傳 mean_metric
A Hold-out 驗證(Hold-out Validation)
B 留一交叉驗證 LOOCV(Leave-One-Out Cross Validation)
C K-fold 交叉驗證(K-fold Cross Validation)
D 拔靴法(Bootstrap)驗證
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
虛擬程式碼的關鍵特徵:迴圈執行 i = 1 到 N(N 為資料筆數),每一輪僅以第 i 筆單一資料作為測試集,其餘 N-1 筆全數用於訓練,共訓練 N 個模型後將評估指標取平均。「每次留一筆當測試、輪流留完全部 N 筆」正是留一交叉驗證(Leave-One-Out Cross Validation, LOOCV)的定義,相當於 K-fold 交叉驗證中 K = N 的極端特例,故 (B) 正確。
【為何其他選項錯了?】
- (A):Hold-out 驗證僅做一次訓練與測試集切分(例如 80/20),只訓練一個模型;程式碼訓練了 N 個模型,特徵不符。
- (C):一般 K-fold 將資料切為 K 折,每折包含多筆資料,迴圈執行 K 次(K 通常取 5 或 10);此處迴圈次數等於資料筆數且測試集每次僅一筆,是 LOOCV 而非一般 K-fold。
- (D):拔靴法(Bootstrap)的特徵是以有放回隨機抽樣產生訓練集;程式碼按順序輪流保留一筆,完全沒有隨機抽樣,特徵不符。
提示:迴圈次數等於資料筆數、測試集僅含一筆,即為 LOOCV;它是 K = N 的 K-fold,也是計算成本最高的驗證法。
本題掛載於「資料切分 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
以下虛擬程式碼(pseudocode)最可能是在描述何種演算法?
Input:
- data_points:N 筆資料,每筆資料有 D 個特徵
- X:要分成的群數
Output:
- clusters:每筆資料所屬的群編號
- centroids:每個群的中心點
Algorithm:
1. 隨機選擇 X 個資料點作為初始中心
2. 重複以下步驟直到收斂:
a. 分群:
對每個資料點,計算它到每個中心的距離
將資料點指派給距離最近的中心
b. 更新中心:
對每個群:
計算該群中所有資料點的平均值
將群中心更新為這個平均值
3. 當群中心不再變動時,停止
回傳每筆資料的群編號 clusters,以及最後的群中心 centroids
A K-means 分群(K-means Clustering)
B 高斯混合模型分群(Gaussian Mixture Model Clustering)
C 階層式分群(Hierarchical Clustering)
D DBSCAN 分群(Density-based Spatial Clustering of Applications with Noise Clustering)
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
此 pseudocode 的流程完全對應 K-means(Lloyd 演算法):先隨機選擇 X 個資料點作為初始群中心;接著反覆執行「指派」(每個資料點歸給距離最近的中心)與「更新」(群中心移動到群內所有點的平均值)兩步驟;當群中心不再變動即收斂停止,輸出各點的群編號與最終群中心。「最近距離硬指派+平均值更新中心」正是 K-means 的核心迴圈。
【為何其他選項錯了?】
- (B):高斯混合模型以 EM 演算法進行「軟指派」,依機率(責任值)分配樣本,並同時更新平均值、共變異數與混合權重;本 pseudocode 只有硬指派與平均值計算,沒有任何機率成分。
- (C):階層式分群逐步合併(或分裂)最相近的群並產生樹狀圖,不需預先指定群數,也沒有「中心點迭代更新」的流程。
- (D):DBSCAN 以 ε 鄰域密度與 MinPts 擴張群集,能標記雜訊點,完全不使用「群中心」與「預先指定群數」這兩個概念。
提示:「隨機初始中心、最近距離指派、平均值更新、收斂停止」四個步驟同時出現,即為 K-means。
本題掛載於「K-Means 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
考慮某生產線每小時出現瑕疵品的個數符合卜瓦松分佈(Poisson Distribution),已知平均每小時產生 5 個瑕疵品,以下程式碼展示資料處理:
import numpy as np
from scipy.stats import poisson
lambda_poisson = 5
print(poisson.pmf(5, lambda_poisson))
請問下列敘述何者正確?
A lambda_poisson = 5 表示每小時最多 5 個瑕疵品
B poisson.pmf(5, lambda_poisson) 表示小於 5 個瑕疵品的機率
C 卜瓦松分佈的適用條件為事件彼此獨立,且平均發生率固定
D poisson.cdf(10, 5) 表示大於或等於 10 個瑕疵品的機率
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
卜瓦松分佈的適用前提正是:事件彼此獨立發生、單位時間的平均發生率 λ 固定,且極短時間內最多發生一次事件。生產線瑕疵品計數符合這些條件,才能以 Poisson(λ=5) 建模,選項 (C) 敘述正確。另外說明,程式中 poisson.pmf(5, 5) 計算的是「恰好出現 5 個瑕疵品」的機率。
【為何其他選項錯了?】
- (A):λ 是「平均」發生次數,不是上限;每小時出現 8 個、10 個瑕疵品仍有發生機率,只是機率較低,把 λ 視為上限是對參數的誤解。
- (B):pmf(機率質量函數)計算的是「恰好等於 5 個」的機率;要計算「小於 5 個」應使用累積機率 poisson.cdf(4, 5)。
- (D):cdf(10, 5) 是 P(X ≤ 10),即「小於或等於 10 個」的累積機率;「大於或等於 10 個」應寫成 1 − poisson.cdf(9, 5),選項的方向與邊界皆錯誤。
提示:pmf 為恰好等於 k 的機率;cdf 為小於等於 k 的累積機率;λ 是平均次數而非上限。
本題掛載於「分佈 / 偏態 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
一間遊戲市場研究公司分析全球電子遊戲銷售資料集 vgsales.csv(以 data = pd.read_csv("vgsales.csv") 載入),欄位包含 Name(遊戲名稱)、Platform(平台)、Year(發售年份)、Genre(類型)、Publisher(發行商)、NA_Sales / EU_Sales / JP_Sales / Other_Sales(各地區銷售量,單位:百萬份)與 Global_Sales(全球總銷售量)。
分析師執行 data['Year'] 檢視欄位,輸出顯示共 16598 筆、值如 2006.0、1985.0 等,dtype 為 float64,而非一般年份常用的整數。他想了解這樣的情形為什麼會發生。請問下列哪些原因可能導致這種狀況?
原因A:CSV 檔中 Year 欄位有缺失值(NaN),導致 Pandas 自動將整欄轉為浮點數。
原因B:CSV 檔中的年份資料原本是字串(如 "2006"),Pandas 轉換時出錯而變成浮點數。
原因C:Pandas 預設會將所有數值型態讀取為 float64,不論資料是否為整數。
原因D:CSV 檔中的年份資料可能包含小數點(例如 2006.0),因此被視為浮點數。
A 原因B、原因C
B 原因A、原因D
C 原因A、原因B、原因D
D 原因C、原因D
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
原因A正確:NumPy 的 int64 型態無法表示 NaN,只要欄位中存在任何缺失值,Pandas 讀檔時就會把整欄提升為 float64 以容納 NaN,這是年份欄位變成浮點數最常見的原因。原因D也正確:若 CSV 檔中的年份原本就以 2006.0 這種帶小數點的格式儲存,Pandas 依字面值推斷型態,自然會判定為浮點數。兩者皆為可能成因,故正確組合為原因A加原因D。
【為何其他選項錯了?】
- (A):原因B不正確,若年份欄位含有無法解析為數值的字串,Pandas 會把整欄讀成 object 型態,而不是「轉換出錯而變成 float64」;原因C亦不正確,理由見選項 (D) 的說明。
- (C):此組合多納入了錯誤的原因B(同上),因此整個組合不成立。
- (D):原因C不正確,Pandas 不會把所有數值一律讀成 float64;一欄完整無缺失的整數會被推斷為 int64。float64 是「含 NaN 或含小數點」造成的結果,並非預設行為。
提示:int64 無法容納 NaN,整欄會自動升級為 float64;年份欄位出現 .0,應先檢查是否有缺失值。
本題掛載於「缺失值處理 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
承前述遊戲銷售資料集(DataFrame 變數為 data),其 Year 欄位目前為 float64 型態。研究團隊想要將 Year 欄位轉換為整數型態,以便後續進行年份趨勢分析。考慮到資料中可能包含缺失值(NaN),請選出最合適的轉換方式。
A data['Year'] = data['Year'].astype(int)
B data['Year'] = data['Year'].fillna(0).astype(int)
C data['Year'] = data['Year'].fillna(1).astype(int)
D data['Year'] = data['Year'].astype('Int64')
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
astype('Int64')(首字母大寫)會將欄位轉換為 Pandas 的可空整數型態(Nullable Integer),以 pd.NA 表示缺失值,允許整數欄位中存在缺失值。此寫法既能把 2006.0 轉回整數 2006,又能完整保留缺失資訊,不需填入任何人為數值,是含 NaN 年份欄位最合適的轉換方式;原生的小寫 int64 則無法容納缺失值。
【為何其他選項錯了?】
- (A):astype(int) 遇到 NaN 會拋出 IntCastingNaNError,因為原生整數型態無法表示缺失值,轉換直接失敗。
- (B):先以 0 填補雖可成功轉型,但等於在資料中製造「年份為 0」的虛假紀錄,後續年份趨勢分析會被這些不存在的資料點扭曲。
- (C):以 1 填補與以 0 填補是同一類錯誤,同樣以不存在的年份取代缺失值,引入假資料並破壞原始分布。
提示:整數欄位要保留缺失值,使用 astype('Int64')(大寫 I 的 Nullable Integer);以 0 或 1 硬填等於自行製造錯誤資料。
本題掛載於「缺失值處理 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某遊戲銷售資料集(DataFrame 變數為 data)包含 Platform(遊戲平台)與 Global_Sales(全球銷售量,單位:百萬份)等欄位。為了觀察各遊戲平台的市場表現,分析師想要統計每個平台的全球銷售總額,並以長條圖呈現。請選出最能正確實現此分析的程式碼。
A data.groupby("Platform")["Global_Sales"].sum().plot(kind="bar")
B data.groupby("Platform")["Global_Sales"].count().plot(kind="bar")
C data["Platform"].value_counts().plot(kind="bar")
D data.groupby("Platform")["Global_Sales"].mean().plot(kind="bar")
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
需求可拆成兩步:「每個平台的全球銷售總額」需按 Platform 分組後對 Global_Sales 加總,即 groupby("Platform")["Global_Sales"].sum();「以長條圖呈現」則接上 .plot(kind="bar")。選項 (A) 的分組欄位、聚合函數與圖表型態三個環節皆正確,完整實現題目要求。
【為何其他選項錯了?】
- (B):count() 統計的是每個平台的資料筆數,不是銷售額加總;遊戲款數多不代表銷售總額高,兩者是不同指標。
- (C):value_counts() 同樣只計算 Platform 各值的出現次數,完全沒有使用 Global_Sales 欄位,無法反映銷售金額。
- (D):mean() 計算的是每平台「平均單款銷售量」,不是「銷售總額」;平均值高可能只是款數少,無法反映整體市場規模。
提示:「總額」用 sum()、「筆數」用 count() 或 value_counts()、「平均」用 mean();聚合函數選錯,結果就偏離題目要求。
本題掛載於「5. 探索分析 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某遊戲銷售資料集(DataFrame 變數為 data)包含 NA_Sales、EU_Sales、JP_Sales、Other_Sales(各地區銷售量)等欄位。團隊希望比較北美、歐洲、日本及其他地區的整體銷售總額比例,並使用 seaborn 套件以長條圖的形式進行可視化分析。請選出能正確顯示這些地區銷售總額比例的程式碼。
A sns.countplot(x=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"], data=data)
B sns.lineplot(x="Platform", y=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"], data=data)
C sns.barplot(x="variable", y="value", data=pd.melt(data, value_vars=["NA_Sales","EU_Sales","JP_Sales","Other_Sales"]), estimator=sum)
D sns.histplot(data[["NA_Sales","EU_Sales","JP_Sales","Other_Sales"]])
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
四個地區的銷量分別存放於四個「欄位」(寬格式),但 seaborn 的 barplot 期望「一欄是類別、一欄是數值」的長格式。pd.melt 將四個欄位融合為 variable(地區名)與 value(銷量)兩欄,再以 x="variable"、y="value" 繪製長條圖,並以 estimator=sum 將每個地區的銷量「加總」呈現(barplot 預設計算平均),完整達成各地區銷售總額的比較。
【為何其他選項錯了?】
- (A):countplot 只能計數,且把欄位名稱清單直接傳給 x 是錯誤用法;它無法呈現銷售「數量加總」,只能統計出現次數。
- (B):lineplot 的 y 參數不接受欄位名稱列表的寫法,執行會報錯;且折線圖適合呈現趨勢,不適合類別間的總量比較。
- (D):histplot 繪製的是各欄位數值的「分佈直方圖」,呈現銷量落在各區間的頻率,而非各地區加總後的比較。
提示:寬格式轉長格式使用 pd.melt;seaborn 的 barplot 預設計算平均,要呈現總和須指定 estimator=sum。
本題掛載於「視覺化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
某遊戲銷售資料集(DataFrame 變數為 data)包含 Name(遊戲名稱)與 NA_Sales(北美地區銷售量)等欄位。研究團隊想要知道在北美地區(NA)銷售成績最好的遊戲前五名,並希望以 seaborn 的條狀圖呈現結果。請選出能正確完成這項分析的程式碼。
A sns.barplot(x="NA_Sales", y="Name", data=data.head(5))
B sns.barplot(x="Name", y="NA_Sales", data=data.nlargest(5, "NA_Sales"))
C sns.lineplot(x="Name", y="NA_Sales", data=data.nlargest(5, "NA_Sales"))
D sns.countplot(x="Name", y="NA_Sales", data=data)
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
本題有兩個關鍵步驟:先以 data.nlargest(5, "NA_Sales") 依北美銷量由大到小取出前五筆,再以 sns.barplot(x="Name", y="NA_Sales") 用遊戲名稱作為類別軸、銷量作為數值軸繪製條狀圖。選項 (B) 正確組合了「依指定欄位取前五名」與「條狀圖呈現」兩項需求。
【為何其他選項錯了?】
- (A):data.head(5) 只是取資料表「原始排列順序」的前 5 列,並非依北美銷量排序的前五名,無法回答「NA 銷售成績最好」的問題。
- (C):nlargest 的用法正確,但 lineplot 是折線圖,五個離散的遊戲名稱之間連線並無意義,且題目指明要以條狀圖呈現。
- (D):countplot 是計數圖,只能統計類別出現次數;且它不接受同時指定 x 與 y 的用法,執行會直接報錯。
提示:取前 N 名使用 nlargest(N, "欄位");head() 只依原始順序取列,nlargest 才依數值大小取列。
本題掛載於「視覺化 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
使用行銷資料集 marketing.csv 進行分析,以 df = pd.read_csv("marketing.csv") 載入後,執行 df.describe() 得到以下輸出(數值依序為 youtube、facebook、newspaper、sales 四個欄位):
count:200.00、199.00、200.00、200.00
mean:176.451、27.820、36.665、16.827
std:103.025、17.808、26.134、6.261
min:0.84、0.00、0.36、1.92
25%:89.25、11.94、15.30、12.45
50%:179.70、27.00、30.90、15.48
75%:262.59、43.68、54.12、20.88
max:355.68、59.52、136.80、32.40
根據上述結果,下列何者正確?
A 資料集個數為 199 筆,變數個數為 4 個
B sales 變數的中位數是 16.827
C facebook 變數的第三四分位數(Q3)是 11.94
D youtube 變數的第一四分位數(Q1)是 89.25
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
describe() 輸出中,youtube 欄位的 25% 列(即第一四分位數 Q1)數值為 89.25,選項 (D) 敘述正確。判讀 describe() 的要領:count 是「非缺失值」筆數,mean 是平均值,50% 是中位數,25% 與 75% 分別對應 Q1 與 Q3。
【為何其他選項錯了?】
- (A):資料集共 200 筆(youtube、newspaper、sales 的 count 皆為 200);facebook 顯示 199 是因為該欄位有 1 個缺失值,不代表整個資料集只有 199 筆。變數個數 4 個正確,但筆數敘述錯誤,整個選項即不成立。
- (B):16.827 是 sales 的平均值(mean);中位數應看 50% 列,其值為 15.48,兩個統計量不可混淆。
- (C):11.94 是 facebook 的 25%(Q1),不是第三四分位數;facebook 的 Q3(75%)是 43.68。
提示:describe() 判讀要領:count 為非缺失筆數、50% 為中位數、25% 與 75% 為 Q1 與 Q3;mean 與中位數是不同統計量。
本題掛載於「5. 探索分析 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
承前述行銷資料集(DataFrame 變數為 df,欄位為 youtube、facebook、newspaper、sales)。欲計算各變數的遺漏值(NaN)個數,執行後得到以下結果:
youtube 0
facebook 1
newspaper 0
sales 0
dtype: int64
下列哪些語法可以得到上述結果?
選項A:df.isnull().sum()
選項B:df.isNaN().sum()
選項C:df.isna().sum()
選項D:df.isnan().sum()
A 選項D
B 選項B、選項C、選項D
C 選項A、選項C
D 選項A、選項B、選項C
看正解與逐選項詳解
正解:C
正確答案:(C)
【正解解析】
Pandas 檢查缺失值的標準方法有兩個:isnull() 與 isna(),兩者為完全相同的函式(isnull 是 isna 的別名),回傳布林 DataFrame 後接 .sum() 即可統計每欄的 NaN 個數,得到 youtube 0、facebook 1、newspaper 0、sales 0 的結果。因此選項A與選項C皆正確,答案為 (C)。
【為何其他選項錯了?】
- (A):df.isnan() 並不存在,isnan 是 NumPy 的函式(np.isnan),DataFrame 沒有這個方法,呼叫會拋出 AttributeError。
- (B):isNaN() 是 JavaScript 的函式,Pandas 中並不存在;此組合除選項C外皆為不存在的方法,且遺漏了正確的選項A。
- (D):選項A與選項C正確,但混入了不存在的 isNaN()(選項B),整個組合因此不成立。
提示:Pandas 檢查缺失值只有 isna() 與 isnull() 兩個等價方法;isnan 屬於 NumPy,isNaN 屬於 JavaScript,不可混用。
本題掛載於「缺失值處理 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。
使用行銷資料集(DataFrame 變數為 df,欄位為 youtube、facebook、newspaper、sales),且資料集已填補遺漏值。執行以下程式碼:
from sklearn.linear_model import LinearRegression
import statsmodels.api as sm
X = df[['youtube', 'facebook', 'newspaper']]
y = df['sales']
reg = 空格1
print(reg.coef_)
X2 = sm.add_constant(X)
model_sm = 空格2
print(model_sm.summary())
OLS 迴歸結果(No. Observations: 200,R-squared: 0.898)的係數表如下:
const:coef 3.5561,P>|t| 0.000
youtube:coef 0.0455,P>|t| 0.000
facebook:coef 0.1891,P>|t| 0.000
newspaper:coef -0.0006,P>|t| 0.914
針對下列敘述:
A:空格1完整語法 reg = LinearRegression().fit(y, X)
B:空格1完整語法 reg = LinearRegression().fit(X, y)
C:print(reg.coef_) 結果為包括截距項等 4 個係數值
D:空格2完整語法 sm.OLS(X2, y).fit()
E:model_sm 迴歸模型的所有迴歸係數在 α=0.05 之下具有顯著的解釋力
F:截距項係數值為 3.5561
下列何者正確?
A B、C、F
B B、F
C A、C、D、F
D B、E
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
敘述 B 正確:scikit-learn 的擬合方法簽名是 fit(X, y),特徵矩陣在前、目標變數在後,空格1應為 LinearRegression().fit(X, y)。敘述 F 正確:OLS 摘要中 const 的係數即截距項,值為 3.5561。六個敘述中僅 B 與 F 成立,故選 (B)。
【為何其他選項錯了?】
- (A):多納入了敘述 C。reg.coef_ 只包含 youtube、facebook、newspaper 三個特徵係數,不含截距項;截距需另查 reg.intercept_,因此是 3 個值而非 4 個。
- (C):敘述 A 把 fit 的參數順序寫反(正確為 fit(X, y));敘述 D 也錯,statsmodels 的簽名是 sm.OLS(endog, exog),應寫成 sm.OLS(y, X2),目標變數在前,與 scikit-learn 相反;此組合同時包含多個錯誤敘述。
- (D):敘述 E 錯誤,newspaper 的 p 值為 0.914,遠大於 0.05,並不顯著,「所有迴歸係數皆具顯著解釋力」不成立。
提示:sklearn 是 fit(X, y),statsmodels 是 OLS(y, X),兩套 API 順序相反;coef_ 不含截距,截距在 intercept_。
本題掛載於「線性回歸 」節點,建議搭配節點的觀念教學一併複習,鞏固詳解中的關鍵概念。