深度學習知識地圖 · NLP 與 LLM
RNN / LSTM
序列基礎
觀念教學
循環神經網路 (RNN) 是序列模型的基礎,可記憶先前的資訊,但原始 RNN 有梯度消失問題,記不住長距離依賴。
LSTM(Long Short-Term Memory)
LSTM 是 RNN 的升級版,靠三道「門」控制記憶:
- 遺忘門(Forget Gate):決定丟掉哪些舊記憶(不重要的忘掉)
- 輸入門(Input Gate):決定寫入哪些新資訊(重要的記住)
- 輸出門(Output Gate):決定輸出哪些記憶給下一步用
比喻:LSTM 像一本筆記本,遺忘門 = 橡皮擦(擦掉不重要的),輸入門 = 鉛筆(寫入新重點),輸出門 = 翻開哪一頁給別人看。
GRU(Gated Recurrent Unit)
LSTM 的簡化版,把三道門合併成兩道(重置門 + 更新門),參數更少、訓練更快,效果通常跟 LSTM 差不多。
RNN → LSTM → Transformer 演進
- RNN:能處理序列,但記性差(梯度消失)
- LSTM/GRU:加了門機制,記性好很多
- Transformer:拋棄循環結構,用注意力機制平行處理,速度和效果全面超越
現在 LLM 時代 Transformer 是主流,但 LSTM 在時間序列預測、語音辨識等場景仍然常用。
應用場景
評估指標
iPAS 歷屆考題詳解(6 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某團隊想採用循環神經網路(Recurrent Neural Network, RNN)建構長期氣候數據的預測模型,以下哪一項敘述最符合使用 RNN 可能會遇到的挑戰?
- ARNN 無法處理可變長度的序列輸入,因此在實務上限制極大
- BRNN 在長序列訓練中可能出現梯度消失,影響模型效果
- CRNN 無法捕捉時間上的依賴關係,因此預測準確度低
- DRNN 只能用於分類任務,不能應用於時間序列預測
看正解與逐選項詳解
正解:B
正確答案:(B)
【正解解析】
RNN 以隱藏狀態沿時間步遞迴傳遞資訊,訓練時採用沿時間反向傳播(BPTT)。當序列很長時,梯度需經過多步連乘,容易出現梯度消失(或梯度爆炸),使模型難以學習長距離的時間依賴關係。長期氣候數據正屬於長序列,較早時間步的重要資訊難以影響後期的學習,模型效果因此受限;LSTM、GRU 等門控架構即為緩解此問題而提出。
【為何其他選項錯了?】
- (A):處理可變長度序列正是 RNN 的設計優勢,其遞迴結構可逐步讀入任意長度的輸入,此選項將 RNN 的強項描述為弱點。
- (C):RNN 的核心機制即是透過隱藏狀態捕捉時間依賴關係(h_t 由 h_{t-1} 與 x_t 計算而得),「無法捕捉時間依賴」與其本質相反。
- (D):RNN 廣泛應用於時間序列預測、語言生成等序列任務,並非僅能用於分類。
提示:題幹關鍵詞「長序列訓練的挑戰」直接對應梯度消失;其餘選項皆與 RNN 的基本性質相悖。
某公車系統想預測各站點的到站時間,需要考慮歷史班次資料、即時路況、天氣 等因素。由於路況變化複雜,傳統循環神經網路(Recurrent Neural Network, RNN)在建模時可能難以保留較早期的重要資訊。下列哪種架構最能解決這個問 題?
- A卷積神經網路(Convolutional Neural Network, CNN),利用卷積層捕捉局部特 徵
- B自編碼器(Autoencoder, AE),先進行資料壓縮再重建
- C全連接神經網路(Fully Connected Neural Network, FCNN),增加隱藏層數量
- D長短期記憶網路(Long Short-Term Memory, LSTM),改善 RNN 的長期記憶問 題
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
本題為典型的時間序列預測問題。傳統 RNN 處理長序列時,會因梯度消失或梯度爆炸而難以保留較早期的重要資訊,例如早晨尖峰路況對後續班次的影響。長短期記憶網路(LSTM)透過輸入門、遺忘門、輸出門組成的門控機制,選擇性地保留重要的長期資訊並捨棄不重要的細節,有效改善 RNN 的長期依賴問題,最符合題幹需求。
【名詞白話語典】
- RNN:專門處理序列資料的神經網路,以隱藏狀態逐步傳遞先前的資訊,但序列過長時早期資訊容易流失。
- LSTM:RNN 的改良架構,以門控機制控制記憶的保留與遺忘,能記住長時間序列中的重要資訊。
【為何其他選項錯了?】
- (A):CNN 主要處理影像等網格結構資料,擅長捕捉空間上的局部特徵,並非長序列時間依賴問題的解方。
- (B):自編碼器(Autoencoder)用於資料壓縮、降維與特徵抽取,不是為序列預測與長期記憶設計的架構。
- (C):全連接神經網路無法建模輸入之間的時間順序關係,單純增加隱藏層數量也無法解決早期資訊保留的問題。
提示:題幹關鍵詞「難以保留較早期的資訊」即長期依賴問題,標準解法為 LSTM 的門控機制。
某企業規劃導入 AI 技術支援多項資料分析任務中,下列何種屬於結構化預測 (Structured Prediction)問題?
- A判斷一封電子郵件是否為垃圾郵件
- B預測未來一週的產品需求量
- C預測客戶是否可能流失
- D為語音內容轉換後的文字進行逐詞標註
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
結構化預測(Structured Prediction)指模型的輸出本身是具有內部結構的物件,例如序列、樹或圖,且輸出元素之間彼此關聯,而非單一數值或單一類別。逐詞標註(如詞性標註)須為句子中每一個詞指定標籤,輸出是一整條標籤序列,且前後標籤之間存在依賴關係(前一詞的標籤會影響後一詞的合理標籤),屬於典型的結構化預測任務,故 (D) 正確。
【為何其他選項錯了?】
- (A):判斷電子郵件是否為垃圾郵件,輸出為兩個類別之一,屬於二元分類,輸出不具內部結構。
- (B):預測產品需求量的輸出為連續數值,屬於迴歸問題,重點在數值準確,而非輸出元素間的結構關聯。
- (C):預測客戶是否流失同樣輸出單一類別(是或否),屬於二元分類。
提示:判斷結構化預測看輸出型態:輸出為彼此相關的標籤序列即是;單一類別或單一數值則為分類或迴歸。
某語音辨識系統需分析長時間的語音序列,發現當句子較長時,模型難以保留長時間序列中的前段資訊,導致辨識準確度下降。為改善此問題,下列何種模型最適合?
- A長短期記憶網路(LSTM);
- B循環神經網路(RNN);
- C卷積神經網路(CNN);
- D生成式對抗網路(GAN)
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
題幹描述長語音序列中前段資訊隨序列長度增加而流失,即長期依賴(Long-term Dependency)問題。長短期記憶網路(LSTM)在 RNN 的基礎上引入記憶單元與輸入門、遺忘門、輸出門,可選擇性保留與遺忘資訊,緩解梯度消失,較能維持長序列中前段的重要資訊,適合改善長句語音辨識準確度下降的問題。
【為何其他選項錯了?】
- (B):一般 RNN 正是題幹問題的來源,長序列訓練易發生梯度消失,前段資訊難以保留,無法改善現況。
- (C):CNN 以卷積核捕捉局部特徵,擅長影像或序列的局部模式,不具備跨長時間距離保留資訊的記憶機制。
- (D):GAN 由生成器與判別器對抗訓練,用於資料生成任務,與長序列的記憶保留問題無關。
提示:題幹關鍵詞「長時間序列、前段資訊流失」即長期依賴問題,優先對應 LSTM。
下列哪一種情境中最適合使用「序列到序列(Seq2Seq)」模型?
- A預測銷售趨勢曲線,輸出未來數值序列
- B辨識文本中出現的人名、地名與組織名稱等實體資訊
- C對輸入文本中的關鍵字進行頻率統計與可視化
- D將輸入文字轉換成語意等價的另一段文字,如自動翻譯或摘要生成
看正解與逐選項詳解
正解:D
正確答案:(D)
【正解解析】
序列到序列(Seq2Seq)模型由編碼器(Encoder)讀入一段輸入序列,再由解碼器(Decoder)生成另一段輸出序列,輸入與輸出的長度可以不同。其典型應用即機器翻譯、文本摘要、對話生成等「將一段文字轉換為語意對應的另一段文字」的任務,正是 (D) 的描述。
【為何其他選項錯了?】
- (A):銷售趨勢預測屬於時間序列迴歸問題,常以 ARIMA 或輸出數值的 LSTM 迴歸模型處理,輸出為數值而非語言序列,並非 Seq2Seq 的典型應用。
- (B):辨識人名、地名、組織名是命名實體辨識(NER),屬於序列標註(Sequence Labeling)任務,輸入與輸出逐詞對齊,不需要 Encoder-Decoder 的生成架構。
- (C):關鍵字頻率統計與可視化屬於統計分析工作,不涉及序列生成,無須使用 Seq2Seq 模型。
提示:Seq2Seq 的特徵是「一段序列輸入、另一段序列輸出、長度可不同」,代表應用為翻譯與摘要。
下列哪一種應用最適合採用長短期記憶網路(Long Short-Term Memory, LSTM)模型?
- A預測未來七天的電力需求變化趨勢
- B辨識監視影像中不同類別的物件
- C將大量顧客資料依相似特徵自動分群
- D將高維度的感測器資料壓縮成低維表示
看正解與逐選項詳解
正解:A
正確答案:(A)
【正解解析】
LSTM 是循環神經網路(RNN)的改良架構,透過輸入門、遺忘門、輸出門控制記憶單元,擅長捕捉序列資料中的長期依賴關係,並克服傳統 RNN 的梯度消失問題。電力需求預測是典型的時間序列任務:未來七天的需求與過去用電模式、週期性趨勢高度相關,正是 LSTM 適用的場景。
【為何其他選項錯了?】
- (B):監視影像的物件類別辨識屬於空間特徵問題,主流作法為 CNN 或 YOLO 等物件偵測架構,而非處理序列的 LSTM。
- (C):顧客分群屬於非監督式學習,以 K-means、階層式分群等演算法處理;LSTM 為監督式的序列模型,不適用於分群任務。
- (D):高維感測器資料壓縮為低維表示屬於降維任務,對應 PCA、自編碼器(Autoencoder)等方法,與序列建模無關。
提示:辨識題幹的資料型態:具時間順序與前後依賴的預測任務,優先考慮 RNN/LSTM。