深度學習知識地圖 · NLP 與 LLM

BERT

理解 / Encoder

在互動地圖中開啟 回深度學習知識地圖

觀念教學

BERT (Bidirectional Encoder Representations from Transformers) 是 Encoder-only 架構,擅長理解和分類任務。

白話說明
GPT 是「從左讀到右」猜下一個字,BERT 是「左右同時看」理解整句話的意思。像做閱讀測驗,BERT 會先把整篇文章讀完再回答問題,而不是邊讀邊猜。

使用場景
語意搜尋、情感分析、問答系統、命名實體識別(NER)、文本分類。

優點
雙向理解上下文,語意理解能力強,微調後各種 NLP 任務都能用。

缺點
不擅長生成文字(那是 GPT 的強項)、模型較大推論較慢。

應用場景

文本分類情感分析問答系統命名實體識別

評估指標

AccuracyF1-Score

iPAS 歷屆考題詳解(3 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第3題

某企業計畫應用 BERT(Bidirectional Encoder Representations from Transformers)模型分析大量顧客意見,以強化客服自動回覆系統。在BERT 的預訓練過程中,「遮罩語言模型(Masked Language Model, MLM)」的主要訓練策略為何?

  1. A依序遮罩句尾詞語,讓模型從左到右逐步生成完整句子
  2. B隨機遮罩部分詞語,並讓模型根據雙向上下文(Bidirectional Context)預測被遮罩的詞
  3. C透過對抗訓練(Adversarial Training)生成語意相似的擾動樣本以提升泛化性
  4. D以未遮罩的詞為條件,使用解碼器(Decoder)結構重建整句內容
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 BERT 預訓練的遮罩語言模型(Masked Language Model, MLM)會隨機遮罩輸入中約 15% 的詞元(token),再讓模型同時利用左右兩側的上下文預測被遮罩的原詞。由於預測時可取得雙向資訊,BERT 學到的語意表徵特別適合理解型任務,例如文本分類、問答與顧客意見分析,正符合題幹的應用情境。 【為何其他選項錯了?】 - (A):「依序遮罩句尾、從左到右逐步生成」描述的是自迴歸語言模型(如 GPT)的訓練方式;BERT 是雙向編碼器,不進行逐步生成。 - (C):對抗訓練(Adversarial Training)以擾動樣本提升模型穩健性,屬於另一類技術,與 MLM 的遮罩填空策略無關。 - (D):BERT 僅有編碼器(Encoder),沒有以解碼器重建整句的設計;以 Decoder 重建的描述較接近 Seq2Seq 或 BART 等去噪自編碼架構。 提示:MLM 的兩個關鍵詞是「隨機遮罩」與「雙向上下文預測」;出現「由左至右生成」即屬 GPT 類自迴歸模型。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第4題

某金融科技公司的工程師正在準備內部客服對話與交易紀錄文本,進行 BERT 模型的預訓練,以提升模型對金融語境的理解能力,並採用遮蔽語言建模(Masked Language Model, MLM)作為訓練任務。請問 MLM 的核心訓練目標為何?

  1. A讓模型自左至右逐 token 生成句子,學習自迴歸語言模型(Autoregressive LM)能力
  2. B透過對抗訓練(Adversarial Training)縮小真實句與生成句之間的語意差異
  3. C隨機遮蔽輸入序列中部分 token,訓練模型根據雙向上下文預測被遮蔽的原始內容
  4. D透過遮蔽低頻詞來減少詞彙表大小,降低 Embedding 的記憶體使用
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 遮蔽語言建模(Masked Language Model, MLM)是 BERT 的核心預訓練任務:隨機將輸入序列中約 15% 的 token 以 [MASK]、隨機詞或原詞替換,訓練模型利用左右雙向的完整上下文,預測被遮蔽位置的原始內容。此設計迫使模型學習深層的雙向語境表示,是 BERT 適合理解型任務的原因;以金融客服語料進行 MLM 預訓練,模型即可吸收金融領域的用語與語境。 【為何其他選項錯了?】 - (A):自左至右逐 token 生成是自迴歸語言模型(Autoregressive LM)的訓練目標,屬 GPT 系列的作法;MLM 是雙向填空,而非單向生成。 - (B):以對抗訓練縮小真實句與生成句的語意差異屬於 GAN 式的訓練思路,與 MLM 的填空重建目標無關。 - (D):MLM 的遮蔽對象是隨機選取的 token,並非針對低頻詞;此機制也不會縮減詞彙表或降低 Embedding 的記憶體使用。 提示:MLM=隨機遮蔽+雙向上下文預測;與 GPT 的單向生成目標互為對照,是常見考點。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第23題

某團隊開發法律文件生成系統,需根據合約前半段內容自動生成後半段條款。工程師分別使用 BERT與GPT-2 進行微調,但發現 BERT 的生成效果明顯較差,且即使增加訓練資料也無法改善。下列何者為最主要原因?

  1. ABERT 缺乏法律領域知識,因此生成能力較差
  2. BBERT 的分詞方式影響語意理解,導致生成效果不佳
  3. CBERT 模型規模較小,因此生成能力不足
  4. DBERT 無法根據前文逐步生成後續文字,較不適合此類任務
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 BERT 為 Encoder-only 架構,以雙向遮罩語言模型(MLM)訓練,擅長同時參考前後文進行填空式的理解,並無「根據前文逐步預測下一個 token」的自迴歸生成機制。合約後半段條款的生成屬於開放式的長文本續寫任務,架構特性決定了 BERT 難以勝任,因此增加訓練資料也無法改善。GPT-2 為 Decoder-only 自迴歸模型,逐 token 續寫正是其設計目標,微調後表現自然較佳。 【為何其他選項錯了?】 - (A):法律領域知識可透過微調注入;題幹指出增加資料仍無法改善,顯示問題出在生成機制,而非領域知識不足。 - (B):BERT 的 WordPiece 分詞在理解任務上表現良好,分詞方式並非生成效果不佳的主因。 - (C):相同規模下 GPT-2 的生成能力仍明顯優於 BERT;關鍵在於是否具備自迴歸生成機制,而非參數規模。 提示:任務與架構對應:理解型任務選 Encoder(BERT),生成型任務選 Decoder(GPT);「加資料也無效」暗示架構層面的限制。

相關節點