深度學習知識地圖 · NLP 與 LLM
BERT
理解 / Encoder
觀念教學
BERT (Bidirectional Encoder Representations from Transformers) 是 Encoder-only 架構,擅長理解和分類任務。
白話說明
GPT 是「從左讀到右」猜下一個字,BERT 是「左右同時看」理解整句話的意思。像做閱讀測驗,BERT 會先把整篇文章讀完再回答問題,而不是邊讀邊猜。
使用場景
語意搜尋、情感分析、問答系統、命名實體識別(NER)、文本分類。
優點
雙向理解上下文,語意理解能力強,微調後各種 NLP 任務都能用。
缺點
不擅長生成文字(那是 GPT 的強項)、模型較大推論較慢。
應用場景
評估指標
iPAS 歷屆考題詳解(3 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某企業計畫應用 BERT(Bidirectional Encoder Representations from Transformers)模型分析大量顧客意見,以強化客服自動回覆系統。在BERT 的預訓練過程中,「遮罩語言模型(Masked Language Model, MLM)」的主要訓練策略為何?
- A依序遮罩句尾詞語,讓模型從左到右逐步生成完整句子
- B隨機遮罩部分詞語,並讓模型根據雙向上下文(Bidirectional Context)預測被遮罩的詞
- C透過對抗訓練(Adversarial Training)生成語意相似的擾動樣本以提升泛化性
- D以未遮罩的詞為條件,使用解碼器(Decoder)結構重建整句內容
看正解與逐選項詳解
正解:B
某金融科技公司的工程師正在準備內部客服對話與交易紀錄文本,進行 BERT 模型的預訓練,以提升模型對金融語境的理解能力,並採用遮蔽語言建模(Masked Language Model, MLM)作為訓練任務。請問 MLM 的核心訓練目標為何?
- A讓模型自左至右逐 token 生成句子,學習自迴歸語言模型(Autoregressive LM)能力
- B透過對抗訓練(Adversarial Training)縮小真實句與生成句之間的語意差異
- C隨機遮蔽輸入序列中部分 token,訓練模型根據雙向上下文預測被遮蔽的原始內容
- D透過遮蔽低頻詞來減少詞彙表大小,降低 Embedding 的記憶體使用
看正解與逐選項詳解
正解:C
某團隊開發法律文件生成系統,需根據合約前半段內容自動生成後半段條款。工程師分別使用 BERT與GPT-2 進行微調,但發現 BERT 的生成效果明顯較差,且即使增加訓練資料也無法改善。下列何者為最主要原因?
- ABERT 缺乏法律領域知識,因此生成能力較差
- BBERT 的分詞方式影響語意理解,導致生成效果不佳
- CBERT 模型規模較小,因此生成能力不足
- DBERT 無法根據前文逐步生成後續文字,較不適合此類任務
看正解與逐選項詳解
正解:D