學習路線圖 · AI應用規劃師中級

階段 1 技術入門

複習AI概念,深入NLP(分詞、情感分析)與 CV(物件偵測、影像分割);了解GenAI(Transformer/Diffusion)與多模態。

在互動地圖中開啟 回學習路線圖

觀念教學

挑戰 AI 應用規劃師中級,階段 1 要把技術底盤從「聽過」升級到「講得出原理與應用場景」:NLP、CV、生成式 AI 三大主軸一次到位。

這一階段學什麼

  • AI 概念複習:把初級程度的 AI 分類與學習範式快速掃過,補平知識落差
  • NLP 深入:分詞、情感分析等核心任務,理解文字如何被拆解與理解,認識 BERT 這類代表模型
  • CV 深入:物件偵測與影像分割的差異與應用,認識 YOLO 這類即時偵測代表
  • GenAI 原理:Transformer 與 Diffusion 兩大架構 — 前者撐起語言模型,後者撐起圖像生成
  • 多模態 AI:文字、影像、聲音如何在同一系統中互通

為什麼是現在學

中級考的是「規劃」,但規劃建立在技術判斷上:不懂物件偵測與影像分割的差異,階段 2 的專案評估就選不對技術方案;不懂 Transformer,階段 5 的深度學習調校也無從談起。技術入門是後面五個階段的地基。

怎麼練(具體行動)

  1. 替 NLP 與 CV 各整理一張任務地圖:任務名稱、輸入輸出、代表模型(如 BERT、YOLO)、產業應用
  2. 用白話各寫 200 字說明 Transformer 與 Diffusion 的原理,講給非技術朋友聽
  3. 找三個台灣產業案例(如醫療影像、客服文字分析、製造檢測),標出各用了哪類技術
  4. 做一份「鑑別式 vs 生成式」對照筆記,列出典型任務與模型

完成標準

  • 能分辨並說明 NLP、CV、GenAI 的代表任務與模型(呼應里程碑:掌握 AI 關鍵技術)
  • 給一個應用場景,能指出該用哪類技術與理由
  • 看到分詞、影像分割、多模態這些詞不再心虛
⚠️ 常見誤區:死背模型名字不記任務 — 中級考題給的是情境,考你「這場景用哪類技術」,不是名詞默寫。

這一階段對應中級考科的技術基礎題,底盤穩了,後面的規劃與實作題才有得分空間。

里程碑

✓ 掌握 AI 關鍵技術

範例專題

BERT/YOLO 應用

應用場景

NLP/CVTransformerDiffusion多模態 AI

iPAS 歷屆考題詳解(2 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第17題

某醫療新創公司正在開發一套「多模態患者風險評估系統」,需同時處理三種異質資料來源:胸腔 X光影像(影像模態)、臨床診斷筆記(文字模態),以及心率與血氧的時序感測資料(數值時序模態)。工程師在進行各模態的特徵擷取模型選擇時,需為每種模態挑選最適合的模型架構。下列哪一組模型配置最符合三種模態各自的資料特性?

  1. A影像模態用 LSTM、文字模態用 CNN、時序模態用 BERT
  2. B影像模態用 TF-IDF、文字模態用 ResNet、時序模態用 Word2Vec
  3. C三種模態統一使用 BERT,因為 Transformer 架構具備通用性,可處理任意形式的輸入資料
  4. D影像模態用 CNN、文字模態用 Transformer、時序模態用 LSTM 或 Temporal CNN
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 模型架構的選擇要對準各模態的資料特性。胸腔 X 光是 2D 影像,重點在空間局部特徵(紋理、邊緣、病灶形狀),卷積神經網路(CNN)的卷積運算正是為擷取空間局部模式而設計;臨床診斷筆記是自然語言,需要建模詞彙間的長距離語意關聯,Transformer(如 BERT 系列)是目前的標準架構;心率與血氧是連續數值時序資料,重視時間依賴性,LSTM 或時序卷積網路(Temporal CNN)皆是針對時序建模的架構。各模態先以合適的骨幹網路擷取特徵,後續融合才有良好基礎,故 (D) 正確。 【為何其他選項錯了?】 - (A):三項配置全數錯位:LSTM 是時序架構卻被配給影像,CNN 擅長空間特徵卻被當成文字主力,BERT 處理 token 序列卻被指派原始數值時序,皆非各模態的合理首選。 - (B):TF-IDF 是文字統計特徵方法,無法處理影像;ResNet 是影像模型,不適合讀取病歷文字;Word2Vec 是詞向量技術,無法直接處理心率數值,三者全數錯配。 - (C):BERT 原生輸入是 token 序列,影像與數值時序需先經特殊轉換(如 ViT 的 patch 化)才能餵入 Transformer;「架構具通用性所以統一使用 BERT」忽略了各模態所需的前處理與歸納偏置差異,工程上並不成立。 提示:影像對 CNN、文字對 Transformer、時序對 LSTM 或 TCN,依模態特性配對架構。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第18題

某醫院的 AI研究團隊正在開發一套整合「CT影像+電子病歷文本+基因序列」三種模態資料的癌症預測模型。請問在此場景中採用「跨模態對齊(Cross-Modal Alignment)」技術主要解決什麼問題?

  1. A使模型僅聚焦於 CT 影像資料,避免文本與基因資料引入雜訊
  2. B自動生成跨模態配對標註,以減少人工標記需求
  3. C降低多模態資料的儲存與計算成本,以提升訓練效率
  4. D將不同模態的資料表示對齊至共同語意空間,使模型能建立跨模態之間的語意關聯
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 CT 影像、病歷文本與基因序列各自經過不同編碼器後,產生的向量分別落在互不相干的表示空間,彼此的距離與方向不具可比性,模型無法判斷「這張影像」與「這段病歷」是否描述同一病患的同一病理狀態。跨模態對齊(Cross-Modal Alignment)的目標,是透過對比學習等方法(如 CLIP 將影像與文字映射至同一空間),把不同模態的表示投影到共同語意空間:同一病患、同一概念的不同模態表示彼此靠近,模型才能建立跨模態的語意關聯,實現三種模態互通的癌症預測,故 (D) 正確。 【為何其他選項錯了?】 - (A):對齊的目的是讓三種模態的資訊聯合運用,而非只聚焦影像並把文本與基因視為雜訊排除;若僅使用單一模態,便無須建置多模態系統。 - (B):跨模態對齊不是自動標註技術;對齊訓練通常反而需要既有的跨模態配對資料(如影像與報告的對應),並非用來產生配對標註。 - (C):對齊處理的是表示空間不一致的問題,與降低儲存與計算成本無關;成本與效率屬系統資源層面的議題。 提示:「跨模態對齊」的關鍵字是共同語意空間與跨模態語意關聯,與標註需求、儲存成本無關。

相關節點