深度學習知識地圖 · 生成式 AI
Diffusion
Stable Diffusion, Midjourney
觀念教學
擴散模型透過逐步去噪生成高品質圖像,是目前 AI 繪圖的主流技術。
白話說明
訓練時:拿一張清晰圖片,一步步加噪音直到變成純雜訊。模型學的是「怎麼去噪」。
生成時:從一團隨機雜訊開始,一步步去噪,最後變成一張清晰圖片。就像雕刻家從一塊石頭慢慢鑿出雕像。
代表產品
Stable Diffusion、Midjourney、DALL-E 3、Imagen。
使用場景
AI 繪圖、圖像編輯(局部修改)、影片生成、3D 模型生成。
優點
生成品質極高、訓練穩定(比 GAN 好訓練)、可控性強(文字描述→圖片)。
缺點
生成速度慢(需要多步去噪)、計算資源需求大。
應用場景
評估指標
iPAS 歷屆考題詳解(4 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某企業導入生成式影像AI 工具以提升商品圖片處理效率,並允許使用者以自然語言描述編輯需求。下列何者最不屬於該類工具之典型功能範疇?
- A依指令移除圖片中不需要的物件並修補背景;
- B依指令調整商品影像之光影與色彩風格;
- C依指令將影像中特定元素替換為其他物件;
- D依圖像內容自動判斷商品銷售數據並生成分析報表
看正解與逐選項詳解
正解:D
某AI 團隊正在開發一套文字生成影片的系統,模型可根據輸入的描述,自動生成連續且具時間一致性的影像內容。該系統的生成過程是由隨機初始狀態開始,透過多步驟逐漸轉換為有意義的影像序列。請問下列哪一項最能敘述此類影片生成模型的核心機制?
- A透過拼接既有影片片段來組合成新影片;
- B從靜態噪聲開始,逐步去除噪聲生成影片內容;
- C先產生多張獨立靜態影像,再依序串接成影片;
- D使用生成對抗網路(GAN)從隨機向量一次生成完整影片
看正解與逐選項詳解
正解:B
某影像設計團隊在使用 Stable Diffusion 生成4K級產品圖時,發現影像邊緣與細節存在顆粒化與模糊現象。若僅能在生成階段進行調整,希望提升畫面清晰度與紋理層次,同時避免過度平滑,下列哪一項作法最適合?
- A降低取樣步數,以縮短生成時間
- B增加取樣步數並選擇高品質取樣器,以強化細節還原度
- C提高CFG(Classifier-Free Guidance)值,使生成結果更具創意與多樣性
- D改用低解析度輸入以降低計算成本
看正解與逐選項詳解
正解:B
某設計師使用公司內部建置的生成式 AI工具製作行銷素材,並輸入提示語(Prompt):「請生成一張模特兒手持品牌飲料、背景為海邊夕陽的照片」。系統能正確生成主要主題與場景,但輸出的圖像中,品牌標誌顏色常有誤差,或人物手部姿勢顯得不自然。若從多模態生成模型的技術機制分析,此現象最可能是下列哪一項原因所造成?
- A擴散式生成模型的去雜訊過程出現隨機梯度漂移,導致影像像素錯誤
- B提示語過長造成 Transformer 的位置編碼超出上下文限制,導致生成混亂
- CCLIP 模型中的文字編碼器與影像編碼器在語意嵌入空間未充分對齊,導致跨模態理解偏差
- D模型未採用對比學習(Contrastive Learning)損失函數,無法建立多模態語意關聯
看正解與逐選項詳解
正解:C