深度學習知識地圖 · 生成式 AI

Diffusion

Stable Diffusion, Midjourney

在互動地圖中開啟 回深度學習知識地圖

觀念教學

擴散模型透過逐步去噪生成高品質圖像,是目前 AI 繪圖的主流技術。

白話說明
訓練時:拿一張清晰圖片,一步步加噪音直到變成純雜訊。模型學的是「怎麼去噪」。
生成時:從一團隨機雜訊開始,一步步去噪,最後變成一張清晰圖片。就像雕刻家從一塊石頭慢慢鑿出雕像。

代表產品
Stable Diffusion、Midjourney、DALL-E 3、Imagen。

使用場景
AI 繪圖、圖像編輯(局部修改)、影片生成、3D 模型生成。

優點
生成品質極高、訓練穩定(比 GAN 好訓練)、可控性強(文字描述→圖片)。

缺點
生成速度慢(需要多步去噪)、計算資源需求大。

應用場景

AI 繪圖圖像編輯風格轉換影片生成

評估指標

FIDISCLIP Score

iPAS 歷屆考題詳解(4 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第21題

某企業導入生成式影像AI 工具以提升商品圖片處理效率,並允許使用者以自然語言描述編輯需求。下列何者最不屬於該類工具之典型功能範疇?

  1. A依指令移除圖片中不需要的物件並修補背景;
  2. B依指令調整商品影像之光影與色彩風格;
  3. C依指令將影像中特定元素替換為其他物件;
  4. D依圖像內容自動判斷商品銷售數據並生成分析報表
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 生成式影像工具的功能範疇是影像內容的生成與編輯:依指令移除物件並修補背景(Inpainting)、調整光影與色彩風格、替換影像中的特定元素,皆屬以自然語言操作影像的典型能力。依圖像內容判斷商品銷售數據並生成分析報表,涉及銷售資料的取得與統計分析,屬於資料分析或商業智慧系統的工作,且影像本身並不包含銷售數據,故 (D) 最不屬於此類工具的典型功能範疇。 【為何其他選項錯了?】 - (A):依指令移除不需要的物件並修補背景,是影像修補(Inpainting)的典型功能,屬生成式影像編輯的核心能力。 - (B):調整商品影像的光影與色彩風格,是生成式影像編輯的常見功能,可經文字指令完成。 - (C):將影像中特定元素替換為其他物件,同樣是生成式影像工具常見的編輯能力。 提示:本題問「最不屬於」;區分影像生成編輯功能與銷售資料分析,後者不在影像工具的範疇內。
115年第二次初級AI應用規劃師第二科生成式AI應用與規劃 第29題

某AI 團隊正在開發一套文字生成影片的系統,模型可根據輸入的描述,自動生成連續且具時間一致性的影像內容。該系統的生成過程是由隨機初始狀態開始,透過多步驟逐漸轉換為有意義的影像序列。請問下列哪一項最能敘述此類影片生成模型的核心機制?

  1. A透過拼接既有影片片段來組合成新影片;
  2. B從靜態噪聲開始,逐步去除噪聲生成影片內容;
  3. C先產生多張獨立靜態影像,再依序串接成影片;
  4. D使用生成對抗網路(GAN)從隨機向量一次生成完整影片
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 題幹描述生成過程「由隨機初始狀態開始,經多步驟逐漸轉換為有意義的影像序列」,這正是擴散模型(Diffusion Model)的核心機制:訓練時對資料逐步加入雜訊,生成時從純雜訊出發,由模型逐步去噪(Denoising),經多個步驟還原出有意義的內容;影片生成則在此基礎上加入時間維度的建模,使連續影格維持時間一致性,選項 (B) 的敘述最符合。 【為何其他選項錯了?】 - (A):拼接既有影片片段屬素材剪輯與組合,並非從隨機狀態逐步生成新內容,與題幹描述不符。 - (C):先產生多張獨立靜態影像再串接,影格之間缺乏共同的時間建模,難以維持連續動作與時間一致性,不符合題幹所述的核心機制。 - (D):GAN 的典型生成方式是由隨機向量一次前向生成,不具「多步驟逐漸去噪」的過程,與題幹強調的機制不同。 提示:「從靜態噪聲開始、多步驟逐漸生成」是擴散模型的識別特徵。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第38題

某影像設計團隊在使用 Stable Diffusion 生成4K級產品圖時,發現影像邊緣與細節存在顆粒化與模糊現象。若僅能在生成階段進行調整,希望提升畫面清晰度與紋理層次,同時避免過度平滑,下列哪一項作法最適合?

  1. A降低取樣步數,以縮短生成時間
  2. B增加取樣步數並選擇高品質取樣器,以強化細節還原度
  3. C提高CFG(Classifier-Free Guidance)值,使生成結果更具創意與多樣性
  4. D改用低解析度輸入以降低計算成本
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 擴散模型生成影像是從純雜訊逐步去噪(Denoising)的過程:取樣步數(Sampling Steps)越多,每一步去噪越精細,細節與紋理的還原度越高;搭配高品質取樣器(如 DPM++ 系列)可在細節與效率之間取得更好的平衡。邊緣顆粒化與模糊正是步數不足或取樣器品質不佳的典型症狀,增加取樣步數並選用高品質取樣器可直接提升清晰度與紋理層次,同時避免過度平滑,是生成階段的正確調整。 【為何其他選項錯了?】 - (A):降低取樣步數是反方向操作,去噪不完全會使顆粒感更明顯,以畫質換取生成時間,與題目目標相悖。 - (C):提高 CFG 值會使生成結果更貼近提示語,過高反而導致過飽和與偽影;且 CFG 的實際作用是收斂於提示、降低多樣性,與選項所稱「更具創意與多樣性」相反。 - (D):改用低解析度輸入直接損失像素資訊,與 4K 產品圖的細節要求背道而馳。 提示:清晰度與紋理不足時,優先檢視取樣步數與取樣器品質;CFG 控制的是貼合提示的程度,不是畫質。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第50題

某設計師使用公司內部建置的生成式 AI工具製作行銷素材,並輸入提示語(Prompt):「請生成一張模特兒手持品牌飲料、背景為海邊夕陽的照片」。系統能正確生成主要主題與場景,但輸出的圖像中,品牌標誌顏色常有誤差,或人物手部姿勢顯得不自然。若從多模態生成模型的技術機制分析,此現象最可能是下列哪一項原因所造成?

  1. A擴散式生成模型的去雜訊過程出現隨機梯度漂移,導致影像像素錯誤
  2. B提示語過長造成 Transformer 的位置編碼超出上下文限制,導致生成混亂
  3. CCLIP 模型中的文字編碼器與影像編碼器在語意嵌入空間未充分對齊,導致跨模態理解偏差
  4. D模型未採用對比學習(Contrastive Learning)損失函數,無法建立多模態語意關聯
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 文生圖系統(如 Stable Diffusion)依賴 CLIP 類的文字編碼器將提示語轉為語意向量,引導擴散過程生成影像。若文字編碼器與影像編碼器的語意嵌入空間對齊不充分,細粒度語意(品牌標誌的特定顏色、手部的精細結構)在跨模態轉換時容易失真,呈現「整體主題與場景正確、局部細節出錯」的典型症狀,與題幹中標誌色偏、手部姿勢不自然的現象一致,故 (C) 是最可能的原因。 【為何其他選項錯了?】 - (A):「隨機梯度漂移」並非擴散模型去噪過程的既有機制;去噪由訓練完成的雜訊預測網路執行,不存在此選項所述的現象。 - (B):題幹的提示語相當簡短,遠未超出上下文限制;位置編碼超限造成的是整體生成混亂,而非僅細節出錯、主體正常。 - (D):CLIP 本身就是以對比學習(Contrastive Learning)訓練的模型,「未採用對比學習」與事實不符;問題在於對齊的充分程度,而非有無使用。 提示:文生圖「大方向正確、細節失準」的症狀,優先考慮 CLIP 圖文嵌入空間對齊不足。

相關節點