首頁教材庫 / 多模態AI / CLIP 圖文對比學習

iPAS AI初級 多模態AI ⏱ 約 4 分鐘讀完
iPAS AI 初級・漫畫式小白教材

CLIP

Contrastive Language-Image Pre-training|讓 AI 學會「圖片 ↔ 文字」是同一件事!

🎬 第一幕:AI 看到一張貓的照片

🖼️ 圖片
🐱📷
「一隻橘色的貓坐在沙發上。」

這是圖片資訊

📝 文字
💬🐱
「A cute orange cat sitting on a sofa」

這是文字描述

🤝 CLIP
🖼️ ↔️ 📝

CLIP 學習:

「這張圖和這句話很配!」

把圖片與文字映射到可以比較相似度的共同語義空間。

🧠 一句話先背起來

CLIP=「圖片 Encoder + 文字 Encoder + 對比學習」

CLIP 不是單純「圖片分類器」。它使用大量圖片-文字配對資料,讓圖片與對應文字的表示彼此接近;不匹配的圖片與文字則被拉遠。

Image EncoderText EncoderContrastive Learning共同語義空間

🎭 第二幕:用「配對遊戲」秒懂 Contrastive Learning

① 老師給照片
🐶📷

照片:

一隻狗在草地上。

② 給三句話
📝📝📝
A:狗在草地上 🐶🌳
B:一台汽車 🚗
C:一顆蘋果 🍎
③ CLIP 配對
🤝⭐

正確配對:

圖片 🐶 ↔ 文字「狗在草地上」

拉近正確配對,拉遠錯誤配對。

🔄 第三幕:CLIP 到底怎麼運作?

🖼️
① 圖片
Image
👁️
② Image Encoder
轉成向量
📝
③ Text Encoder
文字轉向量
🤝
④ 比相似度
正確配對更接近
圖片 → Image Encoder → 圖片向量
文字 → Text Encoder → 文字向量

Contrastive Learning:正確配對拉近、錯誤配對拉遠

🎯 第四幕:CLIP 可以拿來做什麼?

🔍 Zero-shot Image Classification

不用為每個新類別重新訓練分類器,只要提供文字標籤:

「貓」 vs 「狗」 vs 「汽車」

比較圖片與各文字描述的相似度,找最符合的標籤。

🔎 Image-Text Retrieval

「幫我找出最符合『海邊夕陽』的照片。」

可以把圖片與文字放在共同表示空間裡比較。

🛒 電商商品搜尋

使用者輸入:

「白色休閒鞋」

用文字與商品圖片的語義相似度找商品。

🏢 大樓影像應用

例如用文字提示比較影像:

「正常大廳」/「施工現場」/「積水地面」

作為影像語義匹配的基礎。

🥊 第五幕:CLIP 跟「一般圖片分類」有什麼不同?

比較🖼️ 傳統分類模型🤝 CLIP
主要概念圖片 → 固定類別圖片 ↔ 文字共同表示
類別怎麼來?通常訓練時就定義好可用文字描述建立候選概念
核心訓練常見為分類監督學習圖片-文字對比學習
例子貓/狗/鳥「一隻狗在草地上」與圖片的相似度
記憶法「圖片是哪一類?」「這張圖片最像哪句話?」

⚠️ 第六幕:CLIP 不等於「看到圖片就什麼都懂」

❌ 不要這樣背

「CLIP = 圖片辨識 AI」

太粗略。

✅ 正確理解

CLIP 的核心是圖片與文字的跨模態表示對齊,利用對比學習把匹配的圖文拉近。

🎯 考試看到「圖片+文字配對」、「共同語義空間」、「Contrastive Learning」、「Zero-shot 分類」→ 優先想到 CLIP。

🚨 第七幕:你提供的「最後例題」其實考的是 ReAct!

這裡要特別注意:你這次指定的 CLIP 教材,最後附上的題目內容仍然是上一題的 ReAct(Reason and Act)題目,不是 CLIP 題目。為了讓你複習不混淆,我仍然把它放在最後,並明確標示「這題考 ReAct」。
❌ 這題不是在考 CLIP。
題目關鍵是 AI Agent、自己判斷資訊是否足夠、調整查詢方向,這些都屬於 Agent/ReAct 的概念。

🎯 最後來做你提供的題目:ReAct 題

題目:某企業在設計 AI Agent 時,需判斷是否採用 ReAct。哪種情境最適合?

A. 固定 PDF 批次翻譯並自動儲存
B. 按既有規則判斷退貨條件
C. 依既定流程進行多步查詢與整理
D. 分析新創融資,AI 自行判斷資訊是否足夠並調整查詢方向

🎯 正確答案:D ✅

關鍵字:「自行判斷」+「資訊是否足夠」+「調整查詢方向」

這是典型 ReAct:
🧠 Reason → 🔎 Act → 👀 Observe → 🧠 再 Reason → 🔎 下一個 Action。

這與 CLIP 無關。 CLIP 是「圖片 ↔ 文字」的跨模態表示與對比學習。
⭐ CLIP:圖片 ↔ 文字
⭐ ReAct:思考 → 行動 → 觀察 → 再思考

🧠 iPAS 考前超強口訣

CLIP=「圖文配對」
Image ↔ Text

ReAct=「邊想邊做」
Reason → Act → Observe

看到「圖片+文字+Contrastive Learning」→ CLIP

看到「Agent+工具+根據結果調整下一步」→ ReAct

📌 考前最後一張小抄

題目關鍵字立刻想到
圖片+文字🤝 CLIP
Contrastive Learning🤝 CLIP
共同語義空間🤝 CLIP
Zero-shot Image Classification🤝 CLIP
Reason + Act🤖 ReAct
工具使用+觀察結果+動態調整🤖 ReAct

⭐ 最終口訣:
CLIP 看圖文,ReAct 看行動。