🖼️ 圖片
🐱📷
「一隻橘色的貓坐在沙發上。」
這是圖片資訊。
Contrastive Language-Image Pre-training|讓 AI 學會「圖片 ↔ 文字」是同一件事!
這是圖片資訊。
這是文字描述。
CLIP 學習:
「這張圖和這句話很配!」
把圖片與文字映射到可以比較相似度的共同語義空間。
CLIP 不是單純「圖片分類器」。它使用大量圖片-文字配對資料,讓圖片與對應文字的表示彼此接近;不匹配的圖片與文字則被拉遠。
Image EncoderText EncoderContrastive Learning共同語義空間照片:
一隻狗在草地上。
正確配對:
圖片 🐶 ↔ 文字「狗在草地上」
拉近正確配對,拉遠錯誤配對。
不用為每個新類別重新訓練分類器,只要提供文字標籤:
比較圖片與各文字描述的相似度,找最符合的標籤。
「幫我找出最符合『海邊夕陽』的照片。」
可以把圖片與文字放在共同表示空間裡比較。
使用者輸入:
「白色休閒鞋」
用文字與商品圖片的語義相似度找商品。
例如用文字提示比較影像:
「正常大廳」/「施工現場」/「積水地面」
作為影像語義匹配的基礎。
| 比較 | 🖼️ 傳統分類模型 | 🤝 CLIP |
|---|---|---|
| 主要概念 | 圖片 → 固定類別 | 圖片 ↔ 文字共同表示 |
| 類別怎麼來? | 通常訓練時就定義好 | 可用文字描述建立候選概念 |
| 核心訓練 | 常見為分類監督學習 | 圖片-文字對比學習 |
| 例子 | 貓/狗/鳥 | 「一隻狗在草地上」與圖片的相似度 |
| 記憶法 | 「圖片是哪一類?」 | 「這張圖片最像哪句話?」 |
「CLIP = 圖片辨識 AI」
太粗略。
CLIP 的核心是圖片與文字的跨模態表示對齊,利用對比學習把匹配的圖文拉近。
A. 固定 PDF 批次翻譯並自動儲存
B. 按既有規則判斷退貨條件
C. 依既定流程進行多步查詢與整理
D. 分析新創融資,AI 自行判斷資訊是否足夠並調整查詢方向
看到「圖片+文字+Contrastive Learning」→ CLIP
看到「Agent+工具+根據結果調整下一步」→ ReAct
| 題目關鍵字 | 立刻想到 |
|---|---|
| 圖片+文字 | 🤝 CLIP |
| Contrastive Learning | 🤝 CLIP |
| 共同語義空間 | 🤝 CLIP |
| Zero-shot Image Classification | 🤝 CLIP |
| Reason + Act | 🤖 ReAct |
| 工具使用+觀察結果+動態調整 | 🤖 ReAct |
⭐ 最終口訣:
「CLIP 看圖文,ReAct 看行動。」