← 返回知識庫刷題首頁
P1 · 應會

機器學習中級

跨模態對齊 (Cross-Modal Alignment)

是什麼

把影像、文字、聲音等不同模態的表示映射到同一個語意空間,使語意相同的不同模態資料在空間中彼此靠近、可以直接比較。

解決什麼問題

讓模型能做圖文檢索、圖像描述等跨模態任務,建立不同模態之間的對應關係。

考場 Trigger

  • 共同語意空間
  • 圖文配對
  • 對比學習拉近正樣本
  • 不同模態可直接比較

容易搞混

CLIP 與 DINO特徵融合模態專屬編碼器

中級深度

能說明對齊的目的是建立共同語意空間,以 CLIP 圖文對比學習為例,並與特徵融合區分。

Official Evidence

官方題目正在怎麼考

1 官方題1 考綱節點