P1 · 應會
機器學習
跨模態對齊 (Cross-Modal Alignment)
是什麼
把影像、文字、聲音等不同模態的表示映射到同一個語意空間,使語意相同的不同模態資料在空間中彼此靠近、可以直接比較。
解決什麼問題
讓模型能做圖文檢索、圖像描述等跨模態任務,建立不同模態之間的對應關係。
考場 Trigger
- 共同語意空間
- 圖文配對
- 對比學習拉近正樣本
- 不同模態可直接比較
容易搞混
CLIP 與 DINO特徵融合模態專屬編碼器
中級深度
能說明對齊的目的是建立共同語意空間,以 CLIP 圖文對比學習為例,並與特徵融合區分。