-
CLIP: Architecture for Image-Text Alignment
Understanding how CLIP bridges the gap between vision and language.
-
GeoStack: Geometric Stacking for Knowledge Composition
GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs.
-
Multi-Modal Spaces
Motivation for Multi-Modal Spaces.
-
BiCLIP
BiCLIP: Domain Canonicalization via Structured Geometric Transformation.
-
Visual, Audio, and Textual Datasets
Some insights on datasets!!