当 AI 学会"看"世界,它不再只是一个文字处理器。从 CLIP 的对比学习到 LLaVA 的视觉指令微调,多模态大模型正在重新定义人机交互的边界。本文将深入解析三大里程碑架构,并给出完整的实战代码。
一、多模态架构演进全景
1.1 从单模态到多模态的三个阶段
阶段1: 双塔模型(Dual Encoder)
┌──────────┐ ┌──────────┐
│ Image │ │ Text │
│ Encoder │ │ Encoder │
│ (ViT) │ │ (BERT) │
└────┬─────┘ └────┬─────┘
│ │
│ 对比学习对齐 │
│ (Contrastive) │
└────────┬────────┘
│
共享嵌入空间
代表: CLIP (2021), ALIGN (2021)
能力: 图文检索、零样本分类
局限: 只能做检索,不能生成描述
阶段2: 交叉注意力融合(Cross-Attention)
┌──────────┐ ┌──────────┐
│ Image │ │ Text │
│ Encoder │ │ Decoder │
│ (ViT) │ │ (LM) │
└────┬─────┘ └────┬─────┘
│ │
│ Cross-Attention│
│ (Q←Text, KV←Image)│
└────────┬───────┘
│
融合表示 → 生成
代表: BLIP-2 (2023), Flamingo (2022)
能力: 图像描述、VQA、图文生成
优势: 深度交互,理解更准确
阶段3: 投影层直连(Projection + LLM)
┌──────────┐ ┌──────────────┐
│ Image │ │ LLM │
│ Encoder │ │ (Vicuna/ │
│ (CLIP │ │ Llama) │
│ ViT) │ │ │
└────┬─────┘ └──────┬───────┘
│ │
│ MLP Projection │
│ (线性层/MLP) │
└────────┬─────────┘
│
视觉Token混入文本Token
代表: LLaVA (2023), MiniGPT-4 (2023)
优势: 架构简单、可复用LLM能力、支持指令微调
2026/7/3大约 16 分钟