Meta · Multimodal LLMs
PATH 03 · 5 章
多模态:从像素到内容理解
图像 patch、CLIP、masked reconstruction、视觉语言模型与视频时间轴:理解模型看见了什么。
- 01
图像怎样变成 token:Patch、位置与分辨率
从 RGB 张量到 ViT patch embedding,计算视觉 token 数,理解缩放与裁剪可能丢失的内容。
- 02
CLIP:让图像和文字在同一空间相遇
亲手构造 B×B 相似度矩阵,理解对比学习、负样本、温度和零样本分类的局限。
- 03
Reconstruction:遮住图像后,模型究竟学什么?
区分像素重建与语义预测,拆解 MAE 的 visible-only encoder、轻量 decoder 和 masked loss。
- 04
视觉语言模型:从 CLIP 特征到能回答问题的 LLM
理解 vision encoder、projector 与 decoder 的接口,分清对齐训练、指令训练和视觉 grounding。
- 05
视频内容理解:采样、时间定位、音频与评估
把视频当成时间上的证据,计算帧与 token 预算,并诊断静态捷径、字幕泄漏和事件遗漏。