全部学习路线Read in English →

PATH 03 · 5

多模态:从像素到内容理解

图像 patch、CLIP、masked reconstruction、视觉语言模型与视频时间轴:理解模型看见了什么。

  1. 01

    图像怎样变成 token:Patch、位置与分辨率

    从 RGB 张量到 ViT patch embedding,计算视觉 token 数,理解缩放与裁剪可能丢失的内容。

  2. 02

    CLIP:让图像和文字在同一空间相遇

    亲手构造 B×B 相似度矩阵,理解对比学习、负样本、温度和零样本分类的局限。

  3. 03

    Reconstruction:遮住图像后,模型究竟学什么?

    区分像素重建与语义预测,拆解 MAE 的 visible-only encoder、轻量 decoder 和 masked loss。

  4. 04

    视觉语言模型:从 CLIP 特征到能回答问题的 LLM

    理解 vision encoder、projector 与 decoder 的接口,分清对齐训练、指令训练和视觉 grounding。

  5. 05

    视频内容理解:采样、时间定位、音频与评估

    把视频当成时间上的证据,计算帧与 token 预算,并诊断静态捷径、字幕泄漏和事件遗漏。