小白程序员必看!收藏这份视觉模型发展史,从CNN到VLA的完整进阶指南

📅 2026/7/30 2:06:44
小白程序员必看!收藏这份视觉模型发展史,从CNN到VLA的完整进阶指南
本文带你回顾视觉模型的发展历程从基础的图像矩阵表示开始深入解析CNN、ViT、Transformer等核心架构再到自监督学习、生成模型GAN到Diffusion最后通过CLIP和VLA模型展示视觉AI如何打通图文并走向具身智能。全文通俗易懂适合小白和程序员快速掌握视觉AI技术演进脉络。开篇你用手机拍了一张模糊的老照片打开某个 App点一下修复——三秒后一张清晰的彩色照片出现了。你告诉AI“帮我画一只穿西装的猫在月球上喝咖啡”——十秒后AI 交出了一张以假乱真的图。你对着机器人说把桌上的杯子放到架子上——它走过去真的放了。这三件事背后分别是视觉基础模型的三种能力理解图像、生成图像、操控世界。这篇文章从图像在计算机里的最底层表示讲起经过 CNN、Transformer、自监督学习到生成模型GAN → Diffusion → Flow Matching再到 CLIP 打通图文最后落在 VLA视觉-语言-动作模型上。一条线串完你会看到整个视觉 AI 从看懂到画出再到动手的完整演进。本文基于课堂笔记借助大模型辅助理解与知识拓展后整理而成力求通俗易懂。文中部分案例和图片来自课件。一、图像在计算机里是什么在讲模型之前先回到最底层计算机看到的图像就是一个数字矩阵。一张 224×224 的彩色图就是 224×224×33通道RGB 150,528 个数字。所有视觉模型的工作本质上都是对这堆数字做变换。一个类比很直观灰度图就像一张黑白照片每个像素记录有多亮彩色图就是三张灰度图叠在一起红、绿、蓝各一张混合出你看到的颜色。二、CNN用小窗口理解图像全连接为什么不行最朴素的想法把 150,528 个像素拉平成一个向量丢进全连接网络。问题立刻暴露一层 1000 个神经元的全连接层参数量 150,528 × 1000 ≈ 1.5 亿。图再大一点就训不动了。更要命的是全连接把每个像素当独立特征——猫耳朵紧挨着猫脸这个空间关系被完全忽略了。卷积的三招CNN 用三个设计解决了这些问题局部连接一个 3×3 的卷积核Kernel每次只看一小片区域。权值共享同一个卷积核扫遍全图。不管猫在左上角还是右下角同一个猫耳朵探测器都能捕捉到。逐层抽象堆叠多层卷积从边缘 → 纹理 → 部件 → 物体逐步构建理解。池化只留最关键的信号池化Pooling在特征图上滑一个窗口每个窗口只保留一个值Max Pooling取最大值保留最强响应Avg Pooling取均值保留整体趋势一个 2×2 Max Pool 把 4×4 的特征图压成 2×2——计算量降到 1/4特征的位置微小偏移也不影响结果。一句话总结 CNN用可学习的小模板扫描图像逐层从像素中提炼出语义。以前文章单独介绍过这里简单带过。三、CV 任务万花筒为什么难以统一CNN 很强但计算机视觉的任务极其碎片化任务输入 → 输出粒度图像分类图 → 一个标签图像级目标检测YOLO图 → 多个框 类别区域级语义分割图 → 逐像素类别像素级抠图Matting图 → 逐像素透明度0~1 连续值像素级深度估计图 → 逐像素距离像素级图像复原退化图 → 清晰图像素级图像生成文本 → 图像生成注意抠图Matting和语义分割的区别分割是逐像素的二分类前景/背景边界粗糙抠图需要边界处精细的连续值——比如一根发丝可能是 0.3 的透明度半透明婚纱需要逐像素的 alpha 值。这就是为什么影视合成、证件照换背景需要专门的 matting 模型。每种任务的输出形式不同标量、框、矩阵、图像历史上各有各的专属架构——YOLO 做检测、U-Net 做分割、R-CNN 做实例分割……无法用一个统一模式囊括。对比 NLP所有任务都是token 序列 → token 序列翻译、问答、摘要所以一个 Transformer 通吃。CV 缺的正是这种统一性。所有的NLP任务都是预测下一个词。还有一个有趣的共性图像复原类任务超分、去模糊、去噪都是不适定问题——无数种高清原图都可能产生同一张模糊图解不唯一。深度学习的破局方式是从海量数据中学到图像长什么样的先验从无穷多可能解中挑一个最合理的。四、ViT把图像变成句子2020 年Google 提出了 ViTVision Transformer做了一件极其简单但影响深远的事把图像切成块变成 token 序列。很巧妙的做法把图片切成块变成NLP任务中的句子一样。就这么简单。没有卷积没有局部性假设直接用 NLP 的标准 Transformer。关键结论在大数据预训练下ImageNet-21kViT 精度超越 CNN。但小数据下不如 CNN——因为 CNN 自带局部性 平移不变的归纳偏置ViT 什么都没有全靠数据学。ViT 的真正意义不在于比 CNN 强而在于视觉和语言终于站在了同一个计算范式上。 图像是 token文本也是 token——它们可以一起丢进同一个模型处理。这是后续所有多模态模型的根基。当然ViT 本身只解决了分类。真正用单一模型吃下多种 CV 任务分割、检测、深度估计……要等到后面的视觉基础模型和 SAM。但统一的 token 范式是从 ViT 这一步开始的。五、自监督学习不用标注也能学会看ImageNet 有 1400 万张人工标注的图片但互联网上有几十亿张无标注图片。如何不花一分钱标注费让模型学会强视觉特征答案是自监督学习。路线一掩码重建MAE何恺明 2021 年提出的 MAEMasked Autoencoder把图像切成 patch随机遮住 75%Encoder 只处理剩余 25%省计算Decoder 重建被遮住的像素遮住 75% 还能还原 → 模型必须真正理解语义结构而非记纹理。训练目标就是一个简单的 MSE 重建损失。路线二对比学习SimCLR / MoCo对同一张图做两次不同的数据增强裁剪、翻转、颜色抖动得到两个视图同一张图的两个视图 → 特征拉近正对不同图 → 特征推远负对模型被迫学到不管怎么变换本质是同一个东西的不变性表示。路线三自蒸馏DINO / DINOv2Meta 的 DINO 系列走第三条路——teacher-student 自蒸馏同一张图的两个视图分别过 teacher 和 student 网络让 student 的输出对齐 teacherTeacher 通过 EMA指数移动平均缓慢更新不需要负样本不需要掩码重建方法极简但效果惊人。DINOv22023 用 1.42 亿张高质量图片预训练产出的视觉特征通吃所有下游任务——分类、检测、分割、深度估计接个轻量头就能用。它就是视觉领域的BERT一个通用的视觉特征底座。DINO 系列有个很酷的可视化用 PCA 把每个 patch 的 768 维特征降到 3 维映射成 RGB 颜色。结果同类物体自动变成同色——模型在无监督下就学会了语义分割。六、SAM一个模型分割万物2023 年 Meta 发布的 SAMSegment Anything Model 把基础模型理念推向了分割任务给任意提示点、框、文本分割出任意物体。架构三件套组件作用Image EncoderViT MAE 预训练图像 → 特征只算一次可缓存Prompt Encoder点/框/文本 → 提示 embeddingMask Decoder双向注意力特征 提示 → 分割 maskMask Decoder 中的双向交叉注意力是关键设计prompt token 查询图像特征“这个位置是什么”图像特征也感知 prompt“用户想要什么”——两者充分交互分割结果精准响应用户意图。训练数据SA-1B 数据集1100 万张图像11 亿个 mask。意义从每种物体训一个分割模型变成一个模型分割万物。2024 年发布的 SAM 2 进一步扩展到视频分割支持时序一致性让分割万物从静态图片走向了动态视频。七、生成模型从理解世界到画出世界前面讲的都是判别式模型——回答这是什么。接下来是生成式模型——回答世界可以是什么样。7.1 GAN生成器与判别器的零和对决2014 年 Goodfellow 提出的 GAN核心是两个网络博弈Generator从噪声生成假图目标是骗过判别器Discriminator判断真假目标是识破生成器类比囚徒困境中的博弈——理想结局是纳什均衡生成器完美以假乱真判别器只能猜 50/50。但 GAN 有硬伤训练不稳定容易震荡、模式坍塌只生成少数几种图、难以精确控制。7.2 Normalizing Flow可逆的橡皮泥从高斯噪声出发通过一系列可逆变换把简单分布揉捏成复杂分布。每步可逆意味着可以精确计算概率。缺点可逆性约束太强限制了网络设计自由度。7.3 Diffusion Model扩散模型的思路极其优雅训练往图像中不断加入噪声最终图像会变成纯随机噪声这个过程叫正向扩散过程Forward diffusion推理生成图片时则相反一步一步去掉噪声来得到图片这个过程称之为反向扩散过程 Reverse diffusion为什么它能击败 GAN 和 Flow 成为主流训练稳定简单 MSE、生成质量最高、多样性好、可通过文本精确控制。当今绝大多数顶级生成模型都基于 DiffusionStable Diffusion 1.x/2、DALL·E 3、Midjourney、Sora。7.4 Flow Matching新一代替代范式2023 年提出的 Flow Matching 是生成模型的新一代范式与经典 Normalizing Flow 不同——它不要求每步可逆也不算雅可比行列式而是用回归直接学一个速度场Diffusion 走弯曲路径SDE需要很多步Flow Matching 走直线ODExₜ (1-t)·ε t·x₀直线意味着步数更少、采样更快。Stable Diffusion 3、FLUX 等最新模型已经切换到 Flow Matching。八、CLIP打通图与文的桥梁2021 年 OpenAI 发布的 CLIPContrastive Language-Image Pre-training 是多模态基础模型的里程碑。核心思想极其简洁用对比学习把图像和文本映射到同一个向量空间。CLIP 的革命性在于开放世界识别。不需要在特定数据集上训练用文本描述什么就能分什么。更深远的影响CLIP 证明了图像和文本可以映射到同一个空间——后面大量多模态模型DALL·E 2、Stable Diffusion、LLaVA 等都直接建立在 CLIP 的图文对齐基础上。图像和文本映射到同一空间为现在大家都在使用的文生图文生视频打下基础。九、VLA从看懂世界到操控世界前面讲的所有模型无论理解还是生成都还是在屏幕里工作。具身智能Embodied AI 要更进一步——让 AI 拥有身体机器人能感知真实环境并执行物理动作。多模态模型的终极延伸不只是看懂和画出而是动手操控物理世界。VLAVision-Language-Action模型将三种模态统一建模关键洞察动作也是 token。 关节角度、夹爪开合、移动速度——离散化后和文本 token 没有本质区别。整个流程就是token in → token out。当前主要的 VLA 模型模型机构特点RT-2Google DeepMind开山之作VLM 直接输出动作 tokenOpenVLAStanford开源 7BLlama 2 DINOv2 SigLIPπ₀Physical IntelligenceFlow Matching 生成连续动作Gemini RoboticsGoogle DeepMind基于 Gemini强语言推理 操作技术路线分化为两派离散动作 tokenRT-2、OpenVLA直接用 LLM 自回归生成连续动作流π₀、CogACT用 Diffusion / Flow Matching 生成更精细的操作总结一条线串完视觉 AI 的演进核心逻辑只有一句话把一切变成 token让 Transformer 统一处理。 图像是 token文本是 token动作也是 token。当所有模态都站在同一个计算范式上一个模型理解并操控整个世界就不再是科幻。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取