大模型是什么:从 GPT 到开源大模型的演进脉络 📅 2026/8/26 17:25:20 欢迎拜访雾里看山-CSDN博客本篇主题大模型是什么从 GPT 到开源大模型的演进脉络发布时间2026.8.25隶属专栏AI进化之路目录先把大模型这个词拆开大模型的官方定义演进时间线先把骨架看清楚第一阶段Transformer 奠基2017第二阶段预训练范式确立2018BERT 路线Encoder-onlyGPT 路线Decoder-only第三阶段规模放大与涌现2019-2020GPT-2通用生成的萌芽GPT-3In-Context Learning 改变玩法第四阶段RLHF 与 ChatGPT 时刻2022为什么 GPT-3 还不够好用RLHF 的核心思想ChatGPT 的意义第五阶段开源大模型与多模态2023LLaMA-1开源社区的起点国内开源三剑客多模态起步第六阶段推理能力与 Agent 化2024长上下文推理模型Agent 与工具调用第七阶段开源追上闭源2025演进背后的三条主线主线 1规模与架构主线 2范式与对齐主线 3能力边界易错点与常见误区误区 1把 GPT 当成唯一路线误区 2认为开源 免费商用误区 3把参数规模当成能力上限误区 4忽略时间线只追榜单这一篇到底要记住什么给后续几篇打个底先把大模型这个词拆开这一篇开始会反复出现大模型、LLM、GPT、LLaMA、Qwen、DeepSeek这些名词。如果一开始就陷入“谁比谁强”的对比很容易迷失。更稳的姿势是沿着时间线看演进每一代模型到底解决了上一代什么痛点又留下什么新问题。把这条线串起来再去看今天眼花缭乱的模型榜单就会清晰很多。大模型的官方定义先给一个足够通用的定义避免后面每篇都要重新解释大模型Large Model通常指LLMLarge Language Model是一类基于Transformer架构、在海量文本以及越来越多模态数据上预训练得到、参数规模达到数十亿至数千亿级别的深度学习模型。可以拆成四个关键词记忆基于 Transformer这是目前几乎所有大模型的共同骨架。预训练用“下一个词预测”这种自监督任务在大规模语料上先学一通。参数规模大几十亿10B起步几千亿1T也不罕见。通用任务能力一个模型可以同时处理问答、写作、翻译、代码等任务。题外话严格意义上大模型不止包含LLM还有视觉大模型、多模态大模型。但本篇重点讲LLM的演进脉络其他模态后续单独拆。演进时间线先把骨架看清楚下面这张表是把过去十年最重要的几个节点压成一条线便于记忆时间代表模型关键突破类型2017Transformer提出自注意力机制奠定后续几乎所有大模型的基础架构2018BERT/GPT-1预训练 微调范式确立Encoder-onlyvsDecoder-only闭源2019GPT-2/T5规模放大到1.5B通用生成能力初现闭源2020GPT-3把规模拉到175B出现In-Context Learning上下文学习闭源2022ChatGPT/InstructGPTRLHF对齐让模型变得“会聊天”闭源2023GPT-4/LLaMA-1/Qwen/ChatGLM多模态起步开源大模型生态全面铺开闭源 开源2024GPT-4o/Claude 3.5/LLaMA-3/Qwen-2/DeepSeek-V2长上下文、推理能力、Agent 能力全面提升闭源 开源2025DeepSeek-V3/GPT-5/Claude 4/Gemini 2推理模型与多模态深度融合开源追上闭源闭源 开源下面分阶段拆开讲。第一阶段Transformer 奠基20172017 年Google发表的论文《Attention Is All You Need》提出了Transformer架构。它抛弃了之前RNN的顺序计算方式改用Self-Attention让模型能一次性看到整个序列。这一阶段的核心意义是训练可以高度并行跑在GPU上效率高。长距离依赖问题被显著缓解。给后面所有大模型一个共同的骨架。对学习者来说如果只挑一篇论文读就先读Transformer。后面所有BERT/GPT/LLaMA都是它的变体。第二阶段预训练范式确立20182018 年是“预训练 微调”范式确立的关键一年。两条路线几乎同时出现BERT 路线Encoder-onlyBERT用的是Transformer的Encoder部分。它的训练任务是“掩码语言模型Masked Language Model”即把一句话里的某些词遮住让模型猜。BERT系列的强项是理解类任务分类、检索、问答中的“找答案”。它更像是一个理解大师不擅长长文本生成。GPT 路线Decoder-onlyGPT-1用的是Transformer的Decoder部分。它的训练任务是“下一个词预测Next Token Prediction”把文章一个 token 一个 token 续写出来。GPT系列的强项是生成类任务写作、对话、续写。后续所有对话大模型骨子里都是Decoder-only。这一阶段最重要的认知是Encoder-only和Decoder-only不是简单的技术差异而是代表了两种不同的能力方向。后面所有模型都要先回答一个问题——你到底要做“理解”还是“生成”。第三阶段规模放大与涌现2019-2020GPT-2通用生成的萌芽GPT-2把参数量推到1.5B训练数据也大幅增加。它展示了同一个模型不做任务级微调也能写出看起来像样的文章。但当时社区更多把它当成“写作辅助”而不是通用助手。GPT-3In-Context Learning 改变玩法GPT-3把规模拉到175B参数最重要的不是规模本身而是它展示了一种新能力——In-Context Learning不更新模型参数只在 Prompt 里给几个示例模型就能照着做。这意味着大量任务不再需要微调只需要写好 Prompt。同一个模型可以作为通用 API 服务按 token 计费。“大模型即服务”这种商业模式有了技术基础。题外话GPT-3本身没有对外完全开放但它催生了OpenAI的API商业化和后来ChatGPT的诞生。第四阶段RLHF 与 ChatGPT 时刻2022为什么 GPT-3 还不够好用GPT-3虽然能写但有两个明显问题不会“听话”你让它总结它可能给你继续编故事。不够安全容易输出有害、有偏见的内容。RLHF 的核心思想RLHFReinforcement Learning from Human Feedback三步走先在大量数据上做普通预训练这一步和GPT-3一样。再用人工写的“问题 好答案”做SFT监督微调。最后让人类对模型的不同回答打分训练一个“奖励模型”再用强化学习优化大模型。ChatGPT 的意义ChatGPT把RLHF落地为产品形态效果立竿见影模型不再“自由发挥”而是按人类偏好回答。多轮对话变得稳定。普通人也能直接用。从这一年开始大模型走出了学术圈进入大众视野。第五阶段开源大模型与多模态20232023 年是“开源大模型元年”。几个标志性事件LLaMA-1开源社区的起点Meta发布的LLaMA-17B/13B/65B虽然一开始限制商用但很快被社区泄露并衍生出一整套生态Alpaca、Vicuna用对话数据微调得到的开源聊天模型。Hugging Face成为开源模型的事实标准仓库。各种量化、推理框架如text-generation-inference、vLLM开始爆发。国内开源三剑客国内厂商也几乎同时布局Qwen通义千问阿里开源覆盖0.5B到72B多个尺寸。ChatGLM/GLM智谱开源中文表现突出。Baichuan百川早期中文开源代表之一。多模态起步同一年GPT-4把视觉理解能力带进大模型LLaVA、MiniGPT-4等开源多模态模型迅速跟进。多模态不再是独立的小赛道而是和大模型深度融合。第六阶段推理能力与 Agent 化20242024 年关注的不再是“能不能聊”而是三件更具体的事长上下文Claude 3.5支持200Ktoken。Gemini 1.5 Pro支持1M甚至2Mtoken。上下文长度从“卖点”变成“基础能力”。推理模型OpenAI o1系列把“思考过程”显式化用更多算力换推理质量。DeepSeek-R1开源了同等思路的推理模型。“思考型模型”和“快答型模型”开始分化。Agent 与工具调用Function Calling成为标配。主流模型原生支持Tool Use。MCPModel Context Protocol等统一工具协议开始出现。大模型从“聊天”走向“干活”。第七阶段开源追上闭源20252025 年最显著的趋势是头部开源模型的能力已经接近闭源旗舰。代表事件DeepSeek-V3以开源姿态发布能力逼近头部闭源模型价格却低一个数量级引发行业震动。Qwen-2.5/Qwen-3阿里持续在开源榜单上保持领先。LLaMA-3.1/LLaMA-3.2Meta把405B级别的模型完全开源。这个阶段给学习者的提示是今天再学大模型只盯着闭源 API 已经远远不够。开源模型 本地推理 私有部署是后续工程实战的主线。演进背后的三条主线如果把时间线压成三条主线会更容易记住主线 1规模与架构从RNN/LSTM→Transformer→Decoder-only Transformer。参数量从100M→1B→100B→1T。训练数据从百万级网页 → 万亿 token。主线 2范式与对齐从监督学习 → 自监督预训练 → 预训练 SFT → RLHF → DPO 等偏好对齐。重点从“模型会不会做”转向“模型愿不愿意按人类期望做”。主线 3能力边界从单任务模型 → 通用模型 → 多模态 → 工具调用 / Agent。模型的角色从“答题器”变成“数字员工”。易错点与常见误区误区 1把 GPT 当成唯一路线今天闭源生态里GPT系列最有影响力但开源生态里Qwen、DeepSeek、GLM等中国系模型同样关键。只看OpenAI一家会显著低估国内开源的进展。误区 2认为开源 免费商用不同模型的许可证差别很大LLaMA系列有特殊社区许可。Qwen、DeepSeek部分模型允许商用部分需要遵守额外条款。部分模型允许研究使用但不允许商用。工程落地前一定要看LICENSE不要想当然。误区 3把参数规模当成能力上限参数规模是必要条件但不是充分条件。今天7B模型经过高质量数据微调后在很多垂直任务上能超过未微调的70B模型。数据质量、训练方法、对齐手段往往比参数更重要。误区 4忽略时间线只追榜单每过几天就有新榜单发布。只看榜单容易陷入“谁更强”的焦虑忽略“谁解决了什么问题”。更稳的学习姿势是每学一个新模型先问它比上一代多解决了一个具体问题。这一篇到底要记住什么大模型是基于Transformer、在大规模数据上预训练得到的超大规模深度学习模型。演进主线Transformer2017→ 预训练范式2018→ 规模涌现2019-2020→RLHF与ChatGPT2022→ 开源生态爆发2023→ 多模态与 Agent2024→ 开源追上闭源2025。三条隐藏主线规模与架构、范式与对齐、能力边界。学习大模型要从“模型在解决什么问题”的角度看而不是“哪个模型最强”。给后续几篇打个底第 03 篇会讲大模型能做什么、不能做什么把第 02 篇的能力演进落到具体任务边界上。第 04 篇开始进入工程侧讲Token这个最容易被忽视但又最重要的概念。⚠️ 写在最后以上内容是我整理大模型演进脉络时的一份学习笔记更像是一张“地图”不是一份“谁更强”的榜单。如果你想进一步了解某个具体模型可以评论或者私信我我会在后续的实战篇里拆开讲。