从 Transformer 到 Vibe Coding:我的大模型词汇地图

📅 2026/7/20 17:04:53
从 Transformer 到 Vibe Coding:我的大模型词汇地图
文章目录1 引言2 第一阶段模型训练2.1 底层架构2.2 数据表示2.3 预训练2.4 对齐训练3 第二阶段能力评测4 第三阶段产品落地5 第四阶段进阶应用5.1 怎么提问5.2 怎么扩展能力5.3 怎么自主执行5.4 怎么人机协作6 总结1 引言过去一段时间AI 领域层出不穷的新名词让我很是焦虑。公司内部不同团队隔三差五发布新的 AI 产品名字五花八门完全不知道它们之间有什么差别也不知道每类 AI 最适合处理哪些问题。组里的同学也持续跟进AI 算法应用时不时冒出一个新词比如 AutoResearch听起来厉害但完全说不清楚它是什么更谈不上怎么用。业余时间刷公众号也一样RAG、Agent、Vibe Coding、MCP……标题里全是这些词点进去看又冒出更多没见过的读完一篇感觉懂了下一篇又懵了。最近痛定思痛决定把这些词系统梳理一遍。沿着大模型从研发到应用的全流程走下来才发现每个词都有自己的位置。定位清晰之后就不那么迷糊了。这篇文章就是我的心得。下面这张图是本篇的全景先看一眼再往下读2 第一阶段模型训练这一阶段的词说的是大模型怎么被训练出来的。对于专注应用的人来说不需要亲自动手训练但理解这层能帮你搞清楚模型的能力从哪来、边界在哪。2.1 底层架构大模型的基础是Transformer一种神经网络架构2017年由 Google 提出。在它之前处理语言的模型又慢又难扩展Transformer 出现之后大规模训练才变得可行。今天所有主流大模型GPT、Claude、Gemini、LLaMA都建立在这个架构上它是整个大模型时代的技术起点。这背后的核心机制是Attention注意力机制让模型在处理一个词的时候能同时看到句子里其他所有词并判断哪些词更重要。比如处理它这个词模型需要回头找到它指代的是什么靠的就是 Attention。2.2 数据表示架构决定了模型的结构但文字在进入模型之前还要先经过一道转换把人类语言变成模型能处理的数字形式。文字首先被切成一个个Token词元不是按字也不是按词而是按子词规则来切。所谓子词规则是把常见词保持完整、把罕见词拆成更小的片段规则是训练前预先定义好的不是模型现场学的。比如ChatGPT在词汇表里不存在就被拆成 “Chat” “G” “PT”。这个切分过程叫Tokenization。每个 Token 先被分配一个编号再通过一张查表把编号变成一串数字这就是Embedding嵌入。这串数字不只是编号而是带着语义意思相近的词在数字空间里也挨得近。更有意思的是这套数字还能做运算“女王” − “女人” ≈ “国王” − “男人”向量相减能捕捉语言里的逻辑关系。模型靠这套数字来阅读和推理。TokenEmbedding简化示意猫[0.2, -0.5, 0.8]狗[0.3, -0.4, 0.9]火车[-1.2, 0.7, -0.3]Token 是模型理解和生成语言的基本单位后面很多技术参数包括模型每次能处理多长的文本都是以 Token 数量来衡量的。2.3 预训练架构和数据表示都到位了接下来是训练。预训练Pre-training是第一步也是最重要的一步。做法很简单把互联网上海量文字喂给模型反复让它做一件事预测下一个词Next Token Prediction。训练数据量以万亿词计计算量极大。模型后来所有的知识和能力写作、推理、编程几乎都从这里来后续的训练步骤只是在此基础上解锁和调教。预训练过程中研究者们发现了一条规律叫Scaling Law规模法则模型参数量、数据量、计算量三者按特定比例协同扩大预测准确率就会稳定提升。这让大模型的研发从碰运气变成了按公式来。也正是这个发现让各大公司有信心砸入天量资源堆规模。但规模扩大带来的不只是更准还有一个意外收获叫涌现Emergence某些能力并不随规模平滑增长而是在参数量超过某个临界点后突然冒出来。举个例子预训练数据里有大量算术内容但没有专门针对算术任务做训练参数量够大之后模型自己就会了。今天还不会的事参数量够了之后可能突然会也可能不会没人能提前预测。这正是这个领域让人又兴奋又不安的地方。2.4 对齐训练预训练之后模型只会续写文字。你问它问题它会把你的话当开头继续往下写而不是真的回答你。对齐训练的目的就是通过进一步训练让模型学会响应指令、按人类期望的方式作答。SFTSupervised Fine-Tuning监督微调是第一步收集指令 → 高质量回答的配对样本用这些数据微调模型让它学会以响应指令的方式作答。这一步之前模型有知识但不会干活。你说帮我总结这段文字它会把这句话当成开头继续往下写这一步之后它才知道这是一个要执行的指令会给你一份真正的总结。RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习是第二步让人类对模型的多个回答排序训练一个奖励模型把偏好提炼成信号再用这个信号持续优化语言模型让回答越来越符合人类期望。ChatGPT 的懂你感靠的就是这一步。同期参数量更大的模型有很多但 ChatGPT 在 2022 年底爆火核心秘密就在这里它让模型从能回答升级到回答得好。DPODirect Preference Optimization是 RLHF 的简化版本跳过奖励模型直接用人类偏好数据优化语言模型效果相近但流程更简单。DeepSeek 等模型在训练中大量使用了这种方式。3 第二阶段能力评测模型训练完之后不会直接发布要先经过系统评测。Benchmark基准测试就是用公开测试集给模型打分方便不同模型之间横向对比。按测试维度分常见的有知识理解MMLU涵盖57个学科的多选题考察知识广度MMLU-ProMMLU 的加强版选项更多、干扰项更强数学推理GSM8K小学到初中水平的数学应用题考察基础推理AIME美国数学奥林匹克题目难度拔高一个量级代码能力HumanEval代码生成题考察能不能写出可运行的函数LiveCodeBench持续从真实编程竞赛抓题更新专门防止模型刷题综合推理GPQA博士级难题Google 也搜不到答案专门考真实推理能力而非记忆中文能力C-Eval / CMMLU中文知识与推理评测国内模型发布时的必测项值得注意的是Benchmark 刷得好不代表实际用起来好。有些模型专门针对测试题优化实际体验未必匹配。即使评测分数不错大模型本身的局限性也不容忽视。其中两个最值得关注一个影响你信不信它的输出一个影响你用不用得好。幻觉Hallucination模型一本正经地说出错误信息而且好像很有把握。这影响的是你信不信它的输出。它没有我不确定这个内部状态在知识边界模糊的地方不会停下来只会按什么词接在后面听起来合理的逻辑继续走结果就是编出一个语义通顺、但事实错误的答案。实际使用中涉及具体人名、数字、引用来源时尤其需要验证。Context Rot上下文腐化影响的是用不用得好。模型每次能看到的内容有一个长度上限即上下文窗口即便没超过上限当塞入的信息远超模型最佳处理范围时也会开始出问题。给模型的信息越多它反而越容易出错开始忽略前面定好的规则、前后矛盾、答非所问。就像桌子够大但堆满了杂物你要找的那份重要文件反而被淹没了。优化上下文重点不是给得多而是给得准。4 第三阶段产品落地模型评测通过之后要经过一系列包装才能变成可用的产品。这一层先要分清两个概念模型和产品。它们经常被混着说但不是一回事。模型是底层能力的载体。GPTOpenAI、ClaudeAnthropic、GeminiGoogle、LLaMAMeta、DeepSeek深度求索、Qwen阿里这些是大脑严格来说属于第一阶段「模型训练」的产物。产品则是基于模型能力、针对具体场景做的应用。同一个模型可以支撑完全不同的产品既可以是面向所有人的通用产品也可以是针对特定专业场景深度定制的垂直领域产品。通用产品以对话为主要交互方式面向所有用户ChatGPTOpenAI、Claude.aiAnthropic、Kimi、豆包、文心一言、通义千问这些是大多数人接触大模型的第一个入口。垂直领域产品则针对特定场景深度定制能力更聚焦。以编程类为例CursorAI 代码编辑器可以接入多个模型GPT-4、Claude 等GitHub Copilot微软/GitHub 做的编程助手内嵌在编辑器里Claude CodeAnthropic 的编程产品底层用 Claude 模型值得单独说一下推理模型。2024年下半年开始OpenAI 的 o1、o3以及 DeepSeek-R1 等模型代表了另一类产品形态它们不直接输出答案而是先在内部走一遍类似 CoTChain-of-Thought思维链的思考过程再基于思考结果给出答案。代价是响应更慢、成本更高但在数学、逻辑、代码等复杂任务上准确率大幅跃升比普通模型高出显著一截。不管做哪类产品想调用模型能力都要通过APIApplication Programming Interface来接入开源和闭源模型都提供 API。不同的是闭源模型GPT-4、Claude只有 API 这一种用法权重不公开看不到内部开源模型LLaMA、DeepSeek、Qwen权重公开除了调 API还可以下载到本地自己跑、自己改。这个区别对实际使用有三个影响成本开源模型自己部署量大时比向闭源厂商按 Token 付费更划算。数据隐私闭源模型数据要发到对方服务器有合规顾虑的企业倾向于用开源模型本地跑。可定制性闭源模型只能通过 Prompt 和 Fine-tuning 调整行为开源模型可以直接改训练、做私有部署上限更高。5 第四阶段进阶应用模型有了产品有了但从你问它答到深度应用中间还有一段路怎么提问才能让输出更符合预期、怎么扩展能力边界、怎么让它自主完成复杂任务以及人和 AI 的角色如何重新分配。5.1 怎么提问想让输出符合预期先把输入组织好。Prompt就是你给模型的输入问题、指令、背景信息……一切输入都叫 Prompt。把它写好是一门方法论叫Prompt Engineering提示词工程。形态上Zero-shot是不给例子直接让模型完成任务Few-shot是先给几个示范例子再让它照着做需要固定格式时直接给示例往往比描述格式更准。思考方式上CoT是让模型把推理过程一步步写出来再给答案在数学、逻辑等复杂任务上准确率大幅提升。把每条 Prompt 写好只是起点。更上一层的问题是送进去什么、什么时候送。Context Engineering上下文工程管的就是这个送进去的信息不是越多越好冗余内容会稀释注意力对话历史越积越长时早期设定的规则反而容易被忽略。它管的不是怎么写而是在对的时机送对的内容进去。除了怎么写、怎么组织还可以控制输出的风格。Temperature是控制输出随机性的参数越高越发散有创意越低越保守确定。写代码时调低写故事时调高。直接调 API 时可以手动设置用 ChatGPT、Claude 这类产品时产品已经预设好了默认值普通用户感知不到它的存在。以上这些参数直接调 API 时都可以自己设置用现成产品时开发者往往已经替你预设好了。但还有一类参数用户始终看不到、改不了那就是System Prompt系统提示词开发者提前写入规定了模型的身份、行为边界和回答风格。公司自建的客服机器人、某个垂直场景的 AI 助手它表现出的角色和边界感背后都有一段你看不到的 System Prompt 在约束着它。5.2 怎么扩展能力提问方式再好也改变不了模型本身的局限。模型开箱即用但有两道天然的限制一是知识边界训练数据有截止日期企业私有数据也进不来二是能力边界它只能在自身知识范围内作答无法查实时信息、跑代码、操作外部系统。这两道限制之外还有一类更深层的需求通用模型在特定领域表现不够专需要定制化。知识边界用RAGRetrieval-Augmented Generation检索增强生成来补回答之前先从外部知识库检索相关内容让模型能基于最新的、私有的信息作答。能力边界用Tool Use / Function Calling工具调用来破让模型在合适时机调用外部工具搜索引擎、代码解释器、日历、数据库……从只能依赖自身知识变成能操作真实世界。多个 Tool 围绕同一目标组合在一起就形成了一个Skill技能某一类可复用的能力单元。比如日程管理这个 Skill可能包含查日历、创建事件、发会议邀请等一组 Tool。Tool Use 普及之后新问题随之而来各家模型接入接口不一样工具开发者要为每家分别适配维护成本极高。MCPModel Context Protocol就是为此而生Anthropic 在 2024年11月提出定义了一套开放的标准接口工具只需实现一次所有支持 MCP 的模型都能直接调用。可以理解为 AI 工具生态的 USB 接口以前不同设备各用一套私有接口MCP 出现后直插即用。MCP 发布后OpenAI、微软等多家主流厂商陆续支持已成为行业事实标准。第三类需求是定制化用Fine-tuning微调来解决。用特定领域的数据对模型做进一步训练让它像专家一样思考、按给定格式输出、只处理某类任务。Fine-tuning 直接改模型本身而 RAG 只是在回答前给模型补充信息改不了它的行为方式。两者经常叠加使用Fine-tuning 让模型具备正确的行为模式RAG 给它补充最新的私有知识。5.3 怎么自主执行能力扩展了但单轮问答应对不了多步骤的复杂任务每次还是要人来发起任务、等结果、再发起下一步。于是出现了 Agent。Agent智能体是在模型能听懂指令、会推理、能调工具的基础上套一层自主执行的架构给出目标它自主规划、分步执行、观察结果、调整策略不需要人逐步下指令。任务更复杂时一个 Agent 不够可以拆给多个专职 Agent 分工协作由协调者汇总这就是Multi-Agent多智能体协作。Agent 能自主跑了但随之而来的问题是它犯错怎么办靠人手动纠正太低效。Mitchell Hashimoto 提出了Harness挽具的概念套在 Agent 外面的运行框架专门解决执行可控性。发现 Agent 犯错在 Harness 层修加规则、补兜底、挂钩子让它在结构上不可能再犯同样的错。比如 AI 代码助手偶尔误删文件与其事后在 Prompt 里加句叮嘱不如直接将删除前必须人工确认写进框架层这类失误在结构上就不会再出现。Harness 解决的是怎么让 Agent 不出错Loop Engineering解决的是另一个问题流程自动化。把发现任务、布置任务、执行、检查结果、决定下一步设计成一个能自己转的闭环人不再需要每次手动触发。Claude Code 创始人 Boris Cherny 描述过这样一种实践“我已经不 prompt Claude 了是 loop 在运行着 prompt Claude我的工作是写 loop。”5.4 怎么人机协作Agent 越来越自主Loop 让流程自动转那人在这个过程里扮演什么角色答案不是消失而是角色在变。这种变化体现在三个层面执行上少动手、工作方式上重新分工、决策上明确哪里不能放手。执行层Vibe Coding是 Andrej Karpathy 在 2025年初提出的词程序员完全用自然语言描述想要什么让 AI 生成代码自己不看代码细节只关注结果对不对。“Vibe是氛围/感觉”凭感觉驱动而不是精确控制每一行代码。工程师的工作从写代码变成审结果、调方向本质上是把执行权让渡给了 AI。这个趋势背后更深层的逻辑推荐读《Codex 执行权战争》。工作方式层AI Native的 Native 是原生的意思不是后来加进去的而是从一开始就长在里面。不是有任务了顺手问问 AI而是从拿到任务的第一秒就在想哪些环节让 AI 做、哪些我来把关。AI 是默认的协作方人的注意力集中在定方向、定标准上。决策层执行可以让渡但某些节点不能放手。Human in the loop人在回路中和 Loop Engineering 的名字像方向却相反Loop Engineering 追求让流程自动转、减少人的介入Human in the loop 说的是在自动化流程里刻意在关键节点保留人的判断。高风险决策医疗、法律、金融AI 给建议人做最终判断。Agent 执行到不可逆操作发邮件、转账、删数据时暂停等人确认再继续。自动化程度越高在哪里留人、留多少反而是更需要设计的问题。前面说了这么多方法这里汇总一下每个词解决什么问题、对应什么实际场景方法解决什么问题典型场景Prompt Engineering / Zero-shot / Few-shot怎么把话说清楚让模型按指定格式输出给示例让它照着写报告CoT推理过程不透明答案不可信让模型一步步写出解题过程再给最终答案Context Engineering如何组织输入让模型在最佳状态下作答多轮改稿中早期定好的风格要求被后来的补充信息冲掉长对话里开头的约束越来越被忽略Temperature输出太随机或太保守写代码时调低写创意文案时调高System Prompt需要固定模型角色和边界公司客服机器人只回答产品相关问题RAG模型知识过时 / 有私有数据需求企业内部知识库问答接入最新政策文件回答问题Fine-tuning通用模型在特定领域能力不足训练只处理合同审核任务的法律助手Tool Use / MCP模型只能回答无法操作外部系统让模型查实时天气、执行代码、写入数据库Agent复杂任务需要多步自主执行给出帮我调研竞品并生成报告Agent 自己搜索、整理、写作Harness EngineeringAgent 犯错靠人手动纠正太低效AI 代码助手偶尔误删文件将删除前必须人工确认写进框架层从此在结构上不会再出现Loop Engineering人还需要每次手动触发任务每天自动拉取行业新闻、AI 筛选相关条目、生成摘要、推送邮件全程无人值守Human in the loop高风险场景不能完全交给 AI医疗诊断 AI 给建议医生做最终判断后才写入系统Vibe Coding工程师想减少写代码的时间专注需求和结果用自然语言描述需求让 Cursor/Claude Code 生成只看结果AI Native事后叠加 AI效率提升有限产品经理收到新需求第一步就让 AI 拆解需求、列实现路径自己只做选择和判断而不是写完 PRD 再让 AI 润色6 总结好了今天的词汇归类就到这里了。纸上得来终觉浅。其实在写这篇文章之前我已经在项目中实操过 Vibe Coding做出来的东西已经上线在用了。趁着此次的词汇梳理顺带参考这个框架把公司内部的 AI 工具梳理了一遍很多之前模糊的定位一下子清晰了。另外还搞了个周报 Agent体验了一波 Loop Engineering 的魅力。但也深刻感受到 Agent 有多难驯想让它变成真正的完美助理还有挺长的距离。词汇焦虑基本没有了。至于 AI 带来的那种隐约的不安感我想大多数人都有我也没彻底解决。但推荐最近看的另一本书《小龙虾 OpenClaw 恐慌谁在获利》读完应该能稍微缓解一些。