大模型里面到底长什么样?Tokenization+词表映射+MoE+门控网络+稀疏激活+Transformer+Attention全讲透(附代码)

📅 2026/7/29 23:00:57
大模型里面到底长什么样?Tokenization+词表映射+MoE+门控网络+稀疏激活+Transformer+Attention全讲透(附代码)
本文是「108张AI知识卡片·大模型通关手册」系列第 10 篇。前九篇讲的是怎么用大模型——RAG、Agent、提示工程。这篇换个视角从用跳到懂打开 GPT 的胸腔看看 Transformer、Attention、MoE 这些架构组件到底长什么样。不推公式用比喻讲透硬核原理。目录TL;DR 太长不看一、Tokenization大模型的消化系统二、词表映射文字和数字之间的翻译官三、MoE大模型的智囊团四、门控网络MoE的调度中心五、稀疏激活四两拨千斤六、Transformer大模型的骨架七、Attention大模型的心脏八、一张图串起大模型架构链路九、代码Tokenization MoE 简化实现写到最后系列导航 持续更新TL;DR 太长不看⚡30 秒版先记这 7 条细节往下翻。Tokenization把文本切成 Token 碎片——大模型真厉害切成[“大”,“模型”,“真”,“厉害”]大模型只认碎片不认整句。词表映射每个 Token 对应一个编号——“大”234“模型”5678文字和数字之间的翻译官。MoE混合专家模型——请了一群专家按需调用不浪费算力大模型大而省的秘密。门控网络MoE 的调度中心——看一眼输入决定派哪个专家出马就像医院分诊台。稀疏激活每次只激活一小部分专家——8 个专家只激活 2 个省 75% 算力还能保效果。Transformer大模型的骨架——所有现代大模型都站在这个架构上注意力机制前馈网络的堆叠。架构口诀Tokenization 切碎片 → 词表映射变数字 → MoE 请专家 → 门控网络做调度 → 稀疏激活省算力 → Transformer 搭骨架 → Attention 跳心脏。一、Tokenization大模型的消化系统你输入大模型真厉害大模型不是直接处理这 5 个字——它先把句子切成碎片Token再一个一个处理。Tokenization 就是这个切碎的过程是大模型的消化系统。Tokenization 解决的核心问题大模型不能直接处理原始文本——它只认数字。Tokenization 把文本切成 Token最小处理单元每个 Token 再映射成数字大模型才能处理。它到底在干嘛机制层Tokenization 的核心是分词算法——决定文本怎么切。三种主流算法。BPEByte Pair Encoding从字符级开始反复合并最高频的字符对——“h”“e→he”“he”“llo→hello”。GPT 系列用 BPE。WordPiece类似 BPE但合并标准不是频率最高而是 likelihood 提升最大——BERT 用 WordPiece。SentencePiece语言无关的分词器直接在字节级操作——不依赖预定义的词表多语言场景首选。关键参数词表大小Vocab Size——GPT-2 是 50257GPT-4 用的更大。词表越大每个 Token 承载的信息越多但模型参数也越多。Tokenization 的粒度直接影响模型能力切得太细字符级序列太长计算量大切得太粗词级词表太大稀疏问题严重。你能感受到什么体感层英文unbelievable→[“un”,“believ”,“able”]——BPE 把它切成 3 个 Token因为 “un” 和 “able” 是常见词缀。中文大模型真厉害→[“大”,“模型”,“真”,“厉害”]——中文每个字/词基本就是一个 Token。数字2024→[“20”,“24”]或[“2”,“0”,“2”,“4”]——取决于训练数据中数字的出现模式。同一个概念不同模型的 Tokenization 可能不同——GPT 切 3 个 Token 的词Claude 可能切 2 个这就是为什么不同模型的Token 数不能直接比较。️ 动手感受不同模型的 Tokenization 差异操作把unbelievable 2024年分别用 GPT 和 BERT 的 Tokenizer 分词对比结果。你会看到GPTBPE[“un”,“believ”,“able”, 202,“4”,“年”]——6 个 Token。BERTWordPiece[“un”,“##believ”,“##able”,“2024”,“年”]——5 个 Token。差异说明了什么不同分词算法对同一段文本的切分不同——这直接影响模型的输入表示和计算成本。 想一想Tokenization 有个尴尬的问题模型的所有理解都建立在 Token 级别但人类思考是词级别甚至概念级别的。Token 和概念之间的鸿沟是大模型理解的天然瓶颈——它永远在碎片上做推理而不是在完整概念上。这也是为什么大模型会犯拼写错误——它在 Token 级别操作不是字符级别。 顺着他想Token 切出来了但大模型只认数字——大怎么变成 234这就是词表映射的事。二、词表映射文字和数字之间的翻译官Tokenization 把大模型真厉害切成了[“大”,“模型”,“真”,“厉害”]但大模型只认数字——大怎么变成 234词表映射就是干这个的每个 Token 对应一个唯一编号文字和数字之间的翻译官。词表映射解决的核心问题大模型的输入输出都是向量数字但人类用文字交流。词表映射是文字和数字之间的桥梁——Token→编号→Embedding 向量每一步都是翻译。它到底在干嘛机制层词表映射分三步。① 构建词表Vocabulary训练 Tokenization 算法时同时构建词表——一个从 Token 到编号的映射表。GPT-2 的词表有 50257 个 Token编号从 0 到 50256。② Token→编号Token ID每个 Token 查词表得到唯一编号——“大”234“模型”5678“真”890“厉害”12345。③ 编号→Embedding编号不是直接输入模型的——它是一个索引用来查 Embedding 矩阵。Embedding 矩阵的每一行是一个向量如 768 维或 4096 维这个向量才是模型真正处理的数字表示。关键点编号是离散的234 和 235 之间没有关系Embedding 是连续的相近的 Token 在向量空间中距离更近。词表映射把离散的编号变成了连续的向量表示。你能感受到什么体感层Token→编号“猫”1024“狗”2048——1024 和 2048 之间没有任何语义关系编号只是查表索引。编号→Embedding查 Embedding 矩阵后猫的向量 [0.3, -0.7, 0.1, …] 和狗的向量 [0.4, -0.6, 0.2, …] 在向量空间中距离很近——因为猫和狗语义相近。这就是词表映射的魔法编号是任意的但 Embedding 是学出来的——训练过程中语义相近的 Token 会被推到向量空间中相近的位置。️ 动手感受编号 vs Embedding 的语义关系操作取猫“狗”汽车三个 Token分别看它们的 Token ID 和 Embedding 向量的余弦相似度。你会看到Token ID猫1024狗2048汽车4096——ID 之间无语义关系。Embedding 余弦相似度猫-狗0.85高相似猫-汽车0.12低相似——Embedding 编码了语义。变化说明了什么词表映射的编号只是查表索引真正的语义信息在 Embedding 里——训练让 Embedding 学会了谁和谁像。 想一想词表大小是个两难选择词表大→每个 Token 承载信息多→序列短→计算少但 Embedding 矩阵大→参数多→显存占用高。词表小→Embedding 矩阵小→参数少但序列长→计算多。GPT-4 选择了更大的词表~100K用更多的参数换更短的序列——在长上下文场景下这个取舍是值得的。 顺着他想Token 变成 Embedding 向量后就进入了模型的大脑——但大模型有几千亿参数每次推理都用全部参数吗当然不是MoE 让模型大而省。三、MoE大模型的智囊团GPT-4 有一万亿参数每次推理都用全部参数那一张 A100 都跑不动。MoEMixture of Experts的思路是请一群专家按需调用——每次推理只激活一小部分参数省算力还能保效果。MoE 解决的核心问题模型越大越强但越大越贵。MoE 让模型大而省——总参数很多保证容量但每次推理只激活一小部分控制成本。就像公司请了 8 个专家顾问每次开会只叫 2 个相关的不用 8 个全到场。它到底在干嘛机制层MoE 的核心是用参数量换计算量。传统密集模型Dense Model每个 Token 经过所有参数的计算——1 万亿参数就做 1 万亿次运算。MoE 模型把前馈网络FFN替换成多个专家Expert——每个 Expert 是一个独立的 FFN输入 Token 只经过其中几个 Expert 的计算。MoE 的关键组件Expert专家多个并行的 FFN每个 Expert 学不同的知识——Expert1 学语法Expert2 学事实Expert3 学推理。Router/Gating门控/路由决定每个 Token 该去哪个 Expert——这是 MoE 的调度中心下一篇详讲。稀疏激活每个 Token 只激活 Top-K 个 Expert通常 K1 或 2——8 个 Expert 只激活 2 个计算量只有密集模型的 25%。你能感受到什么体感层Dense 模型7B 参数每个 Token 经过全部 7B 参数的计算——推理一次约 7B FLOPs。MoE 模型总参数 46B激活 7B总参数是 Dense 的 6.6 倍容量更大但每次只激活 7B计算量相同——效果接近 46B Dense 模型成本接近 7B Dense 模型。Mixtral 8x7B 的实测总参数约 46B每次激活约 13B2 个 Expert效果接近 Llama-2 70B推理成本只有 1/5。️ 动手感受Dense vs MoE 的参数效率操作对比 Dense-7B 和 Mixtral-8x7B 在相同推理预算下的效果。你会看到Dense-7B推理 7B FLOPs效果 7B 水平——中规中矩。Mixtral-8x7B推理约 13B FLOPs效果接近 70B 水平——用 1/5 的计算量达到接近的效果。变化说明了什么MoE 的核心优势是参数效率——同样的计算预算MoE 能装下更多知识因为知识分布在多个 Expert 里按需调用。 想一想MoE 的 Expert 之间会不会抢活如果所有 Token 都被路由到同一个 Expert其他 Expert 就闲置了——这就是负载不均衡问题。MoE 训练时需要加负载均衡损失Load Balancing Loss强制每个 Expert 被均匀使用。但均匀使用不等于每个 Expert 都学到了有用的知识——有些 Expert 可能只是在凑数。 顺着他想MoE 的关键是按需调用——谁决定需求是什么门控网络MoE 的调度中心。四、门控网络MoE的调度中心MoE 有 8 个专家每个 Token 该派给谁门控网络Gating Network就是 MoE 的调度中心——看一眼输入决定派哪个专家出马。就像医院的分诊台看症状决定挂哪个科。门控网络解决的核心问题MoE 的 Expert 需要一个调度员——决定每个 Token 该去哪个 Expert。门控网络就是这个调度员输入一个 Token 的向量输出每个 Expert 的匹配分数选分数最高的 Top-K 个 Expert。它到底在干嘛机制层门控网络的核心是路由决策。流程分三步。① 计算匹配分数Token 的向量经过一个线性层输出 N 个分数NExpert 数量——每个分数表示这个 Token 和这个 Expert 的匹配程度。② Softmax 归一化把分数转成概率分布——所有 Expert 的概率加起来等于 1。③ Top-K 选择选概率最高的 K 个 Expert通常 K1 或 2按概率加权组合它们的输出。门控网络的训练挑战负载均衡——如果门控网络总是选同一个 Expert其他 Expert 就白训了。训练时需要加辅助损失Auxiliary Loss惩罚 Expert 使用不均匀的情况。抖动问题——门控网络的决策是离散的选/不选离散操作不可导无法用梯度下降训练。解决方案用 Softmax 近似可导但不精确或用直通估计器Straight-Through Estimator前向离散、反向连续。你能感受到什么体感层好的门控网络代码类 Token→路由到 Expert3专精代码数学类 Token→路由到 Expert7专精数学日常对话 Token→路由到 Expert1专精语言——每个 Token 都找到了最合适的专家。差的门控网络所有 Token 都路由到 Expert1——Expert1 过载其他 Expert 闲置MoE 退化为 Dense 模型。门控网络的质量直接决定 MoE 的效果——路由错了再好的 Expert 也白搭。️ 动手感受门控网络的路由决策可视化操作输入不同类型的 Token代码/数学/日常对话看门控网络的路由决策。你会看到代码 TokenExpert3 的匹配分数最高0.72被选中。数学 TokenExpert7 的匹配分数最高0.65被选中。日常对话 TokenExpert1 的匹配分数最高0.58被选中。变化说明了什么好的门控网络能自动识别 Token 的类型路由到最合适的 Expert——这不是人工设计的是训练出来的。 想一想门控网络本身也有参数——如果门控网络太简单一个线性层路由决策可能不够精确如果太复杂又增加了计算开销和训练难度。门控网络的设计是 MoE 架构中最微妙的部分——它需要在精确路由和计算效率之间找平衡。 顺着他想门控网络选了 Top-K 个 Expert其他 Expert 怎么办直接跳过——这就是稀疏激活MoE 省算力的核心机制。五、稀疏激活四两拨千斤8 个 Expert每次只用 2 个——剩下 6 个在睡觉。稀疏激活就是让大部分参数休眠只激活最相关的一小部分。四两拨千斤用 25% 的计算量达到 80% 的效果。稀疏激活解决的核心问题密集模型太贵——每个 Token 都经过全部参数的计算算力和显存都扛不住。稀疏激活让大部分参数休眠只激活最相关的一小部分——用更少的计算量达到接近的效果。它到底在干嘛机制层稀疏激活的核心是选择性计算。MoE 的稀疏激活每个 Token 只经过 Top-K 个 Expert 的计算——8 个 Expert 只激活 2 个计算量是密集模型的 25%。但稀疏激活不只存在于 MoE——它是一种通用的省算力思想。MoE 的稀疏激活在 Expert 维度做稀疏——选哪些 Expert 激活。Activation Sparsity激活稀疏在神经元维度做稀疏——ReLU 本身就是一种稀疏激活负值变零约 50% 神经元被关闭。条件计算Conditional Computation在层维度做稀疏——根据输入跳过某些层Early Exit、Layer Skipping。稀疏激活的代价GPU 利用率低——GPU 是为密集矩阵运算设计的稀疏计算会导致大量空洞实际加速比低于理论值。通信开销——分布式训练时Token 被路由到不同 GPU 上的 Expert需要跨 GPU 通信All-to-All通信延迟可能抵消计算节省。你能感受到什么体感层理论加速8 个 Expert 激活 2 个→计算量是密集模型的 25%→4 倍加速。实际加速GPU 稀疏计算效率低跨 GPU 通信开销→实际加速约 2-3 倍。效果损失稀疏激活的模型效果通常略低于同等参数量的密集模型——因为休眠的参数在推理时完全没用。权衡用 10-20% 的效果损失换 2-3 倍的推理加速——在大多数场景下这个交易是值得的。️ 动手感受不同稀疏度的效果-速度权衡操作对比 Top-1/Top-2/Top-4/全激活Dense在相同模型上的效果和推理速度。你会看到Top-1速度最快4x 理论加速效果损失最大约 5-10%。Top-2速度较快2.5x 理论加速效果损失适中约 2-5%——Mixtral 的选择。Top-4速度中等1.5x 理论加速效果损失很小约 1%。Dense速度基准效果基准。变化说明了什么稀疏度是速度-效果的旋钮——Top-2 是当前的最佳平衡点。 想一想稀疏激活的省算力只在推理阶段明显——训练阶段所有 Expert 都需要被训练即使每次只激活一部分所以 MoE 的训练成本并不比 Dense 低甚至更高因为参数更多、通信更复杂。MoE 的核心优势是推理便宜不是训练便宜。 顺着他想Token 切好了、数字映射好了、Expert 选好了——这些组件组装在一起就是 Transformer大模型的骨架。六、Transformer大模型的骨架GPT、BERT、LLaMA、Claude——所有现代大模型都站在同一个架构上Transformer。它不是某个模型的名字是一个架构范式——就像钢筋混凝土不是某栋楼的名字是所有摩天大楼的骨架。Transformer 解决的核心问题RNN 的序列依赖瓶颈——RNN 必须一个 Token 一个 Token 地处理无法并行。Transformer 用自注意力Self-Attention替代循环Recurrence实现了完全并行计算——这是大模型能大起来的基础。它到底在干嘛机制层Transformer 的核心是注意力机制前馈网络的堆叠。编码器EncoderBERT 的架构——每一层包含 Self-Attention FFN输入序列每个位置同时计算注意力捕获全局依赖。解码器DecoderGPT 的架构——每一层包含 Masked Self-Attention FFN只能看到当前位置之前的 Token因果注意力保证自回归生成。编码器-解码器Encoder-DecoderT5/BART 的架构——编码器处理输入解码器生成输出中间用 Cross-Attention 连接。Transformer 的关键创新并行计算——Self-Attention 让所有位置同时计算不像 RNN 必须顺序处理。全局依赖——每个位置可以直接关注序列中任何其他位置不像 RNN 只能通过隐状态间接传递信息。可扩展性——堆叠更多层、更多头、更大 FFN就能得到更大的模型——这个堆叠范式让模型规模从百万参数扩展到万亿参数。你能感受到什么体感层RNN 处理大模型真厉害先处理大→带着隐状态处理模型→再处理真→最后处理厉害——4 步串行无法并行。Transformer 处理大模型真厉害4 个 Token 同时输入Self-Attention 同时计算所有位置之间的关系——1 步并行。代价Self-Attention 的计算复杂度是 O(N²)——序列长度 N 翻倍计算量翻 4 倍。这也是为什么长上下文100K Token是大模型的硬挑战。️ 动手感受RNN vs Transformer 的并行性操作同一个序列分别用 RNN 和 Transformer 处理对比计算时间和可并行性。你会看到RNN4 个 Token 串行处理GPU 利用率低大量空闲核心总时间 4 × 单步时间。Transformer4 个 Token 并行处理GPU 利用率高所有核心同时工作总时间 ≈ 1 × 单步时间。变化说明了什么Transformer 的快不是因为单步计算少是因为能并行——GPU 的并行计算能力被充分利用。 想一想Transformer 的 O(N²) 注意力复杂度是它的阿喀琉斯之踵——序列越长计算量增长越快。Flash Attention、稀疏注意力、线性注意力等方案都在试图解决这个问题但到目前为止没有任何方案能在精确高效两个维度同时超越标准 Attention。长上下文的计算成本是大模型架构的下一个突破口。 顺着他想Transformer 的核心是 Self-Attention——它让每个位置都能看到其他所有位置。但看到不等于关注——Attention 机制决定每个位置该关注谁这就是大模型的心脏。七、Attention大模型的心脏“大模型真厉害”——当你读到厉害时你的大脑自动关联到大模型而不是真。Attention 机制做的就是这件事让模型在处理每个 Token 时知道该关注序列中的哪些其他 Token。这是大模型理解上下文的核心能力。Attention 解决的核心问题如何让模型在处理每个位置时动态地关注序列中的相关位置。传统方法RNN/CNN的信息传递是固定路径的——RNN 只能通过隐状态传递CNN 只能在局部窗口内传递。Attention 让每个位置可以直接看到序列中任何其他位置并按相关性加权——信息传递路径是动态的、数据驱动的。它到底在干嘛机制层Self-Attention 的核心是QKV 机制。每个 Token 生成三个向量QueryQ“我在找什么”——当前 Token 的查询向量。KeyK“我有什么”——每个 Token 的键向量。ValueV“我的内容是什么”——每个 Token 的值向量。计算流程① 计算注意力分数当前 Token 的 Q 和所有 Token 的 K 做点积——分数越高两个 Token 越相关。② Softmax 归一化把分数转成权重加起来1——权重表示当前 Token 应该关注每个其他 Token 的程度。③ 加权求和用权重对 V 加权求和——得到当前 Token 的新表示融合了序列中所有相关 Token 的信息。多头注意力Multi-Head Attention不是做一次 Attention而是做 H 次如 8 头、32 头——每个头学不同的关注模式一个头关注语法关系另一个头关注语义关系最后拼接所有头的结果。你能感受到什么体感层处理厉害时Q厉害和 K大模型的点积很高→Attention 权重大→厉害的新表示融合了大量大模型的信息→模型理解厉害修饰的是大模型。处理真时Q真和 K厉害的点积较高→真融合了厉害的信息→模型理解真是厉害的副词修饰。没有 Attention每个 Token 只知道自己的信息不知道上下文——厉害可以是厉害任何东西。有 Attention每个 Token 的表示融合了上下文信息——“厉害知道自己在修饰大模型”。️ 动手感受Attention 权重可视化操作输入大模型真厉害可视化厉害这个 Token 对所有其他 Token 的 Attention 权重。你会看到“厉害→大模型”权重 0.65最高——“厉害主要关注大模型”。“厉害→真”权重 0.20——“厉害也关注修饰词真”。厉害→自身权重 0.15——每个 Token 也会关注自己。变化说明了什么Attention 权重直接反映了谁和谁相关——可视化 Attention 是理解模型行为的最直观方式。 想一想Attention 权重高≠因果性强——“厉害高度关注大模型”但这不意味着大模型导致了厉害。Attention 反映的是相关性不是因果性。把 Attention 权重当作模型推理的证据是有风险的——它会误导你对模型决策的理解。 顺着他想7 个组件串起来就是大模型从文本输入到理解输出的完整链路——下一篇我们讲大模型的训练过程预训练、微调、RLHF看这些组件是怎么被炼出来的。八、一张图串起大模型架构链路7 个组件串成一条从文本输入到理解输出的完整链路文本输入大模型真厉害 │ ① Tokenization ← 切碎片[大,模型,真,厉害] │ ② 词表映射 ← 变数字[234, 5678, 890, 12345] → Embedding向量 │ ③ Transformer ← 搭骨架多层堆叠的注意力前馈网络 │ │ │ ├── Attention ← 跳心脏每个Token动态关注相关Token │ │ │ └── FFN(MoE) ← 请专家多个Expert按需调用 │ │ │ ├── 门控网络 ← 做调度决定Token去哪个Expert │ │ │ └── 稀疏激活 ← 省算力只激活Top-K个Expert │ └── 输出下一个Token的概率分布架构口诀Tokenization切碎片——文本变 Token大模型才认。词表映射变数字——Token 变 Embedding语义才编码。MoE请专家——参数多但激活少大而省。门控网络做调度——看一眼输入派最合适的专家。稀疏激活省算力——8 个 Expert 只用 2 个四两拨千斤。Transformer搭骨架——注意力前馈的堆叠并行计算的基础。Attention跳心脏——QKV 机制决定每个 Token 关注谁。九、代码Tokenization MoE 简化实现importtorchimporttorch.nnasnnimporttorch.nn.functionalasF# ① 简化版 BPE TokenizerclassSimpleTokenizer:def__init__(self):# 简化词表实际GPT词表有50257个Tokenself.vocab{大:1,模型:2,真:3,厉害:4,不:5,过:6,如此:7,[PAD]:0}self.id_to_token{v:kfork,vinself.vocab.items()}defencode(self,text:str)-list:# 简化按词表最大匹配切分tokens,i[],0whileilen(text):matchedFalseforlengthinrange(min(4,len(text)-i),0,-1):chunktext[i:ilength]ifchunkinself.vocab:tokens.append(self.vocab[chunk])ilength matchedTruebreakifnotmatched:tokens.append(0)# [UNK]i1returntokensdefdecode(self,ids:list)-str:return.join(self.id_to_token.get(i,[UNK])foriinids)# ② 稀疏MoE层classMoELayer(nn.Module):def__init__(self,dim64,num_experts4,top_k2):super().__init__()self.num_expertsnum_experts self.top_ktop_k# 门控网络self.gatenn.Linear(dim,num_experts)# 多个Expert每个是一个FFNself.expertsnn.ModuleList([nn.Sequential(nn.Linear(dim,dim*4),nn.ReLU(),nn.Linear(dim*4,dim))for_inrange(num_experts)])defforward(self,x):# x: [batch, seq_len, dim]gate_scoresself.gate(x)# [batch, seq, num_experts]gate_probsF.softmax(gate_scores,dim-1)topk_vals,topk_idxgate_probs.topk(self.top_k,dim-1)# 选Top-K# 稀疏计算只经过被选中的Expertoutputtorch.zeros_like(x)forkinrange(self.top_k):expert_idxtopk_idx[:,:,k]# [batch, seq]weighttopk_vals[:,:,k:k1]# [batch, seq, 1]foreinrange(self.num_experts):mask(expert_idxe).unsqueeze(-1).float()# [batch, seq, 1]ifmask.sum()0:expert_outself.experts[e](x)# 全部Token都过Expertoutputexpert_out*mask*weight# 只保留被选中的Tokenreturnoutput# ③ 演示tokenizerSimpleTokenizer()idstokenizer.encode(大模型真厉害不过如此)print(fToken IDs:{ids})print(fDecoded:{tokenizer.decode(ids)})moeMoELayer(dim64,num_experts4,top_k2)xtorch.randn(1,len(ids),64)outmoe(x)print(fMoE输入:{x.shape}→ 输出:{out.shape})print(f激活比例:{2}/{4} 50% (稀疏激活))这段代码实现了 Tokenization最大匹配分词和 MoE稀疏 Expert 激活的核心逻辑。生产环境要做的升级用 BPE/SentencePiece 替换简化分词、加 Embedding 层、加多头注意力、加负载均衡损失。写到最后7 个组件从 Tokenization 的切碎文本到 Attention 的动态关注串起来就是大模型从文本输入到理解输出的完整链路。Tokenization 是消化系统词表映射是翻译官MoE 是智囊团门控网络是调度中心稀疏激活是省算力的秘密Transformer 是骨架Attention 是心脏——每个组件各司其职缺一不可。下一篇我们讲大模型的炼成过程——预训练、微调、RLHF看这些组件是怎么从零开始被训练出来的。如果你读下来觉得真有用点个赞让我知道架构篇这种拆开讲的写法值得继续⭐收藏起来Tokenization/MoE/Attention 这些概念在理解大模型时回来翻的概率很高关注一下下一篇大模型训练篇会讲预训练/微调/RLHF关注了就不会错过。有问题评论区直接说我会逐条回。系列导航 持续更新系列第 10 篇上一篇6张图搞懂Agent进阶——A2A多智能体NL2SQLVibe Coding 下一篇预告预训练微调RLHF大模型是怎么炼出来的如果这篇对你有帮助点个收藏大模型架构概念在理解模型行为时回来翻的概率很高。有问题欢迎在评论区交流我会逐条回复。