京东 算法实习一面 上

📅 2026/8/15 12:58:35
京东 算法实习一面 上
八股transformer的基本知识、几个层Transformer完全基于注意力机制摒弃了循环和卷积操作。Transformer出来之前主流的序列转换模型都基于复杂的循环神经网络RNN包含编码器和解码器两部分。当时表现最好的模型还通过注意力机制将编码器和解码器连接起来。Transformer是一种基于自注意力机制的深度学习模型为了解决自然语言处理中的序列到序列sequence-to-sequence问题而设计的。相较于RNN模型Transformer模型具有2个显著的优势。优势一处理长序列数据。Transformer采用自注意力机制能够同时处理序列中的所有位置捕捉长距离依赖关系从而更准确地理解文本含义。而RNN模型则受限于其循环结构难以处理长序列数据。优势二实现并行化计算。由于RNN模型需要依次处理序列中的每个元素其计算速度受到较大限制。而Transformer模型则可以同时处理整个序列大大提高了计算效率。Transformer遵循编码器-解码器总体架构使用堆叠的自注意力机制和逐位置的全连接层分别用于编码器和解码器。Transformer的架构Encoder编码器Transformer的编码器由6个相同的层组成每个层包括两个子层一个多头自注意力层和一个逐位置的前馈神经网络。在每个子层之后都会使用残差连接和层归一化操作这些操作统称为AddNorm。这样的结构帮助编码器捕获输入序列中所有位置的依赖关系。Decoder解码器Transformer的解码器由6个相同的层组成每层包含三个子层掩蔽自注意力层、Encoder-Decoder注意力层和逐位置的前馈神经网络。每个子层后都有残差连接和层归一化操作简称AddNorm。这样的结构确保解码器在生成序列时能够考虑到之前的输出并避免未来信息的影响。编码器与解码器的本质区别在于Self-Attention的Mask机制。Transformer的核心组件Transformer模型包含输入嵌入、位置编码、多头注意力、残差连接和层归一化、带掩码的多头注意力以及前馈网络等组件。Transformer的核心组件输入嵌入将输入的文本转换为向量便于模型处理。位置编码给输入向量添加位置信息因为Transformer并行处理数据而不依赖顺序。多头注意力让模型同时关注输入序列的不同部分捕获复杂的依赖关系。残差连接与层归一化通过添加跨层连接和标准化输出帮助模型更好地训练防止梯度问题。带掩码的多头注意力在生成文本时确保模型只依赖已知的信息而不是未来的内容。前馈网络对输入进行非线性变换提取更高级别的特征。Transformer的3种注意力层在Transformer架构中有3种不同的注意力层Self Attention自注意力、Cross Attention 交叉注意力、Causal Attention因果注意力编码器中的自注意力层Self Attention layer编码器输入序列通过Multi-Head Self Attention多头自注意力计算注意力权重。解码器中的交叉注意力层Cross Attention layer编码器-解码器两个序列通过Multi-Head Cross Attention多头交叉注意力进行注意力转移。解码器中的因果自注意力层Causal Attention layer解码器的单个序列通过Multi-Head Causal Self Attention多头因果自注意力进行注意力计算从0到1微调或训练一个LLM数据-预训练-微调-对齐提升实用性与安全性参考训练大语言模型LLM是 “数据 - 模型 - 训练 - 评估 - 部署” 的全链路工程核心目标是让模型学习语言规律、知识逻辑并具备实用生成能力。以下是结构化的从 0 到 1 训练流程兼顾理论框架与工程实践要点一、前置准备明确目标与技术选型1. 场景与目标定义明确核心用途通用大模型如 GPT-3或垂直领域模型如代码漏洞检测、医疗问答界定能力边界支持的任务类型生成、分类、推理、输入输出格式文本长度、结构化要求、性能指标Perplexity、准确率、生成连贯性。2. 技术栈与硬件选型框架选型PyTorch灵活易调试适配研究场景、TensorFlow工业级部署友好分布式训练工具DeepSpeedZeRO 优化、Megatron-LM张量并行 / 流水线并行硬件资源GPU/TPU 集群显存≥40GB / 卡支持 FP16/FP8 混合精度通用大模型需 100 张 A100/H100垂直领域可缩减存储与算力调度分布式文件系统如 HDFS、集群管理工具Kubernetes。二、数据工程高质量数据是模型的基础1. 数据收集与筛选数据来源公开数据集如 Wikipedia、C4、BigVul、行业私有数据需合规授权、爬取数据遵守 robots 协议与版权法筛选原则高质量、多样性、无偏见—— 优先选择权威、准确、无冗余的数据覆盖目标场景的核心领域如漏洞检测模型需重点收集 C/C/Java 漏洞代码数据剔除色情、暴力、虚假信息。2. 数据预处理关键步骤清洗去重文本指纹去重、语义去重、去噪过滤乱码、低质量短句、广告垃圾信息、格式标准化统一编码、换行、标点分词与 tokenization使用专用分词器如 GPT 的 BytePairEncoding、CodeBERT 的 CodeTokenizer处理特殊字符如代码中的括号、注释设定最大序列长度如 512/1024 tokens数据格式转换将文本转为模型可接收的张量格式input_ids、attention_mask划分训练集 / 验证集比例通常 9:1合规处理脱敏去除个人隐私、敏感信息、授权确认商业数据需签署许可协议符合 GDPR、数据安全法等规范。三、模型设计与初始化1. 架构选型核心架构基于 Transformer 解码器自回归生成如 GPT 系列或编码器 - 解码器Seq2Seq如 T5垂直领域可复用预训练基座如 CodeBERT 用于代码相关任务超参数设计需根据数据量与算力调整模型规模层数12-100、注意力头数12-16、隐藏层维度768-4096、参数量百万级 - 千亿级其他超参激活函数GELU/SwiGLU、归一化方式LayerNorm、dropout 比例0.1-0.3防止过拟合。2. 模型初始化从零训练随机初始化 Transformer 参数适用于有海量数据的通用模型成本高迁移初始化基于公开预训练模型如 RoBERTa、Llama微调适用于垂直领域降低训练成本、提升效率权重初始化采用 Xavier/Glorot 初始化避免梯度消失或爆炸。四、训练过程分阶段优化与监控1. 预训练核心阶段训练目标让模型学习语言基础规律与通用知识核心任务自回归语言建模预测下一个 token适用于生成式模型、掩码语言建模MLM预测被掩码的 token适用于编码器模型、句子顺序预测SOP增强语义理解训练策略优化器AdamW权重衰减 0.01防止过拟合学习率调度线性预热Warmup 余弦退火 / 多项式衰减避免初期震荡后期稳定收敛批量处理梯度累积显存不足时等效增大 batch size、混合精度训练FP16/FP8提升算力利用率监控指标训练损失Loss、验证集困惑度Perplexity越低表示模型拟合效果越好、GPU 显存占用、训练速度tokens/sec。2. 微调适配具体任务监督微调SFT使用标注数据如 “漏洞代码 - 修复方案” 配对数据微调让模型学习任务映射关系提示工程Prompt Tuning通过少量标注数据设计提示模板如 “判断以下代码是否存在缓冲区溢出漏洞{code} 答案”避免全量微调的高成本关键要点冻结基座模型部分层仅训练顶层分类器 / 适配器使用更小的学习率1e-5~1e-7防止灾难性遗忘。3. 对齐训练提升实用性与安全性奖励模型训练RM收集人工标注的生成结果排序数据如 A 方案优于 B 方案训练奖励模型评估生成质量强化学习微调RLHF基于 PPO近端策略优化算法让模型根据 RM 的奖励信号调整生成策略优化连贯性、准确性、安全性安全对齐加入拒绝生成规则如拒绝恶意代码生成、虚假信息输出过滤有害 prompt。五、评估与迭代全面验证模型能力1. 量化评估基础指标困惑度Perplexity、BLEU/Rouge生成任务、准确率 / 召回率分类任务如漏洞检测下游任务测试Few-shot/Zero-shot 能力评估如用少量漏洞样本测试模型检测准确率、跨领域泛化性如从 C 语言漏洞迁移到 Java 漏洞效率指标推理速度tokens/sec、显存占用、训练成本算力消耗。2. 定性评估人工评估邀请领域专家评估生成结果的准确性如漏洞检测是否误报 / 漏报、连贯性、逻辑性、实用性安全性测试检测模型是否生成有害内容如恶意代码、隐私信息、是否存在偏见如性别 / 种族偏见。3. 迭代优化针对问题调整数据层面补充高质量标注数据、修正数据偏差、模型层面调整超参数、增加适配器层、训练层面优化学习率调度、延长训练周期版本管理记录每次迭代的模型参数、数据版本、评估结果便于回溯最优版本。六、部署与落地从模型到产品1. 模型压缩与优化量化INT8/INT4 量化降低显存占用与推理延迟如 GPTQ、AWQ 量化蒸馏通过教师模型大模型指导学生模型小模型在保证性能的前提下缩减参数量推理优化使用 vLLM、TensorRT 等推理引擎优化注意力计算如 FlashAttention提升并发处理能力。2. 服务化部署部署形式API 接口服务如 RESTful API、嵌入式部署适用于边缘设备工程保障负载均衡应对高并发请求、缓存机制缓存高频查询结果、监控告警推理延迟、服务可用性接口设计明确输入输出格式如代码漏洞检测模型输入为代码文本输出为漏洞类型、位置、修复建议。3. 持续迭代与合规收集用户反馈监控模型实际使用中的错误如漏检漏洞、生成无效修复方案形成反馈数据集持续微调定期用反馈数据更新模型提升适配性合规合规确保模型输出符合行业规范如漏洞检测模型需满足信息安全标准规避法律风险如版权、隐私保护。核心总结从 0 到 1 训练 LLM 的关键是 “数据为王、模型适配、训练可控、评估全面、部署高效”高质量数据决定模型上限合理的架构与训练策略决定模型性能对齐与合规决定模型实用性而工程优化决定模型能否落地应用。实际训练中需平衡算力成本、训练周期与性能指标优先聚焦核心场景迭代再逐步扩展能力边界。