【LLM面试专题】11.3 面试实战:高频题速查手册

📅 2026/7/28 9:41:06
【LLM面试专题】11.3 面试实战:高频题速查手册
面试前1小时看这个。每条5-10秒回想答案想不起来的立刻回对应模块复习。三个梯队红色必考答不出基本凉、黄色高频答得好拉开差距、白色中频答出来是加分。带追问标记的题目在面试中常被追问往下挖一层。第一梯队必考13题100%掌握每道题能口述3遍以上。A1: Self-Attention公式Attention(Q,K,V) softmax(QK^T / √d_k) V 为什么除以√d_k q_i, k_i ~ N(0,1)时点积方差 d_k标准差 √d_k 不缩放 → softmax饱和 → 梯度消失 缩放后方差恢复1 → 梯度正常追问除以d_k行不行→ 不行。Var(x/d_k) 1/d_k方差太小softmax太平信息无法聚焦。A2: 手写Multi-Head Attentiondefmha(x,w_q,w_k,w_v,w_o,maskNone):B,T,dx.shape Qw_q(x).view(B,T,n_h,d_k).transpose(1,2)Kw_k(x).view(B,T,n_h,d_k).transpose(1,2)Vw_v(x).view(B,T,n_h,d_k).transpose(1,2)scoresQ K.transpose(-2,-1)/d_k**0.5ifmaskisnotNone:scoresscores.masked_fill(mask0,float(-inf))attnF.softmax(scores,dim-1)out(attn V).transpose(1,2).contiguous().view(B,T,d)returnw_o(out)常见Bugcontiguous()不可忘mask在softmax前加-inf维度检查QK^T→(B,h,T,T)A3: RLHF完整流程Stage 1 - SFT10K-100K高质量数据→监督微调。学对话格式 Stage 2 - RM Training生成K个回答→人类排序→训练Reward Model Loss -E[log σ(r_w - r_l)] Stage 3 - PPOPolicy生成→RM打分→PPO更新→KL约束防偏离追问KL惩罚为什么必要→ 没有KL → Policy学会骗RM → Reward Hacking。A4: MHA vs MQA vs GQAMHAh个Q头h个K/V头 → KV-Cache最大质量最好 MQAh个Q头1个K/V头 → KV-Cache最小(MHA的1/h)质量微降 GQAh个Q头g个K/V头 → 折中主流选择追问GQA为什么几乎不损失质量→ 注意力分布主要在Q侧K/V共享影响不大。LLaMA-2/3都选GQA。A5: DPO推导30秒版RLHF目标max E[r(x,y)] - β·KL(π_θ || π_ref) 闭式解r(x,y) β·log(π_θ/π_ref) β·Z(x) 代入Bradley-Terry → 消去r和Z → 只剩策略比值 L_DPO -E[log σ(β·log(π_θ(y_w)/π_ref(y_w)) - β·log(π_θ(y_l)/π_ref(y_l)))]核心insightReward可被Policy比值替代 → 不需要RMA6: ZeRO三阶段ZeRO-1分片优化器状态 → 显存省约4倍 ZeRO-2分片梯度 → 再省2倍 ZeRO-3分片参数 → 省N倍通信量最大追问实际怎么选→ ZeRO-2性价比最高。ZeRO-3配合TP使用通信正交。A7: RoPE原理在Q和K上乘以旋转矩阵使内积只与相对位置(m-n)有关 θ_i 10000^{-2i/d} 高频维度(小i)旋转快 → 近距离依赖 低频维度(大i)旋转慢 → 远距离依赖 叠加效果|m-n|越大 → 内积越小远程衰减追问RoPE怎么扩展长文本→ PI → NTK-aware → YaRN调整θ_i缩放方式A8: 分布式并行策略DP每卡一份模型数据分片 ZeRO在DP基础上分片优化器/梯度/参数 TP每卡模型一部分需高带宽(NVLink) PP层分给不同卡 SP序列维度分片用于超长文本 典型300B配置ZeRO-3 TP-8 PP-8 SP约2000 A100A9: KV Cache显存计算KV Cache 2(KV) × n_layers × n_kv_heads × seq_len × head_dim × dtype_bytes 例70B, 80层, GQA-8(8组KV), seq4096, head_dim128, FP16 2 × 80 × 8 × 4096 × 128 × 2 5.4 GB MHA(64头): 2 × 80 × 64 × 4096 × 128 × 2 42.9 GB GQA节省约8倍A10: Flash Attention核心问题传统Attention对HBM读写太多 方案QKV分块加载到SRAMSRAM内计算局部Attention 用online softmax避免完整归一化 效果HBM读写减少到1/N加速2-4×精度无损A11: RAG完整流程离线文档→Chunk(256-512t)→Embedding→向量库 在线Query→[HyDE优化]→检索(DenseSparse)→Rerank→LLM生成 优化方向 Chunk定长 语义切分 层级切分 检索Dense Sparse Hybrid 高级Graph RAG、Agentic RAGA12: 幻觉分类与检测四类事实性/忠实性/逻辑性/指令性 检测三法Self-Consistency(多次生成一致性) Factual Grounding(知识库验证) Uncertainty(logprob分析) 缓解首选RAG外部知识锚定A13: LLM-as-Judge偏差三大偏差 Position Bias → 交换顺序取平均 Self-Enhancement → 换不同模型做Judge Verbosity Bias → rubric加长度无关说明 与人类一致率GPT-4约80%仍有20%噪声第二梯队高频12题全部掌握每个能展开2分钟。B1: Pre-LN vs Post-LNPre-LN: output x F(LN(x)) 梯度恒等项1保证梯度不消失 可以不warmup训练更深模型 所有现代LLM都用Pre-LNB2: Scaling LawKaplan(2020)主要扩参数 Chinchilla(2022)参数和数据等比最优~20 tokens/参数 意味着预算有限时不要只堆参数数据同样重要B3: LoRA原理ΔW BA (低秩分解B: d×r, A: r×d) r8覆盖大部分任务 为什么有效预训练权重已高秩ΔW的有效秩约4-8 QLoRANF4量化基座模型双重量化分页优化器B4: PagedAttention借鉴虚拟内存分页逻辑块→物理块 每块16 tokenBlock Table管理映射 Copy-on-Write支持beam search共享prefix 显存利用率从20-40%提升到90%B5: Speculative Decoding草稿模型(小)快速生成γ个候选 目标模型(大)一次验证所有候选 正确的接受错误的从第一个错误位置重新生成 加速比2-3×数学等价不损失精度B6: Prefill vs DecodePrefill处理完整promptcompute-boundGPU利用率高 Decode逐token生成memory-bound需加载全量权重 优化方向不同Prefill→高算力GPUDecode→高带宽GPUB7: 数据污染检测检测方法 n-gram重叠训练集与测试集 Perplexity分析污染样本PPL异常低 Min-K% Prob最低K%token均值 Membership Inference二分类器 时间戳验证用截止后数据B8: 安全防御多层架构L1: 输入过滤关键词分类器 L2: 注入检测多信号同时出现→可疑 L3: Prompt加固系统prompt强调安全规则 L4: 安全生成低temp约束解码 L5: 输出过滤安全分类器 L6: 事后验证LLM自检B9: SwiGLU输出 down(silu(gate(x)) * up(x)) 三个权重矩阵gate(w1), up(w2), down(w3) 中间维度8/3×d_model保持参数量与标准FFN一致 SwiGLU门控机制→更优梯度流动B10: 评估Benchmark对比MMLU57学科选择题2024年区分度下降 GSM8K小学数学CoT提升15-30% HumanEval164编程题Passk指标 MT-Bench80道多轮对话GPT-4评分 Chatbot Arena匿名成对比较Elo排名B11: Self-Instruct vs Evol-InstructSelf-Instruct水平扩展广度种子池→LLM生成→ROUGE-L去重 Evol-Instruct垂直深化深度进化操作(深度/约束/推理) 最佳实践先Self-Instruct覆盖类型再Evol-Instruct提升难度B12: Continuous Batching每个请求有自己的KV Cache块 调度器每步检查活跃请求padding-free 请求完成立即移除新请求加入 吞吐量提升2-4×第三梯队中频10题熟悉核心Insight答出来是加分。C1: ALiBi位置编码在QK^T后、softmax前加入偏置score q·k/√d - m·|i-j| 距离越远惩罚越大不需要显式位置编码 外推能力强BLOOM使用C2: MoE负载均衡路由器 Linear(d_model, num_experts) Top-K选择专家 负载均衡LossL α×N×Σ(f_i × P_i) 无此loss → 所有token去同一专家C3: BF16 vs FP16BF168位指数(范围FP32) 7位尾数 → 训练稳定 FP165位指数 10位尾数 → 精度高但易下溢 训练首选BF16推理可回退FP16C4: Gradient Checkpointing用计算换显存前向时只存部分中间结果 反向时重计算丢失的中间结果 约增加33%计算量节省50%显存 适合显存紧张的场景C5: GPTQ vs AWQ量化GPTQ基于二阶信息(Hessian)的逐层量化 AWQ识别并保护关键通道(对输出影响大的) AWQ通常精度更好速度更快C6: Constitutional AIAnthropic提出原则驱动的自我修正 SL-CAI模型生成→根据宪法原则修正→SFT RL-CAI用宪法原则训偏好模型→PPO 不依赖大量人工标注C7: Calibration校准模型置信度与实际准确率是否匹配 ECE分bin计算准确率与置信度的加权差 Platt校准sigmoid后处理 Isotonic校准保序函数更灵活 高风险场景必须校准C8: Needle-in-a-Haystack在长文本随机位置插入关键信息测试模型能否定位 热力图上下文长度×针位置 Lost-in-the-Middle现象中间位置检索准确率最低 变体Multi-Needle、Adversarial、NumericalC9: DPO的β参数β控制对偏好数据的信赖程度 β大(0.5)积极拟合偏好差异 β小(0.01)保守接近参考模型 β→0退化为仅推高偏好回答概率 典型值0.1-0.5C10: Agent评估维度任务完成率(Success Rate) 工具调用准确率(F1/EM) 效率(步数/耗时/Token消耗) 鲁棒性(错误恢复率) 规划能力(Plan Correctness)补充按主题分类的高频问答速查表A. Transformer核心面试出现率90%问题一句话回答关键词Self-Attention复杂度O(n^2d)n序列长d维度二次复杂度为什么除以sqrt(dk)防止点积过大导致softmax梯度消失缩放因子Multi-Head的作用多个子空间捕获不同模式信息多样性位置编码为什么必要Attention本身无顺序感知排列不变性RoPE vs ALiBiRoPE旋转编码ALiBi线性偏置外推性FlashAttention核心IO感知减少HBM读写分块计算KV Cache为什么有效避免重复计算已处理token的K/V空间换时间GQA vs MHAGQA多Q共享一个KV减少显存效率-质量折中B. 训练相关面试出现率80%问题一句话回答关键词Scaling LawsLoss ~ N^(-alpha)数据/参数/算力幂律关系Chinchilla预训练数据量20 token/参数(Chinchilla最优比)数据模型比3D并行DPTPPP按模型/显存/通信选并行策略ZeRO三个阶段优化器/梯度/参数依次切分显存优化LoRA原理Wdelta_W, delta_WBA低秩分解参数高效LoRA rank选择r8通常够用复杂任务r16-64调优RLHF三阶段SFT→Reward Model→PPO对齐DPO vs PPODPO跳过Reward Model直接用偏好数据简化训练C. 推理优化面试出现率70%问题一句话回答关键词Prefill vs DecodePrefill计算密集Decode内存密集两阶段特性PagedAttention虚拟内存分页管理KV Cache碎片率降低Continuous Batching请求动态插入/移除GPU持续满载吞吐量提升投机解码原理小模型猜大模型验证加速比K/2量化对精度的影响INT8几乎无损INT4损失3-5%精度-速度权衡SmoothQuant将激活的异常值迁移到权重INT8友好D. 评估与安全面试出现率60%问题一句话回答关键词MMLU是什么57学科选择题测知识广度知识评估LLM-as-Judge用LLM评估LLM输出质量自动评估数据污染检测n-gram重叠PPL异常MIA评测有效性幻觉类型事实性/忠实性/逻辑性/指令性四维分类RAG减少幻觉提供外部证据grounding事实验证越狱防御多层防御:输入过滤安全对齐输出审核纵深防御E. RAG与Agent面试出现率70%问题一句话回答关键词RAG vs 微调RAG灵活可解释微调深度优化选型依据Chunk策略RecursiveCharacterTextSplitter最通用分块Hybrid SearchDenseBM25RRF融合检索优化ReAct框架Thought→Action→Observation循环Agent基础Function CallingLLM输出结构化函数调用JSON工具使用LangGraph优势有向图建模状态流转支持循环分支Agent框架F. 系统设计面试出现率50%问题核心思路关键点设计RAG系统分块→Embed→检索→Rerank→生成检索质量模型大小部署70B模型TP4INT4量化PagedAttention显存管理多模型服务级联路由动态batchGPU调度成本-质量对话系统状态管理上下文压缩安全层多轮一致性数据飞轮收集→标注→训练→评估→部署→收集持续迭代补充易混淆概念对比速查概念A概念B核心区别MHAGQAMHA每头独立KVGQA多头共享KVLoRAQLoRALoRA用FP16QLoRA用NF4Double QuantPPODPOPPO训练RM再优化DPO直接用偏好RAGFine-tuningRAG外部知识注入FT参数内化HNSWIVFHNSW图索引召回高IVF倒排索引内存省TTFTTPOTTTFT首token延迟TPOT每token延迟SFTCPTSFT指令微调CPT继续预训练BGEE5BGE中文强E5英文强vLLMTGIvLLM性能优先TGI生态优先BLEUROUGEBLEU看precision(翻译)ROUGE看recall(摘要)PerplexityLossPPLexp(Loss)PPL更直觉TokenWordToken是子词级Word是词级补充数字速记卡数字含义20Chinchilla最优token/参数比32K-128K主流模型词表大小4096-8192常见Embedding维度57MMLU学科数164HumanEval题目数8.5KGSM8K题目数0.5-2xLoRA rank8时的显存占比2-4xINT8量化加速比10-20%INT4量化精度损失4PagedAttention典型block大小(KB)5-8投机解码典型草稿长度K0.6-0.9投机解码典型接受率范围60-80%KV Cache碎片率(无PagedAttention)4%PagedAttention后碎片率10%Attention占Transformer计算量比例90%Matmul占Attention计算量比例补充面试常考公式速查公式含义场景Softmax(z_i) exp(z_i)/sum(exp(z_j))归一化为概率分布Attention输出层Attention(Q,K,V) softmax(QK^T/sqrt(d))V缩放点积注意力Transformer核心RoPE: f(q,m) q * e^(im*theta)旋转位置编码位置编码LoRA: W’ W BA, B(dr), A(rk)低秩适配参数高效微调InfoNCE -log(exp(sim/T)/sum(exp(sim/T)))对比学习损失Embedding训练KL(PQ) sum(P*log(P/Q))passk 1 - C(n-c,k)/C(n,k)代码评估无偏估计HumanEvalBradley-Terry: P(AB) sigma(s_A - s_B)成对比较模型Arena排名ECE sum(acc(k)-conf(k)*n_k/N)NDCGK DCGK/IDCGK归一化折损累积增益检索评估补充面试必背英文术语中文英文缩写大语言模型Large Language ModelLLM检索增强生成Retrieval-Augmented GenerationRAG人类反馈强化学习RLHFRLHF低秩适配Low-Rank AdaptationLoRA注意力机制Attention Mechanism-位置编码Positional EncodingPE知识蒸馏Knowledge DistillationKD投机解码Speculative DecodingSD键值缓存Key-Value CacheKV Cache思维链Chain of ThoughtCoT工具使用Tool Use / Function CallingFC数据污染Data Contamination-对齐Alignment-幻觉Hallucination-红队测试Red Teaming-混合专家Mixture of ExpertsMoE量化Quantization-预训练Pre-training-微调Fine-tuning-提示工程Prompt EngineeringPE补充面试常见陷阱与正确理解陷阱错误理解正确理解“Attention就是加权平均”简单加权求和是Q和K的相似度驱动V的信息聚合“模型越大一定越好”参数决定一切数据质量训练策略同样关键(LIMA)“RLHF让模型变好”RLHF提升能力RLHF是对齐而非提升基础能力“RAG替代微调”二选一互补RAG注入知识微调提升能力“INT4量化损失大”不能用于生产多数场景质量损失可接受性价比极高“Prompt越长效果越好”越多上下文越好上下文过长反而可能Lost-in-the-Middle“Embedding维度越高越好”维度效果过高维度存在维度诅咒需Matryoshka等策略“Beam Search一定更好”贪心不如Beam开放任务Beam Search可能导致重复/无聊速查对照表编号主题一句话核心A1AttentionQK^T/√d_k方差缩放A2MHA代码投影→分头→attention→合并contiguous不可忘A3RLHFSFT→RM→PPOKL防Reward HackingA4MHA/MQA/GQAGQA平衡质量和KV-CacheA5DPORewardPolicy比值不需要RMA6ZeRO分片优化器→梯度→参数A7RoPE旋转矩阵→相对位置远程衰减A8并行DP/ZeRO/TP/PP/SP各适用场景A9KV Cache2×layers×heads×seq×dim×bytesA10Flash分块SRAM计算online softmaxA11RAGChunk→Embed→检索→Rerank→生成A12幻觉四类三检测RAG缓解A13JudgePosition/Self/Verbosity三大偏差B1Pre-LN梯度恒等项1B2ScalingChinchilla 1:20B3LoRAΔWBA, r8够用B4Paged虚拟内存分页管理KVB5Speculative小模型草稿大模型验证B6Prefill/Decode计算vs内存瓶颈B7数据污染n-gram/PPL/MIA检测B8安全防御六层纵深B9SwiGLU三矩阵门控8/3×dB10BenchmarkMMLU/GSM8K/HumanEval/ArenaB11数据生成Self-Instruct广度Evol深度B12Batching动态插入移除padding-free考前1小时流程0:00-0:15 第一梯队13题过一遍每题30秒口述 0:15-0:30 第二梯队12题过一遍每题1分钟口述 0:30-0:40 第三梯队10题过一遍每题30秒 0:40-0:50 回顾手撕代码Attention/KV Cache/LoRA 0:50-1:00 回顾场景设计题框架五步法关键原则想不起来的立刻标记考后重点复习不要在一个知识点上卡太久口述比默看有效10倍带追问的题目要能展开讲2-3分钟