腾讯科恩实验室 一面 四

📅 2026/8/26 17:49:47
腾讯科恩实验室 一面 四
目录一、DeepSeek-R1 的思维链CoT原理1.1 思维链到底是什么1.2 DeepSeek-R1 是怎么学会思考的1.3 思维链的本质三个关键特征1.4 信息论视角CoT 为什么有效1.5 架构支撑MoE 混合专家1.6 解码策略的严谨性1.7 GRPO思维链的锻造炉二、AI Agent 核心理解2.1 什么是 AI Agent2.2 核心公式Agent LLM 记忆 规划 工具2.3 现代 AI Agent 的三大关键能力2.4 Agent 的四种典型形态三、总结一、DeepSeek-R1 的思维链CoT原理1.1 思维链到底是什么思维链Chain of ThoughtCoT本质上是一种让模型把思考过程写下来的推理范式。它模仿人类解决复杂问题时的习惯——边写边想一步一步推导最终得出结论而不是在脑子里跳到答案。一个有趣的发现是早期研究者在训练大模型时意外观察到仅仅在提示词中加入一句请逐步思考Think step by step模型的准确率就出现了显著提升。这说明显式地把推理步骤展开本身就能改善模型的推理质量。1.2 DeepSeek-R1 是怎么学会思考的DeepSeek-R1对应 API 中的deepseek-reasoner在运用思维链时有一套清晰的训练路径先具备能力让模型拥有输出思维链的基本能力再强化训练通过人类反馈强化学习RLHF与基于规则的推理奖励Rule-Based Reward for Reasoning对模型进行强化自然涌现经过这样的训练模型在推理时就能自然而然地生成思维链并按照人类期望的方式思考和作答。1.3 思维链的本质三个关键特征1分步拆解将复杂问题分解为多个有序子问题像人类解题一样逐步推导2逻辑链条构建从问题到答案的连续推理路径每一步都以前一步的结论为基础保证逻辑的严密性3显式思考输出完整的思考过程被思考标签包裹让用户可见、可验证。1.4 信息论视角CoT 为什么有效从信息论的角度看CoT 在高复杂度的查询与答案之间建立了一条低熵通道。通过逐步分解每一步的条件概率都更加自然最终把原本跳跃式的结论转化为小步快走式的累积推导从而大幅降低了直接生成答案时的不确定性。1.5 架构支撑MoE 混合专家DeepSeek-R1 之所以用得起如此长的思维链离不开其底层的 MoEMixture of Experts混合专家架构采用256 个路由专家 1 个共享专家总参数671B但每次推理仅激活37B实现大模型能力、小模型开销专家选择每个 token 通过门控网络选择 8 个专家处理形成动态计算图注意力机制128 个注意力头分为 RoPE 与 NoPE 两部分提升长序列理解能力动态路由根据输入动态激活不同的专家组合形成个性化的推理路径。从推理流程上看模型可抽象为输入层 → 特征提取层 → 推理引擎层 → 输出层的分层结构融合符号逻辑与统计学习方法兼顾推理的严谨性与灵活性。1.6 解码策略的严谨性在思考模式下DeepSeek-R1 采用特殊的解码策略来保证推理的确定性低随机性将 temperature、top_p 等参数设为极低值甚至忽略避免蝴蝶效应导致推理偏离贪婪解码每一步都选择概率最高的 token保持逻辑一致性多路径生成通过束搜索beam search隐式生成多条路径最终选择得分最高的一条输出。1.7 GRPO思维链的锻造炉R1 没有走传统 RL 路线而是通过GRPO群体相对策略优化算法训练跳过 SFT 直接用纯强化学习激发推理能力摒弃 Critic 模型用组内相对优势估计替代价值函数减少约40%的显存占用奖励机制包含准确性奖励确保推理结果正确语言一致性奖励防止多语言混杂思考深度奖励鼓励生成完整推理链而非直接给答案KL 散度约束控制策略更新幅度防止模型遗忘已有知识将训练崩溃率从17% 降至 2%。二、AI Agent 核心理解2.1 什么是 AI AgentAI Agent人工智能代理是一种能够感知环境、自主决策并执行动作的智能实体。与传统 AI 系统不同Agent 不仅能回答问题还能主动完成一系列复杂任务。一个形象的比喻如果把大语言模型LLM比作一个超级大脑那么 AI Agent 就是给这个大脑装上了手脚和工具让它能够像人一样主动行动而不只是被动应答。传统 AI像个听话的工具你说跳它就跳一下AI Agent像个有主动性的助手你给个目标它自己规划怎么跳、跳多高。2.2 核心公式Agent LLM 记忆 规划 工具一个典型的 Agent 通常由四大核心组件构成大模型LLM提供语言理解、推理与生成能力是整个 Agent 的大脑任务规划Planning借助大模型对复杂任务进行分解、规划与调度并实时观察子任务执行结果、及时调整工具使用Tool Use根据决策结果执行具体动作与外部工具API、数据库、硬件设备等交互扩展能力边界相当于 Agent 的手脚记忆Memory存储经验与知识支持长期学习是 Agent 的存储器——既可以是短期记忆如单次任务中的多轮人机交互也可以是长期记忆如用户任务历史、个人信息与偏好。此外Agent 通常还需提供一个直观的入口可视化文字/语音输入或对外开放的 API方便用户下达指令、查看结果。2.3 现代 AI Agent 的三大关键能力1根据经验调整行为通过上下文学习In-Context Learning、记忆重要经验、从反馈中学习2使用工具搜索引擎获取实时信息、代码执行器编写并运行程序、API 调用与其他服务交互、数据库查询检索信息3规划能力任务分解、路径规划、资源分配、错误处理。2.4 Agent 的四种典型形态形态说明代表Reflection反思模式通过模型自身反思来改进任务执行ReAct、Self-Refine、RefineTool Use工具调用模型调用外部工具或库来解决问题——Planning规划模式提前计划与组织步骤提升效率与准确率——Multi-Agent Collaboration多智能体协作多个智能体协作提升任务执行能力A2A 协议三、总结思维链CoT与 AI Agent分别对应了大模型能力的两个关键维度想得更深与做得更多。前者通过显式推理 强化学习GRPO MoE 架构让模型在复杂问题上给出更可靠、可验证的答案后者通过LLM 记忆 规划 工具的组合让模型从会回答进化到会行动。对于准备大模型岗位面试的同学建议把这两块的原理、训练方法、架构细节都梳理清楚——它们既是技术热点也是面试官最爱深挖的连环追问考点。