ArXiv 论文追踪报告 — 2026年7月20日

📅 2026/7/21 14:03:03
ArXiv 论文追踪报告 — 2026年7月20日
数据来源:cs.AI(949篇) |cs.CL(398篇) |cs.CV(643篇) |cs.LG(863篇)追踪日期: 2026年7月20日周一覆盖 7月15日-7月20日 提交精选数量: 10 篇一、标签分布统计研究方向论文数量占比 LLM 基础与推理★★★30% Agent★★★30% 多模态与科学AI★★20%️ AI 安全与可解释性★★20%二、论文概览序号标题方向核心亮点1CRAFT: Clustering Rubrics to Diagnose Weak LLM CapabilitiesLLM 评估基于评分标准的层次化能力诊断 定向微调数据生成2Understanding Reasoning from Pretraining to Post-Training推理用国际象棋揭示预训练→RL 全流程推理机制3Verbalizable Representations Form a Global Workspace in LMs可解释性发现 LLM 中存在类似人类全局工作空间的意识表征4ToolVerse: Unlocking Massive Environments for Agentic RLAgent基于 400 MCP 协议构建大规模 Agent RL 训练环境5Knowledge-Centric Agents for Workflow GenerationAgentECCV 2026 — 知识驱动的 ComfyUI 工作流自动生成6DSWorld: A Data Science World ModelAgent数据科学世界模型Agent 训练加速 14-36 倍7S1-Omni: Unified Multimodal Reasoning for Science多模态统一 200 科学任务超越 GPT-5.5 和 Gemini-3.1-Pro8SciForge: AI-Native Multimodal Workbench for Scientific Discovery多模态AI 原生科学发现平台支持基因发现、蛋白质设计9Process Reward Informed Tree Rollout (PATR)推理/RL过程奖励引导的树展开SWE-Bench 提升 5.0 分10Harmonizing AI Safety ThresholdsAI 安全统一前沿 AI 公司的安全能力阈值方法论三、论文详细信息1. CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data作者: Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He链接:arXiv:2607.16122提交日期: 2026年7月17日中文摘要: 现有 LLM 评估大多只能指出模型在哪里出错而无法解释为什么出错。CRAFT 提出了一种将任意基于评分标准的评估数据集转化为模型能力诊断的方法从每个评分标准中提取能力描述聚类构建层次化能力树在树的各层级动态选择模型表现最弱的节点并据此生成定向监督微调数据。在金融和法律两个专业领域、4 个开源模型、13 个独立基准上的实验表明CRAFT 在金融领域全面领先在法律领域 4 个模型中有 3 个最优。创新点:首次将评估从样本级提升到评分标准级的能力诊断层次化能力树 动态节点选择精准定位模型弱项诊断结果直接驱动定向微调数据生成形成闭环2. Understanding Reasoning from Pretraining to Post-Training作者: Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov链接:arXiv:2607.16097提交日期: 2026年7月17日中文摘要: RL 后训练已成为提升 LLM 推理能力的核心手段但预训练与 RL 之间的关系仍不清楚。本文以国际象棋为受控实验平台系统研究了从 5M 到 1B 参数的完整预训练→SFT→RL 流程。核心发现(1) RL 后的性能可由预训练损失准确预测(2) RL 奖励曲线的斜率与预训练 token 数近似线性增长(3) RL 并非简单强化 SFT 策略——简单问题上放大已有正确走法困难问题上则浮现 SFT 阶段几乎不存在的正确走法。在数学领域文本上的验证实验也复现了相同规律。创新点:首次系统量化预训练与 RL 后训练之间的 scaling 关系揭示了 RL 在简单/困难问题上的差异化工作机制提供了可复现的推理科学研究实验平台3. Verbalizable Representations Form a Global Workspace in Language Models作者: Wes Gurnee, Nicholas Sofroniew, Adam Pearce 等 (Anthropic, 共16位作者)链接:arXiv:2607.15495提交日期: 2026年7月16日中文摘要: 本文提出了一个惊人的发现大语言模型内部存在类似人类全局工作空间Global Workspace的功能结构。通过一种新的可解释性技术Jacobian Lens作者识别出模型在任何处理时刻准备说出来的表征集合J-space。这些表征具有全局工作空间的特征属性可被报告、可被主动调用和保持、可用于静默推理的中间步骤、可传递给任意下游计算。在安全对齐审计中J-space 揭示了模型的策略性思考、评估意识和训练中植入的未对齐倾向——这些从未出现在模型输出中。作者还提出了反事实反思训练仅通过训练模型在被中断时的反思内容来改善行为。创新点:首次在 LLM 中发现与认知神经科学全局工作空间理论高度一致的功能结构Jacobian Lens 技术为模型内部思维提供了实用窗口反事实反思训练开辟了新的对齐范式4. ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning作者: Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, Feng Hong, Cao Liu, Ke Zeng链接:arXiv:2607.15660提交日期: 2026年7月17日中文摘要: LLM Agent 在紧凑场景中表现良好但在大规模、多样化、动态的真实环境中难以保持鲁棒性。ToolVerse 提出了一个大规模 Agent RL 框架自动从近 400 个真实 MCP 协议约 4500 个工具构建可执行训练环境基于工具依赖图设计长 horizon 任务生成策略GUST 数据集提出细粒度 Turn-Aware Relative Advantage 算法解决长 horizon 信用分配问题。实验表明该框架显著增强了 LLM 的长 horizon 工具使用能力。创新点:首次利用真实 MCP 协议大规模构建 Agent RL 环境工具依赖图驱动的长 horizon 任务自动生成Turn-Aware Relative Advantage 解决长序列信用分配5. Knowledge-Centric Agents for Workflow Generation作者: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu链接:arXiv:2607.15845会议:ECCV 2026提交日期: 2026年7月17日中文摘要: ComfyUI 等工作流生成系统不仅需要语法正确性还需要专家级的模块化组合推理。现有 LLM 方法将其视为直接的文本到 JSON 生成任务缺乏设计所需的结构化知识。本文提出知识中心框架通过知识反演从大量真实工作流中蒸馏层次化表示、知识注入监督微调教模型从任务描述推理策略、从策略推理可执行结构、可逆推理推理时合成可执行工作流并自我修正三步实现。实验表明该方法生成的 workflow 节点多样性更丰富、结构更连贯、执行成功率更高。创新点:知识反演→注入→推理的三阶段知识驱动框架层次化知识表示伪代码→骨架→高层策略ECCV 2026 接收面向实际视觉创作系统6. DSWorld: A Data Science World Model for Efficient Autonomous Agents作者: Zherui Yang, Fan Liu, Hao Liu链接:arXiv:2607.15901提交日期: 2026年7月17日中文摘要: 自主数据科学 Agent 严重依赖试错工作流计算成本高昂。本文首次提出数据科学世界模型概念通过预测环境状态转换来预判操作效果。DSWorld 框架结合结构化状态构建、成本感知路由、轻量级真实执行和基于 LLM 的昂贵操作模拟器。构建了 8K 规模的转换轨迹数据集并提出 Reflective World Model Optimization 错误感知强化学习策略。实验表明 DSWorld 将 RL-based Agent 训练加速约 14-36 倍。创新点:首次将世界模型概念引入数据科学 Agent 领域成本感知路由 LLM 模拟器的混合架构14-36 倍训练加速显著降低 Agent 训练成本7. S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation作者: Jiahao Zhao, Junyi Liu, Lifeng Xu 等 (22位作者)链接:arXiv:2607.15686提交日期: 2026年7月17日中文摘要: AI for Science 领域模型能力高度碎片化难以联合建模异构数据、科学定律和专家知识。S1-Omni 将科学理解、预测和生成统一到单一模型中。架构包含三大核心统一科学数据表示CIF、SMILES、蛋白质序列、光谱、科学图像映射到共享空间、自然世界知识对齐将科学定律和专家知识融入训练、任务特定解码支持属性预测、光谱到分子生成、蛋白质位点/结构预测、科学图像生成编辑。在 200 个科学任务、60 基准上训练评估超越 GPT-5.5 和 Gemini-3.1-Pro。创新点:首个统一 200 科学任务的多模态推理模型科学定律与专家知识的结构化融入在多数基准上超越 GPT-5.5 和 Gemini-3.1-Pro8. SciForge: An AI-Native, Multimodal Workbench for Scientific Discovery作者: SciForge Team (Zhangyang Gao, Minghao Fang 等 12位作者)链接:arXiv:2607.16038提交日期: 2026年7月17日中文摘要: 科研工作涉及论文、代码、数据集、科学文件格式、模型输出、图表、手稿和团队决策等异构产物通用 AI 助手难以将其作为连贯可审计的研究状态保存。SciForge 是一个多模态科研原生 AI 工作台围绕五大支柱构建目标范围科学决策治理、先翻译再推理的多模态输入、证据治理的可审计追溯、协作团队科学、真实应用场景。旗舰演示包括多日 Agent 科研冲刺基因发现、AI 引导的从头蛋白质设计、分子优化、基因组到 BGC 发现。系统开源。创新点:AI 原生的完整科研工作台而非简单的聊天助手Evidence-DAG 审计侧车确保科研可追溯性已在基因发现、蛋白质设计等真实场景验证9. Process Reward Informed Tree Rollout for Effective Multi-Turn RL (PATR)作者: Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang链接:arXiv:2607.15610提交日期: 2026年7月17日中文摘要: 现有 Agent RL 方法如 GRPO/RLOO依赖多个独立采样的完整轨迹进行优势估计在长 horizon 任务中浪费大量预算在无信息的死胡同尝试上。PATR 提出过程评分引导的自适应树展开框架使用任务适配的过程反馈对部分轨迹评分从有希望的状态选择性分支复用共享前缀保守停止退化路径。在 SWE-Bench 上提升 5.0 分在 FrozenLake 上提升 9.3 分证明了过程引导树展开是多轮 RL 的有效策略。创新点:将多轮 Agent 轨迹重构为树结构进行高效探索过程评分引导的选择性分支策略在 SWE-Bench 这一此前树展开 RL 方法未探索的基准上验证10. Harmonizing AI Safety Thresholds作者: Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey链接:arXiv:2607.16112提交日期: 2026年7月17日中文摘要: 前沿 AI 公司发布的能力阈值差异巨大第三方难以验证阈值是否被跨越或比较各公司的要求。缺乏共同最低阈值可能导致安全标准逐底竞争。本文开发了跨三个风险领域网络滥用、生物滥用、自动化 AI 研发的统一阈值推导方法论对滥用风险采用基于预期危害的显式风险建模方法对自动化 AI 研发则基于 AI 进展的观测速率。分析扩展了先前工作并指出了现有经验差距和局限性。创新点:首个系统化的跨公司 AI 安全阈值统一方法论区分滥用风险与自动化研发风险的不同建模方式为 AI 安全治理的标准化提供理论基础四、统计与分析维度详情顶会论文ECCV 2026 ×2 (Knowledge-Centric Agents, EgoExoMoCap)开源/可复现80% 提供代码或开源SciForge、ToolVerse、DSWorld、CRAFT、PATR、S1-Omni、Cura 1T、Verbalizable Representations涉及机构Anthropic、INSAIT、actAVA AI、多所高校热点趋势Agent RL 规模化、LLM 推理机制理解、AI4S 统一平台、AI 安全治理标准化 本报告由 AI 助手自动生成基于 ArXiv 公开论文摘要整理。论文质量评估仅供参考建议阅读原文获取完整信息。