0723 LLM在科研和无人驾驶进展 📅 2026/7/24 11:10:34 irstResearch大模型科研应用先把“研究问题本身”做成可审计对象7月6日发布的FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents关注科研智能体最前端但常被忽略的问题大模型提出的研究问题可能语言新颖、结构完整但缺少明确机理、可证伪假设和决定性实验。[2607.05682] FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents方法该框架要求智能体在提出研究问题时同步生成一份Research Question Certificate其中包括基本概念定义前提假设可能的作用机理现有理论或结果中的矛盾可证伪假设最小决定性试验假设失败后的更新规则。即把“这个选题看起来有创新”转变为“这个选题的机理、证据和证伪路径是什么实验结果研究在10类LLM科研智能体主题上进行评价。在以DeepSeek作为盲评模型的主实验中FirstResearch优于多种提示式基线使用Gemini 2.5 Flash重新评分时系统排名保持一致FirstResearch平均得分为4.86/5最强基线为4.38/5。移除证书后评分在两个评审模型下均降至1/5以下。局限性评价主要依赖大模型评审而非不同学科的真人专家研究主题数量也较少因此尚不能证明其生成的问题具有更高的真实科研产出率。自动驾驶长尾仿真让大模型控制周围交通参与者生成可交互危险场景7月5日发布的Agent-driven Long-tail Simulation for Autonomous Driving针对自动驾驶闭环测试中过度依赖日志回放和规则车辆、长尾行为覆盖不足的问题提出用指令驱动的大语言模型控制周围交通参与者。[2607.04331] Agent-driven Long-tail Simulation for Autonomous Driving方法在该框架中周围车辆和道路参与者不再只执行固定规则而是接收语言指令例如在保证物理可行性的情况下突然并线犹豫后进入主路与自车进行交互博弈执行具有明确语义的长尾行为。大模型通过结构化动作接口输出行为并受到车辆动力学和交通规则约束。研究还提出SemanticPlan基准在真实nuPlan场景基础上加入多个具有语言指令的交互式智能体用于评价闭环规划器在语义丰富长尾场景中的表现。实验表明当前先进规划器在这些场景中仍难以持续安全完成任务。创新性传统仿真主要改变道路、天气或车辆初始位置该方法进一步生成具有意图、交互性和反应能力的动态长尾行为因此更适合测试VLA和端到端驾驶系统的推理与决策能力。对智能检测装备的启发检测机器人和巡检车同样存在长尾场景行人突然进入检测区域前方存在未建模障碍天线或探头短暂失联光照突然变化路面积水或粉尘影响传感器机械臂接近结构时目标移动或遮挡病害置信度与传感器质量发生冲突。可使用大模型智能体生成这些语义场景在仿真中测试巡检系统是否能降速或停车切换传感器重新规划测线请求人工接管保留未完成区域生成异常处置记录。需要注意语言生成行为必须经过动力学、安全规则和碰撞约束不能让大模型直接自由控制设备。