登至第一,端到端论文生成系统来了!

📅 2026/8/24 14:10:38
登至第一,端到端论文生成系统来了!
AI科技圈最近一周又发生了啥新鲜事OpenAI开源Codex Agent运行框架该框架核心为Harness执行系统负责管理对话状态、流式执行、工具调用、沙箱与审批策略并通过Codex app-server以客户端协议暴露能力。开发者可按场景选择集成方式codex exec适合脚本和CI任务Codex SDK支持程序化启停和流式任务Codex app-server则面向需要持久对话、事件流和审批处理的产品级应用。实际落地案例中Thrive Holdings与Crete将其用于税务准备流程试点处理7000份申报准备时间缩短约三分之一Cisco在Cloud Control的App Builder中集成Codex SDKGitHub和JetBrains则将Codex引入IDE工作流https://developers.openai.com/blog/codex-as-a-platformDeepSeek调整周末API计费为全天谷价DeepSeek宣布自8月23日起调整峰谷计费规则周末全天不再区分峰谷时段统一按低谷时段价格收费。此前V4-Flash和V4-Pro API已实行峰谷计费高峰时段价格为低峰两倍。此举对开发者构成利好可降低周末批量任务成本但也引发对职场考勤可能随算力成本波动的讨论已有短剧制作团队和程序员群体为节约Token成本而调整工作时段https://mp.weixin.qq.com/s/OWvEG7c9N2l6kinMgyAk1A小米新一代人形机器人亮相2026世界机器人博览会小米新一代人形机器人身高约1.70米、体重约66公斤全身拥有66个自由度且半数集中于手部。该机器人由大模型驱动能够自主理解现场交互指令与实时场景并独立完成操作在现场演示中完成了抓取香片、撒花、递送以及握手、碰拳、比心等流畅互动。该机器人目前仍处于样机阶段https://www.ithome.com/0/991/747.htm千问推出GUI智能体基座模型Qwen-UI-AgentQwen-UI-Agent是一个以真实世界为中心的GUI智能体基座模型覆盖移动端、电脑端、网页端及深度搜索环境。在移动端MobileWorld基准上达到82.1%的成绩领先对比模型8.9至14.6个百分点真机基准MobileWorld-Real得分92.2%电脑端OSWorld-Verified为79.5%WebArena达73.6%位列第一ScreenSpot-Pro等5个GUI定位基准全部刷新SOTA。该模型支持GUI与CLI混合动作空间及批量操作通过超100步长轨迹的在线强化学习与约10000个并发环境训练并构建了覆盖100多台真实手机与150多个应用的真机环境。模型将安全判断贯穿执行全程可拒绝高风险请求并在敏感操作前主动停手请求确认https://mp.weixin.qq.com/s/xjKcjN2W82eNcb0lSrP6yQMiniMax推出多模态内容创作产品MiniMax DesignMiniMax Design是一款将多模态模型能力转化为生产力的产品基于原生多模态视频模型H3构建能够理解用户创作目标、拆解任务并调用相应模型与技能完成从素材处理到最终交付的完整流程。该产品将创作与修改从像素级操作提升至语义层面用户通过自然语言表达意图即可驱动系统完成生成与编辑并支持理解项目级别的复杂上下文。MiniMax Design擅长处理商业内容任务如广告创意批量迭代、知识视频制作及PV/MV创作等同时提供3D导演台用于分镜预览并支持接入ComfyUI等开源工作流https://mp.weixin.qq.com/s/vMmhr2rCeBC_dM_tBdks1ADeepSeek发布Harness框架RC.8版本RC.8版本重点增强了多模态能力使模型适配器支持原生图片请求核心命令支持图文混合输入并允许通过菜单引用本地文件与历史会话。该版本将Claude Code和Codex作为可安装的Profile Bundle纳入子代理调用体系使其成为Agent工作流中可调用的组件。工具调用方面支持web_search并发查询与子代理结果主动反馈Windows终端获得持久化PowerShell会话支持同时修复了图片载荷、流式生成及API兼容性等多处问题https://github.com/deepseek-ai/deepseek-harness/releases#en-v0.1.0-rc.8扣子推出桌面端扣子桌面端让智能体从网页走进本地电脑在用户授权后可读写本地文件、执行Python或Node.js脚本及Git操作并能处理视频压缩与格式转换等任务。桌面端支持深度截图功能可将画面及界面信息自动传入对话框。扣子云盘作为统一文件空间让资料在多个智能体、人与智能体以及多台电脑之间实现同步与协作。用户通过手机App还可远程调用桌面端已授权的本地文件执行任务https://mp.weixin.qq.com/s/9Kods-auxnMj__emtsZSCQCursor推出Origin代码托管服务Cursor推出的Origin代码托管服务已向所有付费方案用户开放早期Beta版提供代码仓库管理、PR协作、代码浏览及GitHub双向同步等核心功能。已同步的GitHub仓库支持实时更新PR评论可在Cursor与GitHub之间双向同步。该服务将代码、PR与智能体功能整合于同一平台并已集成Vercel、Depot和Buildkite等应用支持预览部署与CI/CD工作流https://cursor.com/cn/changelog/origin-code-hosting研究人员推出端到端论文生成系统Spark-to-Paper研究人员推出的Spark-to-Paper系统以13个可组合技能的形式运行在现有编程助手内部能够从研究想法出发自动完成文献检索、实验设计、实验执行、论文写作、证据驱动的结论修订及可编辑论文图生成最终输出完整LaTeX项目。在8个受控研究课题上该系统引文有效率达99.5%图形元素可编辑率达96.4%对36条人为注入的假结论检出率从单遍生成的14%提升至92%对抗式评审精确率达74%。系统平均每篇论文使用11.9M token成本8.1美元耗时3.2小时https://github.com/Spark-To-Paper-Skills/spark-to-paper-skills昆仑万维发布AI音乐生成模型Mureka V9.5Mureka V9.5基于MusiCoT音乐思维链框架构建在编配、人声与情绪表达上追求克制与自然。该模型的人声表现良品率达61.0%控制良品率与曲风完全体现比例分别为97.0%和95.7%在国风演绎上实现了更精准的咬字发音与更具层次的和声编排。此次升级源自对超过2.5万份用户反馈的收集与响应使AI音乐从“能生成”跨越至“值得反复聆听”的阶段https://mp.weixin.qq.com/s/YSm_YXYMXvQ6gbDwwHePww阿里巴巴上线Qwen-Audio-3.0系列语音模型阿里巴巴正式推出自研Qwen-Audio-3.0系列语音模型并通过千问AI平台提供API服务。该系列包含语音识别模型Qwen-Audio-3.0-ASR、语音合成模型Qwen-Audio-3.0-TTS以及实时语音交互对话模型Qwen-Audio-3.0-Realtime在Artificial Analysis今年7月的语音评测中包揽三个赛道全球第一https://mp.weixin.qq.com/s/yb4-PDno5NaacES9RfxIEA