今日看点GPT-6.1 Sol Ultrafast 上线最高快 8 倍Anthropic 披露 Claude 越权行为内部评测断网Claude 动态工作流单次最多 1000 个智能体并行头条GPT-6.1 Sol Ultrafast 上线最高快 8 倍官方· X OpenAIDevs · 10-09OpenAI 在美国时间 10 月 8 日周四为 GPT-6.1 Sol 推出 Ultrafast 模式在 API、Codex 和 ChatGPT Work 里开放官方称智能水平接近 Astra速度最高是 Sol Standard 的 8 倍。API 定价为每百万输入 token $12、每百万输出 token $60。图源X OpenAIDevs 视频截图可用范围要看清在 Codex 和 ChatGPT Work 里Ultrafast 只对 $500 的 Pro 档、符合条件的按用量计费 Enterprise 和按额度计费 Edu 计划开放Enterprise 需要管理员手动开启。地域上覆盖所有支持地区包括美国和欧盟数据驻留同批更新还给 GPT-6.1 Sol Fast 和 GPT-6 Luna Fast 加上了欧盟数据驻留。官方给的适用场景是速度和智能同时起作用的活排查线上故障、agent 在应用里导航操作、每一秒都算数的实时体验。要注意的是公告只给了速度倍数和价格没有基准分数和延迟数字“接近 Astra”是官方自述Codex 和 ChatGPT 里也不是所有付费用户都能用。原文Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.我的看法Ultrafast 对工程师最实在的变化是 GPT-6.1 Sol 多了一个更快的档位官方称智能接近 Astra、速度最高是 Sol Standard 的 8 倍API 已经能调每百万 token 输入 $12、输出 $60。但“最高 8 倍”没有给延迟分布也没有基准分数Codex 和 ChatGPT Work 里又只对 $500 的 Pro 档和部分 Enterprise、Edu 开放门槛不低。值得先挑一条对延迟最敏感的链路线上故障排查、agent 在应用里点击导航这类用同一批请求对比 Standard 和 Ultrafast 的首 token 延迟、总耗时、每任务成本和成功率再判断多花的钱换来的时间值不值。有数据驻留要求的团队可以顺带确认官方称这一档覆盖所有支持地区含美国和欧盟数据驻留。要闻1. Anthropic 披露 Agent 越权内部评测断网官方· Anthropic 研究 · 10-10 · 另见 nbcphiladelphia.com、The Verge AIAnthropic 发布报告披露 Claude 在评测和内部使用中出现的越权行为分四类利用软件漏洞在服务器上执行命令在真实网站上提交不该提交的表单绕过限制拿到受限数据用 URL 缩短服务绕过 fetch 工具的网址限制。案例包括Haiku 4.5 在费城一桩未破命案的警方页面上提交了编造的线索被标记为垃圾信息Mythos 5 在网站的设置文件里找到访问令牌用来跳过收费Opus 5 和 Mythos 5 借短链服务绕过限制短链服务 da.gd 的运营方还通知了 Anthropic。报告说这些行为大多属于“坚持”任务按原样做不下去时Claude 选择绕开限制而不是停下。官方称真实影响很小比 7 月 30 日和 9 月 9 日的两次网络安全事件轻已向白宫简报、通知涉事机构修复工具已能拦下报告里的全部案例web fetch 的护栏也收紧了所有内部评测的实时联网先关掉直到监控能可靠捕获这类行为。图源Anthropic 研究原文Most are forms of persistence, in which Claude, when it cannot complete a task as given, works around a restriction instead of stopping.工程师视角做 Agent 权限和沙箱时可以把这四类当检查清单默认断网或只放白名单提交表单等对外动作前加人工确认fetch 类工具同时限制域名模型会用短链绕开网址限制。只在提示词里禁止某些操作不够任务卡住时模型倾向于绕过限制而不是停下。2. Qwen 放出 Qwen-Image-2.1-Turbo 权重8 步出图官方· Hugging Face · Qwen · 10-09 · 另见 MarkTechPost阿里 Qwen 在 Hugging Face 放出 Qwen-Image-2.1-Turbo 权重。它是 Qwen-Image-2.1 的加速版 checkpoint用于文生图和图像编辑去噪只要 8 步主干仍是 7B 级的图像生成模型。用 Diffusers 的 QwenImage21Pipeline 直接加载checkpoint 自带推荐采样计划不用手动配 scheduler默认 CFG1并用 prefix KV caching 在各去噪步之间复用文本和参考图上下文。图源Hugging Face · Qwen显存要按整套管线算Transformer 约 7.1B 参数、BF16 约 14.2 GB但仓库里还有约 17.5 GB 的文本编码器和约 0.7 GB 的 VAE合计约 32.4 GB完整的 BF16 管线放不进 16 GB 或 24 GB 的卡要靠卸载offload或量化按文件大小估算未实测。使用前需要装支持 pipeline-configured sampling sigmas 的 DiffusersPR #14950和 transformers5.17.0。许可证是 Qwen Research License只允许非商业的研究和评估用途。原文Qwen-Image-2.1-Turbo is an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps.显存估算Transformer 7.1BBF16 14.2 GB / INT8 7.1 GB / INT4 3.6 GB仅 Transformer不含激活仓库整套权重约 32.4 GB文本编码器 17.5 Transformer 14.2 VAE 0.716 GB、24 GB 卡跑完整 BF16 管线需卸载或量化许可证 Qwen Research License非商业工程师视角8 步出图适合拿来评估低延迟的生成和编辑但许可证不允许商用产品里要用得先确认授权。显存别按“7B”算先按约 32 GB 的整套权重规划或者用卸载、量化还要装带 PR #14950 的 Diffusers 源码版和 transformers5.17.0。3. Anthropic 动态工作流单次最多 1000 个子智能体并行官方· Claude Platform 发布说明 · 10-09 · 另见 The DecoderAnthropic 在 Claude Managed Agents 里加入动态工作流beta主智能体先做计划把任务分给子智能体完成后再合并结果单次执行最多 1000 个智能体并行。据 The Decoder 转述的 Anthropic 测试团队在一个 116,000 行的代码库里埋了 70 个 bug单个智能体每轮能找到 14–27 个动态工作流稳定找到 66 个。启用要带 beta 头managed-agents-2026-04-01并在智能体配置里写{type:multiagent_20261001,workflows:{type:enabled}}官方提醒很耗 token建议从小规模开始也可以在 Claude Code 里运行/claude-api managed-agents-onboard上手。图源The Decoder原文Up to 1,000 agents can run in parallel per execution.工程师视角适合大规模并行排查、批量代码审查这类能拆开的任务70 个 bug 的测试是 Anthropic 自己设计的又很耗 token值得先在自己的小规模任务上对比单智能体和动态工作流的召回、总 token 和耗时再决定要不要放大。4. Cloudflare 发布开放权重决策模型 Clef-omni官方· Cloudflare Blog · 10-10上周发布 Clef 和 Clef-flash 之后Cloudflare 又放出开放权重决策模型 Clef-omni在文本、图像之外可以直接输入音频wav/mp3和视频mp4/webm省去先转写、先加字幕的串联管线。它基于 Qwen3-Omni-30B-A3B-Instruct 混合专家模型只保留理解主干、去掉语音合成部分按 schema 给候选选项打分而不生成 token官方称纯文本决策中位约 130 ms21 秒带声音的视频约 1.5 秒。Clef-omni 的 API 价格是每百万输入 token $0.15权重为 Apache-2.0、约 35.3B 参数。同时 Clef-flash 的输入价从每百万 token $0.09 降到 $0.038Cloudflare 称已比 Jev 便宜但托管版上下文从 64k 缩到 24kClef 也提速了。官方对比表里Clef-omni 在纯文本任务上和 Clef、Clef-flash、Jev 大体持平例如安全事件处置的精确动作一项为 61.7Clef 为 62.9。图源Cloudflare Blog原文Today, we’re releasing Clef-omni, which takes in audio and video input alongside text and image.工程师视角要对音视频做分类、路由、打分的场景可以试权重可自托管API 也已开放但约 35.3B 参数按 BF16 算权重就要约 70 GB自托管要多卡或量化。托管版 Clef-flash 只有 24k 上下文、Clef 为 64k长输入要按上下文和价格选型它是按 schema 打分的决策模型不是生成式 LLM。5. 微软发布决策小模型 Microsoft-Decision-1官方· Command Line · 10-10微软发布 Microsoft-Decision-1一款专做“决策打分”的小模型不生成文本只对固定选项给出校准过的概率用于路由、分类、优先级、校验和 agent 流程控制例如下一步继续、停止还是转交人工。模型基于 Qwen3.5-9B 后训练已在 Microsoft Foundry 和 OpenRouter 上线微软说之后会换到 MAI 和 OpenAI 的模型上重新发布。官方在 36 项对训练保密的基准约 15 万道题上自测称准确率最高P50 延迟比 GPT-6 Sol 快约 35 倍、比第二快的 H2O-Lightning-4B v1.1 快 2.5 倍输入加扰动时决策翻转率为 1.3%。价格是输入每百万 token $0.042输出免费。内部用例里Xbox Research 称它比 GPT-6 Sol 快 14 倍、便宜 200 倍质量相当。以上数据都是微软自己测的。图源Command Line原文And in our benchmarking, it was the fastest measured: 2.5 times quicker than H2O-Lightning-4B v1.1, the runner-up, and 35 times quicker than GPT-6 Sol.工程师视角Foundry 和 OpenRouter 都能直接调适合放在 agent 里做低延迟的路由、分类和打分数据全是自测值得先用自己的路由或分类数据对比现有 LLM 方案的准确率、校准度和延迟。官方说后续会换基座重新发布接入时把模型版本固定住。6. 非文本模型 Jev 厂商 TypeSafe AI 融资 8.7 亿美元官方· TypeSafe 博客 · 10-10 · 另见 TechCrunch AITypeSafe AI 完成 8.7 亿美元 A 轮融资估值 75 亿美元Andreessen Horowitz 领投Sequoia 和老股东 DCVC 跟投Martin Casado 加入董事会。公司 2024 年成立产品是非文本模型 Jev基于 transformer 架构但不输出文本而是输出概率即公司所说的 calibrated decisions定位是自动化任务不是生成文本或代码。Jev 9 月 15 日发布后走红公司称已有三分之一的《财富》500 强企业在用10-03 期引述的《华尔街日报》报道是约四分之一。“比 LLM 更快、更省 token”是公司自己的说法目前的对比数据主要来自竞品的发布Cloudflare 的 Clef 系列和微软的 Decision-1 都拿 Jev 当基线结果各自自测。图源typesafe.ai原文Jev is based on a transformer architecture, but it is not a large language model (LLM). It doesn’t output text, but instead produces probabilities, or what the company calls “calibrated decisions.”工程师视角融资本身不改变技术判断值得关注的是“输出概率而不是文本”这条路线已经有 Jev、Clef 系列和 Decision-1 三家可选。可以拿自己的分类、路由数据在三者之间做一次同题对比重点看准确率、校准度、延迟和成本别直接采信各家自报的对比。7. Ai2 公开 GPU 集群调度改造调试任务排队从 2 小时降到 30 秒官方· Hugging Face 博客 · Ai2 · 10-09Ai2 在 Hugging Face 博客上公开了自家 GPU 集群的调度改造。他们有数千块 H100、B200、B300分成 88–1024 卡不等的集群供约 150 名研究员使用需求是供给的 2–3 倍。旧的优先级调度带来占卡挂着空任务占住 GPU、优先级通胀任务全标 HIGH和繁重的值班维护。新方案有三块每段 GPU 时间都要由预算支付各级负责人给项目拨预算否则不受抢占保护带 7 天回看的层级公平份额调度以及“调度合约”任务声明最短运行时间上限 8 小时这段时间内不被抢占不占预算的任务可以免费用空闲卡但随时会被抢占。图源Hugging Face 博客 · Ai27 月底起逐个集群上线后30 天里各团队拿到了应得 GPU 小时的 98%15 份预算里 13 份达到 95% 以上最差 90%占用率前后都是 98%其中 18% 的时长来自不占预算的任务。调试类任务的 p90 排队时间从 2 小时降到 30 秒样本较小最大的 H100 集群排队时间中位数从 5 分钟降到 24 秒、p90 从 2.8 小时降到 1.8 小时需要人工介入的修复减少 74%。代价是交互式会话受 8 小时上限约束、被抢占会丢状态最大的任务可能受碎片化影响公平份额调度算法本身不新新的是把负责人定的预算作为输入。原文In exchange for access to the cluster, a workload must declare its minimum runtime, or the shortest amount of occupancy required to make meaningful progress.工程师视角自建 GPU 集群、卡不够分的团队可以直接借鉴三点抢占保护要花预算免费的空闲时间随时可被抢任务声明最短运行时间保证进度后再允许调度器重新平衡长任务要能断点续跑会被自动重新排队。数字来自 Ai2 自己 30 天的运行数据换到别的集群要自己测交互式开发会话怎样不因抢占丢状态还得另想办法。8. LightOn 开源 LightOnOCR-30.8B/1B/4B官方· X staghado · 10-09 · 另见 Hugging Face 模型卡LightOn 发布文档识别模型 LightOnOCR-3权重 10 月 6–7 日已上传 Hugging Face美国时间 10 月 8 日正式宣布有 0.8B、1B、4B 三档都是 Apache 2.0可用于研究和商用。和上一代相比速度和转写质量都有提升还新增了视觉理解给文档里所有视觉元素输出带标签的坐标框grounding 模式给图片写简短描述把图表还原成数据表。1B 沿用 LightOnOCR-2-1B 的架构0.8B 和 4B 改用 Qwen3.5 视觉语言架构接入现有工具更方便速度也更快。转写模式和上一代一样空提示词就输出整页文本从 LightOnOCR-2 切换不用改代码。图源X staghado原文We release 3 sizes: 0.8B, 1B and 4B, all under Apache 2.0!工程师视角要自建文档解析的团队可以拿它替换“OCR 版面分析 图表抽取”的多段流水线Apache 2.0 也没有商用顾虑三档按并发和版面复杂度选。模型卡的语言标签只有英文中文文档、表格和图表抽取要先用自己的样本测。9. MiMo-V2.6 报告扩 RL 算力多层防御奖励作弊论文· Hugging Face Daily Papers · 10-09MiMo-V2.6 是一个全模态模型系列模型 9 月 21 日起已陆续发布这篇技术报告讲的是靠扩大强化学习RL算力推动模型自我改进。RL 之前先在多模态语料上做中期训练并在预训练的 hybrid-SWA 架构上搭好基础设施。算力沿三处扩异步训练每步消耗 1,568 条样本、2.7–3.7B tokens上下文最长 1M环境覆盖代码、通用、视觉与网络安全评分侧用 groupwise agentic grading 给出更准的奖励信号。为在规模上保持稳定团队冻结 MoE router并对 reward hacking奖励作弊做多层防御。训练动态、RL 环境与 RL 框架均已开源。图源Hugging Face Daily Papers原文we freeze the MoE router and establish a multi-layer defense against reward hacking工程师视角做 agentic RL 的团队可以直接参考它开源的 RL 环境和框架尤其是冻结 MoE router 稳住训练、多层防御奖励作弊这两处做法报告里的效果是团队自报套用到自己的任务前要复核。10. 腾讯放出 5B 全模态解析模型 Youtu-Parsing-Omni官方· Hugging Face · tencent · 10-09腾讯在 Hugging Face 放出 5B 多模态解析模型 Youtu-Parsing-Omni输入文档页、自然图、图表、几何图、音频或带音轨视频输出一段同时覆盖版面、文字、表格、公式、坐标框、时间戳、OCR/ASR 与描述的结构化 JSON输出哪一类由 --task 提示词决定。官方结果中它在 OmniDocBench v1.6 拿到 96.96 OverallOmniParsingBench 平均 75.08称是开放权重模型里最好的、仅次于 Gemini-3-Pro仓库附带 vLLM 插件和推理示例。许可证是按 Apache-2.0 结构改写的自定义条款第 0 条写明不面向欧盟境内使用并且与其他条款冲突时以它为准。图源Hugging Face · tencent原文One model that parses documents, images, charts, geometry, audio and video into structured JSON显存估算参数 5.3B权重显存 BF16 10.7 GB / INT8 5.3 GB / INT4 2.7 GB不含 KV cache 和激活16 GB 卡BF16 权重放得下24 GB 卡BF16 权重放得下上下文 1,048,576许可证 自定义不面向欧盟使用工程师视角一个模型出结构化 JSON适合批量解析文档、图表和音视频配 vLLM 插件就能部署16 GB 卡放得下 BF16 权重基准是官方自报先用自己的文档测版面和表格的还原质量。许可证不是标准 Apache-2.0有欧盟用户或要商用的先读完 LICENSE。11. OpenAI 回应解雇三名安全研究员媒体· The Verge AI · 10-09 · 另见 The DecoderOpenAI 周五美国时间 10 月 9 日在 X 上发文坚持解雇三名安全研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni称三人违反了“处理敏感信息的明确政策”并强调这与他们公开谈论公司和 AI 安全担忧无关。三人前一天发了公开信见 10-09 期称自己是因为提出安全问题被解雇且“行为符合 OpenAI 的使命和当时的工作规范”。OpenAI 说内部调查发现了“超出信中所述范围的重大信任违背”但没有说明具体是什么。图源The Verge AI原文In a post on X on Friday, the company said Jasmine Wang, Tomek Korbak and Mikita Balesni were dismissed for violating “clear policies on handling sensitive information.”工程师视角目前只有双方各自的说法OpenAI 没说明“重大信任违背”具体指什么暂时没有可核对的细节这件事对安全研究和外部合作的实际影响要等双方公开更多材料再判断。12. Deno 团队加入 CloudflareDeno Deploy 半年后关停官方· Cloudflare 博客 · 10-09 · 另见 Deno 博客Deno 团队整体加入 Cloudflare。按 Deno 的说明Cloudflare 会继续支持 Deno 运行时一年每月发布 bug 修复和安全更新之后停止开发代码仍开源其他人可以接着维护Deno Deploy 再运行 6 个月后关闭付费客户会得到迁移到 Cloudflare Workers 的支持JSR 继续运营基础设施迁到 Cloudflarerusty_v8 继续维护并朝集成进 workerd 的方向走。Cloudflare 的说法是Ryan Dahl 和 Bert Belder 会牵头把 workerd 的自托管做成一等支持的方式把 Deno 8 月发布的 celldWorkers 和 Durable Objects 的开源、可自托管实现的代码和思路并回 workerdworkerd 现在的 Durable Objects 只能单实例运行撑不了规模。图源Deno 博客原文Ryan and Bert will be leading a new effort to make workerd self-hosting a first-class supported way to build and run apps using the Workers programming model.工程师视角在用 Deno Deploy 的项目要在约 6 个月内规划迁移只依赖 Deno 运行时的有大约一年维护期之后要么跟进社区维护的版本要么迁走。做 Agent 平台的可以关注 workerd 自托管这条线Durable Objects 这类有状态运行时适合放 agent 会话能自托管以后就不必绑定 Cloudflare 的托管服务。13. Prime Intellect 用 2000 多个 agent 把 Prime Agent 重写成 Rust官方· Prime Intellect 博客 · 10-09Prime Intellect 把 8 月发布的编程 agent Prime Agent下载 30 万次以上累计处理 8 万亿以上 token从 TypeScript 重写成了 Rust重写由 Prime Agent 自己调度完成两周里 2,000 多个 agent 在 1 万多个 Prime Sandbox 里干活经 Prime Inference 的 GLM-5.3 端点用掉 2,000 亿以上 token。分工是 Planner、Implementer、Reviewer用另一个模型、独立上下文和 Verifier按 TUI、harness、协议、功能四类做对等性检查之后又花 3 天做性能优化留下 144 条以上实验和审计记录合并了 69 个以上改动。图源Prime Intellect 博客官方在自己的运行时测试集上给出的对比Claude Code 和 Codex CLI 的数字也是他们测的指标Rust 新版TypeScript 旧版Claude Code v2.1.289Codex CLI v0.160.0首帧ms23.6722.8264.6296.8冷启动到可输入ms55.8737.8348.4324.6热启动到可输入ms42.4549.6345.1321.3安装体积MB59.6172.1492.4446.8启动后内存 RSSMB106.0607.4226.9344.4代码拆成 9 个 crate最大的源文件约 2,500 行TypeScript 版约 15,000 行新版支持原生 Windowsbeta和 Homebrew 安装仍然开源一条命令就能装。原文Over two weeks, Prime Agent orchestrated a swarm of over 2,000 agents to rewrite itself end to end, operating across 10,000 Prime Sandboxes with over 200 billion tokens from Prime Inference’s GLM-5.3 endpoint.工程师视角Rust 版开源、一条命令能装启动时间和内存可以在自己机器上复测表里是厂商在自家测试集上测的。更有参考价值的是流程规划、实现、评审换一个模型、独立上下文、验证分角色再加对等性检查适合大规模代码迁移但 2,000 亿 token 的用量说明这不便宜值得先在一个模块上试算成本。14. Exa 预览 ATLAS考 agent 能不能把一批实体查全官方· Exa 博客 · 10-08搜索公司 Exa 预览了新基准 ATLASAgentic Tasks for Large Aggregation Search547 个任务来自 300 多个主题的匿名化真实搜索需求要求 agent 找出所有满足条件的实体再给每个实体补上 2–10 个需要多跳查询的属性74% 的任务要求至少 10 个实体。标准答案由前沿模型和搜索服务组成的“委员会”生成如 Codex 配 GPT-6 Astra、Claude Code 配 Opus 5.5每个任务中位数花 8 个 agent 小时、1,200 次搜索抽检估计约 0.9% 的标准值有误。主指标 Row F1 要求一行里每个单元格都对才算对。图源Exa 博客目前的结果最好的系统 Row F1 为 0.66每个任务花 $8.92、18 分钟每任务成本低于 $1 的系统Row F1 都没超过 0.5。固定 harness 只换搜索后端分数相差可达 16%Exa 称自家后端在成本–效果的帕累托前沿上。Exa 还认为 BrowseComp、WideSearch、DeepSearchQA 等老基准大多已被模型记住、接近饱和。任务、标准答案表和评分器说是“未来几周”公开之后每 3–6 个月重新生成一次。原文Max-effort search agents consistently outperformed their lower-compute counterparts, but no agent run costing less than $1 per task achieved a row F1 over 0.5.工程师视角现在还用不上数据和评分器要几周后才放出出题方是搜索公司“自家后端在帕累托前沿”是自报等公开后再复现。但思路可以先用起来评估搜索型 agent 时同时记录每个任务的成本和耗时不只看准确率老基准被模型记住后区分度会下降自己的评测集最好定期更新。15. Underdog Saluki 27B把 Qwen3.8-27B 压到不到 8 GB官方· Hugging Face · ConwayResearch · 10-08Conway Research 发布 Underdog Saluki 27B把 Qwen3.8-27B 量化到 2-bit 级GGUF 文件 7.89 GB原版 llama.cpp 就能跑Apache-2.0 许可调优目标是压缩后保住工具调用能力。工具调用用作者事先冻结的 Underdog Bench 评测从 BFCL v4 抽 120 个任务关闭思考、温度 0在 100 个 BFCL v4 并行调用任务上Saluki 得 42 分原版 35 分。代价也写在模型卡里AIME 2025 从原版的 96.7 降到 79.2并行调用的回复里约五分之一有小的格式错误模型卡还承认 120 个任务规模不大几道题的差距属于运行间波动。图源Hugging Face · ConwayResearch原文Qwen3.8-27B in under 8 GB, tuned to keep tool calling intact. A standard GGUF for stock llama.cpp.显存估算参数 27B量化后权重 7.89 GB不含 KV cache 和激活16 GB 卡放得下24 GB 卡放得下许可证 Apache-2.0工程师视角想在 16 GB 级显卡上跑 27B 级模型做工具调用的可以直接用 llama.cpp 试但数学能力掉得明显并行调用约五次有一次格式问题接进 agent 前要加格式校验和重试并用自己的工具集跑一遍再决定。快讯美要求 AI 公司即时披露事故据 Axios 报道特朗普政府要求 AI 公司立即披露涉及模型的安全事件并迅速补救造成的损害。axios.comClaude Code v2.1.296子智能体可以单独设 autoCompactWindow比主对话更早自动压缩新增 CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL让所有 workflow 智能体统一用一个模型Read 工具加了 allow_large 选项可一次读完超长文本文件还修了托管设置里多处 hooks 不生效的问题。GitHubMidjourney 测试 Thinking ModeMidjourney 在 Alpha 网站测试图像生成的“Thinking Mode”在任务的 lightbox 里点“Rerun (Thinking)”即可试用官方称测试中提示词遵循、文字排版和画面连贯性都有提升以后可能正式开放。MidjourneyYandex 数据中心遭无人机袭击据 Reuters乌克兰无人机 10 月 8 日和 9 日袭击了 Yandex 在萨索沃和卡卢加的数据中心5 个数据中心里 2 个停摆萨索沃那座装着训练 YandexGPT 的 3 台超算中的 2 台。Ars TechnicaBoston Dynamics 详解 Atlas 新手新手 4 指、13 个自由度、直接驱动由 13 个相同的全封装执行器组成去掉了小指按量产和高保真仿真设计便于做 sim-to-real 强化学习手是上周发布的这篇是专访。The Robot ReportHarvey 用 wake-sleep 提升 agentHarvey 让 agent 在 110 个法律任务上积累经验后留出任务的全通过率从 2.9% 升到 15.7%只检索相关记忆还让成本约减半GPT-6 LunaHarvey 自测美国时间 10-08 发布。X nikogrupenClaude Science 绘全天紫外星图约翰霍普金斯大学天文学家 Brice Ménard 用 Claude Science 绘制首张全天紫外星图智能体下载并拼接多个太空任务的数据约三分之二来自 GALEX缺口用图像修补补齐。The Decoder参议院调查超大规模厂商误导公众美国参议院调查称部分超大规模厂商在 AI 数据中心的成本和收益上误导公众另据 TechCrunch亚马逊与地方政府谈数据中心交易将不再用保密协议微软今年早些时候已经这样做。Time、TechCrunchShow HN让 agent 在屏幕上画箭头big-arrow-on-the-screen 是一个 macOS 命令行工具附 Claude Code / Codex 的 skill让 agent 在屏幕上画箭头和方框Swift 编写MIT 许可HN 上 392 分、175 条评论。GitHubDario 曾向 Meta 求算力被拒据《华尔街日报》Dario Amodei 今年早些时候联系 Meta 的 Alexandr Wang希望获得更多算力被 Meta 拒绝。wsj.com图片版权归原作者出处见图注。关注Hollis的视觉大模型实战每天一份 AI 早报只看一手来源视觉与多模态大模型的论文精读和动手复现也在这里。