AI 大模型日报 — 2026-08-10 📅 2026/8/10 11:41:34 AI 大模型日报 — 2026-08-10本报告基于多源公开信息整理覆盖 2026 年 8 月上旬全球大模型领域的最新动态。数据截至 2026-08-10由 Hermes Agent 自动搜集整理。 今日速览OpenAI 史上最大预训练模型 “Doug” 曝光8 月 9 日SemiAnalysis 披露 OpenAI 此前卡住的预训练问题已解决正在推进代号 Doug 的更大规模预训练项目与 GPT-6 并非同一模型最迟或于 11 月前推出DeepSeek V4 正式版发布窗口开启据新浪财经报道V4 GA 预计 8 月 10 日至 20 日发布封闭测试结束后约 1~2 周V4-Flash 正式版已于 7 月 31 日上线公测Agent 基准大幅提升DeepSeek 重启第二轮融资计划募资 500 亿元、投前估值突破 5000 亿元坐稳国内 AI 企业估值榜首两轮累计融资或达千亿级开源模型排行榜大洗牌阿里 Qwen-3-235B 于 8 月拿下开源模型第一智谱 GLM-4.5 与 OpenAI gpt-oss-120b 首次进入前十Claude Opus 5 登顶独立智能指数Artificial Analysis 智能指数 v4.1 中 Opus 5 以 61 分居首7 月 24 日Fable 5 60 分、GPT-5.6 Sol 59 分可灵 AI 创视频大模型融资纪录落地近 30 亿美元融资投后估值有望达 180 亿美元上周智能科技投融资密集8 月 3 日—9 日共披露 137 起融资总额约 1268.54 亿元 热门话题摘要OpenAI 秘密大模型 Doug 浮出水面研究机构 SemiAnalysis 最新披露OpenAI 此前卡住的预训练问题已经解决正在推进代号Doug的史上最大规模预训练模型。爆料称 Doug 与 GPT-6 并非同一模型且最迟可能在 11 月前推出——这意味着 OpenAI 在 GPT-5.6 之外还握有一张更大的底牌新一轮预训练军备竞赛信号明确。DeepSeek V4 正式版进入倒计时V4-Flash 正式版0731已于 7 月底上线公测Terminal Bench 2.1 达 82.7、Cybergym 76.7 等 Agent 基准大幅超越 V4-Pro-Preview并原生支持 Responses API、适配 Codex。V4-Pro 正式版将尽快发布行业预计 8 月中旬8/10—8/20落地叠加 500 亿元新一轮融资与 5000 亿元估值DeepSeek 正在资本与技术双线冲刺。“价格战全面升级为性价比战”Gemini 3.5 Flash 以速度 4 倍、价格砍半冲击市场头部企业迁移 80% 负载每年可省超 10 亿美元Claude Opus 5 定价约为 Fable 5 的一半并登顶独立智能指数GPT-5.6 宣布端到端服务成本再降 20%、token 生成效率提升超 15%。前沿能力的单位成本正在被系统性击穿。开源生态格局生变Qwen-3-235B 登顶 8 月开源模型排行榜智谱 GLM-4.5 与 OpenAI gpt-oss-120b 首次闯入前十DeepSeek-V4-Flash 在 OpenRouter 上 token 份额持续居前——开源阵营由一超多强走向多极竞争国产开源模型集体崛起。资本向头部 AI 集中、视频与智能体成吸金赛道可灵 AI 近 30 亿美元融资创全球视频大模型纪录Moonshot AI 融资 35 亿美元上周国内披露 137 起投融资事件、总额约 1268.54 亿元。资金加速流向物理 AI、基础大模型与 AI 软件应用早期融资占比高达 64.6%。 国际头部模型动态OpenAI — GPT 系列模型时间要点Doug预训练中2026-08-09 曝光史上最大规模预训练项目与 GPT-6 非同一模型SemiAnalysis 称此前卡住的预训练问题已解决最迟或 11 月前推出GPT-5.6 Sol / Terra / Luna2026-07-09三档 Agent 模型1.05M 上下文、128K 最大输出新增 “ultra” 多智能体并行档位Sol 编码智能体指数 80 分超 Fable 5 2.8 分token/时间/成本约为其 1/2、1/2、2/37/29 披露端到端服务成本再降 20%、token 效率提升超 15%GPT-5.22025-12推理与数学标杆已被 5.6 系列取代主力地位GPT-Image 22026-04原生图像生成模型自带推理模式其他动态收购演示文稿初创 NextSlide 扩充办公生态gpt-oss-120b 首次进入开源模型榜前十OpenAI 高管称Codex 这类 Harness 模式也就再火两个月暗示技术路线迭代加速。Anthropic — Claude 系列模型时间要点Claude Opus 52026-07-24$5/$25 每百万 token约 Fable 5 一半价格Artificial Analysis 智能指数 v4.1 登顶61 分Coding Agent Index 上 Claude Code Opus 5 居首67 分单任务成本 $7.08 低于竞品 $11.71已成为 Claude Max 默认模型、Pro 最强模型Claude Fable 52026-06-09旗舰模型智能指数 60 分居次席7 月 1 日解除限制全球重新部署Claude Sonnet 52026-06-301M 上下文、128K 最大输出持久化记忆与多步工具调用Claude Code Auto 模式2026-08-14 生效Pro/Max/Team 默认开启安全分类器拦截 89% 危险命令Google DeepMind — Gemini 系列Gemini 3.5 FlashI/O 2026 发布已 GA定位迄今最强大的智能体与编程模型输出 token 速率达竞品 4 倍Antigravity 优化版 12 倍智能体任务成本通常不到竞品一半GDPval-AA 1656 Elo、Terminal-Bench 2.1 达 76.2%、MCP Atlas 83.6%支持多子智能体并行与数周自主工作流。Gemini 3.5 Pro已在 Google 内部使用“展现极大性能提升”预计近期正式推出正面迎战 GPT-5.6 与 Claude Opus 5。Gemini 3.6 Flash / Flash-Lite / Flash Cyber2026-07-20更低成本实现更高 token 效率输出较 3.5 Flash 减 17%~65%。生态数据Gemini App 月活从 4 亿增至 9 亿月度 Token 处理量 3.2 千万亿同比 7 倍2026 年资本支出预计 1800~1900 亿美元Gemini Spark 个人智能体已向美国 AI Ultra 用户开放 Beta。xAI — Grok 系列Grok 4.52026-07-15xAI 收购 Cursor 后由 Cursor 团队主导训练的 Agent 模型MoE 约 1.5T 参数、500K 上下文。Meta — Llama / Muse 系列Muse Spark 1.2 (xhigh)2026-08-05 上榜Meta Superintelligence Labs 推理模型LLM Rank 综合评分 90.4%在多维评测中表现突出。Llama 4Scout / Maverick为上一代开源旗舰开源榜上 Llama 系持续被 Qwen / DeepSeek / GLM 追赶。其他国际厂商MistralMagistral 系列持续迭代小模型路线Mistral Medium 3 为前沿级多模态模型。InclusionAI — Ling 3.02026-08-04/06Tiny / Flash 版本上榜 LLM Rank主打高性价比推理。AI9Stars — G9v3-39A5B2026-08-03新上榜模型。 国内模型动态厂商模型要点DeepSeekDeepSeek-V4-Flash 07312026-07-31 正式版公测Agent 能力大幅增强Terminal Bench 2.1 82.7、NL2Repo 54.2、Cybergym 76.7、DSBench-Hard 59.6原生支持 Responses API 并适配 CodexOpenRouter 上 token 份额持续居前、HF 官方仓下载量突破 61.8 万环比 42.6%DeepSeekDeepSeek-V4-Pro 正式版即将发布GA 预计 8 月 10—20 日API 已支持 V4-Pro/V4-Flash旧模型名 deepseek-chat / deepseek-reasoner 已于 7/24 停用DeepSeek新一轮融资计划募资 500 亿元、投前估值超 5000 亿元两轮累计或达千亿级坐稳国内 AI 估值榜首阿里 QwenQwen-3-235B8 月开源模型排行榜第一名Qwen 3.8 Max8 月 3 日2.4 万亿参数为千问迄今最大旗舰通义实验室已重组为 Alibaba Token Hub 旗下 Qwen 研发单元智谱 GLMGLM-4.5首次进入开源模型榜前十GLM-4.6 系列 Agentic Coding 大幅跃升支持寒武纪国产芯片 FP8Int4 混合量化部署月之暗面 KimiKimi K3新一代旗舰大模型在 2026 国际数学家大会期间引发关注K2.7 Code 等持续迭代可灵 AI可灵视频/图像系列落地近 30 亿美元融资创全球视频大模型公司最大融资纪录投后估值有望达 180 亿美元可灵视频 O1、2.6 及图像 O1 持续迭代腾讯混元HunyuanVideo 1.5开源视频生成8.3B 参数14G 显存消费级可跑字节跳动豆包 Doubao-Seed-1.6 系列多模态全家桶豆包 火山引擎组合重排 To B 业务MiniMaxMiniMax-M1、H3推理 语音模型持续迭代港股表现活跃百度文心 ERNIE 5.0 Preview文本榜国内第一1432 分华为 / 科大讯飞等盘古 / 星火等以昇腾算力 行业解决方案推动全栈落地 行业趋势分析1. 预训练军备竞赛再启规模仍是暗线OpenAI Doug史上最大预训练项目与 GPT-6 并行推进、Gemini 3.5 Pro 蓄势待发、DeepSeek V4 进入 GA 窗口——在效率与性价比的明线叙事之下头部厂商的预训练规模军备竞赛并未停歇。模型能力的天花板仍由预训练投入决定性价比战只是让同一能力层级内的竞争更激烈。2. 性价比成为竞争主轴价格体系加速重构Gemini 3.5 Flash速度 4 倍、价格砍半、Claude Opus 5 半价登顶、GPT-5.6 成本再降 20%——前沿模型单位成本正在被系统性击穿企业以更低的迁移成本获得前沿能力。价格弹性effort 档位、轻量变体、Flash 系列成为各厂标配API 定价将进入持续下探通道。3. 智能体 AI 从演示走向生产Claude Code Auto 模式默认开启、Gemini 3.5 支持数周自主工作流与多子智能体并行、DeepSeek-V4-Flash 全面强化 Agent 基准并适配 Codex——自主执行 安全兜底成为 Agent 产品标配智能体在编程、金融尽调、发票处理、税务申报等真实场景开始稳定交付行业竞争焦点从会不会推理转向能不能可靠、安全地干活。4. 开源阵营多极竞争国产模型集体崛起Qwen-3-235B 登顶开源榜、GLM-4.5 与 gpt-oss-120b 首入前十、DeepSeek-V4-Flash 高性价比扩散——开源生态从一超多强走向多极竞争且中国厂商在开源榜占据明显优势。开源与闭源的边界也在模糊OpenAI 发布开源权重模型、Meta 重心转向 Superintelligence Labs。5. 资本加速向头部集中视频与具身智能成新吸金赛道可灵 AI 近 30 亿美元全球视频大模型纪录、Moonshot AI 35 亿美元、DeepSeek 500 亿元融资——资金高度集中于头部基础模型与 AI 应用。亿欧数据统计上周国内融资事件 137 起、总额约 1268.54 亿元资金向 AI 软件应用与物理 AI具身智能、智能驾驶赛道集中早期融资占比 64.6%开源繁荣带动创业热潮。6. AI 与宏观发展议题深度绑定世界银行 2026 世界发展报告《人工智能发展新机遇》8 月 4 日指出AI 可能让发展中国家在十年内实现原本需要更长时间的发展成果各国围绕主权 AI、算力建设与AI场景应用加速布局AI 正从技术叙事上升为全球发展议程的核心变量。 参考来源新浪财经2026-08-09OpenAI 最大预训练模型 Doug 曝光华尔街见闻、火星财经转载 SemiAnalysis 披露新浪财经2026-07-28DeepSeek V4 正式版或延至 8 月中旬国内大模型竞速生变DeepSeek API 官方更新日志2026-07-31DeepSeek-V4-Flash 正式版公测钛媒体2026-05-20Gemini 3.5 发布——谷歌用价格砍半、速度4倍逼竞争对手出局OpenAI 官方2026-07GPT-5.6 发布与效率报告openai.com/index/gpt-5-6/Artificial Analysis 智能指数 v4.1 / Coding Agent Index v1.32026-07 更新aivy.com.au2026-08-07 更新GPT-5.6 vs Claude Fable 5 / Opus 5 独立评测世界互联网大会2026-08可灵 AI 融资近 30 亿美元创纪录亿欧数据2026-08-10智能科技领域投融资周报8 月 3 日—9 日全球人工智能趋势全景白皮书 2026智慧城市行业分析LLM Rankllmrank.cn2026-08-06 更新LLM Stats AI Newsllm-stats.com/ai-news世界银行2026-08-042026 世界发展报告《人工智能发展新机遇》知乎专栏《国内外知名大模型及应用——模型/应用维度》2026-08-05 更新报告生成时间2026-08-10 由 Hermes Agent 自动整理