Kimi-K3实测!用Kimi Code和Agent写同一篇论文,K3能力到底有多强? 📅 2026/8/4 7:39:43 之前测试了五个模型同题生成学术文章点此查看上一篇文章今天专门拉了Kimi AppK3 进阶模式256k 上下文和Kimi Code1M 上下文 Agent Swarm两个工具用昨天同一套学术任务再跑一遍。结论先放K3 能力确实强但价格摆在那——和 DeepSeek-V4-Flash 谈智价比真的不划算。一、 Kimi-K3国产模型的全新天花板7月16日月之暗面发布Kimi-K3。7月27日完整权重开源。2.8T参数MoE架构激活1040亿原生视觉1M Token上下文。这几个数字放在一起基本就是国产模型天花板的配置单。但K3真正的杀手锏不在参数量在架构。KDA 混合线性注意力 注意力残差AttnRes技术——这套组合拳带来的直接效果是百万 Token 上下文下解码速度提升6.3 倍。什么概念以前处理一整本书的内容模型要慢慢读很久现在快了六倍多。长文本处理从能做变成了做得快。基准测试5 项全球第一在 AAArtificial Analysis独立评测中189 个模型同台竞技K3 的成绩单是这样的基准测试K3 得分排名Code WebDev (arena.ai)1679 #1BrowseComp网页浏览Agent91.2 #1SWE Marathon长程软件工程42.0 #1Program Bench77.8 #1OmniDocBench视觉文档91.1 #1Terminal Bench 2.188.3#2差 Sol 半分Automation Bench30.8 #1AA Intelligence Index57.1#45 项第一这个成绩放在全球范围看都是顶级水平。当然也有短板。。DeepSWE 67.5Sol 73.0略落后MMMU-Pro 81.6Sol 83.0略落后。但总体来说尤其在代码开发、网页浏览、软件工程这些硬核 Agent 任务上K3 基本就是标杆。但价格也是顶级的计费项价格缓存命中 / 百万Token$0.30新输入 / 百万Token$3.00输出 / 百万Token$15.00K3 直接进入对标美国头部的价格区间——海外开发者直言这是中国 AI 创业者迄今发布的最昂贵模型之一。比国内主流模型贵了将近 5 倍。能力确实强但这个定价让人不得不多想一个问题智价比划算吗先把这个问号留着后面实测见分晓。国内主流旗舰模型输出价普遍不到 ¥1/千TokenDeepSeek V4 Pro、通义千问 Max 等。一个有点抽象的设定再说一个让很多用户困惑的点。K3 目前可以通过两个工具使用kimi-app 和 kimi-code。两个工具的差异不只是界面不同那么简单。kimi-appK3 进阶模式上下文窗口256kkimi-code上下文窗口 1M还支持 Agent Swarm多子代理并行同一个模型同一家公司两个工具上下文差了4 倍。⚠️ 小编的订阅是199 元档位但 agent 和 code 的额度还是分开计算的。更关键的是——kimi-app 的 agent 没有 1M 上下文只有 256k。这一点怎么说呢——有点抽象。就像你买了一辆车发动机一模一样但导航系统告诉你走这条路只能看到前方 256 米走那条路才能看到 1 公里。同一个引擎视野却差了四倍。你问为什么没人能给你一个特别说得通的理由。 顺便告诉宝子们一个小福利kimi目前有邀请活动邀请 100 个好友约等于49 元订阅一年的额度年底 12 月 31 日过期。闲鱼上有人转让大约30 元。▲ Kimi 订阅信息199档位5小时 Code 额度独立计算赠送额度 2026-12-31 截止二、实测任务同一篇学术论文分别测试 任务是什么一篇完整的学术论文生成。不是那种帮我写个摘要的玩具任务而是全套流程能力报告 → 研究契约 → 文献检索日志 → references.bib → 论文大纲 → 论点图谱 → 7 章正文 → 12 图 12 表 → 引用审计 → 同行评审 → docx/tex/pdf 三格式输出 → 最终 QA。这个任务昨天已经用 DeepSeek-V4-Flash 测过一遍48 分钟完成约 2.5 万字41 条文献花费约 1.38 元。今天换 K3 上场而且是一次跑两个工具。 路径一kimi-appK3 进阶模式256k 上下文▲ K3 进阶模式启动Crossref API 检索英文文献上下文 22%55k/256k启动 K3 进阶模式上下文 256k。任务开始时已用 22%约 55k/256k。可以看到它通过 Crossref API 检索英文文献流程正常跑起来了。▲ 任务启动能力报告、研究契约 ✅其余阶段陆续开始能力报告、研究契约已完成后续章节正在推进。看起来一切顺利。▲ 上下文文件通用论文生成主提示词.md run-manifest.json 各阶段产出上下文文件列表中可以看到通用论文生成主提示词.md等核心文件任务规划清晰。⚠️中途断线了。▲ 进度前 8 项 ✅ 完成最后 2 项PDF 最终QA空白最后两项PDF 生成 最终 QA没跑完。任务进度卡在那里。▲ 断线重连后进度全部清零所有任务重新开始重新接入后任务状态全部清零。虽然得从头规划但已生成的文件还在我们看最终成果指标kimi-app 数据文件数84 个文档词数26,137 字论文正文46,574 字符中文 23,449图文资源35 项12 SVG 12 PNG 11 build参考文献42 条耗时约 1 小时 30 分钟含断线▲ 用量不少。最终赠送额度用到1.6%订阅用量方面kimi-app大约用掉了月用量的10%左右(黑色区域)kimi-code方面大约5小时Code100%一次论文任务吃掉了比较可观的额度。值得一提的是K3 完成论文后主动提议要不要生成 15 页答辩 PPT▲ 完成后 K3 主动提议要不要把这篇论文浓缩成 15 页答辩 PPT这个主动性得点个赞。不是等你问还能做什么而是自己想到下一步。这才是 Agent 该有的样子。路径二kimi-code1M 上下文 Agent Swarm▲ Kimi Code 启动环境检查context 4% (36.7k/1M)kimi-code 启动上下文 1M当前 4%约 36.7k/1M。工具检查完毕开始干活。然后——重头戏来了。▲ Agent Swarm: 4 个子代理同时写作2 agents runningAgent Swarm 启动。4 个子代理同时并行写作。第 3 章、第 4 章、第 5 章、第 6 章四个章节同时开跑。后台还有子代理在生成 14 张 SVG 概念图。▲ 第3-6章设计类章节并行第3/5/6章 ✅第4章进行中▲ 第1/2/7章摘要阶段后台子代理完成 14 张 SVG 概念图这不是一个一个排队写是四路大军同时推进。这就是 1M 上下文 Agent Swarm 的威力——上下文够大装得下所有章节的信息子代理够多并行效率拉满。▲ Kimi Code 最终交付总字符 58036汉字 30105图 14表 25参考文献 39Kimi code最终交付指标kimi-code 数据文件数88 个文档词数26,593 字论文正文58,036 字符中文 30,105图文资源42 项14 SVG 14 PNG 14 HTML参考文献39 条完成状态完整完成无断线 ✅kimi-code的中文字符数 30,105比kimi-app的23,449多了将近 7000 字。这就是1M上下文带来的差异——更大的上下文窗口意味着模型能看到更多内容生成更深入的论述。⏱️时间对比工具耗时完成状态kimi-app~90 分钟断线一次部分未完成kimi-code完整跑完同样90分钟全部 12 步 ✅DeepSeek-V4-Flash48 分 41 秒完整完成 ✅▲ DeepSeek-V4-Flash 同样任务48分41秒完成41条文献12图12表约2.5万字DeepSeek-V4-Flash 的 48 分钟41 条文献12 图12 表约 2.5 万字——又快又稳又便宜。三、横向对比千笔、K3、DeepSeek学术写作谁更行之前我们发了一篇文章分析了千笔AIWritePaper 这款AI学术写作工具同时用 5 个模型做了同题 PK。千笔AIWritePaper的核心卖点10 分钟 3 万字、40 篇真实文献、不限次 2000 字三级大纲、AI 率/重复率不达标退费。综合评分 86 分零门槛速成的首选。之前测试中DeepSeek-V4-Flash 以 76.7 分、1.38 元成本、48 分钟完成的表现被称为智价比之王。opus-5 以 86.8 分登顶质量榜但成本也最高。现在我们把 K3 在 App 和 Code 两个工具下的实测数据加进来用同样的五个维度打分看看 K3 的表现到底如何。五维评分维度权重kimi-appkimi-codeds4-flash任务完成度20%788877内容细节25%759080图文丰富度20%789082文献真实度15%938592综合得分75.082.0 76.7一句话总结kimi-code 以 82 分登顶本轮测试。主要赢在两点1M 上下文带来的内容深度中文字符 30,105远超另外两个以及 Agent Swarm 并行带来的图文丰富度42 项资源最多。kimi-app 75 分垫底主要输在断线导致任务未完成内容深度也受 256k 上下文限制。同一个模型换个工具分数差了 7 分上下文窗口的影响实打实地体现在了产出质量上。这里再提一下论文绘图、表格这里kimi code真的能打了多元内容基本无可挑剔。最终出图svg方式绘制不输Claude-opus-5但是由于agent中的上下文只有kimi-code的1/4出图质量明显查了一大截。▲ 系统用例图▲ 数据库E-R图▲ 流程图▲ 时序图▲ 订单创建流程与事务边界图四、当前国模天花板但智价比一般Kimi-K3是现阶段最强的国产模型但价格偏高与 DeepSeek-V4-Flash 最新版的智价比对比并不划算。能力层面确实顶5 项全球第一不是吹的。Code WebDev 第一、BrowseComp 第一、SWE Marathon 第一、Program Bench 第一、OmniDocBench 第一。AA Intelligence Index 排第 4。在长程软件工程和 Agent 任务上K3 确实是顶级的。SWE Marathon 42.0 分比 Fable 5 还要高 20%——这意味着它能处理更复杂、更长链条的工程任务。BrowseComp 91.2信息检索能力也是一骑绝尘。对于追求极致能力的硬核开发者K3 还是非常能打的。价格层面贵了不止一点按一篇 2.8 万字论文的消耗估算输入约 300 万 Token输出约 50 万 Token。成本项Kimi-K3DeepSeek-V4-Flash输入价 / 百万Token$3.00$0.14缓存命中输出价 / 百万Token$15.00$0.28论文输出费用≈ $7.50约 ¥54≈ $0.14约 ¥1K3 是 DS-V4-Flash 的54 倍54 倍是什么概念同样写一篇论文DeepSeek花 1 块钱K3要花54块。能力确实强了但强了 54 倍吗显然没有。K3的输出定价是DeepSeek-V4-Flash的50倍左右。对于学术写作这种长文 多文件 图表的场景Token消耗量大成本差距会被进一步放大。工具层面kimi-code 更值得用实测下来kimi-code 凭借 1M 上下文 Agent Swarm 并行完成度和产出丰富度都优于 kimi-app。82 分 vs 75 分7 分的差距主要来自上下文窗口的差异。但前提是你得订阅 199 档位而且 code 和 agent 额度分开算。最让人费解的还是那个设定kimi-app 的 agent 只有 256k 上下文kimi-code 才有 1M。同一个模型同一家公司工具不同上下文差 4 倍。这一点确实有点抽象。✨ 对于学术写作这种长文多文件图表的场景1M上下文的优势是实打实的kimi-code借助1M上下文Agent Swarm并行实测完成度比kimi-app高——kimi-app 中间断线 部分未完成kimi-code完整交付。而 DeepSeek-V4-Flash 用 48 分钟 1.38 元成本就完成了任务——智价比碾压 K3。所以怎么选零门槛速成、省心、完成度高选千笔AIWritePaper学术写作——10 分钟 3 万字不达标退费。追求极致能力选kimi-K3kimi-code-5项第一但是得接受高价。追求智价比 学术写作选DeepSeek-V4-Flash48 分钟1 块钱完整交付。体验K3性价比首选选199订阅闲鱼约30元的邀请额度也很值。#KimiK3 #KimiCode #AgentSwarm #AI写论文 #智价比