大模型竞争转向Agent基准赛:GPT-5.6能操作应用、Kimi K3开源2.8万亿、DeepSeek五倍跃升

阅读: 302 评论: 0

标签:

从"能聊天"到"能干活":大模型竞争换了赛道

8月19日,上海一处园区里,工作人员正跟马来西亚最大的电子钱包企业远程连线,讨论怎么用新开发的AI工具处理企业内部的海量数据。这不是个例——同期,巴西参访团跑到中国看AI黑板,印尼学校已经用上了手写方程式秒变图形的教学设备。中国AI大模型的调用量已经连续多周保持全球第一。

但我更关注的不是这些"出海"故事本身,而是一个更底层的变化信号:大模型厂商们不再比谁参数大、谁Benchmark分数高了。2026年8月这一周,三家头部厂商——OpenAI、Moonshot、DeepSeek——不约而同把竞争焦点转向了同一件事:Agent能不能真正完成任务。

国泰海通人工智能联合实验室8月月报说得很直白:"下一阶段大模型竞争的核心指标将逐步由模型参数量和静态Benchmark得分,转向真实任务成功率、连续工作时长、工具调用稳定性、任务复用率以及单位任务成本。"说白了,以前比谁跑得快,现在比谁干得靠谱。

一、GPT-5.6整合Codex:从"生成答案"到"操作应用"

OpenAI这个月做了件挺有想象力的事——发布GPT-5.6并整合了Codex。这不是简单的版本迭代。新模型能直接操作应用程序和文件,自动完成表格、文档、幻灯片及Web应用等任务。

听起来好像不算什么?但你想想之前的大模型在干什么:你问它问题,它生成一段文字回答你。本质上是个超级搜索引擎。GPT-5.6整合Codex之后,模型不再只是"回答问题",而是"执行任务"——你让它做一份季度财报PPT,它自己去打开Excel读数据、打开PPT排版、生成图表、保存文件。整个过程不需要你中间插手。

这背后的技术变化值得细说。头部模型的升级方向正由"生成更好的答案"转向"完成更复杂的任务"。这意味着模型的评估维度变了——以前看BLEU分数、看MMLU得分,现在看Terminal Bench、DeepSWE、OSWorld这些长周期Agent任务的通过率。

说实话,我觉得这个方向比单纯堆参数有意义得多。企业不需要一个能背诵维基百科的模型,企业需要一个能替员工干活的数字同事。OpenAI这一步,把大模型从"知识工具"推向了"劳动力工具"。

对南宁的企业来说,这件事的直接影响在于:如果你在做南宁大模型相关的应用开发,Agent能力将成为选型的第一指标。模型能不能稳定调用你的业务系统API、能不能在长程任务中不跑偏、出错了能不能自己纠正——这些才是落地成败的关键。南宁模型微调的场景里,与其追求参数量,不如在Agent工具调用稳定性上做针对性优化。

二、Kimi K3全量开源:2.8万亿参数背后的基础设施野心

7月27日,Moonshot AI正式开放Kimi K3完整模型权重,同步发布技术报告及MoonEP、FlashKDA和AgentEnv等关键基础设施技术。总参数规模2.8万亿,采用原生多模态MoE架构,支持100万Token上下文。

2.8万亿参数,这个数字放在半年前会让人倒吸一口气。但我觉得真正有意思的不是参数量本身,而是Kimi K3在架构上做的几件事。

第一件,混合注意力架构。K3采用KDA与Gated MLA组合——KDA负责高效处理长序列,Gated MLA周期性保留全局信息检索能力。翻译成人话就是:模型在处理超长上下文时,既能快速读完全文,又不会读到后面忘了前面。这在100万Token上下文里至关重要。

第二件,超稀疏MoE。896个专家、每个Token激活16个专家。总参数很大,但单次推理的实际计算量被控制住了。这就像一栋896间房的大楼,你每次只需要开16间房的灯——电费不会爆炸,但整栋楼的"知识储备"很充足。

第三件,也是最关键的——Moonshot不是只放了个模型权重就完事了,它同步开源了MoonEP(训练/推理引擎)、FlashKDA(注意力加速)、AgentEnv(Agent训练环境)一整套基础设施。这才是真正的"开源生态"打法。

国泰海通月报分析得很到位:"与单纯开放API相比,权重开放使开发者能够进行本地部署和二次开发,研究机构可围绕超大规模MoE、注意力机制等方向开展研究,企业则能够基于模型构建私有化知识系统和Agent集群。"

这对南宁的企业意味着什么?如果你是南宁软件公司或南宁智能体开发团队,以前用API调用大模型,数据得传到厂商服务器上。现在K3权重开放了,你可以把2.8万亿参数的模型部署在自己机房里,数据不出企业。对于金融、医疗这些数据敏感行业,私有化部署是刚需。K3的MoE架构让单次推理计算量可控,部署成本没有想象中那么吓人。

还有一个容易被忽略的细节:AgentEnv。这个工具是专门用来训练Agent能力的环境。以前你要训一个能在企业系统里干活的Agent,得自己搭一套模拟环境。现在Moonshot把训练基础设施都开源了,等于把"造Agent的流水线"也给你了。我觉得这比模型权重本身的价值更大。

三、DeepSeek V4-Pro:Terminal Bench 87.9分,国产Agent逼近全球第一

8月12日深夜,DeepSeek官网API文档更新,模型版本从V4-Pro预览版切换为"DeepSeek-V4-Pro-0813"正式版。重点强化了Agent能力,支持Responses功能。

数据很硬。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分。全球第一是谁?Anthropic的Fable 5,88.0分。差0.1分。相比预览版的72.1分,正式版跃升了15.8分。

更夸张的是DeepSWE软件工程能力测试:分数从预览版的12.8飙升至62.7,接近原来的五倍。12.8到62.7,这不是小修小补,这是质变。

这个成绩放在全球Agent基准赛里看:DeepSeek V4 Pro在Terminal Bench跟Anthropic Fable 5只差0.1分,但输出定价只有0.87美元每百万Token。性价比碾压级别。

我其实觉得,DeepSeek这波最值得关注的不是分数本身,而是它暴露的一个行业趋势——本周三大发布(Gemini 3.7 Flash、Grok 4.6、DeepSeek V4 Pro)无一例外都以DeepSWE、Terminal-Bench、AutomationBench、OSWorld等长周期Agent任务为卖点。Agent基准已经成了新的兵家必争之地。

这意味着什么?意味着如果你是南宁大模型应用开发者,选模型的时候不能只看MMLU、HumanEval这些老Benchmark了。你得看Terminal Bench、DeepSWE——这些才是衡量"模型能不能真正帮你干活"的指标。对于做南宁模型微调的团队来说,微调目标也得变:从"提高通用问答准确率"转向"提高特定Agent任务的完成率"。

再延伸一层:Agent基准赛的兴起,对中小软件企业是利好。以前大模型竞争拼参数、拼算力,中小企业根本插不上手。现在竞争拼的是Agent任务成功率,这需要高质量的垂直场景数据、精细的提示词工程、稳定的工具调用编排——这些恰恰是中小企业的优势领域。广西软件开发企业如果能深耕某个垂直场景(比如设备运维、HR管理、电商运营),完全可能在细分Agent基准上做出超越通用大模型的表现。

Agent基准赛才刚开始

回顾这一周的三个信号——GPT-5.6整合Codex操作应用、Kimi K3开源2.8万亿权重加一整套训练基础设施、DeepSeek V4 Pro在Terminal Bench逼近全球第一——它们指向同一个结论:大模型竞争的下半场,不是比谁的模型更大,而是比谁的Agent更能干活。

国泰海通月报预测:"AI应用正由单点内容生成和Copilot辅助,向能够理解任务、调用企业数据并完成业务流程的Agent演进。"这个判断我认同。但我想补一句:Agent基准赛不只是大模型厂商的事。模型权重开源(Kimi K3)、训练环境开源(AgentEnv)、端侧芯片Day-0支持(联发科跟进Qwen3.8),这些变化正在把Agent能力的构建门槛拉到前所未有的低点。

对南宁的企业和开发者来说,现在该做的不是追模型版本号,而是想清楚一个问题:你的业务场景里,有哪些任务是重复的、规则明确的、目前靠人力堆的?这些就是Agent最先该切入的地方。Agent基准赛才刚开始,场景切入点比模型选型更重要。

上一篇 > 8月20日数据安全评估明天施行+8月18日三大软件商AI收入占比破五成:B2B软件商的三条新主线
下一篇 > 数据安全评估办法施行首日:认证就位、报送启动,三地产业数字化方案同步落地