9月9日,AI圈被两件事刷屏:OpenAI发布GPT-6 Astra,英伟达CEO黄仁勋在社交平台直言"通用人工智能已经到来"。同一天,面壁智能以仅20亿参数的MiniCPM5-2B拿下全球4B以下开源模型综合第一,微信视觉团队的开源多模态嵌入模型WeMM-Embedding登顶MMEB-v2榜单。国产大模型正从"比参数规模"切换到"比智能密度"的赛道,而微软Project Opal让智能体连续运行数天自动干活——AI产业的核心矛盾已经从"模型够不够大"变成了"能不能真正替人干活"。
说实话,我跟踪AI行业这两年,每周都有"里程碑"发布,但今天这三条线放在一起看,确实传递了不同信号:模型能力天花板在抬、开源生态在下沉到端侧、智能体在向企业生产流程渗透。下面逐条拆解。
OpenAI发布的GPT-6 Astra,核心突破集中在智能体执行能力和深度推理两个维度。据官方展示,Astra可以填写在线表格、更新客户管理系统、整理日程,也能分析科研数据、生成图表、搭建网站并检查功能。用户提出目标后,模型自行规划步骤、切换工具、修正错误,大幅减少对人工分步指令的依赖。
黄仁勋在贺帖中披露,GPT-6 Astra由约10万块英伟达Grace Blackwell NVLink72芯片完成训练,并透露下一批40万颗GPU即将上线。他直言"AGI已经到来"——这番话在业内引发两种截然不同的反应。支持方认为,Astra跨越多软件工具完成专业工作的能力确实触及了通用智能的门槛;反方则指出,10万GPU训练成本和40万GPU扩产计划恰好在英伟达出货周期前夜公布,"技术判断"和"商业喊单"难以完全分开。
OpenAI CEO奥特曼同日在播客访谈中首次确认将自研人形机器人,内部北极星指标已从AGI升级为"超级智能"。他还承认过去一年因投入视频生成等支线走了弯路,宣布代号"The Merge"计划——将ChatGPT与编程工具Codex融合为统一AI入口。这个转向说明OpenAI意识到"对话"和"干活"不应割裂成两个产品。
对企业用户而言,真正值得关注的不是AGI到底来没来,而是模型能力边界扩展到了"操作电脑完成多步骤工作流程"。这意味着销售运营团队可以把整条工作流交给AI,而非依赖技术人员做拼接。当然,代价是算力需求持续攀升——高盛预测全球数据中心建设竞争将导致存储芯片供应严重短缺,这种基础设施压力最终会传导到推理成本上。
9月8日,面壁智能联合OpenBMB开源社区发布MiniCPM5-2B端侧基座模型。这个仅20亿参数的小模型,在Artificial Analysis榜单以23分位列全球4B以下开源模型第一,智能体指标达到20分——同级模型普遍低于10分。在真实任务评测中得分891(人类基线1000),高于参数规模约为其6倍的Gemma 4 12B(647分)和Qwen3.5 9B(645分)。
更值得注意的是,这次开源包含完整训练配方、强化学习框架和4个数据集,被称为"L4级真开源"。面壁已与英特尔、瑞芯微、Arm完成首日适配,MiniCPM系列全球下载量突破5000万次,已进入三星旗舰机、长安和吉利等车企座舱、具身机器人等场景。
同日,微信视觉团队开源通用多模态嵌入模型WeMM-Embedding(2B/4B/9B),支持文本、图像、视频及任意交错输入。9B版本以80.6分位列MMEB-v2榜首,2B版本77.9分超过此前8B开源模型。该模型已在视频号、公众号、朋友圈等场景落地,日调用量达十亿量级。
再看更大格局:阿里旗舰模型Qwen3.8-Max首次开放权重,智谱发布GLM-5.3,腾讯混元开源Hy4预览版。这些新一代旗舰模型集体采用稀疏MoE架构——总参数站上万亿级,但单词元激活控制在千亿上下,以极低激活成本换取旗舰能力。智谱GLM-5.3在基座不变的情况下仅靠后训练便实现编程能力五成提升;腾讯混元Hy4首次让模型参与自身训练方法与数据策略的自动优化,推理吞吐提升超三成。
这条线的深层信号是:国产大模型正在经历去泡沫化的结构性调整。头部厂商不再以参数量为核心卖点,而是集体转向推理成本、端侧部署和工程化效率。一个覆盖云端到终端到边缘的分层开源矩阵已然形成——万亿级MoE旗舰承接大型集团复杂业务,10B级稠密模型主攻PC和终端本地部署,轻量化模型将办公智能体和企业自动化流程作为主战场。正如行业分析师所言:"接下来能跑通付费闭环的厂商会迅速拉开身位,剩下的则会被压缩成纯基础设施供应商。"
微软CEO纳德拉宣布为Microsoft 365 Copilot上线Project Opal功能,定位为长周期任务智能体——可连续运行数小时至数天,自动完成素材搜集、表格生成、演示文稿制作及消息分发等全流程。用户通过Frontier模块输入指令,系统调用云电脑与高级推理模型执行动态计划。首批场景包括季度合规审计、新员工入职等,单周最高可节省20小时人工。
这是微软第一次让AI智能体"跑好几天"。之前Copilot的定位是"辅助你干活",Project Opal直接变成了"替你干活"。合规审计、新人入职这种流程化、跨系统的长任务,确实是智能体最理想的落地场景。做企业级应用的同学可以参考这个方向——长周期自动化是下一个高价值需求点。
同在智能体赛道,AI编程创企Cognition AI在E轮融资中筹集20亿美元,估值达480亿美元,年化收入从4.92亿美元增至近9亿美元。资本押注的是"能独立完成完整工作的智能体",而非"只会建议的助手"。这传递的信号很明确:自动化复杂任务的智能体正在从编程领域向外扩展,销售和运营场景即将跟进。
再看国内动态,腾讯文档上线AI工作台,基于智能体内核与自研编辑引擎,可直接读取本地文件与在线文档,支持人机双写——选中任意内容用自然语言下达指令,改动直接落在原文件并记入修订记录。小米也开放了MiMo桌面客户端邀测,可直接读取表格、图片、视频、PDF等素材,拆解任务并交付文档、网页、3D模型等可继续编辑的成果。这些产品动作说明一个趋势:智能体正在从"单轮对话"走向"多步骤长流程执行",从"回答问题"走向"操作工具交付成果"。
对广西本地企业而言,智能体落地不是遥不可及的事。南宁的企业在做数字化转型时,完全可以先用轻量开源模型(如MiniCPM5-2B)在本地部署验证场景,跑通后再上云端旗舰模型做规模化。模型微调也是关键环节——用企业自有数据做后训练,让模型适配自己的业务术语和流程,比直接调用通用API效果好得多。
把三条线放在一起看:GPT-6 Astra把模型执行能力推到新高度,国产开源把智能密度做到极致,微软Project Opal把智能体跑进企业生产流程。过去讨论AI总绕不开"模型到底有多聪明",现在行业已经不吵这个问题了——焦点转向"能不能以足够低的成本跑进真实业务场景"。
对企业来说,与其追每一款新模型(发布速度已经快到追不过来),不如选定一两个场景深耕:用开源模型做端侧验证,用旗舰模型做复杂推理,用智能体做流程自动化。跑通付费闭环的团队,会在这波浪潮中拿到真正的红利。