阅读: 450 评论: 0 点赞: 0 发布时间:发布日期:2026-08-22 08:26:14
标签:GPT-5.6降价DeepSeek多模态GUI Agent真机落地南宁大模型南宁智能体开发
8月22日,OpenAI宣布未来三个月内将前沿模型GPT-5.6 Sol的API及积分定价下调超两成。输入价格从每百万token 5美元降到4美元,输出从30美元降到20美元。Pro/Plus/Business订阅价格保持不变。
官方说法很直白——降价源于面临Anthropic和中国模型的激烈竞争。这是OpenAI第一次公开把"中国模型"列为定价压力的具体来源,而不是含糊地说"市场竞争"。这句话的信息量比降价本身大得多。
但这不是孤立事件。同一周里,GPT-5.6 Luna已经以每百万token 0.2美元的价格运行——相比最初定价降了八成。Google Gemini 3.6 Flash对长程Agent任务给出最高六成五的成本节省。整个8月,前沿模型的价格曲线像在比赛谁先触底。
竞争焦点已经换了赛道。过去比"谁的参数大""谁的跑分高",现在比"每美元能买到多少智能"。OpenAI明确以"约四分之一成本击败Fable 5"作为营销叙事,Grok 4.6强调"达到Fable 5同级但token消耗仅四分之一"——同一个逻辑:不是你更强,而是你更便宜地强。
不过,便宜的通道正在收窄。DeepSeek官方预告重大涨价,低价红利期可能进入尾声。对依赖DeepSeek低价API做应用的团队来说,现在到年底是个窗口期——趁价格还没涨,把Agent工作流跑通、把调用密度提上去,比等"更好的模型"更实在。
对南宁的AI应用团队来说,这一轮降价潮意味着什么?用同样的预算,你可以在Agent工作流里塞进更多次模型调用、更多轮自我纠错、更长的上下文窗口。拿多模态Agent来说,一次任务可能需要模型看图、理解指令、执行操作、反馈结果,四五个调用叠起来,价格降两成就等于免费多跑一轮。南宁大模型应用的开发成本正在快速下降,关键是能不能在价格涨回去之前把产品跑通。
8月21日,DeepSeek正式上线实验性多模态视觉理解模型V4-Flash-Vision-Exp。简单说——DeepSeek终于"长眼睛"了。
这个模型支持图片输入,多模态Agent能力已经接近Claude Opus-4.8的水平。但真正让开发者兴奋的不是"接近"这个定性描述,而是成本数字——延续V4-Flash的定价策略,单张图片最高只占384个token。
对比一下:很多主流多模态模型处理一张图要吃掉几千甚至上万token。一张图384 token,意味着用1美元的预算可以处理上万张图片。在视觉理解这个赛道上,DeepSeek几乎是在用"白菜价"提供"准旗舰级"的能力。
同步开放的还有免费Files API。开发者可以上传文件,让模型读图、看文档、解析图表,然后直接接入Agent工作流。而且这个视觉模型跟DeepSeek Harness 0.1.1原生打通——意味着视觉理解不再是"先调一个视觉模型输出描述,再调一个文本模型做推理"的割裂流程,而是在同一个Agent框架内闭环完成。
我想多说一句这个"原生打通"的价值。过去做多模态Agent,最痛苦的不是模型不够强,而是拼接成本太高:视觉模型输出一段描述,文本模型再基于这段描述推理,中间的信息损耗和延迟叠加起来,体验往往不如直接用人工。原生打通意味着视觉输入直接进入Agent的推理链,不需要中间翻译层。
这对需要"看图决策"的场景——比如UI自动化测试、文档审核、工业质检——是实打实的效率提升。以前你要先调视觉模型识别截图中的按钮位置,再调文本模型决定点击哪个,两步之间可能丢信息。现在一个模型搞定,延迟减半,信息不丢。
从南宁模型微调的角度看,DeepSeek视觉模型的低价策略给本地AI团队一个低成本试错的机会。与其花大价钱调一个闭源多模态模型,不如先用V4-Flash-Vision-Exp把应用原型跑起来,验证场景可行性,再决定要不要投入微调资源。384 token的图片成本意味着你可以用几百块钱跑几千张图的测试——这在半年前是不可想象的。先验证,再投入,这个顺序在AI应用开发里永远比"先买最贵的模型"靠谱。
如果说降价和视觉补齐解决了"成本"和"感知"问题,阿里Qwen-UI-Agent解决的是最硬的骨头——真实环境落地。
8月21日,阿里巴巴推出GUI智能体基座模型Qwen-UI-Agent,覆盖移动端、电脑端、网页端和深度搜索环境。数据很硬:MobileWorld测试得分82.1,领先多个国际旗舰模型;自建百台真机基准MobileWorld-Real上成功率超九成;Android Daily接近满分;电脑端OSWorld-Verified取得79.5分;WebArena网页测试位列所有对比模型第一。
但这些数字里,最有价值的不是92.2这个绝对值,而是"真机"两个字。
过去GUI Agent的测试大多在模拟器里跑——模拟器干净、稳定、可复现,但跟真实手机差了十万八千里。真实设备上App会弹更新提示、系统通知会遮挡按钮、网络波动导致加载失败、不同品牌手机的UI定制层千差万别。模拟环境跑90分的Agent,到了真机上可能只有50分。
阿里团队的做法是直接搭了覆盖100多台真实手机、150多个应用的真机移动环境,用于任务构建、轨迹采集和模型训练,并推出包含400多个任务的MobileWorld-Real真机基准。这意味着模型的训练数据本身就来自真实设备,而不是模拟器生成的"干净"数据。训练数据的真实性决定了模型在真实环境里的可靠性——这是一个经常被忽略但极其关键的工程细节。
功能设计上有几个值得拆开看的点:
对南宁智能体开发团队来说,Qwen-UI-Agent的开源意味着可以直接在真机Agent场景上做二次开发。不管是做企业内部的移动端RPA、还是给客户做自动化测试工具,真机超九成的成功率已经跨过了商用门槛。与其从零训练一个GUI Agent,不如在这个基座上针对垂直场景做微调——比如专门针对某类App的交互模式做强化学习,把九成出头提到九成五以上。开源模型的最大价值不是免费,而是你可以拿到训练数据和方法论,站在巨人的肩膀上做场景化深耕。
GPT-5.6降价两成是价格维度的信号,DeepSeek补视觉是能力维度的信号,阿里真机超九成是落地维度的信号。三件事叠在一起,传递的信息很明确:前沿模型的调用成本在快速下降、多模态能力在快速补齐、Agent在真实环境中的可靠性已经跨过商用门槛。
行业里有个数据值得注意:近九成的组织报告在至少一个业务环节使用了AI,但八到九成五的AI项目仍然无法交付承诺的回报。问题不在模型不够强,而在数据和集成的工程瓶颈。当模型价格降下来、能力补上来、可靠性提上来之后,剩下的变量就是工程能力——你的场景理解、数据积累、工作流设计。
对做AI应用的团队——不管是南宁还是其他城市——现在是把"实验性Agent"变成"生产级Agent"的窗口期。别等"更好的模型"。用现在的价格、现在的能力、现在的真机成功率,把你的Agent应用跑起来。模型会迭代,但你的场景理解、数据积累和工程经验不会自动长出来——这些才是真正的护城河。