阅读: 469 评论: 0 点赞: 0 发布时间:发布日期:2026-08-23 08:24:05
2026年8月第三周,AI模型圈出了三件让人既兴奋又摸不着头脑的事。
第一件,一个叫 Ox Alpha 的模型出现在 OpenRouter 平台上。免费,百万 token 上下文,支持文本图片视频输入。最关键的,它在编程基准上超过了 GPT-5.6。没人知道是谁做的。OpenRouter 只透露了三点:百万 token 上下文窗口、支持文本图片视频三模态输入、不使用用户的输入提示和生成内容做训练。这个模型上线不到 24 小时就被接入了生产环境。
第二件,法律科技公司 Harvey 基于 Moonshot AI 的开源模型 Kimi K3,训练出了法律专精模型 Tenet。在 LAB 法律基准测试上,全通过率提升了 82 个百分点,运营成本不到主流基座模型的四分之一。Kimi K3 本身 2.8 万亿参数权重在 7 月中旬就完全开源了,任何人都可以下载、微调、部署。
第三件,一家叫 Generalist AI 的公司发布了 GEN-1.5 具身智能基座模型。给它 3 到 12 秒的操作演示视频,它就能学会一个物理任务,一次成功率约六成。给它 5 分钟数据做 10 步梯度微调,成功率拉到八成以上。这个模型跑了八个月的物理交互数据预训练。
说实话,这三件事单独看都不算惊天动地,但放在一起你会发现一个共同模式:AI 模型的竞争焦点正在从"谁的通用模型最强"转向三个新方向——匿名化、领域专精和具身落地。我管这叫"非通用赛道"。
先说 Ox Alpha。这个模型 8 月 20 日出现在 OpenRouter 平台上,定位是"为编程和持续智能体工作设计的隐身模型"。所谓"隐身",就是连提供方都不公开。OpenRouter 只透露了三点:百万 token 上下文窗口、支持文本图片视频三模态输入、不使用用户的输入提示和生成内容做训练。
最让人在意的是它的性能。多个独立评测显示,Ox Alpha 在编程基准上的得分超过了 GPT-5.6。GPT-5.6 是 OpenAI 当前最强的编程模型,8 月初刚发布,背后是整个 OpenAI 的算力、数据和工程团队。一个来路不明的匿名模型在编程能力上压过它,这件事本身就值得琢磨。
更值得关注的是采用速度。据 OpenRouter 方面的信息,Ox Alpha 上线后不到 24 小时就有团队把它接入了生产环境做智能体编程。一个匿名模型,没有品牌背书、没有安全白皮书、没有负责人出来发社交媒体,开发团队凭什么信它?
我认为答案在两个字:结果。当你跑一遍基准测试、跑一遍真实任务,发现它的输出质量确实好、延迟也合理、而且免费,品牌不品牌的就没那么重要了。这跟开源软件的逻辑一样——你不会因为不知道某个操作系统内核贡献者的真名就不用他的补丁,只要代码能跑通就行。
Ox Alpha 代表的是一种新的 AI 分发模式:能力与品牌脱钩。过去你用 GPT 是因为信任 OpenAI,用 Claude 是因为信任 Anthropic。现在出现了一种"能力先于身份"的模型,用户靠基准测试和实际使用效果做判断,不靠品牌。
这对行业格局意味着什么?我个人的判断是,匿名模型不会取代主流厂商,但它会压缩品牌溢价空间。当一个免费匿名模型能打平甚至超过收费旗舰,"因为它是大厂出品所以贵两倍"这个逻辑就站不太住了。对中小企业来说尤其有意义——你可以先用匿名模型跑原型验证,确认效果后再决定是否迁移到有品牌保障的付费模型。我们自己在南宁做大模型应用开发时,这种"先验证后付费"的策略已经在用,Ox Alpha 的出现进一步降低了试错成本。对于正在做南宁模型微调项目的团队来说,多了一个免费的基座选项,可以在后训练实验中作为对照组快速验证效果。
第二件事更有实际落地意义。Harvey 这家公司专做法律 AI,之前一直用通用大模型做法律任务,效果不够精准。这次他们换了个思路:直接在 Moonshot AI 开源的 Kimi K3 权重上做法律领域后训练,产出了专精模型 Tenet。
几个关键数据。在 LAB 法律基准测试上,Tenet 的全通过率提升了 82 个百分点。同时,它的运营成本不到主流基座模型的四分之一。Harvey 还配套发布了三个子智能体模型,分别针对并购尽调、文档审查和律所知识管理三个法律场景。
为什么这个案例重要?因为它验证了一条可行性极高的路径:拿开源大模型权重,针对特定领域做后训练,得到成本远低于通用旗舰的专精模型。Kimi K3 的 2.8 万亿参数权重在 7 月中旬就完全开源了,任何人都可以下载、微调、部署。Harvey 做的本质上就是"站在开源巨人的肩膀上修一条法律专线"。
这条路径对广西本地的软件服务商特别有启发。我们做南宁模型微调项目时,经常遇到客户说"通用大模型在我们行业用着不够准"。以前要么自己从头训(成本太高),要么买商业接口做检索增强(精度有天花板)。现在有了像 Kimi K3 这种完全开源的旗舰级权重,针对医疗、法律、制造等垂直领域做后训练,成本和精度都可以接受。Harvey Tenet 证明了一件事:在开源基座上做领域精修,可以在特定任务上大幅超越通用旗舰,同时把成本压到四分之一。
Tenet 的发布还揭示了一个结构性的趋势:AI 模型的市场正在分层。顶层是少数几个通用基座(GPT-5.6、Claude Opus 5、Kimi K3 等),中间层是各领域的专精模型(法律、医疗、金融等),底层是面向具体业务流的智能体。Harvey 的三个子智能体就属于底层——它们基于 Tenet,但进一步针对并购尽调、文档审查做了任务级优化。这个三层结构跟传统软件从操作系统到中间件到应用软件的分层逻辑很像。
对于广西的软件公司来说,这个分层结构意味着新的商业机会。你不需要自己训基座模型(那是大厂的事),也不需要自己训领域专精模型(那是行业头部公司的事),但你可以基于这些专精模型构建面向具体业务场景的智能体。比如我们做南宁企业数字化项目时,完全可以基于某个法律专精模型,构建合同审查智能体、合规检查智能体,嵌入客户的管理系统中。这条路径的成本远低于自己做大模型,而交付物的专业性却很高。
第三件事最有科幻感。Generalist AI 公司发布的 GEN-1.5 是一个"具身智能基座模型"。所谓具身,就是模型不光理解文字和图片,还能理解和操作物理世界。
最核心的能力是这样的:给它 3 到 12 秒的演示视频,它能学会一个物理任务。一次学习后成功率约六成。给它 5 分钟的操作数据,做 10 步梯度微调,成功率拉到八成以上。
这个数据意味着什么?在机器人领域,传统方法训练一个新任务需要大量示教数据——通常是几个小时甚至几天的专家演示。GEN-1.5 把这件事压缩到了秒级。你给它看一遍怎么拧螺丝,它就能上手试,十次里成功六次。再给它 5 分钟多看几次,十次里成功八次以上。从"需要海量训练"变成了"一次演示就能开始尝试",这是质的变化。
Generalist AI 透露了一个关键信息:GEN-1.5 经过了八个月的连续预训练,训练数据是大规模的物理交互数据。也就是说,这个模型不是用文字和图片训出来的,而是用"跟物理世界交互的经验"训出来的。这跟语言模型用互联网文本训练的逻辑不同——它学的是"动作-反馈"的因果链。
对工业落地来说,这个方向的想象空间很大。设备运维、产线操作、仓储分拣这些场景,痛点就是"通用 AI 模型不懂物理操作"。我们做南宁设备智能运维项目时,AI 可以分析传感器数据、生成维修工单,但到"实际动手修"这一步就无能为力。具身智能模型如果真能从短演示学会操作任务,设备运维的自动化程度能再上一个台阶。
当然,GEN-1.5 目前还在研究阶段,六成的一次成功率离工业级部署还有距离。但方向已经很清楚了——AI 的下一个前沿不是把语言模型做到更大,而是让模型理解并操作物理世界。我跟做机器人集成的朋友聊过,他们的判断是:具身智能从实验室到工厂车间,可能只需要一到两年。如果这个预测靠谱,2027 年我们可能会看到第一批真正能"动手干活"的 AI 模型出现在工厂里。
把三件事放在一起看,8 月第三周的 AI 模型竞争呈现出一个清晰的拐点信号。
Ox Alpha 代表"能力与品牌脱钩"——匿名模型靠效果而非品牌获取信任。Harvey Tenet 代表"开源基座上的领域精修"——用开源权重做垂直后训练,成本砍到四分之一,精度反超通用旗舰。GEN-1.5 代表"从语言到物理"——模型不再只理解文字,开始理解并操作真实世界。
三条赛道有一个共同点:都不在"谁有最大的通用模型"这条赛道上。当匿名模型能免费打平收费旗舰、当开源权重上的领域专模能以四分之一成本超越通用模型、当具身 AI 从 3 秒演示学会物理任务,"通用模型越大越强就能赢"这个叙事就开始松动了。
对中小企业的实际意义在哪?我认为有三点值得记住。第一,模型选型别只看品牌,跑基准、跑真实任务做判断,匿名模型和开源模型完全值得一试。第二,如果通用模型在你的垂直场景不够准,别急着从头训练,先看看有没有合适的开源权重可以做后训练,Harvey Tenet 已经验证了这条路。第三,关注具身智能的进展,如果你的业务涉及物理操作环节,这个方向可能在未来一到两年内进入实用阶段。
8 月还没结束,但这个月的模型发布节奏已经说明问题——11 个模型在 20 天内从 5 家以上的供应商涌出,单月模型发布密度创了新高。数量多了,但真正改变格局的,往往是那些不在主赛道上的"非通用"突破。