扩散模型颠覆文字生成、英伟达万亿开源、字节10万亿赌数据:8月AI三个底层信号

阅读: 371 评论: 0

标签:

从"逐字打稿"到"整段喷墨":扩散模型杀入文字生成

你盯着手机屏幕等AI回复的那几秒钟里,模型正在做一件极其低效的事:它先把整本"字典"翻一遍,算出第一个字,然后再把字典翻一遍,算第二个字。每出一个字,整个模型就得从内存里重新"唤醒"一次。这个机制叫自回归生成,从GPT-2到GPT-5.6,几乎所有主流大语言模型都这么干活。

芯片的大部分时间不是在"思考",而是在等内存把数据搬过来。谷歌DeepMind的工程师觉得这太蠢了。8月4日,他们发布了一篇编号为arXiv:2608.00146v1的技术报告,给出了一个不同的答案——DiffusionGemma。

这个模型不再一个字一个字地吐,而是一次性规划256个词的完整"草稿",然后像雕刻师打磨石块一样反复修改,直到草稿变成流畅准确的回答。思路来自扩散模型——就是之前用来生成图片的那套技术,从一团噪点中逐渐"显影"出画面。现在DeepMind把它搬到了文字上。

效果相当炸裂。在单张NVIDIA H100 GPU上,DiffusionGemma每秒能生成约1500个词,是同等规模传统自回归模型的7倍以上。跟配备了KV Cache等专业加速技术的竞争模型比,也有近5倍领先。更关键的是,速度提升没有以牺牲智能为代价:在数学推理、编程、常识问答、多模态理解等多项评测中,DiffusionGemma的得分依然排在同类文字扩散模型的最前列,跟一些顶级闭源商业模型形成了正面竞争。

说实话,这个方向我盯了大半年了。扩散模型做文字不是新概念,但之前的尝试要么生成质量太差,要么速度优势不明显,始终停在论文阶段。DeepMind这次把质量拉到了能跟商业模型掰手腕的水平,意味着"扩散生成文字"可能真的要走出实验室了。

对企业来说,这件事的意义很直接:推理成本可能要掉一个台阶。目前大模型API定价的基本盘就是推理算力成本,推理快7倍,理论上单位token的成本就能压到原来的七分之一甚至更低。如果DiffusionGemma的技术路线被验证可规模化,整个行业的定价模型都得重算。

英伟达造万亿参数开源模型、Meta跟进Muse Spark 1.2:开源从"可选项"变成"必答题"

8月11日,多家媒体报道英伟达正在开发新一代开源AI模型Nemotron4,参数规模至少达到1万亿。目标是跟全球领先的开源大模型正面竞争。英伟达此前已经推出过Nemotron系列,包括3400亿参数的Nemotron-4340B,主要用于训练数据生成和企业AI应用。但这次直接拉到万亿级别,信号很明确:卖芯片的也要做生态。

英伟达的逻辑不难理解。开源模型越多、用得越广,对GPU算力的需求就越大。Nemotron4不是要跟OpenAI抢API收入,而是要让更多企业有理由买更多卡。这是一笔"送软件赚硬件"的账。但客观上,万亿参数级别的开源模型一旦发布,对整个开源生态又是一次水位抬升。

几乎同一时间,扎克伯格在8月10日宣布开源最新模型Muse Spark 1.2,并同步推出端侧模型系列Muse Glimmer。他还在公开场合呼吁美国政府重新审视模型蒸馏和训练数据使用政策——这话说得相当直白,翻译一下就是:别限制我们用公开数据训练模型,也别限制我们向其他模型学习。

扎克伯格急了,有原因。OpenRouter最新数据显示,8月3日至9日全球AI大模型总调用量69万亿Token,中国达到34.25万亿,环比增长21.76%,连续十五周超过美国。全球调用量前五名全部被中国模型包揽。这个趋势已经不是一两周的事了——从5月开始,中国模型在OpenRouter上的周调用量就稳定领先,而且差距还在拉大。

中国开源模型的海外渗透率也在飙升。从去年同期的4.5%涨到了如今的46%,Coinbase、Lindy、Floxy等一批海外公司已经从Claude/GPT迁移到了国产模型。原因很简单:能力够用,价格只有几分之一。

把这些信号串起来看,开源已经从"大厂的可选项"变成了"必答题"。英伟达做万亿开源是为了卖卡,Meta做Muse Spark是为了保住开发者生态,中国厂商做开源是为了抢全球调用量份额。动机各异,结果一致:开源权重模型的数量和质量都在加速膨胀。

对企业用户来说,这意味着选模型时不用再被某一家厂商"卡脖子"了。同档位能力的开源模型越来越多,部署灵活性大幅提升。但反过来,模型选择本身也在变成一个技术活——怎么评估、怎么部署、怎么在多个开源模型之间做路由,这些都需要专门的工程能力。

字节为10万亿参数先建"数据部队":全球AI正在撞上数据墙

字节跳动最近做了件不太引人注意但意味深长的事:成立了一个新的一级部门"AI数据与安全",跟Seed、Flow、抖音平行。

一个数据团队升格为一级部门,在互联网公司里并不常见。据36氪报道,这个部门的前身是2023年成立的GlobalData,百人左右,最早服务Dola和TikTok的国际业务。后来字节大模型业务越铺越开,数据团队也越来越多——集团数据中台DMC、Flow旗下AI数据平台AIDP、Seed内部各方向的数据团队,各干各的,做的事情越来越重叠。这次整合,等于把分散的数据团队收拢成一个"正规军"。

时间点也巧。金融时报近日援引知情人士报道称,字节正在预训练一个参数规模最高可能达到10万亿的超级模型,目前仍处于早期阶段。如果最终做到这个规模,它将成为全球参数量最大的AI模型之一。

但真正有意思的是,字节CEO张一鸣在约一个月前的Seed全员会上明确反对通过蒸馏外部模型来追赶。据The Information 8月5日报道,张一鸣认为字节应该"为长期目标牺牲一些短期利益",即使Seed阶段性落后,也不应靠蒸馏竞争对手的模型来补差距。

一边奔着10万亿参数去,一边又不让抄作业,那只能自己准备更多"教材"。这就是数据团队升格的底层逻辑。

字节遇到的问题,其实是所有还想继续Scaling的大模型公司共同面对的。2022年DeepMind的Chinchilla论文发现,模型参数翻倍,训练数据量也应该同步增加。但参数可以继续堆,GPU可以继续买,互联网上人类写出来的好东西却是有限的。

研究机构Epoch AI估算过,全球公开的人类文本大约相当于300万亿Token。按照大模型训练数据规模的增长速度,这批数据可能在2026到2032年之间被充分利用。如果模型为了降低推理成本而做更长时间的"过度训练",时间还会提前。

公开互联网不够吃了,大厂开始往围墙外面找。2024年Google跟Reddit签了每年约6000万美元的内容授权协议;OpenAI跟NewsCorp达成多年合作,把华尔街日报、泰晤士报的内容纳入训练范围。更专业、更稀缺的数据,开始需要专门找人生产——代码、数学、科学领域,大模型公司直接雇佣工程师和博士参与训练数据生产。

最极端的案例是Anthropic。华盛顿邮报今年1月根据法院解封文件披露,Anthropic早在2024年就启动了一个内部代号"Project Panama"的项目:批量采购数百万册实体书,用液压设备切掉书脊,散开的书页送进高速扫描仪,数字化后回收原书。内部文件甚至把目标写成"破坏性扫描全世界所有的书"。更早之前,Anthropic还从LibGen等影子图书馆下载了超过700万册盗版书籍。今年7月,美国联邦法院正式批准了Anthropic 15亿美元的和解协议——这是已知规模最大的美国版权诉讼和解之一。

15亿美元的和解金,换个角度看,就是给高质量数据标了一个极其夸张的价格。书可以买,版权可以买,专家也可以花钱请,但真正没被模型吃过、又足够好的数据,不会随着参数一起凭空长出来。

回到企业视角。对大多数企业来说,10万亿参数的模型离自己很远,但数据工程这件事离自己很近。过去两年,很多企业的AI战略是"选哪个模型",接下来会变成"拿什么数据去喂模型"。企业内部的业务数据、流程数据、交互数据,这些是公开互联网上买不到的,也是企业做AI差异化竞争的真正护城河。

数据治理、数据质量管控、数据标注工程——这些过去被认为是"脏活累活"的事,正在变成跟算法和算力一样需要单独组织、持续投入的工程体系。字节把数据升格为一级部门,不过是走在了前面。

三个信号指向同一个方向

扩散模型提速7倍、万亿参数开源成潮流、10万亿参数撞上数据墙——这三件事看似各干各的,其实指向同一个判断:AI行业正在从"暴力美学"走向"精打细算"。

过去几年,大模型变强的办法简单粗暴:更多参数、更多算力、更多数据。但这三样东西都不是无限的。DiffusionGemma在生成机制上找效率,开源模型在生态层面摊薄成本,数据工程在原料端做精细化管理——各自从不同角度回应同一个问题:怎么用更少的资源做更好的智能。

对企业的建议也很直接:别只盯着模型选型,把数据资产梳理好、把业务场景里的高质量数据沉淀下来,可能比追最新模型版本更有价值。模型每个季度都在更新,但你手里的业务数据,别人永远拿不到。

上一篇 > 8月20日《数据安全风险评估办法》倒计时9天:撞上「专精特新+数据资产」双窗口,B2B软件公司的三个卡位方向
下一篇 > 8月中小企业政策三连击:50亿转型基金、个人信息简化与专精特新扩容