返回首页

自适应液态变压器:人工智能能效的突破

麻省理工学院的研究人员引入了自适应液态变压器,根据任务复杂度实时禁用不必要的人工智能参数。与NVIDIA Rubin芯片配合使用时,可节省40-70%的内存,改变数据中心的经济性。该技术有利于超大规模企业,但对NVIDIA构成长期风险,对AMD至关重要。

液态变压器如何淘汰旧GPU集群
Advertisement 728x90

自适应液态Transformer:能效领域的突破性进展

马萨诸塞州的研究人员推出了一种新型AI架构,可根据任务复杂度实时动态调整参数。结合Rubin芯片,内存消耗最多可降低40%。


无人察觉的突破:为何“液态Transformer”比任何危机都更快地冲击芯片行业

马萨诸塞州的另一条新闻看起来像典型的学术实验室新闻稿:“自适应液态Transformer根据任务复杂度动态调整参数,与Rubin芯片配合使用时,最多可节省40%的内存。”研究人员很高兴。记者们转载这些数字。投资者耸耸肩——不过是又一项优化,没什么大不了的。

但作为一个在过去五年里追踪架构创新如何实际影响市场的人,我看到的不仅仅是“改进”,而是一场让当前一半AI投资变得毫无意义的地壳运动。头条新闻没有说的是:这项技术是朝着让庞大、耗能的GPU集群像蒸汽机一样过时迈出的真正第一步。对NVIDIA来说,最可怕的部分是——这一切正发生在他们自己的芯片上。

Google AdInline article slot

让我们来剖析一下马萨诸塞州究竟展示了什么,为什么它敲响了当前“瓦数越高越好”商业模式的丧钟,以及谁才能真正从这场“静悄悄的革命”中获益。


[核心]:“聪明懒惰” vs. “蛮力”

当前的LLM像白痴天才一样工作:对于任何查询——从“你叫什么名字”到“写一篇关于量子物理学的论文”——它们都会激活全部1000亿到2000亿个参数。这就像每次看时间都要打开一个10千瓦的探照灯。2017年创建的Transformer架构从根本上说是低效的:它在计算阶段不区分简单和复杂的任务。

MIT的研究人员引入了一种机制,可以实时分析输入token并动态禁用不必要的权重(自适应参数)。在实践中,这意味着:当用户输入“你好”时,大约5%的神经元被激活。当查询复杂时——80%甚至100%。这不是经典意义上的新架构——它是在现有Transformer之上的“手术”,可以在软件层面(通过特殊驱动程序)或芯片微码层面实现。

Google AdInline article slot

与NVIDIA Rubin芯片(我们知道,每块GPU拥有高达22.2 TB/s的巨大带宽,并与HBM4内存配合使用)搭配时,这种效果会倍增。在Rubin的背景下,40%的内存节省的说法并不是关于需要更少的千兆字节。而是关于能够在相同内存容量(每个Rubin NVL72机架2.3 TB)下将批处理大小(并行查询数量)提高40-50%。换句话说,一台每秒处理1000个查询的服务器,在相同功耗下将开始处理1400-1500个查询。这从根本上改变了数据中心的 economics。

[时间线与背景]:8年的架构死胡同

条件计算和混合专家(MoE)的概念早已为人所知——谷歌早在2020年就发布了GShard。但之前的所有尝试要么需要从头重写模型,要么引入了过多的开销(协调专家的成本),吞噬了所有收益。自适应液态Transformer(或在原始论文中称为“灵活动态Transformer”)通过面向硬件的方法解决了这个问题。

注意日期:早在2025年4月,韩国研究人员(高丽大学)发表了关于TP-DCIM的工作,提出了一种用于Transformer的双线CIM架构,性能提升了2.5倍。那是一只“燕子”。MIT现在展示的是这些想法的直接演进,但针对特定的NVIDIA Rubin芯片进行了适配,这些芯片于2026年上半年开始量产。

Google AdInline article slot

这种同步性并非巧合。NVIDIA的工程师在设计Rubin时,知道它达到了物理极限——功耗高达2.3 kW,机架带宽176 TB/s。功耗无法再增加——触点会熔化。唯一的出路是让芯片减少浪费。就在Rubin上市时(根据NVIDIA的路线图,2026年底到2027年初),一个软件补丁出现了,使这些芯片的效率大幅提升。这并非巧合。这是整个平台的“保全面子”之举。

[谁赢谁输]

NVIDIA(短期赢,长期输)。

到2026年底,这是胜利。Rubin的销量将飙升,因为超大规模云服务商(微软、谷歌、亚马逊)将看到:你可以在一个机架上插入相同的72块Rubin GPU,支付电费(不会变得更便宜),但每秒获得40%更多的有用token。投资回报率变得有1.5到2倍的吸引力。但从长期来看(2027-2028),这项技术对NVIDIA的打击比AMD的竞争更严重。因为它降低了专用硬件的价值。如果“聪明懒惰”在Rubin上有效,那么它将在更便宜、性能更低的AMD芯片甚至下一代ARM处理器上同样有效。NVIDIA失去了其“速度优势”的排他性。

微软、谷歌、亚马逊(大赢家,每年节省高达50亿美元)。

这些公司在数据中心上花费数百亿美元。对他们来说,40%的内存节省意味着他们可以将新建数据中心的时间推迟12-18个月。仅微软一家,据我估计,通过在Rubin服务器上实施这项技术,2027年将在资本支出上节省约30-40亿美元。他们会立即将这个补丁集成到Azure堆栈中。对他们来说,这是一个“免费”的性能升级。

AMD和初创公司(输,关键性)。

AMD刚刚发布了Instinct MI455X,本应通过更好的性价比与Rubin竞争。MIT的自适应架构使得“原始瓦数”的优势(AMD的1.7 kW TDP vs. NVIDIA的2.3 kW)变得不那么重要。如果NVIDIA凭借软件领先40%的优势交付相同的最终结果(推理加速),AMD将无计可施。他们需要紧急与研究团队谈判以适配他们的芯片,但时间已经失去——Rubin已经在生产中。

[媒体没有说的]

第一个非显而易见的见解:在生产环境中,实际节省可达60-70%。 MIT展示的是“单查询推理”任务的实验室条件。在运行数千个并行流的真实数据中心中,包括代码生成、客户支持和推荐系统,查询复杂度的差异比基准测试中要大得多。此外,结合早期退出机制(如果答案已经找到,模型停止计算深层),自适应Transformer在简单查询上可节省高达70%。为什么这件事被保密?因为70%听起来像魔法,而投资者不相信魔法。

第二个见解:这项技术扼杀了“全包”商业模式。 目前,云服务提供商(OpenAI、Anthropic)以每个token的固定价格出售模型访问权限。但如果服务一个简单查询的成本比复杂查询低3-4倍,而用户支付的价格相同,那么提供商从“愚蠢”用户那里获得超额利润。然而,竞争将迫使他们降低简单操作的价格。到2027年中,我们将看到按“复杂度单位”而非token定价。

第三个最 cynical 的见解:Rubin并非为这项技术而设计。 MIT工程师使其效率提高40%是一个源于HBM4内存架构的幸运巧合。但真正的“突破”将发生在NVIDIA从头开始为自适应计算设计“Rubin Ultra”或下一代(比如“Hopper Next”)时。这不会在2028年之前发生。在此之前,我们将目睹“技术精神分裂症”:硬件可以物理上以100%运行,但软件受限于自适应算法的不成熟。

[预测:未来30天和90天]

未来30天(2026年6月下旬至7月):

专利战将开始。MIT可能已经提交了专利,但NVIDIA聘请了顶级律师,辩称“对复杂度的自适应调整”是混合专家技术的明显扩展,而他们拥有来自谷歌的交叉许可。结果将在一个月内决定——最有可能的是,NVIDIA将一次性支付5-7亿美元买断,并将该技术纳入定于8月发布的CUDA 14 SDK标准版。对NVIDIA来说,这只是零花钱。

90天(2026年9月):

来自第三方实验室(如MLPerf)的首批真实基准测试将发布。“40%”的数字将变成“23-28%”(因为实际上,任务差异不像MIT中那样极端)。NVIDIA的股价将下跌5-7%,因为市场意识到:“软件正在追赶硬件”,这意味着无尽的功耗竞赛正在结束。开发者将悄然迁移到亚马逊(Trainium 3)和谷歌(TPU v7)的ARM兼容芯片,因为这些开放架构可以更快地适配“液态”方法,而不受CUDA向后兼容性的限制。

在90天内,主要云服务提供商将开始公开测试价格歧视网格。AWS将提供“经济推理模式”(利用自适应内存节省),比标准模式便宜35%,将“全功率”留给高级客户。这将引发一场价格战,消费者获胜,AI服务的利润率开始下降。然后,“能效突破”将转变为整个行业的“盈利危机”。正如经常发生的那样。

— Editorial Team

Advertisement 728x90

继续阅读