https://www.youtube.com/watch?v=NcqHQmpNjr0
AI推理效率之争:从n-gram到AgentX,TPU v7与Vera Rubin的硬件竞赛
分段详情
第一部分 引言与开场 (0% - 5%)
- 主持人介绍:Dylan欢迎听众回到《Semi Analysis Weekly》播客,本期将与InferenceX团队的Cam、Bryan和Alec一起讨论多个话题。
- 本期主题概览:将讨论n-grams(一种模型架构)、AgentX(一个针对智能体编码的基准测试)、TPU(谷歌的张量处理单元)以及其他想到的话题。
- 团队状态更新:距离上次邀请InferenceX团队已有两个月,他们在此期间一直在努力工作。
第二部分 n-gram技术详解与动机 (5% - 25%)
-
1. n-gram的基本概念与工作原理
- n-gram模型的概念已经存在一段时间,其核心思想是在训练阶段学习多个token(如二元组、三元组)组合的含义,并将这些含义存储在嵌入向量中。
- 在推理时,这些预学习的含义可以通过哈希表直接查找,从而避免了在Transformer层中逐层构建语义的过程,几乎可以“免费”获得信息。
- 通过DeepSeek的实验图表可以看出,完全由MoE(混合专家)层构成的模型与完全由n-gram层构成的模型相比,损失函数值在两者混合使用时达到最低点,表明混合架构性能最佳。
-
2. n-gram的设计动机与历史背景
- 动机:传统模型需要在后续层中逐步构建词语的语义表示。n-gram通过让早期层的隐藏状态与后期层的隐藏状态之间的KL散度更低,证明模型能更早地进行下一个token预测,从而节省了用于记忆语义的参数。
- 协同设计:DeepSeek擅长在模型架构设计时就考虑推理效率。n-gram模块的输入仅仅是token ID,因此它可以与其他模型部分异步重叠执行,减少等待时间。
- 放置位置的权衡:
- 将n-gram层放在模型前面,能最大程度地帮助模型尽早引入记忆,但缺点是此时没有其他计算可以与之重叠,必须等待检索完成。
- 例如,Qwen 3.8 Flash Next将n-gram放在第二层,利用第一层的时间进行检索,从而几乎没有开销。而DeepSeek V4.1 Flash将其放在第一层,虽然仍有重叠空间,但不如前者高效。
-
3. n-gram与HBM限制及中国芯片生态的关系
- 核心驱动因素:n-gram技术的出现和普及,根本上是受限于HBM(高带宽内存)容量不足。人们正围绕这一限制进行创新,通过n-gram将部分计算和数据(如KV Cache)卸载到DRAM或SSD。
- 中国芯片的限制与创新:
- 中国芯片在HBM带宽上受到比美国芯片更严格的限制,这迫使他们必须寻找创造性的解决方案。
- 这种限制反而催生了大量创新,例如不断压缩和优化KV Cache,并将其卸载到更低层级的内存中。
- n-gram可以被视为这一趋势的自然延伸,因为它通过将部分层“免费”化,并允许将其卸载到DRAM,从而绕过了HBM的限制。
- 结论:感觉目前很多重要的创新都来自中国的实验室,因为他们面临更严苛的硬件条件。
第三部分 AgentX:面向智能体编码的新基准测试 (25% - 45%)
-
1. AgentX的提出背景与目标
- 动机:传统的AK1K基准测试无法准确反映现代AI应用(特别是智能体编码)的真实工作负载模式。
- 目标:开发一个能更精确代表智能体编码工作模式的基准测试,并应用于所有新模型,同时发布数据集和初步结果。
-
2. AgentX的工作负载特性
- 模拟真实场景:AgentX模拟的是智能体编码的流量。在这种场景下,模型会收到消息、输出结果、调用工具、将工具输出追加到消息流中,然后再发送给模型。由于模型是无状态的,KV Cache会在每次交互中快速增长。
- 高缓存命中率:在这种工作模式下,理论上的缓存命中率非常高(超过98%)。因此,系统的关键在于如何在现实中实现这98%的缓存命中率,即如何高效地存储、传输和路由KV Cache。
-
3. AgentX的应用与发现
- 评估系统级性能:AgentX不再仅仅测试芯片级别的性能,而是测试整个系统,包括KV Cache在芯片间的移动、预填充和解码分离场景以及数据卸载的效果。
- 卸载的重要性:在高吞吐量场景(如离线批量推理或强化学习回滚)下,将KV Cache卸载到DRAM变得极其重要。数据显示,通过DRAM卸载可以实现20-30%的额外缓存命中率提升。
- 盈利计算器:结合InferenceX的TCO(总拥有成本)模型和OpenRouter的API定价数据,可以计算出不同芯片和配置下的利润率。例如,在特定参数下,使用GB300运行Kimi K3模型可以获得约40.70%的利润率。这表明,在当前环境下,运行开源推理模型就像一台“印钞机”。
-
4. 数据的真实性与代表性
- 数据来源:AgentX的数据集是通过拦截SemiAnalysis所有员工的智能体编码会话获得的,经过后处理后,在真实服务器上重放。
- 代表性:虽然不能完美代表所有智能体编码流量,但所有编码智能体的工作模式本质上是相似的:接收任务、使用工具、获取上下文、循环迭代。因此,这个数据集具有很强的代表性。
第四部分 TPU v7:谷歌的开放与竞争 (45% - 55%)
-
1. TPU v7的性能表现
- 首次公开可购:TPU v7是谷歌第一款通过自家云平台对外公开销售的可购买加速器。
- 性能对比:在与B200和B300的对比中,TPU v7在大多数情况下都处于帕累托最优曲线上,意味着它是成本最低的选择(每百万token的成本)。
- 潜力巨大:考虑到这是TPU在开源推理上的早期表现,并且其TCO(总拥有成本)非常有竞争力(约1.21美元),未来通过软件优化,性能只会更好。
-
2. TPU的未来趋势与挑战
- 外部化趋势:随着TPU v7的成熟和v8的到来,谷歌将停止将所有TPU用于内部工作负载,转而向外部销售更多算力。
- 生态系统改善:开源生态将得到巨大改善。例如,原生PyTorch后端(torch-tpu)即将推出,这将极大地简化编程模型,并立即提升开源推理的性能。
- 硬件与软件挑战:
- TPU基于脉动阵列,优先考虑数据移动。但其固定大小的阵列在处理小规模模型时需要填充,造成计算浪费。过去,谷歌内部模型为此做了优化,而开源模型没有。
- 尽管存在挑战,但TPU的外部化是一个重大事件,它将成为AMD和NVIDIA之外的第三个真正竞争者。
第五部分 Vera Rubin:NVIDIA的持续进化与性能飞跃 (55% - 65%)
-
1. Vera Rubin vs. Grace Blackwell:增量改进还是重大升级?
- 架构变化较小:从GB300到VR NVL72,在软件支持和物理部署方面属于较小的改进。没有新的ARM CPU,也没有重大的Scale-Up网络变革,液冷部署经验也已普及。
- 性能提升显著:尽管如此,性能提升是巨大的。在中等交互性区间(如100 tokens/s),性能是前代的3倍。这主要归功于从HBM3到HBM4带来的近3倍内存带宽提升。
-
2. 关键技术亮点:LUTB量化
- 什么是LUTB:Vera Rubin引入了名为LUTB(查找表B)的硬件加速路径。它使用3位键来查找8位查找表中的值,从而将权重压缩至约3.125位。
- 意义:这是NVIDIA首次为特定量化方案提供硬件加速路径。虽然目前还没有看到具体的应用案例,但这为未来的模型优化提供了新的可能性。
-
3. 市场与商业影响
- 盈利优势:Vera Rubin更高的性能使其在盈利计算器上表现更佳。由于其性能大幅提升而定价并未同比例增长,这使得它成为更具吸引力的选择。
- 结论:NVIDIA再次展示了其领先地位,Vera Rubin在推理任务上比Blackwell更高效,是一个更好的投资选择。
第六部分 关于“快Token”的辩论与未来展望 (65% - 85%)
-
1. 正方观点(看空“快Token”)
- 工具调用瓶颈:智能体任务的核心在于调用工具,而工具的执行时间(如30秒)远长于Token生成时间。因此,即使生成速度极快(如1000 tokens/s),整体任务完成时间并不会显著缩短。
- 多智能体并行:个人用户通常同时运行多个智能体,单个任务的完成速度并不重要,因为回来时任务通常已经完成。
- 成本过高:超高速Token服务的价格极其昂贵(如300美元/百万输出Token),投资回报率不高。
-
2. 反方观点(看好“快Token”)
- 用户体验:当模型响应极慢时,用户会感到沮丧。如果能实现瞬时输出,将极大提升某些场景下的体验。
- 推理模型的需求:对于需要进行大量推理的模型(如思维链),快速的解码速度至关重要。
- 未来不可预测:一年前的使用习惯与现在截然不同,很难预测未来是否会需要更快的Token。
-
3. 折中与未来预测
- 专业化分工:未来的智能体框架可能会根据不同任务需求,将请求路由到不同的“模式”。例如,快速启动React应用需要快Token,而过夜运行的性能基准测试则不需要。
- 规模化的必然性:历史上,计算效率的提升总是被更庞大的软件所吞噬。因此,模型不太可能变得更小,更大的模型需要更快的速度才能保持可用。
- “快Token ≠ 低效Token”:如果硬件设计得当(如使用SRAM而非昂贵的HBM),高速单批次推理同样可以高效,因为可以通过流水线化实现高有效吞吐量。
第七部分 TileRT与芯片初创公司的挑战 (85% - 95%)
-
1. TileRT:软件优化的力量
- 定义:TileRT是一个延迟优化的推理引擎,旨在实现超低延迟。
- 意义:它证明了无需依赖专用SRAM架构(如Cerebras),仅通过极致的软件优化,就能在NVIDIA GPU上实现极高的交互性(如接近500 tokens/s)。
- 工作原理:可以将TileRT视为一个覆盖整个模型的巨型内核。它在高交互性场景下表现出色,但在高吞吐量场景下不佳(目前仅支持batch size 1)。
-
2. 芯片初创公司的生存之道
- 需求远超供给:目前市场对所有类型的芯片都有巨大需求,任何能生产出芯片的公司都能找到客户。
- 真正的挑战在于商业运营:能否管理好供应链、保证良率、建造服务器和数据中心,这些商业挑战远比技术挑战更难克服。
- 异构计算的可能性:未来的芯片公司可能需要设计专用的预填充芯片和解码芯片,以在不同工作负载间取得最佳效率。
- NVIDIA的收购印证了方向:NVIDIA收购Groq表明,专用芯片确实能做通用GPU做不到的事,但关键在于能否大规模生产和部署。
第八部分 总结与展望 (95% - 100%)
- 本期内容回顾:本期节目涵盖了六篇InferenceX相关文章,包括n-gram、AgentX、Vera Rubin性能、TPU性能、DeepSeek V4.1和TileRT。
- 最令人兴奋的点:TPU登上InferenceX平台是最令人激动的事情,因为这标志着谷歌向外部开放其强大算力的单向趋势。
- 未来规划:InferenceX的目标是成为一个整合的平台,提供各种芯片在真实推理工作负载下的性能信息,未来还可能加入训练基准测试和社区功能。
通俗易懂的全文解释
这篇文章是一期科技播客的文字记录,主要讨论了AI推理领域的几件大事。
首先,他们聊了一种叫 “n-gram” 的技术。你可以把它想象成一本“成语词典”。以前,AI模型看到一个词,需要从头开始理解它的意思。现在,有了这本词典,模型可以直接查到这个常用词组的意思,省去了复杂的思考过程,从而大大加快了速度,并减少了对昂贵的高速内存(HBM)的依赖。这项技术尤其受到中国AI公司的青睐,因为他们能获得的高端芯片受限,所以被迫想出了这些巧妙的办法。
接着,他们介绍了自己开发的 “AgentX” 基准测试。以前的测试方法像“考试”,只看芯片本身有多强。但AgentX更像“实战演习”,它模拟了AI写代码时的真实场景:AI会反复调用工具、获取信息、修改代码,这个过程会产生海量的临时数据(KV Cache)。AgentX测试的就是整个系统如何处理这些数据,包括如何高效地存储和转移它们。结果发现,在这种真实场景下,只要系统优化得好,运行开源AI模型简直像开“印钞机”一样赚钱。
然后,他们分析了两个最新的AI芯片:谷歌的TPU v7和NVIDIA的Vera Rubin。TPU v7是谷歌第一次正式对外卖的最强AI芯片,性能很好,性价比很高,而且未来随着软件优化,还会更强。Vera Rubin则是NVIDIA的最新款,虽然看起来只是常规升级,但实际性能提升巨大,尤其是在处理速度上,是上一代的三倍。它还引入了一个叫“LUTB”的新技术,能进一步压缩模型大小,提高效率。
最后,他们讨论了一个有趣的问题:我们真的需要快到飞起的“快Token”吗? 一部分人认为没必要,因为AI写代码时,大部分时间都在等工具运行(比如上网搜资料),生成文字的速度再快也没用,而且这种高速服务还很贵。另一部分人则认为,速度快肯定更好,尤其是对于那些需要复杂思考的模型来说。最终大家觉得,未来的AI服务可能会像“高速公路”一样,既有普通车道,也有快车道,根据不同的任务需求灵活切换。
Top comments (0)