http://www.youtube.com/watch?v=cB_X6AImPjQ
🎬 全文标题:《AI Infra效率革命:SGLang与RadixArk如何把GPU的"硅"极限榨到尽头》
第一部分 AI造芯大战与推理拐点的到来(0% - 12%)
1 大模型竞争进入部署阶段,推理加速成为核心战场:OpenAI亮出首枚推理芯片,谷歌计划将Gemini架构直接写入硅片,Anthropic、智谱、DeepSeek也相继传出相关布局,整个AI行业突然开启"造芯大战",背后根本原因是模型竞争全面进入部署阶段,让模型更快、更便宜地跑起来变成了最重要的事,"推理的拐点已经到来"。
2 并非所有公司都能重造芯片,AI Infra成为新出路:重造芯片需要巨额资金与技术能力,绝大多数公司不具备这个条件,因此市场目光转向AI Infra——即通过对已部署的数据中心和GPU进行优化来释放潜力,这引发资本和巨头关注,成为一个新的千亿级市场。
3 AI Infra赛道商业化提速,开源推理引擎"双子星"登场:AI推理平台Baseten一年收入增长20倍,估值从21亿美元暴涨至130亿美元;同赛道Fireworks七个月内估值翻四倍达175亿美元,年化营收突破10亿美元。最近该赛道迎来强劲势力——开源推理引擎"双子星"vLLM和SGLang前后脚宣布商业化,种子轮融资均超一亿美元,背后几乎聚齐AI产业所有巨头和顶级风投,拉开强强对决大幕,"GPU的利用率"成为硅谷最新关键词。
4 本期节目嘉宾与核心议题:邀请由SGLang孵化的RadixArk联合创始人和核心成员,以及数据中心专家,共同探讨AI Infra的四层架构、行业如何把"硅"的潜力榨到极限,以及背后的关键技术。
第二部分 推理需求爆发与GPU利用率困境(12% - 27%)
1 大模型重心从训练走向推理,算力需求性质剧变:训练成本极高但任务阶段性告一段落;推理则不同,无论Chatbot还是Agent,AI应用越多GPU需处理的请求越多,且请求完全不间断,推理需求呈爆发性增长。"市面上基本所有卡都很难找到了,每一家都缺卡"。
2 巨头持续加码算力基建,但华尔街担忧重演互联网泡沫:Meta、Google、Microsoft等科技巨头持续提高资本开支,今年预计超过1万亿美元;黄仁勋预测到2030年全球AI基础设施年投资规模将达4万亿美元。但华尔街担忧不无道理——互联网时代泡沫破灭的前车之鉴中,大量光纤建设与互联网公司投资虽然长期实现了价值,短期却出现了很大问题。
3 关键出路:提高GPU利用率,引出AI Infra产业层:既然无法在短期内大规模增加算力,答案就是提高GPU的利用率,背后的产业层即为AI Infra(人工智能基础设施层)。
4 反直觉事实:GPU大多数时间其实很"闲":GPU只是整个AI系统中的一环。从用户请求进入系统开始,需经过网络传输、资源调度、模型加载、内存管理,再到最终完成推理返回结果,整个过程只要任一环节出现瓶颈,GPU就只能停下来等待。卡内基梅隆大学对756块GPU进行31天细粒度遥测,覆盖从A100、H100到最新B200的六代产品,结果发现:观测集群中整体近20%的执行时间和约11%的能耗被浪费在等待上;推理场景中Azure Code负载高达65%的能耗消耗在空转上,OpenAI的Chat类请求也达到52%。
第三部分 AI Infra四层架构解析(27% - 38%)
1 第一层·能源基础设施(电):决定GPU能否持续稳定运行。
2 第二层·计算硬件(卡):除GPU外,现在还包括高带宽存储、高速互联以及CPU等,决定理论上能够提供的计算上限。
3 第三层·系统软件:包括CUDA、编译器、通信库、内存管理和底层算子库等,决定每一次计算能否被执行到硬件的物理极限。
4 第四层·服务编排:负责协调GPU资源,决定哪些任务优先运行,以及不同业务之间的动态调度。推理引擎、训练框架、请求调度和资源管理都属于这一层,代表性项目有vLLM、SGLang等,也是近年来创新最密集的地方。
5 GPU跑不满的四层归因与"软硬"之分:
- "硬"问题(下两层):电力和散热不足→GPU被迫降频;硬件互联跟不上→GPU花大量时间等数据。改造周期以年为单位,优化空间正快速见顶。
- "软"问题(上两层):系统软件优化不够→每次计算无法触及硬件物理极限;请求调度不当→本可合并的计算被拆散、可复用的结果被重算。本质上是工程问题和算法问题,优化后往往能带来数倍性能提升。
6 行业注意力快速上移,软件层优化即商业问题:尽管成本会落在物理层,但大部分工作都要放在软件层和服务编排,因为人力投入这块能带来最大优化可能性。举例:一台NVIDIA GB200 NVL72机柜采购成本约400万美元,若软件栈没做好调度优化,GPU实际利用率可能只有50%,相当于200万美元以电费、折旧和机会成本形式被白白烧掉;反之将利用率从50%推到90%以上,效果相当于凭空多出一台机柜。
7 Anthropic案例:AI Infra团队成为竞争壁垒:Anthropic员工占比最大的是AI Infra相关工程师,inference队伍已堆到约200多人。这三年间他们从infra极度不稳定,做到极度趋于稳定,并把成本和优化做得更强,直接影响了其Q2收入达到盈利。OpenAI、Anthropic和谷歌都把AI Infra团队放在公司内部,成为各大前沿实验室的竞争壁垒之一;而对没有资金量做优化的较小模型团队或初创公司来说,vLLM和SGLang两个开源框架成为支柱。SGLang这样的开源社区出现,正是为了用新框架重新定义新的硬件系统组合,跟它做更好的适配。
第四部分 优化四大核心问题与SGLang的KV Cache复用方案(38% - 58%)
1 四大核心优化问题:所有优化工作都可归结为——哪些计算不用重新做、哪些等待可以消除、哪些算力没有吃满、哪些资源没有协同。vLLM和SGLang都围绕这四个问题展开,只是设计思路略有不同:vLLM因提出PagedAttention而受广泛关注,更强调常规、通用的推理部署场景;SGLang则从推理执行流程出发,更强调计算复用和系统级优化。
2 "推理税"问题:重复计算的巨大浪费:大模型推理中存在一个"很傻"的事实——当同一段文字被反复喂给模型时,每次都要从头计算一遍,在实际业务中尤其是Agent工作流里,同样的工具描述可能被调用几十次,每一次都从零开始。这被称为"推理税"(跟智商税差不多,都是白花的钱)。Anthropic之前做过一版优化,直接把成本砍了90%——本来要花十块,优化完只需花一块钱。
3 KV Cache复用机制原理:Transformer在解码时,每一层self-attention都会把历史token映射成Key/Value张量(即KV)。在第一次请求的prefill(预填充,用户输入完prompt到生成首个token的过程)时,系统把prompt中每个token每一层的K/V都存下来;之后解码每个新token时,只计算新token的KV并追加到缓存里,历史token的K/V直接复用。这可以降低解码计算量、降低首token延迟(TTFT),但代价是占用GPU显存。当上下文很长、同时有很多用户请求时,KV Cache会占用大量显存,显存一旦不够,模型就很难继续提高并发和速度,因此它常变成推理服务的主要瓶颈。
4 RadixAttention:用基数树组织海量请求的KV Cache:SGLang的核心解决方案之一是RadixAttention技术,核心思路是用一种叫做"基数树"(Radix Tree)的数据结构来组织海量请求的KV Cache。可以想象成一棵共享前缀的家族树——共享同样开头的请求会共同用同一段枝干,只有当内容开始分叉时才各自长出新的树枝。在agentic world中,很多请求会有shared system prompt,在共享系统提示词后会有不同的user prompt,在同一个user prompt下面大家会接着问问题,从而延伸出更多树形结构。这也是SGLang论文比较有远见的地方——2023年就大概预见到了这样的模式,随着agentic coding用户越来越多,RadixTree以及SGLang本身的prefix cache(前缀缓存)这套系统带来的增益越来越大。
5 跨请求、跨机器的全局KV Cache复用:普通的KV Cache只服务于一个请求,SGLang把它变成了全局可复用资源,跨请求、跨机器地共享和复用KV Cache。
6 工程复杂性:缓存五大精细化设计:这件事听起来简单,工程上却很复杂,包括缓存存在哪里、怎么快速匹配、多个请求怎么共享、显存不够时该淘汰谁,每一步都要精细设计。
7 Cache-aware scheduling(缓存感知调度):仅仅有好的缓存结构还不够,还需要调度器主动把可以共享前缀的请求安排在一起处理,否则缓存明明存着,调度器却把请求分到不同时间、不同的GPU,缓存就等于白存了。SGLang用Cache-aware scheduling让前缀相似的请求靠近处理,缓存更容易命中,进一步提高效率。类比为餐厅后厨:连续处理三份麻辣香锅时很多调料和准备工作可以复用;如果顺序是麻辣香锅、寿司、牛排、麻辣香锅、寿司、披萨、麻辣香锅,中间切来切去大厨还得洗锅,复用机会就少了。Cache-aware scheduling下的顺序会是"三份麻辣香锅加两份寿司加牛排加披萨"。
8 Eviction(淘汰机制):显存不够时扔掉最不可能再用的缓存,类似管理手机内存——十年前的照片和文档可能没有最近几个月的数据有价值。常用的system prompt、高频RAG文档、最近刚被用过的对话前缀更会被保留;显存不够时就淘汰很久没有用过、复用价值低、不太可能再被访问的KV Cache。
9 分布式cache-aware load balancer(缓存感知负载均衡器):大规模服务通常有很多GPU,如果某段长prompt的KV Cache在GPU 1上,但下一个相同前缀的请求被发到GPU 3上,GPU 3没有这份缓存还是得重新算。SGLang尽量把请求发到"已有笔记"的那一个GPU上,从而少算很多重复内容。
10 工程考量因团队而异:虽然SGLang把架构都搭好了,但具体每个团队怎么部署infra还是很有工程上的考量。
第五部分 消除等待:连续批处理与PD分离(58% - 72%)
1 内存涨价与GPU"干等"的矛盾:当前行情下内存价格一个季度能涨90%,高端显存缺货缺到2027年,GPU有钱都不一定能抢到,但最后这些花了大价钱抢到的卡一半时间却在"干等"。
2 请求等待的演进:从排队制到连续批处理:
- 排队制:最早的推理引擎请求一个一个来,一个算完再算下一个。
- 批处理:凑够一批一起算,但凑批也要等,且一批里如果有的请求短、有的请求长,短的算完了还要等长的算完才能一起下车,短请求用户体验极差。
- Continuous Batching(连续批处理):主流做法,不再等一批人全部到齐后再发车,而是像一辆随时可以上下客的公交车,新请求随时上车,算完的请求随时下车,GPU始终保持满载。这一改造能让GPU的实际吞吐量提升2到4倍。
3 计算阶段的等待:Prefill与Decode互相拖累:大模型推理包含"读入"(Prefill)和"生成"(Decode)两个阶段。读入阶段需要快速处理一大段文字,对算力要求高;生成阶段则是一个字一个字往外蹦,计算量不大,但每写一个字都要翻一遍完整记忆,对显存带宽极其敏感。过去这两部分被塞进同一张GPU里面混合执行,结果Prefill在算的时候Decode在等,Decode在算的时候Prefill在等,互相拖累。
4 Prefill/Decode分离(PD分离)架构:现在的做法是把Prefill和Decode两个阶段拆到不同的GPU上,各自用最适合的硬件配置,通过高速网络传递中间结果。例如DeepSeek采用此方案:Prefill"读题"时32张GPU组成一个最小计量单元,等真正开始"逐字作答"时,任务就交给另一批GPU接手,两拨卡各干各的、互不打扰。如今PD分离已成为推理引擎最重要的架构演进之一,在英伟达最新推出的分布式推理框架Dynamo中,PD分离被放在了整个架构设计的核心位置;而SGLang也是业界最早支持大规模PD分离部署的推理引擎之一。
第六部分 吃满算力:低精度计算与投机采样(72% - 82%)
1 H100算力跃升却未带来推理同步飞跃的怪象:英伟达H100发布后,Tensor Core算力相比A100提升了数倍,整个行业期待AI推理能够同步增长、性能飞跃,但现实并非如此。背后主要原因是GPU大量时间花在了数据搬运上,又受限于串行解码,计算能力无法得到充分释放。
2 方向一·低精度计算:大模型运行时GPU显存里主要装了三样东西——模型权重、中间激活值、KV Cache。这三部分的精度可以独立设置,用更小的数据格式来存储或运算其中的任何一部分,都能减少显存占用,也能利用GPU上更快的低精度算力,在合适场景下甚至相当于多释放出一倍的算力空间。
3 方向二·投机采样(Speculative Decoding):先用一个小模型(draft model,草稿模型)去"猜"接下来的几个字,再让大模型进行一次性验证,猜对了就等于一次计算生成了多个字。类比为:大模型是很厉害但很忙的老师,小模型是速度很快的助教。之前学生每写一个字都会问老师"你看这个字行不行",老师确认后再写下一个字;投机采样则是助教先帮学生写一小段草稿,老师一次性看这一小段,如果前面都对就全部通过,如果中间错了就从错的地方重新再来。最佳情况下能把生成速度提升2到3倍。
4 推理引擎的关键整合作用:推理引擎扮演着至关重要的角色,把这些新功能第一时间集成到系统里面,把软件和硬件的四层都打通,让优化协同起来。SGLang本身是个整体的解决方案、是一个inference engine(推理引擎),它保证做kernel optimization(计算内核优化)、scheduler optimization(调度器优化)、CUDA Graph(CUDA图执行优化)、continuous batching(连续批处理),再往上走还有routing(请求路由),包括prefix cache(前缀缓存)怎么被route到对应的engine replica(推理引擎实例)。SGLang有非常多的技术结合在一起,把推理整体解决方案做到极致。
5 推理引擎与芯片厂商深度绑定联合优化:RadixArk联合创始人朱邦华表示,像SGLang这样的推理引擎现在跟芯片厂商之间已经是一种深度绑定的联合优化——芯片厂在设计新硬件的时候就已经在和SGLang的团队一起做联合调优,等到硬件正式发布的时候SGLang几乎在同一时间完成了day-0的支持,双方一起希望把硅的性能压缩到极致。SGLang某种程度上变成了一个硬件评测工具,AMD最新的硬件、英伟达最新的硬件,现在都是一个产品发布合作伙伴,在发布硬件的day-0(当天)就会说在SGLang的性能上达到了多少多少。SGLang本身和RadixArk团队会和所有的硬件供应商合作,把他们硬件的性能压缩到极致,交付更好的推理性能和训练性能。
6 RadixArk豪华投资方阵容的战略逻辑:RadixArk从SGLang孵化出来进行融资时,机构投资人方面英伟达、AMD、联发科、Databricks等AI硬件与系统层的主要玩家几乎全部到齐;个人投资者名单更是重磅——英特尔CEO陈立武、Broadcom CEO陈福阳、OpenAI联合创始人John Schulman等。对他们来说,投资RadixArk这样的推理引擎是一种战略下注,需要一个连接算力与应用的基础设施入口,把更多的模型、企业应用和Agent都汇聚到自己的算力生态当中。
第七部分 资源协同:Miles训练框架与强化学习优化(82% - 92%)
1 强化学习(RL)成为新一代模型核心训练方式:OpenAI o1和DeepSeek R1等都采用RL,这让AI训练形态发生巨大变化。传统模型训练是"体质单一"的事——喂数据、更新参数、再喂数据、再更新参数,整个过程GPU干的都是同一类活儿,硬件配置和调度策略只要针对"训练"这件事优化到位就行。但RL要把推理、评估、参数更新这三种完全不同的计算揉在一起循环跑,三件事对硬件的需求天差地别。
2 RL的资源争抢困境:RL必须要做在线推理——先让模型生成很多想回答的内容,然后根据内容打分,再把模型更新一下,再去回答新问题,再打分,本身就是交替做训练和推理的过程。如果用传统的训练框架来跑强化模型,它们会在同一批GPU里面争抢资源,生成的时候训练在等,训练的时候生成在等,大量算力被浪费在阶段切换和相互等待上。资源协同成了效率提升的命门。
3 RadixArk推出训练框架Miles:RadixArk在SGLang之外最近还推出了训练框架Miles。如果单纯无视训练只做推理,反而没有办法押注未来,因为最终很多人还是希望自己训练自己的模型再去推理,要做整体的AI软件基础设施,两边都需要关注。
4 Miles的定位与核心差异:Miles是一个面向大模型后训练的开源训练框架。后训练是指模型有了基础能力之后,再通过SFT、强化学习等方式继续打磨,让它更会听指令、更会思考。和传统训练框架相比,Miles最大的不同是它把"训练"和"推理"放在同一个系统里面一起考虑,这在强化学习中非常重要。
5 Miles与SGLang配合形成高效后训练闭环:Miles和SGLang配合在一起后,SGLang在推理端不断产出新样本,Miles训练端不断更新模型权重,更新之后的模型可以继续用于下一轮生成,让推理和训练衔接得更顺,减少等待和切换的时间浪费,从而形成更高效的后训练闭环。Mismatch(不一致问题)是现在工程领域中很容易经常发生的,只有推理和训练模型能共享比较共用的模型权重和内核,才能保持对齐。很多人会用SGLang,这时候再用Miles的话,本身会带来更强的训练能力,对推理任务、长任务、agentic(智能体)任务提高更多的稳定性。
6 MoE架构下的内核级对齐挑战与Miles的应对:MoE(混合专家模型)现在成为大家比较容易接受且都在使用的架构,但MoE本身在routing(路由)过程中会导致不同——在训练和推理当中,kernel-level(内核级)的并行策略以及最后的准确度都会不一样,这时就需要有更强的工程能力把这件事做成,Miles本身就带来了这一块的优化,把训练和推理做更好的结合。
7 Miles的工程优化与采用情况:目前Miles在新硬件支持、MoE训练以及推/训一致性(Training-Inference Alignment)等方面都进行了大量的工程优化,使整个后训练流程能够更加稳定、更高效运行。去年11月发布之后,Miles就已经被不少前沿实验室采用了。
第八部分 开源推理引擎商业化与AI Infra的公共品化(92% - 100%)
1 开源社区"为爱发电"难以满足庞大需求:SGLang和vLLM都是开源架构,背后主要依靠一群研究者和工程师在业余时间共同维护、为爱发电。但当全世界都面临算力短缺、需要"榨"硅的极限从而释放更多算力时,仅靠开源社区的协作已经很难满足庞大的需求。于是SGLang和vLLM的主创团队都前后选择了正式出来创业,更快速、更投入地把技术往前推。
2 本期节目深度访谈预告:本次专门和SGLang的提出者、RadixArk的创始人、前xAI Inference推理团队负责人盛颖进行了深度访谈,视频播客也将很快上线。
3 RadixArk的更大野心:让AI Infra成为共享基础设施:从SGLang正式孵化出来之后,RadixArk认为就像云计算改变了服务器一样,未来AI Infra也可能演变成整个AI行业能够共享的基础设施。最近黄仁勋牵头成立开源AI联盟,联盟里既有模型公司也有芯片公司,还有像SGLang这样的AI Infra项目。
4 Day-0支持:推理引擎正在成为AI时代的"操作系统":今天开源模型迭代速度越来越快,从DeepSeek V4、智谱GLM-5.2到最近的Kimi K3,每隔几周就会出现新的强劲开源模型。但开源模型开放的只是权重,权重并不会自动变成token,任何人下载了这些模型依然要解决部署、显存、吞吐和调度等一系列工程问题。这正是为什么推理引擎的开源项目一直很强调Day-0支持——模型一发布,任何开发者就能借助开源引擎立即部署;同一套推理框架也能够跑在英伟达、AMD以及更多新兴的AI芯片上,这让推理框架正在越来越像AI时代的"操作系统",成为连接模型与芯片的关键一层。
5 RadixArk的使命:消灭"前沿实验室"的门槛壁垒:RadixArk做这件事一个更大的目的,是希望以后不要有frontier lab(前沿实验室)这个词,因为人人都可以做frontier lab。frontier lab本身是一个非常动态的事情——两年前大家觉得Anthropic并不是frontier lab,在这之前大家可能觉得Google离OpenAI太远、不可能追上。AI变化太快,相信会有越来越多挑战者、越来越多有想法的人做出更好的AI产品和AI模型。RadixArk希望赋能这些更有想法的人,给他们提供最强的基础设施支持,让他们从想做的那一刻开始就有和现在frontier lab一战之力,最终可能世界上所有人都能自己训练出frontier level(前沿水平)的模型,能做最好的推理。RadixArk更希望是这样一个支持者的角色。
6 AI Infra公共品化的深远意义:当AI Infra的能力从少数前沿模型巨头的独家资源,变成了任何一家创业公司都能直接调用的公共品,从事AI工作的门槛被显著降低——这或许才是"榨出硅的极限"这件事情最重要的意义所在。在infra红利被全面释放之后,会有越来越多带着新想法、新架构、新应用场景的团队,不再因为infra门槛而被拖慢脚步,这也会让AGI距离我们更近一步。
7 结尾互动与下期预告:《硅谷101》主持人陈茜提醒观众不要错过下一期和盛颖的视频播客,盛颖被评价为"太有趣、太酷的一个人"。点赞、转发和留言是支持《硅谷101》做好深度科技和商业内容的最佳动力,下期视频再见。
Top comments (0)