https://www.youtube.com/watch?v=_OoB3WxBQq0
这期由基地发布的视频,深度剖析了 AMD 在 2026 年 8 月收购芯片初创公司 Taalas 及其推出的 HCE(Hardcoded Engine) 芯片背后的技术细节与商业赌局。
主要内容梳理如下:
一、 疯狂的硬件设计:代码即物理形状 [00:00]
- 固化模型:普通 GPU(如 H100、MI300)运行 AI 时需要不断从显存中提取模型权重;而 Taalas 芯片没有外挂高带宽内存(HBM),它直接将 Llama 3.1 8B 等大模型的权重以物理金属互连(过孔)的形式“焊”死在了芯片硬件上 [00:34]。改代码/模型就必须重新改芯片物理形状 [00:48]。
- 降本核心(只改最上 2 层金属):芯片底层 90 多层电路(逻辑门、累加器等)全是一样的通用晶圆 [01:34]。更换模型时,只需重新设计最顶部两层的掩模(Mask),这使开模费用从传统定制芯片的约 550 万美元大幅降至 130 万-180 万美元,裸片生产成本仅约 200-300 美元 [01:45] [07:32]。
- 乘法变“选择”:模型权重被极度量化为 3 位或 4 位,输入数据先与固定的常数相乘,再经过交叉开关矩阵。开关由金属过孔控制(通或断),直接跳过了将权重从 SRAM/HBM 搬运到寄存器的繁琐过程,省去了最耗电的内存数据搬运环节 [02:09] [03:03]。
二、 极端的性能宣传与潜在痛点 [03:33]
- 实验室数据极亮眼:Taalas 宣称其单用户吞吐量高达 16,960 tokens/s(远超 H100/H200 的数百 tokens/s),且能耗极低(0.015 J/token) [03:41] [04:14]。
- 无独立第三方盲测:视频指出,这些数据全来自 Taalas 内部实验室推算,从未经过 MLPerf 等第三方标准盲测 [04:53]。
- 单人 vs 批处理痛点:16,960 tokens/s 是基于“单用户、零排队”的极限情况测得的。芯片片上 SRAM 仅约 100-300 MB,无法承载多用户并发的 KV Cache 缓存(只能容纳 2000-6000 tokens 上下文) [05:17] [06:14]。对于云厂商而言,它赢了单人等待延迟,却输了多用户总吞吐 [06:23]。
三、 AMD 为什么花重金买它? [09:40]
AMD 愿意收购 Taalas 的战略考量主要有三点:
- 规避两大供应链瓶颈:
- 台积电 CoWoS 先进封装:英伟达拿走了约 6 成 CoWoS 产能,交付周期长达 52-78 周;
- HBM 显存缺货:海力士、三星、美光的 HBM 产能被抢光。
Taalas 芯片采用台积电 6nm 成熟制程,且不需要 CoWoS 和 HBM,能极大地避开供应链卡脖子问题 [09:44] [10:01]。
两手准备的商业对赌:
赌架构收敛:如果未来两三年主流大模型架构(如 Transformer / Llama 系列)停下演进脚步,那么这种固化芯片将成为数据中心成本最低、效率最高的推理大杀器 [10:36]。
人才与技术对赌(期权属性):Taalas 团队由来自 Tenstorrent、AMD、苹果、英伟达的顶尖架构师组成 [00:58]。即便固化路线走不通,AMD 也能将这批顶级人才吸纳进自身的 Instinct / CPU 部门,同时买下了最强推理 IP [10:49]。
总结 [11:38]
从单颗芯片看,这是一种“一辈子只能跑一个模型、淘汰即废品”的疯狂设计;但放在 AMD 的战略盘口里,这是一笔用小资金买下的“对赌协议与人才期权”。
Taalas 和 Celebras公司技术的异同
Cerebras 是一家独立的上市公司(股票代码 CBRS,主打晶圆级芯片 WSE),是英伟达在 AI 硬件领域的强劲竞争对手之一。
不过,Taalas 与 Cerebras(以及英伟达自身路线)的技术理念有着非常鲜明的对比。两者的核心相同点在于极力消除内存数据搬运(Memory Bottleneck),但在实现路径、芯片制造与灵活度上存在本质差异。
技术维度对比
| 对比维度 | Taalas(AMD 收购) | Cerebras(晶圆级 AI 芯片) |
|---|---|---|
| 核心架构路线 | 硬编码引擎 (HCE):将模型权重通过电路金属互连直接“焊”死在硬件上。 | 晶圆级引擎 (WSE):将一整块 300mm 硅晶圆做成单颗超大芯片,依靠巨量 SRAM 实现近存计算。 |
| 内存与数据传输 | 无 HBM / 无外挂 SRAM,权重即物理形状,消除了传统的权重读取与搬运过程。 | 无 HBM,但集成了高达 44GB 的片上 SRAM,高带宽微网络连通所有核心。 |
| 模型灵活性 | 极低(不可逆):一颗芯片一辈子只能跑一个固定模型;改模型需重开最顶层 2 层金属掩模。 | 极高:通过软件编译和加载不同的神经网络模型,可自由切换训练与推理任务。 |
| 制造与成本 | 成熟制程 + 低成本:基于 TSMC 6nm 等成熟节点,裸片成本低;更换模型开模费约 130万-180 万美元。 | 极端制造 + 极高成本:利用完整晶圆,制造良率与封装成本极高,属于顶配巨型硬件。 |
| 应用场景 | 专注于极低延迟、超高吞吐的单模型生产级推理。 | 覆盖大模型训练与超高速通用 AI 推理(Cerebras Inference)。 |
两者的异同点分析
1. 相同点:对“内存墙”的终极反叛
传统 GPU(如英伟达 H100)在运行大模型推理时,绝大部分能耗和时间都消耗在将权重从高带宽内存(HBM)搬运到计算核心的过程上。
- 两者的共同目标:彻底丢弃 HBM 显存。
- 解决思路:两者都主张将计算与存储放在极其靠近(或直接融为一体)的位置,用极高的片上带宽支撑高吞吐推理。
2. 不同点:灵活度与物理形态的极端取舍
- 存储形态:硬件过孔 vs 晶圆级 SRAM
- Taalas 走的是“硬件即算法”的极限路子。它把模型的逻辑权重压到 3 位或 4 位后,直接通过芯片最上面两层金属过孔(Via)电路来实现,连逻辑上的“权重存储”都不存在了。
Cerebras 走的是“规模即正义”的路线。它不改动芯片的通用逻辑,而是直接将一整片晶圆(约餐盘大小)做成芯片,凭借内部数以千计的计算核心和庞大的 SRAM 阵列,将整个大模型直接装进片上内存里。
经济学与风险模型
Taalas 将芯片当作“消耗品/彩票”:牺牲通用性换取极高的能效比与单人推导速度。只要某个模型(如 Llama 3 系列)生命周期超过 12–18 个月,通过节省的电费和硬件成本即可收回开模费。一旦模型淘汰,芯片即报废。
Cerebras 仍是传统的“资产型”硬件:设备价格昂贵,但具备完全的可编程能力,能灵活应对各种不断更新的 AI 算法。
Taalas与Groq的异同
Taalas 芯片的技术逻辑是“将模型硬化到芯片电路中”(Model-in-Silicon / ROM/SRAM极速推理),通过牺牲通用性来换取极致的吞吐、能效与超低延迟。
从投资与收购的角度来看,英伟达(Nvidia)极少直接投资这类“纯硬化/不可编程”的专用 AI 芯片公司,但它在推理加速(Inference)与专用架构(ASIC/LPU)领域有非常重大的战略动作与布局:
1. 英伟达在推理/专用架构领域的类似重磅动作
- Groq(技术授权与团队吸纳,近 200 亿美元)
- 技术路线差异:Groq 采用的是张量流处理器(LPU),主打极其确定性的极速推理。它虽然保持了芯片的可编程性,但理念与 Taalas 一样,都是为了追求极高 Token 生成速度,放弃传统 GPU 的通用内存架构(如 HBM),转而将权重和计算尽量紧密地放在 SRAM 内存中。
英伟达的动作:2025 年底,英伟达通过近 200 亿美元的技术授权与“反向收购(Acquihire)”拿下了 Groq 的核心推理技术与技术团队,并将其整合入英伟达的下一代 LPX 推理平台中。
Enfabrica(芯片/互联架构投资)
英伟达早期重金参投了专门解决 AI 数据中心集群扩展性与超低延迟互联问题的芯片公司 Enfabrica,后续也进行了深度的团队与技术整合。
2. 为什么英伟达不直接投 Taalas 这类“硬化芯片”公司?
英伟达在投资 AI 芯片初创公司时,战略重点与 Taalas 存在本质差异:
- 软件生态(CUDA)是英伟达的护城河
- Taalas 的芯片“一辈子只能跑一个固定模型”,模型一旦迭代(例如从 Llama 3 升级到 Llama 4,或者模型结构发生根本改变),芯片就必须重新 tape-out(流片)。
英伟达的核心商业壁垒在于 CUDA 软件生态和通用可编程性。任何无法运行 CUDA 或完全脱离通用编译器的“死电路”,都会削弱英伟达的生态优势。
英伟达的战略投资偏好
投资上游与生态应用:英伟达自己的 GPU 和 NVSwitch 本身就是硬件顶峰,因此其风投部门(NVentures / GPU Ventures)更倾向于投资 前沿 AI 大模型应用/软件公司(如 Safe Superintelligence、Cohere、Perplexity、Mistral 等),以此来扩大对其 GPU 计算资源的消耗需求。
硬件投资侧重补短板:英伟达对硬件的投资或收购,主要集中在高速互连(如 Mellanox)、光子芯片、硅光子、边缘推理等能为其主营数据中心业务“锦上添花”的领域,而不是去扶持可能破坏通用计算范式的专用芯片。
总结
虽然英伟达没有直接投资 Taalas 这种“把模型烧死在电路里”的公司,但英伟达通过重金整合 Groq 等主打 SRAM/极致推理 speed 的专用芯片企业,展示出了其对超高吞吐、超低延迟推理架构的极高重视。对于像 Taalas 或 AMD(收购 Taalas)这种“以彻底丧失通用性换取极限推理成本/能效”的极端路线,英伟达目前依然选择以通用 GPU + 极速内存/网络架构(如 Blackwell/Rubin 平台)来应战。
Top comments (0)