https://www.youtube.com/watch?v=sVeEc3H6bA4
权重即数据:神经网络权重空间学习如何成为 AI 的下一类训练集
以下位 TWIML AI Podcast 第 772 期《Why Models Are AI's Next Training Dataset》访谈转录整理,嘉宾为圣加仑大学 AI 与机器学习教授 Damian Borth,主持人 Sam Charrington。
介绍详细内容之前,先说说WSL是否等同于模型蒸馏?
答案是不是一回事,但容易混着叫。先把两件事拆开,再对照 Borth 的"权重空间学习(WSL)"你就清楚了。
1. Anthropic 骂阿里那件事是什么
Anthropic 2026 年 6 月致信美国参议院,说阿里 Qwen 团队在 4/22–6/5 期间用近 2.5 万个假账号调 Claude 约 2880 万次,把 Claude 的回答当训练数据去训自己的模型,他们叫它"蒸馏攻击(distillation attack)"。
这本质上是黑盒/API 层的数据蒸馏:
- 教师=Claude(只看得到输出文本)
- 学生=Qwen 系模型
- 方法=拿 Claude 的生成文本(硬标签,最多再加点软标签)当语料去训学生
- 目的=迁移能力、省训练钱
注意:这跟"白盒蒸馏"还不一样,阿里(按指控)根本没拿到 Claude 的权重,拿到的是对话文本。行业里把"用强模型输出当训练数据"泛称为蒸馏,但严格学术定义里这只是黑盒 KD 或数据蒸馏。
2. Borth 的"权重当数据"是不是蒸馏
形式上沾边,本质上不同。
| 维度 | 经典/黑盒蒸馏(Anthropic 指控那种) | Borth 权重空间学习(WSL) |
|---|---|---|
| 学习对象 | 教师模型的输出(文本/软标签/中间激活) | 一堆已训练模型的权重本身(参数张量) |
| 数据形态 | (x, 教师输出) 配对样本 | 把模型权重序列化、令牌化后的"权重语料" |
| 目标 | 学生模仿教师行为,压缩模型 | 学"模型种群"的流形:预测准确率 / 生成新权重 / 跨架构采样 |
| 要不要原始数据 | 黑盒蒸馏可以完全不用原数据,只用教师输出 | 完全不用任何输入输出数据,连教师行为都不看 |
| 典型操作 | 用 Claude 回答训 Qwen | 下载 HF 上 2000 个 CV 模型 → 自编码器压成隐空间 → 采样出遥感模型权重 |
Borth 自己在论文里也承认:WSL 可以看作"直接在权重上做的、基于训练的知识复用",但它不需要像 KD 那样去跑原数据集拿激活、也不需要教师在线推理,它是把"训练好的模型集合"当成第三种数据模态(继文本、图像之后)。
简单说:
- 蒸馏是"看菜谱做出来的菜(输出)来学做饭"
- WSL 是"把几百道做好的菜称重、切片、分析配料分布,然后直接捏出一道新菜的重量配方"——连火都没开,更没尝过菜味。
3. 为什么大家会搞混
因为两者都叫"复用已有模型的知识",而且 WSL 生成出的权重确实能当初始化、能跨域迁移(比如用 ImageNet 模型权重训出遥感模型,350 GPU 小时干掉 12000 GPU 小时的从头训),效果上像"蒸馏了前辈经验"。但机制上:
- KD 的知识载体是前向行为(logits / 文本)
- WSL 的知识载体是参数几何结构(权重空间里的流形、对称性、轨迹)
所以 Borth 在访谈里特意说"权重不仅是学习的输出,也可以是学习的输入"——这句话的潜台词就是:别把它归类成 KD,它是一个新模态的学习问题。
4. 一句话收口
Anthropic 抱怨阿里,是"你偷用我家模型吐的字句当教材";Borth 的路子是"我把全网开源模型(含你家的,只要开源许可允许)的权重文件当语料,训一个会造权重的元模型"——前者踩的是 API 条款和商业秘密红线,后者用的是已发布权重(Hugging Face 上大多有许可证),技术族谱上离"蒸馏"比离"神经架构搜索 + 超网络"更远。
第(一)部分 节目开场与研究总览:当训练数据枯竭,权重成为新燃料(0% - 8%)
节目引入与核心命题:主持人点明当下 AI 领域最严峻的问题之一——高质量训练数据越来越难找,部分研究者押注合成数据,另一部分押注推理时计算(test-time reasoning)。而本期嘉宾 Damian Borth 提出了一条截然不同的路径:每一个训练好的模型都凝结了数千乃至数百万 GPU 小时"什么管用"的探索经验,这些权重不应只被视为训练过程的终点,而应成为下一次训练的起点和数据本身。
嘉宾背景与研究方向:Damian Borth 是瑞士圣加仑大学 AI 与机器学习教授。他的核心研究线索是"权重空间学习"(weight space learning / weights based learning),同时也涉足遥感(remote sensing)与表格数据表示学习,目前正把这些方向汇聚到权重空间学习这一主线之下。他认为这条路能解决社区当前面临的若干棘手问题,且从一个非常冷僻的想法起步,最终"出人意料地好用"。
本部分定位:奠定全片基调——把"训练好的模型权重"视作一种可被学习、被分析、被用于生成新模型的数据模态,类比文本、图像之后的第三种基础模态。
第(二)部分 权重空间学习的核心思想:把权重当作输入模态(8% - 20%)
从经典机器学习到权重模态的范式转换:经典监督/无监督/自监督机器学习,是用数据+输出训练神经网络,昂贵训练过程产出的"权重"定义了网络,相当于网络的 DNA。过去十年这一范式推动了巨大创新,伴随 GenAI 浪潮,过去几年越来越多模型被公开发布到 Hugging Face、GitHub 等仓库。
-
核心类比——语言、像素、权重三者同构:
- 语言模型:用互联网上所有句子训练 → 获得分析与生成语言的能力
- 像素模型:用互联网上所有像素训练 → 获得分析与生成图像的能力
- 权重模型:用所有已训练神经网络的权重训练 → 获得分析与生成权重的能力
-
两条核心能力愿景:
- 分析侧:拿到一个从未见过、自己也不了解的新网络时,能否更精确地分析它的权重(例如预测其准确率、泛化间隙、所用激活函数等)
- 生成侧:能否比从头训练快得多地为目标任务创建新权重
"权重作为新模态"带来的空旷空间:把权重当作输入模态后,突然打开了一整个"空白世界"——权重空间的"语言翻译"对应什么?权重的"词与 token 生成"对应什么?这套思想在随后两三年里逐渐聚拢起一个研究社区。
第(三)部分 起源故事:从"神经网络指纹"到首个自编码器(20% - 34%)
2020 年的起点问题——能给神经网络做"diff"吗:最初想法非常简单:软件代码可以做 diff,一眼看出百万行代码里哪里被改了;神经网络只要训练时做一次权重更新,每个权重都会略有不同,"如果一切都不同,那就等于什么都没不同"——局部层面极其不稳定。团队因此思考:能否找到一个空间,让神经网络的权重/模型被压缩、变得可理解?
并行学术脉络:几乎同一时期,Google 土耳其团队的 Thomas Unterthiner、Daniel Keysers 等人发表了最早把权重作为输入的工作,用手工统计特征预测权重准确率;另有工作预测泛化间隙。这些都属于"手工特征 + 传统机器学习"路线。
端到端学习的突破思路:Borth 团队认为既然他人用手工特征,为什么不端到端学习?于是提出用自编码器(autoencoder)把权重序列压缩到低维空间再重建。假设从一个神经网络族群(model zoo)中学到了低维流形,那么这个流形可能编码了准确率、所用训练数据、学习率等"隐生成因子"的信息。
-
首篇论文的实验与结果(2021 年发表):
- 在同构模型动物园(相同数据、相同架构训练出的众多小网络)上训练自编码器
- 编码器将未知神经网络映射到隐空间,再用简单线性回归头预测准确率
- 核心能力:无需测试数据即可"预测"一个神经网络的准确率
- 在极小玩具网络上(几千到几万参数的 embarrassingly small 网络)验证可行,能预测准确率、泛化间隙、所用激活函数
- 把隐空间画出来,能看到不同初始化及其演化轨迹(他们训练了 1 万个模型、每模型 50 个 epoch,轨迹可见)
- 自编码器用 600 个网络训练、300 个测试,预测 Fashion-MNIST 准确率时 R² 优于 Thomas Unterthiner 等人的原始权重空间工作
- 审稿人评价"虽小但有趣",得以发表,成为这场四年旅程的引信
第(四)部分 生成式权重与"模糊权重"难题(34% - 46%)
解码器的自然延伸——采样生成新网络:自编码器有编码器必有解码器,能否从隐空间采样来生成神经网络?这在概念上显而易见。但 2022 年那篇生成神经网络的论文发现:生成出来的网络不如标准初始化好,更远远不及完全训练好的网络。
-
"均方误差陷阱"与重建失败的悖论:
- 训练出的自编码器重建误差(MSE)极低
- 把重建权重塞回网络做前向传播,整个网络却彻底崩坏
- 根因:MSE 是"平均"指标,网络能很好地重建平均权重,但那些决定函数是否真正起作用的高频微小差异被忽略了
- 类比图像生成领域:早期生成模型输出的图像总是模糊的,后来"Taming Transformers"等工作把 MSE 换成感知损失(perceptual loss)、加入量化与 GAN 才解决
损失函数的迭代摸索:团队尝试归一化、行为损失(behavior loss)等替代方案,生成质量有所提升,但仍缺失一部分高频信息——他们自嘲生成的是"模糊权重"(blurry weights):低频信息到位、高频信息缺失。
规模化瓶颈与"三次幸运"的自省:Borth 坦言"你不能连续三次走运",运气用完前必须真正把规模做上去。在 Constantine Schüürhof 等人推动下,团队提出关键思路——不再重建整个模型,而是把模型参数当作序列做窗口化(windowing),逐窗口重建。这解耦了原始模型序列长度对自编码器的限制,使得方法可以扩展到 ResNet 及更大网络。
与 Michael Mahoney 的结缘:2024 年与 UC Berkeley 的 Michael Mahoney 合作。Mahoney 在一开始讨论中直白地说:"Damian,你做的东西很有趣,但没用。"Borth 顺势拉他入伙一起把这件事规模化,Mahoney 由此成为后续论文的合作者(他早前也正与 Charles Martin 等人做 Weight Watcher 系列的权重分析工作)。
第(五)部分 社区汇聚与方法论迁移:对称性、增强与损失曲面(46% - 55%)
会议上的"原来大家都在做"时刻:团队在会议上偶遇其他做相似事情的研究者,包括 Technion 的 Haggai Maron、Gurrit Shlomo、Yediia 等人。有个学生胸牌底部不写学校而写着"Weights are the new modality",Borth 一看之下立刻开启合作,并推动了专门研讨会(Workshop)的成立。
-
权重空间的特殊结构——置换对称性(permutation symmetry):
- 一个全连接层里神经元的位置可以任意交换,权重的序列顺序变了,但底层函数完全相同
- 这意味着权重空间存在大量"恒等变换"——类似图像的翻转、旋转
- 2021 年首篇论文已用对比损失(contrastive loss)做增强,而构造正样本对就需要这类"权重空间增强"操作
-
从其他领域借方法的空旷田野:
- 图像领域有"感知损失",权重空间对应"行为损失(behavior loss)"
- 图像有几何增强,权重空间有置换增强、尺度增强等
- 整个领域的特点是:可以把 NLP、CV 里的成熟思想"翻译"到权重空间,而这是一块近乎空白、待填充的领地
-
与损失曲面(loss landscape)理论的汇合:
- "模式连通性"(mode connectivity)相关工作可以在参考模型之间对齐模型
- 置换对称性意味着损失曲面上存在大量"轨道(orbits)"——这些点函数值相同但在权重空间坐标不同
- UCSD 的 rose 等人关于损失曲面演化的理论工作,帮助 Borth 更好理解学习过程中到底发生了什么,并被吸收进骨干网络的设计中
- 同样相关的还有"grokking"(顿悟)、"phase transition"(相变)——模型突然收敛或突然不工作的现象,Borth 希望能借此让训练更快、并对模型在哪些性能区间内可用给出保证或边界
与分析派工作的互补:Charles Martin 的 Weight Watcher 侧重分析权重矩阵形状变化来判断收敛与否;Borth 团队的工作侧重"学习"视角。两边并行推进,殊途同归。
第(六)部分 爬出玩具模型:在 Hugging Face 模型动物园上训练权重空间基础模型(55% - 70%)
"1001 个网络"的尴尬:此前无论生成多好,都需要先有 1000 个网络训好才能生成那"第 1001 个"。听众自然会问:"既然我已经有了 1000 个,再多一个能带来什么?"——必须走向利用外部已发布的开放权重。
-
Hugging Face 模型动物园的现实:
- Yahoo 等团队的"Model Atlas"项目揭示,Hugging Face 上约 30% 的模型没有任何有意义的元数据
- 第一步过滤就是剔除这些"无名模型"
- 实验表明:单纯扩大规模没用,必须提升模型的多样性
-
模型筛选与评分函数:
- 聚焦计算机视觉为主,语言模型为下一阶段
- 设计评分函数综合考虑:模型流行度、是否为原创而非派生(Hugging Face 上有大量"树状派生")
- 从约 20,000 个模型中筛出 2,000 个通过质量检查的模型,涵盖数十亿参数,用于训练骨干网络
-
架构无关的令牌化(tokenization)难题:
- 不同序列长度、不同类型的网络层带来挑战
- 受新加坡 Kawwang 等人工作启发,采用架构无关(agnostic)的权重处理方式
- 具体做法:把从 Hugging Face 下载的模型权重按读取顺序"愚蠢地"摊平(strip away),销毁矩阵结构,序列化成一个长达数百万参数的序列
- 再对该长序列做令牌化;同时做归一化(归一化可在预处理阶段、令牌化阶段或损失函数处进行,目前依数据特性在批处理内做)
-
首篇开放权重权重空间模型:
- 成功训练出第一个既能做生成、又能做分析的权重空间模型,下游任务覆盖判别与生成
- 尽管主要聚焦 CV,但意外实现了跨域知识迁移:采样出的 GPT-2 小模型作为初始化,比在常规语言数据上从头训收敛更快——证明 CV 模型上学到的某种知识能迁移到语言模型
-
"模糊权重"仍是未解难题:
- 生成的模型"有点受损",通常需要少量微调步骤来恢复(幸运的是微调往往很快就能恢复)
- 根本原因是解码器仍受困于高频信息缺失
- 长远愿景:如果能用所有这些数据训出一个"神经网络的基础模型",按需采样用户想要的任意模型,预训练将被彻底取代——不必再有预训练模型,直接采样你需要的那个
第(七)部分 遥感领域的验证:350 GPU 小时媲美 12,000 GPU 小时(70% - 80%)
"鸡生蛋"困境:采样需要一个锚点(anchor)模型先过编码器,锚点模型越好,采样出的模型越好。如果在同领域内,"我既然已经有一个好模型,为什么还要生成一个?"——这是个典型的鸡生蛋问题。
-
跨域破解法——遥感应用:
- 即将发表于 CVPR 的论文:用 ImageNet ViT 作为锚点,通过权重空间机器生成遥感领域的基础模型
- 这是真正的知识迁移:编码-解码器把 ImageNet 上学到的知识搬到遥感域,生成的模型超越了单纯 ImageNet 微调能达到的性能
-
算力对比的惊人数字:
- 当前 SOTA 遥感模型(如 TFM,发表于 ICLR)需要训练约 12,000 GPU 小时
- Borth 团队的方法只需约 350 GPU 小时
- 提速比达到 20~30 倍(视计算口径而定)
-
为什么这条路在"数据枯竭"时代尤为关键:
- Scaling Law 受到质疑,社区转向 test-time training/adaptation,因为用于训练大模型的数据确实在枯竭
- 但人们没有利用旧模型的权重——那些凝结了所有人算力的知识被白白浪费
- 遥感界据调查已有 70 个基础模型,仍有团队在训第 71、72 个。与其如此,不如把所有已有知识压缩进一个权重空间学习表示,再按需采样
突破"基础模型=大模型"的绑定:当前基础模型范式下,用户若想在边缘设备跑任务,仍被迫使用那 8 亿~9 亿参数的 ViT,计算负担沉重。而权重空间方法可以按需采样 ResNet、EfficientNet 等不同架构——用户指定架构,机器生成对应该架构的参数。这也使之成为一种压缩技术:生成的较小模型,比"用原模型做师生蒸馏"得到的小模型更好。
第(八)部分 数据集即提示:隐私保留的按需模型生成(80% - 90%)
最后一块拼图——摆脱"模型提示":目前采样需要一个模型作为提示(锚点)。如果能用数据集本身作为提示——"给我一个在这个数据集上表现好的模型"——将彻底打开所有不在 Hugging Face 上的私有数据集。
类 CLIP 的对齐空间构想:团队已有模型动物园(模型+数据集配对),类似于 CLIP 把文本和图像对齐,可以把"数据集编码器"与"模型/权重生成器"对齐训练。用户侧:银行、医疗机构等拿自己的数据集(如 100 或 1000 个样本)生成一个数据集嵌入(embedding),个体样本无法被反推。
-
隐私保留的天然属性:
- 用户侧只需要提供一个聚合后的嵌入向量,不泄露任何个体样本
- 虽然仍需防范任务成员推断攻击(membership attack)、可能需要加噪,但原则上机构可以在合规前提下使用
- 德国中央银行(Deutsche Bundesbank)的外部博士生项目正是受此驱动——央行数据依法不能共享,但嵌入向量可以使用
验证隐空间是否"良态"(well-behaved):如果一个数据集本身从未在 Hugging Face 上出现过、也没有任何模型在它上面训练过,它的数据集提示能否生成落在已知网络之间的有意义新网络?如果能,说明学到的隐空间具备良好的插值性质,那就可以用最小甚至零预训练来生成神经网络——实现前向传播中的按需超个性化。
-
与神经架构搜索(NAS)的关系——互补而非替代:
- NAS 定义结构,权重空间学习提供契合该结构的"最佳权重"
- 用户给出"我要一个 ResNet-18"或"我要一个 Transformer",机器生成对应权重
- 目前若用数据集提示,仍需外部信号指定架构;若用模型提示,则架构已由锚点给定
- 更聪明的下一步:构建能理解架构元素的令牌化器,让解码器条件化地生成架构——新加坡 Kawwang 团队、Kaiser 团队已在做扩散模型+条件信号(数据集信号+架构信号)的方向
-
生成机制的细节:
- 当前生成的是权重序列,每个 token 通过位置编码知道自己在哪一层、哪个块、绝对位置
- 序列生成后整体覆写(overwrite)目标架构中的随机初始化权重,技术上直接加载 checkpoint 即可
- 由于是廉价的前向传播,可以一次生成模型集成(ensemble),开辟新的自由度
- 尚未观察到明显的"权重幻觉"伪影(如某位置生成两个权重、另一位置零权重),但理论上可能存在,需要通过条件化解码器来进一步改善生成质量、减少所需微调步数
任务向量(task vector)视角的补充:取微调模型与基座模型之差即得任务向量,可做任务算术。实证发现:某些场景下任务向量比完整权重更容易学习与生成,反之在另一些场景则完整权重更容易——这一现象目前还缺乏理论解释。
第(九)部分 开放问题、社区建设与研究展望(90% - 100%)
频率域处理的猜想:主持人提到权重中的高频/低频噪声让人联想到对权重做 FFT 变换到频率域处理。Borth 回应:据他所知目前没人这么做,但这是有趣的方向——类比图像域先用 VAE 重建、再用 GAN 强制高频信息。把权重移到其他域再处理、或先做大量预处理再学隐表示,都是开放问题。
-
权重空间学习的相邻前沿:
- Haggai Maron 等人把权重空间学习思想应用到梯度空间、激活空间,做"表示工程"
- Yediia 等人做神经网络探针(probing)——不看来访网络的权重,而是控制输入输出关系来探测网络行为
- Anthropic 也在做类似方向的探索
- 所有这些工作的共性:把训练产物(权重、梯度、激活)作为工件集合,学一个表示,用以预测性质或操纵、编辑、修改行为
-
研讨会与社区建设:
- 2024 年 ICML 有同事组织了关于"权重对称性(weight symmetries)"的研讨会
- Borth 团队 2025 年举办了首届专门研讨会
- 当前挑战:早期 PhD 们陆续毕业,新 PhD 流入有窗口期,社区出现小幅断层
- 下一阶段重点是建立共同语言、共同基准(benchmarking),在保留各自探索自由的同时形成 coherent 的社区合力
收束与前瞻:主持人总结本集从高质量训练数据稀缺出发,Borth 论证了我们忽视了已训练模型这一重要知识源;权重空间学习从"被嘲笑冷僻"走到"遥感领域 20~30 倍算力缩减",再走到"数据集提示下的隐私保留按需生成"。Borth 在结尾感慨:"让我们看看三年后会在哪里。"——面向未来,神经网络的基础模型、跨架构跨域的知识迁移、以及用模型集合替代不断增长的数据集来训练未来 AI 系统,仍是一片广阔而未被充分开垦的疆域。
Top comments (0)