https://www.youtube.com/watch?v=I-rLxiIGf-4
谁在出题、卖题、判卷?深度解析AI数据行业的野蛮生长
说明:百分比按照文档token总长度12876做占比估算,代表内容在全文的位置占比。
第(一)部分 节目开篇预告:线下AI活动介绍(0%‑7%)
1 主持人开场首先宣传《硅谷101》即将在湾区举办的黑客松活动,活动归属Alignment 2026年度大会,活动名称为STORY101 LAB AI视频创作挑战赛。
2 赛事面向两类人群,一类是已经使用AI拍片的专业团队,另一类是想要尝试AI视频创作的新手;赛事划分探索组与专业组,会配套免费实操培训。
3 参赛优胜作品可以获得奖金,同时能够在千人规模的线下活动进行公开展映;活动举办时间为10月10‑11日,地点位于桑尼维尔的Plug and Play科技中心,报名入口放在本期节目的附信息当中。
4 Alignment 2026大会本身也开放报名,已经邀约OpenAI、英伟达等多家知名企业机构嘉宾参与线下交流。
第(二)部分 行业现象:AI数据赛道迎来爆发式估值增长(7%‑17%)
1 很多投资人近期高度关注AI数据赛道,随着大模型能力迭代升级,模型企业对于训练数据的需求变得更加复杂、更加细分,硅谷涌现一大批高速增长的数据服务企业。
2 举例新秀企业AfterQuery,不到半年估值从3亿美元暴涨至32亿美元,创下YC孵化企业最快独角兽纪录;老牌数据企业同样估值惊人,Meta入股时Scale AI估值超290亿美元,Mercor融资估值达到100亿美元。
3 高估值的背后,外界很难看懂数据公司实际业务模式,由此引出核心疑问:这些数据公司究竟售卖什么,为什么大模型企业愿意付出巨额资金采购。
4 简单科普传统数据标注与当下新增业务差异:过去的数据标注主要是图片打标签、给模型输出打分;如今需要行业专家,把自身专业知识转化为模型可以学习的任务,诞生评分细则、强化学习环境这类新型数据产品。
5 当前AI评测类型持续扩张,覆盖金融、法律垂直行业,还出现智能体完整工作流程测试;同时带来新行业困惑:榜单分数提升是否等于模型真实能力变强,针对榜单优化什么时候属于能力提升,什么时候只是单纯刷分。
6 介绍本期两位访谈嘉宾:Scale AI负责后训练与评测研究的何允中,伯克利博士后、智能体终极测试基准项目研究者孙一铀,正式开启对话。
第(三)部分 嘉宾自我介绍,以及市面AI数据公司的主要分类(17%‑31%)
1 何允中自我介绍:他在Scale AI负责后训练以及评测研究工作,团队对外输出基准测试、强化学习数据相关研究文章,本质上相当于为整个大模型行业提供数据和方法论支撑,相当于行业外包的数据研究团队,同时声明发言仅代表个人,不代表公司与客户立场。
2 孙一铀自我介绍:伯克利博士后,研究方向是智能体评测;主导智能体终极测试基准项目,该项目联合三百多位行业专家共同打造,目标是构建规模最大、覆盖范围最广的智能体评测基准。当前公开150多个任务,覆盖五十多个细分行业,计划新版本扩充至一千余个任务,几个月内发布第二版。
3 AI数据服务商的几大类别:一部分企业基因来自招聘业务;Scale AI这类企业起源传统众包标注;还有新兴企业主打合成数据;也有原本做模型的公司,产出大量素材之后顺带做起素材售卖;不少传统行业从业者发掘自有数据商业价值转型做数据公司。
4 不同类型玩家特点:综合型大厂如Mercor、Surge AI、Scale AI,业务范围广,希望覆盖全部需求;偏研究工程向新秀企业,聚焦代码、工具调用这类风口赛道;还有小型垂直领域公司,一部分做标注,一部分充当数据中间商,比如手握版权素材做倒卖;当下新趋势是专家组建团队深耕单一垂直领域。
5 招聘出身的数据公司商业模式解析:Mercor起家就是AI面试产品,核心资产是自建专家网络,可以快速调动大量行业专家;行业普遍存在取舍难题,自建全职专家团队人员质量高,但是灵活性不足、产能受限;众包网络灵活度高,但人员产出质量难以管控,由此衍生出数据与人双重质检的业务,也是部分头部数商的核心优势。
第(四)部分 行业需求变迁:从众包标注数据走向智能体数据(31%‑48%)
1 何允中回顾入职经历,见证行业薪酬、人才竞争疯狂上涨,亲身观察行业热点快速迭代:一年多前评分细则属于新潮事物,行业热点很快转向强化学习环境。
2 2024年前后行业需求发生巨大变化,预训练阶段需要海量基础人工众包标注数据;深度搜索兴起之后,行业转向智能体相关数据,评分细则、强化学习环境、真实工作流数据成为核心需求。
3 预训练、基于人类反馈的强化学习的局限:预训练依旧重要,但行业研究热点发生转移;早期推理模型依靠数学、代码做强化学习,对错客观可判定;但医疗、金融、通用文本领域没有简单客观标准答案,无法直接用对错判断输出好坏。
4 评分细则的原理:专家提前写好完整打分标准,普通人员或者弱模型就可以依据这套标准评判模型输出,实现“弱监督强模型”。专家把脑海知识固化成规则,低能力的工具就可以完成判卷,这套方案曾经非常火热,也是不少企业崛起的推手;但容易收集的静态文本类评分细则资源被挖掘得差不多。
5 强化学习环境的升级:仅仅评判文本输出已经不够,智能体需要实际动手完成任务,需要配套工具、沙盒执行环境、多样化验证手段。验证方式包含程序自动检查、评分细则、人类偏好选择;行业尚未形成统一标准,不同团队路线分化,有的评测完全抛弃评分细则只使用程序校验。
6 两位嘉宾观点分歧:何允中认为静态文本类评分细则行业热度下降;孙一铀认为依靠专家的主观判断题评分细则依旧远远没有被充分开发。
第(五)部分 评测基准构建难题:如何兼容多样化正确输出,主观指标如何量化(48%‑63%)
1 借鉴代码领域高速发展的经验:代码领域发展快,得益于大量可验证的评测基准,企业为榜单优化带来模型真实能力提升;希望把这套逻辑复制到其他行业,打造大量有实际价值的评测,模型刷有意义的榜单就能带来真实工作能力提升,这就是智能体终极测试基准项目的初衷。
2 多正确答案带来的评测困境:很多任务不存在唯一标准答案,例如制作游戏、部分数学解题思路;如果强制和唯一标准答案比对,评判就会出错;如何设计评分细则兼容多种正确输出,是构建评测基准的一大难点。
3 主观感受的量化难题:像游戏好不好玩、画面好不好看这类主观指标,没有简单固化评判条款;虽然部分领域存在科学指标可以衡量主观体验,但是目前缺少公开、完整可用的评测体系,高度依赖深度的专家参与。
4 验证器与模型同步成长逻辑:模型能力变强之后,用来校验模型的验证工具也可以同步变强;验证体系掌握的知识能力,必须高于被训练的模型,否则无法完成训练目标。
5 主观问题混合解决方案:完全写成硬性评判条款很难,会把评分细则写得过于模糊;可以结合专门训练奖励模型处理主观判断,再搭配硬性评分细则,采用混合方案解决主观评价,例如AI绘图任务。
6 评分细则与运行环境的关系:二者不是对立,运行环境提供任务执行平台,评分细则负责最终打分奖励,二者需要搭配使用。根据任务特性区分:任务指令清晰、输出结果唯一适合确定性评分细则;涉及人类高层决策的任务高度模糊,很难量化,训练对应的奖励模型难度极高,是未来巨大挑战。
第(六)部分 评测基准和售卖数据需要划清边界,什么才是高质量评测(63%‑78%)
1 评测基准和商业数据的本质区别:评测基准用来定位模型能力缺口,偏向科学研究;商业数据用于当下模型训练优化。做评测基准的团队很容易凭借领域专业性获得数据售卖的商业权威性,带来商业诱惑。
2 行业红线警示:严禁把评测基准的测试题目拿来当做训练数据对外售卖;一旦评测数据流出用于训练,就会污染评测基准,榜单彻底失去参考价值,同时损害整个行业。
3 “刷榜”不完全是坏事:如果评测基准贴近真实世界工作需求,针对榜单优化可以带来模型实际能力提升;但如果只是为榜单做特化适配,不会带来通用能力进步,刷榜就变成负面行为。
4 两类高质量评测基准:第一种,测试模型底层通用认知能力,优化之后能够在多个评测任务同步提升;第二种贴合真实用户应用场景,直接反映实际产品体验。最好的评测可以同时满足两点。
5 综合榜单的缺陷:把多个评测赋予权重合并打分,权重设置本身非常主观,榜单结果容易遭受质疑;头部大模型企业大多自建内部评测体系,第三方评测更多用于对外宣传佐证;中小型实验室高度依赖公开第三方评测。
6 小众垂直评测现状:很多有实际业务价值的垂直评测不会出现在大众公开榜单;一个评测能不能火有很多随机因素,例如被综合榜单收录、某家大厂率先使用;大量不为人熟知的垂直评测正在行业内部被使用。
第(七)部分 评测理想分布很难实现,智能体评测成本高昂(78%‑86%)
1 理想评测分布代表真实用户实际遇到任务,对应真实的用户反馈体验;但是智能体时代很难实现,智能体长周期任务运行耗时极长,运行成本巨大,无法像简单问答一样大规模采集人类实时打分。
2 即便拿到用户反馈,本身也带有主观偏差;线上产品A/B测试结果和评测榜单分数经常出现不一致,榜单高分不一定等于用户实际体验更好。
3 不同企业对评测的使用策略差异:资金人才充足的头部企业以自建评测为主;资源有限的前沿小实验室依赖公开第三方评测。
4 长期发展来看,成熟业务赛道可以依靠线上用户指标判断模型好坏,类似传统互联网产品看用户活跃度;但像科学研究这类新场景,缺少大规模真实用户数据,依旧只能依靠人工构建评测基准。
第(八)部分 AI数据采购创业机会,垂直领域面临重重卡点(86%‑98%)
1 当下很多小型AI数据创业公司拿到高估值,大量机会来自垂直领域;新兴强化学习环境公司很多做合成数据,依靠工程能力快速产出大量训练环境。
2 数据业务分为两大环节:原材料采购,以及原材料加工成适配大模型训练的环境、标注、任务。采购环节正在成为行业巨大壁垒。
3 垂直领域落地的各类现实阻碍:很多行业需要商业软件、私有数据库版权授权,版权采购成本极高;举例游戏源码采购报价可达数百万元;医疗领域受隐私限制,病例数据获取门槛高。大量细分行业,连一套完整的评测基准都不存在,更不用说配套训练数据。
4 合成数据创业公司的生存难题:合成数据存在生命周期,当行业热点赛道被卷完,需要快速抓住下一个新方向;采购能力弱的企业会被市场淘汰。
5 未来数商核心竞争力:即便大模型企业自身也组建数据团队,外部第三方数商依旧长期存在价值。大模型公司存在利益冲突,不方便深度介入部分行业获取企业私有数据;第三方企业核心竞争力变成研发,提前研究未来需要的行业,搞定版权与素材,制作评测和训练数据再对外输出。
6 商业上的定制化服务:数据供应商会根据客户模型当前能力筛选难度适配的题目,采集、筛选模型运行轨迹,提供配套训练方案;同一份原始数据可以买断独家,也可以多家售卖。
7 训练配方与奖励作弊问题:拿到数据不等于就可以直接训练,需要整套训练流程方案;要防范奖励作弊,也就是模型找到取巧捷径拿到高分,却没有真正完成任务;需要对抗测试、多维度复杂奖励来规避该现象。
第(九)部分 数据污染、造假难题,奖励机制设计是核心痛点(98%‑110%)
1 数据污染问题:一部分是评测任务本身脚本、题目设计有缺陷;另一部分是测试内容提前进入训练集,模型见过原题导致分数虚高。公开数据的污染有技术手段检测;最棘手的是人为编造虚假专家数据,虚假内容看起来高度逼真,验证成本极高,需要同等水平专家花费大量时间核验。
2 众包、专家提交任务的作弊动机:无论是按小时付费,还是以署名权当做激励,都存在参与者造假提交劣质、编造任务的情况。
3 探索新的激励方案:例如工作量证明,要求完整留存全部工作步骤流程,提高造假的成本;如何设计激励,让参与者利益和项目目标对齐,是重要研究方向。
4 智能体执行任务大量动作本质都可以抽象为调用接口、代码操作,因此代码相关数据依旧是行业内卷重点。
第(十)部分 行业长期展望,学术与商业数据收集的差距,节目收尾(110%‑120%)
1 探讨数据行业并购可能性:私募资本出现新玩法,收购垂直行业企业,一方面用AI降本增效,另一方面挖掘企业内部数据对外售卖。
2 数据服务商的生意特点:很难像互联网产品一样积累用户之后躺赚收益;大模型迭代速度太快,行业热点持续变化,企业必须不停迭代研发;最大优势是搭建可持续发掘新任务、新领域的流水线飞轮。
3 学术项目和商业数据采集的差异:学术项目可以依靠荣誉、署名吸引高水平专家无偿贡献;商业采购需要支付高额报酬,预算限制很难拿到顶级专家产出的数据;设计有效的商业激励机制,是商业数据收集最大难点。
4 总结行业现状:当下属于百花齐放阶段,仍存在大量未被挖掘的行业机会。
5 主持人结束访谈,告知听众各平台收听渠道,播客文稿会发布在微信公众号,节目正式结束。
Top comments (1)
Some comments may only be visible to logged-in visitors. Sign in to view all comments.