https://www.youtube.com/watch?v=cFx9Z3ZXca0
简易版:TypeSafe CEO Diogo Almeida 播客访谈:Jev模型、System‑One架构
通俗大白话解读这场播客:TypeSafe的Jev到底想干啥
简单背景:Diogo是TypeSafe公司CEO,刚发布叫Jev的新AI模型。现在市面上ChatGPT、Claude这类大模型,是给人聊天用的;而Jev是专门给电脑代码调用的AI。
1、为啥要搞Jev?(核心矛盾)
现在AI很离谱:能解超级难的数学难题,但是很多简单重复的干活活儿,AI却没法自动干完。
就好比:AI是一台超级厉害的发动机,但是没有插头,接不到现实工作的机器上。
ChatGPT是把AI输出文字给人看;但真实世界大量工作是程序、软件在后台跑,代码看不懂人类聊天的文字,这就是现在的痛点。
Jev这类模型叫「系统一模型」,目标:输出结果直接给代码读,不是给人看。
它主打指标:花1块钱,最多的智能能力(每美元智能),追求便宜又能干。
对比老模型:
ChatGPT系列:人提问 → AI输出漂亮文字 → 人阅读使用
Jev:程序代码发请求 → AI输出机器能识别的结果 → 软件直接拿去干活
2、吐槽现在聊天AI(RLHF训练出来)的一堆毛病
现在的聊天AI用RLHF训练(人类反馈对齐),为了让人类觉得回答舒服,会出现模式坍缩。
大白话:AI学会专挑人爱听的话说,掩盖自己拿不准的地方,不敢输出不确定的结果。
举例:明明不知道答案,强行编一套看起来很通顺的假话。
这个问题对于聊天还能忍,但是给程序后台用就会灾难,程序分不清AI啥时候在瞎编。
有大佬LeCun提出过一套新理论JEPA,Diogo评价:想法很棒,但是现在还没法落地干活。
3、一个争议观点:底层AI模型,不该做“拒绝回答”
现在ChatGPT遇到敏感问题会说“我不能回答这个问题”。
Diogo说:聊天软件这么做没问题,但是当做底层API工具绝对不行!
举个生活例子:
你写了个软件,Jev藏在后台默默干活。万一随机触发拒绝,软件莫名其妙就崩了。你作为开发者完全预料不到什么时候会罢工。
👉 分清两件事:
- 能力对齐:AI老老实实完成程序员交代的任务,越稳定越好(这个要做)
- 安全对齐(拒绝过滤):强制AI遵守第三方的道德规矩(底层模型不要干这个)
类比:数据库。数据库不会管你拿它存好人数据还是坏人数据。作恶是使用者的问题,不该数据库本身去拦截。
不是说支持拿AI干坏事,Diogo的想法:过滤限制放到上层业务代码去实现,不要把约束焊死在AI内核里,焊死会破坏AI本身的智商。
4、不相信AI排行榜(公开基准测试)
网上各种AI跑分榜单,他觉得水分很大。各家公司会专门做数据刷分数,跑分高≠真实干活好用。
不要看排行榜,正确做法:拿你的真实业务去实测这个AI好不好用。
同时他提出:做AI,数据比算力、显卡重要得多。堆再多显卡,数据不行模型照样拉胯。
他们甚至坚决不用用户的真实数据来训练模型。用户的数据会带大量现实偏见,模型学多了就只会适配现在,没法应对未来新奇的软件场景。
5、Jev的特殊接口,和普通AI不一样
普通大模型输入输出全是字符串文字。
Jev提供3种专门给代码用的返回结果:
- Choice(选择):类似多选一,适合程序的分支判断(比如:A/B/C三个方案选哪个)
- Score(分数):返回一个置信分数,用来排序、判断阈值
- Bernoulli(伯努利,布尔概率):不是简单true/false,返回概率,适合if判断
💡给开发者忠告:
不要把一大堆要求全部塞到一段提示词里!把大任务拆成很多个小问题!
坏做法:写一大段提示词,让AI一次性干完所有事
好做法:拆成几十次小查询,每一步结果都能校验。出错了就新增一条判断,稳定可控。
6、关于大家关心的几个现实问题
能不能固定输出结果?(同样输入每次返回一模一样)
可以做到,但会牺牲性能成本。他们优先追求:输入意思差不多,输出就差不多(鲁棒性),而不是死板的完全一模一样。模型版本更新:上线的模型不会偷偷暗地改效果;但是不会无限永久维护老版本,会不停出新版本。
两大指标怎么选
每美元智能:Jev主攻,适合后台大批量跑任务,不怕慢,要省钱
每秒智能:追求响应飞快,适合面向人的实时产品,Jev不作为主攻方向
微调支持?
现在不开微调。微调容易让模型在小任务变强,但是通用性变笨。优先靠「拆任务+调整置信阈值+调用更强模型」解决。
7、Jev适合干什么活?
- 暗数据分析:企业存了海量历史数据,以前AI处理太贵,现在用Jev大批量解析
- AI写代码助手(编码Agent):这是最大场景,开源代码工具接入Jev会迎来大变局
- 实时场景:游戏、客服助手
- 校验别的AI输出:拿Jev去检查其他大模型有没有胡说八道
- 电脑自动化操作:控制浏览器、操作系统(现在demo看着很酷,可靠性还不够)
8、创业的底层思考
Diogo以前在OpenAI上班。他反思早期的AI产品,只拿来写文案,没能真正自动化工作。
他逆向思考:如果AI真的掀起经济革命,调用AI的主体一定是代码程序,而不是人类。这就是他创办公司做Jev的源头。
他觉得现在很多新AI实验室只是烧钱玩实验,没有找准要解决的实际任务。
他呼吁研究者:不要跟着主流思路卷聊天AI,去挖掘全新的任务方向。
9、最后总结一句话
ChatGPT这类模型是给人聊天对话的AI;
Jev是埋在软件底层,给程序代码打工的AI。
目标:让软件像调用数据库一样,简单、稳定、便宜地用上AI能力,实现大规模自动化。
详情版:TypeSafe CEO Diogo Almeida 播客访谈:Jev模型、System‑One架构与可编程AI革命
说明:无真实时间轴,按照文档token总长度,通过内容位置估算内容占比百分比。
第(一)部分 访谈开篇:Jev发布后的个人状态与行业现状 (0%‑10%)
1 发布Jev之后的身心状态:Diogo作为技术型CEO,身心极度疲惫,感觉自己像“残破的躯体”,需要处理大量突发问题;但精神层面感到振奋,认为当下自己终于和现实对齐,开发者群体看懂了Jev的价值,基于AI的经济革命重新成为现实可能性,对开发者社区满怀感激。
2 优先面向开发者而非VIP投资人:发布会后优先举办面向普通工程师、开发者的线上大厅会(town hall),拒绝把时间大量分配给投资人等权贵人群;他认为理想状态应该把绝大多数时间留给开发者社区,甚至曾设想一边前往演播室一边开线上大厅会,只是想法太过疯狂作罢。
3 社区数据与自嘲不懂自我营销:Discord社区已达到10万用户,Twitter账号热度暴涨;自嘲自己是社交平台新手,完全不擅长自我推广,还闹出把个人信息流趋势当成全网热搜的乌龙。
4 开篇抛出核心行业矛盾:提出一个长久困惑他的行业悖论——AI已经能够解决千禧数学大奖级别的难题,却连大量基础、机械的经济类工作都无法自动化;强大的自动化引擎缺少对接现实经济工作的接口;即便TypeSafe公司消失,竞争对手也要花费1‑2年才能追赶上来,Jev已经改变技术历史的发展路径。
第(二)部分 Jev是什么:System‑One(系统一)可编程模型定位 (10%‑22%)
1 Jev所属的新模型类别:System‑One模型:团队内部把Jev归为System‑One(系统一)模型,不倾向叫“决策模型”,因为能力范围会超越单纯决策;本次Jev更偏向低调的研究预览,公司内部还有大量储备技术没有放出。
2 和传统大模型本质定位差异:传统预训练大语言模型面向互联网文本自动补全;RLHF聊天模型面向人类文本回复;而System‑One机器原生大可编程模型,消费方是代码,模型输出直接供程序读取,这也是TypeSafe公司名字的由来。
3 Jev核心优化目标:每美元的智能(intelligence per dollar):名字源自Jevons悖论;团队把资源全部投入该指标的前沿;承认模型需要做权衡,可靠性、成本、校准、速度都是重要维度,但Jev系列的旗帜就是最大化单位成本下的智能水平。
4 校准(calibration)议题引入:聊到RLHF带来的模式坍缩(mode dropping / mode collapse)问题,模型输出会偏向人类最希望听到的答案,而不是模型自身真实置信度,这对程序调用场景非常有害。
第(三)部分 批判RLHF缺陷、对Yann LeCun JEPA的务实评价 (22%‑33%)
1 RLHF的关键弊病:模式坍缩Mode Collapse:Diogo刻意保证Jev发布视频全部内容真实准确,他认为RLHF带来严重模式坍缩;为了长文本生成尽量少出错,RLHF模型会变得极度保守,破坏概率分布、破坏模型校准。
2 反驳Yann LeCun一张著名图表的推论:LeCun图表提出序列越长模型出错概率会持续走高;Diogo认可图表数学逻辑,但现实实证并不完全成立,根源来自模式坍缩;GAN生成图像时会丢弃少数类别只输出高频样本,RLHF语言模型发生同类现象。
3 看待Yann LeCun JEPA(联合嵌入预测)方案:承认JEPA是非常酷的早期研究,但现实实用性存疑;自己是务实主义者,不迷信缩放定律;缩放定律意味着投入指数级资源只换来次线性能力提升,只有收益足够高才值得;大量优质研究成果躺在论文里,缺少面向真实任务打磨。
4 行业前景预判:可编程AI会迎来淘金热:Jev的发布不仅仅利好TypeSafe公司,会催生一整个平行生态,大量团队会探索如何让软件获得更强AI能力,重回早期互联网那种蓬勃创造的时代,打破“只有头部大实验室可以做AI”的垄断叙事。
第(四)部分 安全对齐:反对在技术底层做拒绝(refusal)对齐 (33%‑46%)
1 区分「安全原则」和「安全对齐」两件事:Diogo不反对安全这个原则本身,但认为当前行业流行的安全对齐往往损害用户利益;模型拒绝输出(refusal)对于聊天产品尚可接受,但作为API底层内核属于类型错误(type error)。
2 底层API中拒绝机制的致命问题:当AI作为后台依赖库运行时,如果随机触发拒绝,下游开发者完全无法预知,会造成软件随机、不可控崩溃;这套对齐思路的设计者往往缺少软件开发实践,执着于把AI打造成AI同事,而不是释放AI全部底层能力。
3 区分能力对齐(capability alignment)vs安全对齐(safety alignment):能力对齐:让模型完成开发者想要做的事,追求可预测、少测试,目标接近数据库一样可靠;安全对齐:强制模型遵从第三方的价值观约束,违背指令跟随;聊天产品做安全对齐合理,但API基础设施层面不可接受。
4 边界:不在技术内核植入价值判断:个人主观不希望产品被用于伤害人类,但拒绝在模型技术层植入过滤;每一次强制价值对齐都会撕裂、损伤模型智能;类比数据库:数据库不应该为使用者拿它做的坏事负责;作为API服务商,不应该窥探下游开发者完整业务逻辑,任务会被拆解成微小单元,这才是给予工程师最大能力的边界;只要Diogo掌权,就会把这类偏见从技术层剥离。
5 战争/恶意使用的讨论:承认业界担忧AI被用于战争杀人,但通用基础技术层不适合做这类拦截;可以在产品层、业务层处理,不能破坏底层模型智能。
第(五)部分 基准评测(Benchmark)立场、数据才是模型能力的核心 (46%‑58%)
1 API条款误解澄清:预览版本曾有限制基准测试的条款,团队后续会移除,不禁止外部基准测试。
2 强烈反对公开基准评测,认可私有代理评测:公开基准极易被刷分、游戏;历史上各大实验室专门采集模仿MMLU的数据刷榜单;公开基准无法衡量难以量化的“智能的独特质感(geniqua)”。
3 正确评估模型的思路:必须放到自己真实业务工作流中做自定义评估,靠实际使用感受建立信任;公司的核心工作就是持续提升模型可靠性的“9个9”级别;Jev其实可以在一年半之前就对外发布,但团队刻意没有那么做。
4 “最痛教训”:任务目标(northstar)、数据远大于算力:引用Sutton观点,算法胜过算力;数据比算力重要得多;LLM发展三次重要转向:RLHF转向指令跟随;RLVR做了小方向调整;TypeSafe的RLCD确立面向程序闭环的新任务。
5 TypeSafe定位是极度重视数据的实验室:模型能力本质来自数据;数据极度复杂,想要提升可靠性指标全靠数据;公司在疯狂招聘数据方向人才;好的数据人员需要具备品味,甄别模型输出问题,以通用方式修复缺陷,而不是只修复个别样本。
6 不训练用户数据:即便条款允许,也坚决不用用户真实业务数据训练;真实世界用户数据服从幂律分布,会造成过拟合,撕裂模型;目标是打造软件底层基础设施,类似TCP协议,要能适配未来科幻级未知业务;真实世界的数据会让模型过拟合当下,无法应对未来场景;数据团队像艺术家,定位、修复模型“锯齿缺陷(jaggedness)”,追求通用维度修复,而不是修补个案。
第(六)部分 RLCD概念辨析,AI自动化现实困境,行业未来畅想 (58%‑70%)
1 RLCD不是凭空造黑话,是一套新任务北极星:RLHF、DPO等后代算法本质都是在完成RLHF的任务目标;RLCD是TypeSafe确立的全新任务目标:面向可编程AI,把人类从循环中剥离,目标是让自动化可以运行;同时保持务实,如果现有技术达不到,不会强行追求不切实际的目标。
2 吐槽行业过度承诺兑现不足问题:RLVR和RLHF都有严重过度宣传问题;回到开篇悖论,AI很强却无法自动化大量基础经济工作,缺少适配经济工作的接口;即便TypeSafe消失,该方向追赶也要耗费1‑2年;这已经改写技术历史,行业会大量探索多种不同类型模型,百花齐放。
3 担忧AI寒冬已经被Jev的出现避免:如果自己没有推动这条路线,一旦出现AI寒冬,Diogo会觉得自己负有个人责任;RLHF放大了过度承诺与现实的鸿沟;Jev上线不到一周,已经被投入真实生产工作,进入狂野的拓荒时代。
4 发布之后业务数据情况:日处理token规模突破重大里程碑,不只是人类试用,大量机器后台持续调用;认为注册签名数量参考价值很低,很多注册者不是开发者,拿它当聊天机器人使用,会产生认知错位;一个重度用户循环脚本产生的价值远高于海量普通人类试用;平台团队实现极高可用性,比肩头部厂商。
5 公司定位:不想做新势力AI实验室(neolab),目标是可靠开发者平台:不在乎成为噱头型新AI实验室,希望成为稳定可靠、开发者信赖的基础设施,点燃开发者创造。
第(七)部分 可靠性、确定性、版本策略、智能/美元 vs 智能/秒指标权衡 (70%‑82%)
1 可靠性的两层内涵:一是输出智能本身的一致性,稳定完成预期任务;二是服务层面的正常运行时间、可扩展性;现在推理大模型聪明,但可靠性还不如实习生;梦想达到写代码心流状态,开发者无需试探就相信模型输出,非平凡分支也能精准执行,但这是漫长工程。
2 确定性(determinism / seed):相同输入不一定输出相同结果:团队不把“同输入同输出”当作北极星;单元测试需要确定性,但更关键的是鲁棒性robustness:语义相似输入给出相似输出;测试方法:prompt中插入无意义唯一ID,语义不变但文本变,模型输出应当接近;确定性可以做,但会牺牲单位成本智能;如果社区给出足够强业务理由,未来可以提供。
3 模型版本、LTS长期支持策略:部署上线后的模型不会偷偷悄悄更新改动;会快速迭代发布新版模型,但不承诺对旧版本无限长期支持;大量LTS版本会分裂集群,损害整体体验;不排除对Jev现有版本做临时LTS支持,团队在研究一套对开发者友好的LTS方案。
4 两大指标权衡:intelligence‑per‑dollar(Jev主线)和intelligence‑per‑second:Jev系列优先每美元智能;每秒钟智能对实时业务价值巨大,但不作为Jev的主战场;实时业务、后台批量业务二者对延迟的需求完全不同;承认行业现状很多模型更快但是更贵,Jev处在“更快同时更便宜还维持智能”这个稀缺象限。
5 评测:反对游戏评测指标,但坚持内部评测:强烈反对外部公开基准被刷分,但TypeSafe拥有严格内部评测;最重要原则是不能游戏内部评测,坚持求真,不能自欺欺人。
第(八)部分 Jev API三大原语:Choice、Score、Bernoulli(nule)以及开发最佳实践 (82%‑92%)
1 三种全新API原语,不属于传统编程语言类型:
- Choice:近似枚举、switch‑case语句,可映射为函数调用;
- Score:类似LLM打分评判,用于排序、阈值判断,不是简单整数浮点数;
- Bernoulli(简写nule):源自伯努利概率,类似布尔但连续概率输出,对应if条件判断; 团队内部还曾想命名为pool等玩梗名字。 2 API设计理念:面向计算机消费,拒绝字符串模板思维:输入的状态、指令、判断条件全部支持结构化JSON对象;不要把一切塞进system message(类比全局脏变量),不要全部拼接成字符串模板;字符串模板是面向人类交互的旧范式;AI函数应当传入程序状态变量。 3 给开发者实战建议:问题分解到最小语义单元:把复杂问题拆解为大量微小独立查询;哪怕模型当下能力有限也要坚持该范式;拆解之后每一步都可评估、可测试;不要靠一个巨大system prompt完成全部任务。 4 举例:拒绝逻辑该如何写:不要直接问“我是否应该拒绝”,而是拆成多个独立问题,分别评估不同风险维度;遇到错误可以新增问题、设置阈值、增加测试用例,永久修复,不受上下文丢失影响,相当于“不用训练机器学习就完成ML工作流”。 5 关于校准偏差、微调(fine‑tuning)的态度:承认模型会出现校准错误;目前没有开放微调;对微调持开放态度但有顾虑:微调过拟合窄任务,损失通用能力,损害边缘案例表现;备选方案:阈值调参、问题拆解、多模型级联(置信度低就调用更强模型);未来会考虑不同尺寸模型,动态调度模型能力。 6 长期愿景:希望成为类似Visa一样不起眼的公共基础设施;本次发布只是低调研究预览,还有大量技术储备;未来还会出现更多机器原生模型类型,不完全局限于决策模型。
第(九)部分 发布前后验证、主要应用场景、编码Agent生态变局 (92%‑97%)
1 发布前内部验证情况:发布前一半以上接触原型的非技术人员无法理解产品;技术圈信徒高度看好;产品更像维生素而非止疼药;目标受众是开发者;社区菜谱(cookbooks)文档投入巨大心血,并非AI生成,来自真实业务问题沉淀,原本担心教育用户会成为巨大瓶颈。
2 四大主要应用场景:
- 暗数据Dark Data:大企业囤积大量数据,过去LLM处理成本太高,Jev可以做大规模分析,数据科学家重点场景;
- 编码Agent:体量最大场景之一;
- 实时交互场景:电商、AI助手、游戏;
- 可验证观测场景:对其他LLM输出做校验; 另外还有计算机操作(computer use),属于实时方向,社区demo效果惊艳,但可靠性还有很大提升空间。 3 编码Agent生态的变化:现有商业编码Agent构建于单一模型范式;开源编码Agent接入Jev之后会迎来新机会;一旦有人找到只能在Jev上实现的杀手功能,会迅速扩散;TypeSafe正在撰写面向编码Agent的设计模式文档,计划对外放出。
第(十)部分 安全节奏讨论、个人创业心路、给研究者的建议、未来值得探索的方向、访谈收尾 (97%‑100%)
1 对“前沿AI应当降速”观点的批判:该观点建立在“所有人都必须做更多RLVR”的前提之上;而Type‑Safe路线最优选择就是零RLVR;行业太少人去探索全新任务北极星;大众不了解技术的选项空间,被少数实验室叙事引导。
2 从OpenAI离职创业心路:早在ChatGPT发布之前就思考该问题;反思Instruction‑GPT最终只用在文案生成,没有释放经济价值;逆向推导AI驱动经济革命发生时,调用AI的主体是代码而不是人类;最初以为该方向一两周就能搞定,实际耗费数年;融资、组建TypeSafe;自认为0企业家特质,从来不想当CEO。
3 给前沿实验室受挫研究者的建议:警惕“新AI实验室”热潮,很多缺少清晰任务北极星,只是花钱做实验;最重要的是确立真正解决现实问题的任务目标;如果你找到了全新任务方向,勇敢跳出固有范式。
4 留给外界的研究课题(自己团队暂时不会主攻):① 智能驱动游戏开发,NPC、故事世界;② 摆脱KV缓存桎梏的编码Agent体系,重新思考状态管理、子任务、记忆、多Agent锁与协同,上下文管理本质是内存管理问题。
5 公司招聘方向:大量招聘数据/模型能力人才、平台基建人才;希望在全球部署服务(目前缺少欧洲服务器);目标不止Jev单一模型,希望打造AI领域的AWS,System‑One只是TCP一样的底层,上层还有很多层等待探索。
6 访谈收尾:Diogo评价公司文化,不崇拜CEO权威,鼓励互相吐槽;对未来迭代充满期待,结束访谈。
Top comments (0)