DEV Community

cognitalk
cognitalk

Posted on

Why Jev Is Changing How We Build With AI | 为什么Jev正在改变我们使用AI的方式


https://www.youtube.com/watch?v=9Aato-NfjoU

整文标题:从“会聊天的AI”到“会办事的AI”——Typesafe创始人Diego谈Jev、机器原生智能与RLCD决策模型

通俗易懂整文解释:
这篇访谈核心在讲一件事:现在的大语言模型很会聊天、写文章、做数学,但让它干“改个银行卡、审个保险、填个工单、决定要不要退款”这种公司日常小事,反而经常出错、不敢全自动。Typesafe的Jev想换一种做法——不把AI训练成“写字的作者”,而训练成“给软件做选择题的裁判”。它会把一堆可选决定、业务输入喂进去,返回每个决定靠谱的概率;开发者用自己的代码设阈值、加规则,像调数据库一样把AI嵌进系统。创始人说,很多所谓“只是分类器”的吐槽没看懂:分类本身正是把智能装进软件的常规方式,但Jev不是简单拿个现成小模型加分类层,而是用新训练方法RLCD重新让模型学会“校准地做决策”,既快又便宜,更重要的是稳。访谈还拿RLHF、RLVR对比,说以前优化“让人满意”,现在要优化“让程序可信任”;拿Waymo和特斯拉说可靠自动化靠工程拆解而不只靠一个大模型;最后讲未来写代码Agent也可用Jev做路由、工具选择、审核,把“会聊”的AI变成“会办正事”的AI。

第(一)部分 节目开场、Jev发布背景与“为什么AI不自动”的核心质疑(0% - 10%)
1 采访背景与Jev出圈情况:三周前Typesafe结束隐身状态发布Jev,迅速成为AI圈最热新模型之一;开发者分成两派,一派认为它只是分类器、没什么新奇,另一派认为它快、便宜、适合构建自动化;几天内出现开源仿品,OpenAI也随后宣布自己的决策类模型回应。主持人指出,多数公开讨论其实没抓住重点,Jev真正的革新不在速度成本,而在“AI该为哪种目标优化”这一根本问题上。
2 嘉宾身份与来路:Diego Almeida是Typesafe联合创始人兼CEO,曾在OpenAI工作四年半,参与InstructGPT与RLHF相关研究,是把语言模型调教成可用助理的关键人物之一;他现在做Jev,提出“machine native intelligence(机器原生智能)”概念,即模型不优化给人看的自然语言字符串,而优化给软件调用的可靠决策。
3 电梯演讲与自动化空白:Diego用“所有自动化都去哪了”作电梯演讲——AI在聊天、深研、写代码上超人,但在数据录入、保险核保、客服改银行卡等看似简单的后台事务上几乎不能用;他认为这中间的巨大落差不是个别产品问题,而是整个现代AI范式问题,节目由此进入对“智能很强却没用”的拆解。

第(二)部分 智能与无用之间的裂沟:字符串生成vs离散决策(10% - 19%)
1 Token变压器只擅长产内容:主持人追问为何数学千禧难题能解、基础会计却自动化不了;Diego先说现代AI核心基本是token预测Transformer,再套大量外围机制让它越来越会写文章、写词、写文本,但大家把所有问题都硬塞进“生成字符串”这一把锤子里,很多事务天然不适合。
2 优化目标决定产出形态:核心论点是“你得到的是你优化出来的东西(you get what you optimize for)”;传统LLM优化字符串,字符串面向人或其它LLM消费,而会计、保险、工单、表单是面向计算机的特定字段、固定格式、离散判断,二者目标不同,所以用聊天模型做这类事会又贵又错。
3 具体反差案例与“有用性缺口”:以客服机器人为例,Anthropic等官网智能体很会抛FAQ,但让用户换信用卡这类极简单操作都做不好;以Navier-Stokes数学/流体方程对比会计,说明“难的科学问题可超人、简单的企业流程却不可用”不是智力上限问题,而是任务定义与优化对象问题;这一段奠定全访谈“重新定义任务”的基调。

第(三)部分 锯齿能力、RLHF不对称与苦涩教训(Bitter Lesson)(19% - 31%)
1 Jagged edge到底是模型属性还是用法属性:主持人提“智能像锯齿,文本与决策不是一刀切”;Diego用ChatGPT是否会无端辱骂为例,说明模型在某些维度其实很稳,锯齿不是AI本体必然属性,而取决于应用场景和优化过程。若客服退款该拒却批,从准确率看和乱敲键盘一样是0%,但RLHF奖励模型会让“乱说话”被重罚、不会出现在推理中,因此不对称性来自人为优化菜单。
2 ML从业者常忽略优化目标:Diego称“你得到你优化的东西”连做ML的人有时都忘;他重讲Sutton苦涩教训的简化版——业界常迷算法,学术年代算力少,后来Scaling算力似乎万能,但他更强调数据重要、且比数据更重要的是“正确任务”;预训练loss能跑出惊艳智能是少数人的赌注,真正大跳跃来自重新定义任务,如RLHF。
3 RLHF三种历史形态与从零造数据:区分早期机器人后空翻RLHF、学习摘要RLHF、以及当前指令跟随RLHF;强调做指令跟随前,互联网根本没有“两个模型回答的人类偏好数据”,团队必须自己设计任务、自己采偏好,方向未验证时只靠信念;CatGPT、o1、Jev都是这种“新任务+新数据”带来的阶跃,而非单纯更大模型。

第(四)部分 Diego职业脉络、科幻demo与工程化可靠性的分野(31% - 43%)
1 从2016到OpenAI再到Typesafe:十年前与主持人聊深度学习,之后去Google、退休玩竞技游戏和即兴表演,再入OpenAI四年半,参与多项核心项目;全程执念“AI为什么强却不做简单工作”,直到做Typesafe/Jev,目标不是再做一个聊天王,而是把后台自动化做到大规模可靠。
2 科幻感demo≠可部署效用:以特斯拉里让Grok建视频、车还自动驾驶为例,承认LLM类应用很酷,但指出LLM是“智能压缩最强、实用最低”的一类;自驾车他更推崇Waymo——不是单一端到端大模型,而是把感知、规划、策略拆模块、工程化、可调试,因而安全可可靠。对比之下很多AI公司只做demo、融A轮、承诺可靠却最终退化为“人在回路”,因为底层模型不可控。
3 LLM不能作为稳定软件依赖:Diego说LLM难以提供抽象边界,会任意崩;第一方App可多模型兜底,但开发者平台不能靠“抽象泄漏后人工修”来做产品;客服demo从2020讲到现在仍没解决,免下车点餐也反复失败,说明很多“看起来比千禧数学简单”的任务,因要求稳定、合规、可审计,反而比自由聊天难落地。

第(五)部分 Jev起源、分类器争议与“不是分类器那么简单”(43% - 57%)
1 多年同一北极星,产品只是最近成型:投资人说pitch史上最牛,Diego直言去年讲一样内容没人懂,现在热闹是PMF而非新点子;北极星一直是“为软件自动化优化、为机器而非人写字符串优化”,Jev是其中第一个80/20产品。回应外界两派:一派嫌它像logistic回归/分类器,一派夸它比LLM便宜快。
2 分类器本身就是软件智能的正经接口:他强调分类器不是ML创新而是有用性形状;Meta、Google大量能力本质靠分类/回归把智能嵌进系统。若Jev被称为“任意任务的零样本通用分类器”,他觉得是最高褒奖——相当于随叫随到的2019年十几人MLE团队,但质量更高、速度更快。真正懂结构化输出的DSPy/结构化派、喊“phantom lib”的开发者,是最早兴奋的人,因为他们长期被字符串模型耽误。
3 嵌入模型+分类器、小模型、OpenAI决策模型都不等同:若只在embedding或小模型上加logistic回归,得到的智能上限就是“embedding/小模型+logistic”的智能;Jev不是卖接口、不是卖低价低延迟,而是重新优化“决策智能”。速度零、成本零是理想,但用户付钱买的是可靠性与判断质量;开源仿品和OpenAI decisioning若只抄接口/成本/速度、不重做智能优化,就沒抓到核心。他原以为此类后训练一周可成,结果因决策校准远难于字符串,做了很久。

第(六)部分 Jev技术形态、RLCD与概率校准(57% - 70%)
1 不完全是常规后训练,而是重构栈:Diego说“post-training”一词对未来会不准确;Jev基于多种开源权重模型做“Frankenstein”式重组,拆掉大量面向人写字的组件,按决策目标重接。团队没做预训练,认为互联网内容已被煮成可下游用的压缩知识,重点是在此之上做10倍级决策跳升。模型内部可视为“压缩版互联网电池”,再套非语言接口。
2 RLCD定义与相对于RLHF的差别:RLHF优化人类偏好、赞踩、写让人满意的话;RLCD(reinforcement learning for calibrated decisions)优化“校准过的决策”,包括多算法组合,目标是给软件可调控概率。举例function calling本就是决策层,但今天聊天API只给字符串旋钮;Jev主张每个函数/工具应有logic bias,让Walmart与Costco不同退款、升级人工策略通过阈值调,而不是把政策写死在system prompt里。
3 概率、阈值与校准来源:Jev对外API返回置信度/概率,相当于把logits交给开发者自行采样与路由;内部外部API基本一致。校准不是简单让模型吐0到1数字,而是从开源基模的预训练校准出发,再用RLCD目标引导——他指RLHF、RLVR为通顺文字会制造过度自信、mode collapse,严重破坏概率质量,GPT-4后只发后训练版本更明显;RLCD则像RLVR自举推理那样自举校准,让长尾概率可信,支持成本/收益不同的业务动作筛选。

第(七)部分 泛化、分布内/外、模型与代码harness关系(70% - 83%)
1 泛化难度:决策不一定比文本更难:主持人担心会计工作流“非常精确、分布外就自信错”;Diego反问ChatGPT是否算通用,指出RLHF因主观文本很容易显得通用,RLVR刷基准会带来脆弱锯齿,纯数学千禧题反而可能比简单业务流更难。Jev的泛化不靠无限补文本,而靠正确决策任务+校准基模;早期发布类比早期ChatGPT,可靠性曲线还在前段,业务工作流会逐渐超越常规RLHF/非推理模型。
2 模型vs harness:拒绝“马车轮子”式套壳:他用代码而非harness看Jev——LLM加while循环、工具调用只是形状,真正可用来自把任务放进分布、拿到对应数据;Claude Code早期不火、后来突进,他判断是编码代理数据入分布而非单纯harness魔法;OpenClaw同理,形状再好没有决策智能也难稳。Jev更低层,用户用自己代码调用,商业逻辑、秘规不塞系统提示,而像调数据库/逻辑门一样嵌进应用。
3 开发者定位与无码不可用:Jev不是给非程序员聊天写文案,也不是替代写代码本身,而是增强代码判断力的原语;Typesafe不提供托管式万能代理,只给模型、概率、偏置,工作流、数据、审计全在用户侧,便于长期维护与组合更高层认知抽象。

第(八部分 代理架构、KV缓存、工作流未来与路线图(83% - 100%)
1 Jev进agent框架的重写空间:现有agent多用文本模型做路由、工具选择、循环决策;Jev可提供可靠低成本的判断节点,做升级人工、分类意图、过滤子任务。Diego发过“KV cash rules everything around me”思路:当前agent受KV cache追加式、贵、易污染限制,所以子代理、重排序、fan-out少;若假设极便宜可靠决策智能,可设计非追加状态、分层检索、pop/push决策栈,减少tool call占上下文。
2 工具调用与logit bias改造:模型常被过度拟合到原生工具,外接工具叫不动;若对工具调用给logit bias,就能在不污染上下文情况下细粒度插入/抑制工具。对coding agent可用Jev做文档分类、局部判断,避免每次用大型推理模型全量读库;此为混合架构中间态。
3 工作流刚性与代理灵活性的取舍:主持人担心回到静态工作流增加技术债;Diego说一次性任务用不稳LLM碰运气即可,但高价值、可后台、可复用依赖必须前期工程化、长期维护。Jev强制“上轨道”对规模化自动化是特性不是缺点;未来是hybrid,越来越多逻辑由代码定义、模型只做语义判断。
4 下一步与团队计划:将推多模型、所谓system-one模型、早期访问计划;部分模型未到公司可靠性印章但智能已超常规;他个人更想做技术不想管公司,计划大量招人。整体愿景是把AI可靠性做成像SQL一样无聊、可预测,开发者随用随调“智能数据库”。

Top comments (0)