https://www.youtube.com/watch?v=UCHsMVasxho
郭宇银座单向街书店分享:语言模型与世界模型之争,AI正在把手伸向物理现实世界
说明:时间占比按照文档token总长度11861进行内容位置占比估算,百分比代表文档内容起止位置占比。
第(一)部分 分享开篇:AI前沿快速迭代,本次分享主题引入(0%‑12%)
- 分享背景与选题变动:本次是银座单向街书店线下分享,原定话题多次修改;AI行业发展迭代速度极快,几乎每个月都有重大新发布,本次距离上一期分享已经间隔两个月,目标是深入浅出解读近一两个月AI领域最重要的变化。
- GPT‑6 Astra核心新能力介绍:本月重点更新GPT‑6 Astra版本,它具备强大Computer Use计算机使用能力,不再局限浏览器间接操作,可以直接操控本地专业桌面软件,例如Blender、Marvelous Designer这类3D设计软件,能够完成专业级建模,能力可以对标人类设计师、工程师。
- 李飞飞实验室世界模型Atlas初步介绍:World Labs推出Atlas版本,仅输入2‑3张图片就能够还原虚拟3D点云场景;举例可以利用逝去亲人的少量照片生成多角度虚拟视图,但生成的点阵云场景仅支持查看视角变换,无法和对象进行交互,物体不能自主在虚拟空间行动。
- 世界模型的原始设计目标:世界模型是服务具身智能(机器人)的技术路线;以Figure机器人举例,该企业在旧金山租用大量Airbnb住宅,训练机器人完成整理房间、洗衣叠被、铺床单等居家任务;世界模型通过构建模拟虚拟世界,把仿真产生的大量视频数据投喂给机器人,让机器人在虚拟环境学习现实物理规则,例如床单重量、材质、拉伸形变受力,以此提升机器人现实任务完成度。
- 两大技术路线出现能力交汇:GPT‑6 Astra语言模型路线、李飞飞Atlas世界模型路线出现功能交集;GPT‑6 Astra操作3D软件产出可复用数字资产,可以用来制作游戏资源、影视剧CG片段;Atlas依靠少量照片生成点云虚拟世界,两种不同技术方案都可以产出虚拟三维内容。
- 预告本次分享全部议题:除GPT‑6 Astra操作3D软件、Atlas世界模型之外,还会介绍新刷屏模型Jev快速分类器;希望面向无工程、无设计背景普通观众,用通俗语言结合网络实例讲解整套技术。
第(二)部分 底层逻辑:语言模型与世界模型,目标是把物理世界迁移进模拟器Real‑to‑Sim(12%‑24%)
- Real‑to‑Sim技术概念与真实目的:Real‑to‑Sim即真实世界迁移至模拟器;做这件事的核心动因并非元宇宙概念,而是服务AI与机器人,让人工智能从更多维度理解真实物理世界。
- 原生语言模型的固有短板:缺失真实世界因果认知:ChatGPT、Claude这类大语言模型本质基于概率生成文本,擅长知识类文字工作;但原生不具备现实世界因果、时间线性逻辑认知,无法自主理解现实里“前因造成后果”的物理因果关系;语言模型只能依靠搜索引擎、维基百科等外部人类知识库间接获取因果相关知识,模型内部神经网络本身没有因果维度。
- 世界模型用来补足因果与物理仿真能力:世界模型构建虚拟环境,内置重力、碰撞、各类物理规则,以此补全语言模型缺失的现实因果逻辑。
- 语言模型逐步向外延伸的发展历程:ChatGPT最初只用于生成各类语言文字;写代码能力成为语言模型触碰现实世界的第一个抓手;去年10月Claude Code推出Skill即时代码生成能力,语言模型可以生成一次性任务代码,开始间接影响软件、互联网APP乃至工业实物;到GPT‑6 Astra,语言模型直接深度操控本地电脑软件,进一步对接现实实物生产链路。
第(三)部分 实战案例:GPT‑6 Astra全自动完成宠物服饰完整3D设计生产链路(24%‑34%)
- 完整的AI服装设计全流程演示案例:以给小狗制作万圣节主题衣服作为实例;GPT‑6生成服饰多视角效果图,导入Tripo建模工具生成约200万三角面3D模型;自动导入Blender完成骨骼绑定,实现角色动态效果;自动接入Marvelous Designer,完成虚拟裁片制作,可以切换针织、硬质等不同布料材质;AI自动完成服装打板,把三维衣服拆解为二维剪裁布片,标注缝纫工艺,输出的文件可以直接给到工厂进行实体生产;整套完整流程仅耗时20分钟。
- Jev快速分类器的价值展望:Jev作为高速分类模型,可以赋能Computer Use电脑操作;如果将Jev接入CUA开源库替代原生GPT浏览器操作,电脑操作速度会提升到人类肉眼无法跟上,人类将完全放手交由AI执行任务,失去观察AI操作过程的机会。
- 本章节后续内容预告:后续会详细拆解Atlas世界模型、GPT‑6 Astra桌面软件实操、Marvelous Designer服装设计、Jev高速分类器四大模块内容;原本计划将本次分享做成实操Workshop,包含现场实操演示。
第(四)部分 GPT‑6 Astra Computer Use工作原理、两种操作模式与优劣对比(34%‑45%)
- OSWorld 2.0基准测试表现:OSWorld是评估AI操作系统操作能力的测试考卷;GPT‑6 Astra相比前代GPT‑5.6得分提升10个百分点,进步幅度显著,已经可以处理浏览器之外大量第三方专业软件。
- 模式一:视觉截屏驱动操作:AI不断对电脑屏幕截图,依靠视觉图像观察界面,判断每一步操作对错;实操小提示:操作专业软件建议软件界面切换英文,中文UI会消耗更多token,识别速度下降;该模式逻辑类似人类使用电脑。
- 模式二:MCP协议后台直接通信模式:MCP协议由Anthropic(Claude所属公司)发明,让大模型直接和软件后端代码通信;优势是可以判断逻辑对错;短板是针对视觉设计任务无效,比如衣服版型变形、模型局部破损,这类视觉问题无法通过后台逻辑识别判断,很难用语言精准描述错误。
- 实操使用建议:操作Blender等3D设计软件优先选择视觉Computer Use模式,即便会消耗更多token,视觉判断产出效果远优于MCP;MCP更适配数据库等抽象逻辑业务场景,不适合视觉创意类软件。
- 技术路线预判:下一代模型偏向视觉式电脑操作:不可能让模型训练阶段遍历世界上全部软件;类比特斯拉自动驾驶放弃激光雷达,以纯视觉模仿人类眼睛感知世界的训练思路;推测GPT下一代版本(如6.5)会大量引入Jev这类高速图像分类能力,主要依靠视觉完成电脑操作;同时评价Claude在桌面软件操控能力上已经大幅落后OpenAI。
第(五)部分 可编辑三维资产的优势,对比传统视频生成模型的痛点(45%‑54%)
- 传统视频生成Seedance类模型的固有缺陷:Seedance生成视频由大量图片帧组成,生成结果不可编辑;想要修改人物动作、外观只能重新生成;多次参考重生成会不断累积噪声造成画面失真;生成高质量视频需要几百上千字超长提示词,普通用户很难完成编写;提示词工程不会是未来主流AI交互方式。
- 原生3D数字资产的核心优势:生成可编辑3D模型后,人物动作、服饰、颜色可以随时修改调整,不需要反复重生成、不需要高额重复算力开销。
- UV展开贴图修改工作流:可以让AI生成二维贴图图片,完成UV展开映射,直接修改3D模型外观,快速更换帽子、服装颜色等外观效果。
- Tripo/Meshy工具作用:Tripo、Meshy可以把多张参考图片转换成高复杂度3D网格模型;最高支持约200万三角面,贴图支持4K‑8K分辨率;工具最初开发目的是生成人像模型供给3D打印机;举例:拍摄孩子照片,一分钟生成孩子3D模型,直接3D打印实体手办。
- 3D资产拓展应用场景:Tripo输出模型导入Blender做骨骼绑定,实现虚拟人物动作;结合语音API,实现和虚拟人物实时对话;日本创作者用来快速制作VTuber虚拟形象,部署网页端实现交互,整套工作仅需要1‑2小时;预判2026年会迎来AI生成内容大规模爆发。
第(六)部分 AI服装设计实操体验:AI能力边界、人台虚拟量体裁衣与制造业影响(54%‑67%)
- AI服装设计现存短板,必须人类介入校验环节:AI可以完成UV拼接、版型裁切,但衣服版型合身度、布料实际物理表现依旧需要人类设计师判断;模型掌握服装理论知识,但缺少实物尺寸、布料真实表现的一手信息;即便是人类服装设计师,也需要多次试样改版,AI同理;想要完全自动化,还需要接入实物测量数据、实物打版反馈闭环。
- Marvelous Designer软件介绍与适用范围:主打虚拟服装仿真;多用于虚拟角色服装创意设计,不完全等同于纺织工厂工业级仿真软件,更偏向学生创作、虚拟内容创意;内置不同布料参数,记录克重、垂坠效果,虚拟仿真效果可以达到90%以上;不能100%复刻真实布料,最终实物依旧需要白坯布打样或者交给工厂试产。
- 虚拟人台实现量体裁衣:可以输入真人照片生成对应身材比例的虚拟人台;可以模拟真人坐下、蹲起等动作,测试西裤等服饰运动冗余量,检查动态下服装变形、紧绷问题;软件只能仿真,布料肌肤触感等真实体验依旧要实体试穿确认。
- 对全球服装制造业的巨大潜在冲击:服装是全球大宗商品,女装占据服装市场极大份额;AI打通个性化服装设计‑打版‑生产全链路,未来普通人无需找裁缝定制服装;若个性化制造蚕食10%大批量生产市场,物流、全球贸易、通关体系都会发生巨大变革;提出警示,如果国内制造业不跟进这套AI个性化生产变革,未来制造业订单有可能外流。
第(七)部分 李飞飞World Labs Atlas世界模型深度解析:能力、局限、机器人训练、太空机器人应用前景(67%‑78%)
- Atlas世界模型能力细节:仅2‑3张静态照片,还原完整空间深度、场景物体,可生成子弹时间多角度画面;不仅是单纯图像,生成结果带有碰撞网格,摄像机不会穿模,具备初步物理约束;模型会自主推测照片没有拍到的画面内容,推测结果不一定和现实完全一致;画质高清,广角畸变问题已经得到很大改善,手机端很难区分虚拟与真实。
- Atlas当下的功能短板:虽然有碰撞网格,但完整物理模拟尚未完成;物体重力、受力交互还不完善,比如示例中篮球还不能自由改变投射力度、角度、自主落地反弹。
- 世界模型的核心终极用途:训练具身智能机器人:可以大批量快速生成大量虚拟场景视频,投喂机器人完成训练;提出太空应用场景:未来月球永久基地大量工作依靠机器人,需要在模拟器复刻月球重力环境,才能提前完成机器人训练,否则机器人抵达月球后无法正常作业。
- 发展阶段判断:当前Atlas仍然处于非常早期;2026年9月当下版本能力有限,期待后续多个版本迭代会带来质变,计划明年单向街继续跟踪分享该技术进展。
- 回顾AI发展节奏变化:2022‑2024年AI大多停留在文本对话;真正加速变革从2025年10‑11月开始,迭代速度越来越快,坚持做线下分享记录AI变革历程有重要意义。
第(八)部分 Jev通用快速分类器:原理、特性、成本、各类落地应用案例(78%‑92%)
- Jev模型基础背景:由前OpenAI研究员Diogo离职后开发,定位通用智能快速分类器;不属于对话大模型,不能聊天生成文本,只做筛选、选择判断;不需要提前标注数据集、不需要预微调,直接使用自然语言描述筛选条件,毫秒级别完成海量数据筛选。
- 核心技术指标与成本优势:响应延迟70‑300毫秒,部分场景宣称速度对比GPT‑6快约300倍;输出选择结果几乎零成本,输入成本很低;准确率略低于GPT‑6、Claude Opus,但是和GPT‑5.6接近;可以和大模型搭配使用:Jev负责高速筛选海量候选对象,大模型后续做内容生成。
- 案例1:电脑操作、机票搜索:用于Computer Use电脑操作,识别屏幕图像内容;搜索航班时高速筛选机场、航班选项,速度远超原生大模型。
- 案例2:邮件批量分类:短时间处理成千上万封邮件,筛选待办、旅行相关邮件,区分重要邮件和垃圾邮件,成本极低。
- 案例3:本地电脑文件自动化管理:监控下载文件夹,新文件出现自动识别、归类、重命名,存入对应磁盘目录;效果优于Mac Spotlight聚焦搜索,不需要长时间建立索引,可延伸到企业仓储、文件管理业务。
- 案例4:游戏AI自动游玩:高速读取游戏状态,实时输出操作指令;可以用于马里奥这类小游戏自动游玩;展望未来可以赋能大型游戏内原生AI角色,解决过去AI游戏角色成本高、延迟高的痛点。
- 其他脑洞方向与风险提示:可以用于量化交易、预测市场Polymarket、二手平台自动捡漏、线上抽票抢票;但是现场举例有人拿Jev做量化交易已经亏损,模型只提供高速筛选,不保证投资盈利。
- 接入渠道与行业影响预判:可直接在OpenRouter、Cloudflare直接调用,无需内测;国内大模型DeepSeek、GLM、MiniMax后续大概率会模仿同类技术实现高速电脑操作;小模型搭配Jev类分类器,能够用OpenAI千分之一成本实现类似Computer Use能力,大量C端软件会接入该类技术。
第(九)部分 AI时代的个人生存思考:智力工作贬值,智能杠杆与叙事Narrative复利能力(92%‑99%)
- 时代变迁回顾:分享者自身经历三次巨大时代变化:从乡村到深圳感受到改革开放时代;PC互联网转向智能手机移动互联网;当下是AI带来的第三次重大变革,变化速度持续加快。
- 传统教育路径面临冲击:过去东亚社会的人生路径:读书考学,依靠脑力做知识型高级打工人获得高收入;在AI时代这套路径正在失效;AI掌握海量人类知识,算力永不休息,医生、律师这类传统高收入知识工作岗位价值被稀释,单纯出卖智力很难获取超额收益。
- 新的核心思路:使用智能杠杆赚取复利:AI可以完成海量知识劳作,但目前尚不擅长构建Narrative叙事(讲故事);叙事能力是当下人类核心优势;举例JK罗琳依靠故事叙事获得巨大复利,马斯克依靠宏大叙事聚拢资源并且落地项目。
- 叙事能力的应用场景:无论是写书、做品牌、做服装、做内容博主,底层都是叙事;AI可以辅助完成生产制造,但决定故事、定义叙事主题这件事目前属于人类;叙事能力可以把AI智能转化为复利收益。
- 教育现状困境:现有东亚教育体系并不鼓励叙事、大胆构想、对外讲述未落地的想法;害怕失败被嘲笑,和AI时代需要的能力不匹配。
- 心态建议:客观看待AI带来的变革,不制造焦虑,保持开放心态;个体无论是调整工作方式、规划下一代教育,前提是认清世界客观发生的技术变化,才能调整自身应对策略。
第(十)部分 结尾:开放问答环节开启(99%‑100%)
- 现场互动说明:本次分享剩余半小时时间,开放现场听众自由提问。
- 分享者承诺会尽可能回答大家提出的全部问题。
Top comments (0)