AI‑Human Simulation: MatrAIx vs Simile — Which Is Superior?
一、MatrAIx介绍
https://www.youtube.com/watch?v=xBdhoOmOM78
简单来说,MatrAIx 构建了一个“数字地球”,里面生活着与地球总人口数量相当的 83亿个AI角色(Persona Agents)。这个巨大项目的核心目标是:在软件和产品正式发布并触达真实用户之前,利用这个“数字世界”来进行极度逼真的软件测试。
以下是详细拆解:
1. 行业痛点:软件测试的“瓶颈”
- 传统人工测试又慢又贵:为了测试一款面向全球的应用,找真实用户进行测试虽然很有价值,但规模极小(比如一个月只能测试20个人),而且成本高昂,根本无法覆盖全球各地、各种背景的用户。
- 自动化脚本缺乏“人味”:传统的自动化测试虽然快,但它只能检查代码有没有 Bug。脚本不懂得什么是“用户挫败感”,也没有耐心去等一个加载很慢的进度条,更没有视障等特殊需求。
2. 解决方案:MatrAIx 及其83亿模拟用户
为了填补这一空白,研究人员开发了这套端到端的评估系统。
- 顶级AI模型驱动:这些角色由当前最前沿的大模型(如 Claude Opus 4.8、GPT 5.5 和 Claude Haiku 4.5)作为底层驱动。它们不仅是聊天机器人,更是能够像真实用户一样使用数字产品的“模拟人类”。
- 1:1还原地球人口:库中包含 83 亿个各不相同的角色记录,开发者可以通过它获得近乎“未卜先知”的能力,提前预演产品在全球发布时的真实表现。
3. 如何打造逼真的“数字人类”?
为了不让这83亿个AI变成千篇一律的克隆人,系统为它们赋予了深度的个性:
- 1,290个维度的“数字DNA”:每个AI都有极其详细的设定,涵盖从财务风险承受能力、语言水平到是否有花生过敏等方方面面。这些设定结合了合成数据和来自维基百科、亚马逊评论等脱敏的真实人类数据。
- DAG(有向无环图)常识系统:为了避免随机生成出荒谬的人设(比如:第一语言是英语,但英语熟练度却是“无”),系统通过严格的逻辑规则来确保每个生成的角色都在逻辑上站得住脚。
4. 强大的“测试游乐场”
开发者不需要一次性召唤83亿人,而是可以精准抽样(例如:筛选出“1000名位于北美的大学生”),并将他们投入到四个高度互动的测试环境中:
- 填写结构化的问卷调查。
- 与AI客服或助手进行自然语言对话(测试如果AI胡言乱语,用户会不会愤怒退出)。
- 浏览真实的互联网站点。
- 原生软件操作:最科幻的是,这些AI可以像拥有手和眼睛一样,在 iOS、Linux 或 Mac OS 界面上直接执行点击、滑动和打字操作,测试软件的菜单是否会让人感到困惑。
5. 真实的测试表现:91.5%的性格还原度
为了验证这些AI是否真的像人,系统跨越商业、金融、医疗等25个行业进行了1000多项任务测试:
- 饮食计划实验:在让1000个不同角色向AI询问食谱时,系统发现,被设定为“空巢老人”的角色比“转行者”角色更容易感到满意,且更愿意听从AI的建议。这证明角色的背景切实影响了他们的行为。
- 在400次严格控制的试验中,这些AI角色有 91.5% 的时间准确表现出了它们被设定的性格特征(包括语气、表情符号的使用习惯和认知风格)。
总结
视频在结尾指出,MatrAIx 代表了软件测试的未来范式。未来的开发者可以在一夜之间部署成千上万个特定背景的 AI,瞬间找出只有特定人群才会遇到的“边缘Bug”。也许在不久的将来,你最喜欢的新App在让你看到之前,就已经被一群“数字人类”严苛地挑剔和把关过了。
二、LatentSpace深度采访Simile 联合创始人兼 CEO 朴俊成(Joon Sung Park)
https://www.youtube.com/watch?v=KpOW9Pk4BUs
Latent Space 播客邀请到了 Simile AI 的联合创始人兼 CEO 朴俊成(Joon Sung Park)。他曾因在斯坦福大学发表首创性的生成式 Agent 论文(即著名的 Smallville 小镇实验)而名声大噪。
视频围绕他从学术研究到创立 Simile AI、如何用 AI 模拟人类行为以及数字孪生与社会模拟的未来前景展开了深入讨论,主要内容如下:
个人背景与研究起点
- 从艺术到计算:Joon 讲述了他从小从事绘画、原本打算成为职业艺术家的经历 [02:15]。他认为顶尖艺术家会创造自己的介质,而计算是时代最好的介质,因而转入 AI 研究 [02:44]。
- 《Smallville》小镇论文:2023年火爆学术圈的“生成式 Agent”论文(72,000+ 引用/阅读)通过简单的记忆与规划机制,展示了 AI 角色在虚拟小镇中具备自主社交、筹办派对等涌现行为 [03:15]。
行为基础模型与数据构建
- 模拟 vs 自动化助手:Joon 认为,打造真正优秀的个人助手前提是拥有精准的人类模型(了解你的偏好与背景)[07:49]。
- 真正的“人类暗黑知识”:目前的 LLM 主要依靠网络公开文本训练,充其量是“超理性推理机器”或模仿在线言论 [12:04]。要做出高保真的人类行为模拟,必须获取现实生活中的行为数据 [12:34]。
- Simile 的三大核心数据源:
- 深度质性访谈:了解个人的成长经历、童年与选择 [13:05]。
- 观察性数据:交易记录与网页行为 [13:58]。
- 随机对照试验(RCT):通过在虚拟实验室中给受试者真实的利益激励(如选购商品并真实寄送),捕捉因果决策机制 [14:43]。
商业应用与模拟的价值
- 模拟不是预测,而是寻求解法:决策者需要的往往不是“未来销量会下滑”这一预测,而是“现在做哪一步能改变这个结果” [15:35]。
- 数字孪生精度:Simile 曾在 1000 人的数字孪生测试中达到 85% 的行为预测准确率 [29:21],而普通大模型在特定细分人群中的准确率仅有 20%–30% [31:22]。
- 核心客户场景:概念测试(Concept Testing)、财报电话会议模拟、UI 与产品交互测试等 [19:28, 53:39]。合作方包括 Gallup(盖洛普)、Wealthfront 等 [20:00, 53:34]。
终极愿景:模拟 80 亿人类与解决社会难题
- 解决复杂“棘手问题”:Joon 将 Agent 社会模拟比作科幻小说《基地》中的“心理史学”(Psychohistory)[24:00]。未来的模拟可用于探寻气候变化协调方案、预测民主衰退信号或建立最优住房政策 [00:18, 43:28]。
- Agent 模拟的扩展定律(Scaling Laws):Simile 发现社会模拟同样存在 Scaling Law,投入更多的算力与人类行为数据,模型的预测精度会呈规律性提升 [41:59]。
- 终极愿景:打造由 80 亿数字孪生构成的全球模拟生态,其社会价值足以媲美训练千亿级基础大模型 [42:49, 50:03]。
三、豆包AI关于 MatrAIx vs Simile 的比对分析
两个项目都在做"用 AI 模拟人类",但路线几乎是两个极端。下面从定位、技术、数据、应用场景等维度详细拆解。
一、项目基本盘
| 维度 | MatrAIx | Simile |
|---|---|---|
| 性质 | 学术研究项目(开源) | 商业公司(闭源 SaaS) |
| 出身 | 哈佛 + MIT 领衔,93 位作者,OpenAI / Anthropic / DeepMind / xAI 等参与 | 斯坦福 spinout,创始人 Joon Sung Park(Smallville / Generative Agents 论文一作) |
| 发布时间 | 2026 年 8 月(arXiv 论文 + GitHub) | 2024 年底成立,2026 年融资 2 亿美元+,估值 20 亿美元 |
| 许可证 | MIT 开源,代码和数据集公开 | 闭源商业产品 |
| 一句话定位 | "83 亿虚拟用户帮你测产品" | "人类行为的基础模型,替你跑焦点小组" |
二、核心技术路线差异
MatrAIx:广度优先的结构化 Persona
MatrAIx 的核心是 Persona 8B——一个包含 83 亿条虚拟人格记录的数据库,每条用 1290 个分类维度描述,覆盖背景、心理、能力、行为、生活方式五大类 。
- 生成方式:用一个有向无环图(DAG)对属性间的条件依赖进行采样,保证"收入高→大概率住好区"这类相关性不被破坏;另一部分来自人工编写的真实档案 。
- 实际发布:83 亿是理论空间,实际开源了约 100 万条质量过滤的核心集(59.9 万人工基础 + 40 万合成) 。
- 代理驱动:把 persona 记录作为系统提示喂给 LLM(Claude Opus 4 等三种),代理本身没有持续记忆或人格演化,是"属性驱动的一次性角色扮演"。
- 行为一致性:论文报告约 91% 。
Simile:深度优先的生成式代理 + 行为基础模型
Simile 的技术根基是 2023 年的 Generative Agents 论文(Smallville 虚拟小镇,25 个代理有日常作息、社交关系) 。每个代理有三大认知组件:
- 记忆流(Memory Stream):用自然语言记录所有经历、观察、互动,持续增长 。
- 反思(Reflection):定期把近期记忆抽象成更高层结论(比如"我做职业决策时倾向稳定而非野心") 。
- 规划(Planning):把理解转化为具体行动 。
在此之上,Simile 训练了行为基础模型(Behavior Foundation Model),用三类真实数据做后训练:长访谈、观察/交易数据、随机对照试验(RCT) 。
- 准确率:模拟人类回答社会调查的准确度达到 85%——意思是"代理复刻一个人回答的准确度,相当于这个人自己两周后重测的 85%",比传统人口统计/persona 代理高 14–15 个百分点 。
- 置信度模型:额外训练了一个模型来评估每次模拟的可靠程度,避免用户把模拟结果当事实 。
三、数据哲学的根本分歧
这是两者最本质的区别:
| MatrAIx | Simile | |
|---|---|---|
| 数据来源 | 人口统计 + 调查数据 → DAG 合成 | 真实个人长访谈 + 交易记录 + RCT |
| 人格建模 | 自顶向下:1290 个标签拼出一个人 | 自底向上:从一个人的真实言行反推其决策模式 |
| 因果性 | 保持属性间统计相关性 | 显式建模"人为什么做这个决策"的因果机制 |
| 代理是否演化 | 否,每次任务是独立快照 | 是,记忆/反思/规划让代理随时间变化 |
| 非理性建模 | 依赖 LLM 内置知识 | 专门训练"非理性人类",Park 明确说"优化成理性的模型不适合模拟非理性的人" |
打个比方:MatrAIx 像给每个虚拟人发了一份极其详细的体检表+户口档案,然后让 LLM 照着演;Simile 像真的采访了这个人 10 个小时、翻了他的消费记录、做了对照实验,然后训练一个数字孪生。
四、应用场景
MatrAIx:产品发布前的"压力测试"
提供 4 种沙箱环境 :
- Survey:填问卷
- AI Chatbot:和客服机器人对话
- Web:在浏览器里操作网站(Docker 沙箱)
- App:操作原生桌面/移动应用(含 macOS、iOS)
配套 1010 个应用任务,覆盖电商、软件、金融、医疗等 25+ 领域,已跑了 18,189 次评估试验 。
典型用户:AI 产品团队、HCI 研究者、软件测试工程师——在上线前用百万级虚拟用户跑一遍,发现边界 case。
Simile:替代焦点小组的决策模拟器
Simile 的产品路线分四阶段 :
- 单个数字分身回答问题
- 同一个人经历一段时间,观察想法变化
- 不同代理互相交流(如患者和药剂师对话)
- 大量代理放进有竞争者、渠道、价格、地理因素的市场里,观察决策连锁反应
典型客户:财富 500 强、市场研究公司、产品团队、政策制定者 。公开案例包括 CVS 用它替代焦点小组 。
五、各自的短板
MatrAIx 的局限:
- 代理没有持续记忆和人格演化,适合单次任务测试,不适合长期行为模拟
- 1290 个维度都是分类标签,无法捕捉一个人独特的语气、推理习惯、隐性偏见
- 91% 一致性是"同一 persona 多次回答是否一致",不等于"和真实人类是否一致"
Simile 的局限:
- 闭源、价格高,中小企业用不起
- 数字孪生需要大量真实个人数据,隐私和伦理争议大
- 85% 准确率在调查类问题上验证过,但在高风险决策(医疗、金融)中的可靠性仍需验证
- 代理规模未公开,和 MatrAIx 的"百万级可复现"相比,更像是定制化服务
六、总结判断
- 如果你是研究者 / 开发者,需要可复现、可定制、大规模的用户测试基础设施 → MatrAIx,开源免费,直接 GitHub 拉下来跑。
- 如果你是企业决策者,想用模拟替代昂贵的焦点小组、预测市场反应、测试政策效果 → Simile,深度和预测能力更强,但要付费且数据不透明。
- 两者不是直接竞品:MatrAIx 是"测试工具",Simile 是"预测引擎"。MatrAIx 回答"这个产品在不同人群中会不会出 bug",Simile 回答"如果我涨价 10%,目标客群会怎么反应"。
- 技术趋势上,Simile 代表的"真实数据 grounding + 生成式代理"路线更被资本看好(20 亿估值),而 MatrAIx 代表的"结构化大规模 persona + 开源基础设施"路线对学术界和开发者生态价值更大。
Top comments (0)