ARC-AGI V3(ARC-AGI-3)完整测试指南与核心解读
一、基础定义:ARC-AGI-3 是什么
ARC(Abstraction and Reasoning Corpus)由 François Chollet 提出,V3是第三代交互式通用智能基准,彻底区别于 ARC-1/2 的静态图形推理题。
- 发布时间:2026年3月正式完整版,ARC Prize 基金会维护
- 核心定位:测试智能体自主探索、因果建模、长时序规划能力,规避大模型刷题、暴力枚举、记忆拟合作弊
- 核心设计原则:
- 无文字、无数字、无现实文化符号,仅色块网格(64×64)
- 不给游戏规则、目标、奖励提示,AI/人类必须主动交互猜规律
- 仅依赖人类先天基础先验:几何对称、拓扑、基础物理、物体持久性、因果交互
- 全关卡人类普通人可通关,AI当前存在巨大鸿沟
和 ARC-AGI-1/2 核心差异
| 维度 | ARC-AGI 1/2 | ARC-AGI V3 |
|---|---|---|
| 任务形式 | 静态图片配对推理(给示例,直接输出答案) | 回合制2D抽象小游戏,交互式动态探索 |
| 推理方式 | 一次性静态归纳 | 多步骤试错、迭代修正世界模型、长期规划 |
| 作弊空间 | 极大,代码暴力枚举可刷高分 | 极小,未知私有关卡杜绝过拟合 |
| 测试能力 | 静态抽象归纳 | 探索、因果建模、自主定目标、动态规划、记忆压缩 |
| 评分标准 | 正确率 | RHAE 人类相对行动效率(核心指标) |
二、测试环境构成(6套独立游戏环境)
分为公开集3个(开发调试) + 私有集3个(官方排行榜,防过拟合)
- ls20(地图导航类) 操控载体移动,携带匹配符号穿过变换机关抵达目标,需要多阶段链式操作
- ft09(静态逻辑匹配) 重叠色块模式还原,考验空间叠加、对称变换推理
- vc33(多物体协同操控) 同时控制多个独立物件联动触发规则,多变量因果推理
- 私有隐藏关卡:sp80、lp85、as66(仅排行榜使用,开发者无法提前获取) 总共有135个分层关卡,难度逐级提升,高权重关卡分数占比更高
三、核心评分指标:RHAE(Relative Human Action Efficiency)
- 计算逻辑: $$RHAE = \frac{人类通关平均步数}{AI通关使用步数}$$
- 100%:AI操作效率≥普通人类,完美对齐人类智能水平
- 0%:完全无法通关任何关卡
- 计分规则:
- 单关上限100%,防止超高效捷径刷分
- 关卡加权,后期高难关卡权重更大
- 步数上限:AI行动达到人类基准5倍直接终止,判定失败
- 总分:所有环境加权平均 0%–100%
- 人类基线:458名普通人测试,平均RHAE约48%,绝大多数人可100%通关全部关卡
四、当前主流大模型官方测试成绩(2026年7月最新)
1)原生基础模型(无定制推理增强,标准API)
- GPT-5.5:0.4%
- GPT-5.6 Sol:7.8%
- Gemini 3.1 Pro:0%
- Claude Opus 4.6:0% 几乎全部近乎挂科,证明原生大模型缺少自主交互式探索能力
2)OpenAI 优化方案(开启留存推理+压缩记忆双API参数)
- GPT-5.6 Sol 公开集:13.3% → 38.3%(分数翻3倍,token消耗降低6倍) 这是目前公开模型最高分,但距离人类48%基线仍有明显差距。
关键结论
当前所有前沿LLM*不具备原生交互式通用推理*:只会被动接收提示词,无法主动探索未知环境、自主构建因果世界模型。
五、ARC-AGI V3 完整测试流程(官方标准Harness)
1. 环境准备
- Python 3.9+,官方工具
arcagi3测试框架
# 安装与查看游戏列表
uv run python -m arcagi3.runner --list-games
# 单游戏基准测试
uv run python -m arcagi3.runner --game_id ls20 --model gpt-5-6-sol --max_actions 2000
2. 标准测试步骤
- 初始化:仅告知模型“你正在游玩抽象回合游戏,输出合法操作”,无任何规则说明
-
循环交互
- 输入:64×64色块网格文本表征 + 当前合法动作列表
- 模型输出:下一步操作指令
- 环境返回:下一帧画面状态,无奖励、无文字反馈
-
阶段限制
- 探索阶段:最多200步用于猜测环境规则
- 解题阶段:额外300步规划执行
- 总步数超阈值直接终止,本关0分
- 结果输出:自动生成RHAE分数、操作回放、关卡通关报告
3. 测试约束(保证公平,杜绝作弊)
- 禁止硬编码关卡逻辑、专用游戏脚本
- 仅允许通用大模型API调用,不允许定制视觉分割、专用世界模型插件(社区优化方案除外)
- 私有集关卡全程盲测,开发者无法提前调试
六、AI在V3测试中暴露出的核心短板
- 缺乏主动探索意识 LLM只会被动根据当前画面输出动作,不会主动尝试陌生操作验证因果关系;人类会主动试探机关、变量。
- 短期记忆碎片化 无法长期压缩数百帧画面的因果信息,容易遗忘前期发现的规则;人类可记住几十步前的交互规律。
- 不会自主定义目标 没有文字提示时,AI无法识别画面中“终点状态”,不知道自己要达成什么结果。
- 长时序规划失效 多阶段链式任务(先开开关→移动载体→变换图形)极易中途偏离策略,无法动态修正方案。
七、提升ARC-AGI V3分数的主流技术路线
路线1:大模型原生推理增强(OpenAI方案)
开启留存推理(Retained Reasoning) + 上下文压缩(Compaction)
- 留存推理:每轮保存历史推理草稿,持续迭代世界模型,不丢弃思考过程
- 上下文压缩:自动提炼数百帧画面的核心规则,减少冗余token消耗 效果:分数提升2–3倍,是最简可落地方案
路线2:世界模型+因果推理(学术方案)
- JEPA视觉预测模块:提前预测操作后的画面,预演试错
- 因果图引擎:记录「动作→画面变化」因果关联,构建环境规则图谱
- 双阶段架构:先探索建模,再规划解题 该方案非纯LLM,混合视觉+因果模块,分数显著高于纯大模型,但部署成本极高
路线3:图搜索探索框架
将环境状态建模为图,优先遍历未测试动作,系统性验证规则;缺点是计算量巨大,单次测试成本可达数千美元
八、如何自行开展ARC-AGI V3测试
- 官方Demo体验(人类试玩) 官网:arcprize.org/tasks,25个演示小游戏,直观感受测试难度
- 自动化模型测试 1)克隆官方arcagi3测试框架 2)接入大模型OpenAI/Anthropic/Google API 3)运行公开集ls20/ft09/vc33获取可复现分数
- 注意事项
- 公开集仅用于调试,最终真实能力以私有集排行榜为准
- 不同提示词、上下文窗口、推理参数会造成分数巨大波动,对比必须固定全部参数
九、ARC-AGI V3 的核心价值
- 区分“记忆拟合”与“真正通用推理” ARC1/2已被大模型暴力刷穿,但V3交互式环境彻底锁死刷题作弊,真正衡量流体智能。
- 定义AGI核心标准 Chollet 提出:达到人类同等RHAE,才代表系统具备类人通用自适应学习能力。
- 指引下一代Agent研发方向 证明单纯增大LLM参数量不足以实现通用智能,必须补充主动探索、因果世界建模、长时序记忆三大能力。
ARC-AGI V3 2026年8月最新最优模型总览(分三类:原生纯LLM、厂商增强推理版、混合架构Agent)
核心区分:原生裸模型(不开厂商专属推理API、无外挂世界模型)、厂商增强推理版本(OpenAI Retained Reasoning / Claude Max深度思考)、混合多模态+强化学习竞赛Agent(ARC Prize Kaggle参赛方案,分数远高于纯LLM)
评测指标统一为 RHAE(人类相对行动效率,满分100%,普通人人类基线≈48%)
一、纯原生基础大模型(无特殊推理开关,标准API直接跑,最公平横向对比)
所有主流旗舰裸跑分数普遍极低,全部低于2%:
- Claude Opus 4.8:1.5%(原生裸跑LLM第一)
- GPT-5.6 Sol 基础版:7.8%(注意:该7.8%仍为轻度推理加持,纯裸GPT-5.5仅0.4%)
- Gemini 3.1 Pro Preview:0.37%
- GPT-5.5 High:0.43%
- Claude Opus 4.6:0.25%
- Grok 4.20 Beta:0%(完全无法通关关卡)
- 国产旗舰(GLM-5、豆包Seed 2.0 Pro、Qwen 3):0.1%~0.5%区间,无突出表现
结论:纯文本大模型天生缺失主动探索、动态因果记忆,原生能力几乎无法应对交互式ARC-V3。
二、厂商官方增强推理版本(开启独家深度思考API,当前商用LLM天花板)
1. Claude Opus 5(Anthropic 2026年7月新旗舰)
- RHAE:30.2%(无第三方外挂、仅官方Max深度推理模式)
- 特点:原生长时序记忆、多步骤试探推理,是不开外部Agent框架的商用模型第一;自主试探环境规则能力显著强于GPT系列;私有隐藏关卡平均通关率领先GPT-5.6 Sol近4倍。
2. GPT-5.6 Sol + Retained Reasoning + 上下文压缩双开关(OpenAI专属增强)
- 基础裸跑:7.8%;开启双推理增强后:38.3%(商用LLM当前最高分)
- 优缺点:分数高于Opus5,但算力消耗暴涨6倍;依赖OpenAI独家API特性,第三方框架无法复现;长链式多阶段关卡容易遗忘前期探索规律。
3. 次一档增强模型
- Claude Opus 4.8 Max模式:8.1%
- Gemini 3.1 Ultra Extended Thinking:4.2%
- GPT-5.4 XHigh CoT:3.5%
三、ARC Prize竞赛混合架构Agent(非纯LLM,视觉CNN+强化学习+状态图搜索,排行榜真正SOTA)
这类方案不属于通用商用大模型,是专门为ARC-V3打造的混合智能体,分数碾压所有纯LLM:
- StochasticGoose(Tufa Labs,官方榜单第一) RHAE:12.58%;架构:CNN视觉编码+强化学习帧预测+因果状态记录,通关18个高难关卡
- Blind Squirrel RHAE:6.71%;基于状态图遍历,系统性探索未知操作
- 学术增强框架Schema-Harness(搭配Opus5/GPT5.6 Sol) 商用模型+外挂世界建模框架,公开集最高可达 95%+ RHAE,接近人类水平,但不属于原生大模型能力,依赖外部代码环境插件
四、梯队清晰排名汇总(2026.8官方基准)
Tier1(商用增强LLM天花板)
- GPT-5.6 Sol(双推理增强):38.3%
- Claude Opus 5(Max深度思考):30.2%
Tier2(次旗舰增强模型)
- Claude Opus 4.8 Max:8.1%
- GPT-5.6 Sol 标准版:7.8%
- Gemini 3.1 Ultra Extended:4.2%
Tier3(纯原生裸跑所有旗舰)
全部<2%,代表:Opus4.8(1.5%)、GPT5.5(0.43%)、Gemini3.1Pro(0.37%)
Tier4(竞赛混合架构Agent,非通用LLM)
- StochasticGoose:12.58%
- Blind Squirrel:6.71%
五、关键补充说明
- 分数差距本质 ARC-V3不考静态做题,考主动试探、自主归纳因果、长期记忆。Claude系列擅长长时序记忆与谨慎试探;GPT Sol系列依靠厂商专属推理压缩机制强行拉高分数,但算力成本极高;Gemini全系在交互式探索存在明显短板。
- 人类基准参考:普通人平均RHAE≈48%,目前最强商用模型(38.3%)仍未达到普通人平均水平。
- 评测区分提醒:
- 对外宣传只看原生裸模型分,用来衡量模型底层通用推理;
- 工程落地Agent场景看厂商增强推理分;
- 学术竞赛、专项ARC评测看混合视觉+强化学习Agent分数。
Top comments (0)