DEV Community

cognitalk
cognitalk

Posted on

ARC-AGI V3(ARC-AGI-3)完整测试指南与核心解读

ARC-AGI V3(ARC-AGI-3)完整测试指南与核心解读

一、基础定义:ARC-AGI-3 是什么

ARC(Abstraction and Reasoning Corpus)由 François Chollet 提出,V3是第三代交互式通用智能基准,彻底区别于 ARC-1/2 的静态图形推理题。

  • 发布时间:2026年3月正式完整版,ARC Prize 基金会维护
  • 核心定位:测试智能体自主探索、因果建模、长时序规划能力,规避大模型刷题、暴力枚举、记忆拟合作弊
  • 核心设计原则:
    1. 无文字、无数字、无现实文化符号,仅色块网格(64×64)
    2. 不给游戏规则、目标、奖励提示,AI/人类必须主动交互猜规律
    3. 仅依赖人类先天基础先验:几何对称、拓扑、基础物理、物体持久性、因果交互
    4. 全关卡人类普通人可通关,AI当前存在巨大鸿沟

和 ARC-AGI-1/2 核心差异

维度 ARC-AGI 1/2 ARC-AGI V3
任务形式 静态图片配对推理(给示例,直接输出答案) 回合制2D抽象小游戏,交互式动态探索
推理方式 一次性静态归纳 多步骤试错、迭代修正世界模型、长期规划
作弊空间 极大,代码暴力枚举可刷高分 极小,未知私有关卡杜绝过拟合
测试能力 静态抽象归纳 探索、因果建模、自主定目标、动态规划、记忆压缩
评分标准 正确率 RHAE 人类相对行动效率(核心指标)

二、测试环境构成(6套独立游戏环境)

分为公开集3个(开发调试) + 私有集3个(官方排行榜,防过拟合)

  1. ls20(地图导航类) 操控载体移动,携带匹配符号穿过变换机关抵达目标,需要多阶段链式操作
  2. ft09(静态逻辑匹配) 重叠色块模式还原,考验空间叠加、对称变换推理
  3. vc33(多物体协同操控) 同时控制多个独立物件联动触发规则,多变量因果推理
  4. 私有隐藏关卡:sp80、lp85、as66(仅排行榜使用,开发者无法提前获取) 总共有135个分层关卡,难度逐级提升,高权重关卡分数占比更高

三、核心评分指标:RHAE(Relative Human Action Efficiency)

  1. 计算逻辑: $$RHAE = \frac{人类通关平均步数}{AI通关使用步数}$$
  2. 100%:AI操作效率≥普通人类,完美对齐人类智能水平
  3. 0%:完全无法通关任何关卡
  4. 计分规则:
    • 单关上限100%,防止超高效捷径刷分
    • 关卡加权,后期高难关卡权重更大
    • 步数上限:AI行动达到人类基准5倍直接终止,判定失败
    • 总分:所有环境加权平均 0%–100%
  5. 人类基线:458名普通人测试,平均RHAE约48%,绝大多数人可100%通关全部关卡

四、当前主流大模型官方测试成绩(2026年7月最新)

1)原生基础模型(无定制推理增强,标准API)

  • GPT-5.5:0.4%
  • GPT-5.6 Sol:7.8%
  • Gemini 3.1 Pro:0%
  • Claude Opus 4.6:0% 几乎全部近乎挂科,证明原生大模型缺少自主交互式探索能力

2)OpenAI 优化方案(开启留存推理+压缩记忆双API参数)

  • GPT-5.6 Sol 公开集:13.3% → 38.3%(分数翻3倍,token消耗降低6倍) 这是目前公开模型最高分,但距离人类48%基线仍有明显差距。

关键结论

当前所有前沿LLM*不具备原生交互式通用推理*:只会被动接收提示词,无法主动探索未知环境、自主构建因果世界模型。

五、ARC-AGI V3 完整测试流程(官方标准Harness)

1. 环境准备

  • Python 3.9+,官方工具 arcagi3 测试框架
# 安装与查看游戏列表
uv run python -m arcagi3.runner --list-games
# 单游戏基准测试
uv run python -m arcagi3.runner --game_id ls20 --model gpt-5-6-sol --max_actions 2000
Enter fullscreen mode Exit fullscreen mode

2. 标准测试步骤

  1. 初始化:仅告知模型“你正在游玩抽象回合游戏,输出合法操作”,无任何规则说明
  2. 循环交互
    • 输入:64×64色块网格文本表征 + 当前合法动作列表
    • 模型输出:下一步操作指令
    • 环境返回:下一帧画面状态,无奖励、无文字反馈
  3. 阶段限制
    • 探索阶段:最多200步用于猜测环境规则
    • 解题阶段:额外300步规划执行
    • 总步数超阈值直接终止,本关0分
  4. 结果输出:自动生成RHAE分数、操作回放、关卡通关报告

3. 测试约束(保证公平,杜绝作弊)

  • 禁止硬编码关卡逻辑、专用游戏脚本
  • 仅允许通用大模型API调用,不允许定制视觉分割、专用世界模型插件(社区优化方案除外)
  • 私有集关卡全程盲测,开发者无法提前调试

六、AI在V3测试中暴露出的核心短板

  1. 缺乏主动探索意识 LLM只会被动根据当前画面输出动作,不会主动尝试陌生操作验证因果关系;人类会主动试探机关、变量。
  2. 短期记忆碎片化 无法长期压缩数百帧画面的因果信息,容易遗忘前期发现的规则;人类可记住几十步前的交互规律。
  3. 不会自主定义目标 没有文字提示时,AI无法识别画面中“终点状态”,不知道自己要达成什么结果。
  4. 长时序规划失效 多阶段链式任务(先开开关→移动载体→变换图形)极易中途偏离策略,无法动态修正方案。

七、提升ARC-AGI V3分数的主流技术路线

路线1:大模型原生推理增强(OpenAI方案)

开启留存推理(Retained Reasoning) + 上下文压缩(Compaction)

  • 留存推理:每轮保存历史推理草稿,持续迭代世界模型,不丢弃思考过程
  • 上下文压缩:自动提炼数百帧画面的核心规则,减少冗余token消耗 效果:分数提升2–3倍,是最简可落地方案

路线2:世界模型+因果推理(学术方案)

  1. JEPA视觉预测模块:提前预测操作后的画面,预演试错
  2. 因果图引擎:记录「动作→画面变化」因果关联,构建环境规则图谱
  3. 双阶段架构:先探索建模,再规划解题 该方案非纯LLM,混合视觉+因果模块,分数显著高于纯大模型,但部署成本极高

路线3:图搜索探索框架

将环境状态建模为图,优先遍历未测试动作,系统性验证规则;缺点是计算量巨大,单次测试成本可达数千美元

八、如何自行开展ARC-AGI V3测试

  1. 官方Demo体验(人类试玩) 官网:arcprize.org/tasks,25个演示小游戏,直观感受测试难度
  2. 自动化模型测试 1)克隆官方arcagi3测试框架 2)接入大模型OpenAI/Anthropic/Google API 3)运行公开集ls20/ft09/vc33获取可复现分数
  3. 注意事项
    • 公开集仅用于调试,最终真实能力以私有集排行榜为准
    • 不同提示词、上下文窗口、推理参数会造成分数巨大波动,对比必须固定全部参数

九、ARC-AGI V3 的核心价值

  1. 区分“记忆拟合”与“真正通用推理” ARC1/2已被大模型暴力刷穿,但V3交互式环境彻底锁死刷题作弊,真正衡量流体智能。
  2. 定义AGI核心标准 Chollet 提出:达到人类同等RHAE,才代表系统具备类人通用自适应学习能力。
  3. 指引下一代Agent研发方向 证明单纯增大LLM参数量不足以实现通用智能,必须补充主动探索、因果世界建模、长时序记忆三大能力。



ARC-AGI V3 2026年8月最新最优模型总览(分三类:原生纯LLM、厂商增强推理版、混合架构Agent)

核心区分:原生裸模型(不开厂商专属推理API、无外挂世界模型)、厂商增强推理版本(OpenAI Retained Reasoning / Claude Max深度思考)、混合多模态+强化学习竞赛Agent(ARC Prize Kaggle参赛方案,分数远高于纯LLM)
评测指标统一为 RHAE(人类相对行动效率,满分100%,普通人人类基线≈48%)

一、纯原生基础大模型(无特殊推理开关,标准API直接跑,最公平横向对比)

所有主流旗舰裸跑分数普遍极低,全部低于2%:

  1. Claude Opus 4.8:1.5%(原生裸跑LLM第一)
  2. GPT-5.6 Sol 基础版:7.8%(注意:该7.8%仍为轻度推理加持,纯裸GPT-5.5仅0.4%)
  3. Gemini 3.1 Pro Preview:0.37%
  4. GPT-5.5 High:0.43%
  5. Claude Opus 4.6:0.25%
  6. Grok 4.20 Beta:0%(完全无法通关关卡)
  7. 国产旗舰(GLM-5、豆包Seed 2.0 Pro、Qwen 3):0.1%~0.5%区间,无突出表现

结论:纯文本大模型天生缺失主动探索、动态因果记忆,原生能力几乎无法应对交互式ARC-V3。

二、厂商官方增强推理版本(开启独家深度思考API,当前商用LLM天花板)

1. Claude Opus 5(Anthropic 2026年7月新旗舰)

  • RHAE:30.2%(无第三方外挂、仅官方Max深度推理模式)
  • 特点:原生长时序记忆、多步骤试探推理,是不开外部Agent框架的商用模型第一;自主试探环境规则能力显著强于GPT系列;私有隐藏关卡平均通关率领先GPT-5.6 Sol近4倍。

2. GPT-5.6 Sol + Retained Reasoning + 上下文压缩双开关(OpenAI专属增强)

  • 基础裸跑:7.8%;开启双推理增强后:38.3%(商用LLM当前最高分)
  • 优缺点:分数高于Opus5,但算力消耗暴涨6倍;依赖OpenAI独家API特性,第三方框架无法复现;长链式多阶段关卡容易遗忘前期探索规律。

3. 次一档增强模型

  • Claude Opus 4.8 Max模式:8.1%
  • Gemini 3.1 Ultra Extended Thinking:4.2%
  • GPT-5.4 XHigh CoT:3.5%

三、ARC Prize竞赛混合架构Agent(非纯LLM,视觉CNN+强化学习+状态图搜索,排行榜真正SOTA)

这类方案不属于通用商用大模型,是专门为ARC-V3打造的混合智能体,分数碾压所有纯LLM:

  1. StochasticGoose(Tufa Labs,官方榜单第一) RHAE:12.58%;架构:CNN视觉编码+强化学习帧预测+因果状态记录,通关18个高难关卡
  2. Blind Squirrel RHAE:6.71%;基于状态图遍历,系统性探索未知操作
  3. 学术增强框架Schema-Harness(搭配Opus5/GPT5.6 Sol) 商用模型+外挂世界建模框架,公开集最高可达 95%+ RHAE,接近人类水平,但不属于原生大模型能力,依赖外部代码环境插件

四、梯队清晰排名汇总(2026.8官方基准)

Tier1(商用增强LLM天花板)

  1. GPT-5.6 Sol(双推理增强):38.3%
  2. Claude Opus 5(Max深度思考):30.2%

Tier2(次旗舰增强模型)

  1. Claude Opus 4.8 Max:8.1%
  2. GPT-5.6 Sol 标准版:7.8%
  3. Gemini 3.1 Ultra Extended:4.2%

Tier3(纯原生裸跑所有旗舰)

全部<2%,代表:Opus4.8(1.5%)、GPT5.5(0.43%)、Gemini3.1Pro(0.37%)

Tier4(竞赛混合架构Agent,非通用LLM)

  1. StochasticGoose:12.58%
  2. Blind Squirrel:6.71%

五、关键补充说明

  1. 分数差距本质 ARC-V3不考静态做题,考主动试探、自主归纳因果、长期记忆。Claude系列擅长长时序记忆与谨慎试探;GPT Sol系列依靠厂商专属推理压缩机制强行拉高分数,但算力成本极高;Gemini全系在交互式探索存在明显短板。
  2. 人类基准参考:普通人平均RHAE≈48%,目前最强商用模型(38.3%)仍未达到普通人平均水平。
  3. 评测区分提醒:
    • 对外宣传只看原生裸模型分,用来衡量模型底层通用推理;
    • 工程落地Agent场景看厂商增强推理分
    • 学术竞赛、专项ARC评测看混合视觉+强化学习Agent分数

Top comments (0)