赛程已核验LLM

llms · Abstract Reasoning

推荐专业:AI / Machine Learning / Computer Science / Mathematics / Data Science难度:进阶

ARC Prize 2026 - ARC-AGI-2

构建能够处理新颖推理任务的人工智能系统。

Team Merger2026年10月26日
Final Submission2026年11月2日
预计结果2026年12月4日

直接回答

ARC Prize 2026 - ARC-AGI-2 是一场以Abstract Reasoning为核心的 Kaggle 比赛,参赛者根据公开数据训练方案并按官方指标提交结果。

适合专业与项目难度

AIMachine LearningComputer ScienceMathematicsData Science难度:进阶

少样本网格规则归纳、程序搜索和候选验证对应 AI、机器学习、计算机与数学;数据科学可负责按任务类型的实验和失败分析。

为什么评为进阶?

供稿标为中高:小型规则 solver 可以启动,但完整网格 exact match、候选歧义、模型适配与时间预算会增加实验难度。

等级说明:需要专业建模方法、可靠验证或多个工程环节,并完成可解释的对照实验。

建议具备的基础

  • Python、JSON 与二维数组
  • 基础算法、几何变换和搜索
  • 训练示例重建与泛化验证

可以从哪里开始

先实现旋转、镜像、裁剪等规则和 exact-fit 检查器,再比较神经候选与程序搜索。

专业与难度由本站根据项目文档分析,面向基线复现与对照实验;具体门槛取决于承担的任务和项目深度。 这不是 Kaggle 官方评级。

先把任务说清楚

系统从少量输入/输出网格示例中归纳变换规则,再为未见测试网格生成两个完整候选。答案按 exact match 计算,尺寸或任意一个格子错误都不能得到该题分数。

LLM

输入

  • 由 0–9 整数构成的 train 输入/输出网格对
  • 需要预测输出的 test 输入网格

输出

  • 覆盖每个 task_id 与 test input 的 submission.json
  • 每个测试输入的 attempt_1 和 attempt_2 两个完整网格

技术路线

  1. 表示

    网格与对象表示

    建立 parser、renderer 和对象属性抽取,先确保尺寸、颜色与连通关系可验证。

  2. 生成

    候选生成

    并行比较几何变换、可执行程序搜索与神经候选,避免只依赖自由文本推断。

  3. 筛选

    证据筛选

    要求候选在全部 train pair 上重建正确,再按简洁性与一致性选择两个输出。

  4. 分析

    预算与失败分析

    按任务难度分配运行时间,把错误拆成解析、候选生成、选择和超时四类。

组队时间窗口

Team Merger deadline
2026年10月26日
Final submission deadline
2026年11月2日
Competition End Date
2026年12月4日
预计结果日期
2026年12月4日,采用 Competition End Date

预计结果日期用于时间适配,不代表官方奖项发布日期或结果承诺。

规则与提交信息

公开分类
llms
最大队伍人数
5
评价指标
test output exact-match accuracy
提交文件
submission.json
运行上限
Notebook 约 12 小时
  • 每日最多提交 1 次,最终计分提交最多 2 个
  • 抽象推理任务按官方评测流程提交,组队和提交规则以官方页面为准

比赛状态、Rules、提交限制和赛程可能变化,请以 Kaggle 官方页面为准。

证据边界:非实时图表,用于理解公开方案与讨论;分数和票数不代表最终排名或本站团队成绩。

公开研究资料

以下图表基于公开页面整理,用于理解公开方案与讨论主题。数据会变化,不作为成绩、排名或结果承诺。

ARC-AGI-2 公开榜前二十图
公开榜分数分布;榜单会变化,也不代表最终排名。 · 官方出处
ARC-AGI-2 公开 Notebook 分数图
公开 Notebook 分数与官方榜并非同一证据口径,不能直接互相比较。 · 官方出处
ARC-AGI-2 公开讨论互动度图
公开讨论互动度;票数不是比赛得分。 · 官方出处

协作重点与可交付成果

协作重点

  • 抽象推理
  • 搜索策略
  • 程序归纳
  • 实验管理

项目产出

  • 网格解析与可视化工具
  • 规则候选库和 exact-fit 检查器
  • 双候选排序实验
  • 按任务类型整理的失败案例集

复盘与面试可以讲什么

  • exact match 如何改变优化重点
  • 两个 attempt 应如何表达不同但有证据的解释
  • 神经生成与符号程序搜索各自适合什么任务

适合用途

留学申请考研/科研求职竞赛履历主页成果

数据状态与官方来源

当前赛程状态为“已核验”。 团队、资格、数据、模型、代码共享和提交方式以单场 Rules 最新内容为准。

https://www.kaggle.com/competitions/arc-prize-2026-arc-agi-2

扫码添加微信

微信二维码
微信号upup_0621