何恺明团队提出NAT-ARC:用ImageNet猫狗图预训练视觉模型,ARC推理集成达 70.2%
MIT团队把MAE在ImageNet上训出的encoder搬进VARC流程,纯视觉方案单模型在ARC-1上跑出 63.4% pass@2,三种预训练策略集成后达到 70.2%,参数量约 2B,接近 8B语言模型方案The ARChitects的 71.6%。
AI解读:ARC是Keras之父François Chollet在 2019 年提出的抽象推理基准,每道题给 2 到 5 组输入输出示例,要求推断规则并应用到新格子。过去主流解法把格子翻译成文字或符号交给大语言模型,而何恺明团队这篇论文把格子当图像直接看。
NAT-ARC的关键动作是复用MAE在ImageNet约 130 万张自然图像上预训练好的encoder权重,只保留backbone,丢掉与图像尺寸绑定的patch embedding和位置编码,换成 2D RoPE,再分三步训练:离线训练编解码器、测试时对每道题做LoRA微调。
成绩方面,huge尺度单模型 0.6B参数在ARC-1上pass@2 为 63.4±0.7%,三种预训练策略集成投票后达 70.2±0.6%,总参数约 2B;作为参照,专门微调的The ARChitects用 8B语言模型拿到 71.6%。视觉路线用约四分之一参数量逼近专用LLM系统。
论文更重要的发现是预训练打通了视觉路线的scaling瓶颈:没有预训练时模型从large到huge性能反而下降,加入ImageNet预训练后base、large、huge三个尺度一路向上。注意力可视化显示,ImageNet预训练模型在没见ARC格子前就已能聚焦前景图案,而非均匀分散。
对做抽象推理和视觉预训练的研究者来说,这意味着自然图像里学到的物体分组、图案匹配、区域分割能力可以迁移到抽象格子任务;但单模型 63.4% 仍低于The ARChitects的 71.6%,集成后才到 70.2%,纯视觉路线还没有稳定反超专用语言模型方案。
何恺明团队提出NAT-ARC,一种不依赖大语言模型的纯视觉ARC解题方案,论文由MIT CSAIL成员Xiaoman Delores Ding一作,通讯作者为何恺明。
该方法把MAE在ImageNet约 130 万张自然图像上预训练的encoder权重接到VARC视觉流程前,预训练阶段完全不使用ARC格子,却把视觉能力迁移到了抽象彩色格子推理上。
成绩上,表现最好的单模型采用huge尺度、0.6B参数,在ARC-1上取得 63.4±0.7% 的pass@2 分数;把三种预训练策略训出的模型池化做多数投票后,集成达到 70.2±0.6%,总参数量约 2B。
作为参照,专门针对ARC微调的The ARChitects用 8B语言模型拿到 71.6%,NAT-ARC以约四分之一参数量逼近这一水平。
论文还报告预训练修复了视觉路线的scaling问题:无预训练时模型从large到huge性能反而下降,加上ImageNet预训练后三个尺度一路向上。
该论文是已被CVPR 2026接收的VARC的直接后续,团队成员包括胡珂雅、Katelyn Gan和Victor Yin。
ARC是什么,以及过去为什么都用语言模型解
ARC全称Abstraction and Reasoning Corpus,由Keras之父François Chollet在 2019 年提出。每道题格式统一:一块最大 30×30 的二维格子、最多 10 种颜色,给出 2 到 5 组输入输出示例,解题者要从示例推断隐藏的变换规则,再应用到全新输入格子上预测输出。
ARC对AI极难,原因在于每道题规则都不同、没有固定模板可背,且只有两三个示例就要归纳并精确执行抽象规则,因此长期被当作测量AI抽象推理能力的标杆。此前占据统治地位的几乎全是语言模型方案,共同思路是把格子翻译成文本或符号序列交给语言模型处理。
- ARC由François Chollet于 2019 年提出。
- 每道题最大 30×30 格子,最多 10 种颜色,2 到 5 组输入输出示例。
- 主流LLM方案先把格子转成文本或符号再推理。
视觉路线的进展:VARC、LoopViT、Loop-OWM
视觉路线起步较晚。一批研究者不把格子翻译成文字,而是用视觉模型直接处理格子图像。其中来自MIT同一团队的VARC把ARC重新定义为条件图生图翻译任务,用 19M参数视觉模型跑到 54%;LoopViT在VARC框架上加入循环推理机制,18M参数达到 65.8%;Loop-OWM用视频预训练模型做few-shot,10.6M参数达到 68.5%。
这些模型的参数量比LLM方案小几个数量级,效果已开始追平。但视觉路线存在结构性短板:LLM通过海量语料预训练积累通用能力,模型越大、预训练越充分,下游scaling越明显;而多数视觉ARC方案从随机初始化开始训练,没吃到预训练红利。NAT-ARC的目标就是补上预训练这一步。
- VARC:19M参数,54%,把ARC视为条件图生图翻译。
- LoopViT:18M参数,65.8%,加入循环推理。
- Loop-OWM:10.6M参数,68.5%,用视频预训练模型做few-shot。
NAT-ARC的三步流程与工程细节
NAT-ARC的核心是在VARC视觉流程前插入一步ImageNet MAE预训练。MAE即Masked Autoencoder,是何恺明在FAIR时期 2022 年提出的自监督视觉预训练方法,训练时遮住图片大部分区域,让模型从剩余碎片复原原图,从而理解物体形状、结构和空间关系。
整个流程分三步:第一步用ImageNet上的MAE预训练encoder;第二步在ARC训练集上离线训练整个编解码器;第三步在测试时对每道题单独做LoRA微调。微调阶段每道题只有 2 到 5 组示范对,模型用这几组示范试图学会该题规则。
工程上,NAT-ARC直接用了MAE的公开checkpoint,没有额外花钱预训练。由于该checkpoint面向更大尺寸ImageNet图片,而ARC格子只有 64×64 像素,模型丢弃了原始patch embedding和位置编码,只保留backbone权重,换成 2D RoPE作为位置编码。
- MAE由何恺明 2022 年在FAIR提出,是自监督视觉预训练方法。
- NAT-ARC三步:ImageNet MAE预训练encoder、ARC训练集离线训练编解码器、测试时逐题LoRA微调。
- 复用MAE公开checkpoint,丢弃patch embedding和位置编码,换成 2D RoPE。
为什么看猫片能帮到抽象格子推理
论文用注意力可视化给出线索。研究人员把三种初始化方式(无预训练、ImageNet MAE预训练、ARC风格格子MAE预训练)的模型放在同一道ARC题前,观察未开始ARC训练时的注意力分布:随机初始化的模型注意力均匀分散、毫无重点;ImageNet预训练过的模型已能区分前景和背景,注意力自动聚焦到格子中有意义的图案区域。
研究人员进一步筛出 15 道预训练后显著提升的ARC题,手动标注后发现集中在两类:6 道属于match-and-copy,需要识别匹配的对象、颜色或图案并复制结构到输出;另外 6 道属于connected-component reasoning,需要识别、填充或重新着色空间上连通的区域。这两类能力恰好对应自然图像里的视觉先验。
- ImageNet预训练模型在未接触ARC训练前,注意力已能聚焦格子前景图案。
- 15 道显著提升题中,6 道match-and-copy,6 道connected-component reasoning。
成绩、scaling曲线与可视化验证
NAT-ARC在ARC-1上的成绩:表现最好的单模型采用huge尺度、0.6B参数,pass@2 为 63.4±0.7%;集成时把三种预训练策略(无预训练、ImageNet MAE预训练、ARC风格格子MAE预训练)分别训出的模型池化做多数投票,拿到 70.2±0.6% pass@2,总参数量约 2B。
论文最重要的发现之一是预训练打通了视觉路线的scaling瓶颈。没有预训练时,模型从base到large性能还能涨,但从large到huge反而掉点;加上ImageNet预训练后,scaling曲线在base、large、huge三个尺度上一路向上。离线训练阶段,用了ImageNet预训练的模型在三个尺度上收敛都明显更快,最终精度也更高。
论文还做了一个可视化验证:研究人员训练一个autoencoder,把ImageNet图像映射到 60×60、10 种颜色的离散格子表示,相当于把一张猫片翻译成ARC格子,再用NAT-ARC对该格子执行旋转 180°、加一圈蓝色边框的ARC变换,再解码回像素。结果显示猫确实被旋转了,边框也确实加上了。
- 单模型huge 0.6B参数:63.4±0.7% pass@2。
- 三种预训练策略集成、约 2B参数:70.2±0.6% pass@2。
- The ARChitects用 8B语言模型取得 71.6%。
- 无预训练时large到huge掉点,加预训练后三个尺度持续上升。
作者与论文来源
论文一作Xiaoman Delores Ding是MIT CSAIL成员、来自何恺明组,她也是VARC的一作,NAT-ARC相当于在上一篇工作基础上继续推进。其余作者包括胡珂雅(Keya Hu,何恺明首批女弟子之一,本科毕业于上海交通大学)、Katelyn Gan和Victor Yin,后两人同样来自MIT,均为本科生,且都在CSAIL担任student researcher。
通讯作者何恺明是ResNet和MAE的作者。VARC已被CVPR 2026接收,NAT-ARC是它的直接后续。论文地址为https://eccv.ecva.net/virtual/2026/poster/5527。
- 一作Xiaoman Delores Ding,MIT CSAIL,何恺明组,也是VARC一作。
- 作者还包括胡珂雅、Katelyn Gan、Victor Yin。
- VARC已被CVPR 2026接收,NAT-ARC为其后续工作。