模型Hugging Face Blog·原文 2026年9月29日本站收录 2026年9月30日

NVIDIA发布Kumo Tabular表格基础模型,四个基准测试排名第一

Kumo Tabular是一个开放表格基础模型,单次前向传播即可完成分类和回归预测,无需训练、调优或特征工程,在TabArena、BeyondArena、TALENT和ScoringBench四个基准上排名第一。

AI解读:NVIDIA这次发布的Kumo Tabular把大语言模型里那套上下文学习搬到了表格上:给它一张带标签的行、再给它要预测的行,它一次前向传播就吐出类别概率或数值。不用收集标签、不用调参、不用手工做特征,对天天跟Excel和数据库打交道的数据团队来说,省掉的是整条建模流水线。

真正值得注意的是它的训练方式。这个模型没有见过任何真实表格,全部用人工生成的数据预训练,因为生成器是程序化采样器而非训练出来的模型,可以无限产新表。NVIDIA的赌注是:在几千万张人工表上学会处理缺失值、多类别、重尾分布这些毛病,比在具体业务数据上从头学更划算。

它有三个尺寸(2800 万到 2.15 亿参数),采用OpenMDW-1.1许可证,允许商用,代码和权重已挂在GitHub和Hugging Face上。对想先在内部试水的团队,门槛主要在于它目前只支持数值和类别列,文本、图像或时间戳得自己先转成特征。

性能方面NVIDIA宣称它在TabArena上ELO达到 1950 排名第一,速度比LimiX-2快 17 倍;在BeyondArena、TALENT和ScoringBench上也排第一。但这些数字来自NVIDIA自己的评测设置,且单次前向传播最多覆盖 10 个类别,超过要用纠错输出码扩展,上线前还是得用自己的留出数据验证精度和校准。

NVIDIA在Hugging Face博客发布Kumo Tabular,这是一个面向表格数据分类和回归的开放基础模型。给定一张带标签行的表格,它在新行上单次前向传播即可预测标签,不需要训练、调优或特征工程。

模型属于NVIDIA Kumo Structured模型集合,提供三个尺寸:Small、Medium、Large,参数量从 2800 万到 2.15 亿。它完全在人工数据上预训练,通过NVIDIA新发布的开源库structured-data-models运行,采用OpenMDW-1.1许可证发布,允许商业使用。

NVIDIA表示,Kumo Tabular在TabArena、BeyondArena、TALENT和ScoringBench四个基准测试中排名第一。

单次前向传播如何工作

Kumo Tabular是一个围绕表格结构构建的Transformer,使用列注意力、行注意力和上下文注意力,思路参考TabICL和TabPFN。预测一个标签需要完成三件事:理解每个值在其列中的含义,理解一行中各列的交互方式,以及把带标签的上下文行与未知标签的查询行关联起来。

具体实现分三步。单元嵌入方面,一组单元格成为一个token,数值和类别值通过傅里叶特征(学习到的频率的正弦和余弦)处理,两种类型使用不同权重。缺失值无需插补,会被特殊处理,上下文中的每个token还会接收一个标签嵌入。

行嵌入方面,模型交替使用两种注意力多次把每行变成一个嵌入。列注意力沿单列向下看,学习一个值在其列分布中意味着什么(例如 42 是典型值还是极端值),其成本随行数线性增长。行注意力在一行的token之间横向看,学习特征如何交互,使用旋转位置编码区分列。四个可学习的 [CLS] token加入每一行,作为该行的最终读出。行压缩之后,最后阶段的成本不再取决于列数。

上下文学习方面,最后一个Transformer在行嵌入上运行。上下文行相互注意,查询行只注意上下文行。因此每条预测只取决于上下文和该行本身,与同时被打分的其他行无关。由于上下文从不看查询,其键和值只计算一次,可复用于后续预测。查询行使用Test-GQA,缩小每次预测读取的缓存。一个head把每个查询行变成分类的类别概率,或回归的 999 个分位数,由此得到点预测和不确定性估计。

长度感知注意力温度解决长表推理

Softmax注意力会随着键的数量增长而分散。在几百行上锐利的注意力,到几万行时可能消散——而推理时的表格往往比典型训练表格大得多。

Kumo Tabular因此用一个随键数量对数增长的温度来缩放每个查询,每个注意力头单独学习系数。NVIDIA称结果是注意力在表格变长或变宽时保持锐利。

完全用人工表格预训练,分三阶段训练

Kumo Tabular完全在人工表格上预训练。每张训练表从结构因果模型(SCM)采样,分六步:先为整张表抽取配置,包括规模、任务、机制和缺失情况;随机因果图连接隐藏变量,从根到叶通过每个节点随机抽取的函数求值(例如线性映射、小型神经网络、树或高斯过程);部分节点成为数值或类别列,一个成为目标,其余保持隐藏,类似真实数据背后未被测量的原因;后处理让成组列相关、裁剪异常值并注入缺失值;最后用快速树集成检查丢弃没有可学习信号的表格。由于生成器是程序化采样器而非训练模型,它能产出无限供应的表格,每张都有新图和新机制。

NVIDIA把真实表格的更多缺陷内建到生成器中:值以多种模式缺失,某些特征被粗化导致重复行可能标签不一致,一些类别列有很多级别,回归目标可能重尾。模型看到数百万张这样的表后,学会无需清理即可处理这些缺陷。

在每张人工表上,模型把大部分带标签的行看作上下文,学习预测其余行的标签,分类用交叉熵损失,回归用分位数损失。分类和回归作为独立模型训练。

训练分三阶段进行,类似TabICLv2。第一阶段最长,使用 1024 行、最多 100 列的表,教模型表格长什么样。第二阶段把上下文从 400 行变化到 10240 行。第三阶段扩展到 60000 行,列数仍最多 100。总计Kumo Tabular-Small/Medium/Large分别见过约 3500 万/7100 万/1.37 亿张人工表。NVIDIA表示训练配方和人工数据生成器将很快发布。

基准测试成绩与速度数据

NVIDIA用默认设置对全部三个Kumo Tabular尺寸在完整TabArena排行榜上运行评测,涵盖调优的梯度提升树、AutoGluon和最新的表格基础模型。NVIDIA称Kumo Tabular以ELO 1950排名第一,在统一的单张RTX 6000 Pro评测设置下,速度比LimiX-2快 17 倍。三个尺寸在准确率-效率帕累托前沿上都建立了新的当前最佳。

在BeyondArena上,Kumo Tabular达到ELO 1418,Improvability得分 7.78%,排名第一。在TALENT上,它在分类准确率、分类对数损失和回归RMSE上取得最高总排名,平均排名分别为 6.67、3.98 和 4.22。在预测分布基准ScoringBench上,Kumo Tabular-Large和Medium的平均排名分列第一和第二。

限制与使用方式

Kumo Tabular只支持数值和类别列,文本、图像或时间戳需要通过内置预处理配方转成特征。单次前向传播覆盖最多 10 个类别,库用纠错输出码扩展到任意类别数。当表格远超训练范围,或查询行与上下文行分布不同时,准确率可能下降。NVIDIA表示,与任何预测模型一样,部署前应在自己的留出数据上验证准确率和校准。

Kumo Tabular通过NVIDIA新发布的GPU原生structured-data-models库运行。该库首次使用时从Hub下载权重,并提供评测中使用的预处理、集成和多类别处理。示例代码展示了从pandas.DataFrame到预测的过程:用sdm.TableTensor.from_pandas张量化数据,用sdm.models.KumoTabular加载模型,传入上下文特征和目标以及查询特征即可得到预测。

模型代码在GitHub的NVIDIA/structured-data-models,权重在Hugging Face的nvidia/Kumo-Tabular。NVIDIA在致谢中感谢David Holzmüller为Kumo Tabular贡献重要想法和消融实验,以及Vignesh Kothapalli在实习期间提供的帮助。

信息来源

Hugging Face Blog原始来源