Hugging Face Blog

NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular Prediction

8.5内容质量

TL;DR · AI 摘要

NVIDIA Kumo Tabular模型在表格预测任务中实现高准确率与效率,无需训练和特征工程,四个基准测试排名第一。

核心要点

  • Kumo Tabular在TabArena/BeyondArena/TALENT/ScoringBench四大赛道均排名第一
  • 模型参数规模28M-215M,支持商业用途的OpenMDW-1.1许可证
  • 通过Transformer架构实现列/行/上下文注意力机制,单次前向传递完成预测

结构提纲

按章节快速跳转。

  1. 介绍NVIDIA Kumo Tabular模型的发布及其在表格预测领域的突破性表现。

  2. 基于Transformer架构,结合列、行和上下文注意力机制实现表格理解。

  3. 通过Cell Embedding、Row Interaction和Context Alignment三步骤完成预测任务。

  4. 在四个基准测试中取得SOTA结果,参数效率比传统梯度提升树更高。

  5. 适用于企业级表格数据预测任务,如客户流失预测、需求预测等。

  6. 模型代码和权重已开源,支持Hugging Face和GitHub平台部署。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • NVIDIA Kumo Tabular模型
    • 技术特性
      • Transformer架构
      • 列/行/上下文注意力
      • 无训练预测
    • 性能表现
      • 四大赛道SOTA
      • 参数效率优势
    • 应用场景
      • 企业表格预测
      • 客户流失分析
      • 需求预测

金句 / Highlights

值得收藏与分享的关键句。

#NVIDIA#机器学习#表格数据#开源模型#Hugging Face
打开原文

NVIDIA Kumo Tabular 为表格预测树立新的精度-效率标杆

返回文章列表

[0

[-1

企业

+

]

文章

2026年9月29日发布

点赞

34

[

  • +28

Qu Jingang

jingangqu

关注

nvidia

Valter Hudovernik

valterh-nv

Martin Jurkovic

martinjurkovic

Cedric Lorenz

cedric-lorenz

Akihiro Nitta

akihironitta-nv

Dmitry Gordeev

dgordeev

Federico Lopez

flopeznv

Ramona Bendias

RBendiasN

Gilberto Titericz Jr

titericz

Aleksandar S. Sokolovski

aleksssokolovski

Isabel Hulseman

ihulseman0220

Jure Leskovec

profjure

Matthias Fey

rusty1s

高亮(TL;DR)

NVIDIA Kumo Tabular 是 NVIDIA Kumo Structured 模型系列的组成部分,现作为开源基础模型在 Hugging Face 上提供。给定包含标记行的表格,它可以在单次前向传递中预测新行的标签,无需训练、无需调优、无需特征工程,适用于分类和回归任务。该模型仅使用人工数据进行预训练,提供三种规模(28M 至 215M 参数),通过我们的开源库运行,并在 OpenMDW-1.1 许可证下发布以供商业使用。在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中排名第一。

  • 模型代码: https://github.com/NVIDIA/structured-data-models
  • 模型权重: https://huggingface.co/nvidia/Kumo-Tabular

向表格基础模型的转变

表格数据是企业机器学习的基石。客户记录、交易、传感器日志、索赔和订单都以表格形式存在,从这些数据中预测流失率、违约率、需求或价格是工业界最常见的机器学习任务之一。过去二十年,这项工作一直依赖梯度提升树,效果良好。但围绕这些模型的工作流程几乎没有变化。每个新问题都意味着收集标签、工程特征、搜索超参数、验证并部署一个对表格一无所知且从零开始学习每个任务的模型。

大型语言模型展示了处理新任务的不同方式。给定提示中的几个示例,预训练模型无需更新任何权重即可解决问题。这就是上下文学习,它同样适用于表格:在数百万表格上预训练的模型可以将标记表格作为上下文,并直接预测新行的标签。

今天,我们发布 NVIDIA Kumo Tabular(GitHub,HuggingFace),一个用于表格分类和回归的开源基础模型。给定包含标记行的表格以及需要预测的行,Kumo Tabular 可在单次前向传递中返回类别概率或数值预测。

Kumo Tabular 的工作原理

Kumo Tabular 是一个围绕表格结构构建的 Transformer,利用 TabICL 和 TabPFN 中引入的列、行和上下文注意力机制。要预测标签,它需要完成三件事:(1) 理解每个值在其列中的含义,(2) 理解行中各列的交互方式,以及 (3) 将带有现有标签的上下文行与带有未知标签的查询行相关联。Kumo Tabular 通过以下方式实现这一点:

单元格嵌入:一组单元格成为一个标记。数值和分类值通过傅里叶特征(学习到的频率的正弦和余弦)进行处理,每种类型都有独立的权重。缺失值无需插补,会得到特殊处理。最后,上下文中的每个标记都会接收一个标签嵌入。

行嵌入:我们通过多次交替使用两种注意力机制,将每一行转换为嵌入表示。列注意力机制沿着单列进行观察,通过诱导的自注意力学习该列中值的分布意义(例如判断42是典型值还是极端值)。因此其计算成本会随着行数线性增长。行注意力机制则跨单行的标记进行观察,学习特征之间的交互关系,并通过旋转位置编码区分不同列。每个行嵌入会加入四个可学习的[CLS]标记,作为该行的最终输出。经过行压缩后,最终阶段的计算成本不再依赖于列数。

上下文学习:最终的Transformer对行嵌入进行处理。上下文行之间相互关注,而查询行仅关注上下文行。因此每个预测结果仅依赖于上下文和当前行本身,而不会受到其他并行评分行的影响。由于上下文部分不会查看查询内容,其键和值只需计算一次即可复用到后续预测中。查询行采用Test-GQA机制,通过缩小每个预测读取的缓存规模来提升效率。每个注意力头将查询行转换为分类任务的类别概率以及回归任务的999个分位数,从而得出点预测结果和不确定性估计。

长度感知注意力温度:Softmax注意力的分布范围会随着键数量的增加而扩散。在表格推理时,当表格规模远超训练时的典型规模时,原本在几百行内清晰的注意力分布可能在数万行中完全消散。Kumo Tabular因此为每个注意力头单独学习一个系数,通过键数量对数增长的温度参数对每个查询进行缩放。这种设计使注意力保持在表格规模扩大或维度增加时的清晰度。

Kumo Tabular的构建方式

Kumo Tabular完全基于人工生成的表格进行预训练。每个训练表格都通过以下六个步骤从结构因果模型(Structural Causal Model, SCM)中采样生成:

我们首先从表格规模、任务类型、生成机制和缺失模式等方面确定整体配置。随后随机生成因果图,通过每个节点处随机抽取的函数(如线性映射、小型神经网络、决策树或高斯过程)从根节点到叶节点依次计算隐藏变量。部分节点会转化为数值型或类别型列,其中一个节点被指定为预测目标,其余节点保持隐藏状态(如同真实数据中未观测到的潜在原因)。后处理阶段会对列组进行相关性处理、截断异常值并注入缺失值,快速树集成模型会过滤掉所有没有可学习信号的表格。由于生成器是过程式采样器而非训练模型,它能持续生成具有新图结构和新生成机制的表格。

现实世界的表格往往存在诸多不完美,因此我们在生成器中加入了更多现实特征。值的缺失遵循多种模式,部分特征经过粗化处理可能导致重复行对标签产生不同判断,部分类别列包含大量取值,回归目标可能呈现厚尾分布。通过观察数百万个此类表格训练出的模型,能够无需任何数据清洗直接处理这些不完美特性。

性能

我们使用默认设置将三种 Kumo Tabular 模型与完整的 TabArena 领域排行榜进行了对比,涵盖调优后的梯度提升树、AutoGluon 以及最新的表格基础模型。Kumo Tabular 在整体排名中位列第一,ELO 评分为 1950,且在统一的单块 RTX 6000 Pro 评估环境下比 LimiX-2 快 17 倍。在所有三种模型规模上,Kumo Tabular 在准确率-效率帕累托前沿均建立了新的最先进水平:

我们还在 BeyondArena、TALENT 和 ScoringBench 上对 Kumo Tabular 进行了评估。在 BeyondArena 上,Kumo Tabular 的 ELO 评分为 1418,可改进性得分为 7.78%,在排行榜上位列第一。在 TALENT 上,它在分类准确率、分类对数损失和回归 RMSE 三个指标上均取得总体排名第一,平均排名分别为 6.67、3.98 和 4.22。在 ScoringBench 上,这是一个用于预测分布的基准测试,Kumo Tabular-Large 和 Medium 在平均排名上分别位列第一和第二。

限制

Kumo Tabular 仅适用于数值型和分类型列,文本、图像或时间戳可通过内置的预处理配方转换为特征。单次前向传播最多支持 10 个类别,库通过纠错输出码扩展到任意数量的类别。在表格远超出训练范围或查询行来自与上下文行不同分布的情况下,准确率可能会下降,因此与任何预测模型一样,在部署前请使用自己的验证数据集验证准确率和校准性。

演示

Kumo Tabular 通过 NVIDIA 最新发布的结构化数据模型 GPU 原生库运行。该库在首次使用时会从 Hub 下载权重,并提供我们在评估中使用的预处理、集成和多类别处理功能。以下代码即可实现从 pandas.DataFrame 到预测的完整流程:

code
import
sdm
# structured-data-models
# 将表格数据张量化:
table = sdm.TableTensor.from_pandas(pd.load_csv(...), device=
"cuda"
)
na_mask = table[
"target"
].isnan()

model = sdm.models.KumoTabular(device=
"cuda"
)
pred = model(
# 上下文示例(特征/目标):
x_context=table[~na_mask].drop_columns(
"target"
),
    y_context=table[~na_mask,
"target"
],
# 预测示例(特征):
x_query=table[na_mask].drop_column(
"target"
),
)

开始使用 Kumo Tabular

/think

Kumo Tabular 采用 OpenMDW 许可协议 1.1 版本发布。NVIDIA 认为可信人工智能是共同责任,我们已制定相关政策和实践,以支持开发各种人工智能应用。根据我们的服务条款下载或使用该模型时,开发者应与支持模型团队合作,确保该模型符合相关行业和使用场景的要求,并解决可能的不当使用问题。请通过此链接报告模型质量、风险、安全漏洞或 NVIDIA 人工智能相关问题。

致谢

我们感谢 David Holzmüller 对 Kumo Tabular 提出的重要想法和消融实验贡献。我们感谢 Vignesh Kothapalli 在实习期间对 Kumo Tabular 的帮助。

本文中提到的模型 1

该作者的更多文章

如何使用 NVIDIA Warp 和 MjWarp 加速机器人模拟与学习工作流程

50

2026年9月23日

**识别说话人及时间:使用 NVIDIA Nemotron 3 说话人分离技术构建实时多说话人 AI**

65

社区

Dhanjeerider

约8小时前

[1

[2

良好

回复

编辑

预览

可通过拖拽、粘贴或点击此处上传图片、音频和视频

点击此处上传图片

评论

· 注册或登录以发表评论

  • +22