Tabular LLMs: An Introduction to the Foundation Models That Predict Your Spreadsheet
TL;DR · AI 摘要
TabICLv2在表格预测任务中超越传统梯度提升树,作者通过独立验证证实其性能,且模型无需训练数据即可预测表格缺失列。
核心要点
- TabICLv2在TabArena基准测试中Elo得分1559,与官方结果1575误差仅16分
- 模型采用Set Transformer+CLS tokens+in-context blocks三阶段架构处理表格数据
- 无需训练数据即可完成零样本表格预测,类似语言模型补全文本的机制
结构提纲
按章节快速跳转。
- §引言
介绍TabICLv2模型在表格预测领域的突破性表现。
- ·核心机制
解析TabICLv2的三阶段处理流程:Set Transformer嵌入、CLS tokens聚合、in-context blocks推理。
- ›独立验证
作者在AWS A10G上复现TabICLv2,结果与官方数据误差小于1%。
- ·性能对比
TabICLv2在TabArena基准测试中超越所有调优后的梯度提升树模型。
- ›应用场景
适用于零样本表格预测、自动数据补全等场景。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Tabular LLMs技术解析
- 核心架构
- Set Transformer嵌入
- CLS tokens聚合
- in-context blocks推理
- 验证结果
- Elo 1559 vs 官方1575
- 51数据集验证
- 应用场景
- 零样本表格预测
- 自动数据补全
金句 / Highlights
值得收藏与分享的关键句。
TabICLv2通过set transformer将每个单元格嵌入为128维向量,结合CLS tokens聚合为512维表示
作者在独立硬件上复现TabICLv2,51个数据集中16个指标与官方结果完全一致
TabICLv2的Elo得分比传统树模型高150+,但推理成本更低
表格LLM:预测电子表格的基础模型简介 | Towards Data Science
大型语言模型
表格LLM:预测电子表格的基础模型简介
一个无需训练的2800万参数模型击败了调优后的XGBoost。介绍表格基础模型,并进行独立复现。
Sean Moran
2026年7月24日
24分钟阅读
分享
TabICLv2的三阶段流程。它通过一次前向传递读取整张表格,并预测每个测试行缺失的目标值——就像学习到的k-NN,无需拟合你的数据。(1)集合变压器按列和目标感知的方式将每个单元格嵌入到128维向量中。(2)对每行数据,4个CLS标记跨其特征进行注意力计算并连接成一个512维标记(RoPE)。(3)12个上下文块使每个测试行仅对标记的训练行进行注意力计算,随着训练行增长,QASSMax保持注意力的锐度。分类或999分位回归头部为每个测试行输出一个分布。
表格基础模型以零样本方式预测任何表格缺失的列,就像语言模型补全文本一样。在主要社区基准测试中,所有表现优于最佳调优梯度提升树的单模型条目都属于此类。本文将解释它们是什么,在我自己的硬件上验证了权重完全开放的最强模型,并映射出树木模型仍占优势的领域。
图1:TabArena(官方榜单,2026-07-15快照)上的准确率与服务成本对比。TabICLv2(蓝色)位于任何人均可下载验证的低成本高精度模型前沿;TabFM(空心)位居榜首但未发布论文,而树模型家族(正方形)在相当的服务成本下低150+ Elo分。📖 来源:作者制作的图片。
表格模型有一个较新的类别:预训练的变压器,可零样本预测任何电子表格,通常被称为"表格LLM"。在TabArena排行榜上,所有表现优于最佳调优集成GBDT配置的单模型条目都属于此类;唯一超越它们的条目是AutoGluon的4小时集成流水线。这颠覆了过去十年的默认答案——拟合调优后的梯度提升树。排行榜曾因外部人员重新运行而暴露出错误(这是我与时间序列模型的经验),因此在相信这个结果前我进行了审计。我从其发布的成果中重新计算了榜单评分,选取了具有完全开放权重的最强模型TabICLv2,并在自主控制的硬件上从零开始重新运行。
我的独立测试覆盖了基准测试官方Lite协议下的全部51个数据集(每个数据集一个训练/测试划分,使用与排行榜相同的划分索引),在单个AWS A10G上完成。在这些完全相同的划分上,与官方成果行对比,我的TabICLv2在Elo评分上达到1559,与官方1575的差距在±60-86的引导区间内,相邻排名且误差极小。按任务划分,51个指标中有16个值在小数点后四位完全一致,中位相对差异为0.08%,最差数据集差异3.5%,这与GPU非确定性导致的差距相当,而非方法论差异。整个测试包括环境设置,仅耗时2.1小时GPU计算,成本仅2美元多一点。
什么是表格基础模型
表格基础模型是一种单一的预训练模型,能够在任何表格上实现零样本预测。你只需将已知标签的行作为上下文提供给模型(就像将已解决的示例粘贴到大语言模型提示中一样),模型就能在一次前向传播中预测出保留行的标签。模型不会在你的数据上进行梯度训练,也无需进行超参数搜索;其他所有表格方法称为“训练”的步骤,在这里都变成了推理过程。文献中将这种能力称为上下文学习(in-context learning),而TabPFN论文已经证明这种方法对表格数据是有效的。
其行为类似于学习到的k近邻算法:要为保留行打标签时,模型会关注它能看到的已标记行,并根据相似性加权得出答案。与普通k-NN的区别在于,这里的相似性计算和邻居组合方式来自于预训练过程,而非预先设定。
自TabPFN之后,该领域发展迅速:TabPFN的继任者(Prior Labs)、TabICL和TabICLv2(Inria的SODA团队)、TabDPT(Layer 6),以及在本文发布前两周推出的Google Research的TabFM。所有这些模型都出现在下方的排名中。
“tabular LLM”中的“LLM”是广义的。这些模型确实是基于Transformer架构,但它们并不处理语言,且在每个组件上都与文本LLM存在差异。文本LLM的token来自固定词表中的词元;而表格模型的原始材料是表格的单元格、列和行,这些数据包含数字和类别,且完全没有固定词表,因为你的表格列从未被见过,模型必须自行处理。文本LLM通过互联网文本的下一个token预测进行预训练;而表格基础模型则通过数百万个由随机结构因果模型生成的小型合成表格进行预训练(这些模型是随机因果图连接起来生成可信的假数据集),其目标是预测这些表格中保留单元格和标签。预训练赋予模型一种通用的处理新表格的流程,推断其特征与目标的关系,而非对世界知识的掌握。一个直接后果是模型规模:表格的表面复杂度低于语言,因此数千万参数就足够——TabICLv2约28M参数,而t0-alpha有102M参数,文本LLM则达到数十亿参数。
与t0文章中时间序列基础模型的对比核心在于顺序性。时间序列有一个明确的顺序:t0、Chronos和TimesFM都沿时间轴应用因果注意力,只关注过去,并通过延续序列来实现预测。表格则没有行顺序:打乱行顺序后仍是同一表格,因此架构需要相反的特性:预测结果不能依赖电子表格的排序方式。(列顺序也是任意的,但TabICLv2通过旋转嵌入和特征分组重新赋予特征位置,以保持各列身份的独立性;架构图下方展示了这一设计。)任务也随之转变,从预测观测范围外的值变为为保留行填充缺失列。这两个领域最终都形成了相似的习惯:都通过合成数据进行预训练(此处普遍使用SCM先验;时间序列部分使用),且都输出分布而非单一值:t0输出九个分位数,TabICLv2的回归头输出999个。
一个歧义延续自时间序列文章。"Tabular LLM"有时也指另一条研究路线,即实际用文本LLM处理序列化为文本的表格(如TabLLM所做的)。本文所有内容都聚焦于表格原生的基础模型,但这次我也测量了序列化-提示这条路线:在49个数据集中,表格原生模型在43个数据集上表现更优(详见下文)。
TabICLv2的特性:小巧、开源、可复现
TabICLv2是这些上下文学习器之一。模型拟合仅需数秒,且无需调整超参数。在标签下它由三个堆叠的Transformer组成,每个Transformer回答表格的不同问题,按此顺序阅读最为直观。
第一个Transformer逐列读取,每次处理一个特征。它的任务是将原始值转换为能识别数值类型的嵌入向量,因为相同数字在不同列中含义不同。价格列中的450和邮编列中的450毫无关联,但仅看到数字的模型无法区分它们。这一阶段采用集合Transformer:将列视为无序值集合,学习该列的分布,并为每个单元格生成反映其在特征中位置的嵌入。因此,同一个450可能变成"相对便宜的商品",而另一个则变成"特定区域的邮编代码"。
第二个Transformer逐行读取并压缩为单个向量。经过第一阶段后,一行数据变为每个列的特征嵌入集合。一行数据是集合,用Transformer总结集合的标准方法是添加几个学习到的查询标记([CLS]标记),让它们关注集合成员。此处每行使用四个[CLS]标记聚合行中关键部分,它们的输出拼接成单个行向量。无论行初始有多少列,现在都转换为固定长度的向量代表整个样本。
第三个Transformer执行预测,这也是上下文学习发生的地方。预测时不会运行梯度下降。相反,每个未标记的测试行向量会关注所有标记的训练行向量,找到最相似的训练行并从中读取标签。注意力仅单向流动,从测试行到训练行,因此标记示例指导预测但不会反向影响。这是用注意力机制实现的最近邻推理:模型查看已知答案的示例,根据与当前行的相似性加权这些示例,然后进行预测。训练集作为上下文输入而非烘焙进权重中,这就是为什么你可以让模型指向预训练时从未见过的表格,也能获得预测结果而无需重新训练。
两个头部位于顶部,每个任务类型一个。对于分类任务,分层分类器分配标签并支持任意数量的类别。对于回归任务,头部不输出单个数字;而是输出999个分位数,包括0.1百分位、0.2百分位,直到99.9百分位。这提供了完整的预测分布而非单一估计值,因此你可以读取中位数和围绕它的可信区间。
这些999个分位数是通过pinball损失函数进行训练的,值得探讨为何这种损失函数能够产生分位数。以目标分位数为例,比如第90百分位数,pinball损失对预测值过低和过高施加不同的惩罚。如果低估了真实值,需支付0.9×误差的代价;而高估时只需支付0.1×误差的代价。这种不对称性会推动预测值向上调整,直到约90%的真实值低于该预测值,这正是第90百分位数的定义。同时将这一规则应用于所有999个目标,每个输出都会收敛到分布中对应的位置。该名称来源于损失函数与误差关系的图形形状:一个倾斜的V形,一侧陡峭另一侧平缓,类似于弹珠台的倾斜度。在中位数处,该损失函数对称且退化为普通的平均绝对误差。
能让v2版本实现扩展而v1版本停滞的关键细节在论文中有所描述:一种查询感知的重缩放softmax(QASSMax)使注意力机制在长上下文中不衰减,特征分组技术打破列之间的对称性,以及早期注入的目标嵌入。
图2:TabICLv2的三阶段架构。一个集合Transformer对输入表的每一列进行嵌入(3个块,目标感知),注意力机制作用于CLS标记将每一行压缩为单个向量(3个块,RoPE),随后的12个上下文学习块使未标记的测试行能够关注已标记的训练行。两个输出头生成预测结果:一个适用于任意类别数量的分层分类器,以及一个生成999分位数分布的回归头。所有层的数量均与发布的源代码验证一致;从检查点统计得出的参数数量为2760万/2850万个。📖 来源:作者原创图片。
使其成为合适审计目标的三个特性是:规模小、开放性和可复现性兼备。权重在HuggingFace上以BSD-3许可证开放获取,无需任何访问限制或点击许可协议;通过pip install tabicl即可安装并运行。加载两个检查点并统计参数数量,可精确得到分类器的27,552,258个参数和回归器的28,544,991个参数,因此“约28M”参数的说法来源于下载的检查点张量统计。该模型的规模仅为t0-alpha的四分之一,却在性能上超越了调优后的GBDT模型。其主要竞争对手并未完全具备这一特性:TabPFN系列(Prior Labs)在非商业许可证下发布权重,其工具链中包含许可证接受步骤;TabFM(Google Research)在无论文的情况下以非商业许可证发布权重。开放权重的重要性与之前相同:任何人都可以重新运行评估并验证声明。
TabICLv2的预训练数据完全来源于合成数据,这些数据由随机结构因果模型生成。没有真实世界表格参与预训练,因此任何基准数据集都无法渗入其中。下文的污染部分将这一点与新增真实预训练数据的新模型进行对比。
在您自己的表格上尝试
实际使用层面与scikit-learn兼容。TabICLv2通过pip install tabicl安装,首次使用时会从HuggingFace下载检查点,并直接接受包含分类列和缺失值的pandas DataFrame:
from tabicl import TabICLClassifier # 回归任务使用TabICLRegressor
clf = TabICLClassifier() # 默认参数已优化,无需超参数搜索
clf.fit(X_train, y_train) # 几秒钟内完成:存储上下文,不进行梯度训练
proba = clf.predict_proba(X_test) # 一次前向传播它在小表上运行于CPU,但本文中的速度数据是GPU数据;单个消费级GPU是预期的运行环境。工作范围存在限制:TabICLv2是在约300到48,000行训练数据的表格上预训练的,下方的基准测试最高达到15万行,而我在后文的制度分析中显示,当表格非常宽(超过约100个特征)时准确率会下降。在该范围内,我的制度分析显示该模型在与调优决策树的对比中赢得了86-88%的数据集,且能在数秒内完成拟合;超出该范围时,下方的决策树部分是更合适的选择。
基准测试,以及我亲自验证的部分
TabArena包含51个精心挑选的数据集,涵盖二分类、多分类和回归任务,行数范围从748到15万,特征数从5到1,777。每种方法均通过重复交叉验证(每个数据集9-30次划分)进行评估,模型通过任务相关的指标(ROC-AUC、log-loss、RMSE)进行比较,最终汇总为Elo评分:每个任务的两两对比视为一局"比赛",评分体系以默认RandomForest为基准(1000分),400分差距意味着10:1的胜率。这是一个持续更新的基准测试,方法和结果会持续添加。
在引用任何人的Elo评分前,我希望确认自己能够重新计算。TabArena公开了每个划分的测试结果作为可下载的制品,因此我本地运行了维护者的聚合流水线,使用其官方常量(200次bootstrap轮次、排除插补方法),并将我的结果与tabarena.ai背后的CSV进行比对。所有69种方法均匹配,其中67种在±1 Elo范围内匹配,前30名的排序完全一致(Spearman ρ = 0.99998)。该验证确认了评分和聚合代码的正确性,其作用相当于t0文章中Seasonal-Naive的验证。它并不验证任何模型自身的预测结果,这正是重新运行的目的。
有两行结果的差异超过1分,是调优后的TabM配置(+4和+5 Elo);所有三种TabM变体的运行时间列也发生了偏移,因为TabM的测试结果制品在当前网站快照发布后进行了更新。基准测试持续更新,因此下文所有内容均固定在2026-07-15的快照版本。
重新计算还显示Elo评分依赖于方法池。我的首次尝试包含了网站排除的插补方法,所有评分均偏移了10-30分。制品中的每数据集指标是池无关的数值;Elo评分则是相对于你所选择的池进行汇总。
排名情况
下文所有Elo数值均来自官方榜单(快照2026-07-15),我通过官方制品重新计算后误差在±1 Elo范围内。这些是完整协议的数值(每个数据集9-30次划分);我自己的运行使用官方Lite协议(每个数据集1次划分),因此作为表格下方的独立对比项而非表格行出现。
图3:按模型排序的TabArena Elo评分。所有位于最佳调优和集成GBDT之上的模型均为基础模型,唯一其他位于其上的条目是AutoGluon集成流水线;TabICLv2(蓝色)是唯一拥有无限制开放权重的最强模型。虚线:RandomForest基准线1000分。📖 来源:作者制作的图片。
将整个方法池限制在Lite划分并合并我的新运行结果:官方TabICLv2在该版本中得分为1575,我的版本为1559,在同一榜单上分别排名第5和第6。上方的复现部分包含各任务的具体数值。
首先,所有优于最佳GBDT配置的模型都是表格基础模型;唯一高于它的非基础模型条目是AutoGluon集成流水线。经过完整调优并进行后置集成的LightGBM达到1432分;完全未经过调优的TabICLv2比它高出158 Elo分,而带门控机制的TabPFN系列表现更优。在这些数据集规模(748到15万行)的对比中,准确率的前沿已完全属于基础模型。我原本并未预料到差距会如此显著。
其次,服务成本使树模型的"廉价"优势不再成立。TabICLv2的预测时间中位数为每千行0.38秒,比调优后集成的LightGBM(2.64秒)更快,与调优后的CatBoost处于同一量级。其拟合时间中位数为每千行4秒,比调优后的GBDT协议快约100倍,因为拟合过程只需一次前向传播且无需超参数搜索。需要注意的是:基础模型运行在GPU而树模型运行在CPU,因此每行成本的比较取决于你的基础设施,CPU上默认的CatBoost(0.08秒/千行)仍是目前最经济的合理选择。关于规模:我全部51个数据集的TabICLv2扫描,在按需A10G实例上仅花费2美元。
第三,TabFM位居榜首,领先第二名AutoGluon流水线98 Elo分,领先下一个单一模型123分。它于2026年6月30日加入榜单,比我撰写此文早两周。审计结果显示:它在数据表现上超出预期,但文档方面存在不足。其预训练完全基于合成数据,采用类似TabPFN和TabICL的结构因果模型先验,因此基准污染问题在它身上也不存在。它缺失的是论文:没有技术报告,没有公开参数量,权重文件携带的非商业许可在README中未提及Christoph Molnar的分析。独立的折叠匹配重测仍显示它优于调优后的XGBoost。我在图表中标注了它的数据但标记为"非独立运行",123 Elo的差距确实存在,但目前只有Google内部人员能解释其原理。
将表格粘贴到前沿LLM中进行实测
我也对序列化并提示的方案进行了量化评估:将每个数据集作为文本输入给Claude Opus 4.8,提示中包含64个带标签的示例行,然后批量输入测试行进行预测并要求输出每类概率。为控制成本,采用简化协议:每个数据集抽取50个测试样本,最多展示32列,对全部51个数据集进行一次批量API调用。抽样导致每个数据集的得分存在噪声,因此应关注整体结果而非单个样本。
整体结果一边倒。51个数据集中有2个因预测结果过少而无法评分;在剩余49个数据集中,LLM在6个数据集上击败TabICLv2,在相同6个数据集上也击败了最佳调优集成的GBDT,其误差中位数比TabICLv2高出57%。它在客户流失、信用评分和献血数据表上表现优异,因为列名包含LLM可利用的现实世界含义。它在应用权限向量、传感器数据和物理过程数据上表现糟糕,因为这些表格仅包含纯模式,语言先验无法提供帮助。"表格LLM"这一表述容易混淆两种模型类别;按照此协议,2800万参数的表格原生模型在49个数据集中赢得43个,且在处理千行数据时仅需几分之一GPU秒,而提示LLM每千次预测的成本约为1.5美元。
调优对GBDT基线的影响
任何GBDT支持者提出的第一个异议都是调参:没有人会直接使用默认配置的LightGBM,因此如果一个团队仅使用默认配置运行树模型,就会高估基础模型的价值。TabArena已经给出了答案,因为它在三种预算下运行所有GBDT模型:默认配置、调参(真实搜索,耗费数小时计算资源)以及调参+事后集成。
对于LightGBM和XGBoost来说,调参的价值高达200 Elo,这几乎相当于“中游水平”和“板上最佳树模型”之间的差距。CatBoost是例外:其默认配置已经与完全调参并集成后的版本仅相差47 Elo,这与其声誉一致,也使默认配置的CatBoost成为此处最强的廉价基线(CPU上1370分,每千次推理仅需0.08秒)。
因此,在我到达之前,这个异议已经被计入评估,但结论依然成立:给予树木模型完整的调参预算和集成,未调参的基础模型仍然比它们高出150+ Elo。(在时间序列任务中我发现了相反的情况——适当调参使基础模型的领先优势减半。在此场景下,差距却远未缩小。)
整体表现掩盖了某种模式划分,它指出了树模型仍然是正确选择的场景。针对每个数据集,与三个调参并集成后的GBDT最佳模型相比,TabICLv2在51个数据集中赢了40个。11次失败集中在两个领域。
第一个是维度:在6个特征数超过100的数据集中,基础模型仅赢了1次。Bioresponse(1,776个特征)、hiva_agnostic(1,617个)、QSAR-TID-11(1,024个)、kddcup09(212个)和MIC(111个)都归于树模型。特征数低于100时,基础模型在86–88%的数据集中获胜。
第二个是高基数分类变量下的规模:板上最大的树模型胜利来自Amazon_employee_access(25%的误差差距),这正是该经典数据集的典型特征,而基础模型的胜率从3,000行以下的89%降至20,000行以上的64%。任务类型几乎无关紧要(二分类、多分类和回归任务的胜率分别为77–85%)。仅基于6个数据集的结论过于薄弱,因此应将维度发现视为强烈暗示而非定律。但依然:如果您的表格很宽或分类变量很复杂,请优先选择调参后的GBDT。
污染:最纯净来源的模型正在被超越
基准污染是我时间序列审计的核心轴线,这里同样存在不同形态的污染问题:数据来源最纯净的模型正在被其他模型超越。
TabICLv2和原始TabPFN模型仅在合成数据上进行预训练。不存在任何泄露可能:没有基准表格可以出现在一个完全不包含真实表格的预训练语料库中,因此对于这些模型,污染问题在结构上已被排除。
主题之所以仍然处于实时状态,是因为准确性的提升越来越依赖于真实数据的加入。RealTabPFN-2.5继续在“精选的43个真实世界表格数据集(来自OpenML和Kaggle)”上进行预训练,其报告中描述的去重流程是我在此次审计中发现的最强方案:数据集ID、名称、形状、特征名称、行和列哈希、人工元数据检查,“与所有内部基准和完整的TabArena套件进行去重” Real-TabPFN论文;TabPFN-2.5报告,附录C。TabDPT更进一步深入真实数据领域:它直接在123个OpenML数据集上进行预训练,而TabArena的数据集也来自OpenML,这正是最近一篇集成学习论文指出的污染问题重叠区域,该论文指出其报告的提升“应被视为上限”。我没有理由不相信任何特定的去重流程;我也无法验证任何一个流程,而激励梯度指向一个方向:真实数据能带来Elo提升,而证明其干净获得Elo的负担落在自声明的去重流程上。这与GIFT-Eval上自声明的“无”数据泄漏标志所处的相同认识论立场一致。
审计中得出的棋盘来源地图:
目前的实用解读:如果你想在自己的数据上获得完全信任的数字,仅使用合成数据的模型能提供最干净的证据立场,其中TabICLv2是权重无限制的最强模型。如果你想获得最后100-200个Elo,你必须信任训练数据的模型,或自行运行保留评估。
混合空间:理想上限与可部署的路由器
互补模型之间可以进行路由,而TabArena发布的成果允许我时间序列分析无法做到的事情:它们包含与测试误差并列的每分割验证误差,因此我可以同时评估理想路由器(根据测试误差为每个数据集选择更优模型,这是一个上限,因为它作弊了)和可部署路由器(根据验证误差选择,这是真实系统拥有的能力)。没有模型运行;这完全基于已发布的每分割结果进行纯算术运算,使用棋盘自身的Elo机制进行评分。
一个比例说明:这些Elo值是在我自己的池中计算的(包含所有78个已发布方法加路由器,包括插补方法),因此绝对数值与网站棋盘略有差异——TabICLv2在这里是1571,而那里是1590。表内比较是同类对同类。
图4:路由器空间。虚线条表示理想上限;蓝色条是两个基础模型之间的可部署验证选择路由器,其性能优于两个成员。同一路由器跨越FM/GBDT分界时的表现低于单独的TabICLv2。📖 来源:作者制作的图片。
互补性是真实存在的,且包括树模型。一个理想选择器在TabICLv2和调优后的LightGBM之间按数据集选择,达到了1674,比单独使用TabICLv2提升了+103——而这个合作伙伴的Elo评分比TabICLv2低160。TabICLv2在51个数据集中的42个上胜出,其余9个数据集的价值也与此相当。FM+FM理想选择器表现更优:1707,超过棋盘上除未经审计的TabFM外的所有模型。
可部署路由器有效,但仅限于基础模型之间。根据验证误差在TabICLv2和TabPFN-2.6之间选择,得分为1645,高于两个成员,仅用理想选择器所需信息的一半就恢复了约一半的理想空间。在互补模型之间进行路由,仅使用部署时可获得的信息,就能超越最佳单模型表现。
相同的路由机制在FM/GBDT之间产生反作用。TabICLv2与调优后的LightGBM之间的价值选择停留在1534,低于始终使用TabICLv2的表现。神谕指出该位置存在+103的提升空间;基于验证的选择机制不仅未能捕捉到这一空间,反而比始终运行TabICLv2低了37 Elo,这可能是因为两个模型家族的验证误差不可比(GBDT的内部验证估计在FM面前显得过于乐观)。我将这一机制标记为推测;结果的方向是可测量的。如果你想获取树模型的九个数据集,需要比原始验证误差更可靠的筛选信号。
我的结论
一个2800万参数的开源模型,在完全没有真实数据预训练的情况下,仅用2美元的GPU时间,就能在与我相同的硬件上复现其公开基准表现(在相同数据划分下误差在引导抽样噪声范围内,16 Elo;每任务中位数差异0.08%),而它所处的榜单显示所有调优后的梯度提升树配置至少比它低158 Elo。我最确信的部分是证据链:开源权重、仅使用合成数据预训练、以及我自己端到端重新计算的评分流程。目前我尚未声称榜单首位:TabFM的来源未经审计,TabPFN系列受限制,而我自己的实验仅覆盖每个数据集的一个划分而非完整协议。
如果你现在正在使用表格数据,上述的领域地图将简化为一个简短的决策规则。在特征数低于100且行数适中的情况下,TabICLv2的零样本表现是你可以运行的最强开源模型,且能在几秒内完成训练。宽表和复杂的分类变量仍然属于调优后的GBDT。如果你能部署两个模型且候选模型均为基础模型,我在实验中发现它们之间的验证选择能提升准确率;但在FM/树模型之间进行验证选择会降低准确率,因此应避免这样做。
唯一尚未验证的点是:我尚未独立复现TabPFN模型。接下来我计划进行的实验包括:在相同Lite划分上重新运行TabPFN-2.6模型,以及使用TabArena缓存预测构建加权FM+GBDT集成,观察真实组合在路由器无法触及的高维数据集上能恢复多少神谕指出的+103提升。
免责声明:本文观点和意见仅代表我个人,不代表我的雇主或任何关联组织。内容基于个人经验和反思,不应视为专业或学术建议。
📚参考文献
- Erickson, N., Purucker, L., Tschalzev, A., Holzmüller, D., Desai, P. M., Salinas, D., and Hutter, F. (2025). TabArena: A Living Benchmark for Machine Learning on Tabular Data . 引入了TabArena,这是本文贯穿使用的持续维护基准,包含其精选数据集、重复评估协议、模型比较和基于Elo的排行榜。
- Qu, J., Holzmüller, D., Varoquaux, G., and Le Morvan, M. (2026). TabICLv2: A Better, Faster, Scalable, and Open Tabular Foundation Model . 引入了TabICLv2,这是本文独立评估的约2800万参数开源表格基础模型,并描述了其合成预训练、架构和扩展改进。
- Hollmann, N., Müller, S., Eggensperger, K., and Hutter, F. (2023). TabPFN: 一种能在一秒内解决小型表格分类问题的Transformer。确立了在表格预测中使用预训练Transformer和上下文学习的方法,并采用基于结构因果模型先验生成的合成数据集进行验证。
- Hollmann, N., Müller, S., Purucker, L., Krishnakumar, A., Körfer, M., Hoo, S. B., Schirrmeister, R. T., and Hutter, F. (2025). 使用表格基础模型在小数据上实现精准预测。介绍了适用于中小型表格数据集的现代TabPFN版本,并证明预训练基础模型无需针对特定数据集进行参数调优即可与传统方法竞争。
- Google Research. (2026). 推出TabFM:面向表格数据的零样本基础模型。介绍了本文讨论的最高排名模型TabFM,描述其零样本分类与回归方法、上下文推理能力以及基于合成结构因果模型的预训练技术。
撰写人
查看Sean Moran的所有文章
数据科学
,
深度学习
编辑精选
机器学习
表格模型
分享本文
- Facebook分享
- LinkedIn分享
- X分享
Towards Data Science 是一份社区出版物。提交您的洞见以触达全球读者,并通过TDS作者支付计划获得收益。
更新为实际投稿链接
为TDS撰写文章
✦ 结束CTA ✦