Google Cloud Blog

Introducing TabFM in BigQuery: Predictive analytics reimagined

8.5内容质量
Introducing TabFM in BigQuery: Predictive analytics reimagined

TL;DR · AI 摘要

Google在BigQuery中推出TabFM模型,通过SQL实现零样本预测,提升企业预测分析效率。

核心要点

  • TabFM通过单条SQL语句实现零样本预测,省去训练和部署步骤
  • 在TabArena基准测试中,TabFM准确率超越传统模型和竞品
  • 支持百万级行数据分钟级处理,无需复杂特征工程

结构提纲

按章节快速跳转。

  1. 传统预测分析流程存在训练周期长、特征工程复杂等问题。

  2. ·TabFM核心功能

    通过零样本预测、自动特征处理等能力简化预测流程。

  3. TabArena基准测试中准确率优于传统模型和竞品模型。

  4. 通过AI.PREDICT和AI.EVALUATE SQL函数直接调用模型。

  5. 支持百万级行数据处理,自动并行化计算。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • TabFM在BigQuery中的应用
    • 核心功能
      • 零样本预测
      • 自动特征处理
    • 性能优势
      • TabArena基准测试领先
      • 高准确率
    • 使用方式
      • SQL函数调用
      • 分布式处理

金句 / Highlights

值得收藏与分享的关键句。

#BigQuery#TabFM#机器学习#预测分析#Google Cloud
打开原文

TabFM 为 BigQuery 添加预测性机器学习 | Google Cloud 博客

数据分析

在 BigQuery 中引入 TabFM:重新定义预测分析

2026 年 9 月 1 日

##### Vaibhav Sethi

集团产品经理

##### Xi Cheng

工程经理

##### 今天试用 Gemini Enterprise

职场人工智能的入口

立即试用

历史上,企业预测分析任务(如预测客户流失、购买意向或欺诈评分)需要使用 XGBoost、随机森林或深度神经网络(DNN)等库构建自定义模型。虽然有效,但传统的训练-调优-部署-再训练周期可能复杂且耗时。此外,手动特征工程、超参数调优、耗时且昂贵的训练过程以及对专业数据科学技能的需求,可能导致企业在决策中未能充分利用预测模型。

今天,我们宣布在 BigQuery 中推出 TabFM 模型。由 Google Research 开发,TabFM 是一种用于表格数据回归和分类的最先进的预训练基础模型。它利用上下文学习(ICL),通过单条 SQL 语句即可在您的表格数据集上即时提供高度准确的预测,省去了单独的训练和部署步骤。目前,BigQuery 上的 TabFM 处于预览阶段。

以下是 TabFM 为您的 BigQuery 分析带来的优势:

  • 零样本预测:跳过模型训练、调优和工件部署。只需将带标签的历史数据和新预测表传递给单个 SQL 函数,即可立即获得高质量预测。
  • 面向智能体应用的预测性机器学习:要为业务场景构建智能体?通过 TabFM 加上 BigQuery MCP 服务器,为您的应用添加预测能力。无需管理运行时或基础设施,只需输入数据即可输出预测结果。
  • 最先进的准确性:在复杂数据集上表现优于自定义训练的现成传统模型,在行业基准测试中实现了更优的准确性评分。
  • 简洁的开发者体验:原生运行在 BigQuery 中,可通过简单的 SQL 语法访问。自动处理缺失值、分类编码等特征工程任务,无需管理复杂的特征工程流程。
  • 可扩展性:利用 BigQuery 的分布式推理架构,可在几分钟内处理数百万行的大型推理表。

表格预测领域的领先模型

Google 的 TabFM 在各种表格数据上实现了行业领先的准确性。在 TabArena 基准测试的评估中,TabFM 一直优于经典机器学习模型和其他表格基础模型。

TabArena 分类(上)和回归(下)前 10 名模型的 ELO 评分(↑)。(D)= 默认;(T+E)= 调优 + 集成。分数越高表示性能越优。

[了解更多关于 TabFM 模型的信息](#)

在 BigQuery 中开始使用 TabFM

使用 TabFM 非常简单。它通过新的内置 SQL 函数直接暴露:AI.PREDICTAI.EVALUATE

  1. 使用 AI.PREDICT 获取即时预测

要进行预测,您只需编写一条查询语句,将训练数据和预测数据传递给模型。模型会根据目标标签的数据类型自动推断任务是分类问题还是回归问题。

加载中...

-- 将交易分类为欺诈或非欺诈 SELECT * FROM AI.PREDICT( TABLE my_project.my_dataset.historical_transactions, -- 训练数据(上下文示例) TABLE my_project.my_dataset.new_transactions, -- 预测数据 label_col => 'is_fraud'-- 预测的目标列 );

在此示例中,输出包含预测表中的所有原始列,以及预测标签和概率列(例如 predicted_is_fraud)。无需手动进行特征工程或模型创建。

  1. 使用 AI.EVALUATE 评估模型 可以通过 AI.EVALUATE 函数快速检查预测性能与测试集的匹配度。这使您能够通过单个步骤生成标准评估指标。

-- 客户终身价值(LTV)回归评估 SELECT * FROM AI.EVALUATE( TABLE my_project.my_dataset.historical_customer_ltv, TABLE my_project.my_dataset.test_customer_ltv, label_col => 'ltv' );

AI.EVALUATE 返回一组稳健的指标,如 r2_score、mean_absolute_error 等用于回归问题,以及 precision、recall 和 f1 等用于分类问题的指标。

BigQuery 中 TabFM 的实现原理

传统机器学习需要将模型参数拟合到训练数据集。相比之下,TabFM 使用上下文学习。类似于大语言模型(LLM)通过提示中的少量示例学习任务的方式,TabFM 将您的训练表作为上下文示例,并在单次前向传递中为您的目标表生成预测。

为了处理表格基础模型的计算复杂性和内存占用,BigQuery 对您的数据执行分布式并行推理。此外,为了优化性能和资源利用率,它使用智能训练数据采样以及分布式执行。这使 BigQuery 能够在处理大型训练数据输入行的同时,快速高效地在数百万行的推理数据上执行预测。

选择合适的工具

TabFM 为 BigQuery 引入了突破性的零样本能力,并补充了现有功能,如 XGBoost 模型。以下是选择 TabFM 和其他模型的建议:

  • 在需要快速、高质量预测洞察且无需机器学习专业知识时,在历史数据集为中小型时,在数据频繁变化时,在需要频繁重新训练模型以保持准确性时,使用 TabFM。它也适用于需要按需预测分析的对话式或代理式工作流。
  • 在拥有非常大的历史数据集时,在需要完全控制自定义超参数调优时,在特征数量超过 TabFM 当前限制时,在需要特征重要性可解释性(即哪些输入特征对预测贡献最大)时,使用传统的 XGBoost 等模型。

简化预测性机器学习

通过将 TabFM 本机集成到 BigQuery 中,预测性机器学习现在只需运行标准 SELECT 查询即可。通过消除模型训练、调整和管理的人工开销,TabFM 让开发人员、数据科学家和分析师能够在几秒钟内从原始数据获得丰富的预测洞察。

立即开始,请查看公开文档。如需提问或反馈,请通过 [email protected] 联系我们的团队。我们期待看到您构建的内容!

发布在

  • 数据分析
  • BigQuery