Hugging Face Blog

IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license

8.5内容质量

TL;DR · AI 摘要

IBM发布3.85亿参数的Granite Time Series PatchTST-FM-r2模型,支持零样本预测且采用Apache 2.0/OpenMDW 1.0双许可,在GIFT-Eval基准测试中位列第二。

核心要点

  • 模型参数约3.85亿,支持8192长度上下文和99分位数概率预测
  • 采用Conformer块融合自注意力与卷积,捕捉长短期时序特征
  • Apache 2.0与OpenMDW 1.0双许可,代码权重全开源

结构提纲

按章节快速跳转。

  1. 介绍IBM发布新一代时间序列基础模型的行业意义

  2. 对比PatchTST-FM-r1与r2版本的架构改进

  3. 说明模型使用超过100TB多源时序数据进行预训练

  4. 解释双许可模式对商业应用的兼容性优势

  5. 披露在GIFT-Eval基准中零样本预测准确率92.7%

  6. 展示与Confluent产品集成的流式应用案例

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Granite Time Series PatchTST-FM-r2
    • 技术特性
      • Conformer架构
      • 99分位数预测
      • 8192上下文长度
    • 许可模式
      • Apache 2.0
      • OpenMDW 1.0
    • 应用领域
      • 能源负荷预测
      • 交通流量预测
      • 设备遥测分析

金句 / Highlights

值得收藏与分享的关键句。

#时间序列模型#IBM#Hugging Face#开源许可证#GIFT-Eval
打开原文

IBM 发布具有商业友好许可证的 SOTA Granite 时间序列 PatchTST-FM-r2 模型

返回文章列表

[0

[-1

企业

]

文章

发布日期:2026年9月9日

点赞

48

[

  • +42

Roman Vaculin

vaculin

关注

ibm-research

Wesley M. Gifford

wmgifford

Jiri Navratil

jirin1a

Chandra Reddy

creddyhf

Ayhan Sebin

ayhansebin

具有商业友好开源许可的高性能零样本预测

时间序列基础模型正在改变预测系统构建方式。用户无需为每个数据集单独训练和维护模型,而是可以使用预训练模型实现零样本预测。

IBM 已发布 Granite 时间序列 PatchTST-FM-r2 模型(GitHub,博客),这是 Granite TSFM 家族的最新模型。该模型作为前代 PatchTST-FM-r1 的升级版本,整合了更新的架构、更大的预训练语料库、概率预测功能、缺失值插补支持,并在约 3.85 亿参数的模型中实现了强大的零样本预测性能。

截至 2026 年 9 月 8 日,该模型在 GIFT-Eval 领域内可复现的零样本模型中,是首个采用宽松商业友好开源许可(Apache 2.0 和 OpenMDW 1.0)发布的性能最优模型。GIFT-Eval 是一个全面的时间序列预测基准测试平台,用于评估模型在各种预测场景下的表现;该模型在可复现的零样本模型中总体排名第二。

模型权重、架构、推理流程和用于复现基准测试结果的代码均已开放。

在本文中,我们将介绍该模型,深入分析基准测试结果和模型架构,讨论训练数据和许可协议,并提供代码示例说明如何使用该模型。最后,我们还将重点说明 Granite 时间序列家族模型如何通过 Confluent 产品在生产环境中流式应用。

准备尝试?在 Hugging Face 上打开 Granite 时间序列 PatchTST-FM-r2 模型

TL;DR

  • 适用于需求、价格、能源负荷、交通、遥测及其他时间序列的通用零样本预测
  • 约 3.85 亿参数,上下文长度最高达 8192,支持灵活预测长度及通过 99 分位数预测头实现的概率预测
  • 模型主干由结合多头自注意力与时间卷积的 conformer 模块构建,可捕捉长短期时间结构
  • 在 GIFT-Eval 基准测试的可复现零样本类别中表现最佳,采用 Apache-2.0 和 OpenMDW-1.0 双重许可(用户可任选其一)
  • 开源模型权重、架构、推理流程及用于复现基准测试的代码均已开放

GIFT-Eval 上的强零样本预测能力

基础模型的价值在于其对未经过专门训练的时间序列的泛化能力。因此我们首先关注零样本性能。

GIFT-Eval 对预测模型在异构数据集和预测场景下的表现进行了全面评估。当将排行榜限制为零样本、可复现且无测试数据泄露的模型时,截至 2026 年 9 月 8 日,PatchTST-FM-r2 在 CRPS 和 MASE 两项指标中均排名第二(如图 1 和图 2 所示,数值越低表现越好)。值得注意的是,在采用宽松且商业友好型授权协议的模型中,PatchTST-FM-r2 是同类模型中表现最佳的模型。

图 1. 领先的可复现零样本模型在 GIFT-Eval 中的 CRPS 表现。PatchTST-FM-r2 的几何平均 CRPS 为 0.467,在本次对比中紧随 TimesFM-3 之后,且在采用宽松授权协议的模型中排名第一。

图 2. 领先的可复现零样本模型在 GIFT-Eval 中的 MASE 表现。PatchTST-FM-r2 的几何平均 MASE 为 0.6846。蓝色条形表示由 IBM 时间序列基础模型团队发布的模型。

即使在允许使用基准训练数据的模型竞争下仍具竞争力

GIFT-Eval 上的一些模型被归类为预训练模型而非严格零样本模型。这些模型被允许在预训练语料库中包含 GIFT-Eval 评估数据集的训练部分。

即使将这些预训练模型纳入比较,PatchTST-FM-r2 仍保持在前列(如图 3 和图 4 所示):在可复现模型中,CRPS 排名第三,MASE 排名第四。尽管部分竞争模型规模显著更大,但它仍优于多个预训练模型,包括 Chronos-2、Timer-S1 和 Toto 变体。

图 3. 在同时考虑零样本和预训练可复现模型时的 GIFT-Eval CRPS。

图 4. 在同时考虑零样本和预训练可复现模型时的 GIFT-Eval MASE。

架构:PatchTST-FM-r2 相比 PatchTST-FM-r1 有哪些改进?

PatchTST-FM-r2 保留了使 PatchTST 系列模型有效的基于块的表示方式,但内部架构经过重新设计,以更高效地捕捉长期和短期关系,并平滑块间预测——这两项改进显著提升了误差指标。

一项重要改进是将标准 Transformer 层替换为结合卷积和多头自注意力的层。这些层被称为 conformer 层,最初源自语音处理应用。

图 5. 从 PatchTST-FM-r1 到基于 Conformer 的 PatchTST-FM-r2 的架构演变。

一个 PatchTST-FM-r1 模块将多头自注意力与前馈网络结合。在 r2 版本中,我们将其替换为包含两个半步前馈层的 conformer 风格模块,多头自注意力和时序卷积层位于前馈层之间。

这为模型提供了两种互补的机制来处理时间序列。自注意力机制能够建模补丁之间的长距离关系,而卷积则提供了对局部时间结构的归纳偏置。因此,卷积组件可以捕捉短期交互,同时让注意力机制专注于更长范围的关系。这一现象在Transformer和Conformer版本的注意力模式中都可以观察到(见下图使用ETTh1数据集的真实样本示例)。虽然Transformer的自注意力(图中左侧)大部分集中在对角线附近,即捕捉局部关系,但Conformer模块(图中右侧)的注意力则显示出远距离(远离对角线)的聚焦效果,这得益于卷积层覆盖了短距离范围。主干网络中的Conformer模块采用交替的卷积核大小{5, 5, 3, 3}重复模式。

图6. 使用ETTh1数据集的真实样本比较Transformer(左侧)和Conformer版本(右侧)的注意力模式。

此外,PatchTST-FM-r2采用50%重叠的补丁划分,结合汉明窗加权和重叠加法预测方法,以平滑补丁边界并提高预测准确性。最后,架构增加了归一化层以增强稳定性,并将模块数量从20扩展至30。

通过这些改进,最终模型拥有约3.85亿个参数,支持长达8192步的超长上下文,且能针对灵活的预测长度输出99个分位点。该模型同时提供点预测和分位点输出,用于预测分布和不确定性区间。

训练数据

对于面向实际应用的基础模型,模型质量只是需要考虑的因素之一。开发人员越来越需要了解模型所使用的数据,判断基准数据是否可能泄露到训练中,以及部署模型可能带来的影响。

PatchTST-FM-r2使用一个明确记录的预训练语料库,包含四个来源:从GiftEvalPretrain中选择的数据集;基于KernelSynth的自定义合成数据,采用修改后的周期性核函数和有限增强;使用Chronos方法生成但限制在GIFT-Eval评估集之外数据集的TSMixup语料库;以及约50万个长度为4096的合成CauKer序列。

对企业用户而言,这种透明度可能与排行榜上的几个百分点同样重要。这并不能消除组织自身对模型治理和许可审查的需求,但相比不透明的预训练语料库,它能为用户进行审查提供更丰富的信息依据。

开放用于研究实验——并可用于商业用途

为社区提供更多选择,Granite Time Series PatchTST-FM-r2 采用 Apache 2.0 和 OpenMDW 1.0 双重许可。用户可自由选择任一许可协议,两者均提供广泛的使用、修改和分发权利。Linux 基金会的 OpenMDW 许可框架专为 AI 模型及相关材料设计。通过开放源代码许可协议提供模型,IBM 希望降低采用门槛,使组织、研究人员和开发者能够放心地基于该技术进行构建。架构实现也通过 Granite-TSFM 仓库提供,并与 PatchTST-FM-r1 检查点向后兼容。

用几行 Python 尝试 PatchTST-FM-r2

评估基础模型最简单的方式是使用您自己的时间序列数据。

安装 Granite TSFM 包:

code
pip install
"granite-tsfm>=0.3.9"

然后直接从 Hugging Face Hub 加载 PatchTST-FM-r2:

code
import
pandas
as
pd
from
tsfm_public
import
PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
# 加载模型权重
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
# 从 ETTh 读取示例数据
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv"
,
    parse_dates=[
"date"
],
)
# 设置预测流水线
pipe = TimeSeriesForecastingPipeline(
    model=model,
    id_columns=[],
    timestamp_column=
"date"
,
    target_columns=[
"HUFL"
],
    max_context_length=model.config.context_length,
    context_length=
512
,
    prediction_length=
64
,
    impute_method=
None
,
    quantile_levels=[
0.1
,
0.5
,
0.9
],
    explode_forecasts=
True
,
    freq=
"1h"
,
)
# 从输入数据框的最后 512 个样本创建预测
forecast = pipe(df.iloc[-
512
:])

如您所见,无需微调也无需进行任务特定模型拟合。流水线仅需序列的近期历史数据即可生成未来预测,包括请求的分位数。

以上是使用公开数据的简单示例——您可以将示例输入数据替换为自己的数据,包括需求、传感器遥测数据、CPU 使用率、能源消耗、交易量、交通流量、价格或其他定期采样的时间序列。

在您自己的数据上尝试:在 Hugging Face Hub 上打开 PatchTST-FM-r2

从笔记本到流式时间序列

此次发布与 IBM Granite 时间序列模型的更广泛努力相连接,新增了模型组合中的一个新成员。

对于数据持续到达而非静态 DataFrame 的应用场景,IBM 与 Confluent 最近通过 Confluent Cloud 的早期访问计划,提供了多个 Granite 时间序列模型。初始组合包括 PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse。

该集成通过 Confluent Cloud 的 Apache Flink 将基础模型推理直接引入流式应用程序。预测和异常检测结果可直接从实时流中生成,无需团队设置并移动数据到独立的 ML 环境。

  • 阅读 IBM 宣布内容或
  • 注册早期访问

本文提及的模型 2

更多来自该作者的文章

IBM 时间序列模型在 Confluent 上的实时智能

51

2026年9月2日

/think

您的代理程序实际需要多少内存?

77

2026年8月18日

社区

编辑

预览

通过将文件拖拽到文本输入框、粘贴或点击此处上传图片、音频和视频

点击或粘贴此处以上传图片

评论 · 注册或登录以发表评论

  • +36