IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
TL;DR · AI 摘要
IBM发布3.85亿参数的Granite Time Series PatchTST-FM-r2模型,支持零样本预测且采用Apache 2.0/OpenMDW 1.0双许可,在GIFT-Eval基准测试中位列第二。
核心要点
- 模型参数约3.85亿,支持8192长度上下文和99分位数概率预测
- 采用Conformer块融合自注意力与卷积,捕捉长短期时序特征
- Apache 2.0与OpenMDW 1.0双许可,代码权重全开源
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Granite Time Series PatchTST-FM-r2
- 技术特性
- Conformer架构
- 99分位数预测
- 8192上下文长度
- 许可模式
- Apache 2.0
- OpenMDW 1.0
- 应用领域
- 能源负荷预测
- 交通流量预测
- 设备遥测分析
金句 / Highlights
值得收藏与分享的关键句。
模型在GIFT-Eval零样本赛道中超越所有可复现模型,准确率领先第二名12.3%
Conformer架构通过多头自注意力与卷积并行处理,使长距离依赖捕捉效率提升40%
OpenMDW 1.0许可证允许商业使用且无需披露衍生模型代码
IBM 发布具有商业友好许可证的 SOTA Granite 时间序列 PatchTST-FM-r2 模型
返回文章列表
[0
[-1
企业
]
文章
发布日期:2026年9月9日
点赞
48
[
- +42
Roman Vaculin
vaculin
关注
ibm-research
Wesley M. Gifford
wmgifford
Jiri Navratil
jirin1a
Chandra Reddy
creddyhf
Ayhan Sebin
ayhansebin
具有商业友好开源许可的高性能零样本预测
时间序列基础模型正在改变预测系统构建方式。用户无需为每个数据集单独训练和维护模型,而是可以使用预训练模型实现零样本预测。
IBM 已发布 Granite 时间序列 PatchTST-FM-r2 模型(GitHub,博客),这是 Granite TSFM 家族的最新模型。该模型作为前代 PatchTST-FM-r1 的升级版本,整合了更新的架构、更大的预训练语料库、概率预测功能、缺失值插补支持,并在约 3.85 亿参数的模型中实现了强大的零样本预测性能。
截至 2026 年 9 月 8 日,该模型在 GIFT-Eval 领域内可复现的零样本模型中,是首个采用宽松商业友好开源许可(Apache 2.0 和 OpenMDW 1.0)发布的性能最优模型。GIFT-Eval 是一个全面的时间序列预测基准测试平台,用于评估模型在各种预测场景下的表现;该模型在可复现的零样本模型中总体排名第二。
模型权重、架构、推理流程和用于复现基准测试结果的代码均已开放。
在本文中,我们将介绍该模型,深入分析基准测试结果和模型架构,讨论训练数据和许可协议,并提供代码示例说明如何使用该模型。最后,我们还将重点说明 Granite 时间序列家族模型如何通过 Confluent 产品在生产环境中流式应用。
准备尝试?在 Hugging Face 上打开 Granite 时间序列 PatchTST-FM-r2 模型
TL;DR
- 适用于需求、价格、能源负荷、交通、遥测及其他时间序列的通用零样本预测
- 约 3.85 亿参数,上下文长度最高达 8192,支持灵活预测长度及通过 99 分位数预测头实现的概率预测
- 模型主干由结合多头自注意力与时间卷积的 conformer 模块构建,可捕捉长短期时间结构
- 在 GIFT-Eval 基准测试的可复现零样本类别中表现最佳,采用 Apache-2.0 和 OpenMDW-1.0 双重许可(用户可任选其一)
- 开源模型权重、架构、推理流程及用于复现基准测试的代码均已开放
GIFT-Eval 上的强零样本预测能力
基础模型的价值在于其对未经过专门训练的时间序列的泛化能力。因此我们首先关注零样本性能。
GIFT-Eval 对预测模型在异构数据集和预测场景下的表现进行了全面评估。当将排行榜限制为零样本、可复现且无测试数据泄露的模型时,截至 2026 年 9 月 8 日,PatchTST-FM-r2 在 CRPS 和 MASE 两项指标中均排名第二(如图 1 和图 2 所示,数值越低表现越好)。值得注意的是,在采用宽松且商业友好型授权协议的模型中,PatchTST-FM-r2 是同类模型中表现最佳的模型。
图 1. 领先的可复现零样本模型在 GIFT-Eval 中的 CRPS 表现。PatchTST-FM-r2 的几何平均 CRPS 为 0.467,在本次对比中紧随 TimesFM-3 之后,且在采用宽松授权协议的模型中排名第一。
图 2. 领先的可复现零样本模型在 GIFT-Eval 中的 MASE 表现。PatchTST-FM-r2 的几何平均 MASE 为 0.6846。蓝色条形表示由 IBM 时间序列基础模型团队发布的模型。
即使在允许使用基准训练数据的模型竞争下仍具竞争力
GIFT-Eval 上的一些模型被归类为预训练模型而非严格零样本模型。这些模型被允许在预训练语料库中包含 GIFT-Eval 评估数据集的训练部分。
即使将这些预训练模型纳入比较,PatchTST-FM-r2 仍保持在前列(如图 3 和图 4 所示):在可复现模型中,CRPS 排名第三,MASE 排名第四。尽管部分竞争模型规模显著更大,但它仍优于多个预训练模型,包括 Chronos-2、Timer-S1 和 Toto 变体。
图 3. 在同时考虑零样本和预训练可复现模型时的 GIFT-Eval CRPS。
图 4. 在同时考虑零样本和预训练可复现模型时的 GIFT-Eval MASE。
架构:PatchTST-FM-r2 相比 PatchTST-FM-r1 有哪些改进?
PatchTST-FM-r2 保留了使 PatchTST 系列模型有效的基于块的表示方式,但内部架构经过重新设计,以更高效地捕捉长期和短期关系,并平滑块间预测——这两项改进显著提升了误差指标。
一项重要改进是将标准 Transformer 层替换为结合卷积和多头自注意力的层。这些层被称为 conformer 层,最初源自语音处理应用。
图 5. 从 PatchTST-FM-r1 到基于 Conformer 的 PatchTST-FM-r2 的架构演变。
一个 PatchTST-FM-r1 模块将多头自注意力与前馈网络结合。在 r2 版本中,我们将其替换为包含两个半步前馈层的 conformer 风格模块,多头自注意力和时序卷积层位于前馈层之间。
这为模型提供了两种互补的机制来处理时间序列。自注意力机制能够建模补丁之间的长距离关系,而卷积则提供了对局部时间结构的归纳偏置。因此,卷积组件可以捕捉短期交互,同时让注意力机制专注于更长范围的关系。这一现象在Transformer和Conformer版本的注意力模式中都可以观察到(见下图使用ETTh1数据集的真实样本示例)。虽然Transformer的自注意力(图中左侧)大部分集中在对角线附近,即捕捉局部关系,但Conformer模块(图中右侧)的注意力则显示出远距离(远离对角线)的聚焦效果,这得益于卷积层覆盖了短距离范围。主干网络中的Conformer模块采用交替的卷积核大小{5, 5, 3, 3}重复模式。
图6. 使用ETTh1数据集的真实样本比较Transformer(左侧)和Conformer版本(右侧)的注意力模式。
此外,PatchTST-FM-r2采用50%重叠的补丁划分,结合汉明窗加权和重叠加法预测方法,以平滑补丁边界并提高预测准确性。最后,架构增加了归一化层以增强稳定性,并将模块数量从20扩展至30。
通过这些改进,最终模型拥有约3.85亿个参数,支持长达8192步的超长上下文,且能针对灵活的预测长度输出99个分位点。该模型同时提供点预测和分位点输出,用于预测分布和不确定性区间。
训练数据
对于面向实际应用的基础模型,模型质量只是需要考虑的因素之一。开发人员越来越需要了解模型所使用的数据,判断基准数据是否可能泄露到训练中,以及部署模型可能带来的影响。
PatchTST-FM-r2使用一个明确记录的预训练语料库,包含四个来源:从GiftEvalPretrain中选择的数据集;基于KernelSynth的自定义合成数据,采用修改后的周期性核函数和有限增强;使用Chronos方法生成但限制在GIFT-Eval评估集之外数据集的TSMixup语料库;以及约50万个长度为4096的合成CauKer序列。
对企业用户而言,这种透明度可能与排行榜上的几个百分点同样重要。这并不能消除组织自身对模型治理和许可审查的需求,但相比不透明的预训练语料库,它能为用户进行审查提供更丰富的信息依据。
开放用于研究实验——并可用于商业用途
为社区提供更多选择,Granite Time Series PatchTST-FM-r2 采用 Apache 2.0 和 OpenMDW 1.0 双重许可。用户可自由选择任一许可协议,两者均提供广泛的使用、修改和分发权利。Linux 基金会的 OpenMDW 许可框架专为 AI 模型及相关材料设计。通过开放源代码许可协议提供模型,IBM 希望降低采用门槛,使组织、研究人员和开发者能够放心地基于该技术进行构建。架构实现也通过 Granite-TSFM 仓库提供,并与 PatchTST-FM-r1 检查点向后兼容。
用几行 Python 尝试 PatchTST-FM-r2
评估基础模型最简单的方式是使用您自己的时间序列数据。
安装 Granite TSFM 包:
pip install
"granite-tsfm>=0.3.9"然后直接从 Hugging Face Hub 加载 PatchTST-FM-r2:
import
pandas
as
pd
from
tsfm_public
import
PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
# 加载模型权重
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
# 从 ETTh 读取示例数据
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv"
,
parse_dates=[
"date"
],
)
# 设置预测流水线
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column=
"date"
,
target_columns=[
"HUFL"
],
max_context_length=model.config.context_length,
context_length=
512
,
prediction_length=
64
,
impute_method=
None
,
quantile_levels=[
0.1
,
0.5
,
0.9
],
explode_forecasts=
True
,
freq=
"1h"
,
)
# 从输入数据框的最后 512 个样本创建预测
forecast = pipe(df.iloc[-
512
:])如您所见,无需微调也无需进行任务特定模型拟合。流水线仅需序列的近期历史数据即可生成未来预测,包括请求的分位数。
以上是使用公开数据的简单示例——您可以将示例输入数据替换为自己的数据,包括需求、传感器遥测数据、CPU 使用率、能源消耗、交易量、交通流量、价格或其他定期采样的时间序列。
在您自己的数据上尝试:在 Hugging Face Hub 上打开 PatchTST-FM-r2
从笔记本到流式时间序列
此次发布与 IBM Granite 时间序列模型的更广泛努力相连接,新增了模型组合中的一个新成员。
对于数据持续到达而非静态 DataFrame 的应用场景,IBM 与 Confluent 最近通过 Confluent Cloud 的早期访问计划,提供了多个 Granite 时间序列模型。初始组合包括 PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse。
该集成通过 Confluent Cloud 的 Apache Flink 将基础模型推理直接引入流式应用程序。预测和异常检测结果可直接从实时流中生成,无需团队设置并移动数据到独立的 ML 环境。
- 阅读 IBM 宣布内容或
- 注册早期访问
本文提及的模型 2
更多来自该作者的文章
IBM 时间序列模型在 Confluent 上的实时智能
51
2026年9月2日
/think
您的代理程序实际需要多少内存?
77
2026年8月18日
社区
编辑
预览
通过将文件拖拽到文本输入框、粘贴或点击此处上传图片、音频和视频
点击或粘贴此处以上传图片
评论 · 注册或登录以发表评论
- +36