Real-Time Intelligence with IBM Time Series Models on Confluent
TL;DR · AI 摘要
IBM与Confluent合作的时间序列模型实现工业实时智能决策,单点准确性提升可节省数百万成本,无需数据科学团队即可部署。
核心要点
- 时间序列基础模型(TSFM)可预测生产线输出并检测异常,准确率提升带来5-10倍生产力增益
- 模型部署无需数据科学团队,领域专家可直接调用API实现预测、优化等功能
- IBM在水泥、钢铁、食品等行业验证,每百万美元投入带来数百万美元价值
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 实时时间序列智能决策
- 技术架构
- TSFM模型训练机制
- 流数据处理框架
- 应用场景
- 工业生产线监控
- 供应链优化
- 价值指标
- 5-10倍生产力增益
- 百万级成本节约
金句 / Highlights
值得收藏与分享的关键句。
传统方法中每周期需支付无法预测的决策成本,而TSFM将准确率提升带来的收益达数百万美元
同一模型可部署至所有生产线,领域专家无需数据科学团队即可调用API实现预测
IBM在水泥、钢铁等行业的应用验证显示生产力提升5-10倍
使用 IBM 时间序列模型在 Confluent 上实现实时智能
返回文章列表
[0
[-1
企业
]
文章
发布于2026年9月2日
点赞
23
[
- +17
Nicholas Fuller
nfuller
关注
ibm-research
Sean Falconer
thefalc
Ayhan Sebin
ayhansebin
Bilge Zeren Aksu
bzeren
Mountu Jinwala
mjinwala
Pankaj Dayama
pankajdayama
Roman Vaculin
vaculin
Siddharth Bedekar
bedeksid
基础模型改变了企业从非结构化数据中释放价值的方式。更大的机遇在于流数据,这是关键决策发生的地方:需要订购多少,要阻止哪笔支付,泵何时会失效,生产线应以多大强度运行,以及上次出现类似情况时发生了什么。现在,IBM 和 Confluent 正在通过原生流数据方式实现这一突破,这些模型已在 Confluent Cloud 的 Early Access 中上线,运行在数据已经流动的位置,Confluent 平台将随后跟进。
迄今为止,这些决策一直基于过时的经济模型:每次只能使用一个定制模型,每个模型都需要数月的专家工作。因此,团队只能对少数几百个关键数据序列进行建模,其余部分则通过安全余量、额外库存、额外缓冲和额外容差来应对,而这些措施往往在窗口关闭后才采取。这种余量是无人能预测的决策成本,每个周期都会重复支付。
时间序列基础模型(TSFM)改变了这一现状。通过在大量多样化信号上进行一次训练,它能够泛化到从未见过的数据序列:只需提供一段测量值,它就能预测接下来会发生什么,行为偏离正常范围有多远,哪些历史记录与此相似,以及哪些设置最有利于实现目标。使用该模型也不需要庞大的数据科学团队:需求计划员、欺诈分析师或工艺工程师都可以在自己的数据流上独立应用这些模型。围绕这些模型,IBM 正在构建功能,将工作向左转移,使预测、异常检测、优化和语义智能以可调用的功能形式出现,而非需要构建的项目。
设想巧克力工厂中的一条温控生产线,其温度、速度和吞吐量每隔几秒采样一次,并与固定阈值进行对比。将基础模型引入该数据流后,它能够预测整晚的生产线输出,使计划员在仍有时间采取行动时发现产能不足。它将今天的运行情况与生产线在黑巧克力生产中的正常表现进行对比,使缓慢的偏差在巧克力条膨胀之前就显现出来。它会在工厂历史记录中找到最接近的匹配,使工程师了解类似运行情况的最终结果。它会根据操作员控制的设置进行条件判断,并在最后几个准确点值得调整时进行微调。无需数据科学团队,同一模型可部署到每条生产线和每个工厂。
在向客户推出这些模型之前,IBM 首先在自己的产品和运营中进行了测试,随后与水泥、钢铁、纸浆和造纸、食品以及电信领域的设计合作伙伴共同进行了应用。数据证明了其价值:每个准确度提升点都价值数百万美元,生产率提升可达5至10倍,原本需要专家处理的工作现在已交由掌握决策权的领域专家完成。
现在,证明与实时上下文相结合:IBM 带来了能够理解信号行为的前沿模型,这些模型已拥有超过 4400 万次下载量,而 Confluent 则提供了业务的实时状态,并将该状态传递到每个执行操作的系统。两者结合后,可在 Confluent Cloud 上以流原生方式运行,并通过 Flink 调用。Confluent Cloud 在 AWS 上开放访问,随后 Confluent 平台将把相同模型和能力扩展到本地和混合环境。
时间序列智能与实时上下文结合,实现零配置、内置治理和高效处理
通常需要数月时间将模型部署到生产环境的流程,现在可以节省这些时间:Granite 读取信号,Confluent 提供上下文、治理以及向下游所有系统的传递。
信号的价值会随着时间衰减:今天检测到泵异常漂移时,这是一张工单;而下周同一台泵出现异常则可能意味着停机。
预测和检测是有状态的:下一个数据点只有在与近期历史对比时才有意义,异常也必须基于对正常状态的持续感知。Flink 管理这种状态,按时间序列进行键控处理并具备容错能力,使每个模型都能获得所需的历史数据,而无需单独的数据存储或每次调用都访问数据库。
这就是价值的叠加之处。Confluent 的数据流平台将业务数据置于运动状态,使其可用于机器学习。该平台持续流式传输、连接、治理和处理实时数据,捕获 IBM Granite 时间序列模型用于预测、异常检测、相似性搜索、分类、数据填补和优化的实时业务信号。Confluent 提供了快速、可靠且安全地实现流式用例所需的一切,使您能够专注于开发实时机器学习应用,而非管理数据基础设施。
Confluent Cloud 是 Confluent 数据流平台的云部署版本,提供原生推理功能,允许您直接在 Confluent 的 Apache Flink® 上运行 IBM Granite 时间序列模型,从而在统一数据和机器学习工作流的同时,为实时数据处理提供更高的灵活性、安全性和成本效率。优势包括:
- 数据所在之处的实时智能:在业务条件发生变化的瞬间,直接在流数据上运行预测和异常检测,无需将时间序列数据提取到单独的机器学习平台或数据仓库中。
- 零配置:Confluent 管理模型服务、基础设施、扩展和运行时操作,因此无需管理提供方凭证或在数据管道与模型之间进行连接。可直接通过 Flink SQL 调用 IBM Granite 时间序列模型,实现实时异常检测和预测。
- 新鲜且丰富的上下文:Confluent 持续捕获并处理数据,生成业务当前状态的最新视图,从传感器遥测数据和支付活动到应用程序指标,使模型能够基于当前实时数据而非过时的批量数据进行操作,从而做出更可靠、更准确的预测。推理结果写入 Kafka 主题,并通过扇出方式共享,可被告警系统、仪表板、湖仓和 AI 代理消费。
- 内置治理和可追溯性:推理管道遵循平台其他所有内容相同的模式、血缘关系和访问控制。Kafka 主题具有持久性和可重放性,支持审计、故障排除、模型评估以及针对历史数据的推理重运行。
- 成本效益:原生推理消除了对专用模型服务基础设施或 GPU 的预配和管理需求,且无需支付任何云数据进出费用。
- 安全性增强:推理过程中数据始终保留在 Confluent Cloud 内,且在整个平台中遵循 RBAC 和隐私政策。
- 快速实现价值:团队可通过熟悉的 SQL 语法,在几分钟内从流数据构建出可运行的预测和异常检测流水线,而无需搭建独立的 ML 堆栈或点对点数据管道。
通过连接运营和分析系统,Confluent 帮助团队将实时业务事件转化为可操作的洞察,将 IBM Granite 时间序列模型引入数据流。由于没有单一模型能同时服务于洗发水生产线、银行卡网络和零售目录,IBM 与 Confluent 提供的是模型组合而非单一模型。
与决策匹配的时间序列基础模型组合
每个决策都会向未来提出不同的问题。规划周期需要多种可能结果,交易台需要每个价位的最精确数值,十万级系列舰队需要保持成本理性,而安全团队则需要识别数据流何时停止正常行为以及上次发生类似情况时发生了什么。该组合包含四种互补的时间序列基础模型,均处于早期访问阶段,通过 Confluent 现有的 AI_FORECAST 和 AI_DETECT_ANOMALIES Flink SQL 函数调用。只需修改一个 SQL 参数即可切换模型,无需重新设计流水线。
整个项目只需一次调用:
SELECT
AI_FORECAST(
load_kw,
event_time,
JSON_OBJECT
(
'model'
VALUE
'ttm'
,
'horizon'
VALUE
12
)
)
OVER
(
ORDER
BY
event_time
RANGE
BETWEEN
UNBOUNDED PRECEDING
AND
CURRENT
ROW
)
AS
forecast
FROM
meter_readings;只需更改模型参数值,相同调用即可运行四种模型中的任意一种,无需单独构建或运营 ML 堆栈。
没有单一最佳模型,因此几个问题将引导选择。是单个序列还是数千个?单变量还是多变量?需要训练时间还是开箱即用?需要预测多远?是预测还是异常检测?PatchTST-FM 以类似语言模型读取文本的方式逐块读取序列,每个变量在独立通道中处理,避免单一噪声信号影响整体,返回完整分布,使计划者可根据第 90 百分位数设置补货点。FlowState 每个数据点都会更新运行摘要,由于其时间连续性动态,可同时读取秒级 SCADA 数据和小时级市场数据。TTM 在时间和变量维度上忽略微小混合网络的注意力,使百万参数模型可在 CPU 上每晚处理十万级序列。TSPulse 在单一小型多任务模型中结合时间与频率视角,用于异常检测、分类、数据填补以及每个操作员都会问的问题:我们以前见过这种情况吗?
“小型”是主动选择而非妥协:推理原生运行在 Confluent Cloud 内,或通过 Hugging Face Hub 的开源权重在您自己的 CPU 上运行,且无云数据进出费用使架构保持简洁并降低成本。IBM Granite 同时引入 IBM 的企业级 AI 治理框架,包含模型溯源、授权透明性,以及不断扩展的模型功能集,使每个使用场景开箱即用时更具价值。这正是组合与平台融合之处,模型不再只是历史的记录者,而是正在运行决策的优化者。
价值落点:预测、异常检测、优化与语义智能
这四个方面都在缩短事件发生到获知该事件的时间间隔。在数据流中,这一时间差从数天缩短到数秒,信号成为触发其他AI系统、代理和工作流的开关,这些系统会调查、筛选重要事项,并在需要人类决策时,基于已收集的上下文信息进行干预。这四个方面也以功能模块的形式进行封装,因此更多工作由平台承担,使用这些功能的团队需要处理的工作量则相应减少。
预测与规划
目前大多数预测仍停留在统计模型和直觉判断的层面,以决策的形式包装呈现。定制化机器学习并未真正弥合这一差距:每个时间序列都需要单独模型,人工重新拟合,且随着预测周期延长而逐渐失效,因此规划工作仅覆盖少数值得投入精力的时间序列,其余则依赖安全库存。
观察一家零售企业的需求计划员,其规划工作只触及商品目录的头部,而尾部商品则作为营运资金堆积在货架上。她将一个共享模型应用于整个目录:该模型能立即处理未见过的时间序列,纳入天气、促销等驱动因素,并返回概率分布而非单一预测值。无需为每个SKU单独构建模型,因此这个模型就像一个工厂:同一任务中可以处理两年期和三个月期的SKU,新上市商品可从相似SKU的历史数据中启动预测,每晚在CPU上处理10万个SKU,且这一模式可跨品类和区域通用。
概率分布将服务水平转化为可公开声明的政策。由于每个预测都对应特定主题,它成为触发器而非报告:补货流程由此启动,分配和定价系统读取相同数据,折扣促销在库存老化前实施,补货在货架空置前触发。成果体现在企业最关键的指标上:缺货和促销损失减少,顾客能顺利找到所需商品,货架收入得以保障,营运资金释放,通常这是商业案例中最大的支出项。
异常检测
异常检测是覆盖面最广的领域,任何一次漏检的异常通常都代价高昂:在欺诈场景中是客户的资金,在安全领域是数据泄露,在IT运营中是客户首先遭遇的服务中断,每种情况都会对品牌造成与资产负债表同样严重的冲击。在金融服务领域,基于规则的检测系统可被穷举,因此对手会针对性地规避规则,收紧规则会导致更多诚实客户流失,收入蒸发,客户半途离场。定制化机器学习需要稀缺且过时的标签数据,而误报带来的成本甚至超过犯罪本身。
设想零售银行的欺诈防控负责人:模型为每张卡维护正常行为模式,并通过AI_DETECT_ANOMALIES接口实时评估每笔交易。由于具备预测能力,它能在事件发生前预警异常趋势。一张两年内始终在三个邮编区域购买杂货的银行卡,在凌晨3点突然向海外钱包转账时,警报会在资金转移前触发,而同一客户在诚实度假期间的交易则能顺利通过。
保护从第一天开始,因为模型在其他地方学到的内容可以迁移到新产品、走廊和未标注案例的资产类型。它还必须持续进化,因为对手也在进化:欺诈模式和攻击特征每月都会变化,因此模型会根据银行自身的数据流进行定制,随着案例确认不断调整,持续改进而非每年重建。随着银行业和商业转向智能代理,代理以机器速度发起支付,正常操作的节奏和交易量不断上升,因此实时上下文和飞行中的评分变得尤为重要。每一次评分都推动下一步行动:阻止支付、将案例附上最相似的历史记录升级给分析师、或交由代理处理。
同样的技术适用于任何具有节奏的实体:IT延迟、基站KPI、以及从开箱到生产过程的温度曲线。
生产优化
每条生产线都基于自身的模型运行,但保持模型的准确性非常困难:统计模型会漂移,基于规则的控制只能维持设定值而无法优化,定制化的机器学习模型无法解释任何内容,因此优化仅停留在试点阶段,而生产线只能在边缘运行。
Andrés在一家洗发水工厂负责生产流程,该工厂的混合线将温度、搅拌速度、加料速率和粘度数据流式传输到Confluent。他将基础模型部署在数据流上,模型开箱即用:原本需要数月定制建模的工作缩短至数天,生产效率提升高达10倍,且仅在生产线有特殊需求时进行定制。基于他能控制的变量,预测结果转化为模拟器:在特定混合速度下的能耗、特定温度和加料速率下的吞吐量、粘度是否符合规格。一个优化器在该空间内搜索,根据他设定的KPI进行优化,遵守他的约束条件,并解释其推荐方案,因为无法验证的推荐方案他不会采纳。Andrés是流程工程师而非建模师,真正了解生产线的人才能掌控它。
优化不会在上线时冻结,而是随着输入变化持续重新优化:表面活性剂供应商更换、香精批次表现不同、需求从400毫升瓶装转向旅行装、本季度目标从节能转向产能提升。只需重新定义目标和约束条件,生产线就能基于最近的运行数据和修复方案,找到下一个最佳设定值。收益体现在CFO追踪的货币单位上:一个涉及数百亿美元运营的工厂,哪怕提升1个百分点,就能带来七位数的收益,而一家食品制造商正是从一个流程和400家工厂开始的。
生产优化锚定了更大的目标:接下来是质量预测和设备状态监测,随着人工智能进入制造、机器人和物理系统领域,这将是颠覆性大市场中的第一个应用。
语义智能
所有上述通道最终都指向同一个问题:我们以前见过这种情况吗?模型通过嵌入向量回答这个问题,这些紧凑的向量捕捉了时间与频率窗口的形状,因此无论规模或偏移如何,相似的事件都会在向量空间中靠近。在数据流中,每个窗口到达时立即被嵌入,并与历史事件及其结果进行匹配,因此返回的是先例而非评分:那些以类似方式偏离的运行记录及其修复方案、新SKU最相似的需求曲线、以及本次会话中与确认欺诈案例相似的记录。相同的嵌入向量驱动分类和缺失值填补,并索引代理在行动前检索的上下文信息。
时间序列技术的发展才刚刚开始。与语言模型类似,技术进步的速度正在加快:新的架构、新的数据源、基于模型构建的智能代理和用户体验,以及开箱即用的功能。IBM 和 Confluent 将继续以最初的方式进行创新,与设计合作伙伴及客户共同探索真实的企业应用场景,从而在所有业务环节中实现更高的效率、准确性和响应速度。
成为创新合作伙伴,立即在 Confluent 上使用时间序列模型
现在可通过 Confluent Cloud 的早期访问功能使用:无需模型训练、特征工程或 AI/ML 专业知识,即可直接在数据流上进行预测和异常检测。Confluent Cloud 是起点,随后 Confluent Platform 将支持本地和混合环境,因此相同模型和功能可无缝扩展至各类部署场景。关键在于反馈循环:您在自身数据流中发现的洞察将指导模型的下一步演进。
- 立即加入早期访问计划**,在自有环境中直接与 IBM 和 Confluent 团队合作,将预测和异常检测应用于您的数据流。您发现的洞察将直接影响后续功能开发,早期访问期间完全免费。
- 文档中心。Confluent Cloud 上 Apache Flink 的 AI_FORECAST 和 AI_DETECT_ANOMALIES 功能,以及由开发者团队提供的实时预测和异常检测模型使用指南。
更多作者文章
您的智能代理实际需要多少内存?
76
2026年8月18日
考虑使用 ACE?我们可以通过更少的 Token 实现
31
2026年8月11日
社区
编辑
预览
可通过拖拽、粘贴或点击此处上传图片、音频和视频
点击此处上传图片
评论
· 注册或登录以发表评论
- +11