Red Hat AI 3.5: Scaling and governing AI agents in production
TL;DR · AI 摘要
Red Hat AI 3.5提供验证模型、操作控制、数据到自主代理路径及可观测性工具,解决生产环境AI代理扩展与治理难题。
核心要点
- EvalHub工具支持对抗性输入测试,生成行业监管认证。
- AI Model Catalog提供预验证模型,减少部署风险。
- 混合云环境可观测性实现成本透明与性能监控。
结构提纲
按章节快速跳转。
- §引言
企业需解决AI代理在生产环境中的扩展与治理挑战。
AI Model Catalog提供预验证模型及安全评估结果。
EvalHub工具支持对抗性输入测试与认证生成。
提供从数据到自主代理的标准化部署流程。
混合云环境下的性能与成本透明监控方案。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Red Hat AI 3.5
- 信任
- AI Model Catalog
- Garak基准测试
- 控制
- EvalHub工具
- GPU资源管理
- 测量
- 混合云可观测性
- 成本透明化
金句 / Highlights
值得收藏与分享的关键句。
EvalHub支持prompt injection和jailbreaks风险测试,生成监管认证。
AI Model Catalog内置Garak基准测试结果,覆盖PII暴露与毒性分析。
混合云环境可观测性实现跨节点资源使用透明化。
Red Hat AI 3.5:在生产环境中扩展和治理AI代理
Component | Article_teaser
2026年9月9日
6分钟阅读
人工智能
Jennifer Vargas
Will McGrath
Carlos Condado
Younes Ben Brahim
Martin Isaksson
Subpattern | social_share_set
Component | social_share
分享
Subpattern | subscribe
Component | social_icon
订阅RSS
Component | Icon
© Red Hat, Inc. CC-BY-4.0授权
Subpattern | results_nav
组布局
Component | Nav_links
- 返回所有文章
Component | Generic
企业团队已超越早期实验阶段。试点项目取得成功,原型设计令人印象深刻,单个团队也已交付初步成果。平台工程和IT运维团队接下来面临的挑战更加复杂:必须以与关键任务AI基础设施相同的操作严谨性来运营AI。要超越孤立的开发沙盒,必须在扩展前回答四个问题:我们能信任它吗?我们能控制它吗?我们能在其基础上构建吗?我们能衡量它吗?Red Hat AI 3.5提供了回答所有四个问题的工具。
该版本在部署前提供可验证的安全证据,为共享AI基础设施提供操作控制,明确从数据到自主代理的路径,并在混合云环境中实现完整的性能和成本透明度。基于开放架构并可与现有基础设施集成,Red Hat AI 3.5帮助组织在数据所在任何位置,将AI作为可信的共享多租户服务进行运营。
我们能信任它吗?
部署前验证模型
当模型仅生成文本时,安全性是质量关注点。如今代理调用API、查询数据库并触发复杂工作流,安全性已成为操作风险。人工审查无法扩展。在受监管的行业中,认证可能需要数月时间,平台团队部署时需要的不仅是信任。Red Hat AI 3.5提供具体证据,让用户有信心做出部署决策。
由Red Hat专家团队在AI模型目录(一般可用GA)中交付经过验证和优化的模型,其安全工作已提前完成。模型安全性和安全性洞察通过Garak基准测试结果呈现,涵盖安全、个人身份信息(PII)暴露和毒性等维度,使团队能够在提交前比较模型在面对对抗性输入时的行为。模型还经过工具调用可靠性验证,并附带部署命令和配置文件,因此构建代理管道的团队可以从经过测试的基础线开始。
我们的模型和代理评估工具EvalHub(GA)将相同覆盖范围扩展到您自行引入或自定义的模型。团队可以针对提示注入和越狱等风险运行以安全为重点的基准测试,并生成行业监管机构要求的认证。结果可通过EvalHub的单一界面查看。
我们能控制它吗?
在共享GPU基础设施上的操作稳定性
专用硬件可以平稳运行试点项目,但生产工作负载通常共享基础设施。代理管道、批处理作业和延迟敏感请求最终会落在相同的加速器或节点上,争夺相同资源。共享基础设施在后台批处理作业导致面向客户的代理资源枯竭前始终具有成本效益。Red Hat AI 3.5为平台团队提供精确的控制手段,以强制实施优先级。
Red Hat AI 在已验证的企业平台能力基础上进一步扩展,为 AI 服务提供商和需要实现从硬件到软件完全隔离的 AI 用例提供原生多租户支持。对于共享单一集群的团队,Red Hat AI 3.5 通过仪表板中的新角色创建用户界面简化了细粒度访问控制——项目管理员可以直观地定义自定义基于角色的访问控制(RBAC)角色,通过引导式表单选择 API 组、资源和权限,并利用现成的模板。对于需要租户间更强隔离的组织,Red Hat AI 现在正式支持在 Red Hat OpenShift Virtualization 上运行托管控制平面,为每个租户分配专用控制平面,同时在共享虚拟化基础设施上整合 AI 工作负载。
多租户机制在团队间划分资源,但基于优先级的服务(GA)负责管理内部工作负载。资源准入控制、公平性策略和防止资源饥饿的保护机制确保关键实时代理满足严格的延迟目标,同时后台批处理任务按顺序等待执行。受控部署(GA)为模型更新带来同样的严谨性:金丝雀验证将少量实时流量路由到新版本进行并行对比,所有正在进行的请求在任何转换前完成,若更新效果不佳,回滚操作无需中断。
为防止长对话中上下文截断,vLLM 引入 CPU 卸载(GA)和非易失性内存表达(NVMe)存储卸载用于键值(KV)缓存,突破硬件内存限制。AI 代理的工具调用现在支持标准和分布式部署模式(GA),确保多步骤工作流无缝运行。
我们能否在此基础上构建?
桥接企业数据与受控 AI 代理之间的鸿沟
即使企业解决了数据量相关的问题,从数据仓库到功能性 AI 代理的路径上仍存在更多摩擦。将数据仓库连接到模型需要检索流水线、向量存储(如 pgvector)、训练运行和治理策略,这些通常分散在碎片化的工具中。Red Hat AI 3.5 通过允许您在数据已存在的位置直接部署和运行 AI 环境(无论是本地还是跨公共云,如 Amazon Web Services (AWS)、Microsoft Azure 和 Google Cloud Platform (GCP)),统一了这一工作流程,消除了将专有数据迁移到第三方 AI 服务的必要性。
我们的 AutoRAG 工具包(技术预览版(TP))用于自动化检索增强生成(RAG)评估和超参数调优,新增多语言处理、上下文检索、对话测试、可视化调试和 pgvector 支持。该工具包通过交互式测试沙盒,使团队能够直观调整并连接现有数据存储到 AI 应用。
这些生成式AI工具的补充,AutoML(TP)通过内置的开箱即用服务运行时,完整实现了从训练到生产的流程,使您无需单独的服务解决方案即可直接在平台上部署和提供预测模型。对于大规模数据准备,Kubeflow Spark Operator将分布式数据处理任务直接引入数据科学家的活跃工作环境,将大规模数据准备和模型服务整合到同一统一平台。
推理时扩展(GA)为模型提供预算高效的推理能力,无需昂贵的重新训练。它应用自适应一致性算法,一旦达成共识即刻停止计算处理。这可避免在简单问题上浪费昂贵的GPU计算资源,仅需2到4个样本即可解决简单查询,同时保留完整的处理预算用于复杂推理任务。
通过OGX交付的Responses API和内置RAG已达到GA状态,为构建企业代理应用提供基础接口。Responses API为开发者提供标准化、开源的多轮代理交互接口,使代理能够在链式推理步骤、工具调用和后续查询中保持上下文,而无需直接集成到客户端。内置RAG将这些代理直接连接到企业知识库,使响应基于您的数据而非仅训练数据。两者共同构成了代理模板、防护措施和评估流水线构建的API层。
AI Hub中提供的Agent模板(GA)和入门套件(我们的核心模型和开发者目录)将这些基础转化为可用代理。它们为代码审查、文档处理和研究工作流等常见模式提供预配置的参考实现,每个实现均可在保留安全策略的沙盒环境中运行,从首次提交起即保障安全性。
为管理这些工作流,NVIDIA NeMo Guardrails确保模型与用户的对话保持主题相关并符合企业规则。此外,技术预览版新增功能将保护扩展至网关层级,监控并验证每个代理对外部工具或API的调用是否符合企业安全策略。例如,如果代理被恶意提示诱导尝试破坏性数据库查询,网关级策略可在命令到达后端系统前将其阻止。
我们能衡量它吗?
原生可观测性与令牌回退
企业财务团队会跟踪传统基础设施的精确成本,但共享GPU集群历来是无法核算的盲区。同时,数据科学家和AI工程师在没有集群监控特权访问权限的情况下,缺乏对模型服务指标的可见性。Red Hat AI 3.5解决了这两个运营挑战。
一个集中式原生可观测性框架(GA)无需手动设置即可提供AI性能指标。新的可观测性仪表板标签(GA)提供对llm-d分布式推理集群的深度可见性,而基于角色的访问控制为非管理员用户提供项目级别的服务指标可见性。
Model-as-a-Service(MaaS)回退(TP)通过管理员和用户仪表板引入账单级令牌计量,提供精确的令牌使用归因和消耗指标,使平台团队能够根据业务部门应用自己的成本参数。
对于智能代理工作流程,可视化代理追踪与调试(TP)功能通过OpenTelemetry和MLflow,将多步骤执行流程转化为交互式调用树可视化,这是我们在生成式AI工作室中提供的交互式模型原型开发实践平台。
GPU即服务仪表板(GA)提供对GPU部署的实时可视化,包括GPU使用状态面板(GA)、硬件型号库存信息(GA),以及动态调度功能用于跟踪已分配与借用的GPU容量(GA),用统一的集成视图取代碎片化的命令行检查。
面向智能代理时代的企业运营成熟度
从实验性AI试点到企业级生产的跃迁,才是检验组织准备度的真正考验。这需要突破单模型的简单性,建立持续运行时治理、最优资源效率和清晰的运营可见性。
Red Hat AI 3.5在企业级基础架构中实现了这些关键的AI基础设施更新,该架构基于开源创新构建。其设计原则是主权可控、按需定制,适用于混合云环境。Red Hat为现实世界提供了真正落地的AI运营方案。
了解更多
- Red Hat AI 3.5现已发布
- 报名参加9月22日2026年举办的"What's new, What's next"专题研讨会
- 在Red Hat AI产品页面了解我们的产品信息
Block | Dynamic pattern deluxe promo
Component | Band_header
Resource
适应性企业:为何AI准备度即变革准备度
这本电子书由Red Hat首席运营官兼首席战略官Michael Ferris撰写,帮助IT领导者应对当前面临的AI技术变革与行业颠覆挑战。
Component | spacer
Component | Cta_multi_basic
Subpattern | simple_cta
Component | CTA
获取资源
Deluxe mbox
Component | Card_header
关于作者
Subpattern | speaker
Card layout
Component | Image_embed
Component | Person
Jennifer Vargas
首席产品营销经理
Subpattern | social_links
Jennifer Vargas是一位营销专家,此前有咨询和销售领域的工作经验,擅长解决那些看似无关但实际紧密关联的业务和技术难题。过去五年来,她一直在Red Hat担任产品营销经理,支持一系列云服务的发布。她的专业领域包括人工智能/机器学习、物联网、集成解决方案和移动解决方案。
查看该作者的更多作品
Will McGrath
资深首席产品营销经理
Will McGrath是Red Hat的资深首席产品营销经理,负责Red Hat OpenShift AI的市场战略制定、内容开发以及市场推广工作。他在IT行业拥有超过30年的丰富经验。在加入Red Hat之前,Will曾担任媒体和娱乐技术合作伙伴的战略联盟经理长达12年。
Carlos Condado
高级产品营销经理
Carlos Condado 是 Red Hat AI 的高级产品市场经理。他通过指导 MLOps 实践的采用和将 AI 模型集成到现有混合云基础设施中,帮助组织找到从人工智能实验到企业级部署的路径。作为 Red Hat AI 团队的一员,他跨工程、产品和市场推广职能开展工作,围绕 Red Hat 开放、灵活且一致的人工智能产品组合,帮助制定战略、信息传递和客户赋能方案。拥有涵盖数据分析、集成、网络安全和人工智能的多样化背景,Carlos 带来了跨职能视角来审视新兴技术。他热衷于技术创新,并帮助企业通过可扩展、生产就绪的人工智能解决方案释放数据价值,获得竞争优势。
Younes Ben Brahim
Younes Ben Brahim 是 Red Hat 的高级产品市场经理,专注于 Red Hat 人工智能平台产品的战略定位和市场采用。Younes 在 IT 行业拥有超过 15 年的经验,曾主导产品市场推广计划,管理高性能计算与人工智能产品生命周期,并提供咨询服务。在加入 Red Hat 之前,他曾与 NetApp、Dimension Data 和 Cisco Systems 等公司合作,为企业基础设施和软件项目提供技术解决方案和产品战略。
Martin Isaksson
GTM 负责人
我的创业精神促使我共同创立了一家人工智能初创公司。这段经历,加上我在 Red Hat 推动关键市场推广计划和建立战略合作伙伴关系的工作,塑造了我将复杂技术转化为有效市场策略的能力。我喜欢分享这些见解,无论是在美国加州大学伯克利分校和斯坦福大学演讲,还是与企业高管交流。我在人工智能研究方面的背景,包括与皇家理工学院和斯坦福大学的合作(研究成果于 2017 年在 SSDL 上发表),继续激发着我对创新的热情。
更多相关内容
动态模式
博客文章
Rafay 与 Red Hat 联合发布主权人工智能云即服务参考架构
Red Hat 赞助 OpenClaw 基金会,推动生产人工智能代理的开放未来
原始播客
Red Hat 如何为可扩展人工智能清除 IT 债务
使用 PyTorch 标准化人工智能堆栈
子模式 | card_flex
子模式 | text_basic
继续探索
- 什么是智能体人工智能? 文章
- 预测性人工智能与生成性人工智能 文章
- 构建生产就绪人工智能/机器学习环境的首要考虑因素 电子书
- 以 Ansible 方式实现生成性人工智能 视频
- 通过现代应用程序平台进行创新和转型 电子书
继续探索 mbox
子模式 | simple_text
按频道浏览
探索所有频道
模式 | raw_html
自动化
有关 IT 自动化的最新动态,涵盖技术、团队和环境
人工智能
有关平台的最新动态,让客户可以随时随地运行人工智能工作负载
开放混合云
探索我们如何通过混合云构建更加灵活的未来
安全
有关我们如何在各种环境和技术中降低风险的最新动态
边缘计算
有关简化边缘操作平台的最新动态
基础设施
有关全球领先的企业的最新动态 Linux 平台
应用程序
深入了解我们解决最复杂应用程序挑战的方案