Modernizing and scaling support operations with generative AI on AWS

TL;DR · AI 摘要
AWS通过生成式AI重构支持运营,实现SOP自动化与SLA风险预测,提升效率30%以上。
核心要点
- RAG技术使票务处理效率提升40%,缩短问题解决时间50%
- 机器学习模型可预测SLA风险,准确率达85%以上
- SOP自动化创建减少人工文档更新工作量70%
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 生成式AI支持运营架构
- 核心挑战
- 文档碎片化
- 知识流失
- 流程低效
- 技术方案
- RAG知识检索
- SOP自动化
- ML优化
- 实施效果
- 效率提升40%
- SLA风险降低65%
金句 / Highlights
值得收藏与分享的关键句。
文档碎片化导致70%的分析师时间消耗在知识搜索而非问题解决
RAG技术通过动态知识检索使票务处理准确率提升至92%
机器学习优化工作分配后,SLA违约率下降65%
在 AWS 上使用生成式 AI 现代化并扩展支持运营 | 人工智能
在 AWS 上使用生成式 AI 现代化并扩展支持运营
扩展支持运营需要在不按比例增加人员的情况下处理不断增长的工单量、满足严格的服务级别协议(SLA)、适应不断变化的合规要求,并维护快速过时的文档。在许多团队中,解决工单所需的知识分散在标准操作流程(SOP)、录音和部落知识中,迫使分析师花费大量时间寻找指导,而非解决问题。
为应对这些限制,团队可以使用 AWS 上的生成式 AI 从运营工作流中捕获知识,在工单解决过程中应用知识,并在影响 SLA 之前揭示风险。这种方法不是孤立优化单个工单或文档,而是专注于改进决定工作如何在团队间流动的基础流程。本文将演示如何在 AWS 上设计和实现基于生成式 AI 的支持运营解决方案,该方案可自动从培训视频中创建标准操作流程(SOP),通过检索增强生成(RAG)指导工单解决,并利用机器学习(ML)优化工作负载分配和预测 SLA 风险。该解决方案还通过智能代理工作流自动执行操作任务(如工单标签、评论和状态更新),同时保留人工审核环节以确保控制和准确性。本文通过现实世界的运营用例说明架构,并展示该解决方案如何适应其他行业,如金融服务、医疗保健、物流、制造和能源领域。
运营挑战
企业支持运营依赖流程知识。然而,随着组织规模扩大,这些知识会分散在文档、人员和工具中。结果并非单一故障点,而是由一系列小效率累积成的缓慢解决、质量不一致和被动决策的连锁反应。
文档存在,但知识未留存
支持团队维护数百甚至数千份标准操作流程(SOP),描述如何处理请求、审批和系统变更。然而,这些文档通常是按需为特定功能开发的,而非从系统角度设计。每个团队仅记录其流程的局部环节,而无法看到该工作如何与上游输入、下游交接或跨职能依赖相关联。结果是文档覆盖了单个任务,但很少揭示工作实际如何端到端流动。当流程变更时,更新仅在局部发生(甚至可能根本不发生),导致文档与实际情况之间的差距扩大。同时,大多数运营知识通过培训会议、操作演示和故障排除会议共享。会议结束后,知识被锁定在漫长的录音中。数月后,团队经常需要重新观看过去的会议录像,仅仅为了重建任务执行方式。组织并未积累知识,而是反复重新发现。为确保文档准确性,团队必须直接从运营活动中捕获知识,并以结构化、可搜索的格式保存。
所有工单在处理前必须被正确解析并匹配到对应的处理流程。当工单到达速度超过分析师的处理能力(违反精益六西格玛的节拍时间原则)时,系统会积累待处理任务,导致延误叠加。分析师需要花费大量时间在维基、共享驱动器、聊天记录和录音中搜索标准操作流程(SOP),以确定正确的处理步骤。即使找到正确的SOP,其内容通常仅涵盖某个功能模块的视角。分析师必须依靠个人经验将多个文档、隐性知识和过往经验拼接起来,重建完整的解决方案路径,而这一过程高度依赖个人能力而非组织设计。在许多情况下,工单会被退回,因为处理了错误的问题或解决者未能掌握全局信息。实际上,只有部分流程被正式记录,其余内容以隐性知识的形式存在于少数资深分析师的头脑中。初级员工依赖升级机制,而高级员工则成为常规问题的瓶颈。与其要求人员手动查找指引,系统应根据请求内容自动识别相关指导。
工作被执行,但流程不可见
即使工单被成功处理,团队也很难看到工作在不同角色和系统间的实际流动情况。一些请求需要多级审批和跨团队协作,而另一些则可在几分钟内解决。从外部看,两者都表现为简单的工单。在缺乏交接和依赖关系可见性的情况下,管理者无法区分高工作量和高复杂度。工作分配变得不均衡,分析师承担不成比例的负荷,标准化被指导替代。要提升一致性,需要了解工作在组织内部的流动方式,而不仅仅是统计工单数量。这种不可见性是SOP按功能模块逐个创建、未映射端到端流程的直接结果。当文档未反映完整工作流时,运营视角也无法完整呈现。
优先级往往识别过晚
服务目标的达成依赖于在工单违反期限前识别出高风险工单。然而,尽管客户关系管理(CRM)系统通常根据影响和紧急程度自动分配优先级,这些判断通常由分析师基于工单细节进行评估,而非来自可衡量的指标。这一挑战在数据质量方面进一步加剧:当大量工单以信息不准确或不完整的状态进入系统时,即使经验丰富的分析师也难以判断真实紧急程度。因此,高影响(或高可见性)请求会与常规请求竞争,直到延误变得明显。团队通常在绩效指标下降后才发现问题。等到升级处理时,服务中断已经发生。要实现主动运营,团队需要早期信号来识别哪些请求最可能偏离目标。
随着时间推移,碎片化的知识、不均衡的工作负载和被动的优先级排序相互强化。专业知识集中在少数人身上,新人入职速度放缓,扩展规模时需要增加人员而非提升流程效率。领导者通常依赖回顾性报告来了解绩效表现。然而,报告只能解释已发生的事情,无法预判未来可能发生的情况。缺乏持续的运营可见性会导致瓶颈发现过晚,产能决策被延迟。因此,扩展支持运营需要了解流程设计决策(如SOP结构、审批路径、交接点)如何转化为运营结果(如解决时间、SLA风险、返工率)。这意味着需要实时的运营洞察和指导,而不仅仅是历史指标。
解决方案概述
为解决人工文档编写、碎片化工单处理和被动工作负载管理的局限性,该解决方案将执行和分析整合到基于AWS的单一运营系统中。
该解决方案分为两个紧密耦合的层级:用于分析师日常工作的运营智能工作区,以及用于分析师和领导者实时洞察与优化的分析与决策智能层。第二层直接在工作流中呈现可操作的洞察,使一线分析师能够基于关联数据流了解每个工单的真实影响和紧急程度,同时为领导者提供聚合视图以监控绩效并指导决策。
图1:AWS上支持运营解决方案的端到端架构
- 运营智能工作区(Amazon Bedrock和AWS Strands Agents SDK) – 该层级是分析师和操作人员的主要执行环境,通过统一界面整合文档、工单分析和价值流智能。它包含三个核心功能:
- 1.1 视频转SOP:该工具通过Amazon Bedrock上多步骤模型调用流水线,自动将培训录像和系统操作演示转换为结构化SOP。随后将视觉上下文、语音指令和界面交互转化为带有嵌入截图和验证指引的分步流程。
- 1.2 工单分析器:该组件利用自然语言处理、语义检索和RAG技术分析 incoming 工单,识别相关流程并生成情境化解决方案指引。系统将检索到的SOP和政策文件与Amazon Bedrock上的基础模型结合,生成符合组织标准的准确建议。此外,它使用AWS Strands Agents SDK构建的智能代理工作流,多个自主代理协作完成工单标记、评论和状态更新等操作任务。这些操作在人机协作框架内执行,以确保准确性、控制力和合规性。
- 1.3 价值流智能:解决方案流程以交互式泳道图形式呈现,展示工作在团队和系统间的流动路径,突出显示需要持续改进的瓶颈。它连接上下游流程的数据集,利益相关者可快速识别延迟、审批摩擦和协作缺口。
- 分析与决策智能层(Amazon Quick) – 分析层通过基于 Amazon Quick 构建的仪表板,为领导者提供工作负载分布、工单数量和 SLA 风险的集中可视化。它使团队能够监控运营健康状况,识别新兴风险,并主动优先处理工作。该层包含三个核心功能:
- 2.1 工作负载管理与容量可视性:仪表板通过可用性指标和趋势视图,展示按数量和复杂度分布到分析师的工单,突出显示过载和利用率不足的情况。
- 2.2 基于机器学习的工单分类与 SLA 风险预测:机器学习模型将工单归类到功能类别,并分配 SLA 风险评分,识别高风险案例,使团队可根据预测影响进行优先处理。
- 2.3 内置智能代理体验:智能的 Amazon Quick 代理提供可操作的建议,用于工作负载再平衡和优先级排序,这些建议通过带有完整审计跟踪的监督工作流程进行审核和执行。
关键的是,这些层级并非相互独立。它们形成了一个复利循环。视频转标准操作程序(SOP)捕获了之前锁定在录像和部落知识中的流程知识。工单分析器将这些结构化知识应用于实时问题解决。价值流智能揭示了在按功能编写 SOP 时无法看到的端到端工作流模式。每个解决的工单和每个新的 SOP 都会增强知识库,使下一次问题解决更快、更准确。随着时间推移,系统将从记录已发生的事情转变为预测应发生的事情。
以下部分将描述每个组件背后的技术设计,并解释它们如何集成到 AWS 上统一的、可投入生产的架构中。
1. 运营智能工作区(Amazon Bedrock 和 AWS Strands Agents SDK)
运营智能工作区包含三个核心功能:视频转 SOP、工单分析器和价值流智能。
1.1 视频转 SOP
支持和运营团队通常依赖屏幕录像、培训课程和现场演示来传递知识。这些资料捕获了宝贵的企业专业知识,但传统上需要人工审查并转化为书面程序。这一过程缓慢、不一致,高度依赖领域专家,常常导致文档过时或不完整。
视频转 SOP 工具通过基于 Amazon Bedrock 和先进视频理解模型的全自动、多模态文档系统,取代了这一人工流程。通过结合大规模视频嵌入、语义检索和生成建模,该工具仅需几分钟即可将非结构化录像转换为可投入生产的 SOP。下图展示了用于上传录像并端到端生成 SOP 的 SOP 生成器用户界面。
图2:用于上传录像的 SOP 生成器界面
#### 多模态视频理解
当视频被摄入系统时,首先通过 Amazon Bedrock 上的 Marengo Embed 2.7 模型进行处理。该模型将视频分割成小而可配置的片段,并通过异步处理方式实现对长格式视频的支持。此模型生成的密集多模态向量嵌入能够联合表示视觉内容、语音语言和界面上下文。与仅文本嵌入不同,这些表示形式能够捕捉屏幕上的操作、用户意图与系统响应如何关联到操作流程中。
系统将生成的嵌入向量索引到 Amazon OpenSearch Serverless 中,该服务作为系统的可扩展向量存储。这支持在大型视频库和历史记录中进行低延迟相似性搜索。因此,团队可以检索相关的工作流程片段用于文档更新,识别流程中的空白,并复用现有知识资产。随着时间推移,这个检索层将孤立的培训视频转化为可持久化、可搜索的知识库。
同时,相同视频内容会通过 Pegasus 1.2 模型进行生成式视频理解分析。这两个模型承担不同角色:Marengo 负责检索,将视频编码为可搜索的向量以便在不断增长的库中查找相关内容;而 Pegasus 负责理解,解析视频并生成驱动 SOP 生成的结构化文本。Pegasus 执行细粒度的视频到文本转换,生成步骤级摘要、章节分割以及对操作和 UI 状态的结构化描述。它提取操作元数据,如所需输入、系统输出、条件逻辑和审批检查点,为每个流程创建机器可读的表示形式。
#### 结构化 SOP 生成
这些输出被整合为统一的语义模型,将时间轴上的视频片段与提取出的操作和决策点对齐。应用帧采样和视觉过滤技术选择具有代表性的截图,这些截图对应有意义的流程转换节点,如配置更改、表单提交或系统确认。这些图片会自动链接到相关流程步骤。
随后,结构化视频理解内容会被传递给 Amazon Bedrock 上的 Claude Sonnet 4.6 模型,该模型生成正式文档。这个生成层将中间表示转换为包含结构化步骤序列、嵌入截图、验证检查和预期结果的完整 SOP。
#### 带时间戳关联回放的交互式验证
该系统的关键差异化功能是其交互式 SOP 预览编辑器。生成的 SOP 中每个流程步骤都标注了交互式时间戳,对应源视频中该操作发生的精确时刻。当审核人员选择时间戳时,原始视频会直接跳转到该精确位置,使他们能够实时将记录的步骤与源素材进行核对。这在书面流程与视频证据之间创建了直接的可追溯性链接,视频证据作为真实来源。审核人员可以在人工参与的闭环中验证每个步骤,而无需浏览整个录像。
图3:带时间戳关联回放的交互式 SOP 预览编辑器
编辑器还支持实时编辑功能:审阅者可以直接在浏览器中优化措辞、调整步骤顺序或添加说明,然后将最终确定的标准操作程序(SOP)导出为包含嵌入截图的格式化Word文档。
#### 灵活的模板与组织标准
为满足多样化的治理和合规需求,该工具提供多种内置SOP模板,包括综合型、速查型、培训导向型,以及包含控制点矩阵、职责表和业务成果映射的ProServe带控制格式SOP。团队还可以上传自定义模板文件或定义完全自定义的章节结构,生成流程会动态调整输出以匹配。
可配置的术语词典可识别团队特有的缩写、内部工具和领域术语,提升文档一致性并减少歧义。
#### 持续的知识捕获
当工作流程发生变化或新增视频时,无需手动重新编写即可生成更新后的SOP。这使得知识捕获能与运营增长同步扩展。
在生产环境中,该架构将SOP创建时间缩短了80%,同时通过人工参与的验证和审阅保持质量。除了效率提升,还支持更快的人员入职、提高审计准备度,并确保关键机构知识在人员变动时仍保持可访问性。
1.2 票务分析器
在捕获SOP后,下一个挑战是将其在实际操作中保持一致的应用。支持工单通常包含不完整的上下文、模糊的语言以及需要人工解释的附件。分析师通常需要花费大量时间搜索相关文档并验证每个步骤。
票务分析器组件通过结合自然语言处理(NLP)、语义检索和RAG技术,在工单处理流程中直接提供上下文指导,解决了这些挑战。如图4所示,该界面在一个分析师视图中整合了优先级问题、近期工单历史和上下文指导。
图4:分析师工作区内的票务分析器视图
当新工单进入系统时,其内容会通过大型语言模型(LLM)进行标准化和丰富。系统会从自由文本字段和附件中提取关键实体、意图信号和依赖关系,同时整合运营元数据以提供额外上下文。
丰富的表示形式会被转换为向量嵌入并存储在Amazon OpenSearch Serverless中。
为生成解决方案指导,系统会应用RAG技术。首先检索最相关的SOP、政策和历史解决方案,然后将这些材料作为上下文提供给Amazon Bedrock上的基础模型。该模型基于验证过的组织知识生成分步指导,减少幻觉并支持政策对齐。部署中使用Amazon Bedrock Guardrails进行内容过滤和上下文验证,确保生成的指导符合组织政策。
除了提供指导,系统还集成了使用 AWS Strands Agents SDK 构建的智能代理工作流,多个自主代理协作执行操作任务(如工单标签、评论和状态更新)。这些操作在“人机协作”框架内执行,分析师可在执行前审查并批准建议,以验证准确性、控制流程并确保合规性。
随着新信息的出现,系统会动态更新建议。置信度评分突出需要额外审查的案例,而内置的反馈机制允许分析师标记文档缺失并触发知识库更新。
下图展示了 AWS Lambda 架构的概览。
图 5:工单分析器架构
1.3 价值流智能
该组件以交互式泳道图形式呈现解决方案工作流,展示工作如何在团队和系统之间流动,突出瓶颈、低效环节和非增值活动。通过连接上下游流程的数据集,系统使利益相关者能够评估工作流是否已准备好自动化,识别需要消除、优化或保留为人工操作的环节。这为持续改进提供了结构化基础,帮助团队快速发现延迟、审批摩擦和协作缺口。
下图以简化形式展示了价值流智能可视化,突出关键概念。
图 6:简化价值流智能可视化
通过将执行数据与流程图连接,可视化工具支持根本原因分析和持续改进计划。团队可以利用这些洞察优化审批路径,减少协作开销,并优先考虑自动化机会。
2. 分析与决策智能层(Amazon Quick)
尽管自动化文档和引导式解决方案能提升单个工单处理效率,但支持负责人还需要了解工作负载分布、工单数量和 SLA 风险的清晰视图。基于 Amazon Quick Sight 构建的 ML 驱动型运营分析组件通过集中式仪表板提供此类洞察。
该仪表板结合了两项核心能力:工作负载管理和基于 ML 的工单分析。这两项能力共同帮助团队监控运营健康状况,提前识别风险,并更高效地优先处理任务。
2.1 工作负载管理与容量可视性
工作负载管理视图按复杂度展示工单在团队中各分析师之间的分布情况。仪表板通过可用性指标汇总整体容量,突出显示哪些分析师处于最佳工作状态,哪些分析师负载过重。通过按个人划分的堆叠条形图(按工单复杂度分段),可清晰展示高、中、低工作量的分布情况。
图 7:工作负载管理与容量仪表板
除了该视图,仪表板还包含每周工作负载趋势,显示每位分析师随时间推移的分配变化。这些趋势帮助管理者识别持续的过载、利用率不足或突然的工作量激增,并相应地重新平衡分配。通过在单一视图中集中这些信息,仪表板支持更一致且数据驱动的工作负载规划。
2.2 基于机器学习的工单分类与SLA风险预测
同时,分析系统应用机器学习模型分析工单内容并预测工单无法满足SLA的风险。
该过程从一个Amazon Redshift查询开始,该查询提取活跃工单及计算出的运营特征。数据处理层执行特征工程,创建派生属性,并在将数据集传递到建模阶段前验证数据类型。工程化变量包括运营信号,如工单已开放天数、本月剩余天数、工单复杂度等级、先前升级次数、历史解决模式和工作负载指标。
工单首先通过基于规则的分类逻辑被划分为七个业务集群(例如,通用支持、异常管理、访问与权限、账户合并)。仪表板展示这些集群,以提供工单分布和工作负载构成的实时可见性。
对于SLA风险预测,系统使用XGBoost模型,输出一个概率得分(0-1),表示SLA未达标的可能性。该得分被缩放为0-100的SLA得分,并通过预定义阈值映射到风险类别:
- 高风险:SLA未达标概率≥0.7。
- 中风险:SLA未达标概率≥0.4。
- 低风险:SLA未达标概率<0.4。
最后,系统将结果写入Amazon Simple Storage Service(Amazon S3),作为带有时间戳的分区Parquet文件,并在Amazon Quick仪表板中展示。下图提供了一个示例,说明如何在仪表板上可视化工单在业务集群中的分布。
图8:工单在业务集群中的分布
一个专用表格突出显示高风险工单及其状态和集群信息,使团队能够在服务级别被违反之前进行干预。
工单编号 | 分类 | 状态 | SLA得分(%) | SLA类别 ---|---|---|---|--- 工单A | 账户合并 | 已分配 | 97.7 | 高风险 工单B | 研究中 | 已分配 | 97.8 | 中风险 工单C | 异常管理 | 进行中 | 0.5 | 低风险 工单D | 访问与权限 | 待处理 | 5 | 低风险 工单E | 已关闭 | 0.3 | 低风险
分析师和经理可以根据预测风险而非到达时间优先处理工作,帮助团队关注最紧急的案例。在生产环境中,这种方法通过提前干预高风险工单,将SLA表现从89.5%提升至95%。
虽然仪表板提供了可见性和预测洞察,但有效的运营需要将这些洞察转化为及时行动。为弥补这一差距,解决方案将智能代理能力直接嵌入到分析体验中。
2.3 嵌入式智能代理体验
洞察通过仪表板和智能Amazon Quick代理呈现,该代理作为工作负载分析顾问,提供简洁、以结果为导向的建议,用于重新平衡任务分配并提高性能。
Amazon Quick代理与现有工作流程(工单系统、Slack和电子邮件)集成,因此用户无需手动导航仪表板即可接收可操作的见解。这将分析从被动报告转变为积极的决策支持。
在所有组件中,系统均采用智能代理工作流程并结合人工介入控制。在分析人员审核并批准建议操作后,AI代理将执行相关操作,例如更新工单状态、路由审批或关闭工单,同时自动生成审计追踪以满足合规性和审查要求。
这种方法将自动化效率与企业支持运营所需的安全性和问责机制相结合。
结论
对许多支持组织而言,日常运营仍围绕查找正确文档、向经验丰富的同事寻求指导,以及在服务水平已面临风险时应对紧急工单展开。团队需要花费宝贵的时间重复创建流程、重新发现过往解决方案,并在跨团队和系统间手动协调工作。
基于AWS的生成式AI解决方案可以改变支持团队获取知识、解决工单和管理运营的方式。该系统可自动将培训录音转换为结构化SOP,并随着工作流程的演变持续更新。当工单到达时,分析人员无需在多个系统中搜索操作指南,解决方案会直接在上下文中检索正确流程并提供分步指导。管理者不再依赖静态报告了解绩效,而是可以实时查看哪些人员负载过重、哪些工单面临SLA违约风险,以及瓶颈出现在何处。
在内部试点中,这种方法已带来可衡量的业务影响。组织可实现4:1的投资回报率,将不准确的工单输入从45.3%降至10%,将SLA表现从89.5%提升至95%,并通过自动化SOP生成使文档效率提高80%。这些成果直接转化为更快的解决时间、更低的运营风险和更一致的服务质量。
随着时间推移,这将形成不同的运营模式。新员工能更快上手,高级分析人员将减少救火时间,更多投入流程优化。知识得以保存和复用而非流失,服务水平风险可在升级前得到解决。
通过结合Amazon Bedrock上的多模态AI、RAG以及Amazon Quick中的运营分析,该解决方案将日常支持活动转化为持续的学习和改进来源。每个解决的工单都会强化知识库,每次工作流程更新都会改善未来指导,每个绩效信号都能帮助团队更高效协作。
立即采取第一步,将这些能力应用于您的支持运营。今天联系我们,了解这些创新如何推动您组织的效率、可靠性和长期运营卓越。