AWS Machine Learning Blog

Scaling medical content review at Flo Health with Amazon Bedrock – Part 2

6.9内容质量
Scaling medical content review at Flo Health with Amazon Bedrock – Part 2

TL;DR · AI 摘要

Scaling medical content review at Flo Health with Amazon Bedrock – Part 2 Artificial Intelligence Scaling medical conten...

核心要点

  • 主题聚焦:Scaling medical content review at Flo Health wit
  • 来源:AWS Machine Learning Blog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#后端#安全#产品
打开原文

使用 Amazon Bedrock 扩展 Flo Health 医学内容审核 – 第 2 部分 | 人工智能

使用 Amazon Bedrock 扩展 Flo Health 医学内容审核 – 第 2 部分

本文由 Flo Health 的 Konstantin Lekh、Sasha Zinchuk 和 Eugene Sergueev,以及 AWS 的 Liza (Elizaveta) Zinovyeva 共同撰写。

在本文中,我们将分享 Flo Health 工程团队如何将 AWS 生成式 AI 创新中心的概念验证(PoC)转化为基于 Amazon Bedrock 的生产级 AI 驱动医学内容审核与生成系统。该系统使审核时间减少 60%,在不扩大医学团队规模的情况下将内容处理量提升三倍。我们将重点介绍四个领域:(1)将 PoC 架构适配至 Flo Health 内容流水线,(2)为不同审核维度实现专用 AI 审核员,(3)构建基于检索增强生成(RAG)的 AI 内容生成系统,以及(4)提示工程与生产部署的经验教训。本系列第一部分介绍了初始概念验证。

本文反映 Flo Health 工程团队的视角。

在 Flo Health,我们创建多样化的内容来支持数百万用户在健康旅程中的需求:从应用内故事和文章到引导流程和营销材料。每一份内容,无论是文本还是视觉内容,都必须符合我们在指南中规定的严格医学准确性标准。虽然我们已成功将 AI 工具整合到编辑和设计师的内容创作流程中以提高效率,但医学审核仍是我们面临的关键瓶颈。

内容创作挑战

我们的医学专家平均需要花费 7 个工作日审核一篇文章,细致核实事实、核对可信来源的参考文献,并确保符合我们 10 项医学准确性检查清单。虽然这一严谨流程对维护信任和安全至关重要,但限制了我们扩展内容生产能力并满足用户需求的能力。

挑战不仅限于时间限制。扩展医学审核团队面临独特困难:具备内容创作能力的合格医学专业人士稀缺,招聘过程耗时且困难,而扩大此类专业团队的成本也非常高昂。传统的通过增加审核人员来扩展团队的模式既不可持续,也不具经济可行性。相反,我们需要找到方法,通过提高现有医学专家的时间效率和扩展其专业知识的可扩展性来放大他们的影响。

尽管通用 AI 工具表现出令人印象深刻的性能,但它们在医学内容审核中存在显著风险。这些系统可能会生成没有依据的参考文献或事实的信息,通常称为“幻觉”。在 Flo,数百万用户依赖我们的教育内容来更好地了解自己的身体和健康,因此准确性和信任度至关重要。我们需要一个专门设计的解决方案,仅从可靠的医学来源提供信息,并对每条信息都提供明确的参考来源。

AWS 概念验证作为起点

概念验证的成功为我们提供了将医学内容审核方式转型的激动人心的机会。我们采用渐进式采用策略,在扩展医学专家能力的同时,通过持续验证建立信任。

我们的生产实现采用三层验证方法。首先,系统会根据内部医学指南对内容进行检查,根据既定规则标记潜在问题并提出修改建议。随后,系统将内容与可信的外部医学资源进行验证,包括基于证据的临床决策工具、同行评审期刊和监管机构。最后,我们的医学专家通过一个优化的界面审核AI标注的内容,该界面会突出显示所应用的规则,并提供相关来源的直接链接,从而简化事实核查流程。

我们的主要成功指标集中在两个方面:减少审核时间,以及降低专家需要修改的次数。

AI审核系统

在本节中,我们将探讨如何将概念验证(PoC)解决方案组件进行集成、转换或扩展,构建一个可扩展的生产就绪系统,以提升医学审核能力。

AI审核工具缩短了内容创作者与医学审核人员之间的反馈循环。使用AI审核后,质量更高的内容能够进入人工审核阶段,所需迭代次数也随之减少。

我们首先根据概念验证阶段确定的MACROS架构,针对Flo的内容模型进行了定制。

在Flo,我们创建了一组AI法官,每个法官都有自己的提示语,并配有用于训练和测试的示例集。每个法官专注于特定的审核维度:医学准确性、法律合规性、品牌风格等。

我们使用不同模型对每个法官进行测试,并根据所需的质量阈值、风险等级、延迟时间和运营成本选择最合适的模型。对于医学安全或其他高风险检查,准确性和可靠性优先。对于较简单或低风险的检查,如果轻量级模型能满足性能阈值要求,也可以使用。这种方法使我们能够通过增加更多示例、定制提示语和提高准确性来独立优化每个法官,而不会影响其他法官,从而避免回归问题。

Flo Health的内容处理流程采用了亚马逊提出的MACROS模式,并将其适配到Flo的Contentful CMS实际生产环境中。所提出的MACROS策略将文本拆分为可管理的部分,与我们现有的架构高度契合,因为我们的图表(调查和聊天)已以预分块格式存储,因此每个步骤都是独立的内容条目。

在提交审核前,我们将每个步骤拆分为更小的部分,例如按钮文本、标题、描述等。

每一块内容都会经历一系列AI法官的评估,而非使用单一的提示语。这意味着Flo为每个审核维度(医学准确性、法律合规性、品牌风格等)运行专门的大型语言模型(LLM)提示语。这样,我们能为每一块内容获得详细的评论。

在获得法官的回复后,我们将其作为输入,按照MACROS流程进行进一步的生成式AI修订。通过使用Amazon Bedrock,我们生成针对发现的问题提出改进文本的建议。这些建议直接在Contentful应用用户界面中呈现,修改部分会高亮显示,使内容编辑人员和医学专家能够在熟悉的流程中查看、选择或编辑首选版本(甚至保留原始版本)。

在使用AI作为专家助手时,人工审核人员仍保持控制权。对于每条内容做出决策后,应用会将最终内容更新到Contentful中的内容条目中。

Pipeline

下图展示了所有 AI 审核阶段如何连接成一个流程。每一步的结果会在准备就绪时加载,因此用户不会遇到延迟。

AI 内容生成系统

在成功将 Amazon Bedrock 作为 AI 内容审核工作流的基础后,我们希望复用相同的服务来加速内容创作。

我们需要一个 AI 生成工具来自动化常规操作并减少认知负担:用户可以快速起草请求,而无需从头开始手动创建图表。

思维链提示

生成管道采用多阶段的思维链提示方法:

一个关键优化是针对不同任务使用 Amazon Bedrock AI 模型中不同版本的 Claude(由 Anthropic 提供)。例如,对于轻量级分类和常规分析(例如确定用户希望生成的步骤数量),我们使用更快且成本更低的 Claude Haiku 模型。

对于高保真内容生成或复杂推理(例如起草细致的医学解释或以特定共情语气重写段落),我们会调用功能更强大的 Claude Sonnet 模型。

检索增强生成

在女性健康等需要整合大量模型外部上下文的领域构建生成式 AI 工具时,我们通过 RAG 技术解决了这一挑战。实际操作中,当我们使用 LLM 进行推理时,仅从知识库中提取相关信息并将其输入模型上下文。例如,在起草内容时,系统会检索相关指南、规则、医学知识以及现有模板或视觉素材参考。这些知识库材料通过产品、编辑和医学审核团队的迭代流程开发和维护,其中医学团队负责安全范围的管理。

我们还整合了可信的第三方医学资源,例如基于证据的临床决策工具、同行评审期刊和监管机构出版物。系统会将每段生成内容所使用的来源列表一并保存,这样医学审核人员可以直接验证引用内容,而无需手动搜索。

用户体验

我们专注于清晰地向用户展示并解释 AI 生成的每个阶段,使他们能够尽早发现不一致之处。我们还通过逐步显示每个阶段完成的中间结果来减少空闲等待时间,使用户能够在管道完成前开始查看输出内容。最后,我们致力于可视化所有设计元素和内容片段(屏幕)之间的连接关系,减少用户反复在手机上导出和测试内容的需求。以下动画演示了 AI 生成的用户体验。

架构

下图展示了我们的 AI 内容生成架构。

内容创作者从熟悉的 Contentful App 环境发起生成请求。系统随后协调一系列步骤,以最小的人工操作生成基于医学依据且符合指南的内容。

请求通过 Amazon API Gateway 路由,该网关与 UI 保持实时通信,因此创作者可以立即看到进度。

核心管道包含三个步骤:

  • 首先,系统通过Amazon Bedrock进行语义搜索,从Amazon Simple Storage Service (Amazon S3)中的知识库中检索相关的医学指南、规则和上下文信息。这样生成的内容就能基于医学知识。
  • 接下来,系统通过Amazon Bedrock调用Anthropic的Claude基础模型对内容进行结构化处理,从Amazon S3中的模板和资源库中提取内容,以保持格式一致性并生成逐步内容流程。AWS Lambda函数负责协调这一工作流。
  • 最后,验证步骤通过Amazon Bedrock检查生成内容的医学准确性和品牌指南合规性。如果发现问题,反馈循环会自动触发重新处理,确保内容创作者仅接收到经过验证的输出。

我们的知识库、医学参考文档、内容模板和视觉素材均存储在Amazon S3中,Amazon DynamoDB负责管理整个流程中的状态和元数据。AWS Step Functions协调端到端工作流,模块化设计使我们能够随着新内容类型或验证需求的出现进行扩展。

影响、见解与经验教训

开发这些生成式AI工具为我们的团队提供了关于提示工程实际应用的宝贵见解。

YAML vs. JSON

我们发现YAML作为输出格式比JSON更加稳健。其基于缩进的结构更具容错性,导致无效输出更少且调试更容易。自我们首次实现以来,Amazon Bedrock引入了结构化输出功能,该功能在API层面直接强制执行符合模式的JSON响应,可能成为面临类似格式一致性挑战的团队的可行替代方案。

示例 vs. 规则

随着项目规模扩大,规则集变得庞大且有时相互冲突,使模型更难正确优先处理。通过用具体示例丰富规则,向模型展示我们实际想表达的内容,而非仅仅说明需要避免的内容,显著减少了错误。少量示例持续提升了输出的遵循度。

AI作为智能助手,而非替代者

我们的生产策略聚焦于增强而非取代人类专业知识,贯穿三个关键工作流程阶段:

  1. 智能预筛选 – AI标记需要验证的潜在医学声明,识别需要专家关注的章节,并针对我们的医学指南进行初步合规性检查。这使专家的起点从空白页面转变为带有明确关注区域的预注释文档。
  1. 实时内容辅助 – 作者在撰写过程中可立即获得关于医学准确性、风格合规性和引用要求的反馈,在内容进入医学专家审核前即可发现问题。
  1. 增强的专家审核体验 – 医学专家收到带有突出显示问题、建议修改和相关预研究资料的AI注释内容,使其能够专注于验证AI见解和需要人类判断的复杂医学细节。

结构化反馈循环的力量

通过将专家的每次修正转化为可复用的规则和示例,而非一次性修改,我们构建了一个随着每次审核周期不断变聪明的系统。该系统使重复错误减少了70%以上,常规合规性修正减少了80%,每条内容的平均审核时间缩短了60%。在不扩大医疗团队规模的前提下,内容处理量提升了三倍。

具体性优于泛化

围绕我们的医疗指南、来源层级和内容标准进行针对性构建,同时通过合成案例与真实匿名案例组合的预定义测试集对每位审核员进行评估,实现了首次审核准确率的持续提升,并减少了对AI输出进行完整重新验证的需求。

未来方向

随着系统能力的扩展,我们正在探索基于合规历史、指南优先级和复杂度的置信度评分体系,该体系由医疗专家共同定义。评分高于特定阈值的内容将获得加速审核,而高风险内容则会接受更严格的审查。我们也在研究将该方法扩展到视觉内容,确保信息图、插图和其他视觉材料达到同等严格的标准。

对于考虑实施类似系统的组织,我们建议:

  • 从明确且文档化的标准开始。
  • 从第一天起就设计持续学习机制。
  • 同时衡量效率和质量。
  • 投资用户体验。
  • 规划逐步推广,因为信任需要通过实际成功案例建立。

在Flo Health,这种方法使我们能够在扩大内容生产能力的同时保持高标准。

Flo Health工程团队的视角到此结束。

结论

在本文中,我们展示了Flo Health工程团队如何将MACROS概念验证转化为基于Amazon Bedrock的生产就绪医学内容审核和生成系统。

成功的关键并非完全自动化,而是通过结合专业AI审核员、结构化反馈循环和分级模型选择策略,在保持严格医学准确性标准的同时提高内容处理量。

如果您计划构建类似的内容审核或生成系统,请首先定义您的领域特定质量标准,然后使用Amazon Bedrock根据这些标准构建专业AI审核员原型。

  • 了解更多关于AWS生成式AI创新中心的信息,并联系您的AWS账户经理获取专家指导和支持。
  • 访问Amazon Bedrock文档,探索可用的基础模型、结构化输出和防护措施。
  • 了解Amazon Bedrock AgentCore,用于编排多步骤代理工作流以实现内容审核和生成流水线。
  • 学习如何使用Amazon Bedrock知识库构建RAG应用。
  • 探索本文架构中使用的AWS服务:AWS Lambda、Amazon API Gateway、AWS Step Functions、Amazon S3和Amazon DynamoDB。
  • 阅读本系列的第一部分,了解完整的概念验证架构和结果。
  • 如果您有任何问题或想分享您的经验,请留下评论。

作者简介

'\"