AWS Machine Learning Blog

How Guardoc transforms medical document processing with Amazon Nova models

8.5内容质量
How Guardoc transforms medical document processing with Amazon Nova models

TL;DR · AI 摘要

Guardoc Health通过Amazon Nova模型实现医疗文档处理效率提升,减少46%错误率并节省400万美元年ROI。

核心要点

  • Amazon Nova模型使文档错误率降低46%,审计罚款减少70%。
  • 单个设施年ROI超400万美元,处理速度提升显著。
  • 医疗文档处理需应对多格式、高精度和大规模挑战。

结构提纲

按章节快速跳转。

  1. 分析医疗文档碎片化、错误率高导致的临床风险与合规问题。

  2. 需解决特殊病症检测、PDF复选框解析和多格式信息提取三大技术瓶颈。

  3. Amazon Nova方案

    基于Amazon Bedrock部署Nova模型,实现自动化文档处理与错误率控制。

  4. 单设施年节省400万美元,错误率下降46%,审计罚款减少70%。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 医疗文档AI处理方案
    • 挑战
      • 多格式处理
      • 高精度需求
      • 大规模处理
    • 解决方案
      • Amazon Nova模型
      • Amazon Bedrock部署
    • 成果
      • 46%错误率降低
      • 70%罚款减少

金句 / Highlights

值得收藏与分享的关键句。

#Amazon Nova#医疗AI#AWS#文档处理
打开原文

Guardoc如何借助Amazon Nova模型变革医疗文档处理 | 人工智能

Guardoc如何借助Amazon Nova模型变革医疗文档处理

每天,护士和护理团队都基于临床文档做出关键决策,而这些文档往往碎片化、不一致且容易出错。不完整或不准确的记录会增加认知负担,引入临床风险,并在本已苛刻的环境中带来合规挑战。医疗文档必须同时服务于患者结果和监管标准,但往往在两个方面都存在不足。

Guardoc Health的使命是通过促进准确、完整且符合合规要求的临床文档,释放医疗数据的全部价值,从而赋予护士和护理团队提供更安全、更高质量护理的能力。在本文中,我们将探讨Guardoc Health如何利用通过Amazon Bedrock提供的Amazon Nova模型家族,变革长期护理中的临床文档处理。

借助Amazon Nova模型,Guardoc Health帮助专业护理机构和辅助生活中心比人工审查更快、更准确地提取、分类并处理复杂文档。这种方法帮助医疗组织每年减少在美国各地数十亿美元的人工文档处理成本。Guardoc报告称,单个设施的文档错误减少了46%,审计罚款减少了70%,年度投资回报率(ROI)超过40万美元。

医疗文档并不遵循规则

医疗记录以各种可能的格式出现。在一天内,医疗机构可能需要处理:

  • 包含手写医生注释和打印文本的多页PDF。
  • 事先授权表格,其中复选框状态决定覆盖决策。事先授权表格是医生或药剂师填写的文件,以便健康保险计划批准某些医疗服务、程序或药物。
  • 嵌入在表格、自由文本或扫描图像中的药物清单。
  • 结合打字字段、手写和橡胶印章的患者入院表格。

根据发表在《BMJ Quality and Safety》1上的研究,门诊护理中诊断错误每年影响约1200万美国成年人,信息处理失败被确定为促成因素之一。Guardoc Health正是为了解决这一问题而构建的。对于Guardoc Health来说,挑战在于规模与精准度的结合。在高峰期,他们每天处理超过100万份文档。在这样的数量级下,即使条件检测的错误率仅为1%,每天也会产生数千份错误记录,每一份都可能成为患者安全风险或合规责任。

实现这一目标需要解决临床文档处理中最具挑战性的三个问题:从患者记录中以高召回率检测特殊医疗状况,可靠地解释数十种表格类型的PDF复选框,以及准确提取混合格式文档中的信息(在同一页面内混合不同格式)。

解决方案:Amazon Bedrock上的Amazon Nova模型

Guardoc Health在其处理流程中构建了Amazon Nova模型家族和Amazon Bedrock,结合多个AWS服务来处理文档处理的每个阶段。以下部分描述了每个部分的工作原理。

基于RAG的医疗状况分类

Guardoc Health 使用检索增强生成(RAG)技术从患者记录中识别医疗状况。RAG 是一种技术,模型首先从外部来源检索相关信息,然后利用该上下文生成更准确的响应。在该流程中,Guardoc 直接从患者自身的文档中检索证据,并通过推理生成最终分类结果。

图 1 — Guardoc 检索增强生成流程

如上图所示,该流程按以下顺序执行:

  • 入站患者文档通过 Amazon Textract(亚马逊Textract)处理,该服务从每页中提取文本和结构元数据。这是流程的第一阶段,可实现每页成本低廉的全面提取。Amazon Textract 是 AWS 机器学习(ML)服务,可自动从扫描文档和 PDF 中提取文本、手写内容、表格、表单和布局信息。它通过识别结构超越基础光学字符识别(OCR),使输出可用于下游应用和文档工作流程。
  • 提取的内容根据文档类型划分边界,将文档分割为对应有意义临床单元的块,而非任意字节范围。这些块是文档中与有意义临床边界对齐的较小片段,如药品清单、诊断部分或医生笔记,而非按字符数或字节大小随意分割。这确保在搜索相关信息时,系统能检索完整的、连贯的临床单元,而非缺乏准确分类所需上下文的碎片。
  • 每个块使用 Amazon Titan Text Embeddings V2(亚马逊 Titan 文本嵌入 V2)进行嵌入,并存储在 Amazon DynamoDB(亚马逊DynamoDB)中,按患者划分分区,确保检索时不跨越患者边界。
  • 在检索开始前,自定义预过滤器通过评估文档类型、近期性和患者上下文信号缩小候选集。此步骤在流程早期移除无关文档,减少需要搜索的内容体积,降低检索整体成本。
  • 在预过滤后的集合中,通过内存中的 k 最近邻(k-NN)搜索检索与疾病分类查询最相关的块。k-NN 是一种通过测量向量表示之间的距离来识别最相似项的技术,返回与查询最接近的匹配项。由于检索按患者划分范围,系统可通过水平扩展处理患者数量增长,而无需依赖共享向量索引。此阶段仅返回页面引用,保持数据传输轻量,为后续更复杂的多模态步骤做准备。
  • 上一阶段识别的页面通过 Amazon Nova 2 Lite(亚马逊 Nova 2 Lite)处理,这是一个轻量且成本高效的模型,通过基于文本的审查移除明显不匹配项,然后再进入更计算密集的多模态步骤。Amazon Nova 2 Lite 是 Amazon Nova 系列中的一种低成本多模态基础模型(FM),专为快速、经济地处理文本、图像和视频输入而设计。
  • 经过所有先前阶段的页面与原始 PDF 字节一并传递至 Amazon Nova Pro(亚马逊 Nova Pro)。Nova 模型通过推理布局、手写内容、签名、印章和其他视觉上下文生成最终分类,且每个输出均可追溯至其来源页面。

该流程遵循有意识的成本分层原则。每个阶段都使用能够完成任务的最经济组件。Amazon Titan Text Embeddings 和 Amazon Nova 2 Lite 处理高吞吐量的轻量级任务,如嵌入、索引和粗略过滤,而 Amazon Nova Pro 专门用于需要对原始 PDF 字节进行多模态推理的最终阶段。

管道生成的每个分类都可以追溯到原始文档中的特定源页面。在临床环境中,由于决策直接影响患者安全,Guardoc Health 将这种级别的可追溯性视为不可妥协的要求。

Guardoc 运营多个文档处理管道,每个管道都针对特定的临床挑战进行了专门设计,覆盖提取、分类和搜索等场景,如以下章节所述。

使用 Amazon Nova 系列模型进行 PDF 处理

大多数医疗文档原生以 PDF 格式存在,无论是扫描件、照片还是数字原生文件,准确处理这些文档需要能够视觉读取页面的模型,而非仅处理纯文本。在评估中,Amazon Nova Pro 在多模态 PDF 处理方面表现出显著改进,包括布局解释、表单结构、复选框状态、签名、手写注释以及页面上字段之间的空间关系。

这种改进使 Amazon Nova Pro 成为 Guardoc 管道中核心多模态组件的可行选择。条件分类、手写解读和药物提取都依赖于按实际存在的页面进行读取,保留注释、修改和布局提示。这种能力适用于包括复选框、手写内容、多列药物清单、盖章认证和划线编辑在内的各种文档类型,所有内容均作为视觉文档而非文本流进行处理,这使得整个多模态技术栈的实现成为可能。

手写识别

现实中的医疗文档包含手写内容。医生笔记、患者签名、注释字段以及印刷表单的修改内容均以自由手写形式出现。Amazon Nova 系列模型能够准确处理这些内容,包括连笔字、临床缩写以及混合印刷和手写的页面。

对于 Guardoc Health 来说,这种能力在两种文档类型中最为关键。第一种是预授权表单上的医生认证字段,其中手写注释可以覆盖印刷的复选框。第二种是患者报告的症状部分,其中手写内容通常包含记录中其他位置未捕获的信息。在早期版本的管道中,遗漏这些文本是 Guardoc Health 信息丢失的主要来源。

药物提取的混合 OCR 管道

药物数据是患者记录中最具影响力的要素之一。药品名称、剂量、给药途径和频率直接影响临床决策,任何错误都可能危及患者安全。药物核对、预授权和保险覆盖决策都依赖于从文档中准确提取这些信息,而这些信息很少以清晰格式呈现。

挑战在于多样性。药物信息可能出现在结构化表格中,也可能出现在医生笔记的非结构化文本中,或是印刷列表的手写补充内容,甚至出现在经过多次传真或拍照传输的扫描页面中。一份患者的病历可能在不同页面上包含所有这些格式。

Guardoc Health 运行一个混合流水线,将 Amazon Textract 与 Amazon Nova 系列模型结合使用:

  • Amazon Textract 执行光学字符识别(OCR),生成包含边界框、表格结构和表单字段识别的结构化输出。对于干净的表格和印刷的药品清单,Amazon Textract 快速、成本高效且准确。
  • Amazon Nova Pro 同时接收原始 PDF 和 Amazon Textract 的输出结果,后者包含可读取的文本以及源页面的视觉布局。
  • Amazon Nova 系列模型通过解决复杂提取场景来补充 Amazon Textract,包括跨多列表格的药品信息拆分、印刷列表中手写添加内容、非标准表格格式以及嵌入在医生笔记中的药品提及等场景。

在该流水线中,每个组件都专注于自身最擅长的领域。Amazon Textract 处理高容量的结构化提取任务,而 Amazon Nova 系列模型则通过多模态推理处理更复杂的场景。最终结果是下游临床工作流程可以直接使用的药品数据,无需人工核对。

业务影响

文档错误会带来临床和财务双重后果。遗漏或不准确的文档可能导致索赔被拒、审计罚款、在以患者驱动支付模式(PDPM)为基础的医保支付体系中因临床文档准确性影响报销金额,以及增加诉讼风险。PDPM 是针对专业护理机构的医保支付体系,其报销金额直接与临床文档的准确性挂钩。

Guardoc 的部署结果反映了这种影响。在两家机构覆盖 200 名患者的季度部署中,Guardoc 推动了 847 处文档修正,解决了 86 个 PDPM 影响问题,并使每 100 例入院患者的医院转院率降低了 74%。这一数据尤其重要,因为医院转院是长期护理中最昂贵且最具破坏性的事件之一,对患者和机构运营均造成重大影响。

在一项覆盖七家机构、服务 1,618 名居民的更广泛案例研究中,Guardoc 识别出 10,612 个问题,并提升了机构层面风险模式的可见性。这种规模的问题检测具有重要意义,因为长期护理中的文档问题通常要等到触发索赔拒付或监管审计才会浮出水面,因此主动识别具有显著的运营优势。另一项季度分析显示,文档错误平均减少了 46%,成果包括单个机构每年超过 40 万美元的 ROI(投资回报率)、审计罚款减少 70%,以及诉讼风险降低 65%,这证明文档准确性提升可直接转化为机构可衡量的财务和合规成果。

长期护理中的临床文档处理是一个高风险问题,历史上一直难以实现自动化。文档内容杂乱、格式差异大,而错误的后果从患者安全延伸至监管合规和财务表现。Guardoc 证明,通过正确组合 AWS 服务构建的架构良好的流水线,可以在大规模上解决这一问题。通过结合 Amazon Textract、Amazon Titan Text Embeddings V2、Amazon DynamoDB 以及 Amazon Bedrock 提供的 Amazon Nova 系列模型,Guardoc 能够在医疗领域最复杂的文档类型上实现准确、可追溯且成本高效的文档处理。

“通过Nova系列,我们正在帮助医疗机构更早发现高风险病例,并在问题变得昂贵之前采取行动。通过自动化过去需要人工监督的工作流程,Nova系列帮助团队减少合规差距,防止错误,并将更多时间投入到改善患者结果上。”

— Assaf Amiaz,Guardoc Health产品总监

不同设施和患者群体的结果表明,更好的文档记录不仅是运营改进,更是向更安全、更高质量护理迈出的重要一步。

Guardoc Health与Amazon Nova模型系列的下一步

Guardoc的路线图将超越合规性,扩展到更广泛的临床工作流程。计划中的模块包括AI NoteAssist、MDSAssist、CarePlanAssist、AdmissionAssist和Pharmacy Reconciliation,旨在帮助团队准确记录,减少人工工作量,并在电子健康记录(EHR)系统内高效完成整个临床工作流程。

Amazon Nova 2系列模型扩展的上下文窗口使多文档推理更加可行,使流水线能够在单次处理中对更大规模的临床内容进行推理。多模态能力的持续改进正在稳步减少当前需要人工审核的边缘情况,例如退化扫描、混合格式页面和非标准布局。底层系统的方向与Guardoc Health所解决的问题需求高度一致。

结论

医疗文档处理是AI在企业中应用风险最高的领域之一。文档多样性极高,容错空间狭窄,失败的后果是真实存在的,表现为护理延迟、合规风险和不必要的成本。

对于正在评估AI用于临床文档处理的医疗机构,实际指导原则非常明确:在实际文档类型上进行基准测试,分别测量召回率和精确率,并设置反映每种错误类型实际成本的置信度阈值。Amazon Nova模型系列和Amazon Bedrock提供了构建在生产环境中稳定运行的流水线所需的基础设施和灵活性,而不仅仅是演示环境。工作的重点在于将这些基础设施校准到工作流程、文档类型以及那些记录依赖正确处理的患者的具体需求上。

关于Guardoc

Guardoc Health是一家人工智能驱动的临床操作系统公司,帮助长期护理团队在专业护理机构(SNFs)和辅助生活设施(ALFs)中改进文档记录并降低风险。网站:www.guardoc.health | 联系:[email protected]

关于Amazon Nova

Amazon Nova是亚马逊推出的一系列基础模型,通过Amazon Bedrock提供。Nova模型支持文本、图像和文档输入,其功能针对企业工作负载进行了优化,包括文档处理、信息提取和多模态推理。Nova Pro在复杂文档任务上表现出色,包括PDF处理、手写识别和结构化数据提取。立即开始使用Amazon Bedrock。

关于作者

'"`