Hugging Face Blog

PP-OCRv6 on Hugging Face: 50-Language OCR from 1.5M to 34.5M Parameters

8.5内容质量

TL;DR · AI 摘要

PP-OCRv6 是 PaddleOCR 的新一代通用 OCR 模型,支持 50 种语言,参数量从 1.5M 到 34.5M,检测和识别准确率显著提升。

核心要点

  • PP-OCRv6_medium 在检测和识别准确率上分别达到 86.2% 和 83.2%。
  • PP-OCRv6 提供三种模型层级:tiny、small 和 medium,分别适用于边缘设备、移动端和服务器端。
  • PP-OCRv6 使用 PPLCNetV4 作为统一的骨干网络,提升模型一致性。

结构提纲

按章节快速跳转。

  1. 介绍 PP-OCRv6 的发布背景及其在 OCR 领域的重要性。

  2. PP-OCRv6 提供三种模型层级,分别适用于不同部署场景。

  3. ·PPLCNetV4 骨干网络

    PP-OCRv6 使用 PPLCNetV4 作为统一的骨干网络,提升模型一致性。

  4. ·RepLKFPN 检测模块

    PP-OCRv6 升级了检测模块,使用 RepLKFPN 提高多尺度文本检测效率。

  5. PP-OCRv6 在检测和识别准确率上相比 PP-OCRv5 有显著提升。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • PP-OCRv6 模型
    • 模型层级
      • tiny (1.5M params)
      • small (7.7M params)
      • medium (34.5M params)
    • 关键技术
      • PPLCNetV4 骨干网络
      • RepLKFPN 检测模块
    • 性能指标
      • 检测 Hmean 86.2%
      • 识别准确率 83.2%

金句 / Highlights

值得收藏与分享的关键句。

#OCR#PaddlePaddle#Hugging Face#模型优化
打开原文

PP-OCRv6 在 Hugging Face 上:支持 50 种语言的 OCR,参数从 1.5M 到 34.5M

返回文章列表

[0

团队

]

文章

发布于 2026 年 6 月 22 日

[-1

点赞

19

[

  • +13

AlexZhang

AlexTransformer

关注

PaddlePaddle

cuicheng

ChengCui

Jun Zhang

jzhang533

Manhui Lin

gggdddfff

Yue Zhang

xiaohei66

leo-q8

yubo

zhangyubo0722

Yi Liu

michaelowenliu

在线评估 PP-OCRv6,然后使用 PaddlePaddle、Transformers 或 ONNX Runtime 后端集成轻量级、生产就绪的 OCR。

PP-OCRv6 是 PaddleOCR 通用 OCR 模型系列的最新一代。它旨在在文档、截图、多语言图像、数字显示屏、工业标签和场景文本中进行现实世界的文本检测和识别。

该模型系列的参数规模从 1.5M 到 34.5M,分为三个层级:tiny、small 和 medium。medium 和 small 层级支持 50 种语言,包括简体中文、繁体中文、英语、日语和 46 种拉丁字母语言。可以快速在线尝试 PP-OCRv6:PP-OCRv6 在线演示。

在 PaddleOCR 官方内部多场景 OCR 基准测试中,PP-OCRv6_medium 的检测 Hmean 达到 86.2%,识别准确率为 83.2%。与 PP-OCRv5_server 相比,文本检测提高了 +4.6 个百分点,文本识别提高了 +5.1 个百分点。

PP-OCRv6 专注于实际的 OCR 需求:使用小模型和灵活的部署选项生成准确的结构化文本输出。如需更深入地了解为什么在 VLM 时代专用 OCR 模型仍然有用,请参阅我们之前的博客:Hugging Face 上的 PP-OCRv5:OCR 的专用方法。

PP-OCRv6 的新特性

PP-OCRv6 在检测和识别方面引入了架构、训练和数据改进。主要设计目标是在保持模型大小适合不同部署环境的同时提高 OCR 准确性。

三种模型层级

PP-OCRv6 提供三种模型层级,涵盖不同的模型大小和 OCR 准确率级别。

模型

模型大小

检测 Hmean

识别准确率

典型应用场景

PP-OCRv6_tiny

1.5M 参数

80.6%

73.5%

边缘设备、轻量级本地 OCR、延迟敏感的演示、受限环境

PP-OCRv6_small

7.7M 参数

84.1%

81.3%

移动设备、桌面、平衡的 OCR 服务、计算成本较低的多语言 OCR

PP-OCRv6_medium

34.5M 参数

86.2%

83.2%

以准确性为导向的 OCR、服务器端流水线、工业 OCR、文档摄入、多语言 OCR

PPLCNetV4 主干网络

PP-OCRv6 使用 PPLCNetV4 作为文本检测和文本识别的统一主干网络。

对于开发者来说,主要好处是模型系列的一致性。tiny、small 和 medium 层级并不是不相关的模型;它们是同一 OCR 系列的一部分,并共享相同的架构方向。

RepLKFPN 用于文本检测

文本检测是 OCR 流水线的第一阶段。检测质量会影响发送到识别器的裁剪区域,而较差的裁剪区域通常会导致识别效果更差。

PP-OCRv6 使用 RepLKFPN 升级检测模块,这是一种轻量级的大核特征金字塔网络,专为多尺度文本检测而设计,同时保持推理效率。

这对于现实世界的 OCR 输入非常重要,因为文本可能很小、密集、旋转、低分辨率或嵌入在复杂的背景中。

EncoderWithLightSVTR 用于识别

在文本识别方面,PP-OCRv6 使用 EncoderWithLightSVTR。它结合了局部上下文建模与全局注意力机制,以提高对具有挑战性的文本裁剪的识别质量。

这些识别改进对于多语言文本、屏幕文本、工业字符、特殊符号、密集文本和噪声图像区域尤为重要。

统一的多语言 OCR

中型和小型模型支持一个模型家族中的 50 种语言,包括简体中文、繁体中文、英语、日语以及 46 种拉丁字母语言。

这有助于减少在常见的多语言 OCR 场景中对单独 OCR 模型的需求。

使用 PaddleOCR 快速入门

安装 PaddleOCR:

code
pip install paddleocr

使用 Paddle Inference(默认后端)运行 OCR:

code
from
paddleocr
import
PaddleOCR
# 模型:PP-OCRv6_medium(默认)
# 后端:Paddle Inference(默认)
ocr = PaddleOCR(
    use_doc_orientation_classify=
False
,
    use_doc_unwarping=
False
,
    use_textline_orientation=
False
,
)
result = ocr.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)
for
res
in
result:
    res.
print
()
    res.save_to_img(
"output"
)
    res.save_to_json(
"output"
)

OCR 结果可以保存为可视化图像和结构化 JSON 输出。结构化输出随后可以被文档解析、搜索、提取、RAG、分析或代理工作流等下游系统使用。

可用的推理后端

PP-OCRv6 可以通过 PaddleOCR 使用多种推理后端。PaddleOCR 3.7 提供了一个统一的推理引擎接口,其中引擎选择底层运行时,相关配置可以通过管道或模块 API 传递。

| 后端 | 描述 | |--------------|------| | Transformers | 针对支持的 PaddleOCR 模型的 Hugging Face / PyTorch 推理路径 | | ONNX Runtime | 针对基于 ONNX 的部署环境的可移植推理路径 | | Paddle Inference | 本地 Paddle 推理格式 |

对于 Hugging Face 用户,PaddleOCR 支持通过 Transformers 后端运行选定的 OCR 和文档解析模型。这可以通过以下方式启用:

code
engine=
"transformers"

有关 Transformers 后端在 PaddleOCR 中的工作方式的更多详细信息,请参阅:

[PaddleOCR:使用 Transformers 后端运行 OCR 和文档解析任务](链接)

使用 Transformers 后端运行 PP-OCRv6 示例:

code
from
paddleocr
import
PaddleOCR
# 模型:PP-OCRv6_medium(默认)
# 后端:Transformers
ocr = PaddleOCR(
    use_doc_orientation_classify=
False
,
    use_doc_unwarping=
False
,
    use_textline_orientation=
False
,
    engine=
"transformers"
,
)
result = ocr.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)

PP-OCRv6 集合中还提供了 ONNX 变体,适用于通过 engine="onnxruntime" 使用 ONNX Runtime 的环境:

code
from
paddleocr
import
PaddleOCR
# 模型:PP-OCRv6_medium(默认)
# 后端:ONNX Runtime
ocr = PaddleOCR(
    use_doc_orientation_classify=
False
,
    use_doc_unwarping=
False
,
    use_textline_orientation=
False
,
    engine=
"onnxruntime"
,
)
result = ocr.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)

这些后端选项共同使 PP-OCRv6 能够在不同的运行时环境中使用,同时在 Hugging Face Hub 上保持相同的 OCR 模型家族。

结论

PP-OCRv6 在 PaddleOCR 的基础上扩展,提供了一款轻量级、多语言的 OCR 模型家族,适用于现实场景中的文本检测与识别。

此次发布包括三个参数规模从 1.5M 到 34.5M 的模型层级,支持多达 50 种语言的 OCR,相比 PP-OCRv5_server,在检测和识别精度上有所提升,并且在 Hugging Face Hub 上提供了多种模型格式,包括 safetensors、Paddle 推理模型和 ONNX 模型。

结合托管的 Hugging Face Space 和可用的 PaddleOCR 推理后端,PP-OCRv6 提供了多个用于评估和集成的入口点:

  • 在线演示:PP-OCRv6 在线演示
  • 模型集合:PP-OCRv6 集合
  • Transformers 后端博客:使用 Transformers 后端的 PaddleOCR
  • PaddleOCR 文档:PP-OCRv6 文档
  • PaddleOCR 官方网站:https://www.paddleocr.com

您可以通过在线演示评估 PP-OCRv6,探索集合中的可用模型资源,并使用与您自身 OCR 工作流程匹配的推理后端。

本文中提到的 Spaces 1

本文中提到的 Collections 1

更多来自该作者的文章

PaddleOCR 3.5:使用 Transformers 后端运行 OCR 和文档解析任务

37

2026 年 5 月 18 日

社区

编辑

预览

通过拖拽、粘贴或点击此处上传图片、音频和视频。

点击此处上传图片

评论

· 注册或登录以发表评论

  • +7