PP-OCRv6 on Hugging Face: 50-Language OCR from 1.5M to 34.5M Parameters
TL;DR · AI 摘要
PP-OCRv6 是 PaddleOCR 的新一代通用 OCR 模型,支持 50 种语言,参数量从 1.5M 到 34.5M,检测和识别准确率显著提升。
核心要点
- PP-OCRv6_medium 在检测和识别准确率上分别达到 86.2% 和 83.2%。
- PP-OCRv6 提供三种模型层级:tiny、small 和 medium,分别适用于边缘设备、移动端和服务器端。
- PP-OCRv6 使用 PPLCNetV4 作为统一的骨干网络,提升模型一致性。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- PP-OCRv6 模型
- 模型层级
- tiny (1.5M params)
- small (7.7M params)
- medium (34.5M params)
- 关键技术
- PPLCNetV4 骨干网络
- RepLKFPN 检测模块
- 性能指标
- 检测 Hmean 86.2%
- 识别准确率 83.2%
金句 / Highlights
值得收藏与分享的关键句。
PP-OCRv6_medium 在检测和识别准确率上分别达到 86.2% 和 83.2%。
PP-OCRv6 提供三种模型层级,分别适用于边缘设备、移动端和服务器端。
PP-OCRv6 使用 PPLCNetV4 作为统一的骨干网络,提升模型一致性。
PP-OCRv6 在 Hugging Face 上:支持 50 种语言的 OCR,参数从 1.5M 到 34.5M
返回文章列表
[0
团队
]
文章
发布于 2026 年 6 月 22 日
[-1
点赞
19
[
- +13
AlexZhang
AlexTransformer
关注
cuicheng
ChengCui
Jun Zhang
jzhang533
Manhui Lin
gggdddfff
Yue Zhang
xiaohei66
leo-q8
yubo
zhangyubo0722
Yi Liu
michaelowenliu
在线评估 PP-OCRv6,然后使用 PaddlePaddle、Transformers 或 ONNX Runtime 后端集成轻量级、生产就绪的 OCR。
PP-OCRv6 是 PaddleOCR 通用 OCR 模型系列的最新一代。它旨在在文档、截图、多语言图像、数字显示屏、工业标签和场景文本中进行现实世界的文本检测和识别。
该模型系列的参数规模从 1.5M 到 34.5M,分为三个层级:tiny、small 和 medium。medium 和 small 层级支持 50 种语言,包括简体中文、繁体中文、英语、日语和 46 种拉丁字母语言。可以快速在线尝试 PP-OCRv6:PP-OCRv6 在线演示。
在 PaddleOCR 官方内部多场景 OCR 基准测试中,PP-OCRv6_medium 的检测 Hmean 达到 86.2%,识别准确率为 83.2%。与 PP-OCRv5_server 相比,文本检测提高了 +4.6 个百分点,文本识别提高了 +5.1 个百分点。
PP-OCRv6 专注于实际的 OCR 需求:使用小模型和灵活的部署选项生成准确的结构化文本输出。如需更深入地了解为什么在 VLM 时代专用 OCR 模型仍然有用,请参阅我们之前的博客:Hugging Face 上的 PP-OCRv5:OCR 的专用方法。
PP-OCRv6 的新特性
PP-OCRv6 在检测和识别方面引入了架构、训练和数据改进。主要设计目标是在保持模型大小适合不同部署环境的同时提高 OCR 准确性。
三种模型层级
PP-OCRv6 提供三种模型层级,涵盖不同的模型大小和 OCR 准确率级别。
模型
模型大小
检测 Hmean
识别准确率
典型应用场景
PP-OCRv6_tiny
1.5M 参数
80.6%
73.5%
边缘设备、轻量级本地 OCR、延迟敏感的演示、受限环境
PP-OCRv6_small
7.7M 参数
84.1%
81.3%
移动设备、桌面、平衡的 OCR 服务、计算成本较低的多语言 OCR
PP-OCRv6_medium
34.5M 参数
86.2%
83.2%
以准确性为导向的 OCR、服务器端流水线、工业 OCR、文档摄入、多语言 OCR
PPLCNetV4 主干网络
PP-OCRv6 使用 PPLCNetV4 作为文本检测和文本识别的统一主干网络。
对于开发者来说,主要好处是模型系列的一致性。tiny、small 和 medium 层级并不是不相关的模型;它们是同一 OCR 系列的一部分,并共享相同的架构方向。
RepLKFPN 用于文本检测
文本检测是 OCR 流水线的第一阶段。检测质量会影响发送到识别器的裁剪区域,而较差的裁剪区域通常会导致识别效果更差。
PP-OCRv6 使用 RepLKFPN 升级检测模块,这是一种轻量级的大核特征金字塔网络,专为多尺度文本检测而设计,同时保持推理效率。
这对于现实世界的 OCR 输入非常重要,因为文本可能很小、密集、旋转、低分辨率或嵌入在复杂的背景中。
EncoderWithLightSVTR 用于识别
在文本识别方面,PP-OCRv6 使用 EncoderWithLightSVTR。它结合了局部上下文建模与全局注意力机制,以提高对具有挑战性的文本裁剪的识别质量。
这些识别改进对于多语言文本、屏幕文本、工业字符、特殊符号、密集文本和噪声图像区域尤为重要。
统一的多语言 OCR
中型和小型模型支持一个模型家族中的 50 种语言,包括简体中文、繁体中文、英语、日语以及 46 种拉丁字母语言。
这有助于减少在常见的多语言 OCR 场景中对单独 OCR 模型的需求。
使用 PaddleOCR 快速入门
安装 PaddleOCR:
pip install paddleocr使用 Paddle Inference(默认后端)运行 OCR:
from
paddleocr
import
PaddleOCR
# 模型:PP-OCRv6_medium(默认)
# 后端:Paddle Inference(默认)
ocr = PaddleOCR(
use_doc_orientation_classify=
False
,
use_doc_unwarping=
False
,
use_textline_orientation=
False
,
)
result = ocr.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)
for
res
in
result:
res.
print
()
res.save_to_img(
"output"
)
res.save_to_json(
"output"
)OCR 结果可以保存为可视化图像和结构化 JSON 输出。结构化输出随后可以被文档解析、搜索、提取、RAG、分析或代理工作流等下游系统使用。
可用的推理后端
PP-OCRv6 可以通过 PaddleOCR 使用多种推理后端。PaddleOCR 3.7 提供了一个统一的推理引擎接口,其中引擎选择底层运行时,相关配置可以通过管道或模块 API 传递。
| 后端 | 描述 | |--------------|------| | Transformers | 针对支持的 PaddleOCR 模型的 Hugging Face / PyTorch 推理路径 | | ONNX Runtime | 针对基于 ONNX 的部署环境的可移植推理路径 | | Paddle Inference | 本地 Paddle 推理格式 |
对于 Hugging Face 用户,PaddleOCR 支持通过 Transformers 后端运行选定的 OCR 和文档解析模型。这可以通过以下方式启用:
engine=
"transformers"有关 Transformers 后端在 PaddleOCR 中的工作方式的更多详细信息,请参阅:
[PaddleOCR:使用 Transformers 后端运行 OCR 和文档解析任务](链接)
使用 Transformers 后端运行 PP-OCRv6 示例:
from
paddleocr
import
PaddleOCR
# 模型:PP-OCRv6_medium(默认)
# 后端:Transformers
ocr = PaddleOCR(
use_doc_orientation_classify=
False
,
use_doc_unwarping=
False
,
use_textline_orientation=
False
,
engine=
"transformers"
,
)
result = ocr.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)PP-OCRv6 集合中还提供了 ONNX 变体,适用于通过 engine="onnxruntime" 使用 ONNX Runtime 的环境:
from
paddleocr
import
PaddleOCR
# 模型:PP-OCRv6_medium(默认)
# 后端:ONNX Runtime
ocr = PaddleOCR(
use_doc_orientation_classify=
False
,
use_doc_unwarping=
False
,
use_textline_orientation=
False
,
engine=
"onnxruntime"
,
)
result = ocr.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)这些后端选项共同使 PP-OCRv6 能够在不同的运行时环境中使用,同时在 Hugging Face Hub 上保持相同的 OCR 模型家族。
结论
PP-OCRv6 在 PaddleOCR 的基础上扩展,提供了一款轻量级、多语言的 OCR 模型家族,适用于现实场景中的文本检测与识别。
此次发布包括三个参数规模从 1.5M 到 34.5M 的模型层级,支持多达 50 种语言的 OCR,相比 PP-OCRv5_server,在检测和识别精度上有所提升,并且在 Hugging Face Hub 上提供了多种模型格式,包括 safetensors、Paddle 推理模型和 ONNX 模型。
结合托管的 Hugging Face Space 和可用的 PaddleOCR 推理后端,PP-OCRv6 提供了多个用于评估和集成的入口点:
- 在线演示:PP-OCRv6 在线演示
- 模型集合:PP-OCRv6 集合
- Transformers 后端博客:使用 Transformers 后端的 PaddleOCR
- PaddleOCR 文档:PP-OCRv6 文档
- PaddleOCR 官方网站:https://www.paddleocr.com
您可以通过在线演示评估 PP-OCRv6,探索集合中的可用模型资源,并使用与您自身 OCR 工作流程匹配的推理后端。
本文中提到的 Spaces 1
本文中提到的 Collections 1
更多来自该作者的文章
PaddleOCR 3.5:使用 Transformers 后端运行 OCR 和文档解析任务
37
2026 年 5 月 18 日
社区
编辑
预览
通过拖拽、粘贴或点击此处上传图片、音频和视频。
点击此处上传图片
评论
· 注册或登录以发表评论
- +7