Hugging Face Blog

Newer Models, Same Advantage

6.9内容质量

TL;DR · AI 摘要

Newer Models, Same Advantage Back to Articles 0 Team Article Published July 16, 2026 -1 Upvote 2 Erick Lachmann ErickvL...

核心要点

  • 主题聚焦:Newer Models, Same Advantage
  • 来源:Hugging Face Blog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#安全#产品
打开原文

更新的模型,同样的优势

返回文章列表

[0

团队

]

文章

发布于2026年7月16日

[-1

点赞

2

[

Erick Lachmann

ErickvL

关注

Dharma-AI

Gabriel Pimenta de Freitas Cardoso

GabrielPimenta99

Francisco de Almeida Rocha Alves

falves9101

Victor Gabriel Ferreira Barbosa

victorBarbosa23

尽管采用了更新的架构,DharmaOCR 通过领域专业化和针对性训练在巴西葡萄牙语上超越了 Mistral OCR4 和 Unlimited-OCR。本文将展示这一优势的证据及其背后的机制。

三个月前,我们发表了关于 DharmaOCR 的论文并开源了其中一个模型。目标非常明确:专为巴西葡萄牙语设计的光学字符识别系统。

训练流程分为两个阶段。第一阶段是监督微调,利用来自不同来源、格式和复杂程度的大量葡萄牙语文本,使模型权重与巴西葡萄牙语的特定词汇、语法和文档结构对齐——将表征能力集中在目标语言上,而非分散到更广泛的多语言空间。第二阶段应用了直接偏好优化(DPO):模型不仅从正确转录中学习,还通过比较不同输出的竞争偏好数据进行训练,使其在推理时能持续选择更优的提取结果。这一阶段解决的是另一个问题:不是准确性,而是稳定性。通过抑制导致生成模型产生重复或不连贯输出的失败模式,DPO 减少了推理时间和成本,并显著提升了模型在生产环境中的可靠性。

综合结果是一个在葡萄牙语专注基准测试中实现了最高提取质量评分且退化率最低的模型。这两个阶段缺一不可:微调阶段构建了领域能力;DPO 阶段确保了这种能力在模型通常失效的条件下依然保持。


OCR 模型正在快速发展。但最初促使 DharmaOCR 设计的差距(在复杂文档中的提取质量以及在生产环境中的模型稳定性)并未缩小。随着领域变化,这些差距反而变得更加具有指导意义。

多模态生成模型的普及使基于语言模型的 OCR 广泛可用,随后涌现的大量微调 OCR 变体也反映了这一技术的快速采用。然而,这种普及并未改变技术的本质。所有基于生成模型的 OCR 系统都是概率性的。转录错误是这种概率性技术固有的变量。模型之间的差异在于错误的数量和类型。这由两方面决定:模型的结构(架构和参数量)以及参数如何为任务进行训练。

架构和参数量决定了模型能学习的上限。训练过程决定了如何分配这种能力。

这种区别使得专业化问题从设计偏好转变为结构性问题。当模型在受限领域进行训练时——例如单一语言、特定文档类型或具体任务——所有参数都专注于该特定任务。当模型需要覆盖更广泛的领域——例如处理N种语言的多语言模型——这些参数必须分配到所有领域中。这种分配并非线性:神经元叠加原理意味着单个参数可以同时编码多个特征。但这种分配是真实存在的,其影响也是真实的。覆盖范围更广的模型对每个领域投入的专注度会更低。

DharmaOCR的训练方式是反向接受这种限制的。该模型并非被设计为其他语言的最佳选择,也从未打算成为最佳选择。作为交换,网络中所有可用参数都可以专注于巴西葡萄牙语的特定词汇、形态和正字法模式——这是该领域对模型资源最集中的利用方式。

这种集中性构成了相对于多语言和宽领域模型的结构性优势。这种优势并不取决于模型架构规模或训练流程的复杂程度是否超过竞争对手——新的架构和训练技术会提升任何模型的能力。它取决于资源分配的方向:集中于单一领域而非分散到多个领域。

三个月后,更新的模型问世了。当这些模型更新且能力更强时,专业化是否仍然具有优势,这是另一个问题。

DharmaOCR论文发表三个月后,两个新的OCR模型引起了研究社区的广泛关注:Mistral OCR4和Unlimited-OCR。两者都代表了真正的技术进步——新的训练技术、新的数据集,以及在多项基准测试中多种语言的出色表现。它们是那种能提升OCR系统预期表现竞争标准的模型。

当我们用这两个模型与DharmaOCR基准进行测试——该评估专为葡萄牙语设计——结果是明确的。

DharmaOCR得分为0.925。Mistral OCR4得分为0.798。Unlimited-OCR得分为0.7587。

差距显著。Mistral OCR4比DharmaOCR低约13分;Unlimited-OCR则低超过16分。两者均在我们模型发布后推出,且都拥有大量研究资源。在DharmaOCR的基本设计决策完全专注于葡萄牙语的任务中,专业化优势是可衡量且显著的。

基准测试是核心发现。后续内容将说明为何差距呈现特定形态。

处理非平凡的葡萄牙语文档能准确揭示多语言模型容易出错的环节。ENEM作文(巴西全国高中考试)结合了手写文本与特定于巴西葡萄牙语的词汇、专有名词和文化参考。这些正是语言特定训练能带来回报的文档类型。

图1:基准测试中使用的ENEM作文手稿及各模型输出。错误部分以红色标记。

Mistral OCR4 在处理此类文档时,将“Chico Buarque”(巴西最广为人知的音乐家和诗人之一)的名字错误转录为“Chico Barque”。Unlimited-OCR 对同一名称的转录结果为“chico bique”。当面对短语“O Brasil não exclui, assimila”(“巴西不排斥,而是吸收”,该引语来自同一文档)时,Unlimited-OCR 的输出为:“a dose de chico bique, 'o Brasil no exclu, eliminila.”

这些错误并非随机发生。对巴西葡萄牙语接触不足的模型不会随意失败——它会在区分巴西葡萄牙语与更广泛多语言语料库的词汇和专有名词上出现系统性错误。Chico Buarque 并非冷门引用,该名称在巴西全国范围内广为人知。其在输出中的系统性错误并非边缘案例,而是诊断性证据:揭示了模型训练中未覆盖的领域。

DharmaOCR 在相同文档上的评估结果正确处理了这些案例。原因直接明了:模型的训练集中于这一语言空间,将资源导向体现巴西葡萄牙语特征的词汇和专有名词分布,而非分散到多种语言中。

这些示例说明的是基准测试而非替代基准测试。基准测试确立了差距的规模,而示例则展示了为何这种差距集中在语言特定识别上,而非通用能力。

然而,提取准确性只是生成性能的一个维度。在视觉复杂度下的稳定性是另一个维度——从操作层面来看,这是更容易失败且影响更严重的维度。

当生成模型遇到无法清晰解析的文档时——小字号、扫描质量退化、密集手写——其输入信号会面临不确定性。主要训练目标为下一个token预测的模型在此处存在特定脆弱性:当视觉信号变得模糊时,模型可能继续基于先前学习的模式生成内容,而非依据源文档。结果是文本退化——输出内容重复、不连贯,且与页面内容语义脱节。

面对小字号文档时,Mistral OCR4 生成的输出与文档内容完全无关。

图2:小字号文档

图3:DharmaOCR输出与Mistral OCR4退化输出

这不是对源文档的低质量转录。这是完全不同类别中的失败。

其操作后果与转录错误截然不同。错误转录以可恢复的方式出错——它与源文档存在关联,原则上可以识别并修正。退化输出则不存在这种关联。由于没有明确的目标可修正,因此无法进行修正。对于依赖结构化OCR输出的下游流程——文档分类、信息提取、合规工作流——退化输出并非不准确的数据,而是结构性不可用的数据。自动化本应带来的效率优势,恰恰在输出停止作为信息的那一刻被完全抵消。

Mistral OCR4 和 Unlimited-OCR 是具有重大技术突破的优秀模型。此处描述的退化行为并不定义它们;它仅指明了一个特定的失败条件,即当前训练尚未解决该领域的特定问题。问题的关键在于,针对这一问题设计的训练流程应当是什么样子。

在 DharmaOCR 中,答案是 DPO 阶段。

监督微调将模型的资源集中在目标领域——即构建上述语言对齐的阶段。但 SFT 的训练基于单个标记的预测:模型学习在给定上下文的情况下生成正确的下一个标记。在视觉复杂度较高的情况下,这种机制会引发退化。如果输出中的早期标记偏离了源文档,后续每个预测都会基于这种偏离状态进行,导致输出持续偏离。重复循环和不连贯的序列在这种情境下是固有特征——它们是优化目标逐步推进却未考虑整体提取连贯性的可预测结果。

DPO 的训练针对的是不同信号。SFT 是逐标记训练,而 DPO 则针对完整输出的质量进行训练——教会模型根据整体提取的连贯性而非单个预测的准确性来区分竞争性响应。其效果具有稳定作用:在视觉复杂度可能引发偏离的文档中,模型更不容易选择偏离路径,因为其训练过程会对在提取层失去连贯性的输出进行惩罚。

结果正如原始基准测试所展示的那样:在相同文档上,退化率降低的同时提取准确性提高,而没有这一训练阶段的模型则会失去连贯性。

该基准测试明确了当前的事实。但它对两年后的情况预测不够精确。

可能——甚至很可能——未来的新模型最终会在巴西葡萄牙语领域超越当前的 DharmaOCR。架构将得到改进,训练技术将取得进展,数据集将扩大。该领域在所有层面都朝着更高能力发展,没有理由认为这种趋势会停止。这是预期的,也是值得欢迎的。

随着每一代架构的更新,绝对性能的上限会发生变化。但不会改变的是决定特定领域中哪些系统最接近其上限的结构逻辑。

可用资源——计算能力、参数数量、训练数据——是有限的。它们必须被分配到某个方向。将资源集中于单一领域的系统,相较于将相同资源分散到多个领域的系统,能在该领域从资源中提取出更多价值。这种关系与通用模型的能力强弱无关。随着架构的改进,专家模型与通用模型之间的差距可能发生变化,但结构性动态不会逆转。我们在一篇早期文章中更深入探讨了这一原理(《为什么专业化是必然趋势》)。

这决定了 Dharma 如何面对未来的发展。目标不是捍卫当前模型的基准地位,而是保持在新兴技术的前沿 —— 新架构、新训练方法、对齐和评估的新方法 —— 并将这些技术应用于同一目标:构建一个专门用于巴西葡萄牙语 OCR 的系统,以尽可能高效地利用可用资源,同时实现最低成本和最短推理时间。

更优秀的工具不会削弱专业化,反而会拓展其能力边界。

三个月前,我们已经证明,将模型训练集中于特定领域,相较于通用系统(包括更新、资源更充足的系统)能产生可衡量的优势。这一优势依然存在。同样的原则将决定 DharmaOCR 的持续演进方向 —— 不是保持固定不变,而是将领域内取得的任何进展应用于一个始终保持不变的领域。

参考文献

  • Cardoso, Gabriel Pimenta de Freitas 等. "DharmaOCR: 专用小型语言模型在结构化 OCR 任务中超越开源和商业基线." arXiv 预印本 arXiv:2604.14314 (2026).

进一步阅读

  • 专业化为何不可避免 —— 专业化论点的结构和理论基础。优化理论、进化生物学、竞争市场和机器学习都指向相同的预测:在资源有限和选择压力下,适应性胜过广度。
  • 专业化胜过规模:AI 采购决策中被忽视的战略变量 —— 本文的实证与战略补充。当 No Free Lunch 定理说明为何专业化在结构上被预测时,本文则探讨了专业化在实践中为何表现更优 —— 以及为何在大多数 AI 采购决策中被低估。
  • 文本退化:大多数基准未追踪的生产失败模式 —— 一种当语言模型超出其有效领域边界时出现的已记录失败模式。
  • 超越聊天机器人的直接偏好优化 —— 说明偏好优化技术如何扩展到对话 AI 以外的专用领域 —— 这是对本文所主张的领域聚焦策略的具象化体现。

在 Hugging Face 上探索 Dharma AI,体验我们的交互式演示,下载开源模型,并发现专用 AI 系统在实际企业应用中如何超越通用模型。

本文提及的模型 1

本文提及的 Spaces 1

更多来自该作者的文章

专业化为何不可避免

13

2026 年 6 月 30 日

超越聊天机器人的直接偏好优化

11

2026 年 6 月 3 日

社区

编辑

预览

通过拖拽、粘贴或点击此处上传图片、音频和视频。

点击此处上传图片

评论

· 注册或登录以发表评论