小互(@imxiaohu)

原样抄写几十页的 PDF,几乎所有模型都做不到 一种全新参考滑动窗口注意力(R-SWA)技术 能让模型像人类抄书一样“连抄几十页”,而不会造成其记忆混乱。 最新开源的 Unlimited OCR...

8.5内容质量
原样抄写几十页的 PDF,几乎所有模型都做不到

一种全新参考滑动窗口注意力(R-SWA)技术

能让模型像人类抄书一样“连抄几十页”,而不会造成其记忆混乱。

最新开源的 Unlimited OCR...

TL;DR · AI 摘要

百度推出 Unlimited OCR 模型,使用 R-SWA 技术实现连续多页 PDF 抄写,无需分页处理。

核心要点

  • R-SWA 技术通过滑动窗口注意力机制,使模型能连续处理多页文档。
  • Unlimited OCR 模型大小为 3B,激活参数为 500M。
  • 该模型模拟人类抄书过程,提升 OCR 处理效率和连续性。

结构提纲

按章节快速跳转。

  1. 当前模型无法像人类一样连续抄写多页 PDF,但百度推出的 Unlimited OCR 模型实现了这一目标。

  2. ·R-SWA 技术原理

    R-SWA 技术通过滑动窗口注意力机制,使模型能连续处理多页文档,而不会造成记忆混乱。

  3. Unlimited OCR 模型大小为 3B,激活参数为 500M,支持一次前向推理处理多页文档。

  4. 传统 OCR 模型需要分页处理,每页处理后清空记忆,导致效率低下。

  5. R-SWA 技术使模型在处理多页文档时,显存和算力需求保持恒定。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Unlimited OCR 模型
    • R-SWA 技术
      • 滑动窗口注意力机制
      • 连续处理多页文档
    • 模型特性
      • 3B 模型大小
      • 500M 激活参数

金句 / Highlights

值得收藏与分享的关键句。

  • R-SWA 技术通过滑动窗口注意力机制,使模型能连续处理多页文档,而不会造成记忆混乱。

    正文

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Unlimited OCR 模型大小为 3B,激活参数为 500M,支持一次前向推理处理多页文档。

    正文

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 传统 OCR 模型需要分页处理,每页处理后清空记忆,导致效率低下。

    正文

    ⬇︎ 下载 PNG𝕏 分享到 X
#OCR#模型#注意力机制#百度
打开原文

小互 on X: "原样抄写几十页的 PDF,几乎所有模型都做不到 一种全新参考滑动窗口注意力(R-SWA)技术 能让模型像人类抄书一样“连抄几十页”,而不会造成其记忆混乱。 最新开源的 Unlimited OCR 模型: 可以模拟人类解析工作记忆的模式 3B大小 500M激活 但在标准 32K 上下文上 https://t.co/gqt9QtLJbJ" / X

小互

@xiaohu

原样抄写几十页的 PDF,几乎所有模型都做不到 一种全新参考滑动窗口注意力(R-SWA)技术 能让模型像人类抄书一样“连抄几十页”,而不会造成其记忆混乱。 最新开源的 Unlimited OCR 模型: 可以模拟人类解析工作记忆的模式 3B大小 500M激活 但在标准 32K 上下文上 它可以一次前向推理能吞几十页文档,不用切页... 该模型由百度研发,据说是挖走DeepSeek OCR核心贡献者的新作 此前所有模型都无法通过一次前向推理完成数十页文档的解析。 因为传统 OCR 是一页一页跑,每跑完一页就清空记忆,最后再把各页结果拼起来 唯独人类可以连续的抄录数百页书籍而不停歇... Unlimited OCR,就是模拟人类抄书过程,使用了一种叫参考滑动窗口注意力(R-SWA)的技术 模型干活的时候,眼前有两样东西: 一样是"原件"(要识别的文档图,加上你给的指令) 一样是"它自己已经写出来的字" R-SWA 的规矩很简单,这两样区别对待: 原件,从头到尾一直完整看着,保证抄写位置不出错。 正在写的字,只看最近一小段(默认 128 个字),更早的就不管了,等于边写边忘。 好处是,它脑子里要记的东西,始终恒定那么多。不存在需要记的太多,脑子掉线的情况,所以不管文档多少页,显存和算力都不涨。 还能一直连续的的抄写文档...

3:51 AM · Jun 24, 2026

3.8K

Views

5

1

7

17

2

25

Read 5 replies