7月6日技术
百度OCR让多页处理内存保持恒定
百度的“Unlimited OCR”通过让记忆像人类遗忘一样运作,一次可处理数十页文档
百度研究人员推出了一种名为 Unlimited OCR 的 OCR 模型,可以在一次推理过程中处理几十页文档。研究团队要解决的核心问题是:现有端到端 OCR 系统通常依赖语言模型解码器,而解码器的 KV cache 会随着生成文本变长而不断增长,从而导致内存占用上升、推理速度变慢。现实中,很多系统只能按页循环处理文档,并在每一页结束后重置 cache。百度用一个类比来解释他们的思路:就像人抄书时不会反复回头重读已经写过的所有内容,而是主要关注原文、刚写下的几个字,以及接下来要写的字,旧内容会像被“软遗忘”一样逐渐淡出。支撑这一设计的技术是 Reference Sliding Window Attention,简称 R-SWA。它让生成的 token 仍然可以关注所有参考输入,但对已经生成的输出只保留最近 128 个 token 的可见范围,因此整个过程中的 KV cache 保持恒定。与此同时,百度还避免让视觉 token 受到同样的滑动窗口状态变化影响,因为那样会逐渐模糊图像特征并降低识别效果。
阅读更多