神了,杨立昆 居然转发了百度的项目??
刚刷推的时候居然发现杨立昆的号里面居然有Unlimited-OCR??
他转发了一条介绍 Unlimited-OCR 的帖子。
Unlimited-OCR这个项目我之前介绍过。
没想到发布一个月后,还能再次冲上 HuggingFace 全球模型趋势榜第三。
目前 GitHub Star 已经突破 16.5 k,HuggingFace 下载量达到 224 万。
Unlimited OCR 真正有意思的地方,是它试图解决 OCR 长文档解析最麻烦的问题。
传统 OCR 通常把 PDF 拆成一页页处理,再把结果拼起来。
遇到跨页表格、公式和复杂阅读顺序,很容易丢失上下文。
Unlimited OCR 的做法是把 DeepSeek-OCR 的全部解码器注意力,替换成一套叫 R-SWA 的机制。
模型始终可以查看全部原始图像,但对于自己已经生成的内容,只保留最近128个Token作为工作记忆。这样一来,KV Cache 不再随着输出不断膨胀,解析到后面也不会越来越慢。
按照论文数据,它可以在32K上下文内一次连续解析数十页文档,输入超过40页后,编辑距离依然低于0.11。
在6000个输出Token时,理论吞吐量比DeepSeek-OCR高35%。
并且一个中国团队开源的3B模型,发布一个月后仍在持续获得海外社区适配并重新冲回全球热榜,还能被杨立昆主动转发。
百度你们这次确实做出了一个全球开发者愿意自己传播的东西啊