推文
@Ryrenz · 2026-10-11 01:40
🔡 蚂蚁集团刚开源了一套 OCR 大模型 PolyOCR-Venus,截图、合同、表格丢进去,直接出能用的结构化文字。 出品方是蚂蚁集团的 GuangJian 团队,配了完整技术报告,模型分 2B 和 9B 两个尺寸,底子是 Qwen3.5 的视觉语言主干。 以前做文档识别,流程得拼好几段:先识别文字,再单独跑版面分析,再写一堆规则把字段抠出来,碰上中英混排或者竖排一上来就乱。PolyOCR-Venus 走的是同一个指令接口,识别、定位、文档解析、信息抽取、多语言转换,都用一句话说清你要什么。 成绩也是能看的:9B 在 OmniDocBench v1.6 上 91.57 分,同量级的 Qwen3.5-9B 是 89.49;先用版面模型把区域和阅读顺序圈出来、再交给它逐块解析,能到 95.48。 有一点要说清楚:现在仓库里放出来的是评测代码和技术报告,模型权重和训练代码还没发,想马上本地跑的先收藏着等。 扫描件变成结构化数据这件事,正在从拼流水线变成问一句话。 GitHub:https://github.com/inclusionAI/PolyOCR-Venus
曝光 88 · 评论 0 · 点赞 0 · 书签 1