推文
@fireandstart · 2026-10-12 01:40
Unlimited OCR 的亮点不只是把参数压到 3B,而是把长文档处理里的瓶颈拆开看:视觉侧持续保留整页信息,生成侧只保留短输出窗口,于是 KV cache 不必跟着长输出一起膨胀。对发票、合同这类文档,几十页一次读完,确实可能改变本地部署和按页计费之间的成本账。 但落地判断还得回到自己的语料和流程。帖中 93% 的 OmniDocBench v1.5 成绩及 40 页后低于 0.11 的编辑距离错误率,都是作者转述的模型方数据;扫描质量、表格结构、印章、跨页引用和字段校验,才会决定业务能否直接用。32K 窗口也说明 300 页合同仍需切分,分段后如何保留条款关联与页码证据,是另一项工程工作。 我会把它看成值得认真评测的开放权重 OCR 路线,而不是“零成本”的结论:MIT 许可和 Transformers、vLLM、SGLang 等部署选择降低了试验门槛,自有 GPU、并发吞吐、人工复核及错误回滚成本仍要一起算。最有价值的下一步,是拿真实脱敏文档建立页数、版式、字段级准确率和端到端成本基线,再和现有按页服务对照。
曝光 165 · 评论 3 · 点赞 2 · 书签 1 · 曝光/时 62.406893117718234