阿里云官方宣布:阿里云开源发布文档解析模型OvisOCR2。该模型以96.58的综合得分刷新OmniDocBench v1.6榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,这是文档解析领域迎来技术路线的重要突破。
PChome 7月24日消息,阿里云官方宣布:阿里云开源发布文档解析模型OvisOCR2。该模型以96.58的综合得分刷新OmniDocBench v1.6榜单纪录,成为首个超越流水线方法并登顶该榜单的端到端模型,这是文档解析领域迎来技术路线的重要突破。

官方介绍,此前文档解析领域由“流水线方法”主导,这种方式虽成熟,但存在维护成本高、误差累积、部署复杂等固有瓶颈。OvisOCR2采用端到端技术路线:输入一张文档图像,模型在一次生成中输出符合自然阅读顺序的Markdown表示,覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作,现在由一个模型一步到位。

此外,OvisOCR2由Qwen3.5-0.8B后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系,合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合四阶段流程,形成多阶段递进式的训练流程,充分释放紧凑模型的潜力。