行业资讯
📅 2026/7/24 22:31:56
阿里巴巴造出0.8B超小文档解析神器,端到端解析时代来了?
这篇来自阿里巴巴集团ATH-MaaS团队的技术报告发布于2026年7月15日论文编号为arXiv:2607.13639有兴趣深入了解的读者可以通过该编号检索完整论文。每天无数人面临同一个痛苦手里有一叠扫描件、PDF报告或者拍照的文件需要把里面的文字、表格、公式统统整理出来再用于后续分析、检索或者喂给AI工具。传统的解决方案要么靠人工手打要么靠一套复杂的软件流水线——先识别版面再裁出每个区域再分别识别文字、表格、数学公式最后拼在一起。这套流程就像在流水线工厂里生产产品每个工位做一道工序任何一道出了岔子后面的工位都得跟着受罪。漏掉了一个表格边界整个表格的内容就废了公式裁歪了识别结果就会面目全非。阿里巴巴的研究团队决定换一条路既然流水线问题多为什么不让一个全能工人直接从头到尾搞定所有事情这个全能工人就是OvisOCR2——一个仅有8亿参数规模的端到端文档解析模型。说仅有8亿是因为它的竞争对手里有不少超过百亿甚至千亿参数的模型而OvisOCR2在主流评测榜单OmniDocBench v1.6上拿下了96.58的综合得分不仅在所有端到端模型里排名第一还把此前长期霸榜的流水线方法全部甩在了身后。---一、文档解析这件事为什么这么难要真正理解OvisOCR2的价值得先明白把一张文档图片变成结构化文字这件事有多复杂。普通人看一页文档眼睛和大脑会自动完成很多工作哪里是标题、哪里是正文、哪里是表格、哪里是图注、哪里是页眉页脚、哪里是数学公式以及整页内容应该按什么顺序阅读——特别是遇到双栏排版的学术论文时阅读顺序并不是从左上角到右下角一撸到底而是先读完左栏再读右栏。这些对人类来说习以为常的判断对机器来说极其复杂。现有方法大致分两派。一派是流水线方法代表选手包括PaddleOCR-VL-1.6、MinerU2.5-Pro和GLM-OCR。这些系统把一页文档拆成多个子任务各配一个专门的模型版面分析模型先把页面切成一块一块然后针对每个区域分别调用文字识别模型、公式识别模型、表格结构识别模型最后再由一个模块负责把所有结果按阅读顺序拼在一起。这种分工协作的方式在主流评测上表现不错但每个环节都可能出错且部署时需要同时维护多个模型运维成本很高。另一派是端到端方法用一个统一的模型接收整张文档图片直接输出完整的Markdown格式文本——文字、表格用HTML格式保留结构、公式用LaTeX格式保留数学结构以及图片位置信息一次生成。这类方法部署简单模型可以在生成过程中利用页面的整体上下文不会因为某个区域裁剪不准而丢失信息。然而在此前端到端方法的解析质量普遍落后于流水线方法尤其是在复杂表格和长文档上。OvisOCR2要做的就是用端到端方法打败流水线方法。---二、数据是根基——两条流水线并行建设研究团队把打造OvisOCR2的过程比作建房子地基就是训练数据。如果数据质量差模型再大也是烂泥扶不上墙。为了获得足够高质量、足够多样的训练数据团队设计了两条并行的数据管道真实文档数据管道和合成文档数据管道。真实文档数据管道的逻辑是大量真实世界的文档图片天然包含了各种字体、扫描质量、版面样式、语言种类是任何合成数据都难以完全模拟的现实感来源。但真实文档的麻烦在于你无法直接知道它的正确答案是什么必须先用现有的OCR工具解析出结果再把这些结果当作训练标签。团队选用了PaddleOCR-VL-1.5和MinerU2.5-Pro这两个专业解析工具来获取结构化输出。这两个工具返回的是JSON格式的结构化数据而不是直接可用的Markdown文本。研究团队专门编写了一套基于规则的转换器把这些JSON结果统一转换为标准Markdown格式。转换规则非常细致文字块如何归并相邻的同类文字块要合并中文直接拼接非中文要加空格、标题层级如何从编号格式如1.2节、第三章自动推断、数学公式如何规范化把各种写法统一成$...$或$$...$$格式、表格是否有效空表格、格式损坏的表格直接过滤掉、图片区域如何用标准化的HTML图片标签表示坐标归一化到0到1000的范围内。光靠自动规则还不够团队还设置了人工抽查环节。他们按照数据来源、解析工具类型、文档领域和转换配置把数据分成不同子集从每个子集里随机抽取样本人工对照原图检查文字有没有漏掉、公式渲染对不对、表格行列对不对、图片标注框框得准不准、阅读顺序有没有错乱。遇到偶尔有小错的子集保留但同时保留自动过滤遇到频繁出错的子集直接剔除。这种宁缺毋滥的保守策略确保进入训练集的数据整体质量可靠。合成文档数据管道则解决了另一个问题真实文档里有些结构非常罕见比如跨多行多列合并单元格的复杂表格、公式和文字密集交织的学术页面、极端多栏排版等。靠自然收集到这些样本的概率很低但这些恰恰是模型容易犯错的硬核场景。合成数据管道的核心思路是从同一个源头同时生成图片和答案彻底消除标注误差。具体做法是先收集那些让模型犯错的难样本包括在真实测试中出错的案例和模型自测中暴露的弱点然后用多模态大语言模型分析这些难样本的视觉结构生成对应的HTML模板。这个HTML模板保留了难样本的关键布局特征同时暴露出可以随机化的变量。接着一个基于代理的自动生成流程会把这个模板扩展成大量变体内容层面可以随机替换文字、数值、公式、专业术语结构层面可以随机改变表格结构、章节层级、页面组织方式和图片位置。最终这个HTML页面被用Playwright渲染成真实的文档图片同时从HTML的DOM结构中直接提取Markdown格式的标准答案。因为图片和答案来自同一个HTML源头标注精度理论上是完美的——不存在OCR识别错了导致标注错了的问题。每一批生成的样本还要经过质量控制检查渲染是否正常、Markdown是否有效、坐标是否对齐最后才能进入训练集。通过这两条并行管道训练数据同时具备了真实文档的自然多样性和合成数据的精准覆盖性。---三、训练的四道工序——从会做到做好数据准备好之后真正的训练过程分四个阶段就像把生铁逐步锻造成精钢。第一道工序是监督微调SFT。这个阶段的目标是让模型学会做文档解析这件事用全量数据进行标准的语言模型训练——给模型看文档图片让它预测正确的Markdown输出。研究团队同时训练了两个规格的模型0.8B参数的小模型最终部署目标和4B参数的大模型作为后续阶段的老师。0.8B模型训练了两个完整轮次4B模型为了节省计算成本只训练了20%的轮次。第二道工序是强化学习RL。SFT阶段的训练靠逐个词预测是否正确来驱动但文档解析的很多错误并不体现在单个词上——比如一个表格的文字内容全对但行列结构乱了一个公式逐字母看都没错但整体含义完全不同。这些结构性错误更适合用整体评分来衡量。研究团队使用了GRPO组相对策略优化算法来做强化学习让模型对同一张文档图片生成多个不同的输出然后用奖励函数给每个输出打分鼓励模型更多地生成高分输出、少生成低分输出。奖励函数由三个分量组成文字部分用归一化编辑距离的反值衡量文字越准确分越高、公式部分用CDM字符检测匹配这个图像级别的渲染对比指标能渲染出一样图形的公式才算对、表格部分用TEDS树编辑距离相似度衡量表格的行列结构和内容都要对才算分。最终奖励是页面中实际出现的元素类型的分量平均值纯文字页面只考察文字分含公式的页面额外考察公式分含表格的页面额外考察表格分。强化学习只在4B模型上进行而不是直接在0.8B模型上进行。这是有原因的研究团队实际测试发现直接对0.8B模型做强化学习训练过程中策略偏离KL散度会越来越大表格质量在训练后期甚至出现下滑。而4B模型容量更大能更稳定地吸收强化学习的梯度信号训练过程保持平稳表格TEDS指标稳步提升。为了让强化学习的数据更有效团队还做了在线难样本筛选先用当前策略跑一遍候选页面把太简单模型每次都答对和太难模型每次都答错的页面过滤掉重点保留那些模型有时候答得好、有时候答得差的中等难度页面——这些页面才能给模型提供最有价值的学习信号。第三道工序是在线策略蒸馏OPD。现在有了一个学习好、能力强的4B教师模型怎么把它的能力传递给部署用的0.8B学生模型标准的知识蒸馏方法是让教师模型生成文本然后学生模型去模仿。但研究团队用了一个更精妙的方式让学生模型先自己生成一段输出然后教师模型来评价这段输出的每个位置上各个词的概率分布学生再根据教师的评价调整自己的概率分布。这种方式的好处是学生始终在针对自己实际生成的内容进行改进——就像一个学生做了一套题老师批改并指出每道题哪个选项应该选、为什么学生据此修正自己的思维模式。更重要的是这里使用的是反向KL散度方向的对齐——简单说这种方向的对齐会让学生集中学习教师最有把握的那些选择而不是被强迫去覆盖教师所有可能的输出。在工程实现上全词汇表的概率对齐计算量太大每个位置都要算几万个词的概率研究团队只保留学生当前概率最高的前k个词只在这个小集合里对齐教师和学生的分布大幅降低计算量同时对长文档使用分块投影来降低内存峰值。第四道工序是模型融合。研究团队训练了多个使用不同数据配比和训练配置的候选模型最后对这些候选模型的权重做加权平均得到最终的OvisOCR2。这种做法类似于多个厨师各自做出了稍有差异的菜最后调出一个融合了各自优点的配方——通常能比单个模型更稳定、泛化性更好。---四、评测三个战场全面出击OvisOCR2在三个评测场景下接受了检验分别是两个公开榜单和一个内部评测集。第一个战场是OmniDocBench v1.6这是文档解析领域目前最权威的公开评测基准覆盖1651个PDF页面包含10种文档类型、5种版面类型、5种语言。评测从四个维度打分文字转录的准确度用归一化编辑距离衡量越低越好、公式识别的准确度用CDM衡量越高越好、表格重建的准确度用TEDS和TEDS-S衡量越高越好以及阅读顺序的准确度用编辑距离衡量越低越好。综合得分由文字分、公式分和表格TEDS三项平均得出。在这个榜单上OvisOCR2拿到了96.58的综合分不仅是所有端到端方法里的第一名还超越了此前领跑的流水线方法PaddleOCR-VL-1.696.33分。具体来看每项指标OvisOCR2的文字编辑距离是0.025是所有模型中最低的公式CDM是97.53是所有模型中最高的表格TEDS是94.76与PaddleOCR-VL-1.6并列第一表格TEDS-S是97.16是所有模型中最高的阅读顺序编辑距离是0.111是所有模型中最低的。作为参照那些参数规模大得多的通用视觉语言模型表现如何Qwen3-VL-235B2350亿参数综合分是89.78Gemini 3 Pro综合分是92.91Ovis2.6-30B-A3B300亿参数综合分是93.70。OvisOCR2用0.8B参数的规模比这些巨型模型高出了3到7个百分点。第二个战场是PureDocBench这个评测基准的特点是数据来源可追溯——文档图片从HTML渲染生成标注答案直接从同一HTML源提取避免了人工标注误差。评测分三个轨道清洁轨道标准渲染图片、数字轨道有退化处理的图片和真实轨道手机拍照、复印件、截图等真实场景图片涵盖1475个页面共4425张图片跨10个领域66个子类别。OvisOCR2在Avg3三轨道平均分上达到75.06是所有参评模型中最高的同时在清洁轨道和数字轨道上也分别排名第一。在真实轨道上OvisOCR2以66.56分排在Gemini-3.1-Pro71.98分和Qwen3.5-122B-A10B69.85分之后说明在严重退化的真实照片场景下针对文档解析专门优化的小模型在鲁棒性上仍有提升空间。这也是研究团队明确指出的未来工作方向之一。第三个战场是内部评测集。公开榜单的数据分布未必能完全覆盖真实业务中的长尾场景研究团队自建了一个超过1000页的内部基准覆盖领域特定的表格、带公章的扫描报告、有手写批注的打印模板等更复杂的真实文档。在这个评测集上OvisOCR2的综合分是85.54高于PaddleOCR-VL-1.6的82.88、GLM-OCR的82.80、PaddleOCR-VL-1.5的81.55以及MinerU2.5-Pro的65.54。按难度分层来看在简单文档上OvisOCR2得87.95中等难度文档上85.82困难文档上78.99在每个难度层级上都领先于所有竞争方法。研究团队还专门针对两类特别棘手的场景做了子集分析。在手写文档子集上OvisOCR2以72.28的综合分位居第一特别在文字编辑距离0.1561最低、公式CDM81.51最高和阅读顺序编辑距离0.1733最低上均领先只有表格TEDS一项50.95略低于GLM-OCR的57.31。在复杂表格子集上OvisOCR2综合分83.97遥遥领先于第二名GLM-OCR的74.08表格TEDS最高78.34文字编辑距离最低0.1040最关键的是表格丢失率仅7.96%——而流水线方法因为版面分析可能漏检表格丢失率普遍在13%到17%之间。一旦版面分析把一个表格漏掉了后续识别环节根本没有机会弥补这个错误而端到端方法从整页理解出发就不会有这种不可逆的先天残缺。---五、定性对比肉眼能看出差距除了定量数字研究团队还在论文中展示了多组定性对比案例直观说明不同模型的实际输出差异。在一张包含Kubernetes集群架构设计文档的中文页面上这张页面同时包含说明文字、多个表格和页眉页脚信息。OvisOCR2的输出完整地保留了所有内容表格的行列结构完全正确。PaddleOCR-VL-1.6和MinerU2.5-Pro的输出在文字内容上基本过关但表格中出现了个别识别错误标红部分。而Unlimited-OCR在这个页面上出现了严重的幻觉式重复输出生成了大量与原文完全无关的内容显然是模型在无法准确识别复杂页面时乱说话了。在一张包含手写日记的中文页面上OvisOCR2准确识别出了日期格式DATE / 118 / 484和所有手写正文内容。PaddleOCR-VL-1.6和MinerU2.5-Pro虽然总体方向正确但存在若干字符识别错误如高涨被识别为高话缘份被识别为微信以及标点符号和句子边界的处理差异。在另一张手写歌词页面上MinerU2.5-Pro出现了明显的阅读顺序错误——歌词原本是单栏从上到下排列却被解析为两栏交叉阅读的顺序导致输出内容逻辑混乱。OvisOCR2则正确按照从上到下的顺序输出了完整歌词。---六、规模与效率的平衡为什么选0.8B整个项目的一个核心设计决策是为什么目标是0.8B参数的小模型而不是像很多竞品那样使用3B、4B甚至7B的模型研究团队给出的理由很务实。在实际部署中模型越大推理速度越慢硬件成本越高特别是在需要处理大量文档的企业场景中0.8B的模型在同样的硬件上可以并行处理更多文档。但更关键的是研究团队通过精心设计的数据引擎和训练方案已经能让0.8B的模型在主流评测上超越参数量大得多的竞争对手这说明在文档解析这个特定任务上数据质量和训练策略的提升空间远没有被穷尽而盲目堆砌参数并不是最优解。当然0.8B模型也有其局限在面对极端退化的真实照片文档时它的鲁棒性确实不如那些超大模型。这是大模型在视觉理解方面的先天优势也是研究团队明确列为未来工作方向的问题。---说到底OvisOCR2这个研究最值得关注的地方不仅仅是一个具体的数字分数。更重要的是它证明了端到端方法在文档解析这个任务上已经有能力真正击败长期依赖多模型流水线组合的工程方案。用一个统一的小模型取代一套复杂的多模型系统不仅让部署变得简单还避免了流水线方案中各阶段错误相互叠加的宿命。对于那些需要大规模处理文档的开发者和企业来说这意味着基础设施可以大幅简化——不再需要维护版面分析、文字识别、公式识别、表格识别这几套独立的模型和工程管道一个模型搞定全部。而对于普通用户而言这类技术的持续进步意味着将来无论是处理工作报告、整理学习资料还是数字化老旧纸质档案AI工具将变得更加可靠、更加普及。当然手写文字的识别以及经过严重拍照退化的文档处理依然是这类小模型的薄弱环节。感兴趣深入了解技术细节的读者可以通过arXiv编号2607.13639查阅完整论文或者直接访问Hugging Face上ATH-MaaS/OvisOCR2页面体验开源模型。---QAQ1OvisOCR2和普通OCR软件有什么区别A普通OCR软件通常只认识文字无法处理表格结构、数学公式和阅读顺序等复杂元素。OvisOCR2是端到端文档解析模型能同时处理文字、表格保留行列结构、数学公式用LaTeX格式输出以及图片位置并按正确阅读顺序输出结构化Markdown文本适合复杂文档的完整数字化处理。Q2端到端文档解析为什么比流水线方法更有优势A流水线方法把文档解析拆成多个步骤先检测版面再逐区域识别最后拼合。任何一步出错都会影响后续——比如版面检测漏掉一个表格后面就没有机会弥补。端到端方法用单个模型直接从整张页面图片生成最终结果不存在步骤间的误差叠加部署也只需维护一个模型复杂度大幅降低。Q3OvisOCR2在哪些文档类型上效果比较弱AOvisOCR2在手机拍照、复印件、截图等严重退化的真实照片类文档上效果弱于Gemini-3.1-Pro等超大型通用视觉模型。此外手写文档的表格识别精度也略低于某些流水线方法。研究团队已明确将提升真实场景图像鲁棒性和手写内容处理能力列为下一步研究重点。