【文档OCR模型需要怎样的高质量数据?PP-OCRv5数据策略实证分析及真实场景数据合成思路】数据才是当前模型能力和决定是否可以落地的关键,尤其是现在的高质量这个东西,啥叫高质量,对模型性能有好处,并且能够形成标准化的数据资产就是高质量。先看PP-OCRv5中的数据策略实证分析,轻量级模型的性能上限由训练数据的难度、精度、多样性决定,而非仅参数规模,进而以数据为核心思路研发PP-OCRv5,也就是还是做数据。另一个是真实场景数据DocMix-3M的思路,通过组合原子元素与预先设计的版式模板生成逼真的样本。首先从多个来源构建标准化元素(表格、公式、段落、图表)的仓库,并收集带有注释阅读顺序的版式模板,以捕捉真实文档中观察到的结构模式。在空间和结构约束下,将采样的元素放置到模板中,合成文档实例,从而生成多样且版式丰富的页面。关注数据,关注本质,回到数据中去,也是高质量数据集的一个框架内容。对数据侧感兴趣的可关注。http://t.cn/AXfegNp7
发布于 北京
