Datalab 推出开源文档提取基准 OmniExtractBench

Datalab 推出开源文档提取基准 OmniExtractBench

N
News Editor
2026-10-02 15:29:17
AI 初创公司 Datalab 发布开源基准套件 OmniExtractBench,用于评估结构化文档提取系统表现。该基准整合 4 个现有基准的 620 份文档,并通过统一评分器,以 6 种可解释判定类型衡量模型填充 JSON 模式的准确性。Datalab 称,现有提取基准存在偏见、评分不透明和文档类型单一等问题。

AI 初创公司 Datalab 发布了开源基准套件 OmniExtractBench,用于评估结构化文档提取系统的性能。

整合 4 个基准共 620 份文档

OmniExtractBench 汇集了来自 4 个现有基准的 620 份文档,并通过统一评分器,按 6 种可解释的判定类型评估模型填充 JSON 模式的准确性。

回应现有基准的局限

Datalab 表示,现有提取基准存在偏见、评分机制不透明、文档类型单一等问题。

评分器与数据发布方式

该基准采用匈牙利算法进行基于内容的行对齐。评分器可通过 PyPI 安装,数据则在 Hugging Face 上以 CC BY 4.0 许可证提供。

这项消息由 MarkTechPost 提及。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。