Cohere推出了拥有2.3 billion个参数的 Parse 5 模型,用于将 PDF、幻灯片和扫描文档转换为结构化 Markdown。该模型将页面作为图像进行处理,并在单次视觉语言模型处理中生成结果;它以 HTML 格式返回表格,附带说明的图像,以及标示表格和图像位置的坐标。API 价格公布为每1,000页$1.50。
在 Cohere 的 ParseBench 对比中,Parse 5 在表格、内容准确性和语义格式化方面获得了79.2分。这一分数低于 GPT-5.5 的84.4分、Opus 4.8 的84.3分和 Gemini 3.5 Flash 的81.8分,但高于 LlamaParse 的 Cost Effective 层级的78.3分。该模型通过 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 提供。评估未包含 Chart 和 Layout 维度,同时据称图表数据提取功能计划在未来版本中推出。
为什么重要
Parse 5 提供了一种输出标准,使文档转换流程不仅能够获取文本,还能同时处理表格、图像及其在页面中的位置。对于处理 PDF 和扫描文档的团队而言,这可能直接影响所获取数据在后续流程中的使用方式;但由于目前尚不支持图表数据提取,其适用范围受到限制。性能结果显示,该模型的表现低于部分竞争对手,但高于 LlamaParse 的上述层级;此外,评估未涵盖图表和布局维度,也使比较范围进一步缩小。其价格以及在不同云平台上的可用性,意味着选择时不能只看模型得分,还需要根据使用方式和现有技术基础设施作出决定。