快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期日 · 09-13 00:00 约 1 分钟读完

LlamaIndex 提出 just-in-time Agentic OCR:两遍式文档处理兼顾成本与精度

摘要

LlamaIndex 博客介绍 just-in-time Agentic OCR 模式:先以 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR,从而在文档处理中平衡成本与精度。

在文档处理场景中,如何在成本与精度之间取得平衡,一直是开发者关注的焦点。LlamaIndex 博客近日提出了一种名为 just-in-time Agentic OCR 的处理模式,试图为这一难题提供新的思路。

该模式采用两遍式流程。第一遍使用 LiteParse 等免费解析器对全部文件进行粗读,生成可供检索的内容;第二遍则仅针对检索命中的相关页面,调用 VLM 执行 OCR。

通过这种分工,系统无需对每一页都动用视觉语言模型,从而在保持关键信息精度的同时控制整体开销。LlamaIndex 博客将这一设计归纳为 just-in-time Agentic OCR 模式。

对于面向大量文档的 AI 应用而言,该思路提供了一种可参考的取舍方案:以免费解析器承担全量粗筛,将 VLM 的算力集中在真正相关的页面上。

LlamaIndexAgentic OCR文档处理VLM
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词