LlamaIndex 发布 legal-kb:法律审查的“多步检索”智能体模板

在合同审查与尽职调查等高精度法律文档处理场景中,传统 RAG(检索增强生成)的一次性向量检索往往无法满足对上下文连贯性和逐段验证的需求。LlamaIndex 最新发布的 legal-kb 参考应用,正是针对这一痛点设计:它不仅将检索升级为多步 Agent 推理,还通过一套“文件系统”风格的工具链,为法律科技从业者提供了一个可直接复用的模板。

legal-kb 基于 LlamaIndex 的 Index v2(即 LlamaParse Platform)构建,采用 Retrieval Harness 模式。核心创新在于将检索过程分解为四个原子化工具:retrieve(混合语义检索,支持 rerank 及引用来源)、findFiles(精确或模糊文件名搜索)、readFile(带偏移量的原始内容读取)和 grepFile(正则匹配并返回字符位置)。这些工具模拟了人类律师审查文档的工作流:先确定目标文件清单,再从中精确定位相关段落,最后通过正则提取关键条款。

与传统 RAG 的单次 embedding 搜索不同,legal-kb 要求 Agent 首先调用 findFiles 生成候选文件清单,随后依次调用其他工具进行语义检索、内容读取和逐行匹配。这种设计将检索从“一次命中”转变为“多步推理循环”,显著降低幻觉风险。例如,在审查一份跨多版本合同差异时,Agent 可先通过文件名版本号过滤,再检索特定条款的语义相近内容,最终用 grep 定位修改位置并返回字符偏移量供用户快速定位。

底层实现上,legal-kb 基于 Vercel AI SDK 6 的 ToolLoopAgent,允许开发者自由选用 OpenAI 或 Anthropic 模型,并支持用户自带 API key。应用以 TanStack Start web app 形式运行,上传文件后自动解析并建立索引,支持同一文件名重复上传以产生版本,检索时通过版本元数据字段进行过滤。这种架构兼顾了灵活性与安全性——敏感法律文档的 API 调用完全在用户控制下完成。

从行业趋势看,legal-kb 代表了 Agentic RAG 的典型实践:将单一检索节点扩展为多个专业工具的编排。对于从事合同管理系统、尽调平台开发的技术团队,该模板的价值在于:它提供了一套开箱即用的“文件-检索-读取-正则”四阶段流程,开发者只需调整索引配置和 prompt 即可适配自身文档库。尤其值得关注的是 version 字段的元数据过滤能力——这在多轮修订的法律场景中几乎是刚需。

建议团队可在此基础上进一步扩展:例如加入表格提取工具(处理合同中的价格清单)、增加 graph 索引用于关联条款引用,或将 grepFile 替换为更强大的结构化查询(如针对 clause 的搜索)。legal-kb 的发布再次印证:在专业领域,RAG 的下一步不是更大的模型,而是更精细的、模拟人类工作习惯的工具链条。