LlamaIndex 开源 legal-kb:用智能体将法律文档检索变成“找—搜—读—查”四步工作流

LlamaIndex 正式开源了 legal-kb,一个面向法律文档的知识库参考应用。它没有停留在常规的“一问一答”式 RAG,而是将检索拆解为智能体驱动的多步工作流:Agent 先定位文件、再执行混合搜索、再读取原文、最后用正则精确探查——这一设计让 RAG 从一次性的“打地鼠”变成了结构化的“侦探链条”。

整套系统基于 LlamaIndex Index v2(LlamaParse Platform)构建,并采用了 Retrieval Harness 模式。Agent 拥有四个文件系统风格的工具:findFiles(支持精确或模糊文件名搜索)用于确定候选文件清单;retrieve 执行混合语义检索,内置重排序(rerank)与引用机制;readFile 支持带偏移量的原始内容读取;grepFile 则实现正则匹配并返回字符位置。Agent 必须按顺序调用这些工具:先通过 findFiles 拿到文件名列表,再依次使用 retrieve、readFile 和 grepFile 深入内容层,而非一次请求就给出答案。

这种“先找文件、再搜片段、再读原文、再精查”的流程,恰恰切中了法律文档与合同审查的痛点——传统的 RAG 通常把整个知识库视为一个扁平池子,一次检索就返回 Top-K 片段,忽略了“哪个文档、哪个版本、哪一行”的上下文完整性问题。而 legal-kb 的 Agent 能感知文件、行号、版本元数据,甚至通过正则定位条款的具体字符位置,等于将“文件系统”和“检索系统”合二为一。

底层由 Vercel AI SDK 6 的 ToolLoopAgent 驱动,支持用户自带 API key 并自由选择 OpenAI 或 Anthropic 的模型。项目以 TanStack Start web app 形式运行,上传文件后自动解析索引;同一文件名重复上传会生成版本,检索时可通过版本元数据字段精确过滤。这意味着企业可以直接将其部署为内部尽调或合同管理工具,无需从零搭建 Agent 框架。

对于合同审查团队和尽调顾问来说,legal-kb 提供了一个“可抄的模板”——它示范了如何用工具调用(tool calling)将 RAG 从一次搜索升级为多步推理循环,同时保留了易部署、可扩展的特性。这一思路的背后是 AI agent 从“回答生成器”向“任务执行器”的转变:在知识密集领域,问题的答案往往藏在“找到文件→定位片段→逐行验证”的链条里。未来,类似的“工具化检索”很可能取代传统的单一搜索 API,成为 agent 与企业知识库交互的标准范式。