当绝大多数RAG系统仍停留在“一次搜索、一段摘要”的浅层应答时,LlamaIndex发布的开源参考应用legal-kb正在重新定义法律文档知识库的交互方式。这一基于Index v2(LlamaParse Platform)的智能体检索示例,并未简单堆砌检索能力,而是引入了Retrieval Harness模式,将AI Agent塑造成一名具备文件系统操作能力的虚拟助理。
legal-kb的核心在于其赋予Agent的四个工具模块:retrieve负责混合语义检索,支持rerank和引用溯源;findFiles可执行精确或模糊文件名搜索;readFile实现带偏移量的原始内容读取;grepFile则通过正则匹配返回字符位置。Agent的典型工作流被设计为多步循环——首先调用findFiles确定文件清单,随后依次使用其他工具定位具体段落。这一设计将传统RAG的“一次搜索-生成答案”拆解为“定位-检索-验证-精读”的多次迭代,大幅提升了复杂法律文档(如合同、法规、尽调报告)中跨文件、跨条款的上下文理解能力。
底层技术架构上,legal-kb运行于Vercel AI SDK 6之上的ToolLoopAgent,支持用户自带API Key选择OpenAI或Anthropic模型。项目以TanStack Start web应用形式呈现,上传文件后自动解析并建立索引,同一文件名重复上传会生成版本,检索时可通过版本元数据字段过滤——这一特性对需要频繁修订的法律文档版本管理尤为关键。
行业背景下,现行多数RAG方案在面对法律文档时存在明显短板:单次检索往往只能获取表面相关片段,却无法像人类律师那样逐步缩小搜索范围、验证上下文。legal-kb模仿的是文件系统惯用的“目录浏览-搜索-阅读-精确查找”逻辑,其价值不仅在于技术实现,更在于提供了一种可复制的多步Agent检索工程范式。对于合同审查和尽调团队而言,这意味着无需从零搭建,即可借用一个开箱即用的多步检索模板。
实用建议方面,团队可直接fork该项目并替换私有文档库,利用其版本溯源能力管理合同迭代历史;若需要更高精度,可替换底层rerank模型或增加自定义工具(如条款分类器)。长远来看,legal-kb展示的趋势清晰:AI Agent正在从“问答机器人”演化为“系统操作员”,通过工具链的编排实现从单次查询到复杂工作流的跃迁。法律、金融等需严格文档验证的领域,将是这一范式最先落地的场景。