当RAG(检索增强生成)从“单次查询-返回”进化为“多步推理-工具调用”,企业级知识库才真正具备了处理复杂文档的智能。LlamaIndex最新开源的legal-kb正是这一趋势的典型代表——它并非简单的检索系统,而是一个基于Index v2(LlamaParse Platform)构建的、面向法律文档的智能体参考应用,其设计思路值得任何处理非结构化文档的团队深入研究。
传统RAG的局限在于:一次语义搜索就试图从海量文档中定位答案,缺乏对文档结构、版本、精确匹配等要素的细粒度控制。legal-kb采用Retrieval Harness模式,赋予Agent四个文件系统风格的工具,模拟人类审查文档的逐步过程:首先findFiles通过精确或模糊文件名搜索确定文件清单,然后依次使用retrieve(混合语义检索,支持rerank与引用)、readFile(带偏移量的原始内容读取)和grepFile(正则匹配并返回字符位置)。这一流程意味着Agent不再“一把抓”,而是先确认文档集合,再在特定文档内部进行深度检索,最后用精确匹配锁定关键条款。
底层实现上,legal-kb基于Vercel AI SDK 6的ToolLoopAgent,支持用户自带API key,可选OpenAI或Anthropic模型。项目以TanStack Start web app形式运行,上传文件后自动解析并建立索引。值得关注的是其版本管理机制:同一文件名重复上传产生版本,检索时通过版本元数据字段过滤。这一设计对法律文档的迭代修订场景尤为关键——律师需要明确引用最新版本或特定历史版本,而非被模糊语义混淆。
与主流RAG框架(如LangChain的检索链、Haystack的管道)相比,legal-kb的差异化在于显式地将检索任务分解为多个原子操作,并强制Agent按顺序执行。这种设计牺牲了一部分端到端的自动化,但换来了更高的可控性和可解释性。对于合同审查、尽职调查等需要精确引用条款行数的场景,一次语义匹配的误召回可能带来合规风险;而通过grepFile的正则匹配与readFile的偏移量读取,Agent能够输出确切的字符位置,让人类专家快速核验。
从行业视角看,legal-kb不仅是一个开源项目,更是RAG向“智能体式检索”演进的实验模板。它暗示了未来企业知识库的形态:不再是静态的“索引-搜索-问答”三角,而是由Agent驱动的、迭代推理的“搜索-阅读-验证-再搜索”循环。对正在构建内部知识系统的法务或合规团队而言,该项目提供了可直接修改的前端、工具定义与Agent编排逻辑,上手成本极低。值得注意的改进方向包括:增加对PDF表格和扫描件的解析能力(当前依赖LlamaParse的OCR能力)、引入多Agent协作(如一个Agent负责目录导航,另一个负责精读)。Agent化RAG的普及,将使得“让AI像资深律师一样翻卷宗”不再是一句口号。