法律文档检索正从一次性的语义搜索转向多步骤的智能体协作。LlamaIndex最新发布的legal-kb参考应用,正是这一趋势的典型代表。该项目不仅是一个知识库,更是一套可复用的智能体设计模板,直接回应了合同审查与尽职调查场景中高精度、多步骤、可追溯的检索需求。
legal-kb基于LlamaIndex的Index v2(LlamaParse Platform)构建,核心创新在于采用Retrieval Harness模式。不同于传统RAG的一次查询即返回结果,该模式赋予Agent四个类文件系统的工具,形成一个强制性的检索闭环:首先,Agent调用findFiles进行精确或模糊的文件名搜索,确定需要审阅的文件清单;随后,使用retrieve执行混合语义检索,结合重排序与引用功能,定位相关段落;接着,通过readFile读取带偏移量的原始内容,确保上下文的完整性;最后,利用grepFile进行正则匹配,返回精确字符位置,用于验证或定位特定条款。这一流程模拟了人类律师“先找文件、再搜索、再阅读、再核对”的思维链条,大幅降低了大模型在不熟悉文档结构时产生的“猜测”风险。
在技术栈层面,legal-kb充分利用了Vercel AI SDK 6的ToolLoopAgent能力,支持用户自携带OpenAI或Anthropic API密钥,实现模型的灵活切换。项目以TanStack Start web应用形式运行,上传文档后自动解析并建立索引,值得关注的是其版本控制机制:同一文件名重复上传会生成不同版本,检索时可通过版本元数据字段进行精细过滤,这对于处理多轮修订的合同或法规文件极为实用。
从行业视角看,legal-kb的价值远超一个技术示范。它标志着RAG从“黑箱式搜索”向“透明化工作流”的进化——不是简单地回答问题,而是遵循可解释的步骤链。对于合同审查、尽调等需要严格溯源的领域,这种设计能显著提升输出的可信度。建议开发团队将这种“先定位、再检索、再验证”的模式作为一个通用模板,集成到自有法律AI系统中,以降低大模型幻觉风险。未来,智能体驱动的多步检索很可能成为专业文档处理的标配,而legal-kb提供了值得借鉴的起点。