RL训出20B检索Agent:开源召回率碾压GritLM等同类11.4点

RAG系统的核心瓶颈之一是检索质量,而非生成步骤。业界过去将大量算力投入生成模型的规模化,却忽视了检索端在复杂信息场景中的决策能力——何时停止搜索、哪些片段值得验证、如何聚合碎片化证据,这些策略性问题并未得到强化学习范式的系统优化。UIUC与Chroma联合推出的Harness-1,直接切入这一痛点:一个参数量仅20B、通过强化学习在有状态搜索框架中训练的检索子Agent,在8个跨领域基准测试上录得0.730平均curated recall,远超GritLM等开源方案11.4个百分点,性能已逼近闭源代表Opus-4.6(差距仅0.046)。

Harness-1的技术架构值得拆解。传统检索Agent通常以无状态方式运行,每一次搜索动作独立于历史,导致关键信息在反复查询中丢失。而Harness-1维护了一个结构化状态空间——包含候选池、重要性标注集、证据图与验证记录,由策略网络动态决定四个核心动作:搜索新内容、筛选已有候选、验证置信度以及终止搜索。这种设计本质上是将检索视为一个部分可观测马尔可夫决策过程(POMDP)的逐轮优化,状态完整记录了过去全部检索路径与推理线索的语义关联,而非简单拼接文本历史。

训练方面,Harness-1使用强化学习,而非更常见的监督微调。RL的优势在于能针对搜索任务的非确定性反馈——即模型可能面对多个看似合理但实际上暗含冲突的信息源。Reward模型评估最终证据图的准确性、覆盖度与冗余度,迫使策略学会在信息密度与搜索成本之间做出权衡。例如,面对“某事件时空跨度与因果链”这类多维查询,Harness-1能主动收拢看似分散但逻辑相关的碎片,而非无休止地追加搜索。

对比GritLM这类基于指令微调的检索Agent,差距的根源并不在于参数规模,而在于训练目标。GritLM更多是对预训练模型做QA类指令对齐,而Harness-1直接用召回率作为reward信号进行策略优化,使得搜索行为与最终评估指标产生了因果联系。也正因如此,Harness-1将其核心竞争者定位为闭源系统Opus-4.6,而非同级开源模型。

对RAG产品团队而言,开源的Harness-1提供了两个直接价值:一是可以直接部署的权重,二是整套Harness框架,允许自定义搜索策略、验证规则与状态结构,接入私有知识库。如果团队正在处理需要多轮验证、多源交叉引用的复杂场景,这个Agent值得深度测试。未来,检索端Agent的RL训练可能复制LLM对话模型的演进轨迹:从无状态指令跟随转向有状态策略学习,开源方案与闭源的差距将迅速收敛至几个百分点以内。RAG正在从“以模型为中心”转向“以系统中心”。