四个小模型一台戏:金融模拟游戏中的异构智能体实践

当多数人还在追求单一超大模型的能力边界时,Thousand Token Wood v2 走了一条更“笨拙”却更贴近现实的路径:让来自四个不同实验室的小模型——gpt-oss-20b、MiniCPM3-4B、Nemotron-Mini-4B 以及一个微调的 Qwen 0.5B——在同一个金融模拟游戏中扮演不同心智的智能体。这不是“我用GPT写了个游戏”的浅层演示,而是一次对异构多模型协同的严肃工程探索。

项目的核心发现,恰恰戳中许多多模型部署者的隐性痛点:异构服务层的摩擦主要来源于vLLM 0.22.1对CUDA工具包的版本依赖,而非模型本身的推理差异。这意味着,只要搭建好兼容的推理框架,模型之间的“沟通成本”远比预想中低。为此,开发团队设计了一个容错性JSON解析层,即便模型输出格式不规范,系统也能自动修复并提取动作指令。新增一个模型只需在配置文件中添加一条记录——这种“插件化”架构,让多模型混跑真正变得工程可行。

真正的挑战在于信息隔离与博弈公平性。金融模拟中,知情交易者(insider)与普通交易者的优势悬殊。为确保内幕标志不会通过提示词泄露给非知情智能体,项目采用严格的信息隔离:扫描测试在所有交易记录中零泄露。更值得借鉴的是记忆管理策略——通过情绪摘要对历史对话进行截断,而非简单按Token数裁剪,避免了关键决策信息的淹没。而微调后的Qwen 0.5B模型,最终实现了零自成交、100%有效报价,并在“真相防火墙”测试中达到零泄露,证明了小模型在结构化任务中的可靠性。

从行业视角看,这组实验揭示了一个反复出现的规律:小模型是可靠的格式生成器,但不可靠的推理器。要弥补这一缺陷,路径在于结构化输出约束、细化提示词、以及针对特定行为的微调。对于资源有限的团队,这种方法论比堆砌大模型更具性价比。vLLM的踩坑记录(CUDA工具包版本兼容问题)可以直接抄作业;信息隔离的扫描测试方法也能复用到其他多智能体场景。

趋势上,这类多模型、异构智能体的金融模拟游戏,正在成为检验小模型协作能力的最佳沙盒。未来,当推理成本持续下降、小模型专长更加分明时,通过微调+结构化提示+异构服务层的组合拳,或将催生一批低成本、高鲁棒性的多智能体应用。对于开发者而言,从这篇实践报告中提取的“vLLM踩坑指南”和“防火墙测试清单”,比任何理论推演都更具落地价值。