当业界热衷于将单个大模型作为智能体核心时,一项新实践揭示了相反路径的价值:用四个来自不同实验室的小模型驱动一场金融模拟游戏。这不是那种“我用GPT写了个游戏”的浅显展示,而是一套可复用的多模型智能体架构方法论。
核心发现:提供vLLM 0.22.1版本异构服务层时,真正的摩擦并非来自模型本身的兼容性,而是CUDA工具包的环境依赖。Thousand Token Wood v2的实践表明,一旦解决了vLLM的部署层问题,模型之间的特性差异反而成为可以正向利用的设计空间。
这套系统打通了五个智能体——分别由gpt-oss-20b、MiniCPM3-4B、Nemotron-Mini-4B以及一个经过微调的Qwen 0.5B模型驱动。关键在于,容忍性JSON解析层充当了“万能适配器”:每个模型只需一条配置即可接入系统,不同实验室的模型不再需要各自独立的专属解析逻辑。这正是多模型架构从理论走向工程可复用的分水岭。
信息隔离是这场博弈游戏的核心。金融模拟中,部分智能体被赋予“内幕信息”,但设计者确保了内幕标志不会出现在模型提示词中,而是通过一个独立的扫描测试来验证是否存在泄露。这种设计思路值得借鉴:不是事后追查泄露,而是从架构层级将隔离作为默认状态。扫描测试通过正则表达式对智能体的输出进行批量检测,确认零泄露。
在记忆管理上,这套系统使用情绪摘要截断机制,用模型对其过去决策的情绪反应作为摘要基础,而非简单的时间或长度裁剪。这避免了长对话中历史行为被淹没的问题——对于小模型而言,降低上下文复杂度比强化记忆更重要。
最具工程参考价值的成果来自微调:Qwen 0.5B模型经过专用训练后,实现了0%的自成交率和100%的有效报价率。小模型在格式生成上高度可靠,但在推理上并不稳定。微调解决了这两个维度的错配:通过结构化的输出约束和针对性训练,让“可靠格式生成器”承担起“可信金融行为模拟器”的功能。
这一实践揭示了一条更务实的多智能体路径:不是让模型更加全能,而是通过结构化提示、容忍性解析和针对性微调,让每个模型在特定维度上做到极致。对于希望构建可信金融或博弈类智能体的团队,这套架构可以直接复制——vLLM的环境配置、JSON解析层、情绪截断策略和防火墙测试逻辑,是整套方案中最具移植价值的方法论。