小模型大棋局:Thousand Token Wood v2如何用四款异构模型构建金融博弈系统

当开源大模型的竞赛陷入参数规模的内卷时,一篇来自Hugging Face的技术博客“Thousand Token Wood v2”提供了另一种思路:与其追逐单一巨兽,不如让多个“小心智”协同博弈。项目没有使用任何超过20B参数的模型,而是组合了来自四个不同实验室的小模型——包括Meta的GPT-OSS-20B、面壁智能的MiniCPM3-4B、NVIDIA的Nemotron-Mini-4B以及团队自微调的Qwen 0.5B——将它们分别作为金融模拟游戏中的独立智能体。这种“多模型、多心智”的架构,其真正的价值不在于演示“用AI写游戏”,而在于暴露和解决了多模型系统在工程实践中的核心矛盾。

服务层摩擦是真正的“鬼故事”。项目团队在部署初期就遭遇了vLLM 0.22.1版本与CUDA工具包的严格依赖问题——这种底层环境的耦合度远超模型本身的可移植性。为了解决不同模型在输出格式上的差异,他们设计了一个容忍性JSON解析层,能够自动处理模型间结构化输出的偏差。最终,添加一个新模型只需要修改一行配置文件。这一设计将服务层面的复杂度从“模型级”降为“配置级”,使得多模型编排从实验室玩具变为可工程化的基础设施。

信息隔离是金融博弈的生命线。在模拟游戏中,交易智能体可能利用内幕信息进行不公平交易。项目采用了一种彻底的隔离方案:将内幕标志从提示词中完全剥离,并通过扫描测试验证输出中无任何泄露。同时,为了防止长对话中历史记忆淹没关键信号,团队引入了情绪摘要截断策略——只保留智能体对关键事件的情绪评分,而非完整对话历史。这种做法不仅控制了token消耗,也更接近真实交易者的信息处理模式:只记忆“有利空”还是“有利多”,而非每一条新闻。

微调0.5B模型带来了惊喜。通过针对金融规则进行微调,这个超小模型实现了0%的自成交(即不与同阵营智能体交易)和100%的有效报价率,且通过了“真相防火墙”的零泄露测试。这揭示了一个反直觉的结论:小模型在结构化任务(格式输出、规则遵守)上表现可靠,甚至可以超越大模型;但在复杂推理(比如跨步骤的逻辑推导)中,它们依然是不稳定的推理器。因此,团队通过结构化提示词、输出约束和领域微调,有效弥补了其推理短板。

从行业趋势看,这个项目提供了一个现成的工程模板:当你想构建多智能体系统时,不必一开始就追求最大参数模型。小模型成本低、延迟低、更容易部署,只需配合合适的工程架构(异构服务层、配置化接入、信息隔离和记忆压缩),就完全可以在特定领域取得超越。项目已开源全部代码和测试方法,尤其是vLLM踩坑记录和防火墙测试脚本,可以直接作为实战参考。

未来,AI应用的演进方向大概率会从“一个大模型统治一切”转向“多个专用模型协同工作”。Thousand Token Wood v2的价值正在于:它用实际行动证明了异构模型组合的可行性,并给出了可以落地的工程细节。毕竟,真正的博弈感,从来不是靠一个无所不能的“上帝模型”赢得的,而是来自多个各有缺陷但彼此制衡的智能体之间的动态平衡。