文章主要内容总结本文介绍了Board Game Arena,这是一个基于Google OpenSpiel库的框架和基准,用于通过策略性棋盘游戏评估大型语言模型(LLMs)的决策能力。该框架支持多种游戏(如井字棋、四子棋、库恩扑克、囚徒困境等),可实现LLM代理与其他类型代理(随机、人类、强化学习代理等)的系统比较。框架核心模块包括:游戏注册与环境:通过装饰器注册游戏,关联OpenSpiel加载器和自定义环境类;代理与策略:实现随机、人类、LLM等代理,LLM代理通过统一后端调用模型并提取行动及推理过程;模拟逻辑:支持回合制和同步游戏,处理行动验证、奖励更新和日志记录,可并行执行;多推理后端:整合LiteLLM(支持百余种托管模型)和vLLM(本地GPU部署),兼顾灵活性与隐私性。此外,框架还设计了结构化提示系统(捕捉游戏状态、合法行动和推理指令),提供全面评估指标(累计奖励、决策最优性、推理质量等),并支持分布式执行(通过Ray)和模块化扩展(便于添加新游戏或代理)。创新点统一评估框架:基于OpenSpiel构建跨游戏的统一接口,首次实现LLM代理与多类型代理在策略游戏中的系统对比;多后端兼容:整合LiteLLM(托管模型)和vLLM(本地部署),支持跨模型提供商的对比实验,兼顾效率与隐私;结构化推理捕捉:设计