谷歌DeepMind扩围AI基准:引入狼人杀与扑克,考验Agent的社交与博弈能力
Google DeepMind宣布扩展Kaggle Game Arena平台,在原有的国际象棋基础上,新增“狼人杀”和扑克两项基准测试。此举旨在突破传统“完美信息”游戏的局限,重点评估AI模型在信息不完美环境下的表现。其中,“狼人杀”通过自...
标签索引 / 第 2 页
这个标签下有 13 篇文章。按时间回看相关判断与实践记录。
标签精选
Google DeepMind宣布扩展Kaggle Game Arena平台,在原有的国际象棋基础上,新增“狼人杀”和扑克两项基准测试。此举旨在突破传统“完美信息”游戏的局限,重点评估AI模型在信息不完美环境下的表现。其中,“狼人杀”通过自...
TetrisBench是一个新兴的AI模型基准测试平台,通过俄罗斯方块对战来评估AI的实时决策与空间推理能力。最新测试结果显示令人惊讶的数据:谷歌推出的轻量级模型Gemini Flash,在与Anthropic顶级旗舰模型Claude 3 ...
SnapBench是一项测试大模型具身智能能力的基准实验,要求模型在3D世界中驾驶无人机寻找并识别生物。在对7款前沿LLM的测试中,仅有价格最低的Gemini Flash成功完成任务,而公认的“最强模型”Claude Opus却因无法控制俯...