2026-06-05 11:07 乐趣下载
xiayx 10 月 4 日消息,据 decoder 今天报道,腾讯研究人员近期以王者荣耀游戏为训练平台,探索如何让 AI 在游戏中实现“战略性思考”,并研发了名为 TiG(Think in Games)的全新框架。相关成果已在 Hugging Face 平台和 arXiv 期刊上发表。

研究团队指出,当前 AI 模型存在明显的功能鸿沟。以游戏为取向的 AI 能够正常进行游戏,但无法理解自身所做出的决策;而语言模型虽然能进行策略推理,却难以真正执行具体操作。为解决这一问题,他们开发了全新的 TiG 框架,使模型能够在游戏中同步进行思考与行动。

团队选择王者荣耀作为训练范本,首先使用匿名且标准化的赛事数据,定义了推上路、击杀暴君、守家等 40 种宏观行动。胜负回数保持均衡,AI 模型需在每个设定场景中选择最佳策略,并解释其战略依据。

具体来说,训练分为两个阶段。首先在监督学习阶段,模型需要掌握这些策略的基本机制;随后通过奖励机制进行强化学习,行动正确得 1 分,错误行动得 0 分。

随后,团队测试了多种语言模型,涵盖 Qwen2.5-7B、14B、32B 以及 Qwen3-14B,并使用 DeepSeek-R1 大模型作为对照组。首先从 DeepSeek-R1 中提炼高质量训练数据,然后采用群体相对策略优化(GRPO)技术,比较不同策略的优劣。

最终,经过 TiG 框架训练的模型不仅能制定行动计划,还能解释决策原因。例如,AI 能够指出某个防御塔防守薄弱,是理想的进攻目标,但同时需要注意埋伏的敌人。模型训练后仍保持原有的文本理解、数学推理与问答能力。

对照组 DeepSeek-R1:决策准确率达 86.67%
Qwen3-14B:决策准确率达 90.91%,超越 DeepSeek-R1
Qwen2.5-32B :准确率从 66.67% 提升至 86.84%
Qwen2.5-14B:准确率从 53.25% 提升至 83.12%
