Loading
CLOUD09_SPACE
0%
INITIALIZING
友情链接
关于我
🗒️
English
Self-playing Adversarial Language Game Enhances LLM Reasoning
DOC_ID // 37c226ONLINE

Self-playing Adversarial Language Game Enhances LLM Reasoning

2026-6-11
UPDATED: 2026-6-12
论文阅读
2244 CHARS
#AI
CLOUD09

整体思路

让开源 LLM 分别扮演 attacker 和 defender,在大量目标词上 self-play,然后基于游戏结果做 reinforcement learning,并观察到多个 reasoning benchmark 上的稳定提升。

要解决的问题

现有提升大语言模型推理能力的方法包括思维链prompt、工具调用、对推理数据进行监督微调,以及利用模型生成数据实现自我改进。然而这些方法均存在局限:基于提示的方法对提示设计极为敏感;微调需要高质量推理数据;自我改进方法通常依赖大模型生成的判断,而这些判断可能存在偏见或不可靠。
这时考虑到AlphaGo Zero,他的训练其实是自己产生训练信号的,(不过也是因为有一个棋盘和规则作为环境)

Self-Play (Adversarial Taboo)

💡
Taboo 原本是一种经典桌游/猜词游戏。规则大概是:一个人要让队友猜出目标词,但自己不能直接说出目标词,也不能说某些禁用词。比如目标词是 “苹果”,你可以说 “一种绿色或红色的水果”,但不能直接说 “苹果”。
作者引入了Self-Play,是要实现LLM自己产生训练信号,那么这就需要和AlphaGo等等强化学习算法一样,也构造一个环境,让智能体/LLM在这个环境中探索。
根据强化学习的要求和LLM的特点,这个环境需要满足三个条件:
  • 强化学习中要定义智能体的行动策略,因为这里是用LLM,因此动作是文本
  • 推理是有目的的,不能闲聊。就像Alpha Go有一个最终目标是赢得游戏一样
  • 可以自动判断胜负。
于是作者设计了如下的游戏规则:
  • attacker 知道目标词;
  • defender 不知道目标词;
  • attacker 要诱导 defender 无意识说出目标词;
  • defender 要根据对话推断目标词,同时避免误说;
  • 如果 defender 无意识说出目标词,attacker 赢;
  • 如果 defender 用规定格式正确猜出目标词,defender 赢。
notion image
比如上面这张图,红色的是attacker,蓝色的是defender
attacker知道目标词,defender不知道
右边的对话中,defender用正确的格式故意猜出来这个词,于是defender赢
左边对话中,defender没有用正确的格式说出来,而是不小心说出来,这时defender输。

训练方式

当时作者能训练的开源模型的能力有限,基本不会玩这个游戏,因此他需要先告诉LLM怎么玩。
首先让GPT-4自己玩,一边当attacker,一边当defender,产生了很多游戏数据
把attacker赢的局里attack的发言和defender赢的局里defender的发言筛选出来,训练一下开源模型,让开源模型学会了如何玩这个游戏
然后重新玩上面的游戏,这次自己训练自己就可以了。
notion image

Game定义

在这篇文章中,作者把游戏定义为 ,分别是状态S,动作A,状态转移F,奖励r,这和强化学习的定义套路是一样的,毕竟他是从AlphaGo发展来的方法。
notion image
💡
状态S是当前游戏进行到哪一步,动作A是玩家下一步能做什么,状态转移F表示说完这句话后游戏如何变化,r是根据游戏规则给出的胜负反馈。

状态S

在这个游戏中,状态S就是目标词语+对话历史, 定义w是目标词语,那么初始状态就是
第t轮attacker说完话之后
第t轮defender说完后
💡
是attacker的第t轮发言,以attacker发言结尾的是
是defender的第t轮发言,以defender发言结尾的是

动作A

动作就是一段自然语言(LLM根据当前的对话历史能采取的动作只有说话,说一段话)

状态转移F

状态转移很简单,新状态就是旧状态后面加上最新的文本,这个状态转移也是一个确定的状态转移。

奖励r

奖励由游戏结果决定。如果defender无意识说出目标词,attacker赢;如果defender用规定格式正确猜出目标词,defender赢;如果最大轮数结束没人赢,就是平局。
游戏结果
attacker reward
defender reward
attacker 赢
+1
-1
defender 赢
-1
+1
平局
0
0
因此作者定义attacker的总回报 ,defender的总回报
这样的话,attacker会想办法让自己的回报变大,defender会想办法把 变小

self-play目标

如果我们把一局游戏的轨迹写成
那么这个轨迹出现的概率就是
一局游戏由目标词采样开始,然后attacker和defender轮流发言,所以整局轨迹概率就是每一步发言概率的乘积,那么self-play训练的目标就是

游戏模仿

现在我们通过GPT的数据来学习如何玩这个游戏
如果一局游戏是attacker赢了,那么就让模型学习attacker这一轮的发言,用下面这个loss让模型模仿每一次输出。
如果是defender赢了,那么就让模型学习defender这一轮的发言,用下面这个loss让模型模仿每一次输出。
💡
是参考策略,也是开源模型的,和我们正在训练的那套参数唯一的区别就是,变化比最新的参数要慢,用来防止学的太激进了
作者提到说,这里不用失败的轨迹是因为这样会破坏语言能力,有些得不偿失。
 

Self-Play RL Loss

学会了如何玩游戏,下一步是自己玩游戏了。
这里作者用了两个模型副本,一个是备份 ,更新慢一步,一个是最新模型
先从旧模型 采样一个轨迹 ,然后让模型根据自己的成功轨迹学习,思路和刚才学习玩游戏是一样的,只不过由于这次是通过采样自己来训练自己,所以要用强化学习的trick对损失函数进行一下变形。
其中 可以认为是对当前模型输出方案的奖励,具体细节是强化学习的内容。比值是新旧模型输出概率的比值,用来调整两个模型参数的偏差导致的训练偏差。
这两个概率在工程上是对已经生成好的句子做一次forward,每个token都有一个softmax概率,然后取target token的log probability,进而算出来的。

实验

训练数据

训练用的words是从COCA高频词表中选50K常用词(不包含停止符等等);
用其中的top 30K target words收集GPT-4玩游戏的轨迹;
最后训练模型的时候用Alpaca SFT data instruction-following data参与训练,防止模型过拟合游戏。

实验结果

notion image
notion image
作者在这里对两个模型分别做了两个实验,一个是通用推理能力,另一个是训练好的模型和GPT进行上述的words游戏。
可以看到SPGA在大多数数据集上的推理能力都有明显提升,并且游戏胜率也是最高的。

消融实验

消融实验一

作者用消融实验来验证,上述性能提升来自于words游戏而不是SFT
消融实验的结果也在上表中,Alpaca-SFT-[1,3]就是不用words游戏,只有SFT[1,3]轮的性能,发现只用SFT的是比不过带words游戏的(SPAG-[1,3])

消融实验二

是不是任何语言游戏 self-play 都有效?
作者用另外两个words-based游戏(20-Question和Guess-My-City)的训练性能对比,Adversarial Taboo 明显比非对抗游戏更有效

消融实验三

是不是一开始用的GPT轨迹数据越多越好呢?
notion image
数据量从很少增加到 5K 左右时,性能提升比较明显;但超过 5K 后,继续增加 GPT-4 imitation data,收益变小。所以说明GPT的数据主要功能是让模型学会游戏规则。

消融实验四

开源模型self-play阶段的训练次数是不是越多越好?
notion image
增加 self-play episodes 一般会带来更高 reasoning score,但提升没有 imitation 阶段那么剧烈。(纵坐标也是GM Score)

Limitation

SPAG不是完全从零开始,因为第一阶段需要GPT-4轨迹做来学习如何玩游戏,其实不算完全自己产生信号进行训练吧,并且做起来很麻烦。
原论文只测试了 LLaMA-2-7B 和 Baichuan-2-13B,没有证明在更大模型上同样有效
作者猜测Taboo训练到的是一些通用能力,比如语义推断、隐变量识别、对话历史建模和策略表达,所以这个方案能work。
NAVIGATION // Related Articles
Loading...
© 2021-2026 Echocean