验证器能提供可靠的正确性,但一个终局奖励无法指出长轨迹中哪些推理决策真正有用或具有误导性。
FlowBalance · Tencent HY LLM Frontier · 2026 年 8 月
FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
让稠密推理反馈始终服从可验证结果。
FlowBalance 从 FlowRL 的分布式推理视角出发,在不引入独立模仿损失的前提下加入稠密特权监督。验证器优势决定结果方向,冻结的自教师细化每条采样轨迹,带剖面的轨迹平衡则学习由此得到的、受参考策略支撑的完整回答分布。
第一部分
动机
给定问题 $x$,推理策略生成一条完整回答 $y=(y_1,\ldots,y_T)\sim\pi_\theta(\cdot\mid x)$。验证器返回结果信号 $r(x,y)$,例如最终答案是否正确。所有成功回答组成集合
这个集合通常不只包含一条轨迹。不同回答可以通过不同的数学表示、中间论证或解题策略得到同一个正确答案。因此,训练推理模型不仅要提高 $\Pr_{y\sim\pi_\theta}[r(x,y)=1]$,还需要回答一个分布层面的问题:概率应当如何分配在 $\mathcal Y^+(x)$ 内部?
带参考解的自教师可能高置信度支持貌似合理的错误轨迹,抑制探索,或让回答迅速变短。
把结果优势与逐 token 教师证据合成为轨迹能量,再归一化为完整回答上的目标分布。
为什么稀疏强化学习与局部蒸馏仍然不够?
只看结果的强化学习方向可靠,却几乎不提供轨迹内部的信息;局部蒸馏信息稠密,却不能保证与可验证正确性一致。把二者简单写成两个损失,仍然没有规定策略最终应学习怎样的归一化完整回答分布。
FlowBalance 在目标分布的设计层面解决冲突:验证器决定教师支持应强化还是抑制一条轨迹。 合成能量对固定参考策略进行指数倾斜,共享配分函数再把相对偏好转化为每个 rollout 组上的概率分布。
第二部分
方法
FlowBalance 从 FlowRL 出发,只修改其回答能量。对每个在策略 rollout 组,验证器给出停止梯度的组相对优势 $A_i$;冻结的 rollout 模型再获得参考解答等特权上下文并重评每个已采样 token。相对于参考策略、经过裁剪的平均对数概率增益构成轨迹信号 $G_T(y_i)$。
在不使用特权上下文的情况下,生成一组完整回答。
验证器提供结果监督,特权教师提供稠密的轨迹评分。
将两类信号转化为采样回答上的归一化目标分布。
得到的能量并不直接更新策略,而是先规定每条完整回答应获得多少相对概率质量:
$\pi_{\mathrm{ref}}$
保留初始模型的分布支撑,而不是无约束地模仿教师。
$A_i$
用验证器导出的组相对正确性区分不同回答。
$G_T(y_i)$
将完整采样轨迹上的稠密特权反馈汇总为轨迹信号。
$Z_{\mathcal G}$
将相对偏好转化为该问题上的概率分布。
分布性质FlowBalance 是达到目标能量水平所需的最小参考分布偏移。+
在给定的 rollout 组上,令 $p_i^\star\propto\pi_{\mathrm{ref}}(y_i)e^{E_i/\tau}$。对任意组分布 $p$,
$$\mathrm{KL}(p\|\pi_{\mathrm{ref}})=\mathrm{KL}(p^\star\|\pi_{\mathrm{ref}})+\mathrm{KL}(p\|p^\star)+\frac{\mathbb E_p[E]-\mathbb E_{p^\star}[E]}{\tau}.$$在期望能量不低于目标分布的所有分布中,$p^\star$ 唯一最小化相对于参考分布的反向 KL。
第三部分
轨迹平衡
FlowBalance 已经定义了完整回答上的目标分布。轨迹平衡将这个分布转化为可训练的条件:如果学生策略匹配目标,那么每条采样回答 $y_i$ 都必须满足
取对数并将所有项移到等式一侧,得到轨迹平衡残差:
FlowBalance 在整个 rollout 组上最小化残差平方:
梯度通过学生 token 对数概率之和传播,但平衡条件施加在完整回答的概率上。
同一问题的所有回答共享 $Z_{\mathcal G}$,从而将轨迹能量转化为归一化分布,而不是彼此独立的分数。
每条回答都隐含一个 $\log Z$ 估计;FlowBalance 使用组内均值,并对该估计停止梯度。
相对偏好保持剖面化一个标量 $Z$ 会保留所有回答对之间的偏好。−
当剖面化轨迹平衡损失为零时,对参考策略支撑上的任意 $i,j$,
$$\frac{\pi_\theta(y_i\mid x)}{\pi_\theta(y_j\mid x)} =\frac{\pi_{\mathrm{ref}}(y_i\mid x)}{\pi_{\mathrm{ref}}(y_j\mid x)} \exp\!\left(\frac{E_i-E_j}{\tau}\right).$$共享配分函数在概率比中相消。它只移除一个组级公共偏移,同时保留全部 $N-1$ 个相对概率方向。
第四部分
FlowBalance 应该何时信任特权教师?
特权似然与验证器正确性是两类不同信号。教师可能为一条逻辑连贯、但被验证器判错的回答赋予正增益。因此,FlowBalance 用 $A_i$ 的符号作为门控:教师增益会提高正优势回答的能量、降低负优势回答的能量,并在 $A_i=0$ 时消失。
验证通过
遵循教师支持。
验证拒绝
反转教师压力。
调节权重,观察分布如何变化
这个示例 rollout 组包含两条验证通过的回答和两条被拒绝的回答。每条回答从参考概率 $\pi_{\mathrm{ref}}(y_i)$ 出发,并获得 FlowBalance 能量
验证器权重 $\eta_A$将概率质量从被拒绝回答移向验证通过的回答。
教师权重 $\beta_T$利用特权推理反馈调整回答间的相对偏好。
符号门控保证教师对错误回答的支持会转化为偏向正确回答的概率修正。+
考虑同一混合结果 rollout 组中的一条验证通过回答 $y_+$ 和一条被验证器拒绝的回答 $y_-$。与其他条件相同但不使用门控的教师塑形相比,符号门控将它们的目标概率比改变为
$$\frac{p^\star_{\mathrm{gated}}(y_+)}{p^\star_{\mathrm{gated}}(y_-)} =\frac{p^\star_{\mathrm{ungated}}(y_+)}{p^\star_{\mathrm{ungated}}(y_-)} \exp\!\left(\frac{2\beta_TG_T(y_-\mid x,c)}{\tau}\right).$$因此,当特权教师为被拒绝回答赋予正增益时,门控会将这份支持从模仿压力转化为正确回答相对于错误回答的概率比增益。
第五部分
实验
在 Qwen3-4B 和 Qwen3-8B 上,FlowBalance 都取得了最高的五项基准平均分。Qwen3-4B 的平均分为 64.26,比 GRPO 高 1.95 分;Qwen3-8B 的平均分为 67.61,比 GRPO 高 2.12 分。训练曲线还显示,FlowBalance 比 GRPO 收敛更快、更稳定,并避免了直接 OPSD 的回答长度塌缩。



相对 GRPO 的五基准平均分提升(总平均分 64.26)。
相对 GRPO 的五基准平均分提升(总平均分 67.61)。
约 100 步达到 0.5 验证准确率,GRPO 约需 143 步。
+ 高于 GRPO- 低于 GRPO
| 模型 | 方法 | AIME24@16 | HMMT25@1 | Minerva@1 | MATH500@1 | Olympiad@1 | Avg. |
|---|---|---|---|---|---|---|---|
| Qwen3-4B | GRPO 基线 | 78.00 | 26.67 | 51.18 | 92.04 | 63.68 | 62.31 |
| OPSD | 65.33-12.67 | 14.67-12.00 | 47.28-3.90 | 87.56-4.48 | 55.76-7.92 | 54.12-8.19 | |
| RLSD | 73.33-4.67 | 21.33-5.34 | 50.29-0.89 | 91.44-0.60 | 61.36-2.32 | 59.55-2.76 | |
| FlowRL | 75.33-2.67 | 30.67+4.00 | 51.99+0.81 | 92.84+0.80 | 65.25+1.57 | 63.22+0.91 | |
| FlowBalance | 80.00+2.00 | 32.00+5.33 | 50.51-0.67 | 93.28+1.24 | 65.49+1.81 | 64.26+1.95 | |
| Qwen3-8B | GRPO 基线 | 85.33 | 31.33 | 52.87 | 93.16 | 64.78 | 65.49 |
| OPSD | 48.67-36.66 | 4.00-27.33 | 38.46-14.41 | 74.56-18.60 | 40.09-24.69 | 41.16-24.33 | |
| RLSD | 82.67-2.66 | 28.00-3.33 | 52.94+0.07 | 93.44+0.28 | 63.56-1.22 | 64.12-1.37 | |
| FlowRL | 86.67+1.34 | 30.67-0.66 | 52.79-0.08 | 92.92-0.24 | 66.20+1.42 | 65.85+0.36 | |
| FlowBalance | 89.33+4.00 | 34.67+3.34 | 53.68+0.81 | 93.52+0.36 | 66.85+2.07 | 67.61+2.12 |
第六部分
多样性分析
我们使用 GPT-5.5 从每条完整 AIME24 轨迹中提取核心数学表示与工具,再依据语义策略而非措辞或回答长度,对匿名摘要进行聚类。聚类完成后才揭示正确性标签,并在正确轨迹上用下式计算多样性:
其中 $p_k$ 是正确轨迹落入策略簇 $k$ 的比例;等价地,$D_{\mathrm{Simpson}}$ 表示随机抽取两条正确轨迹时,它们采用不同策略的概率。
汇总指标说明 FlowBalance 能采样到更多样的正确策略;下面的轨迹进一步展示这种差异在数学上究竟意味着什么。这里按照论文方框标出的关键步骤,概括真正支撑每条推导的表示与判据。
案例分析:用不同数学对象得到同一个答案
AIME24 第 23 题。 一个四面体的三组对边长度分别为 $\sqrt{41}$、$\sqrt{80}$ 和 $\sqrt{89}$,求其内切球半径表达式。
Cayley–Menger 行列式
将四面体表示为六条两两距离,构造距离矩阵,利用对称性,并通过距离不变量求出体积。
隐藏的长方体嵌入
识别 $41=4^2+5^2$、$80=4^2+8^2$ 和 $89=5^2+8^2$;将顶点嵌入一个 $4\times5\times8$ 的长方体,并用标量三重积计算体积。
结果。 两条路线都得到面面积 $24\sqrt{21}$、体积 $160/3$、内切球半径 $20\sqrt{21}/63$,最终答案为 $104$。差异在于解题结构:前者把四面体视为六条距离,后者发现了一个让这些距离一目了然的坐标对象。
另外三个 FlowBalance 案例
这些案例来自同一次 seed-0、step-180、每题 16 次采样的 AIME24 实验。每一对轨迹的最终答案一致,但核心数学对象不同。
AIME24 第 5 题。 一条单位长度线段连接两条正坐标轴。求给定线段上不属于该族其他线段的唯一内点,并计算 $OC^2$。
包络线与星形线
把单位截距线族写成 $F(x,y,u)=x/u+y/\sqrt{1-u^2}-1$。联立 $F=F_u=0$ 得到包络线 $x^{2/3}+y^{2/3}=1$;题目给定线段对应 $u=1/2$。
重根唯一性
参数化线段上的点,并要求已知直线成为一元三角关联方程的二重根。导数条件直接给出 $t=3/4$。
结果。 两条路线都得到 $C=(1/8,3\sqrt3/8)$,因此 $OC^2=7/16$,答案为 $23$。一条路线使用整个直线族的全局包络,另一条则通过重根在局部识别唯一性。
AIME24 第 15 题。 半径为 11 的球与一个环面相切;该环面由半径为 3、圆心距旋转轴 6 的圆旋转而成。比较两条接触圆的半径。
子午截面相切
取经过旋转轴的平面,把三维接触降为半径 $3$ 与 $11$ 的两个圆相切;两种相切情形的圆心距分别为 $8$ 与 $14$。
隐式曲面法向量
在柱坐标中保留环面与球面的隐式方程。相切处法向量共线,把问题化为 $\rho/|\rho-6|=11/3$。
结果。 两种推导都得到 $r_i=33/4$、$r_o=33/7$,所以 $r_i-r_o=99/28$,答案为 $127$。前者改变问题维度,后者则用微分相切条件直接处理原始曲面。
AIME24 第 27 题。 一个菱形的四个顶点位于双曲线 $x^2/20-y^2/24=1$ 上,对角线交于原点。求对所有此类菱形都严格小于 $BD^2$ 的最大实数。
坐标消元
用 $(a,b)$ 与 $(c,d)$ 表示两组对顶点,利用对角线垂直并对平方坐标消元,得到 $BD^2=480+288000/(11a^2-720)$。
正割—正切参数化
将双曲线参数化为 $(2\sqrt5\sec\theta,2\sqrt6\tan\theta)$。对角线垂直化为 $\sin\theta\sin\phi=-5/6$,从而约束 $\tan^2\phi$。
结果。 两条路线都证明 $BD^2>480$,并说明其数值可从上方趋近 $480$,所以所求为 $480$。直接消元与参数化圆锥曲线通过不同不变量得到同一个锐利下界。