作者: 引线小白-本文永久链接:https://www.limoncc.com/post/793a20286198dbac/
知识共享许可协议: 本博客采用署名-非商业-禁止演绎4.0国际许可证
随着应用场景扩展到开放式与高风险任务——包括深度研究(deep research)、医疗诊断、多模态生成与 agentic 工具使用——如何规定、优化与评估模型响应的问题变得愈发重要。简单的正确性信号、整体性偏好分数以及不受约束的基于 LLM 的评判,在这些场景下往往并不足够,质量取决于事实性、完整性、安全性、推理严谨性、证据支撑与实用价值等多重准则。rubrics(量规)把宽泛的质量期望分解为结构化、可解释的准则,为训练监督与模型评测提供了统一接口。这种让评测标准显式化、可操作化的机制越来越流行。接下来笔者将选择几个典型案例来分析。
一、rubrics(量规)怎么来
当前实践已经从”如何离线构造高质量 rubrics“ → “如何持续发现当前集合未覆盖的质量维度与失败模式“,也就是从静态rubrics转为动态rubrics[^1]。 rubric构造方法可分为如下四类:
- 直接生成(direct generation)
- 对比生成(contrastive generation)
- 迭代精炼(iterative refinement)
- 与在线/共同演化生成(online or co-evolving generation)
1.1、RaR的直接生成
RaR论文[^2]的Rubric生成输入是(prompt, reference answer)。输出是一套评分规则。对于Judge判分,论文的结论是整体输出比逐条打分要好。
1.1.1、Rubric生成
1 | 你是一名科学问题领域的专家评分准则撰写人,领域涵盖生物、物理、化学。你的任务是为judging给定问题的回答质量,生成一套自包含的评估标准("rubrics")。评分准则可以覆盖以下方面:事实正确性、推理深度、清晰度、完整性、风格、有用性,以及常见错误。 |
1.1.2、Judge判分
1 | ## System Prompt(系统提示词) |
1 | ## User Prompt Template(用户提示词模板) |
1.2、CDRRM的对比生成
整个 CDRRM [^3]系统里有两个训练出来的模型:一个 Rubric Generator(负责给新查询生成准则),一个 Judge Model(负责在准则条件下判偏好)——这个双模型结构是它的核心设计之一。CDRRM把“为什么 A 比 B 好”这个问题拆成两步推理(先诊断后归纳),并用过滤和双模型训练把它工业化。逐环节拆开:
1.2.1、输入与定位
1、输入三元组 $(x, y^c, y^r)$:查询 + chosen 响应 + rejected 响应,是单条偏好对,不是批量。
2、数据基础是 OpenRubrics 数据集(35.6k 样本,覆盖 UltraFeedback、Tulu 2.5、HelpSteer3、MegaScience、Medical01)
3、从中抽 3k 条训练 Rubric Generator、另抽 3k 条训练 Judge Model。
1.2.2、数据处理
第一步Contrastive Profiling(对比画像)
这不是直接”列出 A 比 B 好在哪”,而是先做维度选择、再逐维取证。
- 自适应评估分类法。先建立一个维度池 $\mathcal{T} = \{d_1, \dots, d_m\}$(指令遵循、逻辑一致性、安全性等),但不是全维度跑一遍——模型先根据 $(x, y)$ 选出相关维度子集 $\mathcal{T}_{x,y} \subseteq \mathcal{T}$,只在激活的维度上做分析。这是对”全面扫描导致冗余噪声”的针对性处理。
- 证据锚定约束。这一步最有价值:对每个激活维度,裁判 LLM 不许给抽象评价,必须输出三元组 $\gamma_t’ = (\gamma_t, \hat{s}^x_t, \hat{s}^y_t)$——分析判断 + 指令中的具体约束片段(如”不要 python 代码”)+ 响应中的对应文本段(如某段 python 代码块)。分析被强制锚定到原文 span 上,直接堵死幻觉式评价。
对 chosen 和 rejected 两个响应各做一遍 推理,得到 $\Gamma^c_i$ 和 $\Gamma^r_i$。
1 | 你是一名专业的回答质量诊断专家。你的任务是对给定的指令(instruction)和回答(answer)进行结构化诊断,识别回答在哪些维度上表现良好、在哪些维度上表现不佳。 |
第二步:Rubric Synthesis(准则合成)
把两个画像用结构化拼接 $\Delta(\Gamma^c_i, \Gamma^r_i)$ 织成一段文本,喂给教师 LLM(Qwen3-235B-A22B-Instruct),条件生成准则集:
$$\mathcal{R}(x_i) = \arg\max_\mathcal{R} P_{\text{Teacher}}\left(\mathcal{R} \mid x_i, \Delta(\Gamma^c_i, \Gamma^r_i)\right)$$
注意这里的语义:生成的 rubric 必须是”能解释这对偏好差异的最小准则集”——准则从”对这道题什么是好的”变成了”什么因素导致了人类偏好这个判断”。这是判别力问题的根本解法。
第三步:一致性过滤(论文真正的护城河)
生成完不直接用。把生成的 rubric 喂回裁判,让它只依据 $\mathcal{R}(x_i)$ 重新判一次 $(y^c, y^r)$ 的偏好;只有预测标签 $\hat{l}_i$ 等于真实标签 $l_i$ 的准则集才保留:
$$\mathbb{I}_{\text{valid}}(\mathcal{R}(x_i)) = \mathbb{1}\left[\text{Judge}(x_i, y^c_i, y^r_i \mid \mathcal{R}(x_i)) = l_i\right]$$
这一步同时完成三件事:剔噪声、剔冗余(判别力不足的准则集会让裁判选错)、并隐式压制冗长偏置/位置偏置——如果准则集主要靠表面特征区分,一致性检查过不了。论文消融也支撑动机:随机遮掉 1–3 条现有方法的准则,性能最多掉 0.42%,说明既有 rubric 数据集里大半是冗余。
1 | # System Prompt for Rubric Generator |
1 | # User Template for Rubric Generator |
1.2.3、双模型训练
- 用过滤后的 $\mathcal{D}_{\text{rubric}}$ SFT 训练 Rubric Generator(Qwen3-8B/14B backbone):输入 $(x, y^c, y^r)$,自回归输出 $\mathcal{R}(x)$。注意:推理时只需要 $(x, y^c, y^r)$ 三个输入,无需参考答案、无需教师 LLM——把 235B 教师的对比分析能力蒸馏进 8B 学生。
- 再用训练好的 Generator 产出 rubric,让教师基于 rubric 生成偏好判断依据,SFT 训练 Judge Model:先自回归生成 rubric 对齐的推理链 $\mathcal{J}(x)$,再输出偏好结论。
1.2.4、与直接对比提示的本质区别
| 直接对比提示 | CDRRM | |
|---|---|---|
| 一步还是两步 | 一步枚举差异即成 rubric | 先逐维取证(带 span 锚定),再合成 |
| 准则来源 | 模型先验 + 表面差异 | 被验证能复现偏好标签的判别因素 |
| 冗余控制 | 无 | 一致性过滤 + 维度激活 |
| 证据可验证性 | 无 | 强制 (分析, 指令约束, 响应片段) 三元组 |
| 部署形态 | 每次调大模型 | 8B 生成器 + 8B 判官(或冻结基座直接用) |
1.3、迭代精炼
尽管直接生成与对比生成提供了可扩展的 rubric 产出方式, 但在rubric集合被用于评测或训练之前持续改进其质量,可以解决之前方法粗以致无法支撑稳定判断、遗漏重要评测方面、彼此重叠,或可验证性不足等方面问题。具体地,现有努力围绕三个互补的质量维度组织
- 1、判别力:单条 rubric 条目是否真能区分响应质量;
- 2、原子性与覆盖度:rubrics 是否足够细粒度并覆盖所有关键评测轴;
- 3、冗余与相关性控制:rubric 集合是否紧凑、非冗余、可迁移。
1.3.1、验证驱动的精炼
rubrics质量不应只看它”像不像评测准则”,关键的检验是它能否在真实比较中可靠区分高质量与低质量响应。这一认识催生了 提出—评估—修订(propose-evaluate-revise)范式:先生成候选 rubrics,再由验证者或评判者检验其判别力,未通过者被迭代修订。
Auto-Rubric[^4](Xie et al., 2025)实例化了这一循环。它的Rubric Generation Prompt1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19## 概述
你是一位开放式问题的专家评分标准撰写者。你的任务是为从给定查询的候选答案中选出更好的答案,生成一套自包含的评估标准(“评分标准”)。评分标准可以涵盖事实正确性、推理深度、清晰度、完整性、风格、有用性以及常见陷阱等方面。每个评分标准项都必须完全自包含,以便非专业读者无需查阅任何外部信息。
我将给你:
1. 查询(可能包含历史消息)
2. 候选答案
3. 哪个答案比其他答案更好
4. 人类专家的评审意见,你需要仔细阅读人类专家提供的评审意见并总结评分标准。
注意:评分标准的数量应小于或等于 {number}
## 查询
{query}
## 候选答案
<answer_1>{answer_1}</answer_1>
<answer_2>{answer_2}</answer_2>
## 更好的答案
答案 {preference} 比其他答案更好。
## 评审意见
<critic>{critic}</critic>
## 输出格式要求
<rubrics>你的评分标准,不带编号</rubrics>
它的优化目标:
$$R_{\text{task}}^* = \arg\max_R \sum_{i=1}^{N} \mathbb{I}\big[\text{eval}_R(x_i, y_i^+, y_i^-) = \text{correct}\big]$$
说白了,$\text{eval}_R$ 就是一次 LLM 前向调用:把 $(x, y^+, y^-, R)$ 塞进 prompt,让 Qwen3-32B 输出”谁更好”的判断。不是打分,是直接输出偏好标签。Rubric Evaluation Prompt如下:
1 | ## 任务描述 |
迭代Rubric Revision Prompt
1 | ## 概述 |
Auto-Rubric是两阶段分工,其中propose-evaluate-revise循环是 Auto-Rubric 的 Stage1 ,Stage1汇成候选池 $\mathcal{R}_{\text{pool}}$。Auto-Rubric还要再候选池再次筛选一个核心子集,目标是
$$\begin{align}
R_{\text{core}}^* = \arg\max_{R \subseteq \mathcal{R}_{\text{pool}}, |R| \leq m} \mathcal{C}(\mathbf{E}_R, \varepsilon)
\end{align}$$
其中编码率 $\mathcal{C}(\mathbf{E}_R, \varepsilon)$,把通过验证的准则用(冻结的)embedding 模型编码为 $\mathbf{E}_R$
$$\begin{align}
\mathcal{C}(\mathbf{E}_R, \varepsilon) = \tfrac{1}{2}\log\det!\Big(\mathbf{I} + \tfrac{1}{\varepsilon^2 |R|}\mathbf{E}_R^\top \mathbf{E}_R\Big)
\end{align}$$
- 行列式与嵌入向量张成的平行多面体体积单调相关;
- 语义上近共线(冗余)的准则组合体积小 → 边际增益低 → 不选;
- 指向新语义方向的准则体积增量大 → 被优先选入;
- $\varepsilon$ 控制压缩与保真的权衡。
子集选择是 NP-hard,论文用贪心算法:从空集出发,每轮加入边际编码率增益最大的那条准则:
$$\begin{align}
r_{k+1} = \arg\max_{r \in \mathcal{R}_{\text{pool}} \setminus R_k} \big[\mathcal{C}(\mathbf{E}_{R_k \cup \{r\}}, \varepsilon) - \mathcal{C}(\mathbf{E}_{R_k}, \varepsilon)\big]
\end{align}$$
每一步迭代产生一个具体的选择动作。早停条件也定义在它上面:边际增益连续 2 轮低于 $\tau_{\text{min}} = 0.002$ 就停。这个停止不仅终止选择,还终止外层”继续采更多偏好对”的数据循环——论文 7 个 batch 后停机,只处理了 70 条样本。所以它一身二职:选什么(objective)+ 何时收手(stopping signal)。
1.3.2、由粗到细结构分解
以RubricHub[^5]为例,使用三阶段流水线,把rubrics由粗到细
- Stage 1:Response-Grounded & Principle-Guided Generation(产粗粒度候选)
- Stage 2:Multi-Model Aggregation(合并去冗余,形成 base rubric)
- Stage 3:Difficulty Evolution(加严准则,抑制分数饱和)
由粗到细的语义在三个阶段间是逐级收紧的:Stage 1 定基调、Stage 2 去偏去重、Stage 3 提判别力。下面逐个拆。
1.3.2.1、Stage 1:锚定 + 元原则,治”rubric drift”
动机:只看 query 生成 rubric 会导致 rubric drift——准则泛化、幻觉、与实际任务输出脱钩。两个对策同时用:
- Response grounding:把参考响应 $o_i$ 喂进生成 prompt,准则必须锚定在具体输出上;
- Principle guidance:一套元原则 $\mathbb{P}_{\text{meta}}$ 约束生成器,涵盖四条——一致性&对齐、结构&范围、清晰度&质量、推理&可评估性。
形式化:$\mathcal{R}_{\text{cand}}^{(i)} = \mathcal{M}(P_{\text{gen}}(q, o_i, \mathbb{P}_{\text{meta}}))$。这一步对应”由粗”——产出的是语义正确的候选准则,但粒度还比较宽。
1 | # 角色 |
1.3.2.2、Stage 2:多模型聚合,消解单模型视角偏置
单一模型的准则天然带视角盲区和主观偏好,会漏掉”有效但表达方式不同”的回答。对策:
- 用异构前沿模型(GPT-5.1、Gemini 3 Pro Preview 等)并行生成候选集;
- 汇成统一池 $\mathcal{R}_{\text{cand}} = \bigcup_i \mathcal{R}_{\text{cand}}^{(i)}$;
- 用聚合 prompt $P_{\text{agg}}$ 把池子蒸馏成一个紧凑的 base rubric:$\mathcal{R}_{\text{base}} = \mathcal{M}(P_{\text{agg}}(q, \mathcal{R}_{\text{cand}}))$——合并冗余项、解决冲突。
这一步对应”粗→中”:从分散候选收敛到覆盖全面、无单源偏置的基准准则集。
1 | # 角色 |
1.3.2.3、Stage 3:难度演化——把”合格”升级为”卓越”
这是论文判别力问题的正面解法,也是最”由粗到细”的一步。base rubric 捕捉的是基本正确性,但区分不了 excellent 和 exceptional——分数会饱和,顶尖模型没有优化梯度。对策:
- 从初始候选池中挑出共识高分的高质量参考响应对 $\mathcal{A}_{\text{ref}}$;
- 用增强 prompt $P_{\text{aug}}$ 分析 $\mathcal{A}_{\text{ref}}$,提取”超出 $\mathcal{R}_{\text{base}}$ 范围、能把 excellent 抬升到 exceptional 的判别性细微差异”,形成追加准则 $\mathcal{R}_{\text{add}}$;
- 合并得到 $\mathcal{R}_{\text{final}} = \mathcal{R}_{\text{base}} \cup \mathcal{R}_{\text{add}}$。
论文举的例子很直白:把”代码正确吗?”升级为”代码是否处理了边界情况且复杂度 $O(n)$?”——从 generic 检查变成 rigorous 标准。
1 | # 角色 |
1.4、去重与压缩
大规模 rubric 生成之后,冗余不可避免:多条 rubrics 可能用不同措辞描述同一底层质量维度,导致聚合时重复打分与噪声放大。更根本地,rubric 生成不应局限于为单个实例撰写准则,还应从局部准则中发现可迁移的评测结构。
Auto-Rubric(Xie et al., 2025)通过其查询无关的压缩阶段解决这一问题:把验证过的实例特定 rubrics 聚类、蒸馏为可复用的”Theme-Tips”。该流水线体现了 rubric 生成的双重目标——既产出逐实例的评测标准,又从局部准则中学习可迁移结构。RRD(Shen et al., 2026)[^6]在分解之外补充相关性加权与相关性感知过滤,以控制扩展准则集的冗余。
另一种结构归纳(structural induction)路线以 Sanders et al.(2026)[^7]为代表:不是从正向质量维度构造 rubrics,而是从推理失败轨迹归纳错误分类法(error taxonomy),证明 rubrics 同样可以由对高频失败模式的系统分类构成。CARO(Chu et al., 2026)[^8]针对更微妙的质量问题:即便 rubric 集合没有冗余,维度边界模糊也会让评判者混淆。通过显式优化维度间可分性,该工作表明高质量 rubric 集合不仅需要全面覆盖与细粒度,还需要清晰的维度间边界。
这个稍微提一嘴CARO,CARO 以“高误置信度样本的邻域”为探针,用当前 rubric 在小批量上的 LLM 评分与人工标注的计数差(混淆矩阵)定位主导错误模式,再以“错误样例+轨迹、对比正确样例、全局矩阵”三类证据驱动“诊断→补丁→优先级整合→候选竞争”的多段修复流水线,逐轮锐化相邻分数档之间的决策边界。具体做法针对同一个评分任务及其对应的同一套 rubric(提示词),CARO 按轮次迭代运行。每一轮的流程如下:
第 1 步:构造小批量。 以上一轮识别出的高误置信度样本为种子——既包括预测错误的样本,也包括预测正确但置信度很低的“侥幸答对”样本(二者共同标出决策边界的位置);再基于 SBERT 嵌入检索这些种子的 $k$ 近邻,拼成本轮的小批量,而非简单抽取“失败率最高”的样本。
第 2 步:LLM 评分。 用当前 rubric 提示词对小批量中每份作答做一次调用(温度 0),每份作答输出两样东西:分数 $\hat{y}$ 和推理轨迹 $r$(轨迹是本次调用的输出,不是输入)。
第 3 步:计算混淆矩阵。 将模型分数与同一任务、同一套人工标注分数逐样本对比,按“真实为 $i$ 分、预测为 $j$ 分”计数,得到 $K \times K$ 矩阵 $\mathbf{C}$:对角线是打对的,非对角单元是方向性错误模式。注意整个流程以单个任务为单位独立运行——标签空间不同的任务各有一张自己的矩阵。
第 4 步:挑选修复目标。 按频次对非对角单元排序,取 top-$K$(实验中 $K=4$)作为本轮修复目标,频次同时决定后续规则整合的优先级。
第 5 步:生成诊断(Reflector)。 对每个被选中的混淆单元 $(i,j)$,向 Reflector LLM 提供三件套证据:① 该单元的局部错误样例(含作答原文与模型推理轨迹);② 从边界两侧采样的对比性正确样例;③ 完整混淆矩阵作为全局上下文。Reflector 产出的是结构化诊断(根本原因、误导模式、建议修复方向、安全检查),不直接改写 rubric。
第 6 步:生成规则补丁(Refiner)。 Refiner 把诊断转化为具体规则补丁,并额外接收其他活跃错误模式的信息(跨模式感知),确保措辞与针对其他单元的补丁兼容,避免修一条边界时恶化相邻边界。
第 7 步:整合与候选竞争。 各模式补丁按错误频次做优先级加权整合(Priority 1/2/3 + 冲突处插入显式决胜指令),生成一份整合候选;随后将“旧提示词 ⊕ 各规则补丁”追加式生成多个候选提示词(rubric 不被原地修改),经 UCB 评估与多样性加权选择后进入下一轮,直至收敛或达到最大轮数。最终选验证集上 $\kappa$ 最高者作为冻结的 $\mathbf{P}^*$ 用于部署推理。
1.5、在线与共同演化生成
前述方法都是离线的,奖励劫持与分布移位是 rubric 构造中第一挑战——这些挑战是静态方法无论多么精心设计都无法完全应对的。有三个方向,具体见综述论文
- 1、基于 rollout 的启发式更新保持固定的更新规则,从最新轨迹刷新 rubric 池,rubric 生成器本身不被训练。
- 2、在线与交替优化把 rubric 生成器变成可训练组件,通过流式偏好或交替 RL 与策略或评判者联合更新。
- 3、自演化、对抗与记忆驱动方法更进一步,主动探测盲区并为系统尚未覆盖的失败提出新 rubrics。
说实话现有论文方法都不够优雅,且限于篇幅这里就不解读了。
二、如何训练
2.1、rubric的分如何计算
在大多数都是直接利用评分 $\displaystyle r_i=\frac{\sum_c w_c\psi_{i,c}}{\sum_c w_c}$,然后做组内归一化
$$\begin{align}
A_i = \frac{r_i - \mu}{\sigma + \epsilon}, \quad \mu = \frac{1}{n}\sum_{j=1}^{n} r_j, \quad \sigma^2 = \frac{1}{n}\sum_{j=1}^{n}(r_j - \mu)^2
\end{align}$$
组内归一化,很容易导致优势为零的问题。LLM-as-a-Verifier[^9] 提出了用模型打分token概率来计算从而在组内归一化避免零优势问题,获得细粒度连续信号。具体做法如下
$$\begin{align}
R(x,\tau)==\frac{1}{GK}\sum_{c=1}^C\sum_{k=1}^K\sum_{g=1}^Gp(\bm{v}_g\mid x ,c,\tau)\psi(v_g)
\end{align}$$
C:评估准则的数量
K:重复验证的次数
G:打分token的粒度。论文主张用26个字母来替换分数,因为数字有可能是2的token,这样不好取概率
$\psi(v_g)$ :把打分token映射为标量值的函数。说白了就是字母代表的分数
2.2、信用分配选择
当前RL训练中,CE-Steps、CE-Outcome、CE-Trajectory一直是讨论的热点问题,众所周知引入的step信用越多,留下的漏洞就越多,引发奖励攻击(reward hacking)的可能就越大,训练会很不稳定,尤其是rubric这种二手实践经验噪声巨大。当前训练多还是以 Out-reward为主,step-reward为辅。通过SRaR[^10]来说明
SRaR的rubric生成:
1 | 你正在为数学问题解答设计评分标准。 |
SRaR评分准则只进行的粗粒度的设计:
- SUGGEST 项强化标准解题范式(清晰的步骤结构、逻辑连贯、显式推导),贡献正的增量。
- PITFALL 项惩罚已知的失败模式(算术错误、逻辑跳跃、幻觉),贡献负的增量。
- BONUS 项奖励有价值的可选行为(替代解法路径、交叉验证),贡献额外的正增量。
这种三方面图式把基线正确性、错误规避与卓越质量分离开来,每一类都受按类型设定的预算约束。
$$\begin{align}
\mathcal{J}(\tau_i,\mathcal{R}) = \{\psi_{i,c,t}\}_{c=1}^{C}, \quad \psi_{\cdot,c,\cdot} \in \{0, 1\}, \; t \in \{1, \ldots, T_i\}
\end{align}$$
2.2.1、步骤归属的评分准则评判
1 | 你是一个数学推理步骤验证器。给定一个数学问题和一系列推理步骤,判断当前步骤在逻辑上是否正确。 |
1 | 问题 |
每一条被评判的评分准则项被转换为一个逐步奖励,在步骤层面于各轨迹之间归一化,并且只广播到它所评判的那一步的各个词元上。这用步骤对齐的信用分配替代了标准 GRPO 中统一的词元级奖励。首先把每个判定映射为一个带符号的增量,其幅值取决于该判定所属的评分准则类型:
$$\begin{align}
\delta_c = \begin{cases}
&\displaystyle+\frac{R_{\texttt{SUG}}}{N_{\texttt{SUG}}}
& {\small\text{Type}(c) = \text{SUGGEST}}, \; \psi_{\cdot,c,\cdot}= 1\\
&\displaystyle-\frac{\mid R_{\texttt{PIT}}\mid}{N_{\texttt{PIT}}}
& {\small\text{Type}(c) = \texttt{PITFALL}}, \; \psi_{\cdot,c,\cdot} = 1 \[2pt]
&\displaystyle+ \frac{R_{\texttt{BON}}}{N_{\texttt{BON}}}
& {\small\text{Type}(c) = \texttt{BONUS}}, \; \psi_{\cdot,c,\cdot} = 1 \[2pt]
&0 & {\small\text{否则}}
\end{cases}
\end{align}$$
- $\delta_c$:这叫“增量”,意思是做对这一条具体标准,你能拿多少分。
- $R_{c}$(预算):这是人为设定的奖金总额。比如规定“这道题所有的建议项加起来,最多只能给你 0.8 分”。这固定了盘子的大小。
- $N_{\tau}$(人数):这是这道题具体有多少条标准。比如这道题有 4 个建议步骤($N=4$)。
计算逻辑:把奖金总额平分给每一个人。
每项得分=这类标准的总分(预算)/这类标准的总条数, 也就是rubric评分有上限了。
2.2.2、逐步式词元分配与跨轨迹归一化
其中 $R_c$ 是类型 $c$ 的总奖励预算,$N_c$ 统计当前样本中该类型的项数,从而无论评分准则清单多长,每一类的贡献都是有限的。被归属到同一步骤 $t$ 的增量累加为该步骤的原始评分准则奖励 $d_{i,t}=\sum_c\delta_{i,c,t}$(属于轨迹 $i$),它表示步骤 $t$ 在归一化之前收到的评分准则信用总量。为提取能反映不同轨迹之间步骤相对质量的学习信号,对 $d_{i,t}$ 按步骤在同一提示词的多条轨迹之间归一化:
$$\bar{d}_{i,t} = \frac{d_{i,t} - \mu_t}{\sigma_t + \epsilon}, \quad \mu_t = \frac{1}{|\mathcal{G}_t|}\sum_{\varsigma \in \mathcal{G}_t} d_{i,t}$$
其中 $\mathcal{G}_t$ 是那些评判结果中至少有一条评分准则项被归属到步骤 $t$ 的轨迹集合,且当 $|\mathcal{G}_t| \leq 1$ 时取 $\bar{d}_{i,t} = 0$,因为单个样本无法提供相对信号。这与 GRPO 的组内归一化思想一致,只是按步骤独立施加:在不同轨迹之间一致地好或一致地差的步骤获得接近零的优势,而质量存在变化的步骤则获得强的学习信号。归一化后的 $\bar{d}_{i,t}$ 随后被广播到该步骤跨度内的每一个词元:
$$\tilde{r}_i^{(n)} = \bar{d}_{i,n} \quad {\small\text{对所有 }} n \in [a_t, b_t]$$
从而一个推理步骤的所有词元共享同一个由评分准则导出的信号。
2.2.3、解耦优势估计器。
若把“基础奖励 + 评分准则”的合并奖励朴素地代入 GRPO 优势,就会让评分准则噪声进入组内基线,使某条轨迹能够通过操纵评分准则来抬高自己的整体优势。我们改为把优势计算为两个各自独立归一化的部分之和:
$$\hat{A}_i^{(n)} = \underbrace{\frac{r_{\text{base},i} - \mu_{\text{base}}}{\sigma_{\text{base}} + \epsilon}}_{\text{结果优势}} + \underbrace{\tilde{r}_i^{(n)}}_{\text{评分准则偏置项}}$$
其中 $r_{\text{base},i} = (1-\lambda)\,r_{\text{acc},i} + \lambda\,r_{\text{fmt},i}$ 结合了准确率奖励 $r_{\text{acc},i} \in \{0,1\}$(抽取出的答案是否正确)与格式奖励 $r_{\text{fmt},i} \in \{0,1\}$(响应是否同时包含步骤标题与 \boxed{} 答案),而 $\mu_{\text{base}}, \sigma_{\text{base}}$ 在同一提示词的多条轨迹之间计算。结果项是由准确率单独导出的标准 GRPO 优势;评分准则项是上文构造的有界逐步偏置项。由于评分准则噪声停留在偏置项中、从不会进入组内基线,没有任何一条轨迹能通过操纵评分准则来抬高自己的整体优势,从而消除了自我纠正循环背后的动机,并带来更稳定的训练。
三、评述
1、rubrics(量规)是实践成本二级摊销,它的判分质量上界由世界模型、规范先验、激发工程和多步因果推理共同决定。这使得Rubrics评分成为了一个工程问题:Rubrics-engineering、Rubrics-Agent、Rubrics-Infra都是针对具体任务的应有之意。
2、Rubrics除了再测评上发挥作用,更是在数据筛选,RL训练中发挥作用。
3、Rubrics和训练在线共同演化还是一个待深入研究的领域。但究其本质还是更好的挖掘模型的二手实践与真实实践对齐。从而在训练中完成认识-实践循环。
参考文献
[^1]: Liu, W.; Jin, J.; Huang, Z.; Wen, T.; Dong, G.; Zhao, Z.; Zhu, Y.; Dou, Z.; Wen, J.-R. The Rules of the Game: A Survey of Rubrics for Large Language Models. Preprints 2026, 2026080565. https://doi.org/10.20944/preprints202608.0565.v1
[^2]: Gunjal, A.; Wang, A.; Lau, E.; Nath, V.; Liu, B.; Hendryx, S. Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. CoRR 2025, abs/2507.17746.
[^3]: Liu, D.; Yang, F.; Wang, X.; Yan, S.; Chai, J.; Li, J.; Ban, Y.; Mao, Z.; Lin, W.; Yin, G. CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling. arXiv 2026, arXiv:2603.08035.
[^4]: Xie, L.; Huang, S.; Zhang, Z.; Zou, A.; Zhai, Y.; Ren, D.; Zhang, K.; Hu, H.; Liu, B.; Chen, H.; et al. Auto-Rubric: Learning to Extract Generalizable Criteria for Reward Modeling. CoRR 2025, abs/2510.17314.
[^5]: Li, S.; Zhao, J.; Wei, M.; Ren, H.; Zhou, Y.; Yang, J.; Liu, S.; Zhang, K.; Chen, W. RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation. CoRR 2026, abs/2601.08430.
[^6]:Shen, W.F.; Qiu, X.; Whitehouse, C.; Alazraki, L.; Goel, S.; Barbieri, F.; Willi, T.; Mathur, A.; Leontiadis, I. Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks. CoRR 2026, abs/2602.05125.
[^7]:Sanders, K.; Weir, N.; Chaudhary, S.; Bostrom, K.; Rangwala, H. Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling. CoRR 2026, abs/2602.06795.
[^8]:Chu, Y.; Li, H.; Yang, K.; Copur-Gencturk, Y.; Krajcik, J.; Shin, N.; Tang, J. Confusion-Aware Rubric Optimization for LLM-based Automated Grading. CoRR 2026, abs/2603.00451.
[^9]:Kwok, J., Li, S., Atreya, P., Liu, Y., Jiang, Y., Finn, C., et al. (2026, July 8). LLM-as-a-verifier: a general-purpose verification framework. arXiv. https://doi.org/10.48550/ARXIV.2607.05391
[^10]:Xie, W., Zhao, H., Liu, W., Zhu, Y., Chen, L., Ye, M., et al. (2026). Step-wise rubric rewards for LLM reasoning. arXiv. https://doi.org/10.48550/ARXIV.2605.17291
| 版权声明 | ![]() |
| 由引线小白创作并维护的柠檬CC博客采用署名-非商业-禁止演绎4.0国际许可证。 本文首发于柠檬CC [ https://www.limoncc.com ] , 版权所有、侵权必究。 | |
| 本文永久链接 | https://www.limoncc.com/post/793a20286198dbac/ |
| 如果您需要引用本文,请参考: |
| 引线小白. (Sep. 16, 2026). 《大语言模型研究10——RubricRL实践》[Blog post]. Retrieved from https://www.limoncc.com/post/793a20286198dbac |
| @online{limoncc-793a20286198dbac, title={大语言模型研究10——RubricRL实践}, author={引线小白}, year={2026}, month={Sep}, date={16}, url={\url{https://www.limoncc.com/post/793a20286198dbac}}, } |
