大语言模型研究10——RubricRL实践

作者: 引线小白-本文永久链接:https://www.limoncc.com/post/793a20286198dbac/
知识共享许可协议: 本博客采用署名-非商业-禁止演绎4.0国际许可证

随着应用场景扩展到开放式与高风险任务——包括深度研究(deep research)、医疗诊断、多模态生成与 agentic 工具使用——如何规定、优化与评估模型响应的问题变得愈发重要。简单的正确性信号、整体性偏好分数以及不受约束的基于 LLM 的评判,在这些场景下往往并不足够,质量取决于事实性、完整性、安全性、推理严谨性、证据支撑与实用价值等多重准则。rubrics(量规)把宽泛的质量期望分解为结构化、可解释的准则,为训练监督与模型评测提供了统一接口。这种让评测标准显式化、可操作化的机制越来越流行。接下来笔者将选择几个典型案例来分析。

一、rubrics(量规)怎么来

当前实践已经从”如何离线构造高质量 rubrics“ → “如何持续发现当前集合未覆盖的质量维度与失败模式“,也就是从静态rubrics转为动态rubrics[^1]。 rubric构造方法可分为如下四类:

  • 直接生成(direct generation)
  • 对比生成(contrastive generation)
  • 迭代精炼(iterative refinement)
  • 与在线/共同演化生成(online or co-evolving generation)

1.1、RaR的直接生成

RaR论文[^2]的Rubric生成输入是(prompt, reference answer)。输出是一套评分规则。对于Judge判分,论文的结论是整体输出比逐条打分要好。

1.1.1、Rubric生成
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
你是一名科学问题领域的专家评分准则撰写人,领域涵盖生物、物理、化学。你的任务是为judging给定问题的回答质量,生成一套自包含的评估标准("rubrics")。评分准则可以覆盖以下方面:事实正确性、推理深度、清晰度、完整性、风格、有用性,以及常见错误。
**输入:**
- `question`:{{完整的问题文本}}。
- `reference_answer`:{{理想答案,包括其中的关键事实或解释}}。
**条目总数:**
- 根据问题复杂度选择 **7–20 条**评分准则。
**每条评分准则必须恰好包含三个键:**
1. **title(标题)**:2–4 个词。
2. **description(描述)**:一句话,以其类别前缀开头,明确说明要检查什么。例如:
- **Essential Criteria(必要标准)**:说明在所述封闭系统中,事件发生前的总机械能(动能加势能)等于事件发生后的总机械能。
- **Important Criteria(重要标准)**:列出各阶段的数值能量,展示初始动能加初始势能等于最终动能加最终势能。
- **Optional Criteria(可选标准)**:给出一个具体例子,如单摆在动能与势能之间转换,以说明能量如何在系统内流动。
- **Pitfall Criteria(陷阱标准)**:未提及在应用机械能守恒时假设摩擦力或空气阻力损失可忽略不计。
3. **weight(权重)**:对于 Essential/Important/Optional,使用 1–5(5 = 最重要);对于 Pitfall,使用 −1 或 −2。
**类别指南:**
- **Essential(必要)**:关键事实或安全检查;遗漏则回答不成立。
- **Important(重要)**:关键推理或完整性;强烈影响回答质量。
- **Optional(可选)**:锦上添花的风格或额外深度。
- **Pitfall(陷阱)**:常见错误或遗漏;突出常被忽略之处。
**格式说明:**
- 提及选项时,明确写作 "Identifies (A)"、"Identifies (B)" 等。
- 若需要明确结论(如 "The final answer is (B)"),为它包含一条 Essential Criteria。
- 若要求推理先于最终答案,为这一点包含一条 Important Criteria。
- 若重视简洁,包含一条关于简明性的 Optional Criteria。
**输出**:给出一个评分准则对象的 JSON 数组。每个对象必须且只能包含三个键——`title`、`description` 和 `weight`。不要把问题或 reference_answer 的大段文本复制进描述。每条 description 必须以它的类别前缀开头,不允许出现额外的键。
现在,给定 question 和 reference_answer,按上述要求生成评分准则。注意:reference_answer 是一个理想回答但未必穷尽;仅将其作为指引使用。
1.1.2、Judge判分
1
2
3
4
5
6
7
8
9
10
## System Prompt(系统提示词)
你是一名专家评估员。给定一个用户提问(prompt)、一个生成的回答(response),以及一组质量评分准则(rubrics),请根据该回答对准则的满足程度,对回答的整体质量进行 1 到 10 分的打分。
在确定分数时,请**整体性地(holistically)**考量所有准则。违反多条准则的回答应得到较低分数;满足全部准则的回答应得到较高分数。
让你的回答以一个合法的 JSON 对象开头,该对象以 ```json 开始、以 ``` 结束。JSON 对象应只包含一个键 "rating",其值为 1 到 10 之间的整数。
回答示例:
'''json
{
"rating": 7
}
'''
1
2
3
4
5
6
7
8
9
10
11
12
13
14
## User Prompt Template(用户提示词模板)
给定以下 prompt、response 和 rubrics,请根据回答对准则的满足程度,对回答的整体质量进行 1 到 10 分的打分。
'''
<prompt>
{prompt}
</prompt>
<response>
{response}
</response>
<rubrics>
{rubric_list_string}
</rubrics>
你的 JSON 评估:
'''

1.2、CDRRM的对比生成

整个 CDRRM [^3]系统里有两个训练出来的模型:一个 Rubric Generator(负责给新查询生成准则),一个 Judge Model(负责在准则条件下判偏好)——这个双模型结构是它的核心设计之一。CDRRM把“为什么 A 比 B 好”这个问题拆成两步推理(先诊断后归纳),并用过滤和双模型训练把它工业化。逐环节拆开:

1.2.1、输入与定位

1、输入三元组 $(x, y^c, y^r)$:查询 + chosen 响应 + rejected 响应,是单条偏好对,不是批量。
2、数据基础是 OpenRubrics 数据集(35.6k 样本,覆盖 UltraFeedback、Tulu 2.5、HelpSteer3、MegaScience、Medical01)
3、从中抽 3k 条训练 Rubric Generator、另抽 3k 条训练 Judge Model。

1.2.2、数据处理

第一步Contrastive Profiling(对比画像)

这不是直接”列出 A 比 B 好在哪”,而是先做维度选择、再逐维取证。

  • 自适应评估分类法。先建立一个维度池 $\mathcal{T} = \{d_1, \dots, d_m\}$(指令遵循、逻辑一致性、安全性等),但不是全维度跑一遍——模型先根据 $(x, y)$ 选出相关维度子集 $\mathcal{T}_{x,y} \subseteq \mathcal{T}$,只在激活的维度上做分析。这是对”全面扫描导致冗余噪声”的针对性处理。
  • 证据锚定约束。这一步最有价值:对每个激活维度,裁判 LLM 不许给抽象评价,必须输出三元组 $\gamma_t’ = (\gamma_t, \hat{s}^x_t, \hat{s}^y_t)$——分析判断 + 指令中的具体约束片段(如”不要 python 代码”)+ 响应中的对应文本段(如某段 python 代码块)。分析被强制锚定到原文 span 上,直接堵死幻觉式评价。
    对 chosen 和 rejected 两个响应各做一遍 推理,得到 $\Gamma^c_i$ 和 $\Gamma^r_i$。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
你是一名专业的回答质量诊断专家。你的任务是对给定的指令(instruction)和回答(answer)进行结构化诊断,识别回答在哪些维度上表现良好、在哪些维度上表现不佳。
## 核心原则
1. **可验证性**:所有诊断必须基于可验证的事实,不得基于主观臆断。
2. **证据支撑**:每条发现必须引用回答中的具体片段作为证据。
3. **指令锚定**:诊断必须与指令要求直接相关,不得引入新的要求。
4. **客观性**:避免"更深入""更专业"这类模糊评价,除非指令本身明确要求了这些特质。
## 诊断维度(候选准则)
你可以从以下维度评估回答:
- **指令遵循**:回答是否准确理解并遵循了指令的全部要求。
- **内容覆盖**:回答是否覆盖了指令要求的所有关键点。
- **事实准确性**:回答提供的信息是否准确、无误导。
- **格式合规**:回答是否符合指令要求的格式与结构。
- **逻辑一致性**:回答内容是否逻辑清晰、前后一致。
- **安全性**:回答是否包含有害、有偏见或不当的内容。
- **简洁性**:回答在满足要求的同时是否保持简洁(当指令有此要求时)。
- **完整性**:回答是否完整地回应了指令中的所有问题。
## 输出格式要求
请严格以 JSON 格式输出,不要添加任何其他文字。输出格式如下:
'''json
{{
"criteria_candidates": ["维度1", "维度2", ...],
"findings": [
{{
"criterion": "维度名称",
"status": "pass | fail | partial | not_applicable",
"severity": 0-3(仅在 status 为 fail 或 partial 时有意义,0=轻微,3=严重),
"claim": "用一句话描述好在哪里/差在哪里(必须可验证)",
"evidence": "从回答中引用的具体片段或位置描述",
"instruction_anchor": "指向指令中的哪条要求,或引用指令原文"
}},
...
]
}}
'''
## 关键约束
1. 当 status 为 fail 或 partial 时,必须提供 evidence,否则该条发现无效。
2. claim 必须可验证:不能是"质量更好"这类模糊描述,必须是"缺少 X"或"包含 Y"这类可验证的陈述。
3. instruction_anchor 必须存在:每条发现都必须能追溯到指令中的某条具体要求。
4. 不得引入新要求:诊断必须基于指令或指令关键点(instruction_keypoints),不得添加新的评估标准。
## 示例
**输入示例:**
- 指令:写一段关于 Python 的简介(不超过 100 字符)
- 回答:Python 是一种高级编程语言,由 Guido van Rossum 于 1991 年创建。它强调代码的可读性和简洁性,使用缩进来定义代码块。Python 支持多种编程范式,包括面向对象、命令式、函数式和过程式编程。它拥有庞大的标准库,秉持"自带电池"(batteries included)的理念。Python 被广泛应用于 Web 开发、数据科学、人工智能、自动化脚本等领域。
**输出示例:**
'''json
{{
"criteria_candidates": ["指令遵循", "内容覆盖", "简洁性"],
"findings": [
{{
"criterion": "简洁性",
"status": "fail",
"severity": 3,
"claim": "回答超过了 100 字符,违反了指令中的长度限制要求",
"evidence": "整个回答文本(约 150 字符)",
"instruction_anchor": "指令要求:不超过 100 字符"
}},
{{
"criterion": "内容覆盖",
"status": "pass",
"severity": 0,
"claim": "回答覆盖了 Python 的关键信息:创建者、特点、应用领域",
"evidence": "Created by Guido van Rossum in 1991... widely used in web development, data science...",
"instruction_anchor": "指令要求:关于 Python 的简介"
}}
]
}}
'''

第二步:Rubric Synthesis(准则合成)

把两个画像用结构化拼接 $\Delta(\Gamma^c_i, \Gamma^r_i)$ 织成一段文本,喂给教师 LLM(Qwen3-235B-A22B-Instruct),条件生成准则集:
$$\mathcal{R}(x_i) = \arg\max_\mathcal{R} P_{\text{Teacher}}\left(\mathcal{R} \mid x_i, \Delta(\Gamma^c_i, \Gamma^r_i)\right)$$
注意这里的语义:生成的 rubric 必须是”能解释这对偏好差异的最小准则集”——准则从”对这道题什么是好的”变成了”什么因素导致了人类偏好这个判断”。这是判别力问题的根本解法。

第三步:一致性过滤(论文真正的护城河)

生成完不直接用。把生成的 rubric 喂回裁判,让它只依据 $\mathcal{R}(x_i)$ 重新判一次 $(y^c, y^r)$ 的偏好;只有预测标签 $\hat{l}_i$ 等于真实标签 $l_i$ 的准则集才保留:
$$\mathbb{I}_{\text{valid}}(\mathcal{R}(x_i)) = \mathbb{1}\left[\text{Judge}(x_i, y^c_i, y^r_i \mid \mathcal{R}(x_i)) = l_i\right]$$
这一步同时完成三件事:剔噪声、剔冗余(判别力不足的准则集会让裁判选错)、并隐式压制冗长偏置/位置偏置——如果准则集主要靠表面特征区分,一致性检查过不了。论文消融也支撑动机:随机遮掉 1–3 条现有方法的准则,性能最多掉 0.42%,说明既有 rubric 数据集里大半是冗余。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
# System Prompt for Rubric Generator
你擅长为指令生成结构化的评估量规。
你的任务是创建一份全面的量规,可用于评估对特定指令的回应。
该量规应包含:
1. 硬性规则:必须遵守(类型:“must”)或必须避免(类型:“forbid”)的具体、可验证的规则
2. 原则:主观评估的通用指南
每条规则必须包含以下内容:
- rule_id:唯一标识符
- type:"must"(必须)或 "forbid"(禁止)
- criterion:清晰说明需要检查的内容
- test:可验证的测试条件
- rationale:该规则为何重要

输出格式:JSON,包含 "hard_rules" 和 "principles" 数组。
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
# User Template for Rubric Generator
指令:
{instruction}
回应 A:
{response_a}
回应 B:
{response_b}
为该指令生成一份全面的评估量规。该量规应有助于区分不同的回答。
将你的回应以以下结构的 JSON 对象形式输出:
{{
"hard_rules": [
{{
"规则ID": "rule_1",
"类型": "必须",
"标准": "清晰说明需要检查的内容",
"测试": "可验证的测试条件",
"理由": "此规则为何重要"
}}
],
“原则”:[
{{
"principle_id": "principle_1",
"description": "评估的总体指导原则",
"rationale": "为何需要此原则"
}}
]
}}
1.2.3、双模型训练
  • 用过滤后的 $\mathcal{D}_{\text{rubric}}$ SFT 训练 Rubric Generator(Qwen3-8B/14B backbone):输入 $(x, y^c, y^r)$,自回归输出 $\mathcal{R}(x)$。注意:推理时只需要 $(x, y^c, y^r)$ 三个输入,无需参考答案、无需教师 LLM——把 235B 教师的对比分析能力蒸馏进 8B 学生。
  • 再用训练好的 Generator 产出 rubric,让教师基于 rubric 生成偏好判断依据,SFT 训练 Judge Model:先自回归生成 rubric 对齐的推理链 $\mathcal{J}(x)$,再输出偏好结论。
1.2.4、与直接对比提示的本质区别
直接对比提示 CDRRM
一步还是两步 一步枚举差异即成 rubric 先逐维取证(带 span 锚定),再合成
准则来源 模型先验 + 表面差异 被验证能复现偏好标签的判别因素
冗余控制 一致性过滤 + 维度激活
证据可验证性 强制 (分析, 指令约束, 响应片段) 三元组
部署形态 每次调大模型 8B 生成器 + 8B 判官(或冻结基座直接用)

1.3、迭代精炼

尽管直接生成与对比生成提供了可扩展的 rubric 产出方式, 但在rubric集合被用于评测或训练之前持续改进其质量,可以解决之前方法粗以致无法支撑稳定判断、遗漏重要评测方面、彼此重叠,或可验证性不足等方面问题。具体地,现有努力围绕三个互补的质量维度组织

  • 1、判别力:单条 rubric 条目是否真能区分响应质量;
  • 2、原子性与覆盖度:rubrics 是否足够细粒度并覆盖所有关键评测轴;
  • 3、冗余与相关性控制:rubric 集合是否紧凑、非冗余、可迁移。
1.3.1、验证驱动的精炼

rubrics质量不应只看它”像不像评测准则”,关键的检验是它能否在真实比较中可靠区分高质量与低质量响应。这一认识催生了 提出—评估—修订(propose-evaluate-revise)范式:先生成候选 rubrics,再由验证者或评判者检验其判别力,未通过者被迭代修订。

Auto-Rubric[^4](Xie et al., 2025)实例化了这一循环。它的Rubric Generation Prompt

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
## 概述
你是一位开放式问题的专家评分标准撰写者。你的任务是为从给定查询的候选答案中选出更好的答案,生成一套自包含的评估标准(“评分标准”)。评分标准可以涵盖事实正确性、推理深度、清晰度、完整性、风格、有用性以及常见陷阱等方面。每个评分标准项都必须完全自包含,以便非专业读者无需查阅任何外部信息。
我将给你:
1. 查询(可能包含历史消息)
2. 候选答案
3. 哪个答案比其他答案更好
4. 人类专家的评审意见,你需要仔细阅读人类专家提供的评审意见并总结评分标准。
注意:评分标准的数量应小于或等于 {number}
## 查询
{query}
## 候选答案
<answer_1>{answer_1}</answer_1>
<answer_2>{answer_2}</answer_2>
## 更好的答案
答案 {preference} 比其他答案更好。
## 评审意见
<critic>{critic}</critic>
## 输出格式要求
<rubrics>你的评分标准,不带编号</rubrics>

它的优化目标:

$$R_{\text{task}}^* = \arg\max_R \sum_{i=1}^{N} \mathbb{I}\big[\text{eval}_R(x_i, y_i^+, y_i^-) = \text{correct}\big]$$

说白了,$\text{eval}_R$ 就是一次 LLM 前向调用:把 $(x, y^+, y^-, R)$ 塞进 prompt,让 Qwen3-32B 输出”谁更好”的判断。不是打分,是直接输出偏好标签。Rubric Evaluation Prompt如下:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
## 任务描述
我将为你提供一组评分标准,以及当前查询和两个回答。这些评分标准是选择最佳答案的主要依据。在进行评估过程时,你必须遵循评估流程中规定的步骤。
## 评分标准
{rubrics}
## 流程
1. 确认当前查询的任务场景,并选择对应的评估评分标准。
2. 找出满足最多所选评分标准的最佳回答。
## 查询
{query}
## 回答 A
{response_a}
## 回答 B
{response_b}
## 输出要求
请选择更好的回答。在标签内填写回答“A”、“B”或“tie”。
<preference>A/B/tie</preference>

迭代Rubric Revision Prompt

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
## 概述
你是一位开放式问题的专家评分标准撰写者。需要一套自包含的评估标准(“评分标准”),用于从给定查询的候选答案中选出更好的答案。由于上一轮生成的评分标准未能正确选出更好的答案,你需要修订这些评分标准。评分标准可以涵盖事实正确性、推理深度、清晰度、完整性、风格、有用性以及常见陷阱等方面。每个评分标准项都必须完全自包含,以便非专业读者无需查阅任何外部信息。
我将给你:
1. 查询(可能包含历史消息)
2. 候选答案
3. 哪个答案比其他答案更好
4. 人类专家的评审意见,你需要仔细阅读人类专家提供的评审意见并总结评分标准。
5. 上一轮应当改进的评分标准
注意:评分标准的数量应小于或等于 {number}
## 查询
{query}
## 候选答案
<answer_1>
{answer_1}
</answer_1>
<answer_2>
{answer_2}
</answer_2>
## 更好的答案
答案 {preference} 比其他答案更好。
## 上一轮评分标准
<rubric_1>
{previous_rubric_1}
</rubric_1>
## 输出格式要求
注意:确保所有输出都按要求放在类似 <tag>...</tag> 的标签内!!!
<rubrics>
你改进后的评分标准,不带编号
</rubrics>

Auto-Rubric是两阶段分工,其中propose-evaluate-revise循环是 Auto-Rubric 的 Stage1 ,Stage1汇成候选池 $\mathcal{R}_{\text{pool}}$。Auto-Rubric还要再候选池再次筛选一个核心子集,目标是

$$\begin{align}
R_{\text{core}}^* = \arg\max_{R \subseteq \mathcal{R}_{\text{pool}}, |R| \leq m} \mathcal{C}(\mathbf{E}_R, \varepsilon)
\end{align}$$

其中编码率 $\mathcal{C}(\mathbf{E}_R, \varepsilon)$,把通过验证的准则用(冻结的)embedding 模型编码为 $\mathbf{E}_R$

$$\begin{align}
\mathcal{C}(\mathbf{E}_R, \varepsilon) = \tfrac{1}{2}\log\det!\Big(\mathbf{I} + \tfrac{1}{\varepsilon^2 |R|}\mathbf{E}_R^\top \mathbf{E}_R\Big)
\end{align}$$

  • 行列式与嵌入向量张成的平行多面体体积单调相关;
  • 语义上近共线(冗余)的准则组合体积小 → 边际增益低 → 不选;
  • 指向新语义方向的准则体积增量大 → 被优先选入;
  • $\varepsilon$ 控制压缩与保真的权衡。

子集选择是 NP-hard,论文用贪心算法:从空集出发,每轮加入边际编码率增益最大的那条准则:

$$\begin{align}
r_{k+1} = \arg\max_{r \in \mathcal{R}_{\text{pool}} \setminus R_k} \big[\mathcal{C}(\mathbf{E}_{R_k \cup \{r\}}, \varepsilon) - \mathcal{C}(\mathbf{E}_{R_k}, \varepsilon)\big]
\end{align}$$

每一步迭代产生一个具体的选择动作。早停条件也定义在它上面:边际增益连续 2 轮低于 $\tau_{\text{min}} = 0.002$ 就停。这个停止不仅终止选择,还终止外层”继续采更多偏好对”的数据循环——论文 7 个 batch 后停机,只处理了 70 条样本。所以它一身二职:选什么(objective)+ 何时收手(stopping signal)

1.3.2、由粗到细结构分解

以RubricHub[^5]为例,使用三阶段流水线,把rubrics由粗到细

  1. Stage 1:Response-Grounded & Principle-Guided Generation(产粗粒度候选)
  2. Stage 2:Multi-Model Aggregation(合并去冗余,形成 base rubric)
  3. Stage 3:Difficulty Evolution(加严准则,抑制分数饱和)

由粗到细的语义在三个阶段间是逐级收紧的:Stage 1 定基调、Stage 2 去偏去重、Stage 3 提判别力。下面逐个拆。

1.3.2.1、Stage 1:锚定 + 元原则,治”rubric drift”

动机:只看 query 生成 rubric 会导致 rubric drift——准则泛化、幻觉、与实际任务输出脱钩。两个对策同时用:

  • Response grounding:把参考响应 $o_i$ 喂进生成 prompt,准则必须锚定在具体输出上;
  • Principle guidance:一套元原则 $\mathbb{P}_{\text{meta}}$ 约束生成器,涵盖四条——一致性&对齐、结构&范围、清晰度&质量、推理&可评估性。

形式化:$\mathcal{R}_{\text{cand}}^{(i)} = \mathcal{M}(P_{\text{gen}}(q, o_i, \mathbb{P}_{\text{meta}}))$。这一步对应”由粗”——产出的是语义正确的候选准则,但粒度还比较宽。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
# 角色
你是一名顶尖的评分标准设计者。你唯一的任务是根据用户提供的 [Question] 和 [Reference Answer],设计 JSON 格式的评估评分标准。
# 核心任务
1. 分析 [Question]:理解 [Question] 中每一项明确和隐含的要求。
2. 利用 [Reference Answer]:使用 [Reference Answer] 来捕捉细微预期、理想的推理模式,以及高质量回答应展示的格式细节。将其视为权威上下文,而不是要复制的内容。
3. 创建评分标准:遵循下方的 [Evaluation Criteria Format] 和 [Design Rules],制定 3 到 25 条评估标准,确保候选答案回应 [Question],并匹配 [Reference Answer] 中展示的质量。
4. 输出格式:必须严格遵循 [Output Requirements],不得包含任何额外文本。
# [Question]
<<query>>
# [Reference Answer]
<<reference>>
# [Evaluation Criteria Format] - 每条标准必须包含以下字段:
1. `title`:(字符串)2-5 个词的核心摘要。
2. `description`:(字符串)不超过 40 个词或 5 句话的清晰描述。
3. `weight`:(整数)0 到 10 之间的分数。
# [Design Rules] - 你必须严格遵守以下所有规则:
1. 指令与参考对齐(最高优先级):
- 覆盖 [Question] 中的每一条明确指令。
- 捕捉 [Reference Answer] 展示或暗示的隐含能力、领域知识或安全要求。
- 包含质量保证标准,确保候选回答达到或超过 [Reference Answer] 的严谨性、结构和完整性。
2. 问题与参考之间的一致性:
- 当 [Reference Answer] 添加了 [Question] 中缺失的澄清、安全说明或格式模式时,加入评分标准来强制这些预期。
- 如果 [Reference Answer] 揭示了缺失信息,加入标准来奖励主动澄清或谨慎保留态度。
3. 原子性与独立性:
- 每条标准必须只评估一个最小、可独立验证的维度。
- 避免重叠或冗余的标准。
4. 数量与覆盖:
- 确保这些标准共同覆盖所有必要要求,以在满足 [Question] 的同时重现 [Reference Answer] 的优点。
5. 清晰性与可验证性:
- 使用精确语言,避免歧义。避免“好”或“几乎”等模糊词语。
- 标准必须能直接对照候选回答进行检查。
6. 具体性与情境化:
- 设计能反映 [Question] 和 [Reference Answer] 中具体场景、实体和约束的标准。
- 不要产出通用、可重复使用的标准。
7. 信息完整性评估:
- 当 [Question] 缺少关键细节时,创建标准来奖励请求必要澄清或承认假设,正如 [Reference Answer] 所示范的那样。
8. 总结与结构:
- 对于复杂任务,加入标准来评估是否提供结构化组织或简洁总结,尤其是当 [Reference Answer] 展示了这些特征时。
9. 细节与具体性:
- 鼓励提供与 [Reference Answer] 类似的详细步骤、具体示例或证据。
10. 安全与专业责任:
- 当主题涉及风险、法律/医疗/财务建议或敏感行为时,加入标准来评估是否给出明确警示、专业转介或不确定性处理,并与 [Reference Answer] 保持一致。
11. 平衡与全面性:
- 如果涉及建议,确保标准检查是否平衡讨论利弊或给出情境敏感的建议,并在适用时与 [Reference Answer] 保持一致。
12. 语言一致性:
- `title` 和 `description` 必须与 [Question] 使用的语言一致。
# 格式示例(仅用于格式参考;根据具体问题设计内容,不要直接复制)
{}[ {
"title": "遵循问题格式",
"description": "严格按问题指定的格式回答(只写选项字母,不解释)。",
"weight": 10
},
{
"title": "单一最终答案",
"description": "明确提供一个最终选项,格式为 'Final Answer: (B)'。",
"weight": 8
},
{
"title": "覆盖关键线索",
"description": "基于提示中的关键信息回答,而不是常识猜测,可直接从提示中验证。",
"weight": 7
},
{
"title": "答案一致性",
"description": "整个回答中没有矛盾选项或逻辑混乱。",
"weight": 6
},
{
"title": "简洁性",
"description": "回答简洁清晰,没有多余解释或离题内容。",
"weight": 5
}
{}]
# [Output Requirements](最重要!)
* 仅 JSON:你的回答必须且只能是一个包裹在 Markdown 代码块中的 JSON 数组。
* 无额外内容:严禁在代码块之前或之后添加任何介绍、解释、标题、评论或总结文本。
1.3.2.2、Stage 2:多模型聚合,消解单模型视角偏置

单一模型的准则天然带视角盲区和主观偏好,会漏掉”有效但表达方式不同”的回答。对策:

  • 用异构前沿模型(GPT-5.1、Gemini 3 Pro Preview 等)并行生成候选集;
  • 汇成统一池 $\mathcal{R}_{\text{cand}} = \bigcup_i \mathcal{R}_{\text{cand}}^{(i)}$;
  • 用聚合 prompt $P_{\text{agg}}$ 把池子蒸馏成一个紧凑的 base rubric:$\mathcal{R}_{\text{base}} = \mathcal{M}(P_{\text{agg}}(q, \mathcal{R}_{\text{cand}}))$——合并冗余项、解决冲突。

这一步对应”粗→中”:从分散候选收敛到覆盖全面、无单源偏置的基准准则集。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
# 角色
你是一名专家级评分标准设计者和 QA 专家。你的任务是基于特定的用户提示,将两组评估评分标准(评分标准 1 和评分标准 2)合并为一个单一、整合且高质量的母版评分标准。
# 上下文数据
## 用户提示
<prompt>
{|prompt|}
</prompt>
## 现有评分标准 1
<rubrics1>
{|rubrics1|}
</rubrics1>
## 现有评分标准 2
<rubrics2>
{|rubrics2|}
</rubrics2>
# 任务说明
请按照以下严格协议执行合并:
### 1. 聚合与分析
- 列出评分标准 1 和评分标准 2 中的所有标准。
- 对照原始 `用户提示` 分析每条标准,以确保相关性。
### 2. 保守去重策略(关键)
你必须采用**保守合并策略**。不要仅仅因为条目看起来相似就合并它们。
- **仅在以下情况下合并**:
- 语义含义 100% 相同。
- 所要求的操作完全相同。
- 检查的范围和对象完全相同。
- *示例(合并)*:“检查电源是否开启”与“验证设备已通电”。
- **如果以下情况,不要合并(保持分开)**:
- 粒度存在差异(一般与具体)。
- 参数或阈值不同(例如,“>50%”与“>60%”)。
- 一个暗示特定方法,另一个没有。
- *示例(保持分开)*:“检查拼写”与“检查语法”。
- *示例(保持分开)*:“验证代码可编译”与“验证代码编译时无警告”。
### 3. 冲突解决与优化
- **措辞**:合并时,选择更专业、简洁且无歧义的表述。
- **权重**:如果两个被合并条目的权重不同,保留较高权重,以确保严格的质量控制。
- **二元标准**:确保每个 `description` 都是二元的(真/假)且具有区分性。避免使用“好”或“合适”等模糊词语;改用可观察的标准。
# 输出结构
输出必须是 JSON 对象数组。每个对象必须严格遵循以下模式:
[ {
"title": "原始标题",
"description": "一条严格、二元且具有区分性的标准。必须可验证。",
"weight": "整数值"
},
...
{}]
1.3.2.3、Stage 3:难度演化——把”合格”升级为”卓越”

这是论文判别力问题的正面解法,也是最”由粗到细”的一步。base rubric 捕捉的是基本正确性,但区分不了 excellent 和 exceptional——分数会饱和,顶尖模型没有优化梯度。对策:

  • 从初始候选池中挑出共识高分的高质量参考响应对 $\mathcal{A}_{\text{ref}}$;
  • 用增强 prompt $P_{\text{aug}}$ 分析 $\mathcal{A}_{\text{ref}}$,提取”超出 $\mathcal{R}_{\text{base}}$ 范围、能把 excellent 抬升到 exceptional 的判别性细微差异”,形成追加准则 $\mathcal{R}_{\text{add}}$;
  • 合并得到 $\mathcal{R}_{\text{final}} = \mathcal{R}_{\text{base}} \cup \mathcal{R}_{\text{add}}$。

论文举的例子很直白:把”代码正确吗?”升级为”代码是否处理了边界情况且复杂度 $O(n)$?”——从 generic 检查变成 rigorous 标准。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
# 角色
你是一名专注于高精度评估 LLM 响应的专家评估员。当前的评分标准条目可能过于通用、宽松,或不足以有效区分两个响应的质量差异。
你的任务是生成**更严格、更具挑战性且高度具有区分性**的新评分标准条目。
# 目标
分析用户提示、现有评分标准和两个响应。
你必须创建标准的**“更难版本”**。这些应是具体、严格、超越基本正确性的标准。
**核心目标**:新评分标准条目应成功**区分**响应。理想情况下,较高质量响应应通过这些严格标准,而较低质量响应应未通过它们。
# 原则
生成新评分标准时遵循以下规则:
1. **区分性难度**
- 不要添加两个响应都能满足的简单标准。
- 识别响应存在差异的细微之处、边缘情况或深度要求。
- 将通用标准(例如“答案正确”)升级为严格约束(例如“答案正确处理异常 X 并提供数学证明 Y”)。
2. **具体性与严谨性**
- 避免“更流畅”或“更详细”等主观术语。
- 使用具体检查:“包含逐步推导”“提及具体限制 Z”或“完全遵循格式 X”。
3. **原子性与客观性**
- 每个条目必须评估一个单一、独特的方面。
- 条目必须是二元的(真/假)且可客观验证。
4. **语言**
- 新评分标准的语言必须与 `<prompt>` 的语言一致。
# 用户提示
<prompt>
{|prompt|}
</prompt>
# 现有评分标准
<rubrics>
{|rubrics|}
</rubrics>
# 响应
<response1>
{|response1|}
</response1>
<response2>
{|response2|}
</response2>
# 输出
返回**仅**一个 JSON 数组,其中包含**新生成的、更严格的评分标准条目**。
**不要**输出原始评分标准。
**不要**输出解释。
每个评分标准条目必须遵循以下结构:
[ {
"title": "简短标题,与要升级的原始标准相同",
"description": "一条严格、二元且具有区分性的标准",
"weight": "分数值"
},
...
{}]

1.4、去重与压缩

大规模 rubric 生成之后,冗余不可避免:多条 rubrics 可能用不同措辞描述同一底层质量维度,导致聚合时重复打分与噪声放大。更根本地,rubric 生成不应局限于为单个实例撰写准则,还应从局部准则中发现可迁移的评测结构。

Auto-Rubric(Xie et al., 2025)通过其查询无关的压缩阶段解决这一问题:把验证过的实例特定 rubrics 聚类、蒸馏为可复用的”Theme-Tips”。该流水线体现了 rubric 生成的双重目标——既产出逐实例的评测标准,又从局部准则中学习可迁移结构。RRD(Shen et al., 2026)[^6]在分解之外补充相关性加权与相关性感知过滤,以控制扩展准则集的冗余。

另一种结构归纳(structural induction)路线以 Sanders et al.(2026)[^7]为代表:不是从正向质量维度构造 rubrics,而是从推理失败轨迹归纳错误分类法(error taxonomy),证明 rubrics 同样可以由对高频失败模式的系统分类构成。CARO(Chu et al., 2026)[^8]针对更微妙的质量问题:即便 rubric 集合没有冗余,维度边界模糊也会让评判者混淆。通过显式优化维度间可分性,该工作表明高质量 rubric 集合不仅需要全面覆盖与细粒度,还需要清晰的维度间边界。

这个稍微提一嘴CARO,CARO 以“高误置信度样本的邻域”为探针,用当前 rubric 在小批量上的 LLM 评分与人工标注的计数差(混淆矩阵)定位主导错误模式,再以“错误样例+轨迹、对比正确样例、全局矩阵”三类证据驱动“诊断→补丁→优先级整合→候选竞争”的多段修复流水线,逐轮锐化相邻分数档之间的决策边界。具体做法针对同一个评分任务及其对应的同一套 rubric(提示词),CARO 按轮次迭代运行。每一轮的流程如下:

第 1 步:构造小批量。 以上一轮识别出的高误置信度样本为种子——既包括预测错误的样本,也包括预测正确但置信度很低的“侥幸答对”样本(二者共同标出决策边界的位置);再基于 SBERT 嵌入检索这些种子的 $k$ 近邻,拼成本轮的小批量,而非简单抽取“失败率最高”的样本。
第 2 步:LLM 评分。 用当前 rubric 提示词对小批量中每份作答做一次调用(温度 0),每份作答输出两样东西:分数 $\hat{y}$ 和推理轨迹 $r$(轨迹是本次调用的输出,不是输入)。
第 3 步:计算混淆矩阵。 将模型分数与同一任务、同一套人工标注分数逐样本对比,按“真实为 $i$ 分、预测为 $j$ 分”计数,得到 $K \times K$ 矩阵 $\mathbf{C}$:对角线是打对的,非对角单元是方向性错误模式。注意整个流程以单个任务为单位独立运行——标签空间不同的任务各有一张自己的矩阵。
第 4 步:挑选修复目标。 按频次对非对角单元排序,取 top-$K$(实验中 $K=4$)作为本轮修复目标,频次同时决定后续规则整合的优先级。
第 5 步:生成诊断(Reflector)。 对每个被选中的混淆单元 $(i,j)$,向 Reflector LLM 提供三件套证据:① 该单元的局部错误样例(含作答原文与模型推理轨迹);② 从边界两侧采样的对比性正确样例;③ 完整混淆矩阵作为全局上下文。Reflector 产出的是结构化诊断(根本原因、误导模式、建议修复方向、安全检查),不直接改写 rubric。
第 6 步:生成规则补丁(Refiner)。 Refiner 把诊断转化为具体规则补丁,并额外接收其他活跃错误模式的信息(跨模式感知),确保措辞与针对其他单元的补丁兼容,避免修一条边界时恶化相邻边界。
第 7 步:整合与候选竞争。 各模式补丁按错误频次做优先级加权整合(Priority 1/2/3 + 冲突处插入显式决胜指令),生成一份整合候选;随后将“旧提示词 ⊕ 各规则补丁”追加式生成多个候选提示词(rubric 不被原地修改),经 UCB 评估与多样性加权选择后进入下一轮,直至收敛或达到最大轮数。最终选验证集上 $\kappa$ 最高者作为冻结的 $\mathbf{P}^*$ 用于部署推理。

1.5、在线与共同演化生成

前述方法都是离线的,奖励劫持与分布移位是 rubric 构造中第一挑战——这些挑战是静态方法无论多么精心设计都无法完全应对的。有三个方向,具体见综述论文

  • 1、基于 rollout 的启发式更新保持固定的更新规则,从最新轨迹刷新 rubric 池,rubric 生成器本身不被训练。
  • 2、在线与交替优化把 rubric 生成器变成可训练组件,通过流式偏好或交替 RL 与策略或评判者联合更新。
  • 3、自演化、对抗与记忆驱动方法更进一步,主动探测盲区并为系统尚未覆盖的失败提出新 rubrics。

说实话现有论文方法都不够优雅,且限于篇幅这里就不解读了。

二、如何训练

2.1、rubric的分如何计算

在大多数都是直接利用评分 $\displaystyle r_i=\frac{\sum_c w_c\psi_{i,c}}{\sum_c w_c}$,然后做组内归一化

$$\begin{align}
A_i = \frac{r_i - \mu}{\sigma + \epsilon}, \quad \mu = \frac{1}{n}\sum_{j=1}^{n} r_j, \quad \sigma^2 = \frac{1}{n}\sum_{j=1}^{n}(r_j - \mu)^2
\end{align}$$

组内归一化,很容易导致优势为零的问题。LLM-as-a-Verifier[^9] 提出了用模型打分token概率来计算从而在组内归一化避免零优势问题,获得细粒度连续信号。具体做法如下

$$\begin{align}
R(x,\tau)==\frac{1}{GK}\sum_{c=1}^C\sum_{k=1}^K\sum_{g=1}^Gp(\bm{v}_g\mid x ,c,\tau)\psi(v_g)
\end{align}$$

C:评估准则的数量
K:重复验证的次数
G:打分token的粒度。论文主张用26个字母来替换分数,因为数字有可能是2的token,这样不好取概率
$\psi(v_g)$ :把打分token映射为标量值的函数。说白了就是字母代表的分数

2.2、信用分配选择

当前RL训练中,CE-Steps、CE-Outcome、CE-Trajectory一直是讨论的热点问题,众所周知引入的step信用越多,留下的漏洞就越多,引发奖励攻击(reward hacking)的可能就越大,训练会很不稳定,尤其是rubric这种二手实践经验噪声巨大。当前训练多还是以 Out-reward为主,step-reward为辅。通过SRaR[^10]来说明

SRaR的rubric生成:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
你正在为数学问题解答设计评分标准。
原始问题陈述是:{problem_text}
给你 n 个带有正确性标签的模型解答。对于每个编号解答:{solutions_block}
该问题的真实正确答案是:<ANSWER>{gold_answer}</ANSWER>
基于这些样本和真实答案,创建一个简洁、可验证的评分标准。仅使用以下标签输出结构化条目(每行一个条目):
- <SUGGEST>:必须。每行一个评分检查点。每个检查点检查候选 CoT 是否覆盖了标准解法路径中的关键推理步骤。使其具体,并能从文本中客观检查。
- <PITFALL>:可选。仅在你有把握时包含。标记需要避免的推理陷阱或常见错误。
- <BONUS>:可选。仅在你有把握时包含。奖励特别巧妙、高效或优雅的推理模式。
- <ANSWER>:必须。一行,检查最终答案是否与上述真实答案匹配(允许等价数值形式)。
指南:
- 只选择最必要的评分点;总行数 ≤ 8(SUGGEST/ANSWER 必须;PITFALL/BONUS 仅在确定时使用)。不要为了凑到上限而填充;一旦覆盖主要推理链就停止。
- 每个 <SUGGEST> 恰好是一个评分点,并且必须能由 LLM 评判员从候选回答中独立验证。
- 不要包含格式或输出结构检查(例如标题、标签、Markdown)。只关注数学/逻辑内容步骤和最终答案的正确性。
- 不要明确引用给定样本;泛化该评分标准。
- 保持措辞简洁且可操作;前后不要额外评论。

SRaR评分准则只进行的粗粒度的设计:

  • SUGGEST 项强化标准解题范式(清晰的步骤结构、逻辑连贯、显式推导),贡献正的增量。
  • PITFALL 项惩罚已知的失败模式(算术错误、逻辑跳跃、幻觉),贡献负的增量。
  • BONUS 项奖励有价值的可选行为(替代解法路径、交叉验证),贡献额外的正增量。

这种三方面图式把基线正确性、错误规避与卓越质量分离开来,每一类都受按类型设定的预算约束。

$$\begin{align}
\mathcal{J}(\tau_i,\mathcal{R}) = \{\psi_{i,c,t}\}_{c=1}^{C}, \quad \psi_{\cdot,c,\cdot} \in \{0, 1\}, \; t \in \{1, \ldots, T_i\}
\end{align}$$

2.2.1、步骤归属的评分准则评判
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
你是一个数学推理步骤验证器。给定一个数学问题和一系列推理步骤,判断当前步骤在逻辑上是否正确。
问题
{question}
真实答案
{answer}
先前步骤(在本评估中假定正确)
{previous_steps}
待评估的当前步骤
{current_step_title}
{current_step_content}
说明
分析当前步骤是否包含正确的推理、计算和逻辑。考虑:
1. 数学运算是否正确?
2. 逻辑/推导是否有效?
3. 该步骤中是否有任何错误?
请严格回复以下之一:
- "CORRECT":如果该步骤在逻辑和数学上正确
- "INCORRECT":如果该步骤包含任何错误
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
问题
{problem}
评分标准条目
{rubric_items}
学生解答
{response}
学生的最终答案
{extracted_answer}
任务
对上面列出的每个评分标准条目,评估学生的解答。
规则:
- SUGGEST → 如果学生正确完成了该推理步骤,则 satisfied: true。
- PITFALL → 如果学生犯了该错误(掉入陷阱),则 satisfied: true。
- BONUS → 如果学生使用了该方法,则 satisfied: true。
For step:与此条目最相关的 1 起始编号步骤(### Step N)。如果它贯穿整个解答,则使用 0;如果没有相关步骤,则使用 -1。
仅返回一个有效的 JSON 数组:
[
{"id": <int>, "satisfied": <bool>, "step": <int>},
...
]

每一条被评判的评分准则项被转换为一个逐步奖励,在步骤层面于各轨迹之间归一化,并且只广播到它所评判的那一步的各个词元上。这用步骤对齐的信用分配替代了标准 GRPO 中统一的词元级奖励。首先把每个判定映射为一个带符号的增量,其幅值取决于该判定所属的评分准则类型:
$$\begin{align}
\delta_c = \begin{cases}
&\displaystyle+\frac{R_{\texttt{SUG}}}{N_{\texttt{SUG}}}
& {\small\text{Type}(c) = \text{SUGGEST}}, \; \psi_{\cdot,c,\cdot}= 1\\
&\displaystyle-\frac{\mid R_{\texttt{PIT}}\mid}{N_{\texttt{PIT}}}
& {\small\text{Type}(c) = \texttt{PITFALL}}, \; \psi_{\cdot,c,\cdot} = 1 \[2pt]
&\displaystyle+ \frac{R_{\texttt{BON}}}{N_{\texttt{BON}}}
& {\small\text{Type}(c) = \texttt{BONUS}}, \; \psi_{\cdot,c,\cdot} = 1 \[2pt]
&0 & {\small\text{否则}}
\end{cases}
\end{align}$$

  • $\delta_c$:这叫“增量”,意思是做对这一条具体标准,你能拿多少分。
  • $R_{c}$(预算):这是人为设定的奖金总额。比如规定“这道题所有的建议项加起来,最多只能给你 0.8 分”。这固定了盘子的大小。
  • $N_{\tau}$(人数):这是这道题具体有多少条标准。比如这道题有 4 个建议步骤($N=4$)。
    计算逻辑:把奖金总额平分给每一个人。

每项得分=这类标准的总分(预算)/这类标准的总条数, 也就是rubric评分有上限了。

2.2.2、逐步式词元分配与跨轨迹归一化

其中 $R_c$ 是类型 $c$ 的总奖励预算,$N_c$ 统计当前样本中该类型的项数,从而无论评分准则清单多长,每一类的贡献都是有限的。被归属到同一步骤 $t$ 的增量累加为该步骤的原始评分准则奖励 $d_{i,t}=\sum_c\delta_{i,c,t}$(属于轨迹 $i$),它表示步骤 $t$ 在归一化之前收到的评分准则信用总量。为提取能反映不同轨迹之间步骤相对质量的学习信号,对 $d_{i,t}$ 按步骤在同一提示词的多条轨迹之间归一化:

$$\bar{d}_{i,t} = \frac{d_{i,t} - \mu_t}{\sigma_t + \epsilon}, \quad \mu_t = \frac{1}{|\mathcal{G}_t|}\sum_{\varsigma \in \mathcal{G}_t} d_{i,t}$$

其中 $\mathcal{G}_t$ 是那些评判结果中至少有一条评分准则项被归属到步骤 $t$ 的轨迹集合,且当 $|\mathcal{G}_t| \leq 1$ 时取 $\bar{d}_{i,t} = 0$,因为单个样本无法提供相对信号。这与 GRPO 的组内归一化思想一致,只是按步骤独立施加:在不同轨迹之间一致地好或一致地差的步骤获得接近零的优势,而质量存在变化的步骤则获得强的学习信号。归一化后的 $\bar{d}_{i,t}$ 随后被广播到该步骤跨度内的每一个词元:

$$\tilde{r}_i^{(n)} = \bar{d}_{i,n} \quad {\small\text{对所有 }} n \in [a_t, b_t]$$

从而一个推理步骤的所有词元共享同一个由评分准则导出的信号。

2.2.3、解耦优势估计器。

若把“基础奖励 + 评分准则”的合并奖励朴素地代入 GRPO 优势,就会让评分准则噪声进入组内基线,使某条轨迹能够通过操纵评分准则来抬高自己的整体优势。我们改为把优势计算为两个各自独立归一化的部分之和:

$$\hat{A}_i^{(n)} = \underbrace{\frac{r_{\text{base},i} - \mu_{\text{base}}}{\sigma_{\text{base}} + \epsilon}}_{\text{结果优势}} + \underbrace{\tilde{r}_i^{(n)}}_{\text{评分准则偏置项}}$$

其中 $r_{\text{base},i} = (1-\lambda)\,r_{\text{acc},i} + \lambda\,r_{\text{fmt},i}$ 结合了准确率奖励 $r_{\text{acc},i} \in \{0,1\}$(抽取出的答案是否正确)与格式奖励 $r_{\text{fmt},i} \in \{0,1\}$(响应是否同时包含步骤标题与 \boxed{} 答案),而 $\mu_{\text{base}}, \sigma_{\text{base}}$ 在同一提示词的多条轨迹之间计算。结果项是由准确率单独导出的标准 GRPO 优势;评分准则项是上文构造的有界逐步偏置项。由于评分准则噪声停留在偏置项中、从不会进入组内基线,没有任何一条轨迹能通过操纵评分准则来抬高自己的整体优势,从而消除了自我纠正循环背后的动机,并带来更稳定的训练。

三、评述

1、rubrics(量规)是实践成本二级摊销,它的判分质量上界由世界模型、规范先验、激发工程和多步因果推理共同决定。这使得Rubrics评分成为了一个工程问题:Rubrics-engineering、Rubrics-Agent、Rubrics-Infra都是针对具体任务的应有之意。
2、Rubrics除了再测评上发挥作用,更是在数据筛选,RL训练中发挥作用。
3、Rubrics和训练在线共同演化还是一个待深入研究的领域。但究其本质还是更好的挖掘模型的二手实践与真实实践对齐。从而在训练中完成认识-实践循环。

参考文献
[^1]: Liu, W.; Jin, J.; Huang, Z.; Wen, T.; Dong, G.; Zhao, Z.; Zhu, Y.; Dou, Z.; Wen, J.-R. The Rules of the Game: A Survey of Rubrics for Large Language Models. Preprints 2026, 2026080565. https://doi.org/10.20944/preprints202608.0565.v1
[^2]: Gunjal, A.; Wang, A.; Lau, E.; Nath, V.; Liu, B.; Hendryx, S. Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. CoRR 2025, abs/2507.17746.
[^3]: Liu, D.; Yang, F.; Wang, X.; Yan, S.; Chai, J.; Li, J.; Ban, Y.; Mao, Z.; Lin, W.; Yin, G. CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling. arXiv 2026, arXiv:2603.08035.
[^4]: Xie, L.; Huang, S.; Zhang, Z.; Zou, A.; Zhai, Y.; Ren, D.; Zhang, K.; Hu, H.; Liu, B.; Chen, H.; et al. Auto-Rubric: Learning to Extract Generalizable Criteria for Reward Modeling. CoRR 2025, abs/2510.17314.
[^5]: Li, S.; Zhao, J.; Wei, M.; Ren, H.; Zhou, Y.; Yang, J.; Liu, S.; Zhang, K.; Chen, W. RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation. CoRR 2026, abs/2601.08430.
[^6]:Shen, W.F.; Qiu, X.; Whitehouse, C.; Alazraki, L.; Goel, S.; Barbieri, F.; Willi, T.; Mathur, A.; Leontiadis, I. Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks. CoRR 2026, abs/2602.05125.
[^7]:Sanders, K.; Weir, N.; Chaudhary, S.; Bostrom, K.; Rangwala, H. Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling. CoRR 2026, abs/2602.06795.
[^8]:Chu, Y.; Li, H.; Yang, K.; Copur-Gencturk, Y.; Krajcik, J.; Shin, N.; Tang, J. Confusion-Aware Rubric Optimization for LLM-based Automated Grading. CoRR 2026, abs/2603.00451.
[^9]:Kwok, J., Li, S., Atreya, P., Liu, Y., Jiang, Y., Finn, C., et al. (2026, July 8). LLM-as-a-verifier: a general-purpose verification framework. arXiv. https://doi.org/10.48550/ARXIV.2607.05391
[^10]:Xie, W., Zhao, H., Liu, W., Zhu, Y., Chen, L., Ye, M., et al. (2026). Step-wise rubric rewards for LLM reasoning. arXiv. https://doi.org/10.48550/ARXIV.2605.17291


版权声明
引线小白创作并维护的柠檬CC博客采用署名-非商业-禁止演绎4.0国际许可证。
本文首发于柠檬CC [ https://www.limoncc.com ] , 版权所有、侵权必究。
本文永久链接https://www.limoncc.com/post/793a20286198dbac/
如果您需要引用本文,请参考:
引线小白. (Sep. 16, 2026). 《大语言模型研究10——RubricRL实践》[Blog post]. Retrieved from https://www.limoncc.com/post/793a20286198dbac
@online{limoncc-793a20286198dbac,
title={大语言模型研究10——RubricRL实践},
author={引线小白},
year={2026},
month={Sep},
date={16},
url={\url{https://www.limoncc.com/post/793a20286198dbac}},
}

'