Sunday面试指南

GRPO 是什么?和 PPO 有什么区别,为什么不需要单独的价值模型?

下面是一段教学用的模拟面试。

🧑‍💻 面试官:GRPO 为什么可以省掉价值模型?

🙋‍♂️ 我:同一个问题采样多份回答,用这一组的奖励来构造相对优势。

🧑‍💻 面试官:那么奖励模型也不要了,模型自己比较哪个回答好就行?

🙋‍♂️ 我:不是。省掉价值模型,不代表不用奖励,奖励还需要可信来源。

🧑‍💻 面试官:如果四份回答都错了,或者都得一分,这组数据还能提供什么信号?训练又怎样避免一步改得太大?

先分清两种工作:奖励评价回答结果,价值估计提供比较基线。GRPO 改的是后面这部分。

面试速答(60 秒版)

GRPO 是一种策略优化方法。它针对同一个问题采样一组回答,分别获得奖励,再利用组内奖励构造相对优势,指导模型调整生成这些回答的概率。

在常见的大模型 PPO 训练中,除了策略模型,还会训练价值模型,用它估计基线并计算优势。GRPO 用组内比较替代这套独立价值估计,因此可以省去相应的训练与内存开销。

但奖励仍然需要提供。可以来自可验证的规则,也可以来自奖励模型;“没有价值模型”和“没有奖励模型”是两回事。

同时,多份回答的采样、奖励质量、组内差异,以及限制策略变化的机制仍然重要。它不是随便选一份最好答案再模仿,也不意味着只要采用 GRPO,推理能力就会自动提高。

同一题采样多回答,经可靠奖励后用组内比较提供策略更新信号

知识点详解:同一题的多份回答,怎样变成训练信号?

奖励与价值,分别在回答什么?

咱们假设训练任务是解一道有标准结果的数学题。

奖励可以根据最终结果是否正确给分,也可以结合格式或其他规则。它回答的是“这份回答获得多少评价”。

价值估计则试图判断当前状态下,后续大概能得到多少回报。优势比较实际回报与基线,帮助判断某个动作相对预期是更好还是更差。

所以,即使它们都输出数值,也不能把奖励模型与价值模型当成同一个组件。

GRPO 为什么要一题生成一组?

假设同一道题采样出四份回答,奖励分别为 0、0、1、1。组内平均奖励是 0.5。

在原始方法的一种结果监督形式中,可以用“奖励减组内均值,再按组内标准差归一化”来构造相对优势。高于基线的回答得到正向信号,低于基线的回答得到负向信号。

这一组回答提供了就地比较的基线,因此不再需要训练独立价值模型来完成相应估计。方法来源见 DeepSeekMath 原始论文。

这个小例子只是解释信号如何产生,不是声称奖励只能为 0 或 1,也不覆盖所有后续 GRPO 变体。

这和“选最好的一份做监督学习”有什么不同?

只拿最佳回答做监督学习,通常是在训练模型复现那份文本。

GRPO 的策略更新会考虑采样回答相对于基线的优势,以及新旧策略下这些生成动作的概率关系。它不只保存一份答案,也会利用较差回答对应的信号。

同时,不能把“正优势”理解成这份回答的每一句话都正确。若奖励只看最终答案,中间可能存在推导缺陷。奖励定义与监督粒度,会决定模型学到什么。

一组奖励完全一样,怎么办?

假设四份回答都得 0 分。它们在组内没有优劣差异,简单的归一化还会碰到标准差为零的问题。

实现必须处理这个数值边界。即使加入稳定项解决了除零,也不会凭空创造有用的相对信号。

因此要检查训练题目的难度、采样多样性和奖励分布。全对或全错的组太多,可能意味着当前数据和训练阶段不匹配。不能只增加采样份数,就认为一定获得了更好的学习信息。

GRPO一组相同奖励不提供区分组内回答的相对信号

为什么还要限制更新幅度?

采样来自旧策略,更新以后策略发生变化。如果一次把生成概率改得过大,原来的样本和当前策略之间可能失去合理关系。

原始 GRPO 保留了限制策略更新的设计,也使用相应的 KL 约束。后续实现可能采用不同安排,讨论具体训练时要看目标函数和配置,不能只看名字。

工程上还要观察奖励是否升高、输出是否变长、格式是否被投机利用,以及真实任务表现有没有改善。奖励分数上升,但模型只学会迎合评分漏洞,并不算训练成功。

真正节省的是哪一部分?

省掉独立价值模型,可以减少对应模型、梯度和优化器状态的开销。但同题多回答的生成、奖励计算、参考策略与训练本身仍然要消耗资源。

因此应比较完整训练任务的显存、吞吐与达到目标效果所需的时间,不能把“少了一个模型”直接换算成固定成本降幅。

面试官继续追问

奖励来自规则,还需要奖励模型吗?

如果任务可以可靠验证,例如结果判定或受控测试,可以使用规则奖励,不必强行增加奖励模型。但开放式质量判断可能需要其他评估方式。

只检查最终答案,会不会学到错误推导?

有这个风险。最终结果奖励不能完整证明过程可靠,需要相应过程检查、数据与评测来约束。

GRPO 一定比 PPO 更好吗?

不能脱离任务和实现比较。它减少独立价值估计的开销,但组内比较的信号质量、采样成本和训练稳定性仍然要验证。

面试速记卡

  • 奖励评价结果,价值估计提供预期回报基线。
  • GRPO 用同题多回答的组内奖励构造相对优势。
  • 省掉独立价值模型,不等于省掉奖励。
  • 组内奖励无差异,需要处理数值与有效信号问题。
  • 更新幅度、奖励投机和真实效果都要检查。
  • 资源收益看完整训练流程,不报固定降幅。

公司面试真题

这道题暂未收录可核验的公司真题来源。你可以先阅读本文解析,或浏览已收录的公司面试真题。

浏览公司面试真题 →
简历汪永久免费在线制作简历,模板直接套用、导出无水印,永久免费、下载免费,不需要付费解锁任何功能。去写简历