Term

Group Relative Policy Optimization

別名: GRPO, Group Relative Policy Optimization

Overview

最終更新: 2026年7月9日

Group Relative Policy Optimization (GRPO) は、DeepSeekが開発した革新的な強化学習アルゴリズムである。従来の標準的な手法であるPPO(Proximal Policy Optimization)では、学習を安定させるために「価値関数(Value Function)」を推定する別のモデル(クリティック)を用意する必要があり、これが膨大なメモリと計算資源を消費していた。GRPOでは、同じプロンプトに対して複数の回答を生成し、そのグループ内での相対的なスコアを基準に学習を進めることで、価値関数モデルを不要にした。これにより、計算コストを従来の数分の一に抑えつつ、推論能力を効果的に向上させることが可能となった。DeepSeek-R1の驚異的な低コスト訓練を実現した中核技術である。

Mentioned Articles

3 件

External Mentions

10 件