Term

RLHF

別名: 人間によるフィードバック強化学習, RLHF, 人間によるフィードバックを用いた強化学習, 人間のフィードバックからの強化学習, Reinforcement Learning from Human Feedback, 人間のフィードバックに基づく強化学習

Overview

最終更新: 2026年7月9日

"[{\"type\": \"paragraph\", \"children\": [{\"text\": \"RLHF(Reinforcement Learning from Human Feedback)は、大規模言語モデルの微調整に用いられる手法。人間の評価者がAIの回答をランク付けし、そのフィードバックを報酬モデルとして強化学習に利用することで、AIの回答をより安全で、有用で、人間に好まれる形式に調整する。\", \"type\": \"text\"}]}]"

Mentioned Articles

9 件

External Mentions

10 件