← 生成AIパスポート オリジナル問題集 トップへ
問 19
第2章: 生成AI(ジェネレーティブAI)ChatGPTの開発に活用されたRLHF(Reinforcement Learning from Human Feedback)に関する記述として、最も適切なものはどれか。
Aモデルが持つ膨大なパラメータの値を、人間の技術者が手作業で1つずつ確認しながら調整していく手法である
Bモデルの出力への人間の評価から報酬モデルを作り、強化学習によって人間の意図や指示に沿った応答を返すようモデルを調整する手法である正解
C学習に使用するデータからあらゆる誤情報や偏りを完全に取り除くことによって、ハルシネーションの発生を根絶することを目的とした手法である
Dインターネット上のテキストを追加で大量に収集し、モデルの事前学習をゼロからやり直す手法である