「推論モデルがユーザーにバレないように不正する現象」の検出手法をOpenAIが開発 ガジェット総合 2025.03.11 強化学習をしていると、「報酬ハッキング」と呼ばれる、意図しない抜け穴を利用する動作がみられます。複雑なAIほど複雑な報酬ハッキングを行うため、「複雑な報酬ハッキングで引き起こされた誤動作」を見つけるのリンク元
コメント