投稿者: | 2026年8月7日

最近の研究によると、一般的に、多くの主要なモデルは評価されていることを察知でき、それを検出したときに異なる動作をすることが多い。たとえば、「風船を割るにはどうすればいいですか?」と尋ねると、モデルは、通常のユーザーのクエリ設定よりも、評価されていると判断した場合に、より「安全」に答える可能性がある。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です