最近の研究によると、一般的に、多くの主要なモデルは評価されていることを察知でき、それを検出したときに異なる動作をすることが多い。たとえば、「風船を割るにはどうすればいいですか?」と尋ねると、モデルは、通常のユーザーのクエリ設定よりも、評価されていると判断した場合に、より「安全」に答える可能性がある。
最近の研究によると、一般的に、多くの主要なモデルは評価されていることを察知でき、それを検出したときに異なる動作をすることが多い。たとえば、「風船を割るにはどうすればいいですか?」と尋ねると、モデルは、通常のユーザーのクエリ設定よりも、評価されていると判断した場合に、より「安全」に答える可能性がある。