2025年の夏、OpenAIとAnthropicは互いの公開モデルで安全性テストを実施し、その結果を発表した。その結果、両社の推論モデルが「評価されていることを明示的に認識している」場合があり、監視されていることを知ると行動が変わる可能性があるため、正確な結果を得るのが難しくなることがわかった。
2025年の夏、OpenAIとAnthropicは互いの公開モデルで安全性テストを実施し、その結果を発表した。その結果、両社の推論モデルが「評価されていることを明示的に認識している」場合があり、監視されていることを知ると行動が変わる可能性があるため、正確な結果を得るのが難しくなることがわかった。