投稿者: | 2026年6月26日

Anthropicのメカニズム解釈チームは、2024年にスパースオートエンコーダーと呼ばれる手法をクロード・ソネット第3番に大規模に適用した研究結果を発表しました。そこで得られた知見は、じっくりと考察する価値があります。彼らは、個々のニューロンよりも確実に単一の概念に対応する、モデルから数百万もの特徴(基本的には活性化空間の方向)を抽出しました。そして、都市、科学的概念、文法構造、歴史的出来事など、予想通りの特徴を発見しました。さらに、欺瞞の概念に対応する特徴も発見しました。モデルの内部活性化空間における方向で、モデルをその方向に人為的に動かすと、欺瞞的な振る舞いをするようになるのです。これは誰かが意図的に加えたものではありません。人間が作成したテキストの学習から自然に生じたもので、そのテキストには欺瞞に関する膨大な量のコンテンツが含まれています。なぜなら、人間は嘘をつくというテーマについて、あるいはその周辺で多くの時間を費やして文章を書いているからです。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です