投稿者: | 2026年6月26日

研究者たちはGPTスタイルのトランスフォーマーを使って、ボードゲーム「オセロ」の合法的な一連の動きを学習させた。入力したのは動きのシーケンスだけで、それ以外は何も与えなかった。駒の意味や、何が勝利となるのかといった説明も一切なかった。モデルの学習目標は、シーケンス内の次の合法的な動きを予測することだけだった。モデルはこの点において非常に優れた能力を発揮した。そこで研究者たちは、巧妙なことをした。モデルの内部活性化を調べて、盤面の状態を内部的に表現できるようになったかどうかを確認したのだ。

このモデルは、盤面を見せられることなく、どのマスにどの駒が配置されているかを内部的に追跡することを学習しました。マスの占有数は、次の合法的な手を予測するために暗黙のうちに必要でした。このモデルは、盤面の状態を知ることが訓練されたタスクをうまくこなすために不可欠だったため、駒の動きのシーケンスから盤面を逆算しました。それは、紙に盤面を描くように「考える」のではなく、経験豊富なオセロプレイヤーが頭の中で盤面を思い描くように考えていたのだと思います。つまり、予測をサポートする機能的なモデルのようなもので、「ここに駒を置けば、相手はあそこに駒を置くことができ、その後は…」といった戦術を考えることができるのです。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です