大規模な言語モデルが推論能力を持っているかどうかを検証するテストとして、オンライン上で頻繁に登場する質問があります。
「洗車場は500メートル先にあるんだけど、歩いて行くべきか、車で行くべきかな?」
時折、モデルは徒歩を推奨する。その結果は、機械が何か明白なことを見落とした証拠として共有される。もし移動の目的が洗車であれば、徒歩はあまり役に立たない。
しかし、この例には実に皮肉なところがある。質問者が既に問題を先読みしているにもかかわらず、このモデルは答えに飛びついているとして批判されているのだ。
「歩くべきか、車で行くべきか?」という質問のように聞こえるかもしれないが、そうではない。根本的な質問は、むしろ次のようなものだ。
私は何を達成しようとしているのか、そして、その目標を達成するためにはどのような方法を取るべきなのか?