投稿者: | 2026年7月3日

ClaudeやGPT-5の料金を支払わずにコーディングエージェントを実行するために、自分のマシンに2,000ドルから5,000ドルを費やすことになるでしょう。現在の一般的なアドバイスは、予算内で買える最大のGPUを購入し、データセンターで人気の推論エンジンであるvLLMでモデルを実行することです。しかし、24GBの一般向けカードでは、このアドバイスを実行すると、プロンプトを書き込む前にトークンの80%を消費することになります。

24GBのシングルカードでvLLMのベンチマークを実行すると、毎秒約19トークンしか得られません。同じカード上で軽量かつローカル優先のエンジンであるllama.cppに切り替えると、毎秒120トークンが得られます。これは6倍から7倍のスループット差です。

原因は機械的なものです。24GBのカードに圧縮されたモデルを格納すると、空きメモリが1GB未満しか残りません。これでは、CUDAグラフと呼ばれる最適化された実行パスをコンパイルするのに十分な容量がありません。CUDAグラフがないと、vLLMは演算を1つずつ実行するようにフォールバックします。CPUはすべての計算を個別に起動する必要があり、これが生成時間の大部分を消費します。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です