VRAM別・現実的に動かせるモデル早見表

ローカルでLLMを動かすとき、最初にぶつかるのが「自分のGPUでどのくらいの規模のモデルが動くのか」という疑問です。 ここではVRAM容量別に、現実的に載せられるモデルの目安を早見表として整理します。 数値はすべて目安で、量子化やコンテキスト長で必要量は変わる、という前提で読んでください。

前提: 量子化したモデルで考える

この記事の早見表は、Q4前後に量子化したモデルを動かす前提で書いています。 量子化なしのフル精度で動かそうとすると、必要なVRAMは数倍に膨らみます。 ローカルで実用的に使う場面では、ほとんどの人がQ4からQ5あたりの量子化モデルを選ぶので、 その水準を基準にしておくと現実とずれにくいです。 また「載るかどうか」と「快適に動くかどうか」は別の話です。 ぎりぎり載っても推論が遅ければ実用にならないこともあります。 ここではまず「載るか」の目安として読んでください。

VRAM容量別の早見表

まずはざっくりとした全体像です。あくまでQ4前後の量子化を前提にした、現実的な目安です。

  • 8GB: 7B前後を量子化して動かせるあたり。チャットや軽い文章生成など、用途を絞れば十分実用になります。
  • 12〜16GB: 14B前後の中型モデルが主力になる帯。日常的な作業の多くはここでこなせるという感覚です。
  • 24GB: 32B前後まで現実的に狙える帯。少し大きめのモデルで精度を上げたいときに効いてきます。
  • 48GB: 70Bクラスを強めの量子化で載せられるあたり。回答の質を一段上げたい用途向けです。
  • 96〜128GB以上: 大型モデルを余裕をもって、あるいは複数を同時に動かせる帯。本格的な基盤として考えられます。 この区切りはきっちりした境界ではありません。 モデルの作りや量子化の度合いによって前後するので、隣の帯とは地続きだと思っておくのが安全です。

8GB〜16GB: まずは試せる帯

8GBクラスは、7B前後のモデルを量子化して動かす入門的な位置づけです。 要約、分類、簡単な下書き生成といった軽い用途なら、これで十分という場面は多いです。 代表例としては RTX 4060 や RTX 3060 あたりが該当します。 【商品リンク: RTX 4060搭載GPU】 12〜16GBになると、14B前後の中型モデルが主力として使えるようになります。 日常の作業をローカルで回す主力機として、一番コスパが良いと感じやすい帯です。 RTX 4070 Ti SUPER や RTX 4060 Ti 16GB あたりが候補になります。 【商品リンク: RTX 4070 Ti SUPER搭載GPU】

24GB: 一段上を狙える帯

24GBあると、32B前後のモデルまで現実的に視野に入ります。 中型では物足りない、もう少し精度のあるモデルを手元で動かしたい、というときに効いてくる容量です。 代表例は RTX 3090 や RTX 4090 で、中古を含めて選択肢が比較的そろっている帯でもあります。 【商品リンク: RTX 4090搭載GPU】 ここから上は価格も一気に上がってくるので、 自分の用途が本当に32Bクラスを必要としているかを一度考えてみると、無駄な投資を避けやすいです。

48GB以上: 大型モデルに踏み込む帯

48GBあれば、70Bクラスのモデルを強めの量子化で載せられるようになります。 回答の質を一段上げたい、難しめのタスクを任せたい、という用途で価値が出てきます。 単体GPUのほか、24GBクラスを2枚使う構成でこの容量に届かせる人もいます。 96〜128GB以上になると、大型モデルを余裕をもって動かしたり、 複数のモデルやエージェントを同時に走らせたりできる帯になります。 この規模になると、GPUのVRAMだけでなく、 Mac Studio のユニファイドメモリのような構成も現実的な選択肢に入ってきます。 【商品リンク: 大容量メモリ搭載ローカルAI向けマシン】

コンテキストを長く取るとさらに食う

早見表はモデル本体を載せる前提の目安ですが、実際にはコンテキスト長も無視できません。 長い文脈を扱おうとすると、その分だけVRAMを追加で消費します。 短いやりとり中心なら表どおりの感覚で動きますが、 長文の資料をまるごと読ませるような使い方では、想定より早く上限に当たることがあります。 なので「モデルは載ったのにコンテキストを伸ばしたら落ちた」というのはよくある話です。 モデルサイズだけでなく、自分がどれくらいの長さの文脈を扱いたいかも合わせて見ておくと安全です。

結論

VRAM容量はそのまま「どのくらいの規模のモデルが載るか」の目安になります。 8GBで小型、12〜16GBで中型、24GBで32Bクラス、48GBで70B、96GB以上で大型を快適に、 というあたりがざっくりした目安です。 ただし数値はすべて目安で、量子化の度合いやコンテキスト長で必要量は変わります。 どこまで量子化するかで載るモデルは変わるので量子化の記事を、 実際にどのGPUを選ぶかはGPU選びの記事も合わせて見てもらえると、判断材料がそろうはずです。