VRAMとユニファイドメモリは何が違うのか

ローカルAIのハードウェアを調べていると、VRAM、ユニファイドメモリ、システムRAMという3つの言葉が出てきます。 どれも「メモリ」ですが、ローカルAIでの効き方はけっこう違います。 ここでは容量と速度という2つの軸で、その違いを噛み砕いて整理してみます。

そもそもメモリが2つの意味で効く

ローカルAIでメモリの話をするとき、効いてくるポイントは大きく2つあります。 ひとつは「モデルが載るかどうか」、もうひとつは「載ったあとにどれくらい速く動くか」です。 前者は容量、後者は帯域(メモリの太さ)でだいたい決まります。 この2つを分けて考えると、3種類のメモリの違いが見えやすくなります。 容量が大きくても帯域が細ければ「載るけど遅い」、 帯域が太くても容量が小さければ「速いけど大きいモデルは載らない」という具合です。

3種類のメモリを並べてみる

ローカルAIで出てくるメモリを、特徴ごとにざっくり整理するとこうなります。

  • GPU専用VRAM: GPUに直結した高速メモリ。帯域が太く、推論が速いのが強みです。 ただし容量は比較的小さめで、容量あたりの価格は高くなりがちです。NVIDIAのGPUなどが代表的です。
  • ユニファイドメモリ: CPUとGPUが同じメモリを共有する方式。Apple SiliconやNVIDIA DGX Sparkなどがこれにあたります。 大容量を積みやすく、大きなモデルを載せやすいのが特徴です。帯域は専用VRAMほどではないものの、システムRAMよりは速い傾向です。
  • システムRAM: DDR5などの一般的なメモリ。最も大容量にしやすく、価格も安いのが利点です。 ただし帯域は細めで、CPUでLLMを動かすとここを使うため「載るけど遅い」状態になりやすいです。

GPU専用VRAMは「速さ」担当

専用VRAMの一番の強みは帯域の太さです。 LLMの推論はメモリから大量のデータを読み出し続ける処理なので、 帯域が太いほどトークンの生成が速くなりやすい、という関係があります。 一方で、容量は数十GBクラスにとどまることが多く、 そこに収まらないサイズのモデルは載せられません。 速度は出るけれど、載せられるモデルの大きさには上限がある、という性格だと考えておくとよさそうです。

ユニファイドメモリは「容量」と「速度」のあいだ

ユニファイドメモリは、CPUとGPUが同じメモリを使うため、 大容量を積みやすいのが大きな利点です。 100GBを超えるような構成も現実的で、専用VRAMには載らない大きめのモデルが載せられます。 帯域は専用VRAMには一歩譲るものの、システムRAMよりはかなり速い、という位置づけです。 「大きいモデルを、そこそこの速度で動かしたい」という用途に向いた、バランス型のメモリだと捉えると分かりやすいです。

システムRAMは「とりあえず載る」担当

システムRAMは容量を増やしやすく、価格も抑えやすいのが魅力です。 GPUに載りきらない大きなモデルでも、CPU側のメモリにあふれさせれば動かすこと自体はできます。 ただし帯域が細いぶん、速度は落ちます。 待てる処理なら問題になりませんが、対話のようにレスポンスを求める用途では、 遅さが体感に直結しやすいところです。 「載せるための受け皿」として見ておくと、役割がはっきりします。

結局どう選ぶか

選び方は、何を優先したいかで分かれます。 速度を最優先で、中規模くらいまでのモデルで足りるなら、帯域の太い専用VRAMを積んだGPUが向いています。 とにかく大きなモデルを載せたいなら、大容量のユニファイドメモリが現実的な候補になります。 なお、ここで挙げた帯域や容量の傾向はあくまで代表的なもので、 製品や世代によって数値は変わります。 細かい型番で比べる前に、自分の用途が「容量で詰まるのか」「速度で詰まるのか」を見極めておくのが先だと思います。

結論

3種類のメモリは、容量と帯域のバランスがそれぞれ違います。 「載るか」は容量、「載ったあとの速さ」は帯域で決まる、という軸を持っておくと、 VRAMとユニファイドメモリの違いはかなり整理しやすくなります。 このうち「速さ」のほうにもう一歩踏み込みたい方は、 対になる記事「ローカルAIの速度は何で決まるのか(メモリ帯域の話)」もあわせて読んでみてください。 なぜ帯域が推論速度を左右するのかを、もう少し詳しく掘り下げています。