土曜日, 8月 08, 2026

Macはなぜ671BのLLMを動かせるのか——ユニファイドメモリの仕組みと2026年DRAM危機の現実

RTX 5090は32GBのVRAMを積んだNVIDIAの最上位コンシューマーGPUだが、70Bクラスの大規模言語モデル(LLM)を4bit量子化してもそのままでは載らない。ところが40万円台のMac Studioなら、パラメータ数671BのDeepSeek R1をまるごとメモリに載せて動かせてしまう。なぜMacだけがこんな芸当をやってのけるのか——答えは「ユニファイドメモリアーキテクチャ(UMA)」にある。

ローカルLLM界隈でこの1年ボトルネックとして語られてきたのは、GPUの演算性能(TFLOPS)ではなく「メモリ容量」と「メモリ帯域」だ。Googleの研究者David Pattersonらが2026年5月のIEEE Computer誌で指摘した通り、AIチップの計算性能はこの10年で80倍に伸びた一方、メモリ帯域の伸びは17倍にとどまり、両者のギャップは4.7倍に開いている。この文脈で、AppleがM1シリーズから一貫して採用してきたUMAが、図らずも「個人がAIモデルを手元で動かす」という新しいニーズに刺さった格好だ。

結論を先に言うと、Macの強みは「容量」であって「速度」ではない。そしてこの構図に気づいたAMD・NVIDIA・Qualcommも、それぞれのやり方でユニファイドメモリ型のアーキテクチャに追随し始めている。さらに2026年に入ってから深刻化したDRAM価格の高騰により、Mac Studio自体の買える構成が様変わりしている。本稿では技術的な仕組みから、競合との比較、そして「結局2026年8月時点で何を買うべきか」まで整理する。

本稿の価格・在庫関連の記述は2026年8月時点のものです。DRAM市場の需給は急速に変動しており、時間が経てば陳腐化する可能性があります。またM5 Ultra搭載Mac StudioやAMDの次世代APUなど、一部は正式発表前の観測筋情報として扱い、その旨を本文中に明記しています。

1. ユニファイドメモリアーキテクチャ(UMA)とは何か

従来型のPCでは、GPUは専用のVRAMを持ち、CPU側のシステムRAMとは物理的に分離している。LLMがVRAMに収まりきらない場合、推論エンジンはモデルの層をGPUとCPU RAMに分割し、そのたびにPCIeバスを跨いでデータをやり取りする。PCIe 5.0 x16でも理論値で片方向約64GB/sしか出ず、モデルの一部でもVRAMからあふれた瞬間に推論速度は大きく落ち込む。

Appleシリコンのユニファイドメモリアーキテクチャは、CPU・GPU・Neural Engine(NPU)が単一の物理メモリプールを共有することで、この「詰め替え」を原理的になくす設計だ。GPUがモデル重みにアクセスする際にPCIe転送のオーバーヘッドが発生せず、マシンに搭載された全メモリがそのまま「VRAM」として使える。

LLMのメモリ所要量は大まかに次の式で見積もれる。4bit量子化(Q4)の場合、実務上の目安として「10億パラメータあたり約0.6GB」に、コンテキスト長に応じたKVキャッシュ分を加える。70BモデルはQ4で約40〜48GB、FP16なら約140GB必要になる。この「140GB」という数字だけで、24GBや32GBのコンシューマーGPU1枚では端から歯が立たないことがわかる。

2. Appleシリコンの世代別スペック

LLMのトークン生成(デコード)は基本的に「メモリ帯域律速」で、帯域がほぼそのまま生成速度を決める。Appleシリコンの帯域は世代とグレードでかなり幅がある。

チップ メモリ帯域 最大UMA容量 メモリ種別
M4(素) 120GB/s 32GB LPDDR5X
M5(素) 153GB/s 32GB LPDDR5X
M5 Pro 307GB/s 64GB LPDDR5X
M5 Max(32コアGPU) 460GB/s 36GB LPDDR5X
M5 Max(40コアGPU) 614GB/s 128GB LPDDR5X
M3 Ultra 819GB/s 512GB(構成上の理論最大) LPDDR5X

M3 ProはM1/M2 Proの200GB/sから150GB/sへと帯域が後退した世代があり、Appleが「up to」という表現を多用する点にも注意したい。M5 Max自体、GPUコア数によって460GB/sと614GB/sの2段階があり、同じ「M5 Max」でも構成次第で帯域が3割以上変わる。

3. 「容量」の圧勝と、「速度」で見劣りする理由

YouTuberのDave2D(Dave Lee氏)が512GB構成のMac Studio(M3 Ultra)でDeepSeek R1の671Bモデル(4bit量子化、ストレージ消費404GB)を動かした検証はよく引用される。macOSのデフォルトのVRAM割り当て上限をTerminalコマンドで448GBまで手動拡張し、約17〜18トークン/秒で生成、消費電力は200W未満だったという。複数のGPUをまたいで分散させる必要がある規模のモデルを、単一マシン・低消費電力で動かせる点は、他のパーソナルコンピュータには真似できない。

ただし、これは「容量」の勝利であって「速度」の勝利ではない。RTX 5090(32GB、1,792GB/s)はM4 Max(546GB/s)やM3 Ultra(819GB/s)より帯域そのものは高く、VRAMに収まる範囲(〜32GB程度)のモデルではNVIDIA側が明確に速い。プロンプト処理(プリフィル、最初の1トークンが出るまでの時間)についても、llama.cppのMetalバックエンドは長年「遅い」と指摘されてきた領域で、長いコンテキストを扱うほどNVIDIA勢との差が開く。

この弱点に対するApple側の回答が、GPUコアに新設された「Neural Accelerator」と、MLXフレームワークの強化だ。Appleの機械学習研究チームが公開したベンチマークでは、M5搭載機(24GB構成)はM4比でプリフィルが最大4.06倍、生成速度が19〜27%向上したという。ただしこの数値はベースM5とベースM4の比較であり、M5 MaxのようなハイエンドSKUでの数値ではない点には注意したい。2026年3月にはOllamaもmacOS向けの推論バックエンドをMLXへ切り替え、M5 Max上のQwen3.5-35B-A3Bでプリフィルが1,154→1,810トークン/秒、生成が58→112トークン/秒に向上したと公表している。ただしこの比較は量子化形式が異なる(旧側はQ4_K_M、新側はNVFP4)非等価比較であり、対応モデルもプレビュー時点ではQwen3.5系に限られる。独立検証でも効果はモデル依存で、Qwen3.6ではほとんど変化がなかったという報告もある。MLX自体にも弱点があり、トークンを出力する前に入力全体のプリフィルを完了させる設計のため、長いコンテキストではTTFT(最初のトークンが出るまでの時間)が入力長に比例して伸びる。8.5Kトークンのプロンプトで、UI上の表示は51トークン/秒でも実効スループットは3トークン/秒しか出なかった、という報告もある。

4. 他社も雪崩を打って追随するユニファイドメモリ

AppleのUMAに最も忠実に追随したのがAMDの「Strix Halo」ことRyzen AI Max+ 395だ。16基のZen 5コア、40基のRDNA 3.5コンピュートユニット、50 TOPSのXDNA 2 NPUを1パッケージに統合し、最大128GBのLPDDR5X-8000を共有する。256bitバスの理論帯域は256GB/sだが、実測は約212〜215GB/sにとどまる。AMD公式は最大約112GBをGPU用に割り当て可能としている。帯域自体はApple Maxクラスに及ばない。128GB構成は2026年初頭こそ1,500〜1,800ドル程度で手に入ったが、DRAM高騰の波はこの陣営にも及んでおり、2026年半ば以降は市場価格が3,000ドルを超え、7〜8月には3,400〜3,800ドル程度まで上昇している。もはやDGX Spark(3,999〜4,699ドル)と比べて「圧倒的に安い」とは言いにくい水準だ。なおAMDは2025年に「Strix HaloはDeepSeek R1でRTX 5080比最大3.05倍」という自社ベンチマークを公表しているが、これはRTX 5080のVRAM(16GB)を超えるモデルサイズでの比較であり、方法論も非公開のため、生の演算性能の優劣を示すものではない点に注意したい。

NVIDIAはデータセンター向けのGrace HopperやGrace Blackwellで、独自のコヒーレント統合メモリを推進しているほか、デスクトップ機の「DGX Spark」(GB10、128GB LPDDR5X、273GB/s、3,999〜4,699ドル)でも同様の思想を採用している。ただしDGX Sparkの実力は用途によって大きく分かれる。dense(非MoE)の70Bクラスモデルでは、第三者ベンチマーク(LMSYS)でLlama 3.1 70B(FP8)のデコードが2.7トークン/秒、Qwen 2.5 72BやLlama 3.2 90Bでも4.6トークン/秒程度と、実用的な対話速度には届かない。長いプロンプトのTTFTも数分単位(Llama 3.2 90Bで133秒、DeepSeek R1 70Bで180秒)とかなり長い。一方で、MoE(後述)アーキテクチャのgpt-oss-120B(総パラメータ120B・活性約5B)では35〜80トークン/秒という報告があり、DGX Sparkの強みは「dense 70B」ではなく「MoEアーキテクチャ」または「vLLM等を使った高並列度でのバッチ処理」(同一条件で高負荷時に単発リクエスト比120倍のスループットという報告もある)にあると見るべきだろう。

QualcommのSnapdragon X2 Elite Extreme(X2E-96-100)は、12チャネル(192bit)のオンパッケージLPDDR5Xで228GB/sを実現し、初代Snapdragon X Elite(135GB/s)から約7割向上した。NPU(Hexagon)はTOPSベースで45→80と倍近くに伸びている。ただしこのラインには帯域192GB/sより低い廉価SKU(X2E-88-100など、128bitバスで152GB/s)も併存しており、「X2 Elite」とひとくくりに語ると数値を取り違えやすい。

5. NPUのTOPS表記に踊らされてはいけない

AI PCのマーケティングでは「NPU〇〇TOPS」という数字が独り歩きしがちだが、大型LLMの実効速度を決めるのは基本的にメモリ帯域であり、TOPSではない。典型的な混同例がIntelのLunar Lake(Core Ultra 200V)だ。NPU単体は48 TOPSだが、GPU・CPU分も合算した「プラットフォーム合計120 TOPS」という数字がしばしばNPU単体の性能であるかのように引用される。搭載メモリも最大32GBのオンパッケージLPDDR5X-8533にとどまり、大型LLM向けの構成ではない。

NPU TOPS(INT8) 備考
Apple Neural Engine(M4) 38 TOPS 16コア
Qualcomm Hexagon(X Elite初代) 45 TOPS 帯域135GB/s
Qualcomm Hexagon(X2 Elite Extreme) 80 TOPS 帯域228GB/s(廉価SKUは152GB/s)
Intel NPU 4.0(Lunar Lake) 48 TOPS 「プラットフォーム合計120 TOPS」と混同されやすい
AMD XDNA 2(Strix Halo) 50 TOPS -

現状、大型LLMの推論はNPUではなくGPU(Apple環境ではMetal/MLX経由)で回すのが主流で、NPUの出番は7〜8B級の量子化モデルまでの常時稼働タスク(要約、字幕生成など)に限られる。実際、MLX自体もMetal経由でGPUを使う設計で、Neural Engine(ANE)を直接使ってはいない。

6. モデル規模別の適材適所とMoEとの相性

モデル規模 向くハードウェア 理由
1B〜8B NPU/エッジ/任意のGPU 省電力・常時稼働向け。8GBでも4bitで動作可
13B〜34B コンシューマーGPU(16〜32GB VRAM)またはMac 32〜64GB VRAMに収まる範囲ではNVIDIAが速い
70B級(dense) Mac Studio/Strix Halo(いずれも96〜128GB) 単一コンシューマーGPUには載らない。UMAが実質的な受け皿
100B〜数百B(MoE中心) 大容量UMA機、またはDGX SparkのようなMoE最適化機 総パラメータは容量を食うが、活性パラメータは一部のみ

MoE(Mixture of Experts)は総パラメータが巨大でも、トークンごとに一部のエキスパートしか活性化しない。DeepSeek-V3は671B中37Bのみ、gpt-oss-120Bは128エキスパート中4つ(総パラメータの一部)だけが動く。重要なのは、全エキスパートをメモリに常駐させる必要がある(=容量を食う)一方、トークンあたりに読み込むのは活性化分だけ(=帯域負荷は小さい)という非対称性だ。これがUMA機(Mac、Strix Halo、DGX Spark)とMoEの相性の良さの正体で、DGX Sparkのgpt-oss-120Bが35〜80トークン/秒出るのもこの原理による。

ただし「MoEなら常に速い」というわけでもない。大学の研究チームがOLMoE-1B-7B(活性1.3B・総7B)をApple M2ProとNVIDIA Jetson Orin Nanoで検証した論文では、帯域律速の環境ではMoEの推論コストは活性パラメータではなく総パラメータに追随する傾向が見られ、エッジ環境では同じ活性パラメータ数のdenseモデルに対して約31%遅い結果になったと報告されている。全重みが物理メモリに載り切る大容量UMA機でこそMoEの利点が生きる、という理解が実態に近い。

7. 2026年のDRAM危機で覆ったMac Studioの現実

ここまでの技術的な議論はMac側にかなり有利な材料が並ぶが、2026年に入ってからの状況変化を無視できない。TrendForceは2026年第1四半期のDRAM契約価格見通しを前四半期比90〜95%上方修正し、Gartnerは年間のDRAM+SSD価格が130%上昇すると予測した。AI向けHBMへの生産能力シフトが、コンシューマー向けDRAMの供給を圧迫している。

この余波でApple自身のMac Studioラインナップが目に見えて縮小した。2026年3月、512GB構成(旧価格9,499ドル)がオンラインストアから消え、上限は256GBに。256GBへのアップグレード価格も1,600ドルから2,000ドルへ引き上げられた。さらに5月には256GB構成も削除され、M3 Ultra Mac Studioは96GB構成の一択に。6月25日の全体的な値上げでは、その96GB構成自体も3,999ドルから5,299ドルへと1,300ドル値上がりしている。Appleの技術仕様ページ自体には256GBの記載が残っており、これが恒久的な仕様変更なのか一時的な販売制限なのか、Appleは公式には説明していない。

結果として、2026年8月時点で実際にApple直販で買える「最大メモリを積んだMac」は、Mac Studioではなく128GB構成のM5 Max MacBook Proという逆転現象が起きている。macOS Tahoe 26.2で追加されたThunderbolt 5クラスタ機能を使えば、256GB機を2台束ねて疑似的に512GBプールを作ることも理論上は可能だが、合計コストは旧512GB構成の単体価格を上回り、インターコネクトのレイテンシも単一ダイのUMAには及ばない。なおMac Proは2026年3月26日付けで販売終了となり(Appleは後継モデルの計画がないことも公表済み)、Mac Studioが名実ともにAppleのフラッグシップワークステーションとなっている。

Bloombergのマーク・ガーマン氏は、M5 Ultra搭載Mac Studioが2026年10月前後に登場し、最大768GBのユニファイドメモリをテスト中と報じているが、これは正式発表前の観測筋情報であり、供給状況次第では実際に販売される上限がそれより低くなる可能性がある。ガーマン氏はまた、AppleがM6世代のPro/Maxチップを見送り、AI性能強化を優先したM7世代を前倒しする計画だとも伝えている。

8. 結局、個人が70B超をローカルで動かすには何を買うべきか

選択肢 実効メモリ/帯域 想定価格 向き・不向き
Mac Studio(M3 Ultra 96GB) 96GB/819GB/s 約5,299ドル〜 70B Q4は載る。静音・省電力。100B超やFP16の70Bは容量不足
M5 Max MacBook Pro 128GB/614GB/s 約6,999ドル(16インチ・2TB。2026年6月の値上げ前は約5,099〜5,399ドル) 2026年8月時点で実際に買える中では最大メモリのApple製品。ノート機であること自体は制約にならない
AMD Strix Halo搭載機 128GB/実測約212〜215GB/s 2026年初頭は約1,500〜1,800ドル。DRAM高騰で2026年半ば以降は3,000〜3,800ドル程度に上昇 dense 70Bも実用速度。ただしDGX Sparkとの価格差はDRAM高騰でほぼ解消した。ソフト面はMetal/MLXほど成熟していない
NVIDIA DGX Spark 128GB/273GB/s 約3,999〜4,699ドル MoEモデル(gpt-oss-120B等)や高並列バッチ処理に強い。dense 70Bの単発対話は非常に遅い(数トークン/秒)

まとめると、dense(非MoE)の70Bクラスモデルを単発の対話用途でローカルに動かしたいなら、Mac StudioかStrix Halo搭載機が現実的な選択肢になる。逆にgpt-oss-120Bのような大型MoEモデルを動かしたい、あるいはチーム内の小規模な推論サーバーとして複数リクエストを捌きたいなら、CUDAエコシステムとFP4ネイティブ対応を持つDGX Sparkに分がある。エンタープライズ向けのマルチユーザー・高スループット推論であれば、この価格帯の議論はそもそも成立せず、H100/H200/B200クラスのデータセンターGPUを使うのが妥当だ。

購入前に確認すべきは「TOPS」ではなく、(1)メモリ帯域(GB/s)、(2)実効メモリ容量(GB)、(3)動かしたいモデルの量子化後フットプリント、(4)dense構成かMoE構成か、の4点だ。とりわけ2026年後半は在庫と価格の変動が激しいため、購入直前にメーカー直販ページで実際に選べる構成を確認することを勧めたい。

まとめ

Macが大型LLMを動かせる理由は、CPU・GPU・NPUが単一の高帯域メモリプールを共有するユニファイドメモリアーキテクチャにある。その本質は「容量の勝利」であり、「速度の勝利」ではない。VRAMに収まる規模のモデルではNVIDIAのコンシューマーGPUが依然として速く、プロンプト処理の弱さもMac側に残る課題だ。そしてこの構図はAppleの独壇場ではなくなりつつある。AMD Strix Halo、NVIDIA DGX Spark、Qualcomm Snapdragon X2という形で、業界全体がユニファイドメモリという方向に収斂している。

一方で、2026年のDRAM価格高騰はMac Studioという製品そのものの立ち位置を揺るがした。512GBという看板構成はすでに市場から姿を消し、96GBが現実的な上限になっている。この波はAppleだけでなく、Strix Halo搭載機のような「安価な代替」を謳ってきた陣営にも等しく及んでおり、128GB構成の実売価格は2026年初頭の1,500ドル台から半年余りで3,000ドル台後半まで上昇した。「大容量が欲しければMacを買えばいい」「Macが高いならStrix Haloを買えばいい」といった単純な図式は、少なくとも執筆時点ではもう成立しない。ハードウェア選びは、動かしたいモデルがdenseかMoEか、単発対話か並列処理か、という要件と、購入直前の実売価格に立ち返って判断する必要がある。

0 件のコメント: