水曜日, 10月 07, 2026

ローカルLLMを動かす個人向けGPUクラウド比較:料金・セキュリティ・使い方まとめ

ローカルLLMを試したいが、数十万円のGPUを買う前に、まず借りて動かしてみたい。個人名義で契約できるGPUクラウドには何があり、どのモデルが月いくらで動かせるのか。料金は日本円に直して比べたい。そんな疑問に答えるため、2026年10月時点の公式料金ページと公式ドキュメントを一次情報として、サービス比較、モデル規模別の費用、セキュリティ、実際の使い方までまとめました。

結論から言うと、公開データで安く試すなら RunPodのCommunity CloudかVast.ai、手軽さと安定性ならRunPodのSecure Cloud、円建て・国内完結なら常駐向けのGPUSOROBANと断続実行向けのさくら高火力DOK、という整理になります。ConoHaのGPUサーバーは、公式の申込フォームに個人からの新規申込みを一時停止している旨が明記されており、個人向けの候補から外れます。

費用感の目安(1ドル=158円)は次のとおりです。14B以下は24GB級のGPUで時給およそ43〜117円、70Bの4bit量子化は48GB級(RunPodのA40やRTX A6000)で約77〜84円、gpt-oss-120bは80GBのH100か96GBのRTX PRO 6000で約267〜457円です。235B級以上の巨大モデルは、個人が常時動かすには費用対効果が悪く、APIの利用を勧めます。

本記事は2026年10月7日時点の公開情報に基づきます。為替は1ドル=158円で換算しました(2026年10月6日のOANDA 158.045円、七十七銀行の仲値157.96円を丸めた値)。海外サービスはUSD建て・税抜の表示価格で、カード会社の手数料や消費税相当額は含みません。損益分岐などの見通しは筆者の仮定です。

1. 用途別おすすめ早見表

用途 第一候補 次点 選ぶ理由と注意
初めて試す・手軽さ重視 RunPod Secure Cloud(RTX 4090/A40)+Ollama/Open WebUIのテンプレート GPUSOROBAN A4000(円建て) 秒課金で、テンプレートから数分で起動できる。Network Volumeにモデルを置けば再ダウンロードが不要
公開データでコスト最優先 RunPod Community、Vast.ai GPUSOROBAN A4000(50円/時) RunPodは機密ワークロードにSecure Cloudを推奨している。Vast.aiは価格が常時変動する
機密・業務データ 国内事業者(さくら高火力DOK、GPUSOROBAN)またはRunPod Secure Cloud Vast.ai Secure Cloud データの所在に加え、ログ・バックアップ・サポートアクセスの所在まで確認する
断続的に大型モデル(H100級) さくら高火力DOK(H100 1,008円/時、秒課金) RunPod H100 PCIe(約457円/時) DOKは実行時間のみの課金だが、コンテナ内のモデル取得時間も課金対象になる
24時間常駐(小型モデル) GPUSOROBAN A4000 月額33,000円 RunPod Community RTX 4090(二次情報の単価で約39,000円/月) ConoHaは個人の新規申込みを停止中
235B・671B級 API利用 短時間だけ専有GPUを借りる 常時の個人運用は費用が合わない(6章の表を参照)

2. 試算の前提

月額は3つの利用パターンで換算します。A は週末中心の月40時間、B は1日3時間×月20日の月60時間、C は24時間常時稼働の月730時間です。時間単価×時間数の単純計算で、ストレージ代は別に加算します。対象は、個人がクレジットカードで契約し、秒〜時間単位で使えるサービスに絞りました。Lambda、AWS、GCP、Azureも個人アカウントで使えますが、本稿では取り上げていません。

3. サービス比較(海外)

サービス 個人契約・支払い 課金の特徴 主なGPUと単価(USD/時) 停止中・待機中の課金など
RunPod 個人でメール登録して利用可。USD建てのプリペイド制で、カード(Stripe)と暗号資産に対応。プリペイドカードは1回100ドル以上の入金を推奨。クレジットは返金不可 秒課金。デプロイには1時間分以上の残高が必要。データ転送料なし。既定の支出上限は80ドル/時 Secure(公式料金表、2026/9/27更新):A40 0.49、RTX A6000 0.53、RTX 4090 0.74、RTX 5090 0.99、A100 80GB 1.59、H100 PCIe 2.89、H200 4.59、RTX PRO 6000 2.09。Communityの例:RTX PRO 6000 1.69(GPU個別ページ) 停止中のVolume Diskは稼働中の2倍(0.20ドル/GB/月)。Network Volumeは0.07ドル/GB/月(1TB超は0.05)でPodを消しても残る。残高が0になるとPodは自動停止し、Network Volumeのない Podは削除されてデータは戻らない
Vast.ai 個人で利用可。USD建ての前払いクレジット(Stripeのカード、BitPay・Crypto.comの暗号資産)。カードで買った未使用分は返金可、暗号資産分は不可 秒課金。GPU・ストレージ・帯域の3種類を、ホストごとの価格で課金する(固定価格ではない) マーケットプレイス方式で価格は常時変動し、固定の価格表はない。「Secure Cloud(Only Trusted Datacenters)」フィルターで認定データセンターの機材に絞れる 停止してもストレージ課金は続き、帯域は状態を問わず送受信バイトに課金される。完全に止めるにはDestroy。カード未登録で残高が尽きると、インスタンスとデータは削除される
DigitalOcean(GPU Droplets) 個人でカード登録して利用可(USD建て) 秒課金(最低60秒または0.01ドルの高い方)。Spot GPUはパブリックプレビュー オンデマンド:RTX 4000 0.76、L40S/RTX 6000 1.57、H100 4.41、H200 4.47、MI300X 2.59 電源を切っても課金は止まらず、GPUも確保されたまま。止めるにはDestroyが必要。送信転送は枠超過分が0.01ドル/GiB(受信は無料)
Modal 個人でカード登録して利用可。Starterは月額0ドル+従量で、毎月30ドルの無料クレジット付き 秒課金でアイドル時は課金なし。Pythonコードをサーバーレスに実行する方式。リージョン指定は基本価格の1.15〜1.75倍 GPU分のみ(ドル/秒):L4 0.000222、L40S 0.000542、A100 80GB 0.000694、RTX PRO 6000 0.000842、H100 0.001097(H100は約3.95ドル/時)。CPU(0.0000131ドル/コア/秒)とメモリ(0.00000222ドル/GiB/秒)は別課金 呼び出し時に起動するため、初回の応答には起動時間が加わる(サーバーレス方式の一般的な性質)。対話用のチャットを常時待機させる用途には向きにくい
Google Colab 個人でGoogleアカウントから利用可。Pro/Pro+は円建ての月額 コンピューティングユニット(CU)制。GPUごとに1時間あたりの消費CUが異なる CU消費量(2026年2月の実測):L4 1.71、A100 40GB 5.37、A100 80GB(High Memory)7.52、H100 18.05 CU/時 GPUの割り当ては保証されない。ノートブックのセッション前提で、APIサーバーの常駐には向かない。CUの円換算はプランで変わる(5章)

出典:Runpod公式料金ページ・Billing/Securityドキュメント、Vast.aiドキュメント(Billing)、DigitalOcean Droplet Pricing、Modal Pricing、Qiita「Google Colab料金比較とベンチマーク」(2026年2月)。

4. サービス比較(国内)

サービス 個人契約・支払い 課金の特徴 GPUと単価(税込) 注意点
GPUSOROBAN(ハイレゾ) 無料会員登録から開始できる。円建て(個人名義での契約条件は利用規約で確認) 従量課金(1時間・台)か月額課金を選ぶ。初期費用無料。料金に消費税・ストレージ・データ転送料を含む A4000 16GB:50円/時(月額33,000円)、A100 40GB:361円/時(月額223,133円)、A100 80GB:398円/時(月額243,631円)。ストレージは標準100GB 公式の一覧(高速コンピューティング)に載るのはA4000とA100の2種。停止中の課金の扱いは公式の一次情報で確認できていないため、契約前にFAQや規約で確かめる
さくら高火力 DOK 会員ID(電話番号認証)とクレジットカードで利用開始。プリペイドは法人・文教向け。新規は3,000円分の無料枠がある コンテナの実行時間のみ秒課金。H100は最低60秒。イメージ取得時間と実行待ちは課金対象外。タスクの実行時間上限を設定できる V100 32GB:0.016円/秒(57.6円/時)、H100 80GB:0.28円/秒(1,008円/時)、H100 8GPU専有(β):0.83円/秒(2,988円/時)。H100はvCPU 10、メモリ192GB Dockerイメージを用意するタスク型。外部接続はHTTPSのみ。SSHは可だがscp/rsyncは不可。ネットワークはベストエフォート250Mbps。モデルはイメージに埋め込むか、外部ストレージから取得する
ConoHa VPS GPUサーバー(GMO) 個人の新規申込みは一時停止中(公式フォームの注記)。法人は申請後に審査があり、本人確認書類が必要。支払いは請求書・カード・チャージ 時間課金で月額上限あり L4 24GB(4vCPU/メモリ16GB):公式GPUページの表示は55.0円/時(上限33,000円/月)。第三者の比較サイトは2026年7月改定後の公式表として60.5円/時(上限36,300円/月)と報告しており、表記が一致しない。H100は提供終了のお知らせが出ている 個人は受付再開待ち。法人で使う場合は、申込時に最新の料金を確認する
GMO GPUクラウド 個人向けの契約は確認できない。請求書払いのHPC向けサービス 共用プランは100円/分(H200×8ノード)。月次契約時間の50%がミニマムチャージ H200(1ノード8基)が中心。高速ストレージは3万円/TiB/月 個人のローカルLLM用途には規模が大きすぎる

出典:GPUSOROBANインスタンス一覧、さくら高火力DOK公式ページ・マニュアル(料金体系)、ConoHa GPUサーバー公式ページ・取引申請フォーム、VPS比較.com(2026/6/18)、GMO GPUクラウド。

5. 主要GPUの時間単価(円換算、1ドル=158円)

RunPodの公式料金表はCommunity/Secureのタブ表示ですが、RTX PRO 6000の掲載価格(2.09ドル)がGPU個別ページのSecure価格と一致するため、料金表の数値はSecure Cloudの価格として扱います。Community Cloudの価格は、公式の個別ページで確認できたものを除き、価格比較サイトによる二次情報です。

GPU(VRAM) サービス・区分 単価(USD/時) 円/時
RTX A5000(24GB) RunPod Secure 0.27 43
RTX 4090(24GB) RunPod Community(二次情報) 0.34 54
RTX 4090(24GB) RunPod Secure 0.74 117
RTX 5090(32GB) RunPod Secure 0.99 156
A40(48GB) RunPod Secure 0.49 77
RTX A6000(48GB) RunPod Secure 0.53 84
L40S(48GB) DigitalOcean 1.57 248
A100(80GB) RunPod Community(二次情報) 1.19 188
A100(80GB) RunPod Secure 1.59 251
RTX PRO 6000(96GB) RunPod Community 1.69 267
RTX PRO 6000(96GB) RunPod Secure 2.09 330
H100 PCIe(80GB) RunPod Secure 2.89 457
H100(80GB) DigitalOcean 4.41 697
H100(80GB) Modal(GPU分のみ) 約3.95 624
H200(141GB) RunPod Secure 4.59 725
B200(180GB) RunPod Secure 6.79 1,073
A4000(16GB) GPUSOROBAN (円建て) 50
A100(80GB) GPUSOROBAN (円建て) 398
V100(32GB) さくら高火力DOK (円建て) 57.6
H100(80GB) さくら高火力DOK (円建て) 1,008

出典:各社の公式料金ページ(5章冒頭に記した区分を除く)。Vast.aiは市場価格のため掲載していません。

Colabは、CU消費量(A100 80GBで7.52、H100で18.05)に、Pro+の月額(約5,200〜5,800円)を付与CU(500〜600程度と資料で食い違う)で割った1CUあたり約9〜12円を掛けると、A100 80GBで約66〜87円/時、H100で約158〜208円/時になります。これは筆者の試算で、割り当てが保証されない点も含めて、常駐用途の比較には使えません。

6. モデル規模別の必要VRAMと費用

6-1. VRAMの見積もり方

重みの大きさは、パラメータ数×1パラメータあたりのバイト数で概算します。FP16/BF16は2バイト、8bitは約1バイト、4bit(GGUFのQ4、AWQ、GPTQ)は約0.55〜0.6バイトです。これにKVキャッシュと実行時の余裕(1〜3GB)を足します。KVキャッシュは次の式で求まります。

KVキャッシュ(バイト) = 2 × 層数 × KVヘッド数 × ヘッド次元 × トークン数 × 1要素のバイト数

Llama 3.1 8B(32層、KVヘッド8、ヘッド次元128)はFP16で1トークンあたり128KiBで、32kトークンなら約4GiBです。Llama 3.3 70B(80層)は1トークンあたり320KiBで、32kで約10GiB、128kで約40GiBに達します。70Bの4bitは重みだけで約40〜43GBなので、48GBのGPUは短〜中程度のコンテキストでぎりぎり、長いコンテキストなら80GB級が必要です。

MoE(Mixture of Experts)モデルは、アクティブパラメータが小さくても全エキスパートの重みをメモリに載せる必要があります。OpenAIの説明では、gpt-oss-120bは総117B・アクティブ5.1Bで、MoE層の重みだけをMXFP4で量子化しており、その他のテンソルはBF16です。公式は「単一の80GB GPU(NVIDIA H100やAMD MI300Xなど)で動く」と案内し、gpt-oss-20bは16GBのメモリ内で動作するとしています。

6-2. クラス別の推奨構成

クラス・代表モデル 重みの目安(FP16/8bit/4bit) 推奨GPU構成 最安候補(円/時) 留意点
〜8B(Llama 3.1 8B、Qwen3-8Bなど) 約16GB/約9GB/約5GB 24GB 1枚。4bitなら16GBでも可 RunPod A5000 約43円、GPUSOROBAN A4000 50円 KVキャッシュは32kで約4GiB(Llama 3.1 8B)
gpt-oss-20b(総21B、アクティブ3.6B) MXFP4で16GBのメモリ内に収まる(OpenAI) 24GB 1枚が無難 同上 MoEなので全重みをVRAMに載せる。KVキャッシュ分の余裕が要る
14B前後(Qwen3-14Bなど) 約28GB/約15GB/約9GB 8bit・4bitは24GB。FP16は48GB 24GB級で約43〜54円。FP16はA40 約77円 —
30〜32B(Qwen3-32B、Gemma 3 27B、Qwen3-30B-A3Bなど) 約64GB/約33GB/約19〜20GB 4bitは24〜32GB(短いコンテキスト)。8bitや長いコンテキストは48GB 4bit:RunPod 4090 約54円(二次情報)。8bit:A40 約77円 24GBでは4bitでもコンテキストを伸ばしにくい
70B前後(Llama 3.3 70Bなど) 約140GB/約70GB/約40〜43GB 4bitは48GB(短〜中コンテキストでぎりぎり)。余裕を取るなら80GB。8bitは96GB級で短いコンテキストに限る 4bit:A40 約77円、A6000 約84円。余裕:A100 約251円 KVキャッシュは32kで約10GiB、128kで約40GiB
gpt-oss-120b(総117B、アクティブ5.1B) MoE層のみMXFP4、他はBF16。80GB 1枚に収まる(OpenAI) H100 80GBかRTX PRO 6000 96GB。A100 80GBは条件付き RTX PRO 6000 Community 約267円、H100 PCIe 約457円 公式の例示はH100とMI300X。A100は例示になく、ランタイムの対応と速度を実測で確かめる
235B級MoE(Qwen3-235B-A22Bなど) 4bitで約130〜140GB(推定) 96GB×2か180GB級。H200 141GB 1枚は余裕が乏しい RTX PRO 6000 2枚(Community)約534円、B200 約1,073円 複数GPUでの実行設定が必要
超大型MoE(DeepSeek V3/R1系 671Bなど) 4bitで約380〜400GB(推定) 80GB級×8枚、またはB300 288GB×2 H200×8で約5,802円 個人の常用には合わない。API利用を推奨

KVキャッシュの値は、層数・KVヘッド数・ヘッド次元から式で計算した値。重みの目安は、パラメータ数にバイト数を掛けた概算(推定)で、実測は実装・量子化形式・コンテキスト長により±20%程度ずれます。

6-3. 月額換算(円)

各構成の月額です。ストレージ代は含みません。

構成(想定モデル) 円/時 A:月40時間 B:月60時間 C:月730時間(常時)
GPUSOROBAN A4000 16GB(〜8Bの4bit) 50 2,000 3,000 33,000(月額プラン。従量では36,500)
RunPod A5000 24GB(〜14B) 43 1,706 2,560 31,142
RunPod Community RTX 4090 24GB(〜32Bの4bit。二次情報) 54 2,149 3,223 39,216
RunPod Secure RTX 4090 24GB 117 4,677 7,015 85,352
RunPod Secure RTX 5090 32GB 156 6,257 9,385 114,187
RunPod A40 48GB(70Bの4bit、短いコンテキスト) 77 3,097 4,645 56,517
RunPod A100 80GB(70Bの余裕構成) 251 10,049 15,073 183,391
RunPod Community RTX PRO 6000 96GB(gpt-oss-120b) 267 10,681 16,021 194,925
RunPod Secure RTX PRO 6000 96GB 330 13,209 19,813 241,061
RunPod H100 PCIe 80GB(gpt-oss-120b) 457 18,265 27,397 333,333
GPUSOROBAN A100 80GB 398 15,920 23,880 243,631(月額プラン)
RunPod H200 141GB(235B級の4bit) 725 29,009 43,513 529,411
さくら高火力DOK H100(断続実行向け) 1,008 40,320 60,480 735,840

単価は5章と同じ。時間単価×時間数で算出(円未満は四捨五入)。常時稼働のさくら高火力DOKは想定外の使い方で、参考値です。

ストレージを含めた総額の例です。

  • 週末だけ70B(4bit)をRunPodのA40で月40時間使い、Network Volume 100GB(0.07ドル×100GB=約1,106円)に重みを置く:3,097円+1,106円=月約4,203円
  • gpt-oss-120bをRTX PRO 6000(Community)で月60時間、Network Volume 150GB(約1,659円):16,021円+1,659円=月約17,680円
  • 同じ使い方をH100 PCIe(Secure)で:27,397円+1,659円=月約29,056円
  • 〜14Bのモデルを常時待機させる:GPUSOROBAN A4000の月額プランで月33,000円

7. 「止めたつもり」で課金が続くパターン

  • RunPod:停止中のVolume Diskは稼働中の2倍の単価です。Podを削除してもNetwork Volumeは残り、月額課金が続きます。残高が0になるとPodは自動停止し、Network Volumeのない Podは削除されてデータが戻りません。
  • Vast.ai:停止してもストレージ課金は続き、帯域は状態を問わず送受信バイトに課金されます。完全に止めるにはDestroyします。モデルのダウンロードで帯域課金が積み上がるので、借りる前にホストのバイト単価を確認します。
  • DigitalOcean:電源を切ってもGPUが確保されたままで、課金は止まりません。止めるにはDestroyが必要です。
  • さくら高火力DOK:タスク型でコンテナ実行時間のみの課金です。止め忘れは起きにくく、タスクの実行時間上限も設定できます。一方で、コンテナ内でのモデル取得時間も課金対象です。
  • GPUSOROBAN:停止中の課金の扱いは、公式の一次情報で確認できていません。契約前に確かめます。

8. セキュリティ

観点 RunPod Vast.ai 国内(さくら・GPUSOROBAN)
監査・準拠 SOC 2 Type 2、SOC 3、ISO/IEC 27001:2022(Trust Center)。SOC 2は認証書ではなく、監査報告(アテステーション) SOC 2 Type II(公式コンプライアンスページ) さくらのクラウドはISMAP関連情報の公開と、ガバメントクラウド採択(2026年3月27日発表)があるが、高火力DOKが対象範囲かは別途確認する。GPUSOROBANは情報セキュリティ基本方針を公開(認証の取得状況は未確認)
層による違い Secure CloudはT3/T4データセンターで、パートナーはSOC 2・ISO 27001・PCI DSSの基準を満たす(公式ドキュメント)。機微なワークロードにはSecure Cloudを使う Secure Cloudは認定データセンター内の検証済みマシンで、ISO 27001またはTier 3/4の基準を満たす拠点が対象(公式FAQ)。フィルターで絞らない限り、それ以外のホストも検索結果に出る さくらは自社データセンターを自社設備として持ち、日本国内で保管すると公表している
ホストからの露出 利用規約でホストによるPodデータの閲覧と利用状況の分析を禁止。違反ホストは除名される。分離はコンテナ単位 個人ホストが機材を物理的に管理する構成では、ホストからディスクを読める可能性を排除できない(筆者の推定) 事業者が機材を管理する。運用者のアクセス範囲は契約・規約で確認する
データの所在 31リージョンから選べる(公式サイト) ホストごとに拠点が異なり、オファーごとに確認する 国内に保管される。ただしログ・バックアップ・サポートアクセス・外部レジストリの所在まで確認する

出典:Runpod Trust Center・Data security and legal compliance、Vast.ai Compliance・General FAQ、さくら高火力DOK公式ページ、さくらインターネットのニュースリリース(2026/3/27)。

8-1. 機密情報を扱うときの運用

  1. 層を選ぶ:RunPodならSecure Cloud、Vast.aiならSecure Cloudフィルター、国内ならデータの所在を確認できる事業者を選びます。CommunityやVast.aiの個人ホストには、公開データと試験用データだけを置きます。
  2. ポートを公開しない:OllamaのAPIには認証機能がなく、0.0.0.0で公開すると誰でも使えてしまいます。vLLMのAPIも--api-keyを付けなければ認証がありません。
  3. 接続経路:SSHポートフォワード(ssh -L)を基本にします。継続利用ならTailscaleか、Cloudflare Tunnel+Cloudflare Accessで保護します。さくら高火力DOKの外部接続はHTTPSのみなので、Open WebUIのログインなど、アプリ側の認証を必ず有効にします。
  4. シークレット:Hugging Faceのトークンは読み取り専用で発行し、イメージやテンプレートに埋め込みません。使い終わったら失効させます。
  5. 削除前提の運用:使い終わったらインスタンスとボリュームの両方を削除します。共有ハードウェア上の消去を完全に信用せず、機密データはそもそも置かない設計にします。
  6. モデルの扱い:重みはsafetensors形式を優先し、pickle形式は任意コードの実行リスクがあるため避けます。ライセンス(Llama系の利用規約、Apache 2.0など)も確認します。

9. 実際の使い方

9-1. RunPodで始める手順

  1. アカウントを作成し、10〜25ドルを入金します。入金額が実質の支出上限になります。
  2. Network Volumeを100〜200GBで作ります(100GBで月1,106円)。
  3. Podを作成し、テンプレート(Ollama/Open WebUI、vLLM、PyTorchなど)とGPUを選びます。GPUの目安は6章の表です。
  4. モデルの保存先を永続ボリューム側に向けます。例:OLLAMA_MODELS=/workspace/ollama、HF_HOME=/workspace/hf。
  5. モデルを起動します(下のコード例)。
  6. 手元のPCからSSHトンネルで接続し、ブラウザでOpen WebUIを開きます。
  7. 使い終わったらPodをTerminateします。Network Volumeだけが残り、月数百円〜千数百円の課金になります。
# Ollama(公式READMEの手順)
ollama run gpt-oss:120b

# vLLM(OpenAI互換API。認証キーを必ず付ける)
vllm serve openai/gpt-oss-120b --api-key <ランダムな文字列>

# 手元のPCから接続(ポートは公開しない)
ssh -L 8080:localhost:8080 root@<PodのIP> -p <ポート>

9-2. 国内サービスの場合

GPUSOROBANは、Ubuntu+CUDAの通常のVMとして使えます。DockerでOllamaとOpen WebUIを立てる手順がそのまま通ります。

さくら高火力DOKは、Dockerイメージを用意してタスクとして実行する方式です。JupyterLabを起動するノートブック機能もあります。モデルの重みはイメージに埋め込むか、外部ストレージから取得します。H100プランのネットワークはベストエフォート250Mbpsなので、40GBのモデルを取得すると、理論値で約21分(40GB×8÷250Mbps)かかります。この間もコンテナの実行時間として課金されるため、H100の単価1,008円/時だと約358円が取得だけで消えます。頻繁に使うなら、重みを小さく保つ(量子化版を使う)か、取得の頻度を減らす工夫が要ります。

9-3. 運用の勘どころ

  • ダウンロード時間:70Bの4bit(約40GB)は、1Gbpsなら理論値で約5分、実効では10分前後です(推定)。毎回取得するとGPU時間を浪費するので、永続ボリュームに置きます。
  • コールドスタート:Podの起動とイメージ取得に数分、モデルのVRAMへのロードに数十秒〜数分かかります。サーバーレス(RunPod Serverless、Modal)は待機中の課金がない代わりに、初回応答が遅くなります。RunPod ServerlessはPodより単価が高く(RTX 4090で1.10ドル/時、H100で4.79ドル/時)、リクエストがまばらなAPI提供向けです。
  • 中断への備え:Vast.aiの中断可能インスタンスは奪われることがあります。対話用途なら再起動すれば済みますが、長いバッチ処理はチェックポイントを取ります。
  • 止め忘れ防止:RunPodはプリペイドなので、入金額が上限です。少額ずつ入金します。GPU使用率が一定時間ゼロなら停止するスクリプト(runpodctlなど)を入れます。国内VPS系は、削除をカレンダーに登録します。
  • 日本からの遅延:米国リージョンまでの往復は100〜150ms程度と見ています(筆者の推定)。LLMはトークンをストリーミングで返すので、体感への影響は最初の1文字が出るまでの時間に少し上乗せされる程度です。

10. 買うか借りるかの損益分岐

損益分岐の時間は、購入費をクラウドの時間単価で割れば出ます。たとえばRTX 5090を購入費45万円(筆者の仮定)とすると、RunPod Secureの5090(約156円/時)で約2,877時間です。電気代とホスト環境の費用は含めていません。月60時間の利用なら約4年、24時間常時稼働なら約4か月で、購入の方が安くなる計算です。月100時間未満の利用なら借りる方が有利で、毎日長時間使うなら購入が有利です。

マネージドLLM APIとの比較は、「GPUの時間単価÷1時間に処理できるトークン数」で1トークンあたりの費用を出し、APIの単価と並べます。GPUを借りる意味があるのは、データを外部APIに出したくない場合、独自にチューニングしたモデルを使う場合、バッチ処理でGPUの使用率を高く保てる場合です。

11. 注意点と不確実な点

  • 価格は変動します:RunPodの公式料金表は2026年9月27日の更新表示です。Vast.aiは市場価格で、固定の料金表がありません。
  • 二次情報の数値:RunPod Communityの4090(0.34ドル)とA100(1.19ドル)は、価格比較サイトの値です。ColabのCU消費量は個人による2026年2月の実測で、付与CUの数も資料によって食い違います。
  • ConoHaの料金表記:公式GPUページの表示(55.0円/時)と、第三者サイトが報じる2026年7月改定後の値(60.5円/時)が一致していません。個人の新規申込みが止まっているため、受付再開後に公式で確かめてください。
  • 個人契約の可否:各社の利用規約と審査基準で変わります。国内の一部サービスは法人向けの記載があります。
  • gpt-oss-120bとA100:OpenAIの案内は「単一の80GB GPU」で、例示はH100とMI300Xです。A100で動かす場合は、ランタイムの対応状況・速度・コンテキスト長を実測で確かめてください。
  • VRAMの見積もり:本文の値は計算による推定で、実装や量子化形式で±20%程度ずれます。
  • 為替と手数料:海外サービスはUSD建てで、為替変動、カード会社の海外事務手数料、消費税相当額で実際の支払額が変わります。

12. まとめ

個人がローカルLLMを借りて試すなら、まずRunPodのSecure CloudでNetwork Volumeを作り、24GB〜48GBのGPUで14B〜70Bの4bitを動かすのが最も手軽です。70Bの4bitが週末の月40時間で約4,203円という水準なので、購入前の見極めには十分に安い費用です。公開データだけなら、CommunityやVast.aiでさらに下げられます。

業務データを扱うなら、層の選択(Secure Cloudか国内事業者)、ポートを公開しない接続、使用後の削除の3点を外さないことが先です。gpt-oss-120bのような100B超のモデルは、H100かRTX PRO 6000を選び、A100は実測してから決める。235B級以上は、個人で常時動かさずAPIに任せる。この3つの線引きが、費用と手間のバランスを取る近道です。

13. 参考にした主な情報源

0 件のコメント: