Table of Contents

H100 SXM は両方の Ollama テストで最速でしたが、最高の価値ではありませんでした。 RTX PRO 5000 と RTX 6000 Ada は速度とレンタル費用のバランスに優れ、完了した Qwen3.8 27B 実行では CMP 170HX の時間単価が最も低くなりました。

この結果は、1 つのモデル、1 つの Ollama ラッパー、デフォルト量子化、1 つのサービング方式を測定したものです。このワークロードのサイズ計画に使い、GPU の普遍的な順位とは考えないでください。

この記事では、8.03B パラメーターの Ollama Q4_K_M ビルド Llama 3.1:8b と、約 27.3B パラメーターの Ollama Q4_K_M ビルド Qwen3.8:27b を比較します。両方を Vast.ai からレンタルした GPU インスタンスでテストしました。実際のプロンプト長を使い、対応するコンテキスト上限までのデコードスループットを測定しました。

短い答え

通常の単一ユーザー作業には RTX PRO 5000 または RTX 6000 Ada をレンタルしてください。 短いコンテキストと中程度のコンテキストでは RTX PRO 5000 が最も有利でした。RTX 6000 Ada は安価で、A100 より有用な速度を維持しました。速度が時間単価より重要な場合や長いプロンプトを使う場合は H100 SXM を選びます。

目的推奨理由
最小のテスト費用CMP 170HX1 時間 $0.420、テストした Q4_K_M モデルに十分な VRAM
$1.25/時未満で最高の価値RTX PRO 5000 または RTX 6000 AdaH100 のレンタル費用なしで高いデコード速度
最速の応答H100 SXM両方のモデルテストで最高のデコード速度
長いコンテキストの Qwen 作業H100 SXM または RTX PRO 6000 Max-Q両方とも約 131k トークンの Qwen 実行を大きな VRAM 余裕で完了
普及した 8B ベースラインLlama 3.1:8b128K コンテキスト上限を持つ実用的な 8B 比較
小規模な定期利用API クレジットまたはチャット契約アイドル GPU、保守、デプロイ費用が不要
非公開で頻繁な利用所有する GPU ワークステーション継続利用ならハードウェア費用を正当化しやすい
Abliterated または uncensored の実験先にレンタルし、継続利用後に購入モデルの挙動、ライセンス、運用リスクには別の検証が必要

テスト内容

ベンチマークはデフォルトの Q4_K_M ビルドを使う Ollama で実施しました。 特別な量子化、投機的デコード、カスタムサンプラー、別のサービングスタックは追加していません。目的は GPU インスタンスの単純で再現可能な比較です。

Vast.ai は計算リソースの提供者と利用者をつなぐ GPU クラウドマーケットプレイスです。ドキュメントにはオンデマンド、予約、interruptible、serverless の選択肢と、GPU、メモリ、価格、可用性のフィルターがあります。以下の時間単価はこのセッションで選んだインスタンスの値であり、固定の価格表ではありません。

測定した出力は、生成トークン毎秒で表す デコードスループット です。prefill はプロンプト処理を表すため別に記載します。デコード速度が高くても、長いプロンプトの処理には時間がかかります。

コンテキストごとに有効な試行を 2 回行い、デコード結果の中央値を記録しました。完了したレベルは実際の prompt_eval_count に基づきます。

  • 約 16.4k プロンプトトークン
  • 約 32.8k プロンプトトークン
  • 約 65.5k プロンプトトークン
  • 約 131k プロンプトトークン

要求した 256k トークンの実行は完了しませんでした。40 GB の A100 と複数の小さいカードは処理中のままか、目標コンテキストまで到達しませんでした。

ベンチマークの限界: 数値は 1 つのサービング方式で 2 つの Ollama Q4_K_M ワークロードを表します。学習速度、マルチユーザー処理量、画像生成、vLLM 性能、別モデルの結果は予測しません。

Llama 3.1 8B の再実行

Llama 3.1:8b は同じ GPU 群に対する実用的なベースラインです。 Ollama は約 1 億 2,000 万ダウンロードと説明しており、人気を基準にした比較に適しています。 公式 Ollama モデルページ には 4.9 GB の Q4_K_M ビルド、8.03B パラメーター、128K コンテキストが記載されています。

モデル専用のベンチマークランナーを使い、Ollama の tokenizer に合わせてプロンプトを生成しました。ラベルは要求値ではなく実際のプロンプト数です。

  • 32k の目標で約 32,676 実トークン
  • 64k の目標で約 65,342 実トークン
  • 128k の目標で約 130,671 実トークン

モデルの上限は 128K なので 256k は未対応です。runner は再試行と状態行を保持し、タイムアウトも表示しました。

Llama 3.1 8B の結果

GPU~32k デコード tok/s~64k デコード tok/s~128k デコード tok/s
H100 SXM163.5124.082.4
H100 SXM158.6121.280.6
RTX PRO 5000110.179.849.9
CMP 170HX 64GB91.971.050.1
RTX 6000 Ada88.353.929.3
RTX PRO 6000 Max-Q66.753.040.3
RTX PRO 6000 S60.342.533.9
A100 SXM4 40GB2.040.638.5
A100 PCIe 40GB1.220.320.3
2x RTX 5060 Ti1.326.8Timeout

2 行の H100 は同じ GPU クラスの別の有効なインスタンスです。どちらも他のカードを明確に上回りました。32k では RTX PRO 5000 より 44% から 48% 高速で、128k では約 61% から 65% 高速でした。A100 と RTX 5060 Ti の 32k 結果は同等の GPU 実行を表しません。RTX 5060 Ti ホストは 128k の 2 回目の試行でもタイムアウトしました。

コンテキスト目標状態
32k10 ホストすべてで完了
64k10 ホストすべてで完了
128k9 ホストで完了。2x RTX 5060 Ti ホストは 2 回目にタイムアウト
256kLlama 3.1 8B の上限が 128K のため全ホストで未対応

2 つのモデルの比較

小さい Llama は比較可能なすべての GPU で高速でしたが、モデルサイズと品質は交換できません。 Llama 3.1 8B はメモリ要求が低い人気のベースラインです。Qwen3.8 27B はより多くのメモリを必要とし、異なる能力を持ちます。数値はハードウェア選定に使い、普遍的な優劣には使いません。

用途適した基準理由
高速な 8B アシスタントLlama 3.1:8bデコード速度が高く必要メモリが少ない
27B ローカルモデルのサイズ計画Qwen3.8:27b大きな単一 GPU ワークロードに近い
128K コンテキスト上限Llama 3.1:8b明示された上限により 256k は無効
VRAM 余裕のテストQwen3.8:27b大きいモデルがメモリと長いコンテキストの限界を早く示す
プロバイダー横断の基準Llama 3.1:8b人気とサイズにより再現しやすい

以前の Qwen 再実行では、対応レベルの実際の数を 32,770、65,538、131,074 トークンに修正しました。比較ではこのラベルを要求した num_ctx の代わりに使います。

約 16k トークン

H100 SXM は短いコンテキストで 134.4 デコードトークン毎秒を記録しました。 RTX PRO 5000 は 113.9 で、時間単価は半分未満でした。

順位GPUVRAMデコード tok/sPrefill tok/sレンタル料金
1H100 SXM79.6 GB134.489,974$2.693/hr
2RTX PRO 500047.8 GB113.968,726$1.005/hr
3RTX 6000 Ada48 GB89.195,856$0.813/hr
4RTX PRO 6000 Max-Q95.6 GB84.172,235$1.507/hr
5A100 SXM440 GB60.653,048$0.680/hr
6CMP 170HX64 GB51.551,122$0.420/hr
7RTX PRO 6000 S95.6 GB49.352,773$1.756/hr
8A100 PCIe40 GB38.438,886$0.565/hr

約 32.8k トークン

中程度のコンテキストでも順位は安定しました。 H100 SXM は 120.0、RTX PRO 5000 は 105.0、RTX 6000 Ada は 75.7 トークン毎秒でした。

順位GPUVRAMデコード tok/sPrefill tok/sレンタル料金
1H100 SXM79.6 GB120.0139,748$2.693/hr
2RTX PRO 500047.8 GB105.0103,707$1.005/hr
3RTX 6000 Ada48 GB75.7141,678$0.813/hr
4RTX PRO 6000 Max-Q95.6 GB66.9120,537$1.507/hr
5RTX PRO 6000 S95.6 GB65.9109,280$1.756/hr
6A100 SXM440 GB51.181,929$0.680/hr
7CMP 170HX64 GB46.277,984$0.420/hr
8A100 PCIe40 GB36.173,377$0.565/hr

約 65.5k トークン

長いプロンプトは、メモリ容量が大きいカードと余裕の少ないカードの差を広げました。 H100 は 112.0 で首位を維持し、RTX PRO 6000 Max-Q はデコード速度で RTX 6000 Ada を上回りました。

順位GPUVRAMデコード tok/sPrefill tok/sレンタル料金
1H100 SXM79.6 GB112.0195,252$2.693/hr
2RTX PRO 500047.8 GB96.9148,897$1.005/hr
3RTX PRO 6000 Max-Q95.6 GB75.7156,443$1.507/hr
4RTX 6000 Ada48 GB70.8208,400$0.813/hr
5A100 SXM440 GB49.3147,699$0.680/hr
6CMP 170HX64 GB45.9118,657$0.420/hr
7RTX PRO 6000 S95.6 GB37.0124,927$1.756/hr
8A100 PCIe40 GBN/AN/A$0.565/hr

約 131k トークン

この長さで 100 デコードトークン毎秒を超えたのは H100 だけでした。 RTX PRO 6000 Max-Q は 73.4、RTX 6000 Ada は 61.7 で完了しました。

順位GPUVRAMデコード tok/sPrefill tok/sレンタル料金
1H100 SXM79.6 GB108.2242,093$2.693/hr
2RTX PRO 6000 Max-Q95.6 GB73.4197,208$1.507/hr
3RTX 6000 Ada48 GB61.7278,283$0.813/hr
4RTX PRO 6000 S95.6 GB39.4124,653$1.756/hr
5RTX PRO 500047.8 GBN/AN/A$1.005/hr
6A100 SXM440 GBN/AN/A$0.680/hr
7CMP 170HX64 GBN/AN/A$0.420/hr
8A100 PCIe40 GBN/AN/A$0.565/hr

全体のデコード比較

GPU~16k~32.8k~65.5k~131k
H100 SXM134.4120.0112.0108.2
RTX PRO 5000113.9105.096.9N/A
RTX 6000 Ada89.175.770.861.7
RTX PRO 6000 Max-Q84.166.975.773.4
RTX PRO 6000 S49.365.937.039.4
A100 SXM460.651.149.3N/A
CMP 170HX51.546.245.9N/A
A100 PCIe38.436.1N/AN/A

H100 は完了したすべてのコンテキスト長で首位でした。 RTX PRO 5000 に対する差は約 16k の 20.5 から約 32.8k の 12.0 に縮まりました。価値の判断は、最初の応答速度を取るか、長いセッションの費用を下げるかで変わります。

100 万デコードトークンあたりの費用

時間単価だけでは有用な比較を隠します。 提示された時間単価をデコードスループットで割ると、100 万生成トークンの概算レンタル費用が出ます。プロンプト処理、アイドル時間、ストレージ、転送、税、割引、失敗した実行は含みません。

GPU短いコンテキストの料金1M デコードトークンの概算費用
CMP 170HX$0.420/hr$2.27
RTX PRO 5000$1.005/hr$2.45
RTX 6000 Ada$0.813/hr$2.53
A100 SXM4$0.680/hr$3.12
A100 PCIe$0.565/hr$4.09
RTX PRO 6000 Max-Q$1.507/hr$4.98
H100 SXM$2.693/hr$5.57
RTX PRO 6000 S$1.756/hr$9.89

この狭い算術比較では CMP 170HX が勝ちました。 RTX PRO 5000 と RTX 6000 Ada は近く、両方ともより高いスループットでした。対話的な用途では、最低のトークン費用より待ち時間が重要になることがあります。

レンタル、クレジット購入、契約、ハードウェア購入

適切な選択は使用率と必要な制御で決まります。 GPU レンタルは変動する計算費用です。API クレジットは変動するモデル費用です。チャット契約は利用制限付きの固定アクセス費用です。所有ハードウェアには購入費に加えて電力、冷却、保守、減価償却が必要です。

月額予算とワークロード推奨理由主な妥協点
$10 未満API クレジットまたは無料のローカルモデルアイドル GPU 費用なしで流れを確認できるホスティングとレート制限の制御が少ない
$10〜$30断続的なら API、毎日ならチャット契約契約は対話、クレジットはスクリプト向きデフォルトで非公開 27B エンドポイントを得られない
$30〜$100アクティブな時だけ RTX 6000 Ada または PRO 5000 をレンタル短い調査と所有コストを両立セットアップ、保存、監視、停止が必要
$100〜$250定期作業には高速カードをレンタル、または所有案を試す継続利用が見える可用性と時間単価が変わる
$250〜$600PRO 5000 の月レンタルとローカル GPU を比較頻繁な非公開推論の判断点電力、熱、サポート、再販リスクが増える
$600 超高使用率のときだけ購入、ピークには H100 を予約混合戦略でピーク機材の所有を避ける資本が 1 つの構成に固定される

H100 は $2.693/時で連続 1 日約 $64.63、30 日約 $1,941.00 です。RTX PRO 5000 は $1.005/時で 1 日約 $24.12、30 日約 $723.60 です。アクティブな時間だけ借りる場合は合計が異なります。

API クレジットが有利な場合

利用が不規則で、自動化が必要で、特定のローカルモデルが不要なら API クレジットが有利です。 GPU の準備、モデルのダウンロード、ドライバー問題、アイドル時間を避けられます。OpenRouter のカタログでコンテキスト、プロバイダー、トークン価格を比較し、実際の計算機で請求額を確認してください。

サブスクリプションが有利な場合

毎日ホスト型アシスタントを使う人には契約が向いています。 Claude の個人プランは Free、Pro、Max に分かれ、制限と機能が異なります。契約は API アクセスではありません。対話型の文章、調査、コード、ファイル確認には契約を、プログラムや agent には API クレジットを選びます。

Vast.ai が有利な場合

オープンモデル、非公開ランタイム制御、短時間の高スループットが必要なら Vast.ai が有利です。 GPU を選び、インスタンスを起動し、Ollama でモデルを試し、終わったら停止します。GPU 使用率と VRAM を確認し、公開サービスを保護し、モデルファイルを保存してください。

GPU 購入が有利な場合

継続利用、安定したモデル要件、ローカル制御が揃ったら購入が有利です。 可用性のリスクを減らし、永続的な環境を得られます。NVIDIA の RTX 4090 仕様は 24 GB メモリ、450 W の総グラフィックス電力、850 W の最小システム電力を示します。テストした 27B Q4_K_M 構成は 24 GB を超えるため、パラメーター数だけでなく実際のメモリ使用量を確認してください。

Abliterated と uncensored モデル

Abliterated と uncensored のモデルは購入判断を変えます。 拒否が少ない点は魅力ですが、安全性の低下、不明な出所、不統一なプロンプト形式、追加の確認、ライセンスや利用規約の制限があります。

先にレンタルしてください。提示された料金なら RTX PRO 5000 の 1 日テストは他の費用を除いて約 $24.12 です。モデル適合性、GPU 使用、回答品質、運用リスクを確認できます。

uncensored モデルを公開インターネットへ直接公開しないでください。 認証、レート制限、ログ制御、ネットワーク分離を前段に置きます。確認していないモデルソースへ個人情報、機密情報、規制対象データを送らないでください。

ベンチマークの注意点

欠けた結果も結果の一部です。 N/A は有効な測定が得られなかったことを意味し、別のカードの値から速度を推定することを意味しません。

  • 2 台目の H100 は有効な結果を出しませんでした。 モデルのダウンロードが遅すぎました。
  • 2x RTX 5060 Ti は除外しました。 Ollama が GPU ではなく CPU にモデルを読み込みました。
  • Qwen3.8 27B の 256k プロンプトは未完了です。 最大の有効レベルは約 131k の実トークンでした。Llama 3.1 8B の上限は 128K です。
  • 要求した num_ctx は順位ラベルにしていません。 最終表は実際の prompt_eval_count を使います。
  • コンテキストごとの 2 回の有効試行は中央値で要約しました。 遅い 1 回の影響を抑えますが、大規模なテストの代わりにはなりません。
  • wrapper は意図的に単純です。 調整済みの vLLM や llama.cpp は異なる順位を出します。

最終推奨

RTX 6000 Ada または RTX PRO 5000 のレンタルから始めてください。 RTX 6000 Ada は $0.813/時なら予算向けです。H100 の価格を下回る速度重視なら RTX PRO 5000 を選びます。長いプロンプト、厳しい対話遅延、時間重視の短いテストには H100 SXM を使います。8B では、最高速度より低い時間単価を重視するなら CMP 170HX を試します。

1 回の成功したテストだけで GPU を購入しないでください。 実ワークロードを 1 か月レンタルし、稼働時間、プロンプト長、同時実行数、モデル変更を記録して、所有費用全体と比較します。頻繁かつ安定して使う場合に購入します。

断続的な作業には API クレジットかチャット契約が簡単です。非公開推論、オープンモデル、abliterated モデルの検証には、Vast.ai が直ちにワークステーションを買うより低い初期負担を提供します。低メモリの基準には Llama 3.1 8B、実際の配備対象には Qwen3.8 27B を使います。

次の手順

自分のプロンプト長と稼働時間の見積もりで比較を繰り返します。GPU 使用を確認し、モデルリビジョンとランタイムバージョンを記録し、各実行後にインスタンスを停止してから、月額レンタルと所有費用全体を比較します。

参考資料

  1. Vast.ai GPU クラウドマーケットプレイス
  2. Vast.ai ドキュメント: マーケットプレイス、インスタンス、価格、レンタル形式
  3. Ollama Qwen3 モデルライブラリ
  4. Ollama Llama 3.1 8B モデルページ
  5. OpenRouter モデルカタログと価格比較
  6. Claude の料金と個人向けプラン
  7. NVIDIA GeForce RTX 4090 仕様
  8. 2026 年のローカル AI: Qwen3.8 27B とセルフホストモデル用ハードウェア
  9. Raspberry Pi ハードウェアでの Ollama モデルテスト