Vast.ai における Llama 3.1 8B と Qwen3.8 27B の GPU ベンチマーク

Table of Contents
H100 SXM は両方の Ollama テストで最速でしたが、最高の価値ではありませんでした。 RTX PRO 5000 と RTX 6000 Ada は速度とレンタル費用のバランスに優れ、完了した Qwen3.8 27B 実行では CMP 170HX の時間単価が最も低くなりました。
この結果は、1 つのモデル、1 つの Ollama ラッパー、デフォルト量子化、1 つのサービング方式を測定したものです。このワークロードのサイズ計画に使い、GPU の普遍的な順位とは考えないでください。
この記事では、8.03B パラメーターの Ollama Q4_K_M ビルド Llama 3.1:8b と、約 27.3B パラメーターの Ollama Q4_K_M ビルド Qwen3.8:27b を比較します。両方を Vast.ai からレンタルした GPU インスタンスでテストしました。実際のプロンプト長を使い、対応するコンテキスト上限までのデコードスループットを測定しました。
短い答え
通常の単一ユーザー作業には RTX PRO 5000 または RTX 6000 Ada をレンタルしてください。 短いコンテキストと中程度のコンテキストでは RTX PRO 5000 が最も有利でした。RTX 6000 Ada は安価で、A100 より有用な速度を維持しました。速度が時間単価より重要な場合や長いプロンプトを使う場合は H100 SXM を選びます。
| 目的 | 推奨 | 理由 |
|---|---|---|
| 最小のテスト費用 | CMP 170HX | 1 時間 $0.420、テストした Q4_K_M モデルに十分な VRAM |
| $1.25/時未満で最高の価値 | RTX PRO 5000 または RTX 6000 Ada | H100 のレンタル費用なしで高いデコード速度 |
| 最速の応答 | H100 SXM | 両方のモデルテストで最高のデコード速度 |
| 長いコンテキストの Qwen 作業 | H100 SXM または RTX PRO 6000 Max-Q | 両方とも約 131k トークンの Qwen 実行を大きな VRAM 余裕で完了 |
| 普及した 8B ベースライン | Llama 3.1:8b | 128K コンテキスト上限を持つ実用的な 8B 比較 |
| 小規模な定期利用 | API クレジットまたはチャット契約 | アイドル GPU、保守、デプロイ費用が不要 |
| 非公開で頻繁な利用 | 所有する GPU ワークステーション | 継続利用ならハードウェア費用を正当化しやすい |
| Abliterated または uncensored の実験 | 先にレンタルし、継続利用後に購入 | モデルの挙動、ライセンス、運用リスクには別の検証が必要 |
テスト内容
ベンチマークはデフォルトの Q4_K_M ビルドを使う Ollama で実施しました。 特別な量子化、投機的デコード、カスタムサンプラー、別のサービングスタックは追加していません。目的は GPU インスタンスの単純で再現可能な比較です。
Vast.ai は計算リソースの提供者と利用者をつなぐ GPU クラウドマーケットプレイスです。ドキュメントにはオンデマンド、予約、interruptible、serverless の選択肢と、GPU、メモリ、価格、可用性のフィルターがあります。以下の時間単価はこのセッションで選んだインスタンスの値であり、固定の価格表ではありません。
測定した出力は、生成トークン毎秒で表す デコードスループット です。prefill はプロンプト処理を表すため別に記載します。デコード速度が高くても、長いプロンプトの処理には時間がかかります。
コンテキストごとに有効な試行を 2 回行い、デコード結果の中央値を記録しました。完了したレベルは実際の prompt_eval_count に基づきます。
- 約 16.4k プロンプトトークン
- 約 32.8k プロンプトトークン
- 約 65.5k プロンプトトークン
- 約 131k プロンプトトークン
要求した 256k トークンの実行は完了しませんでした。40 GB の A100 と複数の小さいカードは処理中のままか、目標コンテキストまで到達しませんでした。
ベンチマークの限界: 数値は 1 つのサービング方式で 2 つの Ollama Q4_K_M ワークロードを表します。学習速度、マルチユーザー処理量、画像生成、vLLM 性能、別モデルの結果は予測しません。
Llama 3.1 8B の再実行
Llama 3.1:8b は同じ GPU 群に対する実用的なベースラインです。 Ollama は約 1 億 2,000 万ダウンロードと説明しており、人気を基準にした比較に適しています。 公式 Ollama モデルページ には 4.9 GB の Q4_K_M ビルド、8.03B パラメーター、128K コンテキストが記載されています。
モデル専用のベンチマークランナーを使い、Ollama の tokenizer に合わせてプロンプトを生成しました。ラベルは要求値ではなく実際のプロンプト数です。
- 32k の目標で約 32,676 実トークン
- 64k の目標で約 65,342 実トークン
- 128k の目標で約 130,671 実トークン
モデルの上限は 128K なので 256k は未対応です。runner は再試行と状態行を保持し、タイムアウトも表示しました。
Llama 3.1 8B の結果
| GPU | ~32k デコード tok/s | ~64k デコード tok/s | ~128k デコード tok/s |
|---|---|---|---|
| H100 SXM | 163.5 | 124.0 | 82.4 |
| H100 SXM | 158.6 | 121.2 | 80.6 |
| RTX PRO 5000 | 110.1 | 79.8 | 49.9 |
| CMP 170HX 64GB | 91.9 | 71.0 | 50.1 |
| RTX 6000 Ada | 88.3 | 53.9 | 29.3 |
| RTX PRO 6000 Max-Q | 66.7 | 53.0 | 40.3 |
| RTX PRO 6000 S | 60.3 | 42.5 | 33.9 |
| A100 SXM4 40GB | 2.0 | 40.6 | 38.5 |
| A100 PCIe 40GB | 1.2 | 20.3 | 20.3 |
| 2x RTX 5060 Ti | 1.3 | 26.8 | Timeout |
2 行の H100 は同じ GPU クラスの別の有効なインスタンスです。どちらも他のカードを明確に上回りました。32k では RTX PRO 5000 より 44% から 48% 高速で、128k では約 61% から 65% 高速でした。A100 と RTX 5060 Ti の 32k 結果は同等の GPU 実行を表しません。RTX 5060 Ti ホストは 128k の 2 回目の試行でもタイムアウトしました。
| コンテキスト目標 | 状態 |
|---|---|
| 32k | 10 ホストすべてで完了 |
| 64k | 10 ホストすべてで完了 |
| 128k | 9 ホストで完了。2x RTX 5060 Ti ホストは 2 回目にタイムアウト |
| 256k | Llama 3.1 8B の上限が 128K のため全ホストで未対応 |
2 つのモデルの比較
小さい Llama は比較可能なすべての GPU で高速でしたが、モデルサイズと品質は交換できません。 Llama 3.1 8B はメモリ要求が低い人気のベースラインです。Qwen3.8 27B はより多くのメモリを必要とし、異なる能力を持ちます。数値はハードウェア選定に使い、普遍的な優劣には使いません。
| 用途 | 適した基準 | 理由 |
|---|---|---|
| 高速な 8B アシスタント | Llama 3.1:8b | デコード速度が高く必要メモリが少ない |
| 27B ローカルモデルのサイズ計画 | Qwen3.8:27b | 大きな単一 GPU ワークロードに近い |
| 128K コンテキスト上限 | Llama 3.1:8b | 明示された上限により 256k は無効 |
| VRAM 余裕のテスト | Qwen3.8:27b | 大きいモデルがメモリと長いコンテキストの限界を早く示す |
| プロバイダー横断の基準 | Llama 3.1:8b | 人気とサイズにより再現しやすい |
以前の Qwen 再実行では、対応レベルの実際の数を 32,770、65,538、131,074 トークンに修正しました。比較ではこのラベルを要求した num_ctx の代わりに使います。
約 16k トークン
H100 SXM は短いコンテキストで 134.4 デコードトークン毎秒を記録しました。 RTX PRO 5000 は 113.9 で、時間単価は半分未満でした。
| 順位 | GPU | VRAM | デコード tok/s | Prefill tok/s | レンタル料金 |
|---|---|---|---|---|---|
| 1 | H100 SXM | 79.6 GB | 134.4 | 89,974 | $2.693/hr |
| 2 | RTX PRO 5000 | 47.8 GB | 113.9 | 68,726 | $1.005/hr |
| 3 | RTX 6000 Ada | 48 GB | 89.1 | 95,856 | $0.813/hr |
| 4 | RTX PRO 6000 Max-Q | 95.6 GB | 84.1 | 72,235 | $1.507/hr |
| 5 | A100 SXM4 | 40 GB | 60.6 | 53,048 | $0.680/hr |
| 6 | CMP 170HX | 64 GB | 51.5 | 51,122 | $0.420/hr |
| 7 | RTX PRO 6000 S | 95.6 GB | 49.3 | 52,773 | $1.756/hr |
| 8 | A100 PCIe | 40 GB | 38.4 | 38,886 | $0.565/hr |
約 32.8k トークン
中程度のコンテキストでも順位は安定しました。 H100 SXM は 120.0、RTX PRO 5000 は 105.0、RTX 6000 Ada は 75.7 トークン毎秒でした。
| 順位 | GPU | VRAM | デコード tok/s | Prefill tok/s | レンタル料金 |
|---|---|---|---|---|---|
| 1 | H100 SXM | 79.6 GB | 120.0 | 139,748 | $2.693/hr |
| 2 | RTX PRO 5000 | 47.8 GB | 105.0 | 103,707 | $1.005/hr |
| 3 | RTX 6000 Ada | 48 GB | 75.7 | 141,678 | $0.813/hr |
| 4 | RTX PRO 6000 Max-Q | 95.6 GB | 66.9 | 120,537 | $1.507/hr |
| 5 | RTX PRO 6000 S | 95.6 GB | 65.9 | 109,280 | $1.756/hr |
| 6 | A100 SXM4 | 40 GB | 51.1 | 81,929 | $0.680/hr |
| 7 | CMP 170HX | 64 GB | 46.2 | 77,984 | $0.420/hr |
| 8 | A100 PCIe | 40 GB | 36.1 | 73,377 | $0.565/hr |
約 65.5k トークン
長いプロンプトは、メモリ容量が大きいカードと余裕の少ないカードの差を広げました。 H100 は 112.0 で首位を維持し、RTX PRO 6000 Max-Q はデコード速度で RTX 6000 Ada を上回りました。
| 順位 | GPU | VRAM | デコード tok/s | Prefill tok/s | レンタル料金 |
|---|---|---|---|---|---|
| 1 | H100 SXM | 79.6 GB | 112.0 | 195,252 | $2.693/hr |
| 2 | RTX PRO 5000 | 47.8 GB | 96.9 | 148,897 | $1.005/hr |
| 3 | RTX PRO 6000 Max-Q | 95.6 GB | 75.7 | 156,443 | $1.507/hr |
| 4 | RTX 6000 Ada | 48 GB | 70.8 | 208,400 | $0.813/hr |
| 5 | A100 SXM4 | 40 GB | 49.3 | 147,699 | $0.680/hr |
| 6 | CMP 170HX | 64 GB | 45.9 | 118,657 | $0.420/hr |
| 7 | RTX PRO 6000 S | 95.6 GB | 37.0 | 124,927 | $1.756/hr |
| 8 | A100 PCIe | 40 GB | N/A | N/A | $0.565/hr |
約 131k トークン
この長さで 100 デコードトークン毎秒を超えたのは H100 だけでした。 RTX PRO 6000 Max-Q は 73.4、RTX 6000 Ada は 61.7 で完了しました。
| 順位 | GPU | VRAM | デコード tok/s | Prefill tok/s | レンタル料金 |
|---|---|---|---|---|---|
| 1 | H100 SXM | 79.6 GB | 108.2 | 242,093 | $2.693/hr |
| 2 | RTX PRO 6000 Max-Q | 95.6 GB | 73.4 | 197,208 | $1.507/hr |
| 3 | RTX 6000 Ada | 48 GB | 61.7 | 278,283 | $0.813/hr |
| 4 | RTX PRO 6000 S | 95.6 GB | 39.4 | 124,653 | $1.756/hr |
| 5 | RTX PRO 5000 | 47.8 GB | N/A | N/A | $1.005/hr |
| 6 | A100 SXM4 | 40 GB | N/A | N/A | $0.680/hr |
| 7 | CMP 170HX | 64 GB | N/A | N/A | $0.420/hr |
| 8 | A100 PCIe | 40 GB | N/A | N/A | $0.565/hr |
全体のデコード比較
| GPU | ~16k | ~32.8k | ~65.5k | ~131k |
|---|---|---|---|---|
| H100 SXM | 134.4 | 120.0 | 112.0 | 108.2 |
| RTX PRO 5000 | 113.9 | 105.0 | 96.9 | N/A |
| RTX 6000 Ada | 89.1 | 75.7 | 70.8 | 61.7 |
| RTX PRO 6000 Max-Q | 84.1 | 66.9 | 75.7 | 73.4 |
| RTX PRO 6000 S | 49.3 | 65.9 | 37.0 | 39.4 |
| A100 SXM4 | 60.6 | 51.1 | 49.3 | N/A |
| CMP 170HX | 51.5 | 46.2 | 45.9 | N/A |
| A100 PCIe | 38.4 | 36.1 | N/A | N/A |
H100 は完了したすべてのコンテキスト長で首位でした。 RTX PRO 5000 に対する差は約 16k の 20.5 から約 32.8k の 12.0 に縮まりました。価値の判断は、最初の応答速度を取るか、長いセッションの費用を下げるかで変わります。
100 万デコードトークンあたりの費用
時間単価だけでは有用な比較を隠します。 提示された時間単価をデコードスループットで割ると、100 万生成トークンの概算レンタル費用が出ます。プロンプト処理、アイドル時間、ストレージ、転送、税、割引、失敗した実行は含みません。
| GPU | 短いコンテキストの料金 | 1M デコードトークンの概算費用 |
|---|---|---|
| CMP 170HX | $0.420/hr | $2.27 |
| RTX PRO 5000 | $1.005/hr | $2.45 |
| RTX 6000 Ada | $0.813/hr | $2.53 |
| A100 SXM4 | $0.680/hr | $3.12 |
| A100 PCIe | $0.565/hr | $4.09 |
| RTX PRO 6000 Max-Q | $1.507/hr | $4.98 |
| H100 SXM | $2.693/hr | $5.57 |
| RTX PRO 6000 S | $1.756/hr | $9.89 |
この狭い算術比較では CMP 170HX が勝ちました。 RTX PRO 5000 と RTX 6000 Ada は近く、両方ともより高いスループットでした。対話的な用途では、最低のトークン費用より待ち時間が重要になることがあります。
レンタル、クレジット購入、契約、ハードウェア購入
適切な選択は使用率と必要な制御で決まります。 GPU レンタルは変動する計算費用です。API クレジットは変動するモデル費用です。チャット契約は利用制限付きの固定アクセス費用です。所有ハードウェアには購入費に加えて電力、冷却、保守、減価償却が必要です。
| 月額予算とワークロード | 推奨 | 理由 | 主な妥協点 |
|---|---|---|---|
| $10 未満 | API クレジットまたは無料のローカルモデル | アイドル GPU 費用なしで流れを確認できる | ホスティングとレート制限の制御が少ない |
| $10〜$30 | 断続的なら API、毎日ならチャット契約 | 契約は対話、クレジットはスクリプト向き | デフォルトで非公開 27B エンドポイントを得られない |
| $30〜$100 | アクティブな時だけ RTX 6000 Ada または PRO 5000 をレンタル | 短い調査と所有コストを両立 | セットアップ、保存、監視、停止が必要 |
| $100〜$250 | 定期作業には高速カードをレンタル、または所有案を試す | 継続利用が見える | 可用性と時間単価が変わる |
| $250〜$600 | PRO 5000 の月レンタルとローカル GPU を比較 | 頻繁な非公開推論の判断点 | 電力、熱、サポート、再販リスクが増える |
| $600 超 | 高使用率のときだけ購入、ピークには H100 を予約 | 混合戦略でピーク機材の所有を避ける | 資本が 1 つの構成に固定される |
H100 は $2.693/時で連続 1 日約 $64.63、30 日約 $1,941.00 です。RTX PRO 5000 は $1.005/時で 1 日約 $24.12、30 日約 $723.60 です。アクティブな時間だけ借りる場合は合計が異なります。
API クレジットが有利な場合
利用が不規則で、自動化が必要で、特定のローカルモデルが不要なら API クレジットが有利です。 GPU の準備、モデルのダウンロード、ドライバー問題、アイドル時間を避けられます。OpenRouter のカタログでコンテキスト、プロバイダー、トークン価格を比較し、実際の計算機で請求額を確認してください。
サブスクリプションが有利な場合
毎日ホスト型アシスタントを使う人には契約が向いています。 Claude の個人プランは Free、Pro、Max に分かれ、制限と機能が異なります。契約は API アクセスではありません。対話型の文章、調査、コード、ファイル確認には契約を、プログラムや agent には API クレジットを選びます。
Vast.ai が有利な場合
オープンモデル、非公開ランタイム制御、短時間の高スループットが必要なら Vast.ai が有利です。 GPU を選び、インスタンスを起動し、Ollama でモデルを試し、終わったら停止します。GPU 使用率と VRAM を確認し、公開サービスを保護し、モデルファイルを保存してください。
GPU 購入が有利な場合
継続利用、安定したモデル要件、ローカル制御が揃ったら購入が有利です。 可用性のリスクを減らし、永続的な環境を得られます。NVIDIA の RTX 4090 仕様は 24 GB メモリ、450 W の総グラフィックス電力、850 W の最小システム電力を示します。テストした 27B Q4_K_M 構成は 24 GB を超えるため、パラメーター数だけでなく実際のメモリ使用量を確認してください。
Abliterated と uncensored モデル
Abliterated と uncensored のモデルは購入判断を変えます。 拒否が少ない点は魅力ですが、安全性の低下、不明な出所、不統一なプロンプト形式、追加の確認、ライセンスや利用規約の制限があります。
先にレンタルしてください。提示された料金なら RTX PRO 5000 の 1 日テストは他の費用を除いて約 $24.12 です。モデル適合性、GPU 使用、回答品質、運用リスクを確認できます。
uncensored モデルを公開インターネットへ直接公開しないでください。 認証、レート制限、ログ制御、ネットワーク分離を前段に置きます。確認していないモデルソースへ個人情報、機密情報、規制対象データを送らないでください。
ベンチマークの注意点
欠けた結果も結果の一部です。 N/A は有効な測定が得られなかったことを意味し、別のカードの値から速度を推定することを意味しません。
- 2 台目の H100 は有効な結果を出しませんでした。 モデルのダウンロードが遅すぎました。
- 2x RTX 5060 Ti は除外しました。 Ollama が GPU ではなく CPU にモデルを読み込みました。
- Qwen3.8 27B の 256k プロンプトは未完了です。 最大の有効レベルは約 131k の実トークンでした。Llama 3.1 8B の上限は 128K です。
- 要求した
num_ctxは順位ラベルにしていません。 最終表は実際のprompt_eval_countを使います。 - コンテキストごとの 2 回の有効試行は中央値で要約しました。 遅い 1 回の影響を抑えますが、大規模なテストの代わりにはなりません。
- wrapper は意図的に単純です。 調整済みの vLLM や llama.cpp は異なる順位を出します。
最終推奨
RTX 6000 Ada または RTX PRO 5000 のレンタルから始めてください。 RTX 6000 Ada は $0.813/時なら予算向けです。H100 の価格を下回る速度重視なら RTX PRO 5000 を選びます。長いプロンプト、厳しい対話遅延、時間重視の短いテストには H100 SXM を使います。8B では、最高速度より低い時間単価を重視するなら CMP 170HX を試します。
1 回の成功したテストだけで GPU を購入しないでください。 実ワークロードを 1 か月レンタルし、稼働時間、プロンプト長、同時実行数、モデル変更を記録して、所有費用全体と比較します。頻繁かつ安定して使う場合に購入します。
断続的な作業には API クレジットかチャット契約が簡単です。非公開推論、オープンモデル、abliterated モデルの検証には、Vast.ai が直ちにワークステーションを買うより低い初期負担を提供します。低メモリの基準には Llama 3.1 8B、実際の配備対象には Qwen3.8 27B を使います。
次の手順
自分のプロンプト長と稼働時間の見積もりで比較を繰り返します。GPU 使用を確認し、モデルリビジョンとランタイムバージョンを記録し、各実行後にインスタンスを停止してから、月額レンタルと所有費用全体を比較します。
参考資料
- Vast.ai GPU クラウドマーケットプレイス
- Vast.ai ドキュメント: マーケットプレイス、インスタンス、価格、レンタル形式
- Ollama Qwen3 モデルライブラリ
- Ollama Llama 3.1 8B モデルページ
- OpenRouter モデルカタログと価格比較
- Claude の料金と個人向けプラン
- NVIDIA GeForce RTX 4090 仕様
- 2026 年のローカル AI: Qwen3.8 27B とセルフホストモデル用ハードウェア
- Raspberry Pi ハードウェアでの Ollama モデルテスト
This article refers to other articles we've written:
- Which AI Models Can Run on a Raspberry Pi 4 or 5?
Use measured Raspberry Pi 4 and 5 results to choose local language models by memory, speed, and workload, from tiny LFM2.5 models to 3B and larger options.







