Table of Contents

製品ラベルの32GBは、Qwen 27Bの処理で32GB使えるという意味ではありません。 OS、ランタイム、KVキャッシュ、モデル形式、ドライバ、カード構成が結果を変えます。容量が足りる安価なカードでも、プロンプト処理や設定時間で大きく遅れる場合があります。

2026年10月はVRAMの数字だけでなく、利用可能なメモリと1ドル当たりの処理量を比較してください。

このガイドでは、6ビット品質と大きなコンテキストでQwen 27Bを動かす方法を比較します。公開仕様と報告されたテスト結果を分けて扱います。ある人のtokens-per-secondはGPUの普遍的な性能ではありません。

32GBを目標にする理由

必要なメモリは重みから始まります。密な27Bモデルは生成時に全パラメータを読みます。6ビット量子化では、ランタイムとコンテキスト用の領域を除いて重みが約20.5GBを占めます。

128Kトークンのコンテキストは、さらに大きな領域を必要とします。KVキャッシュの正確なサイズは、モデル構造、キャッシュ精度、バッチ設定、バックエンドで変わります。実用的な約8GBという見積もりでは、OSと推論ランタイムの領域を除く前に、重みとキャッシュで約28.5GBになります。

構成対応内容
24GBディスクリートGPUコンテキストを減らした4ビット重み、または部分オフロード
32GBディスクリートGPU実用的な128Kコンテキスト目標で6ビット重み
16GB GPUを2枚ランタイム余裕が少ない分割モデル
64GB統合メモリGPU割り当て上限の範囲で、より大きなコンテキストとモデル

32GBは容量計算の基準であり、保証ではありません。 モデルを読み込めても、長いプロンプト、大きなバッチ、マルチモーダル入力、別プロセスの領域が不足する場合があります。

この動画は実地の参考資料

次の動画は、ローカルAIで32GBに到達する主な方法を比較します。報告価格、設定の難しさ、実行結果を確認する資料です。この記事では、ハードウェア仕様、モデルのメモリ動作、ソフトウェア対応、総所有コストを使って別の比較を行います。

箱のメモリより利用可能なメモリ

Appleの統合メモリ

Apple siliconはCPUとGPUで共有プールを使います。Appleには32GB統合メモリのMac mini構成がありますが、全容量が専用グラフィック領域ではありません。macOS、アプリ、推論ランタイムにも領域が必要です。

32GBシステムのllama.cppセッションでは、約22,906MB使用可能と報告される場合があります。これは約21.3GiBで、6ビット27Bモデルと大きなKVキャッシュには余裕がほとんどありません。上限はOS、モデルランナー、メモリ圧力、起動設定で変わります。

Apple siliconは静かなシステムに向いています。llama.cppはMetalを主要バックエンドとして扱います。多くの中古データセンターカードにあるドライバや電力の問題も避けられます。代わりに、高性能ディスクリートGPUよりスループットが低く、メモリ余裕も読みづらくなります。

16GBカードを2枚

16GBカード2枚は物理VRAMとして32GBを提供しますが、ランタイムにはデバイスごとのバッファと通信領域が必要です。一方が13.4GB、他方が14.4GB使用と表示しても、残りはコンテキスト用の単純な4GB予約ではありません。

分割方法も重要です。レイヤー分割は異なるモデル層を別のカードに割り当てます。容量は増えますが、カードは順番にモデルを処理します。テンソル分割は同じ層の処理を両カードに置きます。通信は増えますが、両方が直接計算に参加します。

分割方法主な利点主なコスト
レイヤー分割容量を簡単に増やせる一方の処理中に他方が待つことがある
テンソル分割一部の処理で並列計算が増える調整と接続間通信が増える
CPUとGPUのオフロード総VRAMを超えるモデルに対応CPUが頻繁な層を処理すると大幅に遅い

2枚構成は購入前にバックエンドをテストしてください。 PCIe世代、スロット間隔、電源、ドライバ、量子化形式が結果を左右します。

単体カードの選択肢

RTX 5090

NVIDIAはRTX 5090について32GB GDDR7と1,792GB/sのメモリ帯域を示しています。広いCUDA対応、成熟したツール、多数の検証済みフロントエンドがあります。現在のCUDA GPU表ではcompute capability 12.0です。

問題は価格です。新品5090は32GBへの明確な道ですが、購入費はレンタルアクセラレータ数か月分に相当します。最大575Wの総グラフィック電力も必要なので、強い電源と冷却が必要です。

Radeon AI PRO R9700

R9700は32GB級のAMD製品で、高い帯域と、多くの販売例で5090より低い価格を持ちます。価値はランタイムに大きく依存します。標準llama.cppは使える結果を出しますが、同じカードで高速なコミュニティバックエンドが大幅に上回る報告もあります。

GPU比較に速度の列が2つ必要な理由がここにあります。デコード速度は生成トークンを測ります。プリフィル速度は最初の生成前にバックエンドがプロンプトを読む速さです。5万トークンのコードベースでは、デコードが十分でも弱いプリフィルが見えます。

Intel Arc Pro B70

Arc Pro B70は32GBメモリで業務向け処理を狙います。容量と価格の比率は魅力的ですが、CUDA製品よりソフトウェア経路の確認が必要です。標準GGUF対応、修正版ビルド、draft-token設定、バックエンドの成熟度が結果を変えます。

低い購入価格は、動くビルドを探す時間を埋め合わせません。 試行を楽しむ人には作業の一部です。毎日使うワークステーションでは、ドライバとアプリの対応に価値があります。

中古データセンターカード

Tesla V100

中古32GB Tesla V100はカード価格が安く見えるため注目されます。完成したシステムの費用は増えます。パッシブカードには風量、適切なケースやシュラウド、電源アダプタ、十分なPCIe空間を持つホストが必要です。

ソフトウェアの古さも問題です。現在のCUDA GPU表は新しいアーキテクチャを中心にしており、現行のアーキテクチャ表にV100を載せていません。購入前にCUDA版、ドライバ系列、バックエンド、コミュニティフォークを確認してください。

裸のカードではなく、動くV100システムを予算化してください。 680ドル近いカードでも、冷却、アダプタ、ホストで約1,000ドルのプロジェクトになります。人気のローカルAI処理が同じ旧式アクセラレータへ買い手を集めると、中古価格も上がります。

AMD Instinct MI50

MI50は1GB当たりの中古価格が魅力的ですが、現在のソフトウェア対応が大きな制約です。古いROCmスタックやコミュニティ管理のフォークが必要なカードは、一般的なアプリ対応を持つ現行コンシューマカードと同じではありません。

プロンプト処理の差は表示価格より重要です。ある比較ではMI50が約128 tokens/s、新しい32GBカードが約2,652 tokens/sでした。5万トークンのコードベースでは、生成前の処理が遅い経路で数分、速い経路で数秒です。

MI50は用途が限られます。 速度より容量を重視し、ドライバ保守を受け入れる人向けです。プリフィルが重要なコードベース分析には不向きです。

ソフトウェアもGPUの一部

llama.cppはCUDA、HIP、Metal、Vulkan、SYCLなどを対応します。CPUとGPUのハイブリッド推論やマルチGPUも対応します。ベンダーやモデル形式が違えば、同じ機能でも性能は同じになりません。

同じ物理カードでも、次の間に大きな差が出ます。

  • 標準アプリビルド、保守的な設定。
  • 調整済みllama.cppビルド、バックエンド固有のカーネル。
  • コミュニティフォーク、推測的またはマルチトークン予測。
  • 修正済みモデル形式、特定アクセラレータ向け。

比較で報告された値は、標準32GB AMD経路で約27 tokens/s、マルチトークン予測で約46 tokens/s、専用バックエンドではさらに高い値です。これはソフトウェアによる余地を示します。新規インストールの結果を保証しません。

ベンチマークごとに、バックエンド、コミット、モデルファイル、量子化、コンテキスト長、プロンプト長、バッチサイズ、電力状態を記録してください。 これらがなければtokens/sは広告の数字です。

購入ではなくレンタル

高速GPUのレンタルは計算を変えます。RTX 5090の報告価格が1時間0.69ドル近くなら、4,400ドルの購入は、電力、ホスト、保守、再販価値を除いて約6,377時間のレンタルに相当します。

連続レンタルで約9か月、1日8時間なら約2年です。約1,560ドルの2枚構成デスクトップは、同じ料金で約2,261時間です。レンタル5090なら、熱、騒音、ドライバ設定、カード故障も避けられます。

利用形態最初に試す方法
週に数時間ホスト型モデルまたはレンタルGPU
短期プロジェクト5090級を借り、実際の処理を測る
毎日の対話利用バックエンドとコンテキストを試してから購入
夜間に動くエージェント所有ハードウェアを正当化しやすい
安定した負荷の私有データネットワーク分離した所有ハードウェア

モデル、バックエンド、コンテキスト長が不確かな間は先にレンタルしてください。 実測する週末の費用は、間違ったワークステーションより安く済みます。

購入の推奨

16GB RTX 5060 Tiを2枚

16GBカード2枚は、32GBが必要で一般的なチュートリアル、ドライバ、フロントエンドを使いたい人に実用的なCUDA経路です。テンソル分割はモデル形式とバックエンドを確認してから使います。レイヤー分割は簡単ですが、性能を残す場合があります。

この構成には、2つの使用可能なスロット、十分な電力、カード間の風量を持つマザーボードも必要です。プラットフォーム費用を含めると、小さなワークステーションではありません。

32GBカードを1枚

最低のメモリ価格より信頼性、保証、簡単な導入を重視するなら、32GBカードを1枚選びます。R9700とRTX 5090は異なる選択肢です。AMDは容量と価格、NVIDIAはソフトウェアの広さと成熟したCUDA対応を重視します。

中古V100またはMI50

ドライバ検証、冷却作業、バックエンド保守がプロジェクトに含まれる場合だけ中古データセンター製品を選びます。カード価格は予算の最初の行であり、最後の行ではありません。

Apple silicon

最大スループットより静音、低アイドル電力、コンパクトさを重視するなら32GBのApple siliconを選びます。32GBすべてがモデルに使えると考える前に、実際のランナーが示す割り当てを確認してください。

クラウドレンタル

処理がたまにしかなく、モデルが頻繁に変わり、ローカル所有より速い応答を重視するならレンタルを選びます。テスト後はインスタンスを停止してください。アイドル時間は価格の利点をすぐに消します。

比較表を改善する

購入前に各候補について次を記録します。

  • ランタイムのオーバーヘッド後の利用可能なモデルメモリ。
  • 重みの形式と予想モデルサイズ。
  • 目標コンテキストでのKVキャッシュサイズ。
  • 代表的なプロンプトでのプリフィル速度。
  • コンテキストが満杯のときのデコード速度。
  • 結果に必要なバックエンドとドライバのバージョン。
  • 地域の電気料金でのアイドル時と負荷時の電力。
  • ホスト、冷却、アダプタ、ストレージ、保証の費用。
  • 予定使用時間に対するレンタル相当額。

最も有用なテストは実際の処理から作ったプロンプトです。コーディングなら代表的なコードベースを使います。調査なら通常の検索または貼り付け手順の長い文書を使います。最初のトークンまでの時間、プロンプト処理、生成速度、メモリ、品質、電力を測ってください。

最終推奨

摩擦の少ない32GB CUDA構成には16GB RTX 5060 Tiを2枚購入してください。 小さなテストでバックエンドを確認してからテンソル分割を使います。

より整理されたワークステーションには32GBカードを1枚購入してください。 1GB当たりの価格ではなく、選んだランナーに強いソフトウェア経路を選びます。

保守作業を受け入れる場合だけV100またはMI50を使います。 プリフィルが弱い安価なアクセラレータは、長いコードプロンプトには割安ではありません。

利用が不規則なら5090級GPUをレンタルしてください。 レンタルテストは、大きな購入前に実メモリ、速度、コンテキストのデータを提供します。

32GBの問題は「最も安いギガバイトのカードはどれか」ではありません。「十分な利用可能メモリを残し、処理を速く読み、ソフトウェアで動き、定期利用で購入費を回収できるシステムはどれか」です。

参考資料

次の手順

購入前に代表的なプロンプトで表を埋めてください。最初のトークンまでの時間、プロンプト処理、デコード、メモリ、電力、プラットフォーム総費用を比較します。短期プロジェクトなら先にレンタルし、測定結果を購入判断と一緒に保存します。