Table of Contents

ローカルAIはデータ境界を小さくします。 ローカルランタイムで処理するプロンプトは、モデル、ツール、ログ、ネットワーク経路がローカルに保たれる場合、端末内に残ります。ローカルGPUがあっても、コンピューターが密閉されたシステムになるわけではありません。

モデルランタイム、ツールプラグイン、ブラウザー拡張、リモートアクセス、公開API、モデルのダウンロードは、依然としてリスクを左右します。コストも重要です。電力料金はホスト型のトークン料金を下回る可能性がありますが、ハードウェア所有費を含めた損益分岐点は遠くなる場合があります。

このガイドでは、まずプライバシー境界を整理します。次に、現在のベンダー価格、明示した電力の仮定、提供された動画の報告値を使ってコストを確認します。

このローカルとホスト型のコスト比較は、以下の式の前提を示します。同じモデルファイルとランタイムを自分のハードウェアでテストせず、スループット値をそのまま使わないでください。

動画は2分31秒の実行時間を報告しています。視聴ページでタイトルと実行時間を確認しました。ハードウェアテストは再現していないため、報告された速度はソースによる測定値です。

短い答え

  • 管理されたデータ経路にはローカル推論を選びます。 モデルサーバーを端末内に置き、loopbackにバインドし、ツールのアクセスを制限します。
  • 時々行う作業にはホスト型推論を選びます。 作業量が少ない場合や、希望するモデルがシステムに収まらない場合は、ハードウェア購入を避けます。
  • ローカルコストを2つの数字として扱います。 稼働1時間あたりの電力と、ハードウェア所有費を分けます。
  • プライバシーをシステムの性質として扱います。 プラグインがファイルをアップロードしたり、ローカルAPIが全ネットワークインターフェースで待ち受けたりすると、プライベートモデルの利点は失われます。

機密テキストをワークステーションや分離ネットワーク内に保つ必要がある場合、ローカル推論が役立ちます。オフライン運用、固定したモデルバージョン、プロバイダーの割り当てに左右されない予測可能なアクセスにも役立ちます。

これらの利点は、より良い回答を証明しません。ホスト型モデルの方がタスクに合い、速く終わり、保守が少なくて済む場合があります。ハードウェアを買う前に作業負荷を測定してください。

データ経路を追跡する

リクエストに関係する全コンポーネントを記録します。モデル名だけでは、データがどこを通るか分かりません。

コンポーネントプライバシーの質問集める証拠
ローカルモデルサーバープロンプトはホスト内に残るかプロセス設定、待受アドレス、外向き通信
クラウドモデルどのテキスト、ファイル、ツール結果がホストから出るかAPIエンドポイント、プロバイダー規約、リクエストログ、アカウント設定
ローカルアプリ内のクラウドモード選択したモデルは端末上で動くかモデル識別子、プロバイダー表示、ネットワーク接続
ツールプラグインモデルはファイル、シェル出力、ブラウザー内容を受け取るかツール一覧、権限、取得したリクエストデータ
モデルのダウンロードどのコードと重みがホストに入るかソースリポジトリ、ライセンス、リリースチェックサム、ダウンロード先
ローカルログプロンプトとツール結果はどこに残るかランタイムログ、シェル履歴、クラッシュレポート、バックアップ範囲

ローカルモデルはプロンプト経路から1つのプロバイダーを除きます。 経路の残りを確認する必要はあります。

ローカルでも初期状態ではプライベートではない

Ollamaのプライバシーポリシー は、モデルがローカルで動く場合、Ollamaはプロンプトやデータを見ないと説明しています。ポリシーはローカル動作とクラウドホスト型モデルも分けています。同じアプリが両方のモードを起動しても、クラウドモデルにはサービス境界が生じます。

llama.cppのサーバー文書 では、ローカルサーバーは既定で127.0.0.1:8080を待ち受けます。Docker例には--host 0.0.0.0もあり、全インターフェースにサービスを公開します。広いバインドアドレスはアクセス境界を変えます。

機密テキストを送る前に、待受アドレスを確認します。

lsof -nP -iTCP -sTCP:LISTEN | rg 'ollama|llama|8080|11434'

通常、127.0.0.1またはlocalhostは同じホストからのアクセスに限定します。LANアドレスや0.0.0.0にはファイアウォール規則と認証計画が必要です。両方をテストする前に、モデルエンドポイントをネットワークへ公開しないでください。

選択したモデル名も確認します。Ollamaのクラウド文書はクラウドモデルを別のサービス経路として説明しています。ローカルのインターフェースは、ローカル実行の証明になりません。

OllamaのFAQ にはローカル専用モードが記載されています。~/.ollama/server.jsonにdisable_ollama_cloudを設定するか、サービスを再起動する前にOLLAMA_NO_CLOUD=1を設定します。これにより、選択したランタイムからOllamaのクラウドモデルとウェブ検索が除かれます。ホスト上の他のアプリ、ブラウザツール、プラグイン、ネットワークアクセスは制限しません。

{
  "disable_ollama_cloud": true
}

再起動後に設定を確認します。ローカル専用ランタイムは1つの経路を狭めます。プライベートなホストを確立するものではありません。

ホスト型コストを数える

トークン価格は入力と出力を分けます。 AnthropicはClaude Haiku 5.5について、10万トークンまでのプロンプトで入力100万トークンあたり0.10ドル、出力100万トークンあたり0.50ドルと記載しています 。10万トークンを超えるプロンプトには、記載された高い料金が適用されます。

OpenAIのトークンガイド は、単語数とトークン数が同じではない理由を説明しています。入力、出力、キャッシュ入力、推論トークンも分けています。単語数の推定ではなく、プロバイダーの使用量フィールドを使います。

単純な比較では、生成1百万トークンと入力1百万トークンを別々の作業量として使います。コーディングエージェントは繰り返しコンテキストを送り、回答は小さくなることが多いため、単一の合計トークン数では費用の内訳が隠れます。

ローカル電力を計算する

NVIDIAのRTX 5070発売発表 は、開始価格を549ドルとしました。 NVIDIAのRTX 5070ファミリーページ は、Founders Editionリファレンス設計について12GBメモリと250Wの総グラフィックス電力を記載しています。NVIDIA製品ページは現在も549ドルを表示し、この確認時には在庫切れでした。

GPUの電力値はシステム全体の電力ではありません。PCには電力計を使います。以下の例は、GPU、プロセッサー、メモリ、ストレージ、ファン、電源損失を含むシステム全体400Wを仮定します。これは算術上の仮定であり、測定値ではありません。

米国エネルギー情報局の予測 は、2026年の平均家庭用電気料金として1キロワット時18.2セントを使っています。電力会社の料金で結果は変わります。

生成出力には次の式を使います。

local cost per 1M output tokens =
(whole_system_watts / 1,000)
× (1,000,000 / output_tokens_per_second / 3,600)
× electricity_price_per_kWh

400W、1キロワット時0.182ドルでは、システムは稼働1時間あたり0.0728ドルです。

出力速度1Mトークンの時間1Mトークンの電力コスト
毎秒20トークン13時間53分1.01ドル
毎秒50トークン5時間33分0.40ドル
毎秒94トークン2時間57分0.22ドル

毎秒50出力トークンでは、ローカル電力はHaiku 5.5の出力価格0.50ドルを下回ります。毎秒20出力トークンでは上回ります。この仮定での出力速度の境界は毎秒約40トークンです。

入力計算にも同じ式を使います。毎秒2,650入力トークンでは、入力100万トークンに約6分17秒かかり、電力コストは約0.008ドルです。毎秒1,000入力トークンでは、同じ作業は約0.020ドルです。

提供されたトランスクリプトは、RTX 5070の例で毎秒94出力トークン、毎秒2,650入力トークンを報告しています。400Wの仮定では、上の算術はその値と一致します。トランスクリプトには独立したラボ記録、モデルファイルのハッシュ、ランタイムビルド、プロンプト、電力計の読み値がありません。これらの速度は参考結果として扱い、購入保証とは扱わないでください。

ハードウェアが損益分岐点を変える

電力の節約だけではハードウェア費を回収できません。全購入費を、ホスト型出力コストとローカル変動費の差と比較します。

毎秒50出力トークンでは、

$0.50 hosted output price - $0.40 local power = $0.10 saved per 1M tokens
$549 GPU price / $0.10 = about 5.5 billion output tokens

毎秒94出力トークンでは、丸めた節約額は100万トークンあたり約0.28ドルに増えます。549ドルのGPUを回収するには約20億の出力トークンが必要です。どちらの数字もシステムメモリ、ストレージ、マザーボード、電源、冷却、保守、再販価値を含みません。

発売価格は普遍的な購入見積もりではありません。NVIDIAの現在のページは公式価格を在庫なしで表示していました。819ドルの販売価格は、損益分岐モデルに入れる前に別途確認が必要です。実際の請求額と壁コンセントで測った電力を使ってください。

既存ハードウェアは判断を変えます。 ワークステーションに十分なメモリと適切なGPUがすでにある場合、次の作業に対するハードウェア費は埋没費用です。電力、時間、品質、プライバシー、保守を比較します。完全なシステムを買う場合は、完全なシステムとホスト型利用を比較します。

モデル適合性の詳細は、 ローカルAIモデルとGPUコンテキストガイド と 16GB VRAMサイズガイド を読んでください。報告されたローカルコーディングエージェント構成は、 StrataとOpenCodeガイド で確認できます。

ローカルプライバシーが与えるもの

  • 短いデータ経路: 推論がローカルなら、プロンプトはモデルプロバイダーに届く必要がありません。
  • オフライン運用: ダウンロード済みモデルとローカルランタイムは、テキスト生成にプロバイダーへの接続を必要としません。
  • バージョン管理: プロバイダーの自動変更ではなく、モデルファイルとランタイムのバージョンを選べます。
  • 利用制御: ハードウェア所有費と電力を計上した後、ローカル推論ではリクエストごとのクラウド課金を避けられます。
  • ネットワークポリシー制御: ファイアウォールとホスト制御が、モデルエンドポイントに到達できる人を決めます。

これらの利点は、ソースコード、顧客記録、未公開設計、個人的なメモ、接続を切った環境での作業に特に重要です。ローカル推論でも、ディスク暗号化、ホスト更新、アカウント分離、制限したツールが必要です。

ローカルプライバシーが与えないもの

  • 品質保証: 小型または量子化モデルは、実際の受け入れ基準でテストが必要です。
  • サプライチェーン保証: モデルファイル、ランタイム、プラグイン、コンテナイメージには、信頼できるソースと完全性確認が必要です。
  • クリーンなホスト: マルウェア、ブラウザー拡張、バックアップ、クラッシュレポーター、リモート管理は、ホストデータを引き続き見ます。
  • 安全なネットワークエンドポイント: 全インターフェースにバインドしたサーバーは、防御すべき新しいサービスを作ります。
  • 無料のシステム: 電気、ストレージ、冷却、ハードウェアの消耗、保守にはコストがあります。

Strataローカルコーディングエージェントガイド は、システムメモリ、コンテキスト、ツールアクセス、ランタイム設定を評価に含める理由を示します。GPUメモリだけでは、プライバシーや性能の境界は決まりません。

適切な境界を選ぶ

状況最初に選ぶもの理由
機密文書と既存の互換PCローカル推論管理されたホスト内にプロンプトを保ち、新たなハードウェア費を避ける
時々行う一般的な文章作成ホスト型APIまたはチャットサービス小さな作業量に支払い、保守を避ける
最先端モデルまたは特殊なクラウドツールホスト型サービス必要なモデルやツールがローカルホストにない
検証済みローカルモデルで大きな定常量ローカルまたはハイブリッド電力、品質、サポート時間、プロバイダー価格を比較する
混在した作業ハイブリッドルーティング機密作業をローカルに保ち、承認済みの一般作業をホスト型モデルへ送る

ハイブリッドルーティングには明確な分類規則が必要です。 データをローカル限定、ホスト処理承認済み、審査まで禁止に分類します。規則の適用をモデル名やアプリのアイコンに任せないでください。

信頼する前に確認する

  1. モデル経路を記録します。 モデル識別子、ランタイム、バージョン、ダウンロード元を記録します。
  2. バインドアドレスを確認します。 広い経路に文書化された必要性がない限り、サーバーがloopbackで待ち受けることを確認します。
  3. 全ツールを一覧化します。 ファイル、シェル、ブラウザー、ネットワーク、プラグインへのアクセスを確認します。
  4. 永続化を調べます。 プロンプトログ、ツール出力、クラッシュレポート、バックアップ、共有モデルディレクトリを探します。
  5. ネットワーク動作をテストします。 代表的なプロンプトを使う機密テスト中に接続を観察します。
  6. システムを測定します。 壁コンセントの電力、出力速度、入力速度、コンテキスト長、再試行を記録します。
  7. 受け入れた作業をテストします。 1秒あたりのトークン数だけでなく、完了したタスクとレビュー作業を比較します。

ローカルAIとChatGPTの比較ガイド は、モデル性能のトレードオフを扱います。このプライバシーチェックリストを品質テストと一緒に使ってください。

参考資料