ローカルAIのプライバシー境界: コンピューターに残るものと残らないもの

Table of Contents
ローカルAIはデータ境界を小さくします。 ローカルランタイムで処理するプロンプトは、モデル、ツール、ログ、ネットワーク経路がローカルに保たれる場合、端末内に残ります。ローカルGPUがあっても、コンピューターが密閉されたシステムになるわけではありません。
モデルランタイム、ツールプラグイン、ブラウザー拡張、リモートアクセス、公開API、モデルのダウンロードは、依然としてリスクを左右します。コストも重要です。電力料金はホスト型のトークン料金を下回る可能性がありますが、ハードウェア所有費を含めた損益分岐点は遠くなる場合があります。
このガイドでは、まずプライバシー境界を整理します。次に、現在のベンダー価格、明示した電力の仮定、提供された動画の報告値を使ってコストを確認します。
このローカルとホスト型のコスト比較は、以下の式の前提を示します。同じモデルファイルとランタイムを自分のハードウェアでテストせず、スループット値をそのまま使わないでください。
動画は2分31秒の実行時間を報告しています。視聴ページでタイトルと実行時間を確認しました。ハードウェアテストは再現していないため、報告された速度はソースによる測定値です。
短い答え
- 管理されたデータ経路にはローカル推論を選びます。 モデルサーバーを端末内に置き、loopbackにバインドし、ツールのアクセスを制限します。
- 時々行う作業にはホスト型推論を選びます。 作業量が少ない場合や、希望するモデルがシステムに収まらない場合は、ハードウェア購入を避けます。
- ローカルコストを2つの数字として扱います。 稼働1時間あたりの電力と、ハードウェア所有費を分けます。
- プライバシーをシステムの性質として扱います。 プラグインがファイルをアップロードしたり、ローカルAPIが全ネットワークインターフェースで待ち受けたりすると、プライベートモデルの利点は失われます。
機密テキストをワークステーションや分離ネットワーク内に保つ必要がある場合、ローカル推論が役立ちます。オフライン運用、固定したモデルバージョン、プロバイダーの割り当てに左右されない予測可能なアクセスにも役立ちます。
これらの利点は、より良い回答を証明しません。ホスト型モデルの方がタスクに合い、速く終わり、保守が少なくて済む場合があります。ハードウェアを買う前に作業負荷を測定してください。
データ経路を追跡する
リクエストに関係する全コンポーネントを記録します。モデル名だけでは、データがどこを通るか分かりません。
| コンポーネント | プライバシーの質問 | 集める証拠 |
|---|---|---|
| ローカルモデルサーバー | プロンプトはホスト内に残るか | プロセス設定、待受アドレス、外向き通信 |
| クラウドモデル | どのテキスト、ファイル、ツール結果がホストから出るか | APIエンドポイント、プロバイダー規約、リクエストログ、アカウント設定 |
| ローカルアプリ内のクラウドモード | 選択したモデルは端末上で動くか | モデル識別子、プロバイダー表示、ネットワーク接続 |
| ツールプラグイン | モデルはファイル、シェル出力、ブラウザー内容を受け取るか | ツール一覧、権限、取得したリクエストデータ |
| モデルのダウンロード | どのコードと重みがホストに入るか | ソースリポジトリ、ライセンス、リリースチェックサム、ダウンロード先 |
| ローカルログ | プロンプトとツール結果はどこに残るか | ランタイムログ、シェル履歴、クラッシュレポート、バックアップ範囲 |
ローカルモデルはプロンプト経路から1つのプロバイダーを除きます。 経路の残りを確認する必要はあります。
ローカルでも初期状態ではプライベートではない
Ollamaのプライバシーポリシー は、モデルがローカルで動く場合、Ollamaはプロンプトやデータを見ないと説明しています。ポリシーはローカル動作とクラウドホスト型モデルも分けています。同じアプリが両方のモードを起動しても、クラウドモデルにはサービス境界が生じます。
llama.cppのサーバー文書
では、ローカルサーバーは既定で127.0.0.1:8080を待ち受けます。Docker例には--host 0.0.0.0もあり、全インターフェースにサービスを公開します。広いバインドアドレスはアクセス境界を変えます。
機密テキストを送る前に、待受アドレスを確認します。
lsof -nP -iTCP -sTCP:LISTEN | rg 'ollama|llama|8080|11434'
通常、127.0.0.1またはlocalhostは同じホストからのアクセスに限定します。LANアドレスや0.0.0.0にはファイアウォール規則と認証計画が必要です。両方をテストする前に、モデルエンドポイントをネットワークへ公開しないでください。
選択したモデル名も確認します。Ollamaのクラウド文書はクラウドモデルを別のサービス経路として説明しています。ローカルのインターフェースは、ローカル実行の証明になりません。
OllamaのFAQ
にはローカル専用モードが記載されています。~/.ollama/server.jsonにdisable_ollama_cloudを設定するか、サービスを再起動する前にOLLAMA_NO_CLOUD=1を設定します。これにより、選択したランタイムからOllamaのクラウドモデルとウェブ検索が除かれます。ホスト上の他のアプリ、ブラウザツール、プラグイン、ネットワークアクセスは制限しません。
{
"disable_ollama_cloud": true
}
再起動後に設定を確認します。ローカル専用ランタイムは1つの経路を狭めます。プライベートなホストを確立するものではありません。
ホスト型コストを数える
トークン価格は入力と出力を分けます。 AnthropicはClaude Haiku 5.5について、10万トークンまでのプロンプトで入力100万トークンあたり0.10ドル、出力100万トークンあたり0.50ドルと記載しています 。10万トークンを超えるプロンプトには、記載された高い料金が適用されます。
OpenAIのトークンガイド は、単語数とトークン数が同じではない理由を説明しています。入力、出力、キャッシュ入力、推論トークンも分けています。単語数の推定ではなく、プロバイダーの使用量フィールドを使います。
単純な比較では、生成1百万トークンと入力1百万トークンを別々の作業量として使います。コーディングエージェントは繰り返しコンテキストを送り、回答は小さくなることが多いため、単一の合計トークン数では費用の内訳が隠れます。
ローカル電力を計算する
NVIDIAのRTX 5070発売発表 は、開始価格を549ドルとしました。 NVIDIAのRTX 5070ファミリーページ は、Founders Editionリファレンス設計について12GBメモリと250Wの総グラフィックス電力を記載しています。NVIDIA製品ページは現在も549ドルを表示し、この確認時には在庫切れでした。
GPUの電力値はシステム全体の電力ではありません。PCには電力計を使います。以下の例は、GPU、プロセッサー、メモリ、ストレージ、ファン、電源損失を含むシステム全体400Wを仮定します。これは算術上の仮定であり、測定値ではありません。
米国エネルギー情報局の予測 は、2026年の平均家庭用電気料金として1キロワット時18.2セントを使っています。電力会社の料金で結果は変わります。
生成出力には次の式を使います。
local cost per 1M output tokens =
(whole_system_watts / 1,000)
× (1,000,000 / output_tokens_per_second / 3,600)
× electricity_price_per_kWh
400W、1キロワット時0.182ドルでは、システムは稼働1時間あたり0.0728ドルです。
| 出力速度 | 1Mトークンの時間 | 1Mトークンの電力コスト |
|---|---|---|
| 毎秒20トークン | 13時間53分 | 1.01ドル |
| 毎秒50トークン | 5時間33分 | 0.40ドル |
| 毎秒94トークン | 2時間57分 | 0.22ドル |
毎秒50出力トークンでは、ローカル電力はHaiku 5.5の出力価格0.50ドルを下回ります。毎秒20出力トークンでは上回ります。この仮定での出力速度の境界は毎秒約40トークンです。
入力計算にも同じ式を使います。毎秒2,650入力トークンでは、入力100万トークンに約6分17秒かかり、電力コストは約0.008ドルです。毎秒1,000入力トークンでは、同じ作業は約0.020ドルです。
提供されたトランスクリプトは、RTX 5070の例で毎秒94出力トークン、毎秒2,650入力トークンを報告しています。400Wの仮定では、上の算術はその値と一致します。トランスクリプトには独立したラボ記録、モデルファイルのハッシュ、ランタイムビルド、プロンプト、電力計の読み値がありません。これらの速度は参考結果として扱い、購入保証とは扱わないでください。
ハードウェアが損益分岐点を変える
電力の節約だけではハードウェア費を回収できません。全購入費を、ホスト型出力コストとローカル変動費の差と比較します。
毎秒50出力トークンでは、
$0.50 hosted output price - $0.40 local power = $0.10 saved per 1M tokens
$549 GPU price / $0.10 = about 5.5 billion output tokens
毎秒94出力トークンでは、丸めた節約額は100万トークンあたり約0.28ドルに増えます。549ドルのGPUを回収するには約20億の出力トークンが必要です。どちらの数字もシステムメモリ、ストレージ、マザーボード、電源、冷却、保守、再販価値を含みません。
発売価格は普遍的な購入見積もりではありません。NVIDIAの現在のページは公式価格を在庫なしで表示していました。819ドルの販売価格は、損益分岐モデルに入れる前に別途確認が必要です。実際の請求額と壁コンセントで測った電力を使ってください。
既存ハードウェアは判断を変えます。 ワークステーションに十分なメモリと適切なGPUがすでにある場合、次の作業に対するハードウェア費は埋没費用です。電力、時間、品質、プライバシー、保守を比較します。完全なシステムを買う場合は、完全なシステムとホスト型利用を比較します。
モデル適合性の詳細は、 ローカルAIモデルとGPUコンテキストガイド と 16GB VRAMサイズガイド を読んでください。報告されたローカルコーディングエージェント構成は、 StrataとOpenCodeガイド で確認できます。
ローカルプライバシーが与えるもの
- 短いデータ経路: 推論がローカルなら、プロンプトはモデルプロバイダーに届く必要がありません。
- オフライン運用: ダウンロード済みモデルとローカルランタイムは、テキスト生成にプロバイダーへの接続を必要としません。
- バージョン管理: プロバイダーの自動変更ではなく、モデルファイルとランタイムのバージョンを選べます。
- 利用制御: ハードウェア所有費と電力を計上した後、ローカル推論ではリクエストごとのクラウド課金を避けられます。
- ネットワークポリシー制御: ファイアウォールとホスト制御が、モデルエンドポイントに到達できる人を決めます。
これらの利点は、ソースコード、顧客記録、未公開設計、個人的なメモ、接続を切った環境での作業に特に重要です。ローカル推論でも、ディスク暗号化、ホスト更新、アカウント分離、制限したツールが必要です。
ローカルプライバシーが与えないもの
- 品質保証: 小型または量子化モデルは、実際の受け入れ基準でテストが必要です。
- サプライチェーン保証: モデルファイル、ランタイム、プラグイン、コンテナイメージには、信頼できるソースと完全性確認が必要です。
- クリーンなホスト: マルウェア、ブラウザー拡張、バックアップ、クラッシュレポーター、リモート管理は、ホストデータを引き続き見ます。
- 安全なネットワークエンドポイント: 全インターフェースにバインドしたサーバーは、防御すべき新しいサービスを作ります。
- 無料のシステム: 電気、ストレージ、冷却、ハードウェアの消耗、保守にはコストがあります。
Strataローカルコーディングエージェントガイド は、システムメモリ、コンテキスト、ツールアクセス、ランタイム設定を評価に含める理由を示します。GPUメモリだけでは、プライバシーや性能の境界は決まりません。
適切な境界を選ぶ
| 状況 | 最初に選ぶもの | 理由 |
|---|---|---|
| 機密文書と既存の互換PC | ローカル推論 | 管理されたホスト内にプロンプトを保ち、新たなハードウェア費を避ける |
| 時々行う一般的な文章作成 | ホスト型APIまたはチャットサービス | 小さな作業量に支払い、保守を避ける |
| 最先端モデルまたは特殊なクラウドツール | ホスト型サービス | 必要なモデルやツールがローカルホストにない |
| 検証済みローカルモデルで大きな定常量 | ローカルまたはハイブリッド | 電力、品質、サポート時間、プロバイダー価格を比較する |
| 混在した作業 | ハイブリッドルーティング | 機密作業をローカルに保ち、承認済みの一般作業をホスト型モデルへ送る |
ハイブリッドルーティングには明確な分類規則が必要です。 データをローカル限定、ホスト処理承認済み、審査まで禁止に分類します。規則の適用をモデル名やアプリのアイコンに任せないでください。
信頼する前に確認する
- モデル経路を記録します。 モデル識別子、ランタイム、バージョン、ダウンロード元を記録します。
- バインドアドレスを確認します。 広い経路に文書化された必要性がない限り、サーバーがloopbackで待ち受けることを確認します。
- 全ツールを一覧化します。 ファイル、シェル、ブラウザー、ネットワーク、プラグインへのアクセスを確認します。
- 永続化を調べます。 プロンプトログ、ツール出力、クラッシュレポート、バックアップ、共有モデルディレクトリを探します。
- ネットワーク動作をテストします。 代表的なプロンプトを使う機密テスト中に接続を観察します。
- システムを測定します。 壁コンセントの電力、出力速度、入力速度、コンテキスト長、再試行を記録します。
- 受け入れた作業をテストします。 1秒あたりのトークン数だけでなく、完了したタスクとレビュー作業を比較します。
ローカルAIとChatGPTの比較ガイド は、モデル性能のトレードオフを扱います。このプライバシーチェックリストを品質テストと一緒に使ってください。
参考資料
- 動画、ローカルAIは価値があるか。Claude Haiku 5.5と費用を比較
- NVIDIA Blackwell GeForce RTX 50 Series発売発表
- NVIDIA GeForce RTX 5070ファミリー仕様
- NVIDIA GeForce RTX 5070製品ページ
- 米国エネルギー情報局、2026年10月短期エネルギー見通し
- Anthropic Claude Haiku 5.5
- Anthropic Claudeプラットフォーム価格
- OpenAI、トークンの理解とカウント
- Ollamaプライバシーポリシー
- llama.cppサーバー文書







