土曜日, 10月 10, 2026

エージェント時代のAIコスト管理:2026年秋、トークン課金で何が変わったか

AIの単価は下がっているのに、請求額は膨らむ。2026年に入り、LLMのトークン利用料をめぐってこうした声が目立つようになりました。何が起きているのかを、公式発表と調査資料に当たって整理します。

結論を先に示します。(1) 問題の本質は単価の高さではなく、エージェント型の利用でタスク当たりのトークン量が増え、その変動リスクが利用者側に移ったことです。(2) 主要ベンダーは定額の席課金を全面廃止したのではなく、定額枠に利用量課金を併設・分離する方向へ動いています。(3) 評価の物差しは「100万トークン当たり単価」から「成功タスク当たり総費用」へ移すのが妥当です。

本記事は2026年10月10日時点の公開情報に基づきます。料金は頻繁に改定されるため、契約前に各社の公式ページで再確認してください。Gartner、Goldman Sachsなどの数値は予測であり、確定した事実ではありません。筆者の見通しは、その旨を明記して区別しています。

1. 単価は下がり、総額は増える:二つの力の綱引き

Gartnerは2026年3月25日、1兆パラメータ級LLMの推論にかかるコストが、GenAI提供者にとって2030年に2025年比で90%超下がると予測しました。ただしこれは提供者側のコストの話です。同じ発表は、トークン単価の低下が企業顧客に全額は転嫁されないこと、エージェント型モデルは標準的なチャットボットの5〜30倍のトークンをタスクごとに要すること、消費の伸びが単価の下落を上回るため全体の推論コストは上がる見通しであることを述べています。

2026年8月17日のGartnerの予測では、エージェント・ワークフロー1件当たりの推論コストが2028年までに5倍超になるとされています。Goldman Sachs Researchは、2026〜2030年にトークン消費が24倍になると予測しています。AMDは過去2年で月間トークン利用量が約158倍になったとの見方を示しましたが、発言主体や母集団の記述が媒体によって揺れているため、世界全体の測定値ではなくAMDの推計として受け止めるのが安全です。

2. 従量課金への移行:何がどこまで変わったか

2025年末から2026年秋にかけて、主要ベンダーは相次いで定額枠の縮小や分離に動きました。ただし内容はベンダーごとに異なり、「そろって従量課金へ移った」と一括りにはできません。

ベンダー 変更の中身 時期 性格
GitHub Copilot プレミアムリクエスト(PRU)を、入力・出力・キャッシュのトークン量に基づく「GitHub AI Credits」に置き換え。席料(Pro $10、Business $19、Enterprise $39)は維持し、クレジットを内包 2026年4月27日発表、6月1日から適用 全プランが席料+クレジット従量のハイブリッドに
Microsoft Copilot 日常利用は1ユーザー固定料金(USL)を維持。Cowork、Code、Autopilot、フロンティアモデルなどの高度機能はCopilot Credits(利用量課金、UBB)に分離。クレジット単価は$0.01(Microsoftの公式ガイド) 2026年9月25日発表。CSP経由の新規Copilot Businessは、2026年12月1日からUBBが既定でオン(旧予定は11月2日) 固定と従量を分離。既定の上限は月4,000クレジット/ユーザーで、管理者が変更可能
Anthropic(Enterprise) 契約更新時に利用量ベースへ移行。2026年2月に月$20の単一席を導入。席料は利用枠を含まず、全トークンを標準APIレートで上乗せ請求(The Registerの報道) 2025年11月から更新時に順次、2026年2月に単一席 席料は入場料にとどまり、消費は従量
OpenAI Enterprise向けにトークン連動のレートカードを公開し、Codex・ChatGPT Workなどをクレジット課金に(OpenAIヘルプセンター) 2026年(開始日は資料により異なる) 対象契約・機能ごとに適用範囲が異なる

出典:GitHub Blog(2026年4月27日)、Microsoft Community Hub、Microsoft Partner Center(2026年10月1日の告知)、The Register(2026年4月16日)、OpenAIヘルプセンター。

Microsoftの12月1日からのUBB既定オンは、当初の11月2日から延期されています。対象外とされる国・地域の一覧(豪、独、仏、伊、韓など11市場)に日本は挙がっていませんが、提供は順次展開とされています。

3. 単価表だけでは見えない「実質コスト」

フロンティア帯の中位モデルは、100万トークン当たり入力$2・出力$10前後に集まりつつあります。一方で、表の単価に現れない条件が実質コストを動かします。

モデル 入力 出力 主な条件 時点・出典
Claude Fable 5.1 $10 $50 最上位 2026年10月、Anthropic公式
Claude Opus 5.5 $4 $20 2026年9月22日発表 2026年10月、Anthropic公式
Claude Sonnet 5.5 $2 $10 標準ティア 2026年10月、Anthropic公式
Claude Haiku 5.5 $0.10(10万トークン超は$0.50) $0.50(10万トークン超は$2.50) 10万トークンを超えると単価が5倍になる段階制。キャッシュ読取も$0.01から$0.05へ上がる 2026年10月、Anthropic公式
GPT-6.1 Sol $2 $10 272K超のプロンプトは入力2倍・出力1.5倍(リクエスト全体に適用)。キャッシュ入力は$0.10。Batch/Flexは50%引き。地域処理は10%割増 2026年10月確認、OpenAI公式モデルページ
GPT-5.6 Sol $4 $20 期間限定の価格。期限は少なくとも2026年11月21日まで 2026年8月21日〜、OpenAI公式
GPT-6 Luna $0.10 $0.50 最安帯。GPT-5.6 Lunaとは別世代 2026年10月、OpenAI公式
Gemini 3.8 Flash $0.75 → $1.50 $3.75 → $7.50 2026年12月31日までと2027年1月1日からで倍額。出力は思考トークンを含む。Batch/Flexは50%引き。3.6 Flashも同日に倍額 2026年10月10日確認、Google公式
Sakana Namazu $0.95 $4.00 キャッシュ$0.15。公式ページは円額を参考換算とし、実請求は米ドルと記載。法人向けの円建て対応は報道があるが、契約時に要確認 2026年8月公開、Sakana AI公式
PLaMo API 60円 250円 円建て(100万トークン当たり) 2026年10月7日、PFN技術ブログの記載

価格はいずれも100万トークン当たり、標準ティア。GPT-5.6 Lunaは2026年7月30日の80%値下げ後で$0.20/$1.20(OpenAI公式)であり、上表のGPT-6 Lunaとは価格が異なります。

NTTのtsuzumi 2、富士通のTakane、NECのcotomi、ソフトバンクのSarashinaなどは、2026年10月時点で公開単価を確認できませんでした。

3-1. 実質コストを動かす5つの要因

  • トークナイザーの違い。Anthropicの公式文書によると、Claude 4.7以降の新しいトークナイザーは同じテキストで約30%多いトークンを生成します(内容により幅あり)。単価の変更ではなく計数方式の変更ですが、実効価格を押し上げ得ます。日本語では差がさらに大きくなり得ます。PFNは自社ベンチマークの翻訳出力50件ずつで、日本語1,000文字当たりのトークン数がPLaMoで447、Claude Fable 5.1で893、GPT-6 Astraで744だったと報告しています。これは自社評価であり、一般化はできません。
  • 長文の割増。Haiku 5.5は10万トークン超で単価が上がり、GPT-6.1 Solは272K超でリクエスト全体に割増がかかります。
  • 地域指定。OpenAIは地域処理(データレジデンシー)に10%の割増を設けています。国内処理を要件にする場合は、その分を見積もりに入れる必要があります。
  • 為替。主要APIはドル建てで、消費量と為替の二重の変動を受けます。
  • 導入価格の期限。Gemini 3.8 Flashは2027年1月1日に倍額、GPT-5.6 Solの期間限定価格も2026年11月以降に終わる可能性があります。期限付き価格を前提にした試算は2027年にずれます。

4. 企業では何が起きているか

EYの調査(米国のSVP以上534人、2026年4月24日〜5月17日実施)では、AIに投資する企業の上級幹部の82%がトークン使用量とコストを懸念していました。トークン課金型のツールを使う組織の98%が方針を再検討しており、明確な予算ガードレールを設けて監視している組織は64%でした。

個別事例として、Uberは2026年のClaude Code予算を4月までに使い切ったと報じられています。Bloombergは2026年6月2日、Uberが全従業員にAIコーディングツール1つ当たり月1,500ドルのトークン支出上限を設けたと伝えました。これはUberなど一部企業の事例であり、企業一般の傾向と断定はできません。決済データに基づくRamp AI Index(7万社超)では、AI支出が上位1%の企業の従業員1人当たり中央値が、2026年7月に7,400ドルでした。

提供者側の事情も背景にあります。FTが入手した非公開資料に基づく報道によると、OpenAIは2026〜2030年に累計2,780億ドルのフリーキャッシュフロー赤字を見込み、計算資源・インフラ支出は8,560億ドルとされています。Bloombergによれば年換算売上は9月末で約500億ドルで、年末には700億ドル以上を見込んでいます。巨額の先行投資は、定額枠の設計を見直す動きを促す一因になり得ると筆者は見ています(筆者の推定)。

5. 日本の公共分野:源内は2027年度に有償調達へ

デジタル庁のガバメントAI「源内」は、2026年5月から全府省庁の約18万人を対象に大規模実証を進めています。国産LLMは2026年8月頃〜2027年3月に試用・評価され、2027年度から有償の政府調達に移る予定です。2026年度の試用は無償が前提でした。契約先はNTTデータ、ソフトバンク、NEC、富士通、PFNの5社です。

ITmediaの報道によると、2027年度向けの公募では料金体系の提示とガバメントクラウド上での動作が求められます。初回公募で必須とされた機密性2情報への対応が次回も同じ条件で維持されるかは、正式な公募要領を待つ必要があります。職員の利用量に比例して費用が増える以上、2027年度以降は利用量の見積もりと上限管理が調達の論点になるはずです(筆者の推定)。

6. コストを抑える手立て

  • キャッシュ。GPT-6.1 Solのキャッシュ入力は通常入力の5%($0.10)です。ただし書き込みは1.25倍かかるため、再利用が少ない用途では逆効果になります。
  • バッチ・Flex。GPT-6.1 SolもGemini 3.8 Flashも、BatchとFlexは標準の50%引きです。非同期で構わない業務に限られます。
  • モデルルーティング。Gartnerは、定型・高頻度の業務は小型やドメイン特化のモデルへ回し、フロンティアモデルは付加価値の高い複雑な推論に絞るよう推奨しています。EYは社内AIルーター、研修、ガバナンスを組み合わせ、4月以降トークン消費を最大60%削減したと説明しています(Business Insider、2026年7月30日)。ルーター単独の効果ではありません。
  • 上限と可視化。Microsoftは新規Copilot Businessに月4,000クレジット/ユーザーの既定上限を置き、Uberはツール当たり月1,500ドルとしました。上限に達すると業務が止まるため、超過時の挙動の設計とセットで考える必要があります。
  • 評価指標の統一。モデルごとにトークナイザー、思考トークン、ツール呼び出し回数が異なります。比較は100万トークン単価ではなく、成功タスク当たりの総費用で行うのが妥当です。Anthropic自身も新世代の比較ではその見方を勧めています。

7. 今後の見通し(筆者の推定)

  • 単価は下落基調が続く。根拠はGartnerの2030年までの予測と、2026年夏のOpenAIの値下げ(GPT-5.6 Lunaの80%値下げなど)です。
  • 総支出は増え続ける。Gartnerのワークフロー当たり5倍超、Goldman Sachsの24倍という予測が正しければ、単価の下落だけでは吸収できません。
  • 席+従量のハイブリッドが標準になる。GitHub、Microsoft、Anthropic、OpenAIがすでに形は違っても同じ方向にあります。
  • 導入価格は順次終わる。Gemini 3.8 Flashの2027年1月の倍額化が先例になる可能性があります。

単価の安さだけで導入を決めると、エージェント化が進んだ段階で請求が想定を超える恐れがあります。導入前に、成功タスク当たりの費用、キャッシュの命中率、モデル別の利用比率を見える形にしておくことが、変動リスクを管理する第一歩です。

主な出典

0 件のコメント: