日曜日, 9月 27, 2026

【2026年9月版】個人向けAIサービス比較:無料〜月3,000円でどれを選ぶか

個人向けのAIサービスは、2026年に入って料金体系が大きく動きました。ChatGPTは日本向けの新規契約が円建て・税込になり、Claudeは日本の利用者への消費税の上乗せが始まり、Googleは下位プランを大幅に値下げしました。無料で使える範囲も各社で広がり、「どれか1つにお金を払うなら何か」という問いの答えは、半年前とは違ってきています。

本記事では、無料プランと月額3,000円前後までの有料プランに絞り、OpenAI、Anthropic、Microsoft、楽天に加えて、Google、Perplexity、xAI、LINEヤフー、通信キャリアの特典など、日本で契約・利用できるサービスを比較します。あわせて、9月に米国で公開されて話題になっているMetaのAIエージェント「Muse(ミューズ)」や、10月に日本語対応が予定されているAppleの「Siri AI」など、今後日本の個人ユーザーに影響しそうなサービスも取り上げます。

先に結論を書くと、月3,000円前後の主要候補はChatGPT Plus、Google AI Pro、Claude Pro、Microsoft 365 Premiumの4つです。ChatGPTは機能の幅、Google AI Proはストレージを含むバンドル、Claudeは文章とコードの作業、Microsoft 365 PremiumはOfficeとの統合にそれぞれ強みがあります。無料で済ませるなら、無料枠の広いGeminiを軸にするのが筆者のおすすめです。

本記事の価格・機能・提供状況は2026年9月27日時点の情報です。各社とも料金、利用上限、搭載モデルを数週間単位で変更しているため、契約前には必ず公式の料金ページと決済画面で金額を確認してください。また、「おすすめ」「強み」などの評価は、機能の幅・利用上限・日本語での使い勝手・バンドルの価値をどう重み付けするかによる筆者の判断であり、客観的な順位ではありません。今後の提供予定に関する記述には見通しが含まれます。

1. 用途別の選び方(筆者評価)

まず、利用者のタイプ別に筆者が考える第一候補を整理します。個々のサービスの詳細は後の節で説明します。

利用者のタイプ 第一候補 補足
まず無料で試したい Gemini無料版+ChatGPT Free Geminiは無料でDeep Research、画像生成、音声会話まで使える。Claude Freeも同じ作業で試し、相性で決める
汎用で1本だけ契約 ChatGPT Plus(月3,000円・税込) 円建て・税込で為替の影響を受けない。音声、画像・動画生成、リサーチ、コーディングまで範囲が広い
Googleサービス中心、画像・動画生成 Google AI Pro(月2,900円) 5TBのストレージ、YouTube Premium Liteなどが同梱され、ストレージ代を払っている人ほど割安感が大きい
長文の執筆、コーディング Claude Pro iOSアプリ経由は月3,000円、Web経由は月20ドル+消費税10%。Claude Codeが含まれる
Word・Excelを日常的に使う Microsoft 365 Personal/Family。AIを多用するならPremium(月3,200円) AIの利用量が少なければPersonal/Familyで十分なことが多い
調べもの・リサーチ中心 Perplexity Pro ソフトバンク・ワイモバイル・LINEMO利用者は6カ月無料。不要なら無料期間中に解約する
au/UQ mobile利用者 au経由のGoogle AI Pro 9月時点は月1,760円。10月以降の新規は月2,420円(詳細は後述)
予算を1,000円台に抑えたい Google AI Plus(月725円)またはChatGPT Go(月1,400円) ChatGPT Goは広告表示のパイロット対象になり得る点に注意
楽天経済圏・LINE中心 Rakuten AI、LINEのAI機能を無料のサブとして使う 買い物やLINE上の返信作成には便利だが、汎用の文章作成・リサーチは別のAIを主力にするのが現実的

2. 無料プランの比較

無料で使える範囲は各社で大きく異なります。特にGoogleは、他社が有料側に置いているDeep Researchや画像生成を無料版でも開放しており、「まず触ってみる」用途では最も手厚いと筆者は評価しています。ただし、画像・動画、検索、コーディングのどれを重視するかで順位は入れ替わります。

サービス 主なモデル・できること 制限・注意点
ChatGPT Free 既定モデルはGPT-5.6 Luna。Web検索、音声会話に対応し、画像生成やファイル添付は回数制限付き 日本では2026年6月から、ログイン済みの成人Free/Goユーザーを対象に広告表示のパイロットが始まっている
Claude Free Sonnet/Haiku。Web検索、ファイル作成・コード実行、メモリ、音声モードに対応 Opus、Research、Claude Codeは有料プランのみ。Projectsは5件まで。セッション単位と週単位の上限があり、具体値は負荷やモデルで変動する。画像生成機能はない
Microsoft Copilot Web検索、画像生成、音声会話 Word・ExcelなどOfficeアプリ内でのCopilot利用は有料プラン側
Google Gemini Gemini 3.6 Flash、Gemini 3.1 Pro(回数制限付き)。Deep Research、画像生成・編集、Gemini Live(音声)、Canvasまで無料 動画生成は有料。ストレージは15GB
Perplexity 出典付きのAI検索が中核 高度な検索(Pro Search)は1日3回まで
Grok Web検索に加え、X(旧Twitter)上の投稿を検索できる 無料枠は小さい。画像・動画生成は有料契約と本人確認が条件になったと報じられている
Meta AI Instagram、Facebook、Messenger、WhatsAppの中とmeta.aiで利用できる 日本では2025年11月25日から段階的に提供。後述のMuseとは別サービス
Rakuten AI 楽天の各サービスと連携した対話・検索。Web版は楽天IDで利用できる Rakuten Link版は楽天モバイル契約者向けで、1日単位で変動する回数上限と500文字の入力上限がある
LINEのAI機能 トーク内の返信提案、画像生成など 未加入者は各機能1日3回、LYPプレミアム会員は1日10回

3. 月3,000円前後までの有料プランの比較

次に、有料プランを並べます。これより上の価格帯(ChatGPT Pro、Claude Max、Google AI Ultra、SuperGrokなど)は本記事の比較対象外です。

プラン 日本での月額 主な内容 注意点
ChatGPT Go 1,400円(税込) Freeより広い利用枠、ファイル・画像の枠拡大、プロジェクト 広告表示のパイロット対象。個人プランは月払いのみ
ChatGPT Plus 3,000円(税込) GPT-5.6 Sol、Deep Research、画像・動画生成、Codex 以前からのドル建て契約は自動では円建てに切り替わらない。決済画面で通貨を確認する
Claude Pro Web:20ドル+消費税10%(年払い200ドル+税)
iOS:3,000円(年35,000円)
Opus、Research、Claude Code、Claude in Chrome、Microsoft 365連携、Projects無制限 現在の為替ではiOS経由が割安だが、為替・カードの海外事務手数料・App Store価格の改定次第で変わる
Google AI Plus 725円(400GB)
2TB版は1,450円
無料版より広い利用枠、動画生成、Gmailなどの中でのGemini 同じ名前でストレージ容量の異なる2つの価格がある
Google AI Pro 2,900円
au経由:9月時点1,760円
Gemini 3.1 Pro、動画生成、Gemini Notebook(旧NotebookLM)、5TB、YouTube Premium Lite、Google Home Premium 利用上限はサービス(機能)ごとに個別に設定されており、共通のリセット規則はない
Microsoft 365 Personal 2,130円 Word、Excel、PowerPoint、Outlook+Copilot、1TB AIの利用枠はPremiumより少ない
Microsoft 365 Family 2,740円 最大6人でOfficeを共有、各1TB AI機能を使えるのはサブスクリプション所有者のみ
Microsoft 365 Premium 3,200円(年32,000円) 旧Copilot Pro相当の機能、推論エージェントのResearcher/Analyst、個人向けで最大のAI利用枠 最大6人で共有できるが、AI機能は所有者のみ
Perplexity Pro 直接契約:20ドル
ソフトバンク経由:2,950円
複数社の最新モデルを切り替えて検索・回答に使える 高度な検索は週単位の上限あり。使えるモデルは頻繁に入れ替わる
X Premium 980円(Web) Grokの利用枠拡大とXの有料特典 アプリ内課金は割高。Grok専用のSuperGrokは月30ドルで予算外
LINE AI サービス使い放題プラン 750円(税込) LINE内の画像生成や返信提案などを回数無制限にする LINEの中で使う機能に限られる

4. 主要サービスの要点

OpenAI:ChatGPT

日本の個人向け新規契約は、2026年1月末から円建て・税込となり、Go 1,400円、Plus 3,000円になりました。以前はドル建てに消費税10%が加算されていたため、実質的な値下げです。ただし既存のドル建て契約はそのまま残るため、切り替えたい場合は更新を止めて期間満了後に契約し直す必要があります。

モデルは、7月に公開されたGPT-5.6系(Sol、Terra、Luna)が通常のチャットの中心で、FreeとGoは主にLuna、PlusはSolを使えます。次世代のGPT-6系は、GPT-6 Astraが4月に登場し、9月22日にSolとLunaが加わりましたが、これらはChatGPT WorkとCodexからの先行提供で、通常のチャット画面ではまだ選べません。なおGPT-6 LunaはFree/Goでもデスクトップアプリ経由で使えると発表されており、「無料プランでは上位モデルは一切使えない」とは言い切れない状況です。

会話を学習に使わせたくない場合は、設定の「データコントロール」で「すべての人のためにモデルを改善する」をオフにします。一時チャットは学習に使われません。ただし、回答に高評価・低評価のフィードバックを送ると、その会話が学習に使われる可能性がある点には注意が必要です。

Anthropic:Claude

Claude ProのWeb価格は月20ドル(年払いは200ドル)で、2026年4月1日から日本の利用者には消費税10%が別途課されています。月払いなら税込22ドル相当をカード会社のレートで円換算した額が請求されます。一方、iPhoneのApp Storeでは月3,000円・年35,000円で販売されており、現在の為替ではiOS経由の方が安くなっています。

無料版でもWeb検索、ファイル作成、コード実行、メモリなどが使えますが、上位モデルのOpus、調査機能のResearch、コーディング支援のClaude Codeは有料プランのみです。利用上限はセッション単位と週単位で設けられており、Web・スマホ・Claude Codeの利用が同じ枠を消費するため、コーディングで長時間使うと上限に達しやすい点が実務上の弱点です。画像生成機能はありません。

個人向けプランでは、利用者が設定をオフにしない限り会話がモデルの改善に使われ得る方式になっています。気になる場合は、設定のプライバシー項目で学習への利用をオフにしてください。

Microsoft:Copilot と Microsoft 365

MicrosoftはCopilot Proの単体販売を終え、2025年10月に登場したMicrosoft 365 Premium(月3,200円)がその後継になっています。PersonalとFamilyにもCopilotは統合されており、違いは主にAIの利用枠と、ResearcherやAnalystといった推論エージェントの有無です。FamilyとPremiumは最大6人でOfficeを共有できますが、AI機能を使えるのは契約者本人だけです。

Officeを日常的に使い、AIも頻繁に使う人にとって、Premiumは「Officeライセンス込みでこの価格」という意味で合理的な選択肢です。一方、AIの利用が月に数回程度ならPersonalやFamilyで十分で、Officeを使わない人にとっては汎用AIとしての魅力は他社に劣ると筆者は見ています。

Google:Gemini と Google AI プラン

Googleは2026年6月にGoogle AI Plusを月1,200円から725円に値下げし、ストレージを200GBから400GBに増やしました。同じGoogle AI Plusの名前で2TB版(月1,450円)も併存しています。上位のGoogle AI Pro(月2,900円)には、Gemini 3.1 Pro、動画生成、Gemini Notebook、5TBのストレージ、YouTube Premium Lite、Google Home Premiumが含まれます。ストレージやYouTubeにすでに料金を払っている人にとっては、AI部分の実質負担がかなり小さくなる、というのが筆者の評価です。

au/UQ mobileの利用者は、auを通じてGoogle AI Proを契約できます。9月27日時点の価格は月1,760円で、10月1日以降は月2,420円になります。9月30日までに加入した個人利用者は、10〜12月の利用分に660円の割引が適用され、年内は実質1,760円が続きます。

プライバシー面では、18歳以上のユーザーは「アクティビティを保持」が初期設定でオンになっており、一部の会話は人間のレビュアーが確認します。レビュー済みの会話は最大3年間保持され、アクティビティを削除しても消えません。Google自身が機密情報を入力しないよう案内しているので、仕事の情報を扱う前に設定を見直しておくべきです。

Perplexity

出典付きの回答に強いAI検索サービスで、有料のProでは複数社の最新モデルを切り替えて使えます。9月時点の公式一覧には、GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.1 Pro、Grok 4.5などが並んでいますが、ラインアップは頻繁に更新されるため、最新情報は公式のモデル一覧で確認してください。

ソフトバンク、ワイモバイル、LINEMOの利用者は、Perplexity Proを6カ月無料で使えます。提供条件書には、7カ月目以降は月額2,950円が発生すると明記されており、解約しなければ自動的に有料契約に移ります。ソフトバンク利用者には有料期間に税抜料金の10%(268円相当)がPayPayポイントで還元されますが、無料期間中は対象外です。回線を解約するとPerplexity Proも終了します。

xAI(SpaceXAIブランド):Grok

xAIは2026年7月にSpaceXAIへブランドを変更したと報じられていますが、料金ページなどには旧表記が残っている場合があります。X上の投稿をリアルタイムに検索・分析できるのが特徴で、Xの有料プランX Premium(Web版月980円)でもGrokの利用枠が広がります。Grok専用のSuperGrokは月30ドルと本記事の価格帯を超えるため、Xをよく使う人がX Premium経由で試す程度が妥当だと筆者は考えます。

LINEヤフー:Agent i と LINEのAI機能

LINEヤフーのAIは、性格の異なる2つを分けて理解すると整理しやすくなります。1つはLINEとYahoo! JAPANを横断するAIアシスタント「Agent i」で、店探しや旅行など分野別のエージェントを備え、2026年6月末時点で累計22分野に広がっています。もう1つはLINEの中で使う画像生成や返信提案などの機能で、未加入者は各機能1日3回、LYPプレミアム会員は1日10回まで使え、月750円の「LINE AI サービス使い放題プラン」に入ると回数が無制限になります。

楽天:Rakuten AI

Rakuten AIは無料で、楽天モバイル契約者は通話・メッセージアプリのRakuten Linkから、それ以外の人も楽天IDでWeb版から利用できます。Rakuten Link版には1日単位で変動する回数上限と500文字の入力上限があり、2026年8月5日にはAIによる通話要約機能も加わりました。楽天市場やトラベルでの買い物・情報探しには便利ですが、長文の作成やリサーチの主力にするには力不足で、追加料金なしで使えるサブのAIと位置づけるのが現実的です。

NTTドコモ:SyncMe

ドコモは、dアカウントの情報をもとに利用者ごとに最適化するAIエージェント「SyncMe」をパイロット版として提供しています。正式版は当初の夏の予定から秋に変更されました。料金体系はまだ確定しておらず、正式版の発表を待って評価すべき段階です。

DeepSeekを使う場合の注意

中国のDeepSeekは無料で高性能なモデルを提供していますが、個人情報保護委員会は2025年2月、取得されたデータが中国国内のサーバーに保存され、中国の法令が適用されることについて注意を呼びかけています。デジタル庁も政府機関の業務利用について注意喚起を出しました。個人情報や仕事の情報は入力しない前提で使うべきサービスです。

5. 話題のMeta「Muse」:日本では未提供の個人向けAIエージェント

いま最も注目されている個人向けAIの1つが、Metaが2026年9月8日(米国時間)に発表した「Muse」です。質問に答えるチャットAIではなく、利用者に代わって実際の作業をこなす「AIエージェント」として設計されています。メールの送信、レストランや旅行の予約、買い物、Webフォームへの入力などを、クラウド上の専用環境に用意したブラウザを操作して実行し、時間のかかる作業はアプリを閉じた後も続けます。Metaのこれまでで最も高性能なモデル「Muse Spark」で動いています。

提供は米国でのiOS、Android、Web版(muse.ai)から始まり、WhatsAppからも話しかけられます。CNNによれば公開から約2週間で250万回以上ダウンロードされ、iPhoneの無料アプリで首位になりました。TechCrunchは、調査会社Sensor Towerの推計として9月下旬に340万ダウンロードを超えたと報じています(いずれも第三者の推計値です)。

安全面の設計には特徴があります。Museは利用者ごとに隔離された専用の仮想マシン「Muse Secure VM」上で動き、同じマシン上の別のエージェント「Sentinel」が承認しない限りインターネットにアクセスできません。パスワードや支払い情報はMuse自身からは見えない形で保管され、メール送信や購入の前には必ず利用者に確認を求めます。決済にはStripeのLinkを使い、使い捨てのカード番号で支払う仕組みです。会話をAIの学習に使わせないよう選択でき、会話やデータはMetaの広告システムと共有しないとしています。年内には、利用者だけが持つ鍵でVM全体を暗号化する「Muse Confidential VM」を導入する予定です。

料金は、使用制限付きの無料枠に加えて有料プランがあります。報道によれば有料プランは月20ドルの「Power」と月100ドルの「Maximum」の2種類で、Metaのヘルプページは利用枠が週単位で設定されていること、特典や提供条件は地域とアカウントによって異なることを説明しています。仮に日本で同水準の価格になれば、月20ドルのPowerは本記事の比較対象と同じ価格帯に入ります。

9月23日のMeta Connect 2026では、会話しながら裏で作業を進める音声モード、数カ月以内のAIグラスへの対応、Muse専用のメールアドレス、Mac版でのパソコン操作機能、Walmartなどでの買い物連携の拡大が発表されました。キーホルダー型の専用端末「Muse Charm」も披露されましたが、価格は明らかにされていません。一方で、個人データをどこまでMetaに預けられるかという信頼の問題は、アナリストからも普及の鍵として指摘されています。

Metaの日本語版発表は「日本での提供については現時点で未定」と明記しています。すでに日本で使える「Meta AI」(Instagramなどの中で使えるチャットAI)とは別のサービスです。本記事では、地域制限を回避して利用する方法は扱いません。

6. 今後の日本での動きが注目されるサービス

  • Apple「Siri AI」:GoogleのGemini技術をもとに刷新したAppleの基盤モデルを使う新しいSiriです。9月15日(日本時間)から英語版のベータ提供が始まっており、Appleは日本語版を10月からベータとして提供すると公式に発表しています。具体的な開始日はまだ公表されていません。追加料金なしでiPhoneに組み込まれるため、日本語版が始まれば「無料で日常的に使うAI」の勢力図に大きく影響する可能性があります。
  • Amazon「Alexa+」:生成AIで刷新されたAlexaで、9月16日にはインドで早期アクセスが始まりましたが、日本での開始日は発表されていません。アマゾンジャパンは2月に、時期は明かせないとしつつ、優先度は米国・カナダに次ぐと説明しています。
  • Meta「Muse」:前節のとおり日本での提供は未定です。日本語版の発表資料が用意されていることは、日本市場への関心を示すものとは言えますが、提供時期を示すものではありません。
  • ドコモ「SyncMe」:秋に予定されている正式版で、料金とdポイントなどとの連携内容が明らかになる見込みです。

7. 契約前に確認したいこと

  • 円建てかドル建てか:ChatGPT(新規の個人契約)、Google AI、Microsoft 365、ソフトバンク経由のPerplexityは円建てです。Claude(Web)、Perplexityの直接契約、SuperGrokなどはドル建てで、為替とカードの海外事務手数料の影響を受けます。
  • 決済経路による価格差:同じサービスでも、Web、App Store、Google Playで金額が異なることがあります。Claude ProのようにiOS経由の方が安い例もあれば、X Premiumのようにアプリ内課金が割高な例もあります。
  • 「無制限」ではない:有料プランでも、セッション単位・週単位・機能単位などの上限があります。上限の具体値は公開されていないか、頻繁に変わるものが多いです。
  • 無料期間後の自動更新:キャリア経由の無料特典は、解約しなければ有料に移るものがあります。申し込み時に終了日を控えておきましょう。
  • 学習・レビューの初期設定:ChatGPT、Claude、Geminiの個人向けプランは、初期設定のままだと会話が学習や人間のレビューの対象になり得ます。仕事の情報や個人情報を扱う前に設定を確認してください。

まとめ

2026年9月27日時点で、月3,000円前後の主な候補はChatGPT Plus、Google AI Pro、Claude Pro、Microsoft 365 Premiumの4つです。ChatGPTは機能の幅、Google AI ProはストレージやGoogleサービスとのバンドル、Claudeは文章とコードの作業、Microsoft 365 PremiumはOfficeとの統合にそれぞれ強みがあります。無料で済ませるなら、GeminiとChatGPTの無料版を併用し、同じ作業を試して自分に合うものを選ぶのが最も確実です。

今後の注目点は、10月に予定されているSiri AIの日本語版と、米国で急速に広がっているMetaのMuseです。どちらも「質問に答えるAI」から「代わりに作業するAI」への移行を象徴するサービスで、日本での提供状況によっては、ここで比較した有料プランの価値も変わっていくでしょう。利用上限、モデル構成、地域別の価格は頻繁に変更されるため、契約する直前に公式の料金ページと決済画面を確認することをおすすめします。

土曜日, 9月 26, 2026

マイクロソフトはCopilotをどこへ連れていくのか 個人向けAIからの撤退と「職場のエージェント基盤」への転換

マイクロソフトのCopilotは、この半年でたびたび姿を変えてきました。3月の組織再編、4月のOpenAIとの契約改定、6月のCopilot Cowork一般提供、7月の価格改定、8月のアプリ統合と個人向け機能の廃止を経て、9月25日にはHome/Code/Autopilotを1つにまとめた新しいCopilotアプリが発表されました。

個々の発表だけを追うと全体の方向が見えにくくなります。そこで本記事では、2026年3月から9月までの動きを「製品」「課金」「モデル」「個人向け」「日本市場」の5つの軸で整理します。特に9月下旬に表面化した「個人向けAIコンパニオン路線からの撤退」は、Copilotのこれからを読むうえで欠かせない論点です。

結論を先に書きます。Copilotは「OpenAIモデルを使い、シート単位で売る個人・法人兼用のチャットアシスタント」から、「複数のモデルで動き、シート料金と従量課金の二層で売る、職場向けのエージェント基盤」へ移ろうとしています。ただし移行は途中の段階です。新アプリの主要機能の多くは、2026年9月26日時点でまだFrontier(早期アクセス)やプレビューの段階にあります。

本記事の前提
・価格は特に断りのない限り米国向けの定価で、1ユーザーあたりの月額換算、原則として年間契約です。税、地域ごとの価格、EA/CSP割引は含みません。日本円の価格は公式の価格表または契約窓口で確認してください。
・有料シート数などの数値の多くは、マイクロソフトの決算説明会や公式ブログでの自己申告です。独立した検証はほとんどありません。
・Sensor Towerなどの利用者数は第三者による推計で、公式の数字ではありません。

1. 半年間の主な動き

日付 出来事 意味合い
2026年3月9日 M365 E7「Frontier Suite」とAgent 365を発表(どちらも5月1日に一般提供開始) エージェントの管理基盤を含む最上位スイートを新設
3月17日 個人向けと法人向けのCopilot組織を統合。Jacob Andreou氏がCopilot担当EVPに就任し、Mustafa Suleyman氏はモデル開発に専念 個人向けを独立して推進する体制が終わる
3月20日 Windows責任者が、Windows 11の一部アプリにある不要なCopilotの入口を減らす方針を表明 OSへのAIの露出を見直す
4月3日 日本に2026〜2029年で100億ドル(約1.6兆円)を投資すると発表。同じ日に、日本でのCopilot国内推論処理の予定を2028年に変更 大規模投資と、データ主権対応の遅れが同時に出る
4月27日 OpenAIとの契約を改定。IPライセンスは2032年まで続くが非独占に マルチモデル化の契約上の前提が整う
6月2〜3日 Build 2026で、最初のAutopilotエージェント「Microsoft Scout」と自社モデル群(MAI)を発表 常駐型エージェントの方向を示す
6月16日 Copilot Coworkを全世界で一般提供開始。Copilot Creditsによる従量課金を導入 「シート料金+従量課金」の始まり
7月1日 M365商用ライセンスの価格改定(新規契約と更新時から適用) AI機能を理由とするスイートの値上げ
8月13日〜18日 個人向けアプリとM365 Copilotアプリの統合を開始。8月18日に個人向けのPodcasts、Group Chats、Deep Research、Copilot Labs、キャラクター「Mico」を廃止 個人向けの目玉機能を整理
9月25日 新Copilot(Home/Code/Autopilot)を発表。同じ時期に「Copilot+ PC」ブランドの使用中止も明らかに 職場向けへの集中と、個人向けコンパニオン路線の終わりがはっきりする

2. 「チャット」から「エージェント」へ

製品面の軸は、チャットで手伝う存在から、仕事を任せられる存在への移行です。ナデラCEOは7月29日の決算説明会で、Copilotがチャットから、Cowork、さらにAutopilotへと急速に進化していると説明しました。

  • Copilot Cowork(6月16日に一般提供開始):複数のステップからなる作業を実行し、成果物を返す機能です。利用にはM365 Copilotライセンスが必要で、実際に使った分はCopilot Creditsで別途課金されます。
  • Autopilot:名前・役割・目標を与えて常駐させるエージェントです。Build 2026では最初のAutopilotとして「Microsoft Scout」が発表されました。9月の新アプリではScoutという名前は使われず、ユーザーが自分で作って名前を付けるAutopilotとして整理されています。Scoutは現行の別製品ではなく、Autopilotの初期の名前と考えるのが適切です。
  • 新Copilotアプリ(9月25日発表):Home(ChatとCoworkの統合)、Code(自然言語でのアプリ作成)、Autopilotの3つで構成されます。発表時点では、HomeとCodeは今後数週間でFrontier向けに順次提供され、Autopilotは9月末にプライベートプレビューを広げる予定という段階です。

方向ははっきりしていますが、一般提供まで進んでいるのはCoworkまでです。CodeとAutopilotの一般提供時期と価格はまだ決まっていません。本番業務の設計に組み込むのは、まだ早い段階です。

3. 個人向けAIからの撤退と消極化

この半年で最も大きな方向転換は、個人向けCopilotの扱いです。マイクロソフトは2024年にInflection AIの共同創業者Mustafa Suleyman氏を迎え、個人向けCopilotを任せました。2025年4月の創業50周年イベントでは、Copilotを「Your AI Companion」(あなたのAIの相棒)と位置づけていました。そこから1年半で、この路線は大きく縮小しています。

3-1. 縮小の経緯

時期 確認できる事実 筆者の見方
2026年3月 個人向けと法人向けの組織を統合。Suleyman氏はCopilot製品の責任者を離れ、モデル開発と「スーパーインテリジェンス」に専念 個人向けを独立した事業として推す体制がなくなった
2026年3月 Windows 11のメモ帳やペイントなどで、Copilotの入口とブランド表示を減らす方針を表明 OSの隅々にCopilotを置く手法を見直した。ただしWindowsのAI機能そのものをやめたわけではない
2026年8月18日 個人向けのPodcasts、Group Chats、Deep Research、Copilot Labs、キャラクター「Mico」を廃止。作成済みのPodcastsやGroup Chatsの内容は見られなくなった 個人向けの差別化機能を大きく整理した
2026年9月25日 新Copilotを職場向けを軸に発表。Bloombergの報道によると、Charles Lamanna氏は「個人のコンパニオンのようなCopilotは作らない」と述べた コンパニオン路線からの撤退を幹部が言葉で示した
2026年9月下旬 新型Surfaceが「Copilot+ PC」を名乗らずに登場。Surface担当CVPのBrett Ostrum氏がWindows Centralに対し、要件は満たしているがCopilot+ PCとは呼ばないと説明 個人向けPC市場でも、Copilotの名前を前面に出すのをやめた

3-2. 背景にある利用規模の差

縮小の背景には、競合との利用規模の差があります。CNBCが引用したSensor Towerの推計では、2026年2月の1日あたりの利用者数はCopilotアプリが600万人でした。同じ月のChatGPTは4億4,000万人、Geminiは8,200万人です。GeekWireが引用した同社の推計では、7月の個人向けCopilotアプリの月間利用者は約3,850万人で、約10億人のChatGPTとは大きな差があります。どちらも第三者の推計で、集計の範囲が完全に同じとは限りません。それでも、個人向け市場で存在感を示せなかったことははっきりしています。

Bloombergによれば、Andreou氏とLamanna氏は、MetaのMuseのように利用者の代わりに行動する個人向けアシスタントが伸びていることを、人々がAIによる自動化を求めている証拠と見ています。そのうえで、マイクロソフトの役割はその能力を職場に届けることだと説明しています。個人向けで正面から戦うのではなく、得意な職場の領域で自動化を提供するという判断です。

3-3. 「撤退」はどこまでか

「撤退」はBloombergなどの表現で、マイクロソフト自身はこの言葉を使っていません。事実として確認できるのは、個人向けの提供そのものをやめたのではなく、次の3つをやめたことです。

  • コンパニオンとしての打ち出し:キャラクターのMicoや、「Your AI Companion」という位置づけ
  • 個人向けだけの実験的な機能:Podcasts、Group Chats、Copilot Labsなど
  • ハードウェアでのCopilotブランドの強調:Copilot+ PC

一方で、個人の利用者がすべて切り捨てられたわけではありません。無料のチャットは引き続き使えます。Bloombergによれば、健康に関する質問、学習支援、ニュースの取得といった個人向けの機能の一部は、新アプリに引き継がれました。個人向けDeep Researchの代わりとしては、Microsoft 365 Premiumの契約者向けにResearcherが用意されています。個人のCopilotの受け皿は、単独のチャットボットではなく、M365の個人向けサブスクリプションに移ったと見るのが実態に近いでしょう。

利用者にとっての影響も整理しておきます。廃止された機能で作ったコンテンツは見られなくなりました。スタンドアロンのCopilotアプリで作ったファイルはOneDriveに移されます。企業の管理下にあるWindows 11 PCでは、統合版アプリが自動で更新される場合があります。管理者は配布ポリシーを確認しておく必要があります。

4. 課金モデル:シート料金と従量課金の二層構造

料金体系は二層構造になりました。チャットやOfficeアプリとの連携といった日常的なAI機能はシート料金に含まれます。Cowork、Code、Autopilotのように計算量の多い機能は、Copilot Creditsなどによる従量課金の対象です。Copilotのすべての機能が従量課金になったわけではない点に注意してください。

項目 価格(米ドル) 適用 補足
M365 E7 Frontier Suite 99 2026年5月1日から E5、M365 Copilot、Agent 365、Entra Suiteをまとめたもの
Agent 365(単体) 15 2026年5月1日から エージェントのID・セキュリティ・管理を担う基盤
M365 Copilot(アドオン) 30 据え置き Coworkの利用権は含まれるが、Coworkで消費するクレジットは含まれない
M365 E3/E5 36→39/57→60 7月1日以降の新規契約・更新 既存の契約すべてが同じ日に値上げされるわけではない
Business Standard/Premium with Copilot 23.50/32 7月1日から常設 中小企業向けのCopilot込みバンドル
Copilot Business(300ユーザー以下) 21(割引時は18) 割引は2026年7月1日〜12月31日 18ドルは初年度・年間契約が条件の割引価格。「18ドルから21ドルへの値上げ」ではない

E7の損得は計算の基準日で変わります。7月1日以降の定価で比べると、E5(60ドル)とCopilot(30ドル)の合計90ドルに対し、E7は差額約9ドルでAgent 365とEntra Suiteが付きます。旧E5価格の57ドルで比べると差額は12ドルです。いずれにしても、Agent 365とEntra Suiteを実際に使う計画がなければ割安にはなりません。

Coworkのクレジットは、従量課金(PayGo)の場合1クレジット0.01ドルです。年間の前払い(P3)では、購入量に応じて5〜20%の割引があります。マイクロソフトの公式ガイドが示すタスクごとの目安は次のとおりです。

タスクの規模 公式の目安(クレジット数) PayGoで換算した金額
軽い 70〜200 0.70〜2ドル
中程度 400〜600 4〜6ドル
重い 1,500超 15ドル超

実際の消費量は、使うモデル、読み込む情報の量、ツールの呼び出し回数、実行時間によって変わります。固定の料金表ではありません。開発者向けのGitHub Copilotも、6月1日に利用量に応じた課金へ移りました。AIの費用は、予算を立てやすい固定費から、使い方次第で変わる変動費へと性格を変えつつあります。

5. モデル戦略:OpenAI一本足からマルチモデルへ

4月27日の契約改定で、マイクロソフトが持つOpenAIのモデルと製品のIPライセンスは2032年まで続くことになりましたが、非独占になりました。OpenAIは他のクラウドでも製品を提供できます。一方でマイクロソフトは引き続き主要なクラウドパートナーで、原則としてAzureで先に提供される形は残ります。マイクロソフトがOpenAIに支払っていたレベニューシェアは終わり、OpenAIからマイクロソフトへの支払いは2030年まで続きます。AGIの達成に連動した権利や支払いの条件は事実上なくなったと報じられています。ただし、マイクロソフトの公式発表は「AGI条項の削除」という言い方はしていません。

製品面では、AnthropicのClaudeがOpenAIのモデルと並ぶ選択肢としてM365 Copilotに組み込まれました。5月にはClaude Opus 4.8、7月にはGPT-5.6とClaude Sonnet 5が利用可能になっています。ただしClaudeはすべての環境の標準モデルではありません。使えるモデル、対応するアプリ、既定の設定、ライセンスの条件は機能ごとに異なり、Frontierプログラムへの参加が条件になるものもあります。

これを「OpenAI離れ」と呼ぶのは正確ではありません。OpenAIを主要なパートナーとして保ちながら、Claudeや自社のMAIモデルを加えて依存先を分散した、と見る方が実態に合っています。規制の厳しい業種では、OpenAI以外のモデルを使うときにデータがどこでどう処理されるかを、モデルごとに確認する必要があります。

6. 採用状況と課題

マイクロソフトによると、M365 Copilotの有料シートは4月時点で2,000万超、7月時点で3,000万超に増えました。GeekWireは、3,000万を1月時点で4.5億超あったM365の商用有料シートで割ると約6.7%になると試算しています。ただしこれは購入されたシートの大まかな比率です。分母と分子の対象範囲が完全に一致する保証はなく、実際に使われている割合や、投資に見合う成果が出ている割合を示すものでもありません。

つまり、シート数の伸びは確かに加速していますが、「買われたシート」と「業務で成果を出しているシート」は別物です。後者を独立して検証したデータはまだ限られています。

7. 日本市場への影響

  • 100億ドルの投資(4月3日):2026〜2029年の計画で、国内のAIインフラ、サイバーセキュリティ、人材育成が柱です。さくらインターネットとソフトバンクのGPUをAzure経由で使えるようにする構想は、日本語の公式発表では「共同開発について検討を開始」という段階です。まだ提供中のサービスではありません。
  • 国内推論処理の延期:2025年11月の発表では、日本でのM365 Copilotの国内処理は2025年末までに提供される予定でした。2026年4月3日の更新で、日本は2028年予定に変わりました。国ごとの時期が示されているオーストラリア、インド、UAE、英国、米国、カナダ、日本の中では最も遅い予定です(EU/EFTAは国単位ではなく地域単位の処理に変わっています)。対象がM365 CopilotからCopilot Studio、Power Platform、Dynamics 365まで広がった点もあわせて押さえておく必要があります。
  • 日経225企業の94%:マイクロソフトは、日経225企業の94%がM365 Copilotを利用していると発表しています。ただし「利用」の定義、ライセンス数、本番導入の割合は公表されておらず、試験導入を含む可能性があります。
  • 公共部門:中央省庁では、デジタル庁が政府職員向けの生成AI基盤「源内」を独自に整備しています。Copilotだけでなく、内製・国産の基盤と並行して進んでいるのが現状です。

データを国内に置くことが求められる金融機関や公共部門では、2028年までの空白期間をどう埋めるかが実務上の課題になります。国内リージョンのAzure OpenAIや国内事業者のGPU基盤などを組み合わせる構成を、あらかじめ検討しておく価値があります。

8. 企業ユーザーへの示唆

  • E7は使う計画で判断する:Agent 365とEntra Suiteを12か月以内に本格的に使わないなら、E5とCopilotの組み合わせのままの方が合理的です。
  • Coworkは上限設定から始める:対象部門を絞って試し、管理画面でクレジットの上限を設定したうえで、2〜3か月かけて実際の消費量を測ってください。PayGoかP3かはその結果で決めます。
  • CodeとAutopilotは評価にとどめる:Frontierやプレビューの段階のうちは、本番業務に組み込まないでください。
  • ガバナンスを先に整える:エージェントの台帳、SharePointなどの過剰な共有の是正、情報漏えい対策(DLP)、モデルごとのデータの流れの確認を、全社展開の前に済ませてください。
  • 個人向け機能に頼った運用を見直す:社員が個人アカウントのCopilotで廃止済みの機能を業務に使っていなかったか確認してください。統合版アプリへの自動更新のポリシーもあわせて確認します。

まとめ

2026年のCopilotの変化は、3つの転換にまとめられます。1つ目はチャットから作業の委任と常駐型エージェントへの転換、2つ目はシート料金だけの課金から「シート料金+従量課金」への転換、3つ目はOpenAIへの一本足からマルチモデルへの転換です。その裏側で、個人向けのAIコンパニオン路線は、組織再編、機能の廃止、Copilot+ PCブランドの使用中止という段階を経て、事実上終わりました。

これは、個人向けチャットボット市場をChatGPT、Gemini、Metaに譲り、M365という強い足場のある職場向けに資源を集中するという判断です。成否を分けるのは、まだプレビュー段階にあるAutopilotなどのエージェント機能が、どれだけ早く、予測できるコストで、統制の効いた形で実務に定着するかです。日本の利用者にとっては、これに加えて2028年まで延びた国内推論処理への対応が、当面の現実的な課題になります。

金曜日, 9月 25, 2026

トヨタ「ロボット40万台・年1兆円」を正しく読む:人型ロボットの台数ではない

2026年9月中旬、トヨタ自動車がブリュッセル(トヨタ・モーター・ヨーロッパ)で開いた投資家向け技術説明会で、工場ロボットに関する大きな構想を示しました。「2028年以降、年1兆円規模で世界約60工場・約40万台のロボットを更新する」というものです。国内外で大きく報じられ、中には「トヨタ、ヒト型ロボ40万台」という見出しもありました。

ただ、報道を読み比べると、数字の意味や確度の書き方にかなりの幅があります。40万台はすべて人型ロボットなのか。1兆円は決定した投資なのか。すでに工場で動いている人型ロボットは何台あるのか。こうした基本的な点が、見出しだけでは読み取れません。

先に結論を書きます。40万台は人型ロボットの台数ではありません。既存の産業用ロボットの更新と新規導入、人型と非人型をすべて含んだ全体規模です。年1兆円も「かかり得る」という試算であり、正式な投資決定や継続年数は示されていません。本記事では、発表内容を「確定していること」「構想・試算」「未公表」に分けて整理し、現代自動車、BMW、テスラなど他社の事例と比較します。

本記事は2026年9月25日時点の公開情報にもとづきます。トヨタは本件について公式リリースや説明会資料を公開しておらず、内容は現地取材を含む報道(Car Watch、ロイター、日本経済新聞、読売新聞など)によります。将来の計画や目標値を多く含むため、実際の導入規模や時期は今後変わる可能性があります。

1. 何が発表されたのか

説明会で示されたのは、大きく分けて次の4点です。説明者は副社長兼CTOの中嶋裕樹氏です。

  • 工場自動化の規模感:2028年以降、年1兆円規模で、世界約60工場と約40万台のロボットを対象に更新を進める構想です。Car Watchによれば、内訳はトヨタ・グループ約15万台、サプライヤー約25万台です。1兆円には工場とロボットの両方が含まれ、中嶋氏は工場全体を「コネクテッドファクトリー」として捉えると説明しています。
  • AI:Toyota Research Institute(TRI)が開発する「大規模行動モデル(LBM:Large Behavior Model)」を中核に、ロボット、工場、取引先をつなぐ「ファクトリーオートメーション3.0」を掲げました。
  • 自社開発ロボット「ELEY(エリー)」:車輪で移動する双腕のモバイルマニピュレータ(移動台車に腕を載せたロボット)です。二足歩行のヒューマノイドではありません。
  • 新組織「トヨタ ロボティクス」:執行役員兼CPOの志賀武文氏がリーダーを務めます。

読売新聞は、トヨタがロボティクス事業に本格参入し、将来は外販も視野に入れていると報じました。中嶋氏も、トヨタ生産方式(TPS)を学びに来る企業への販売に触れています。ただし、社内展開と外販のいずれも具体的な日程は示されていません。

2. 「40万台」と「1兆円」をどう読むか

今回の報道で最も誤解されやすいのがこの2つの数字です。ロイターは、トヨタが工場自動化に年最大1兆円(約64億ドル)が必要になり得ると「試算」したと報じました。一方で、投資を確実に実行するのか、何年続けるのかは明言していないとも伝えています。Car Watchには「投資し続けていく」という確定的な書き方も見られますが、本記事ではより慎重なロイターの表現を採ります。

40万台についても、ロイター系の報道は、人型と非人型、既存機の更新と新規設置を含む全体規模として扱っています。ELEYを40万台配備する計画ではありません。また、40万台すべてにLBMを搭載すると確認できる情報もありません。発表内容を確度別に整理すると次のようになります。

区分 内容 補足
確認できる事実 ELEYの公開、新組織「トヨタ ロボティクス」の発足、TRIのLBMを中核に据える方針 ELEYの設計思想と課題はトヨタ公式サイトの技術記事でも確認できる
構想 2028年以降、約60工場・約40万台規模(グループ約15万台+サプライヤー約25万台)を対象に自動化を進める 60工場とサプライヤー工場の関係、サプライヤー分の費用を誰が負担するかは不明
試算 年1兆円程度が必要になり得る 正式な予算承認や継続年数は示されていない
未公表 工場別の予算、LBM搭載機の比率、ELEYの導入台数と最初の適用工程、外販の時期 今後の中期経営計画や決算資料での開示が判断材料になる

1兆円の大きさを測る物差しとして、トヨタの2026年3月期の実績と比べてみます。米国SECに提出された年次報告書(Form 20-F)によると、貸与資産を除く固定資産の追加額は約2兆1,482億円、研究開発費は約1兆5,228億円でした。年1兆円は、それぞれの約47%、約66%に当たります。同年度の設備投資総額は約6兆円に達しますが、これは金融事業のリース車両などを含む数字なので、比較には前者を使うのが適切です。

3. ELEYとLBM:何ができて、何がまだか

ELEYは「Embodied Learning robot for Enhanced Yield」の略です。トヨタ公式サイトの技術記事によると、腕の関節間の長さや太さを人に近い寸法に合わせ、肩甲骨に相当する軸も追加しています。人の作業をそのまま教えやすくするための設計です。全軸に準ダイレクトドライブ(QDD)方式のアクチュエーターを採用し、外から加わる力を受け流しやすくしました。これは、生活支援ロボットHSRの研究で見えた課題への対応だと説明されています。

現地取材による報道では、重さは約50kgで、動力はバッテリーまたは電源コードです。デモでは、作業者がELEYの指を模した治具で動作を教え、約2週間・約1,500回の練習でTシャツを自律的に畳めるようになったとされています。なお、これらの数値はトヨタ公式の技術記事には掲載されていません。

注目すべきなのは、トヨタ自身が課題を率直に挙げている点です。公式記事では、次の3点で世界のトップ技術にはまだ及ばないとしています。

  • 長時間稼働時の信頼性
  • 手先位置の再現性
  • ロボット学習用のデータ基盤

Tシャツ畳みはあくまで技能学習の研究デモです。自動車の組立工程でのサイクルタイム、稼働率、安全認証などを示す実証ではありません。

中核となるLBMについては、TRIのチームが2025年にarXivで論文を公開しています。500を超えるタスク、約1,700時間のデータで事前学習したモデルを、実機約1,800回、シミュレーション4万7,000回超で評価したものです。新しい作業を覚えるのに必要なデータが3〜5分の1で済むという結果が出ています。一方で、追加学習(ファインチューニング)なしで使ったときの結果はまちまちでした。「何でもすぐにこなす汎用ロボット」を実証したものではない点には注意が必要です。

TRIは2025年8月に、ボストン・ダイナミクスの人型ロボット「Atlas」をLBMで動かすデモも公開しています。歩行と物体操作を組み合わせた長い作業を実演しました。Atlasは競合である現代自動車グループ傘下の機体であり、トヨタはAIの研究パートナーという立場です。

4. カナダ工場で動くAgility「Digit」

トヨタの工場ですでに商用契約のもとで動いている人型ロボットもあります。Agility Roboticsは2026年2月、トヨタ・モーター・マニュファクチャリング・カナダ(TMMC)と、二足歩行ロボット「Digit」のRaaS(Robots-as-a-Service、サブスク型のロボット提供)契約を結んだと発表しました。約1年間の実証を経た契約です。TMMCはRAV4などを生産する、日本国外で最大のトヨタの製造拠点です。Digitの作業は、部品を入れた通い箱(トート)の積み下ろしと搬送です。

ただし、台数については情報が一致していません。Agilityの公式発表には台数の記載がありません。The Robot Reportは「実証に3台を使い、さらに7台を配備する」と報じる一方、ジェトロは「7台を配備」とまとめています。前者なら最大10台、後者なら7台です。現時点では、トヨタの人型ロボット実働台数を一つの数字で断定することはできません。いずれにしても一桁から十台程度の規模であり、40万台構想とは桁がまったく違います。

5. トヨタが狙うもの:人との共存と技能の継承

中嶋氏は日経アジアの取材に対し、ロボットが人を置き換えるのではなく、人と共存する世界を目指すと述べています。日経系の報道によれば、トヨタは世界60工場に約1万8,000人の熟練技能者「匠」を抱えています。その技能をカメラやセンサーでデータ化してロボットに学習させ、ある工場で学んだ技能を世界の拠点に展開する構想です。将来はロボットが新人教育を担う可能性にも言及しています。

この構想はTPSの考え方と一貫しています。中嶋氏は、工程をしっかり整流化したうえで自働化し、入れた後も改善を重ねてコンパクトにしていくという順序を強調しました。無人搬送車(AGV)であふれる海外工場については、運ぶこと自体に付加価値はないとも話しています(Car Watch)。ロボットを大量に並べること自体を目的とせず、設備の更新サイクルに合わせて段階的に入れていく設計だと読めます。

市場の反応としては、米バーンスタインがロイターに対し、ロボティクス重視は自動車以外の成長可能性に対する投資家の評価を高めうるとコメントしています。

6. 他社事例との比較

各社の数字を比べるときに最も大事なのは、その数字が何を表しているかです。実ラインで計測された実績なのか、契約台数なのか、将来の生産能力や導入目標なのかで、意味はまったく変わります。下の表では「数値の性格」を列として分けました。

企業 ロボット 段階 公表された数値・内容 数値の性格
トヨタ ELEY(車輪型双腕)+既存の産業用ロボット 構想・研究デモ 2028年以降、約60工場・約40万台を対象、年1兆円規模 構想・試算
トヨタ(カナダ) Agility Digit(二足歩行) 商用契約(小規模) 3台で約1年実証後に契約。追加7台または計7台と報道が分かれる 契約・配備(台数未確定)
現代自動車グループ Boston Dynamics Atlas(二足歩行) 量産・大規模導入の計画 2028年までに年3万台の生産体制(CES 2026)。米国の現代・起亜工場に2万5,000台超を導入する計画 生産能力目標・導入計画
BMW Figure 02(二足歩行) 実ラインでのパイロット完了 米スパータンバーグ工場で10カ月、10時間シフトで稼働。X3 3万台超の生産に関与し、部品9万点超を扱い、約1,250時間稼働 実績(メーカー公表)
メルセデス・ベンツ Apptronik Apollo(二足歩行) パイロット 2024年に契約。部品キットの供給、検品、トート搬送を試験。Apptronikへの出資も実施 試験(定量実績は未公表)
テスラ Optimus(二足歩行、自社製) 生産設備を建設中 2026年第2四半期の株主向け資料では、フリーモントとテキサスのOptimus生産設備はいずれも「建設中」 設備の建設状況
UBTECH(中国) Walker S2(二足歩行) 量産・納入開始 2025年11月に数百台規模の初回ロットを納入し、受注額8億元超と発表。BYDなど自動車メーカーの工場で訓練 企業発表(工場ごとの稼働実績は未検証)
三菱自動車 Highlanders製の汎用人型 基本合意 2026年7月に協業で合意。京都工場で2027年早期の受託量産開始を検討。規模は「月産1,000台」「年1,000台」と報道によって表現が分かれる 検討段階の目標
Foxconn 人型を含む汎用ロボット 初期商用導入 米ヒューストンのAIサーバー工場。2026年3月のロイター報道では、Skild AIのモデルで動かす初期導入とされる。機体と台数は未確認 報道ベース
Amazon(参考) 自律移動ロボット(AMR)など 本格運用 2025年7月に累計100万台に到達。AIモデル「DeepFleet」でロボット群の移動時間を10%短縮 実績(メーカー公表)

表を読むうえでの注意点を補足します。

  • BMWは、作業内容、稼働時間、処理部品数が開示されている点で、最も検証しやすい実ライン事例です。後継機Figure 03による次のユースケース評価や、独ライプツィヒ工場でのHexagon製車輪型ロボット「AEON」のパイロットは別の取り組みです。スパータンバーグの実績と合算すべきではありません。
  • 現代自動車の2万5,000台超は、現時点の実働台数ではなく将来の導入計画です。人型ロボット本体の量産に賭けている点で、トヨタとは方向性が異なります。
  • テスラは、初期の機体を工場での本格労働よりも、学習データの収集や機能開発に使うとしています。「量産が始まった」と読める報道には注意が必要です。
  • Amazonの100万台は主に物流用の移動ロボットで、人型ロボットの競争とは別物です。大規模なロボット群をAIで運用する参照例として載せています。

7. 比較から見えるトヨタの特徴

第一に、比べている数字の土俵が違います。現代自動車やテスラが示すのは人型ロボット本体の生産能力です。トヨタの40万台は、グループとサプライヤーのロボット設備全体の母数です。人型ロボットの実働数だけを見れば、トヨタはカナダの一桁から十台程度にとどまります。BMWやメルセデスと同じく、小規模な商用導入・パイロットの段階です。

第二に、ロボット単体より生産基盤全体の更新に重心があります。TRIのLBM、ソフトウェア基盤「Arene」のロボットへの拡張、TPSの標準作業データを組み合わせ、サプライヤーまで含めて更新していく構想です。これはトヨタの差別化要素といえます。ただし、BMWも統一的なデータ基盤を構築しており、現代自動車はBoston Dynamicsを傘下に持っています。データとAIの統合はトヨタだけの取り組みではありません。

第三に、ELEYは車輪型です。BMWが試すAEONも車輪型です。平らな工場の床では、二足歩行より安定性、安全性、コストの面で有利だという判断が背景にあると筆者は推測します。ただし、トヨタがこれを選定理由として明言したわけではありません。

なお、トヨタは自社開発のELEYと外部製のDigitを並行して使っています。とはいえ、「特定の機体に賭けないマルチベンダー戦略」として全社的に打ち出しているわけではない点にも留意が必要です。

8. 今後の注目点

  • 投資の確度:年1兆円が中期経営計画や設備投資計画に正式に反映されるか。
  • ELEYの実ライン投入:最初に使う工場と工程、サイクルタイムや稼働率などの実績値が開示されるか。
  • 公式に認めた3つの課題:信頼性、再現性、データ基盤の改善がどう示されるか。
  • 40万台の内訳:LBM搭載機や人型ロボットの比率、サプライヤー分の費用負担の仕組み。
  • カナダのDigit:配備台数が明確になり、拡大に進むか。
  • 外販:トヨタ ロボティクスがいつ、どの形で外部にロボットを提供するか。

まとめ

トヨタの発表は「人型ロボット40万台」ではありません。既存の産業用ロボットを含む工場設備全体を、2028年以降、AIを前提に段階的に作り替えていく構想です。年1兆円はその規模感を示す試算で、正式な投資決定ではありません。ELEYは研究デモの段階で、トヨタ自身も課題を率直に認めています。

他社と比べると、BMWの数字は実ラインで測った実績、現代自動車とUBTECHの数字は主に目標や企業発表、テスラは設備の建設中と、それぞれ性格が異なります。ロボット導入のニュースを読むときは、台数の大きさだけで比べないことが大切です。契約台数、実働台数、稼働時間、処理量を分けて見ることで、各社の実際の進み具合が見えてきます。トヨタの構想がどこまで実を結ぶかは、今後の実ラインでの数字の開示にかかっています。

土曜日, 9月 19, 2026

「193.6倍高速」をどう読むか ― TypeSafe Jevの公称値と実像

テキストを一切生成しないAIモデル、と言われたら何を思い浮かべるでしょうか。2026年9月15日、サンフランシスコのスタートアップ TypeSafe AI がステルスを脱して公開した「Jev(ジェヴ)」は、まさにそういうモデルです。自由文も、コードも、思考過程の説明も返しません。返すのは「この問い合わせは二重請求カテゴリである確率0.94」といった、型の付いた判断と確率だけです。

公開直後から日本の技術コミュニティでも一気に話題になりました。「既存のLLMがCPUなら、JevはそのGPU版」という評価がある一方で、「それ、既存LLMのlogitを読めば同じことができませんか?」という冷静な検証も同時に出てきています。TypeSafe自身は「最大193.6倍高速・444.6倍安価」と謳っていますが、この数字がどこまで一般化できるのかは、発表資料を読むだけでは判断できません。

先に結論を書きます。Jevは「回答候補が事前に定義できる判断」を高速・低コストで大量に回す用途には十分な実用性があります。ただし公称性能値はベンダー自己評価であり、参照値すら客観的な正解ラベルではありません。基幹の不可逆な意思決定をJev単独に委ねるのは時期尚早で、誤りを検出・救済できる判断層から、自前の評価データを用意して始めるのが妥当です。以下、その根拠を順に見ていきます。

本記事は2026年9月19日時点の公開情報にもとづきます。Jevは早期アクセス段階にあり、仕様・料金・レート上限・モデルバージョンはいずれも流動的です。また、性能に関する数値の多くはTypeSafe自身の評価であり、独立した再現検証は現時点で限定的です。本文中、事実として確認できた事項と、筆者の評価・推奨は区別して記述しています。

1. Jevとは何か

Jevは TypeSafe AI の旗艦モデルであり、同社が「System One Model」と呼ぶ新カテゴリの最初の公開モデルです。公式サイトは Jev の役割を unstructured state in, typed probabilistic decisions out(非構造の状態を入力し、型付きの確率的判断を出力する)と表現しています。入力として状況説明(state)と型付きの質問を受け取り、質問のスキーマが定める範囲の値と確率を返す。それだけです。

名称の由来は公式FAQとプレスリリースで説明されています。System One はダニエル・カーネマンが広めた「速い直感的思考(システム1)」に、Jev は「効率の改善がかえって総需要を増やす」というジェヴォンズのパラドックスで知られる経済学者 William Stanley Jevons に由来します。知能が安くなれば、これまで使う気にならなかった場所にまで知能が入り込む、という含意でしょう。

開発元の TypeSafe AI は2024年創業、サンフランシスコ本拠のAIラボです。2026年9月15日に DCVC 主導で約4,000万ドルのシード調達を公表しました。共同創業者は Diogo Almeida(CEO)、Erik Gafni(CTO)、Sasha Sheng(COO)で、Almeida は元OpenAIの研究者であり InstructGPT 論文やRLHF系の研究に貢献した人物です。プレスリリースでは「ChatGPTの共同発明者」と紹介されていますが、これは企業広報の表現であり、実態としては上記の理解が中立でしょう。

設計思想として TypeSafe が掲げるのは、「LLMは人間が読むテキストを生成するよう最適化されており、コードが判断を消費する用途にはミスマッチがある」という問題意識です。従来はLLMに構造化出力を無理やり吐かせ、パースし、検証し、それでも型エラーやリクエスト間のブレのリスクが残りました。Jevはその判断部分だけを切り出し、出力空間をスキーマで閉じてしまおうという発想です。公式ドキュメントは、大規模な自動化では機械対機械のやり取りが大半を占め、人間との対話はその一部にすぎない、という想定を置いています。

2. 3つのプリミティブと並列評価

Jevが答えられる質問は3種類だけです。この割り切りが設計の核心にあたります。

プリミティブ 返すもの confidence 主な用途
Choice 定義済み選択肢から選ばれた1つと、全選択肢にわたる確率分布 あり 問い合わせ分類、ルーティング、カテゴリ判定。選択肢は最大255
Score 順序付きルーブリック上の確率加重位置と、レベル別の分布 あり 品質採点、優先度付け、リランキング
Noul yes/no命題が真である確率(0〜1)のみ なし(確率そのものが答えのため) 条件判定、ガードレール、フラグ立て

実際のリクエストは、1つの state に対して複数の質問をまとめて投げる形になります。

{
  "model": "jev-latest",
  "state": "先ほどの注文が二重に請求されています。返金してください。先週も問い合わせましたが返事がありません。",
  "questions": {
    "category": { "type": "choice", "options": ["二重請求", "配送", "その他"] },
    "refund_requested": { "type": "noul", "statement": "顧客は返金を要求している" },
    "is_followup": { "type": "noul", "statement": "これは再問い合わせである" }
  }
}

この3つの質問は、1回のAPI呼び出しの中で並列かつ互いに独立に評価されます。質問を増やしてもレイテンシの増加は小さく、追加されるのは安価な入力トークン分だけです。質問同士が文脈を汚し合わないので、「カテゴリ判定の結果に引きずられて返金要求の判定が歪む」といった現象は起きません。

ただし、ここは誤解しやすいところです。質問の追加による文脈汚染(context rot)が起きないことと、state そのものが長くなっても劣化しないことは別の話です。公式のモデル特性文書(jaggedness)は、無関係な情報を多く含む大きな state は精度を落とすと明記しています。state は絞り込む必要があります。

推奨される使い方は、大きな問いを原子的な質問に分解し、合成はコード側で行う、というものです。「このスタートアップのピッチを評価して」と丸投げするのではなく、市場規模・技術的実現性・差別化をそれぞれ独立した質問にし、重み付けはプログラムで明示的に書く。判断ロジックがブラックボックスの中ではなくコードの中にあるので、レビューもテストも効きます。

3. 価格・制限・提供チャネル

公式の料金は入力10億トークンあたり42ドル、すなわち100万トークンあたり0.042ドルで、出力は無料です。出力が型に閉じているので課金対象にする意味がない、という設計です。逆に言えば、課金は完全に入力トークン依存であり、「1判断いくら」という固定単価は存在しません。1判断あたりのコストを見積もるなら、自分の state の長さで計算する必要があります。

現行モデルは jev-1.13.0 で、jev-latest と jev-preview は現在ともにこれを指します。エイリアスは更新時に挙動が変わり得るため、confidence の閾値をチューニングした本番システムではバージョンを固定し、レスポンスの model フィールドを記録しておくことが公式にも推奨されています。

項目 内容
入力形式 テキストのみ(文字列 / JSONオブジェクト / テキスト配列)。画像・音声・動画は非対応
コンテキスト長 リクエスト全体で64kトークン、state+最長の質問の組み合わせで32kトークン
レート上限 250,000 tokens/秒、1,200 requests/分(早期アクセス段階のため変動しうる)
Choiceの選択肢上限 255。超える場合はScoreで絞ってからChoiceで確定する二段構成を利用者側で組む
言語 英語が主要訓練言語で最も精度が高い。日本語を含むCJKは処理可能だが同等ではなく、自前評価が必要と公式が明記
提供形態 ホスト型APIのみ(重み非公開)。早期アクセスのwaitlist制

利用チャネルは公式HTTP API(POST https://api.typesafe.ai/v1/systemone)に加え、Python / JavaScript の公式SDK、Vercel AI Gateway、Cloudflare Workers AI、OpenRouter などのゲートウェイ経由があります。ただし各ゲートウェイで課金体系や表示される機能名に差があるため、TypeSafe直販APIの価格・上限をそのまま適用できると考えない方が安全です。

なお、GitHubの typesafe-ai/system-one-adapter-python を「Jevの公式SDK」と紹介している記事が散見されますが、これは誤りです。Adapterは OpenAI や Anthropic のLLMを TypeSafe 互換インターフェースに載せて比較するためのOSSであり、Jevを呼ぶためのものでも、Jevをローカルで動かすためのものでもありません。Jevの重みや学習実装は含まれていません。

4. 公称値をどう読むか

ここが本記事でもっとも注意して書きたい部分です。

TypeSafe は自社の workflow evals において「最大193.6倍高速、444.6倍安価」と報告しています。ただし同社自身が、これは現実世界で得られるゲインの上限側の結果だと公式ブログで注記しています。さらに重要なのは、この評価の作り方です。ワークフローは同社の model capabilities team が作成したもので、正解ラベルは用意されていません。参照値として使われているのは GPT-6 Astra と Claude Fable 5.1 の予測の平均です。

つまり、このベンチマークが測っているのは客観的な正解率ではなく、「特定の計算グラフの上で、2つのフロンティアモデルの平均とどれだけ近い答えを出すか」という一致度です。TypeSafe 自身もブログで、この参照解答の取り方が OpenAI・Anthropic のモデルに有利なバイアスをかけると認めています。

したがって、この eval で報告されている集約値(Jev 約67.8%、最良の比較対象 約74.1%)を「精度」と呼ぶのは不正確です。参照モデル平均との一致度として読むべきものであり、一般的な分類精度や、まして一般知能の指標として外挿することはできません。請求書処理のワークフローでは差が大きく開いており、タスク依存性もはっきりしています。

公称された主張 正確な読み方
最大193.6倍高速・444.6倍安価 TypeSafe自社evalにおける最大値。同社自身が現実的ゲインの上限側と注記している
集約スコア67.8% 正解率ではなく、GPT-6 AstraとFable 5.1の予測平均を参照値とした一致度
ハルシネーションが起きない スキーマ適合性の保証に限定される。出力空間外の生成や型違反は設計上防げるが、候補内での意味的な誤判定は防げない
較正された確率を返す 較正は予測群についての統計的性質であり、個々の回答の正しさを保証しない、と公式も明記
LLMではない 外部インターフェースと推論目的が生成LLMと異なる、という製品分類。内部アーキテクチャは非公開のため、言語モデル的な要素を一切使わないとまでは確認できない

訓練手法として TypeSafe が名前を出しているのは RLCD(Reinforcement Learning for Calibrated Decisions)で、RLHF(人間の好み)やRLVR(検証可能報酬)に対して「較正された判断」を最適化目標に置く、と説明されています。ただし報酬関数の設計、較正手法の詳細、較正曲線はいずれも非公開です。アーキテクチャについても「新規アーキテクチャ」「parallel sampler」「全確率を並列に出力」までは公開されていますが、内部の層反復や sampling 回数は開示されていません。したがって「1回のforward passで完結する」という説明は踏み込みすぎで、「自己回帰的にトークン列を生成せず、単一リクエストで複数の型付き判断を並列に返す」と書くのが正確です。

訓練データについては、TechCrunch が Almeida の説明として合成データのみを用いたと報じています。公式サイトやドキュメントの範囲では、査読論文・技術論文は確認できませんでした。

5. 第三者検証で見えたこと

公開から日が浅いため、独立した検証はいずれも小規模です。それでも、速度とコストの優位については複数の独立した観測が一致しています。

検証 規模 主な結果 留意点
Every(米メディア) 37文書 × 21問=777判定 0.7秒未満、約0.0025ドルで完了。別途12文書の欠陥検出比較では、Jevが6/7検出に対しFable 5.1が7/7、速度は約25倍と報告 公式ベンチの再現試験ではなく、別用途のハンズオン。タスク条件とコスト算定を公開本文から完全には再構成できない
lindfors.no(ノルウェー語) 24文書 × 各11問 中央値0.32秒、1,000文書換算0.22ドル。Choiceのトップ確率0.9以上では stance 14/15、respondent 20/20 が参照ラベルと一致 著者自身が「benchmarkではなくfirst look」と明記。基準ラベルはFable 5.1生成のため、正解率ではなくモデル間一致
Near Here(英国) 実出品50件のモデレーション判定 Jev 96%に対しMistral Small 4が84%、Gemini 3.5 Flash-Liteが86%。平均0.59秒/判定、1,000件あたり0.043ドル サンプル数50件と小さく、単一サービスのドメイン特化タスク

これらを「公式の193.6倍/444.6倍を独立に追認した」と表現するのは不適切です。いずれも別のタスクで、別の条件下で、低レイテンシと低コストを観測した、というのが正しい整理です。一方で、精度については「フロンティアモデルにやや劣るが実用範囲」という傾向が共通して見えており、これはTypeSafe自身のeval結果とも矛盾しません。

lindfors.no の検証で興味深いのは、質問文の書き方で較正が悪化したという報告です。同じタスクで、短いdraft wordingを長いcareful wordingに変更したところ、ECE(期待較正誤差)が0.040から0.116に悪化しました。これは「質問文一般に敏感」という広い証明ではなく一例ですが、プロンプトエンジニアリング的な感度がJevにも存在することは示しています。

6. 較正はどこで崩れるか

Jevの売りは「較正された確率」です。85%と言ったら実際に85%正しい、という性質が成立していれば、confidence を閾値にした自動化・エスカレーション設計が可能になります。では、その較正はどこまで信頼できるのか。

公開されている反例として、サイコロの実験があります。隠されたサイコロの出目をChoiceで400回尋ねたところ、Jevは400件すべてで「1」を選び、平均約83%の確信度を付けました。真の確率は1/6です。同じ問いをNoulで尋ねると約19%となり、1/6(約16.7%)にかなり近い値が返りました。実験者本人がコードとデータを公開したうえで報告しています。

ただしこれは、「観測情報がまったくない対称な問題について、事前確率を答えられるか」という分布外・認識的不確実性の試験です。業務文書の分類における較正が一般に失敗することを直接証明するものではありません。適切な理解は、RLCDによる較正は万能ではなく、プリミティブの選び方や情報の欠如した対称問題では大きく崩れる反例が存在する、というものでしょう。

実務への含意は明確です。Choiceのトップ確率をそのまま「正しさの確率」として読んではいけません。自分の用途のデータで reliability diagram、ECE、Brier score、coverage-risk 曲線を測り、そのうえで閾値を決める。accuracy だけを見て calibration を見ないと、confidence ゲーティングの設計自体が砂上の楼閣になります。

7. 「それ、既存LLMでできませんか?」

日本の技術コミュニティで最も鋭かった反応がこれです。回答候補をそれぞれ単一のトークンIDに割り当て、最初のトークンのlogitsを読み出す。あとはバッチ推論とKVキャッシュの再利用を組み合わせれば、既存のLLMでもJevに近い高速な限定選択が実装できるのではないか、という指摘です。

この批判は技術的に妥当です。Zennでは Gemma 3 270M を用いた自作実装でJSON生成比77倍の高速化が報告され、海外でも Sean Goedecke が、1トークン制約とバッチングによって速度・一貫性・並列性の多くは再現できると論じています。実際、オープンモデルのlogitを直接読む模倣実装が公開数日でGitHubトレンド入りしました。

ただし、これがJevの性能全体を再現した証拠ではない点も押さえておく必要があります。TypeSafe の差別化仮説は、専用訓練、確率較正、APIとしての一貫した型、並列推論基盤、そして低価格での運用を一体化した点にあります。個々の要素は模倣可能でも、束ねて安定運用するのは別の話です。とはいえ、公開情報だけでは技術的moatの強弱を確定できないのも事実で、大手が同等機能を提供してきた場合にどうなるかは未知数です。

現時点で言えるのは、「Jevでしかできないこと」があるというより、「Jevだと考えなくていいことが増える」という性質の優位だろう、ということです。既存LLMがCPUでJevがGPUだという比喩は、この感覚をよく捉えています。汎用性を捨てて特定の形の計算に特化し、その代わり桁で速い。

8. 導入をどう判断するか

ここからは筆者の評価です。事実認定ではなくリスク判断として読んでください。

早期アクセス段階であること、レート上限が動的であること、モデルが更新されうること、非英語での性能差があること、公開されている技術情報が少ないこと。これらを踏まえると、基幹的で高リスクで不可逆な判断をJev単独に委ねるのは時期尚早です。一方で、「Jevは本番投入すべきでない」という一般命題は強すぎます。

誤りを検出・救済できる判断層であれば、shadow mode や限定トラフィックでの本番導入は合理的です。具体的には以下のような領域が該当します。

  • 問い合わせの分類とルーティング(誤分類は後段で人が拾える)
  • LLM出力の検証・スコアリング(判定そのものが補助信号)
  • ガードレールの一次フィルタ(危険コマンド、不適切コンテンツの検出)
  • RAGのリランキングや候補絞り込み(最終判断は別途)
  • 既存LLM呼び出しのうち、実質的に分類しかしていない箇所の置き換え

導入時の設計原則としては、confidence を行動可否の第二軸に置くこと。公式も confidence-gated routing のパターンを示しています。ただし「0.9以上なら自動、0.4未満ならフォールバック」といった閾値は普遍的な値ではありません。誤判定のコスト行列、偽陽性と偽陰性の非対称性、クラス別の較正、カバレッジ目標から決めるべきもので、記事や文書に出てくる数値はあくまで例示です。

日本語環境で使うなら、自前のベンチマークは必須です。英語前提で訓練されたモデルである以上、日本語での confidence 分布やECEが英語と同じである保証はありません。LLMに英訳させてから渡すという回避策もありますが、それでは速度とコストの優位が消えてしまうので、まず日本語のまま評価するのが筋でしょう。なお、サービスが米国西海岸で提供されている点は公式ブログから読み取れますが、リージョン一覧や日本からの具体的な追加レイテンシについて公式の保証は確認できていません。国内から使う際のネットワーク遅延は、自分の環境で実測してください。

判断を切り替えるべきタイミングとしては、次のあたりが目安になります。第三者の中立なハーネスで精度パリティが再現されること。較正が難易度や敵対的入力に対しても崩れないことが示されること。日本語で confidence 0.9以上の正答率が自社の運用要件を満たすこと。そして料金体系が維持されること。現状の価格が補助金的なものである可能性は、TypeSafe自身も否定していません。

まとめ

Jevは、AIに「考えさせる」のではなく「判定させる」ためのモデルです。出力空間をスキーマで閉じ、確率を較正し、並列に返す。この割り切りによって、これまでコストとレイテンシの制約でAIを入れられなかった場所に判断を差し込めるようになりました。LayerXが社内勉強会で得た気づきとして「既存のLLM呼び出しを置き換えるだけでなく、これまでAIを使うと考えなかった場所に差し込む」発想の転換を挙げているのは、この性質を的確に言い当てています。

一方で、公開されている性能値の多くはベンダー自己評価であり、参照値すら客観的な正解ラベルではありません。「ハルシネーションゼロ」はスキーマ適合性の話であって意味的な正しさの話ではなく、「較正されている」は予測群の統計的性質であって個々の回答の保証ではない。この区別を曖昧にしたまま設計すると、静かに間違い続けるシステムができあがります。

技術としては面白く、実用的価値もある。ただし、ベンダーの宣伝値と、第三者の小規模試用と、客観的に検証された事実は、それぞれ別のものとして扱う必要があります。低リスクな判断層から、自前の評価データで calibration まで測りながら始める。当面はそれが現実的な向き合い方だと考えます。

参考資料

木曜日, 9月 17, 2026

AIはミレニアム懸賞問題を解いたのか ― ナビエ–ストークス「解決」発表の実像

数学には「解けたら100万ドル」という問題が7つあります。クレイ数学研究所(CMI)が2000年に掲げた「ミレニアム懸賞問題」です。四半世紀のあいだに正式に解決されたのはポアンカレ予想ただ1つで、残る6問は数学の最難関として手つかずに近い状態が続いてきました。

ところが2026年9月、OpenAIが「AIがナビエ–ストークス方程式の問題を解いた」と発表し、同じ朝にNYUの数学者とAnthropicの研究者が近い結果を公表したことで、帰属をめぐる論争まで起きました。AIが数学オリンピックで金メダル相当に届いたのが2025年夏ですから、わずか1年余りで「懸賞問題」の土俵に上がってきたことになります。これは本当に「AIが数学の最難関を解いた」瞬間なのでしょうか。

先に結論を書くと、AIが数学研究の現場を大きく変えつつあるのは確かですが、「ミレニアム問題が解かれた」と言い切れる段階ではありません。OpenAIの主張は4つある選択肢のうち「外力あり」の2つに関するもので、CMIは状態を「active」に変更したものの、賞の授与も独立検証もまだです。本記事では、ミレニアム問題の基本から、AIと数学の最新動向、そして「解決」ニュースの読み方までを整理します。

本記事は2026年9月17日時点の情報に基づきます。ナビエ–ストークス問題の検証は進行中であり、今後のCMIの判断や査読の結果によって評価が変わる可能性があります。また、後半の見通しに関する記述は筆者の見解であり、精密な予測ではありません。

1. ミレニアム懸賞問題とは

CMIは2000年5月24日、パリのコレージュ・ド・フランスで開いた会合で7つの問題を発表しました。基金は総額700万ドル、1問あたりの賞金は100万ドルです。1900年にダフィット・ヒルベルトが同じパリの国際数学者会議で提示した「23の問題」を意識した企画で、リーマン予想は両方のリストに入っています。

受賞の手続きは意図的に慎重に作られています。解答をCMIに直接送ることはできず、まず評価の確立した査読付き数学誌に掲載され、さらに掲載後2年間を経て数学界で一般に受け入れられる必要があります。その後にCMIの科学諮問委員会が検討に入ります。反例による否定的解決の場合も同様の待機期間が設けられています。「証明が出た」ことと「賞が授与される」ことの間には、少なくとも数年の距離があるわけです。

2. 7つの問題の中身

7問は分野もばらばらです。専門的な定式化は省き、何を問うているのかを一言でまとめると次のようになります。

問題 分野 何を問うているか 2026年9月時点の状況
P対NP問題 計算機科学 答えを速く「検証」できる問題は、速く「解く」こともできるのか 未解決。P≠NPと考える研究者が多数派
ホッジ予想 代数幾何 複雑な図形の位相的な特徴の一部が、代数的な部分(代数的サイクル)の組み合わせで表せるか 未解決
ポアンカレ予想 トポロジー 「穴のない」閉じた3次元空間は、本質的に3次元球面と同じか 解決済み(ペレルマン、2002〜2003年)
リーマン予想 数論 ゼータ関数の非自明な零点は、すべて実部1/2の直線上にあるか。素数の分布と直結する 未解決。数値的には膨大な範囲で成立を確認済み
ヤン–ミルズ方程式と質量ギャップ 数理物理 素粒子の標準模型の土台となる量子場の理論を数学的に厳密に構成し、正の「質量ギャップ」を示せるか 未解決
ナビエ–ストークス方程式 偏微分方程式 滑らかな流れは永遠に滑らかなままか、それとも有限時間で速度が発散する「特異点(爆発)」が生じうるか CMIが状態を「active」に変更。賞は未授与(第5〜6章)
バーチ・スウィンナートン=ダイアー(BSD)予想 数論 楕円曲線上の有理点の「多さ」(ランク)が、対応するL関数の振る舞いで決まるか 未解決

IT技術者にとって最も身近なのはP対NP問題でしょう。公開鍵暗号の安全性は「ある種の計算は現実的な時間では解けない」という前提に立っており、P=NPが示されればその前提が根本から揺らぎます。CMIに掲載されたスティーヴン・クックの公式問題文は、P=NPが成り立つなら、妥当な長さの証明をもつ定理の形式的証明をコンピュータが見つけられるようになり、その例にはCMIの懸賞問題すべてが含まれうる、とまで書いています。AIと数学の関係を考えるうえで、示唆的な一文です。

3. 唯一の解決例:ポアンカレ予想

ロシアの数学者グリゴリー・ペレルマンは、2002年から2003年にかけて3本の論文をプレプリントサーバのarXivに投稿し、リチャード・ハミルトンが始めた「リッチ・フロー」の理論を発展させてポアンカレ予想を証明しました。注目すべきは、彼が論文を査読誌に投稿しなかったことです。複数の専門家チームが数年かけて内容を検証し、その結果として証明が受け入れられました。

ペレルマンは2006年のフィールズ賞を辞退し、2010年にCMIが授与基準を満たしたと発表したミレニアム賞も辞退しました。ミレニアム賞の辞退理由として、ハミルトンの貢献が自分に劣らないことを挙げたと伝えられています。この一件は、ミレニアム問題の「解決」が、論文の公開ではなく数学界による長期の検証によって確定するものだということをよく示しています。

4. AIは数学をどこまで変えたか

2026年9月の出来事を理解するには、ここ数年の「AI×数学」の流れを押さえておく必要があります。大きく分けると、競技数学での到達、未知の構造やアルゴリズムの発見、そして定理証明支援系(Lean)による形式化の3本柱です。

時期 主体 成果 読むときの注意
2022年 He、Lee、Oliver、Pozdnyakov 楕円曲線のデータに機械学習を適用する過程で、振動パターン「murmurations」を発見(arXiv:2204.10140) BSD予想の解決ではなく、関連する新現象の発見
2024年7月 Google DeepMind 国際数学オリンピック(IMO)で、AlphaProofが非幾何の3問、AlphaGeometry 2が幾何の1問を解き、合計28/42点(銀メダル相当)。論文は2025年11月にNature掲載 4問はAlphaProof単独の成果ではない。金メダル境界まで1点
2025年 Google DeepMind AlphaEvolveが4×4の複素数行列の積を48回のスカラー乗算で計算する手法を発見(1969年のシュトラッセン法の49回を56年ぶりに更新)。11次元の接吻数の下界を592から593へ 「50超の問題の約75%で既知最良と一致、約20%で改善」はDeepMind自身の評価
2025年7月 OpenAI、Google DeepMind 汎用の推論モデルがIMO 2025で6問中5問を解き、35/42点(金メダル相当) 競技数学は答えが既知で、研究数学とは性質が異なる
2026年9月4日 Anthropic Claudeがフェルマーの最終定理の証明を11日間ほぼ自律的にLeanで形式化。約1,300万行、30,300個の定理を証明し、うち29,500個を最終証明で使用 既に人間が証明した定理の形式化であり、新定理の発見ではない
2026年9月8日 OpenAI ナビエ–ストークス方程式の有限時間爆発について、解析的証明とLean形式化を発表 「外力あり」版。帰属論争あり、CMIの検証は未了(次章)

なかでも見逃せないのが形式化の進展です。Leanのような定理証明支援系で書かれた証明は、機械的にチェックできます。人間が数百ページの論文を何年もかけて読み解く必要があった従来に比べ、「証明が正しいか」の確認コストを大きく下げられる可能性があります。フェルマーの最終定理の形式化は、Leanの数学ライブラリMathlibの約5倍という規模で、インペリアル・カレッジ・ロンドンのケヴィン・バザード氏も自動形式化の成果として高く評価しました。AIが大量の証明を生み出す時代に、その正しさを誰がどう保証するのかという問題への一つの答えがここにあります。

5. 2026年9月、ナビエ–ストークス問題に何が起きたか

「爆発」を探す長い助走

ナビエ–ストークス方程式は、粘性のある流体の運動を記述する方程式で、気象予測から航空機設計まであらゆる工学の土台になっています。問題の核心は、滑らかな初期状態から出発した流れが、有限の時間で速度が無限大に発散する「爆発」を起こしうるかどうかです。

数学者たちは、本命に挑む前段階として、粘性のないオイラー方程式など、より扱いやすい方程式で爆発を探してきました。LuoとHouが数値計算で有力な爆発候補を示し、2022年にはChenとHouがコンピュータ支援証明によってその爆発を厳密に裏付ける成果を出しています。ただ、こうした「安定な」爆発に対し、ナビエ–ストークスで起こりうる爆発は、ごく微妙な条件下でしか現れない「不安定な」ものだと考えられてきました。

ここでAIが登場します。NYUのトリスタン・バックマスター氏らは、物理法則を組み込んだニューラルネットワーク(PINN)で自己相似解を直接探す手法を開発しました。2025年9月にはGoogle DeepMindやスタンフォード大学などとの共同研究として、複数の流体方程式で不安定な特異点の新しい族を系統的に見つけたとするプレプリントを公開しています。

OpenAIの発表

2026年9月8日(発表資料の日付は9月7日)、OpenAIは非公開の内部モデルを使い、約1万のAIエージェントが88時間稼働して、ナビエ–ストークス方程式が有限時間で特異点を生じうることの解析的証明と、そのLeanによる形式化を生成したと発表しました。この内部モデルは、公開中の最新モデルGPT-6 Astraよりも高性能だとされています。エージェント数や稼働時間はOpenAI自身の公表値であり、計算の過程を第三者が検証したものではありません。

BBCはこれを、ミレニアム賞が求める4つの記述のうち2つを解決したものと報じています。この「4つのうち2つ」という点が、次章で説明するように非常に重要です。

同じ朝に出た、もう一つの証明

OpenAIの発表の直前、バックマスター氏とAnthropicの研究者レヴェント・アルペゲ氏が、約1年取り組んできた成果として、外力のあるオイラー方程式の爆発を含む3つの証明を公表しました。こちらもLeanで形式化されており、両陣営の証明が同じ朝に出そろう形になりました。

バックマスター氏は、OpenAIが自分たちの進展を知ったうえで同じ道筋を追ったと主張しました。論点の一つは、同氏がOpenAIのコーディングツールCodexを研究に使っていたことで、そのやり取りがOpenAI側の研究に影響したのではないかというデータの扱いをめぐる疑問です。OpenAIはこの主張を「断じて虚偽」だと否定し、手法も異なると反論しています。双方の主張は食い違っており、2026年9月17日時点で決着はついていません。

テレンス・タオ氏はこの件について、バックマスター氏らの成果を高く評価する一方で、噂だけでAI企業が巨大な計算資源を投入し、人間の研究者がアイデアを育てきる前に問題が「刈り取られて」しまう危うさや、AI企業が数学の成果を論文や講演ではなくプレスリリースで伝える姿勢への懸念を示しています。良質な未解決問題は有限の資源であり、それがAIによって急速に消費されていくことへの問題提起でもあります。

6. 「解決」と言えるのか:4つの選択肢とCMIの判断

CMIのナビエ–ストークス問題は、チャールズ・フェファーマンが書いた公式問題文で、次の4つのいずれかを証明すれば解決とみなすと定めています。「滑らかさが保たれる」を示す肯定的な2つと、「破綻する」を示す否定的な2つです。

選択肢 内容 外力 2026年9月時点
A 3次元全空間で、滑らかな解が永遠に存在し滑らかさを保つ なし 未解決
B 周期境界条件の空間で、同じく滑らかさを保つ なし 未解決
C 3次元全空間で、滑らかな初期値と外力から出発しても滑らかな解が続かない例がある あり OpenAIが証明を主張
D 周期境界条件の空間で、同様の破綻例がある あり OpenAIが証明を主張

規定上はどれか1つを示せば解決です。ただし、流体に外から力を加え続けることを許すC・Dと、外力なしで流体そのものの性質を問うA・Bとでは、数学的な意味合いが異なります。多くの数学者が「本丸」と見てきたのは外力なしの問題であり、こちらは依然として手つかずです。「ナビエ–ストークス問題が解けた」という見出しだけを見ると、この区別が抜け落ちてしまいます。

CMIは2026年9月10日付の声明で、ナビエ–ストークス問題は「解決されたようだ(apparently been settled)」と述べました。翌11日には、検証と帰属を判断するプロセスは意図的に急がないものだと改めて強調し、公式サイト上の状態を「unsolved」でも「solved」でもない「active」に変更しています。賞は授与されておらず、第1章で説明した査読付き掲載と2年間の待機期間という手続きもこれからです。

7. 残る5問とAIの距離

ナビエ–ストークス以外の未解決5問について、AIとの関わりは問題ごとにかなり違います。

リーマン予想は、計算機との付き合いが最も長い問題です。アラン・チューリングも初期のコンピュータで零点の検証を行いました。現在の到達点の一つであるPlattとTrudgianの研究(arXiv:2004.09765)は、区間演算を用いて厳密に、高さ3×1012までのすべての非自明零点が実部1/2の直線上にあることを確認しており、その数は12兆3,631億個を超えます。とはいえ、零点は無限にあるため、どれだけ数値検証を積み重ねても証明にはなりません。

BSD予想では、前述のmurmurationsがAIによる発見の好例です。その後、ニーナ・ズブリリナ氏がこの現象に初めて厳密な理論的説明を与え、論文は2025年にInventiones Mathematicaeに掲載されました。機械学習がパターンを見つけ、人間の数学者が理論を与えるという分業は、AI支援数学の一つの型になりつつあります。ただし、これはBSD予想そのものの解決に直結する成果ではありません。

P対NP問題は、AIにとって最も遠い問題かもしれません。計算量の下界を示す深い分離定理は、既知の証明手法そのものに障壁があることが知られており、探索や形式化の力だけで突破できる見通しは現時点で立っていません。一方で、AIの側から見るとこの問題は他人事ではありません。学習の計算量的な困難さや暗号の安全性は、P≠NPかそれに類する仮定の上に立っているからです。

ホッジ予想とヤン–ミルズ問題は、そもそも問題を正しく定式化して形式化するところから難しく、現時点でAIによる目立った進展は報告されていません。ヤン–ミルズ問題は量子場の理論の厳密な構成を要求しており、数学的な土台づくりそのものが課題です。

ナビエ–ストークスが最初の舞台になったのは、偶然ではないと筆者は考えています。「爆発する解を見つける」という問題は、候補を数値的に探索し、見つかった候補を厳密に証明するという、AIと計算機が得意とする手順に分解しやすい構造を持っていました。すべてのミレニアム問題がこの形に落とし込めるわけではありません。

8. 競技数学と研究数学のギャップ

AIの数学能力を測るベンチマークの推移も、状況を読むうえで参考になります。Epoch AIのFrontierMathは、2024年11月の公開時点では、当時の最先端モデルでも正答率2%未満という難問集でした。

その後、2026年6月12日に改訂版(v2)が公開されました。元の問題の約42%に誤りが見つかって修正され、全338問(Tier 1〜3が295問、研究レベルのTier 4が43問)の構成になっています。旧版とはスコアの互換性がない点に注意が必要です。報道やリーダーボード集計によれば、GPT-6 AstraはTier 4(v2)で97.6%に達し、このベンチマークはほぼ飽和したとされます。

対照的なのが、Epoch AIが本当に未解決のエルデシュ問題68問をLeanで形式化した「FrontierMath Erdős」です。報道によれば、GPT-6 Astraが解けたのは68問中2問(約3%)で、他のモデルは0問でした。答えの決まった難問ではほぼ満点を取れても、誰も答えを知らない問題になると急に正答率が落ちる。この落差こそが、現在のAIの数学能力の実像です。

その意味で、2026年9月のナビエ–ストークスの件は、この落差を越えた可能性のある最初の大きな事例として注目されています。一方で、1万のエージェントを88時間動かすという計算規模や、先行する人間の研究との関係を考えると、「AIが単独で成し遂げた」と単純に言える話でもありません。

9. 「AIが解いた」ニュースの読み方

今後も「AIが難問を解いた」という見出しは増えるはずです。ミレニアム問題に関するニュースを読むときは、少なくとも次の点を確認すると、見出しと実態のずれを見抜きやすくなります。

  • 査読を経ているか。企業の発表やarXivのプレプリントは査読前です。CMIの賞は査読付き掲載と2年間の待機を前提としています。
  • 公式問題文のどの記述を満たすのか。ナビエ–ストークスであれば、外力ありのC・Dか、外力なしのA・Bかで意味が大きく変わります。
  • CMI自身がどう表現しているか。2026年9月時点の公式の状態は「active」であり、「solved」ではありません。
  • 数値は誰の申告か。エージェント数、稼働時間、ベンチマークスコアの多くは開発元の自己申告か第三者の集計で、独立検証されていないことがあります。
  • 「発見」「形式化」「解決」を区別しているか。既知の証明の形式化や、関連する新現象の発見は重要な成果ですが、懸賞問題の解決とは別物です。

また、今回の帰属論争は、未公表の研究をAIツールに入力する研究者にとって現実的なリスクを示しました。業務でAIツールに機密情報を扱わせる企業にとっても、データの扱いに関する規約と実際の運用を確認しておく必要性を示す事例と言えます。

まとめ

ミレニアム懸賞問題は、2000年にCMIが掲げた7つの難問で、2026年9月時点で正式に解決されたのはポアンカレ予想だけです。ナビエ–ストークス問題については、OpenAIとバックマスター氏・アルペゲ氏の双方からLeanで形式化された成果が同時期に出され、CMIも状態を「active」に変えましたが、それは外力ありの選択肢に関するもので、賞の授与も独立検証もまだ先です。

AIと数学の関係は、この数年で「難問集で点数を取る」段階から、「未知の構造を見つける」「証明を形式化して検証する」「研究者と一緒に未解決問題に挑む」段階へと移ってきました。競技数学やベンチマークでは人間のトップに並んだ一方、本当に答えの分からない問題ではまだ正答率が大きく落ちます。

筆者の見立てでは、当面の焦点は二つです。一つは、ナビエ–ストークスの主張が査読とCMIの手続きを通過するかどうか。もう一つは、本丸である外力なしの問題や、性質の異なる他のミレニアム問題に、同じ手法がどこまで通用するかです。いずれにしても、「AIが解いた」という見出しより、誰が何をどの手続きで確かめたのかに目を向けることが、これからますます重要になるでしょう。