IT業界で「ハイパースケール」と言えば、巨大なデータセンターを想像する方が多いと思います。数万基のGPUと数百メガワットの電力を消費する、小さな町ほどの施設です。これまでは、フロンティアAIモデルの「学習」に高い集積度が不可欠だったため、この定義がAIブームの標準的な設計図でした。
しかし、学習は序章にすぎません。すでにモデルが存在する今、業界の課題は「それらをあらゆる場所で、常に、あらゆるタスクのためにどう稼働させるか」に移っています。これは「推論」の課題であり、学習時と同じアーキテクチャでは対応できません。本記事では、この推論フェーズにおいて、インフラのスケールがどう再定義されるべきかを探ります。
AIエージェントが変えるインフラの力学
この変化を決定づけているのは、チャットからAIエージェントへの移行です。両者の違いを明確にする必要があります。
チャット型LLMは、リクエスト・レスポンス方式のシステムです。ユーザーは質問を入力し、1、2秒待ってから回答を読みます。トラフィックのパターンは人間の集中力に依存しており、1秒のレイテンシーはほとんど気になりません。そのため、少数の巨大なクラウドリージョンからワークロードを処理しても、誰からも不満は出ません。
一方、AIエージェントはひとつのタスクを完了するまでに、手順の計画、ツールの呼び出し、結果の確認、次のアクションの決定など、数十から数百の推論を実行します。時には別のAIエージェントにタスクを引き継ぎ、このループを繰り返すこともあります。これらのコールの間には、レイテンシーを許容してくれる人間は存在しません。代わりに、遅延はどんどん蓄積されていきます。もし遠隔のリージョンとの通信で1ホップあたり200ミリ秒のラウンドトリップタイムが発生すれば、20ステップのワークフローで「何もしていない時間」が4秒も生じます。しかも、そうしたワークフローが1日に数百万回も実行されるのです。
今後想定される規模を考えると、この問題は無視できません。IDCの予測によると、2029年までに世界でアクティブに展開されるAIエージェントは10億を超え、2025年の約40倍に達します。また、これらのエージェントは1日あたり2,170億回以上のアクションを実行し、拡大し続ける推論負荷を支えるために毎日3.7テラトークン(3兆7,000億トークンおよびコール)を消費すると見込まれています。
このような未来において、すべてのコールを少数のメガリージョンに送り返すという選択肢はあり得ません。レイテンシーがパフォーマンスのボトルネックになるだけでなく、経済的なコストもさらに悪化するためです。
チャットのトラフィックでは誤差の範囲だったエグレス(出方向の通信)や長距離通信のコストも、1日2,170億回の処理となれば、無視できないコストとなります。さらに、エージェントが扱うデータの大半(POSシステム、工場の現場、患者のカルテなど)は、国外に持ち出せない、あるいは建物外に出すべきではない性質のものです。中央集権型のハイパースケールなアーキテクチャは、そもそもこうした未来を想定して設計されていません。
ハイパースケールをどう捉え直すか
AIエージェントが主体となる世界では、重要になるのは「巨大さ」ではなく「速度」です。規模の大きさよりも、どれだけ広範囲に「到達」できるかが問われます。重要な指標は、「1カ所にどれだけの電力を集約できるか」から、「どれだけ多くの場所に推論環境を置けるか」へとシフトしています。具体的には、どの都市やどの国に配置できるか、そしていかにデータやユーザー、AIエージェントの近くで推論を実行できるかが焦点となります。
地域のデータセンター、都市部のエッジサイト、各国のデータソブリンを満たす環境などに分散された推論キャパシティのフットプリントが、単一の巨大なフラッグシップ拠点よりも重要視され始めています。
これはスケールアウトのアプローチであり、過去10年間の常識を覆す変化でもあります。中央集権的な巨大リソースが「学習」を可能にしたとすれば、物理的な近さは「推論」を実用的なものにします。
AI推論インフラに不可欠な3つの要件
インフラの運用者や、その上でAIアプリケーションを設計するチームにとって、いくつか妥協できない条件があります。
- 柔軟性: エージェントの需要は均等でも安定したものでもありません。ある地域で急増したかと思えば別の地域で落ち着き、モデルやワークロードの進化に伴って変動します。どのようなインフラを構築するにせよ、建物の物理的な場所に縛られるのではなく、需要に合わせてキャパシティを動かせる設計である必要があります。
- レイテンシー: 先述の理由から、エージェントを実用化するには、アクションが発生する場所の「近く」で推論を実行しなければなりません。ここでの「近く」とは、4、5カ所の大きなリージョンに頼るのではなく、数十から数百に及ぶ展開ロケーションのポートフォリオを意味します。
- スケール時のコスト維持: これが最も困難な部分です。高額な投資をすれば、誰でも低いレイテンシーを手に入れることはできます。重要なのは、トークン量が増加しても費用対効果を維持できることです。日常的なAIエージェントのコールに対して毎回プレミアムなリージョン料金を支払うのではなく、適切な規模の設備、妥当な電力コスト、そして短いデータ経路を備えたロケーションを選ぶことが求められます。
アーキテクチャ設計の新たな前提
もしAI戦略が、すべての推論処理を1つか2つの中央集権的なクラウドに集約されることを前提としているなら、それは「チャットボット時代」のアーキテクチャです。一方で、AIエージェント時代は、そのアーキテクチャでは到底対応できないスピードで進み始めています。今後5年間で成功を収めるアプリケーションは、最初から「分散」を最優先の設計要件として扱うようになるでしょう。レイテンシーを考慮したルーティング、多数のロケーションにまたがるモデル提供、データの局所性を尊重したデータパイプライン、そしてAIエージェントによる莫大な通信量に耐えうるコストモデルが不可欠です。
「スケールアップ」の時代が、私たちに優れたAIモデルをもたらしました。次に何が起きるかは完全に推論にかかっており、推論には分散型アーキテクチャが求められます。ハイパースケールは縮小しているわけではありません。その概念が根本から再定義されているのです。
過去10年間の評価基準は、「1カ所にどれだけのコンピューティングパワーを集中させられるか」でした。しかしこれからの10年は、「それらをいかに効率的に分散させられるか」が問われます。AIエージェント時代における真のスケールとは、もはやフットプリントの「大きさ」ではなく、「近さ」によって測られるのです。
Tags