AIによる利益は、損益計算書に反映されることがほとんどなく、これは通常、モデルではなくアーキテクチャ上の問題です。チームは動作するパイロット版をリリースするが、その後、レイテンシや予期せぬコンピューティング負荷、そして誰も予算を確保していなかったセキュリティインシデントによって、その成果が失われてしまう。このモデルは性能を発揮します。しかし、その基盤となるインフラは、本番環境での負荷を処理するために構築されていませんでした。
アカマイは、システム障害が発生する箇所を特定するため、2つの検証調査を実施しました。「AI推論の現状 2026」では、生産環境で推論を実行している200人の実務家を調査しました。そのうち3/4はエンジニアやアーキテクトで、ほとんどがデプロイメントの意思決定者でした。2026年APIセキュリティ影響調査では、6つの業界と10か国にわたる1,840人のセキュリティ専門家を対象に調査が行われました。
この2つの報告書は、共に同じ結論を導き出しています。多くのチームは、トレーニング用に設計されたインフラを拡張して推論にも利用していますが、そのギャップはコスト、レイテンシ、セキュリティリスクとして顕在化しています。
そのギャップは、以下 の3つの要素が揃ったときに解消されます。
生活環境に適応する建築様式
そのアーキテクチャに組み込まれたセキュリティは、後付けではなく最初から設計に組み込まれています。
推論処理は、リアルタイム処理を実現するために、ユーザーにより近い場所で行われる。
これらのどれもが、それ自体では目新しいものではない。問題は、それらを別々のチームが所有する独立したプロジェクトとして扱うことだ。
まずは解剖学から始めましょう。推論とは、学習済みのモデルが新しい入力データを受け取り、出力を生成するリアルタイムのプロセスです。すべての推論処理はAPI呼び出しとして実行されるため、モデルとAPIは別々の問題として扱う必要はありません。それらは同じリクエストパス、同じ障害モード、そして同じ攻撃対象領域を共有しています。その考え方は両方の調査に共通しています。
中央集権が真に崩壊する場所
集中型推論は決して失敗する運命にあるわけではない。トレーニング、バッチ処理、遅延許容型ワークロードの場合、計算リソースを少数の大規模な地域に集中させることが最適な選択となることが多く、Akamaiもその方法で多くのワークロードを実行しています。データが示す物語は、より限定的で、より実用的なものだ。集中化は、特定の成長するワークロードの種類に対して破綻しており、多くのチームがそれに対応した再設計を行っていない。
AI推論に関する調査報告書によると、75%の企業が生成AI(GenAI)を実用化しているものの、そのインフラ整備は追いついていないことが明らかになりました。現在、ワークロードの多くが、遠隔地への往復通信では対応できない厳しいリアルタイム遅延要件を必要としており、実務者の60%がユーザーやデータへの近接性を「重要」または「不可欠」と評価しています。
それでも、46%の企業は依然として単一の中央集権的な地域から推論を実行しています。問題は、集中化がどこでも失敗するということではなく、生産推論の需要がますます高まっており、集中化された環境ではユーザーにより近い場所で処理する必要があるという点にあります。
最初に負荷に耐えられなくなるワークロードは予測可能です。例えば、ライブトランザクション内の不正スコアリング、ボイスエージェント、リアルタイムのパーソナライゼーション、そして回答を返す前に複数のモデル呼び出しを連鎖させるエージェント型パイプラインなどです。各ホップは前のホップの遅延時間を引き継ぎます。その負荷を特定の地域に集中させると、利用が増加するにつれて待ち時間がさらに長くなり、最も負荷がかかっている状況で数百ミリ秒の遅延が発生します。
つまり、真の論点は、中央集権か分散化かという信仰上の問題ではないのです。近接性を必要とするワークロードと必要としないワークロード正解を導き出すチームは、この問題を意図的に、ワークロードごとに検討し、すべての処理を特定の地域に集中させることでレイテンシのペナルティを被ることを避けています。
柔軟なアーキテクチャと、見えないコスト
ROIが低い場合、それは通常、チームがアーキテクチャ的な解決策ではなく、運用面で問題を補っていることを示しています。重要なのはユニットエコノミクスです。つまり、トークン単位またはクエリ単位で測定される、単一の推論リクエストにかかるコストのことです。その数字が見えなければ、最適化はできず、機会が失われた瞬間を捉えることもできません。
ほとんどのチームはそれを見ることができない: 77%の組織では、推論に基づいて追跡可能な一貫したユニットレベルの経済性が欠如しており、その結果、大半の組織は、特定の業務がスケールするにつれてコストが低下しているのか、それとも上昇しているのかを判断できない状況にある。その可視性の欠如は、セキュリティ上の脆弱性にもつながります。トークン消費量の急激な増加は、攻撃者が意図的に推論量を増やして料金を吊り上げる「ウォレット拒否(DoW)攻撃」の最初の兆候であることが多いが、その原因は不明である。
アーキテクチャが自律的に適応できない場合、エンジニアは手動での介入に頼らざるを得なくなります。地域で交通量が増加した際には、手動で交通の流れを調整します。彼らは、過負荷状態のサーバーを維持するために、応答品質を低下させる。推論速度が遅くなると、51%のチームが同じモデルを再試行しますが、これにより通常、混雑は解消されるどころかさらに悪化します。これはトリアージであり、スケールするものではありません。硬直したシステムを拡張すると、その損失も拡大する。
修正はプログラム上で行われます。
すべての推論リクエストにモデルとトークンのメタデータタグを付け、リアルタイムで監視することで、予算を浪費する前に問題のあるモデルを特定できます。
コード上でフェイルオープンとフェイルクローズの動作を定義し、プライマリが応答しない場合でも、システムがキャッシュされた結果や小規模なローカルモデルに切り替わるようにすることで、午前2時にエンジニアを起こす必要がなくなります。
64%の専門家が、自動トラフィック制御をすでに重要な要件と評価しており、市場が今後の方向性を認識していることがわかります。
流通はパフォーマンスを実現する仕組みである。
ROIが低く、それが遅延やコンバージョン率の低下として現れる場合、その原因は地理的要因であることが多い。リアルタイム推論は突発的な処理が発生し、遅延に敏感なため、パブリックインターネットと遠隔地のデータセンターでは安定したサービスを提供できません。
数学は容赦ない。エンドツーエンドの予算が250ミリ秒の場合、計算に100ミリ秒、APIハンドシェイクに50ミリ秒かかるため、データ転送には100ミリ秒しか残されていません。大陸を横断するだけで、モデルが仕事を始める前に予算が尽きてしまう。
推論処理を分散型ポイント・オブ・プレゼンスに配置することで、ユーザーの近くで処理を行うことができ、インターネットの混雑を回避し、集中型システムが課す速度制限を排除できます。この応答は、ネットワーク上ではローカルであるため、自然な印象を与えます。
AIエージェントのような技術について話す際、タスクが実際に完了するまでには平均6回のやり取りが必要だと言われています。ユーザーが遠くにいて、やり取りに100ミリ秒かかる場合、その時点で600ミリ秒の余裕があります。これは一部の用途では問題ないかもしれませんが、現在ではレイテンシに敏感なエッジアプリケーションが数多く開発されています。車両に統合されたAIシステムでは、データの取得と情報の伝達をより短時間で行うことが非常に重要です。
セキュリティにおいて、配布はもう一つ重要な役割を果たします。推論と実行が同じ場所で行われる場合、ネットワークはユーザーを認証し、API呼び出しを検証し、モデルを一か所で実行することができます。リクエストを別のゾーンに送信してチェックするのではなく、ループを閉じて処理を完了させます。
セキュリティはアーキテクチャの特性であり、独立した要素ではありません。
推論を確保できなければ、それをスケールさせることはできません。セキュリティを別作業として扱うと、パフォーマンスの面でコストを払うことになります。両方の研究によると、真の失敗の原因はトポロジーではなく、セキュリティが確保されておらず、テストも行われていない、そして可視化されていないAPIにあるということです。
そのデータは衝撃的だ。過去1年間に87%の組織がAPIに関連するセキュリティインシデントを経験しており、これは2022年の76%から大幅に増加しています。調査によると、インシデントが発生したチームの中で最も多かったAPI関連のセキュリティインシデントは、AI関連APIへの攻撃で、42%がAI技術に関連するAPIへの攻撃を報告しています。
現在、平均的なインシデントによる年間コストは70万ドルに上り、最も深刻な上位25%のインシデントでは180万ドル以上の損失が発生しています。AIに関連するAPIは、将来のリスクではなく、現在進行中のリスクである。
把握できないものは防御できない
この現象が起きている間、可視性は逆方向に変化しています。完全な API インベントリを備え、どの API が機微な情報を返すかを把握している組織の割合はわずか 23% で、2022 年の 40% から低下しました。見えない資産を守ることはできず、AIはその資産を手動での在庫管理よりも速いスピードで拡大させている。コパイロットは、セキュリティレビューを受けないエンドポイントを生成します。自然言語インターフェースは、適切な防御策が講じられていない経路を悪用することで、プロンプトインジェクションによるデータ抽出を攻撃者にとって容易なものにします。
重要なのは、入り口がすべてではないという点だ。攻撃者が単一の公開APIに侵入した場合、AIデータを管理するフィーチャーストアや、モデルウェイトやロジックを格納するリポジトリなど、真の価値を持つコンポーネントに横方向に侵入しようと試みます。
マイクロセグメンテーションは、個々のワークロードを分離するセキュリティのベストプラクティスであり、爆発範囲を抑制する役割を果たします。多くの組織ではまだ導入されていませんが、導入した組織では攻撃を大幅に迅速に阻止することができます。レガシーなネットワークベースのセグメンテーションは、複雑で手間がかかり、効率的でないことが広く知られています。現代のAIを活用したマイクロセグメンテーション技術は、この課題を解決しますが、根深いバイアスという新たな課題も生み出します。推論を実行するネットワークにセグメンテーション機能を組み込むことで、保護とパフォーマンスのバランスを取る必要がなくなります。
実装パターンはアイデンティティベースです。組織は次のことを行うべきです。
IPアドレスではなくワークロードIDに基づいてアクセスを定義することで、特定の推論サービスが特定の機能ストアにのみアクセスできるようにし、それ以外のアクセスを制限します。
継続的なAPIディスカバリを実行し、本番環境のデータに接続されたままの未使用テストエンドポイントを特定してください。
セキュリティは、開発者が回避する一時的な監査対象ではなく、システムに常時組み込まれた特性となる。
二つの課題
両方の研究が明らかにしているより深刻な問題は、技術的なものではなく、組織的な問題である。チームはトラフィックとセキュリティを別々に管理するため、その境界線で問題が発生するのです。
その境界線は、信頼の格差として表れます。Cレベルのリーダーの40%がAPIテストの成熟度が高いと報告している一方、実際に作業を行っているDevSecOpsチームではその割合は28%に過ぎない。リーダーは問題が解決されたと考えているため、基盤へのリソース投入は不十分なままとなり、資金は隣接するツールに流れている。リーダーが保護されていると考えるものと、実際に保護されているものとの間の隔たりは、ますます広がっている。
その距離を縮めるには、交通を管理するチームと交通の安全を確保するチームが、同じ制御プレーン、または少なくとも統合された制御プレーン上で連携して作業する必要があります。検出と隔離が同じレイヤーで機能する場合、プロンプトインジェクションやDoWに典型的な異常なリクエストパターンが検出されると、影響を受けた推論エンドポイントが自動的に隔離されます。このプロセスには人間の介入は必要ありません。その同期は、配布とセキュリティが別々のシステムでない場合にのみ可能です。
ここから何が拡大していくのか
チームを成長させるチームと停滞させるチームを分けるのは、2つの能力の違いです。
ポータビリティ。成熟したオペレーターは、コストや容量の変化に応じて、管理されたGPU、ホスト型API、サーバーレスランタイム間でワークロードを移動できるため、制約が大幅に少なくなります。
ランタイムガバナンス悪意のある入力プロンプトとデータ漏洩を引き起こす出力応答の両方を制御する機能は、アプリケーションに追加されるのではなく、ネットワーク層で実装されています。
それらを単一のプラットフォームに統合し、配信、セキュリティ、トラフィック制御を共通の管理プレーンで共有することで、保護とパフォーマンスのトレードオフが解消されます。実行中のプロセス、その実行場所、および攻撃の有無に関する情報を確認できます。
これは、コンテンツ配信とセキュリティの分野で長年解決に取り組んできたアカマイが、現在は生産現場での推論処理にも取り組んでいる課題です。推論処理をユーザーに近い場所で行うためのグローバルネットワークは、APIセキュリティ、マイクロセグメンテーション、分散型サービス拒否(DDoS)攻撃からの保護も同時に実現しています。そのリーチ機能により、1つのネットワークで2つのタスクを同時に実行することが可能になります。
脆弱なAIのROIは、問題の兆候に過ぎない。
その原因は、適応可能なアーキテクチャ、セキュリティ、ディストリビューションを同じ基盤上で実現できていないインフラにある。パフォーマンスと保護の格差は拡大していますが、これは構造的な問題ではなく、一時的な現象に過ぎません。このギャップは、トラフィックを管理するチームが、推論を実行するために特別に設計されたインフラストラクチャのセキュリティを確保するチームと同一である場合に解消されます。後から推論に対応できるように改造されたインフラストラクチャでは、このギャップは解消されません。
詳細はこちら
より深く理解するには、『2026年AI推論の現状』および『APIセキュリティの影響調査』をご覧ください。
タグ