Akamai는 LayerX를 인수하여 모든 브라우저에서 엔드투엔드 보안과 실시간 AI 사용 제어 기능을 제공합니다. 자세한 정보

AI ROI가 사라지는 곳은 모델이 아니라 인프라입니다

아리 웨일은 Akamai 클라우드 컴퓨팅 및 전송 제품 마케팅 담당 부사장입니다.

Jul 02, 2026

Ari Weil

아리 웨일은 Akamai 클라우드 컴퓨팅 및 전송 제품 마케팅 담당 부사장입니다.

에 의해 작성

Ari Weil

아리 웨일(Ari Weil)은 다양한 관리 및 운영 분야에서 경험을 쌓은 제품 전략 및 시장 진출 담당 임원입니다. 그는 제품과 마케팅 라이프사이클의 모든 측면을 아우르는 20년 이상의 부서 간 기업 경영 전문성을 바탕으로 현재의 역할을 수행합니다. 그의 주요 관심 분야는 데이터 보안, 컴플라이언스, 리스크 관리, 클라우드 도입, 디지털 트랜스포메이션, 최신 애플리케이션 아키텍처입니다.

공유

AI로 얻은 성과가 손익계산서에 반영되는 경우는 드물며, 이는 대개 모델의 문제가 아니라 아키텍처의 문제입니다. 팀이 제대로 작동하는 파일럿을 내놓아도 지연 시간과 걷잡을 수 없이 늘어나는 컴퓨팅 비용, 예산에 없던 보안 인시던트가 수익을 갉아먹는 과정을 지켜볼 수밖에 없습니다. 모델은 제 역할을 합니다. 하지만 그 아래를 떠받치는 인프라는 애초에 워크로드를 프로덕션까지 감당하도록 설계되지 않았습니다.

Akamai는 이러한 문제가 어디에서 발생하는지 집중 검증하기 위해 두 건의 조사를 의뢰했습니다. The State of AI Inference 2026은 프로덕션에서 추론을 운영 중인 실무자 200명을 조사했으며, 이 중 4분의 3이 엔지니어와 아키텍트, 대다수가 배포 의사 결정권자였습니다. 2026 API Security Impact Study는 6개 산업과 10개국의 보안 전문가 1840명을 조사했습니다. 

두 보고서를 종합하면 하나의 결론에 이릅니다. 대부분의 팀은 학습용으로 설계된 뒤 추론까지 무리하게 확장한 인프라 위에서 규모를 키우고 있으며, 그 격차는 비용과 지연 시간, 노출로 드러납니다.

이러한 격차는 세 가지가 맞물릴 때 좁혀집니다. 

  1. 실시간 상황에 맞춰 유연하게 조정되는 아키텍처 

  2. 나중에 덧붙이는 것이 아니라 그 아키텍처에 처음부터 내장된 보안 

  3. 실시간 목표치를 달성할 만큼 사용자와 충분히 가까운 곳에 배치된 추론 

이들 각각은 그 자체로는 새로울 게 없습니다. 문제는 이 세 가지를 서로 다른 팀이 맡는 별개의 프로젝트로 취급한다는 데 있습니다.

먼저 구조부터 살펴봅니다. 추론은 학습된 모델이 새로운 인풋을 받아 아웃풋을 내놓는 실시간 단계입니다. 모든 추론 호출은 API 호출의 형태로 오가므로, 모델과 API는 서로 별개의 문제가 아닙니다. 둘은 동일한 요청 경로, 동일한 장애 유형, 동일한 공격 표면을 공유합니다. 이 맥락은 두 조사 전반을 관통합니다.

중앙 집중화가 정말로 무너지는 지점

중앙 집중식 추론이 무조건 실패하는 것은 아닙니다. 학습, 배치 작업, 지연 시간에 덜 민감한 워크로드라면 몇몇 대규모 리전에 컴퓨팅을 집중하는 것이 옳은 선택인 경우가 많으며, Akamai도 상당수의 워크로드를 그렇게 운영합니다. 데이터가 말해주는 실상은 이보다 좁고 그만큼 더 유용합니다. 중앙 집중화는 특정하면서도 점점 늘어나는 부류의 워크로드에서 무너지는데, 많은 팀이 아직 이에 맞춰 아키텍처를 재설계하지 않았습니다.

The State of AI Inference 보고서에 따르면 기업의 75%가 생성형 AI(GenAI)를 프로덕션에 도입했지만, 인프라는 그 속도를 따라가지 못했습니다. 이러한 워크로드 가운데 점점 더 큰 비중이 이제는 원거리 리전까지의 왕복으로는 충족할 수 없는 엄격한 실시간 지연 시간 요구사항을 갖고 있으며, 실무자의 60%는 사용자 및 데이터와의 근접성을 “중요” 또는 “필수”로 평가합니다. 

그런데도 46%는 여전히 단일 중앙 집중식 리전에서 추론을 실행합니다. 바로 이것이 불일치입니다. 중앙 집중화가 모든 곳에서 실패한다는 뜻이 아니라, 프로덕션 추론 가운데 점점 더 큰 비중이 중앙 집중식 배치가 허용하는 것보다 사용자에게 더 가까이에서 실행되어야 한다는 뜻입니다.

가장 먼저 무너지는 워크로드는 예측 가능합니다. 실시간 거래 중의 사기 점수 산정, 음성 에이전트, 실시간 개인화 그리고 답변을 내놓기 전에 여러 번의 모델 호출을 연결하는 모든 에이전틱 파이프라인이 여기에 해당합니다. 각 홉은 앞선 홉의 지연 시간을 그대로 물려받습니다. 이를 단일 리전에 몰아두면 사용량이 증가할수록 큐잉 지연이 눈덩이처럼 불어나 정작 워크로드가 가장 버티기 힘든 시점에 수백 밀리초가 추가됩니다.

따라서 진짜 문제는 중앙 집중식이냐 분산형이냐를 신념처럼 따지는 데 있지 않습니다. 진짜 문제는 근접성이 필요한 워크로드와 그렇지 않은 워크로드를 가려내는 데 있습니다. 이를 제대로 해내는 팀은 모든 것을 한 리전에 기본값으로 몰아넣고 지연 시간이라는 비용을 떠안는 대신, 워크로드 하나하나를 놓고 그 질문에 신중하게 답합니다.

적응형 아키텍처와 눈에 보이지 않는 비용

ROI가 부진하다는 것은 대개 팀이 아키텍처 차원에서 해결하는 대신 운영 차원에서 임시방편으로 버티고 있다는 신호입니다. 그 단서는 단위 경제성입니다. 즉, 토큰 단위나 쿼리 단위로 측정한 개별 추론 요청의 비용입니다. 그 수치가 보이지 않으면 최적화할 수 없고, 비용이 통제를 벗어나는 순간도 잡아낼 수 없습니다.

대부분의 팀은 이를 보지 못합니다. 기업의 77%는 추론을 추적하는 일관된 단위 수준 경제성 지표를 갖추지 못했으며, 이는 곧 대다수가 특정 워크로드의 비용이 확장에 따라 낮아지는지 높아지는지조차 말할 수 없다는 뜻입니다. 이 가시성 격차는 곧 보안 격차이기도 합니다. 원인 불명의 토큰 소비 급증은 흔히 지갑 거부(DoW) 공격의 첫 신호인데, 이는 공격자가 비용을 불릴 목적으로 추론량을 의도적으로 끌어올리는 공격입니다.

경직된 시스템을 확장하면 손실도 함께 확장됩니다.

아키텍처가 스스로 적응하지 못하면 엔지니어는 수작업 개입에 의존하게 됩니다. 특정 리전에 부하가 급증하면 트래픽을 일일이 손으로 재라우팅합니다. 과부하가 걸린 서버를 살려두기 위해 응답 품질을 낮춥니다. 추론이 느려지면 51%의 팀이 동일한 모델을 다시 호출하는데, 이는 대개 혼잡을 해소하기는커녕 오히려 심화시킵니다. 이는 응급 처치일 뿐 확장성은 없습니다. 경직된 시스템을 확장하면 손실도 함께 확장됩니다.

해결책은 프로그래밍 방식입니다.

  • 모든 추론 요청에 실시간 모니터링으로 전달되는 모델과 토큰 메타데이터를 태깅하면 통제를 벗어난 모델이 예산을 갉아먹기 전에 드러납니다. 

  • 페일오픈과 페일클로즈 동작을 코드로 정의해두면 기본 모델이 응답하지 않을 때 시스템이 새벽 2시에 엔지니어를 깨우지 않고도 캐시된 결과나 더 작은 로컬 모델로 전환합니다.

  • 이미 실무자의 64%가 자동화된 트래픽 스티어링을 필수 요구사항으로 평가하고 있으며, 이는 시장이 이미 어디로 향하고 있는지를 분명히 보여줍니다.

분산이 곧 성능을 좌우하는 메커니즘입니다

ROI 부진이 높은 지연 시간과 낮은 전환율로 나타날 때 그 근본 원인은 대개 지리적 위치입니다. 실시간 추론은 트래픽이 순간적으로 몰리고 지연 시간에 민감해서 퍼블릭 인터넷과 멀리 떨어진 데이터 센터의 조합으로는 안정적인 처리가 어렵습니다.

계산은 냉정합니다. 전체 예산이 250밀리초인데 연산에 100ms, API 핸드셰이크에 50ms가 든다면 데이터가 이동하는 데 쓸 수 있는 시간은 100밀리초만 남습니다. 대륙을 하나 건너면 모델이 일을 시작하기도 전에 그 예산은 이미 바닥납니다. 

분산된 네트워크 거점에 추론을 배치하면 무거운 연산을 사용자와 같은 리전에서 처리하고, 퍼블릭 인터넷 혼잡을 우회하며, 중앙 집중식 배치가 부과하는 속도 제한을 없앨 수 있습니다. 네트워크 관점에서 보면 응답이 실제로 로컬에서 이루어지기 때문에 사용자는 응답이 원래 그 자리에서 나오는 것처럼 느낍니다.

AI 에이전트 같은 것을 이야기할 때 하나의 작업이 실제로 완료되기까지 대략 여섯 번의 상호작용이 필요하다고 합니다. 사용자가 멀리 떨어져 있어 상호작용 한 번에 100밀리초가 걸린다면 그것만으로 벌써 600밀리초가 됩니다. 일부 애플리케이션에서는 이 정도가 괜찮을 수 있지만, 오늘날 엣지에서 구축되는 애플리케이션 중에는 지연 시간에 민감한 것이 많습니다. 차량에 통합된 AI 시스템에서는 모든 데이터와 정보가 훨씬 짧은 시간 안에 전달되는 것이 매우 중요합니다.

분산은 보안 측면에서 중요한 역할을 하나 더 합니다. 추론과 정책 적용이 같은 위치에서 실행되면 네트워크는 한곳에서 사용자를 인증하고 API 호출을 검사하며 모델을 실행할 수 있습니다. 요청을 다른 영역으로 넘겨 어딘가 다른 곳에서 검사받게 하는 대신, 그 자리에서 처리를 마무리합니다.

보안은 별개의 트랙이 아니라 아키텍처의 본질적 속성입니다

추론을 보호하지 못하면 확장할 수 없습니다. 보안을 별개로 진행되는 작업으로 취급하면 그 대가를 성능으로 치르게 됩니다. 두 조사 모두 진짜 문제는 토폴로지가 아니라 보안이 취약하고 테스트되지 않았으며 보이지 않는 API라고 말합니다.

데이터는 충격적입니다. 지난 한 해 동안 API 보안 인시던트를 겪은 기업은 87%로, 2022년의 76%에서 증가했습니다. 인시던트를 겪은 팀에서 가장 많이 언급된 API 관련 보안 인시던트 종류는 AI 연계 API를 겨냥한 공격이었으며, 42%가 AI 기술과 연결된 API에 대한 공격을 보고했습니다. 

이제 인시던트 한 건당 평균 비용은 연간 70만 달러이며, 상위 4분의 1에 해당하는 인시던트는 180만 달러를 넘습니다. AI에 연결된 API는 미래의 리스크가 아니라 이미 지금 당장의 리스크입니다.

볼 수 없는 공격은 방어할 수도 없습니다

이런 일이 벌어지는 동안 가시성은 오히려 나빠지고 있습니다. 자사의 어떤 API가 민감한 데이터를 반환하는지 파악하고 있는 기업은 23%에 불과하며, 이는 2022년의 40%에서 하락한 수치입니다. 보이지 않는 자산 영역은 방어할 수 없는데, AI는 그 영역을 수작업 인벤토리가 따라잡을 수 있는 속도보다 빠르게 넓히고 있습니다. 코파일럿은 보안 검토를 한 번도 거치지 않는 엔드포인트를 만들어냅니다. 자연어 인터페이스가 있으면 무방비 경로를 찾아낸 공격자는 프롬프트 인젝션으로 데이터를 손쉽게 빼낼 수 있습니다.

중요한 것은 진입점이 전부가 아니라는 사실입니다. 노출된 API 하나를 뚫은 공격자는 실질적 가치를 지닌 구성 요소로 측면 이동을 시도합니다. 바로 AI 데이터를 선별해 관리하는 피처 스토어, 그리고 모델 가중치와 로직을 담고 있는 리포지토리입니다. 

개별 워크로드를 격리하는 보안 모범 사례인 마이크로세그멘테이션이 바로 그 피해 범위를 억제하는 수단입니다. 대부분의 기업은 아직 이를 도입하지 않았지만, 도입한 기업은 공격을 눈에 띄게 빠르게 억제합니다. 레거시 네트워크 기반 세그멘테이션은 복잡하고 번거로우며 비효율적이라는 평가가 널리 자리 잡고 있습니다. 최신 AI 기반 마이크로세그멘테이션은 이를 해결하지만, 뿌리 깊은 통념에 도전합니다. 그 세그멘테이션을 추론을 전달하는 바로 그 네트워크에 내장하면 우수한 성능과 보안 사이의 트레이드 오프(trade off)를 피할 수 있습니다.

구현 방식은 아이덴티티 기반입니다. 기업은 다음을 실행해야 합니다.

  • IP 주소가 아니라 워크로드 아이덴티티를 기준으로 접속을 정의해 특정 추론 서비스가 특정 피처 스토어에만 도달하고 그 외에는 접근하지 못하도록 합니다. 

  • 지속적인 API 검색을 실행해 여전히 프로덕션 데이터에 연결된 채 방치된 테스트 엔드포인트를 찾아냅니다. 

그러면 보안은 개발자가 우회하는 일회성 감사가 아니라 네트워크 패브릭에 상시 내재된 속성이 됩니다.

두 갈래로 나뉜 문제

두 조사가 드러낸 더 근본적인 문제는 기술이 아니라 기업에 있습니다. 팀은 트래픽과 보안을 별개의 트랙에서 구축하는데, 그 둘이 맞닿는 이음새에서 문제가 터집니다.

그 이음새는 인식 격차로 드러납니다. 경영진의 40%는 자사의 API 테스트 성숙도가 높다고 답한 반면, 실제로 그 업무를 수행하는 DevSecOps 팀은 28%만이 이에 동의했습니다. 경영진은 문제가 이미 해결됐다고 믿기 때문에, 예산이 주변 도구로 쏠리는 사이 정작 근간에는 자원이 부족한 상태가 이어집니다. 경영진이 생각하는 보호 수준과 실제 보호 수준 사이의 간극은 계속 벌어지고 있습니다.

이 간극을 좁히려면 트래픽을 관리하는 팀과 트래픽을 보호하는 팀이 동일한, 아니면 적어도 통합된 컨트롤 플레인에서 운영해야 합니다. 탐지와 차단이 그 플레인을 공유하면 프롬프트 인젝션이나 DoW에서 전형적으로 나타나는 비정상 요청 패턴이 사람의 개입 없이 해당 추론 엔드포인트를 자동으로 격리하도록 작동시킬 수 있습니다. 이러한 동기화는 분산과 보안이 별개의 시스템이 아닐 때만 가능합니다.

여기서 확장되는 것

확장에 성공하는 팀과 정체되는 팀을 가르는 두 가지 역량이 있습니다.

  1. 이식성. 성숙한 운영 조직은 비용과 용량 변화에 따라 매니지드 GPU, 호스티드 API, 서버리스 런타임을 넘나들며 워크로드를 옮길 수 있어 종속성이 눈에 띄게 낮습니다. 

  2. 런타임 거버넌스. 들어오는 악성 프롬프트와 데이터를 유출하는 응답을 함께 제어하는 작업은 애플리케이션에 덧붙이는 방식이 아니라 네트워크 레이어에서 적용됩니다.

분산과 보안, 트래픽 스티어링이 하나의 컨트롤 플레인을 공유하는 단일 플랫폼에 이 요소들을 올려두면 우수한 성능과 보안 사이의 트레이드 오프(trade off)가 사라집니다. 무엇이 실행되고 있는지, 어디에서 실행되고 있는지, 공격받고 있는지 여부를 하나의 화면에서 파악할 수 있습니다.

이것은 Akamai가 콘텐츠 전송과 보안 분야에서 그동안 풀어온 문제이며, 이제는 프로덕션 추론 분야에서 풀어가고 있는 문제입니다. 추론을 사용자 가까이에 배치하는 바로 그 글로벌 네트워크가 그 주위에서 API 보안과 마이크로세그멘테이션, 분산 서비스 거부(DDoS) 방어까지 함께 수행합니다. 이러한 도달 범위 덕분에 하나의 네트워크가 두 가지 역할을 동시에 해낼 수 있습니다.

취약한 AI ROI는 하나의 증상입니다

그 원인은 적응형 아키텍처와 보안, 분산을 아직 하나의 기반 위에 통합하지 못한 인프라에 있습니다. 성능과 보호의 격차는 점점 벌어지고 있지만, 이 격차는 구조적인 것도 영구적인 것도 아닙니다. 이 격차는 트래픽을 운영하는 팀이 곧 그 트래픽을 보호하는 팀이 되고 추론을 억지로 떠안도록 개조한 것이 아니라 처음부터 추론을 감당하도록 구축한 인프라 위에서 일할 때 사라집니다.

자세히 알아보기

더 자세히 알아보려면 The State of AI Inference 2026API Security Impact Study를 읽어보세요.

아리 웨일은 Akamai 클라우드 컴퓨팅 및 전송 제품 마케팅 담당 부사장입니다.

Jul 02, 2026

Ari Weil

아리 웨일은 Akamai 클라우드 컴퓨팅 및 전송 제품 마케팅 담당 부사장입니다.

에 의해 작성

Ari Weil

아리 웨일(Ari Weil)은 다양한 관리 및 운영 분야에서 경험을 쌓은 제품 전략 및 시장 진출 담당 임원입니다. 그는 제품과 마케팅 라이프사이클의 모든 측면을 아우르는 20년 이상의 부서 간 기업 경영 전문성을 바탕으로 현재의 역할을 수행합니다. 그의 주요 관심 분야는 데이터 보안, 컴플라이언스, 리스크 관리, 클라우드 도입, 디지털 트랜스포메이션, 최신 애플리케이션 아키텍처입니다.

태그

공유

관련 블로그 게시물