디지털서비스 이용지원시스템

자료실

[2026-06] 디지털서비스 이슈리포트 01 ​추론 클라우드

[2026-06] 디지털서비스 이슈리포트 01 ​추론 클라우드 게시글 정보입니다.
2026.07.03 (수정 : 2026.07.06)

01 추론 클라우드

│한상기 테크프론티어

본 글은 한국지능정보사회진흥원의 지원을 받아 작성되었습니다. 

한국지능정보사회진흥원이 저작권을 보유하고 있으며 승인 없이 이슈리포트의 내용 일부 또는 전부를 다른 목적으로 이용할 수 없습니다.

들어가며

지난 1월 아주대 윤대균 교수가 ‘네오 클라우드’의 개요와 주요 기업에 대해 소개했다.1) 네오 클라우드는 IaaS의 AI 특화 버전이라고 할 수 있는 GPUaaS(Gpu as a Service)에 집중하는 차세대 클라우드 서비스를 말한다. 시너지 리서치 그룹(Synergy Research Group)의 데이터에 따르면 네오클라우드 매출이 전례 없는 속도로 성장하여 4분기에 90억 달러에 달했으며, 이는 전년 동기 대비 223% 증가한 수치이다. AI 인프라에 대한 수요 급증에 힘입어 시너지는 네오클라우드 시장이 2031년까지 4,000억 달러에 육박할 것으로 전망하며, 이는 연평균 58%의 복합 성장률을 의미한다.

그림 1 네오클라우드 매출 예측 [출처: 시너지 리서치]

수많은 신규 진입 업체와 전환 중인 암호화 인프라 제공업체가 계속해서 등장하는 가운데, 네오클라우드는 GPU 가속 컴퓨팅에 집중함으로써 차별화를 꾀하고 있으며, 이를 통해 AI 워크로드에 더욱 높은 성능 밀도, 빠른 배포 주기, 효율적인 확장을 제공하고 있다.

2026년 5월 네오클라우드 기업인 ‘제너럴 컴퓨트(General Compute)’는 ‘추론이 파편화되고 있다’는 백서를 발표하면서 에이전트, 특수 실리콘, 그리고 추론 시장이 어떻게 변화하고 있는지 정리했다.2) 이번 원고는 이 백서를 중심으로 AI 추론 클라우드가 어떤 특성이 있으며 앞으로 어떻게 진화할 것인지를 정리해 보기로 한다. 제너럴 컴퓨트가 지향하는 영역이 에이전트를 위해 구축되고 있는 추론 클라우드이기 때문에 이 내용을 살펴보는 것이 의미가 있다고 생각한다. 

추론 시장의 분화

모든 성숙한 컴퓨팅 시장은 분화한다. 데이터베이스가 그랬고, 네트워킹 칩 시장, 모바일 칩도 마찬가지다. 이러한 분화는 시장이 성장함에 따라 워크로드 다양성이 단일 아키텍처가 감당할 수 있는 수준을 넘어섰고, 특화된 칩은 아키텍처적 특성상 가장 적합한 분야에서 시장을 장악하게 된 것이다. 

추론은 이러한 전환의 시작점에 있다. 학습은 당분간 범용 GPU에서 계속될 것이지만 추론은 요구 사항이 매우 다른 여러 작업 부하 유형으로 나뉘고 있다. 음성 추론은 배치 처리와 요구 사항이 다르고, 온디바이스 추론은 하이퍼스케일 서버 처리와 다른 문제이며, 장문 문맥 검색은 단문 생성과 다른 문제이다. 그리고 향후 몇 년 동안 가장 큰 추론 작업 부하 중 하나가 될 것으로 예상되는 에이전트 처리는 이 모든 것과 완전히 다를 것이다.

에이전트는 특정 유형의 하드웨어 특화에 보상을 제공한다. 긴 프롬프트, 짧고 구조화된 출력, 각 단계가 다음 단계를 차단하는 심층적인 순차적 경로, 그리고 채워지지 않는 배치 크기가 그 예이다. 에이전트 실행의 경제성은 경로의 각 단계에서 발생하는 지연 시간에 의해 제한되는데, 밀리초 단위의 디코딩 지연이 전체 작업에 누적되기 때문이다. 지연 시간을 잘못 설정하면 에이전트 제품은 경제성이 없거나 출시할 수 없게 되며, 반대로 제대로 설정하면 새로운 유형의 제품이 실현 가능해진다. 

현재 수력 에너지로 구동하는 제너럴 컴퓨트는 미국 내 기존 코로케이션 시설에 구축된 삼바노바 SN40L에서 에이전트 워크로드를 실행하고 있다. GPT-OSS-120B에서 이 스택은 시장에서 가장 강력한 GPU 기반 추론 제공업체 중 하나인 투게더 AI보다 첫 토큰 생성 시간(Time-to-First Token)이 2.6배 빠르고, 엔드투엔드 지연 시간은 4.6배 빠르다고 한다. 이는 잘 선택된 단일 실리콘 칩만으로도 잘 설계된 범용 스택 대비 이 정도의 성능 향상을 얻을 수 있음을 보여준다.

2026년 4분기에는 두 가지 핵심 요소를 추가할 예정인데 SN50을 통해 6,000억 개 이상의 파라미터 모델에서 랙 전체 처리량을 SN40L 대비 거의 20배 가까이 향상시킬 것이고, 둘째, 칩 종류를 분산시켜 AMD MI300X가 프리필을 담당하고 SN50은 디코딩에 특화하도록 한다. 이런 변화는 동일한 전제를 갖고 하는 것인데, 에이전트 워크로드는 해당 워크로드에 최적화된 하드웨어에서 최고의 성능을 발휘하며, 이러한 최적화 작업이 이루어질 만큼 시장 규모가 크기 때문이다. 

에이전트가 챗봇과 다른 점

2022년부터 2025년까지 업계에서 구축한 추론 인프라는 챗봇을 위해 만들었다. 사용자가 질문을 입력하면 모델이 응답을 생성하고 사용자는 이를 읽는다. 처리량은 많은 사용자를 동시에 응대해야 하므로 중요한 반면, 사람이 실시간으로 출력 결과를 읽기 때문에 지연 시간은 상대적으로 덜 중요했다.

에이전트는 이런 가정을 모두 뒤집는다. 일단 에이전트는 입력값이 많다. 에이전트 프롬프트는 사용자 질문이 아니라 시스템 프롬프트, 도구 카탈로그, 메모리 버퍼, 검색된 컨텍스트, 그리고 이전 단계의 누적 기록이 모두 포함된 것이다. 수만 개의 토큰이 사용되는 것은 일반적이며, 수십만 개에 달하는 경우도 드물지 않다. 모든 단계에서 이러한 컨텍스트의 대부분이 다시 전송되므로, 사전 입력은 일회성 설정이 아니라 지속적인 비용이 발생한다.

두 번째 출력은 간결하고 구조화되어 있다. 에이전트는 장문의 글을 작성하는 대신 도구 호출, JSON 객체, 추론 과정 및 중간 계획을 출력하며, 일반적으로 수백 개의 토큰을 생성한다. 모델은 지속적인 출력을 생성하기보다는 시작 및 중지하는 데 대부분의 시간을 소비한다.

셋째, 작업 부하는 순차적으로 처리된다. 챗봇 대화는 사용자가 읽고 입력하는 동안 자연스러운 멈춤이 있지만, 에이전트의 처리 과정에는 그러한 멈춤이 없다. 한 단계가 완료되는 순간 다음 단계가 시작된다. 사람이 개입하여 지연 시간을 흡수하는 과정이 없기 때문에 디코딩 지연 시간 1밀리초가 전체 작업 시간에 1밀리초씩 추가되고, 이러한 지연 시간은 모든 단계에 걸쳐 누적된다.

넷째, 배치 크기가 작다. 챗봇 서비스 운영 방식은 메모리에서 모델 가중치를 읽어오는 비용을 분산시키기 위해 수십 또는 수백 개의 동시 사용자 요청을 일괄 처리하는 데 의존한다. 에이전트 워크로드는 대개 배치 크기가 1이다. 즉, 가능한 한 빠르게 실행되는 단일의 긴 궤적이며, 함께 처리할 다른 요청이 없다. 따라서 최신 GPU 서비스 스택을 정의하는 처리량 최적화는 적용되지 않는다.

종합하면 에이전트를 처리하는 작업은 긴 입력, 짧은 출력, 단계별 지연 시간에 대한 허용 오차 제로, 수십 단계에 걸쳐 누적되는 작업, 그리고 처리되지 않는 배치 처리 속도라는 특징을 갖는다. 이는 챗봇 서비스 제공과는 다른 문제이며, 단순히 난이도가 높아진 버전이 아니다.

프리필(Prefill)과 디코딩

LLM 추론에 대한 지배적인 접근 방식은 이를 단일 문제로 취급하는데, 토큰이 입력되고 토큰이 출력되며, 빠를수록 좋다는 식이다. 이런 접근 방식은 근본적으로 다른 두 가지 계산의 가중 평균에 최적화된 인프라를 만들어냈고, 이제 그 한계에 부딪히기 시작했다. 즉, 프리필과 디코딩은 하드웨어 수준에서 공통점이 거의 없기 때문이다.

그림 2 프리필과 디코드 처리의 차이 [출처: 제너럴 컴퓨트]

프리필(Prefill)은 연산 집약적인 작업이다. 모델이 긴 프롬프트를 처리할 때, 전체 입력에 걸쳐 병렬로 밀집 행렬 곱셈을 수행하는데, 병목 현상은 FLOPs에서 발생한다. 칩은 넓은 SIMD 대역폭, 높은 연산 강도, 그리고 가중치 스트리밍을 위한 충분한 HBM 대역폭을 필요로 한다. H100이나 MI300X 같은 칩이 프리필 작업을 수행하는 것은 설계된 목적대로 작동하는 것이다. 

디코딩은 메모리 제약이 심하다. 생성 과정이 시작되면 모델은 자기회귀 방식으로 토큰을 하나씩 생성하는데, 각 토큰을 생성하려면 모델의 전체 가중치와 전체 KV 캐시를 메모리에서 읽어온 다음, 간단한 연산을 수행해야 한다. 병목 현상은 대역폭, 특히 가중치와 캐시 데이터를 연산 장치로 가져오는 데 걸리는 지연 시간이다. 연산 강도가 급격히 떨어지면서 칩의 FLOPs가 메모리를 기다리며 유휴 상태가 된다. 배치 크기가 1인 디코딩 작업을 수행하는 GPU는 마치 주차장에 서 있는 페라리처럼, 값비싼 실리콘 칩이 거의 아무것도 하지 않는 것과 같다. 

에이전트 작업 부하가 증가함에 따라 이러한 불균형은 완화되는 것이 아니라 오히려 심화된다. 긴 프롬프트는 사전 입력 비용을 증가시키고, 작고 지연 시간에 민감한 생성 작업은 디코딩의 상대적 비중을 높인다. 코딩 에이전트가 도구를 20번 호출하면 디코딩 비용을 20배로 지불하게 된다. 사전 입력 속도는 첫 번째 토큰을 얻는 데 걸리는 시간의 하한선을 결정하고, 디코딩 속도는 사용자가 포기하기 전에 에이전트가 수행할 수 있는 단계 수의 상한선을 결정한다.

이에 대한 대응책은 두 가지이다. 첫 번째는 전체 워크로드에 더 적합한 실리콘, 즉 GPU보다 두 단계 모두에 더 적합한 아키텍처를 가진 칩을 선택하는 것이다. 두 번째이자 더 강력한 대응책은 두 단계에 하나의 칩을 사용하는 것을 중단하는 것이다. 프리필은 프리필 전용으로 설계된 칩에서, 디코딩은 디코딩 전용으로 설계된 칩에서 실행하여 각 실리콘 칩이 본래의 용도에 맞게 작동하도록 하는 것이다. 진정한 해결책은 하드웨어를 분산시키는 것이다.

데이터 플로우 아키텍처

LLM의 토큰 생성(디코딩)은 연산 속도보다 메모리에서 데이터를 가져오는 속도(대역폭)가 발목을 잡는 ‘메모리 병목 문제’를 해결해야 한다. GPU는 고대역폭 메모리(HBM)로 이를 해결하려 하지만, 하드웨어가 발전할수록 연산 능력(FLOPs) 증가 속도가 HBM 대역폭 증가 속도보다 빨라 병목 현상이 오히려 악화되고 있다. 그 결과, 배치 크기가 1일 때 GPU는 성능 저하를 겪게 된다.

외부 메모리에서 데이터를 계속 매번 가져오는 GPU와 달리, 데이터 플로우 유닛을 사용해 컴퓨팅 유닛 바로 옆에 메모리를 분산 배치하여 데이터가 파이프라인을 통해 흐르도록 만들 수 있다. 가중치와 KV 캐시를 최적의 위치에 상주시켜 HBM 대기 시간을 없앴을 수 있는데, 이는 특히 배치 크기 1 디코딩 및 에이전트 워크로드(프롬프트 캐싱 등)에서 압도적인 속도적 우위를 가진다. 실제 환경에서 동일한 120B 모델을 구동했을 때, 삼바노바의 SN40L 스택이 기존 GPU 기반 추론 제공업체보다 약 4.6배 빠른 지연 시간 성능을 보였다고 한다.

특수 추론 칩에 대한 많은 반대 의견은 범용 GPU가 CUDA를 중심으로 한 방대한 소프트웨어 생태계의 이점을 누리는 반면, 특수 목적용 칩은 그렇지 못하다는 주장이었다. 이는 3년 전만 해도 심각한 문제였지만, 지금은 그 정도가 줄어들었다. 예를 들어 삼바노바 스택은 라마, 큐웬, 딥시크, 믹스트랄 및 기타 MoE 변형을 포함하여 에이전트 워크로드에서 실제로 사용하는 모델 제품군을 지원하며, 프로덕션 에이전트 시스템에 필요한 기본 기능(KV 캐시 관리, 프롬프트 캐싱, 구조화된 출력)도 제공한다. 생태계 격차는 하드웨어 격차보다 빠르게 좁혀지고 있으며, HBM 확장 속도가 둔화됨에 따라 하드웨어 격차는 오히려 벌어지고 있다. 

대량의 연산이 필요한 사전 데이터 입력(프리필) 단계는 여전히 GPU가 유리하다. 따라서 향후에는 프리필은 GPU가, 빠른 토큰 생성이 필요한 디코딩은 RDU가 담당하는 분산형 하이브리드 스택이 최적의 솔루션이 될 것이다.

마무리하며

제너럴 컴퓨트 같은 추론 클라우드를 제공하고 하는 기업은 범용 클라우드를 지향하는 것이 아니다. 에이전트라는 특정 대규모 워크로드 유형에 최적화된 추론 기반을 구축하는 데 집중하고 있는 것이다. 

이를 통해 코딩 에이전트는 도구 호출을 다섯 번에서 서른 번으로 늘릴 수 있으며, 품질 차이는 선형적이지 않게 된다. 이는 코드를 작성하는 시스템과 코드를 구축하고 테스트하는 시스템의 차이와 같다. 연구 에이전트는 문서를 다섯 개에서 쉰 개까지 읽고 요약이 아닌 종합적인 결과를 도출할 수 있게 되며, 음성 에이전트는 처음 떠오르는 그럴듯한 응답을 생성하는 대신, 말하기 전에 무엇을 말할지 추론할 수 있다. 

이를 위해서는 에이전트 추론을 챗봇 서비스의 부수적인 작업이 아닌, 핵심적인 작업으로 처리하는 인프라가 필요하다. 그러한 인프라는 GPU 전용 클라우드에는 존재하지 않으며, 기존 하드웨어가 문제의 핵심이 아닌 다른 부분에 최적화되어 있기 때문에 나중에 추가 구축하는 것도 불가능하다.

또한, 유용한 에이전트 인텔리전스의 양을 늘리는 것이 목표라면, 토큰당 지연 시간은 방정식의 절반에 불과하다. 나머지 절반은 새로운 용량이 얼마나 빨리 가동되는지에 대한 일정이다. 내년에 가능한 것과 3년 후에나 가능한 것을 살펴봐야 하는 이유가 여기에 있다. 


참고문헌

1) 윤대균, “네오클라우드 - AI 시대의 새로운 인프라 패러다임,” NIA 디지털 서비스 리포트, 2026년 1월

2) General Compute, “Inference is fragmenting,” May 2026


프로세스가 진행중입니다. 잠시만 기다려주세요.