Cloudflare의 AI 혁명: Kimi & GLM 모델 속도 41% 향상, 비용 30% 절감

Cloudflare의 획기적인 최적화 기술이 대규모 언어 모델 배포를 어떻게 변화시키는가

2026년 8월 7일약 10분

AI 인프라 환경에 지각 변동이 일어났습니다. Cloudflare는 가장 까다로운 오픈소스 AI 모델인 Moonshot AI의 Kimi K2.6과 Z.ai의 GLM 5.2를 성공적으로 최적화하여 대규모 언어 모델 서비스에 대한 우리의 생각을 근본적으로 바꾸는 놀라운 성능 향상을 달성했습니다.

과제: 메모리를 대량 소비하는 거인

Kimi와 GLM은 AI 역량의 최첨단을 대표합니다. 이러한 대규모 혼합 전문가(MoE) 모델은 262,000개 이상의 토큰 컨텍스트 윈도우를 자랑하며 다국어 및 복잡한 작업에서 탁월한 성능을 제공합니다. 그러나 그 크기는 중요한 병목 현상을 만듭니다: GPU 메모리 제약입니다.

작은 모델과 달리 주요 메모리 소비자는 모델 가중치 자체가 아니라 이전에 처리된 토큰에 대한 어텐션 데이터를 저장하는 KV(키-값) 캐시입니다. 긴 컨텍스트 대화의 경우 이 캐시가 기하급수적으로 증가하여 사용 가능한 GPU 메모리를 빠르게 소진합니다.

해결책: 3가지 혁명적 기술

Cloudflare 엔지니어링 팀은 오픈소스 SGLang 추론 프레임워크와 협력하여 게임을 바꾸는 3가지 최적화를 구현했습니다:

KV 캐시 양자화

KV 캐시를 BF16에서 FP8로 압축해 컨텍스트 용량을 686,000개 토큰에서 137만 개 토큰으로 두 배로 늘렸습니다.

처리량 +41% · 토큰당 비용 −30%

모델 가중치 압축

모델 가중치에 고급 양자화를 적용해 정확도를 희생하지 않고 메모리 풋프린트를 줄여, 더 많은 요청이 동일 GPU를 효율적으로 공유합니다.

캐시 보호 메커니즘

공유 하드웨어에 더 많은 요청이 집약되면서 Cloudflare는 대규모 신뢰성을 위한 강력한 보호 조치를 구현했습니다.

처리량: BF16 vs FP8 KV 캐시

Kimi K2.6 디코딩에서 BF16이 메모리 한계에 도달해도 FP8은 계속 확장됩니다:

동시 요청BF16 (tok/s)FP8 (tok/s)
321,558 (한계)1,489
64메모리 부족2,192

결과: FP8 피크 동시성에서 처리량 41% 향상, 토큰당 비용 30% 절감.

실제 영향

이러한 최적화는 현재 Cloudflare의 Workers AI 플랫폼에서 프로덕션 환경에 적용되어 전 세계 개발자가 Kimi K2.6, Kimi K2.7 Code 및 GLM 5.2 모델에 액세스할 수 있습니다. 개선 사항의 의미:

비용 절감

AI 애플리케이션 개발자의 프로덕션 토큰 비용이 낮아집니다.

처리량 향상

프로덕션 워크로드가 GPU당 더 많은 동시 요청을 처리합니다.

정확도 손실 제로

벤치마크가 최적화되지 않은 버전과 구분하기 어렵습니다.

응답 시간 단축

최종 사용자는 긴 컨텍스트 대화에서 더 낮은 지연을 경험합니다.

중국 AI 모델에 대한 중요성

이 획기적인 발전은 글로벌 시장에 진입하는 중국 AI 모델에 특히 중요합니다. Kimi와 GLM은 다국어 이해, 도구 호출 및 추론 작업에서 탁월한 능력을 입증했지만 배포 비용이 장벽이 되어 왔습니다.

Cloudflare의 최적화는 이러한 정교한 모델의 국제 배포에 대한 "장벽을 낮추는" 데 효과적이며, 더 광범위한 애플리케이션에 경제적으로 실행 가능하게 만듭니다. 한 관찰자가 언급했듯이, 이것은 중국 모델의 글로벌 진출 배포 과제에 대한 "차원 축소 공격"을 나타냅니다.

기술적 우위

Cloudflare 접근 방식의 차별점은 서로 다른 단계에서 다른 최적화를 전략적으로 적용하는 것입니다:

프리필 단계

컴퓨팅이 병목인 곳에서 BF16 정밀도를 유지.

디코드 단계

메모리가 제약인 곳에서 FP8 양자화를 적용.

결과: 각 추론 단계에서 최적의 성능.

미래 전망

GLM 5.2와 Kimi K2.7 Code가 이제 Workers AI에서 사용 가능해지면서 개발자는 262,144개 토큰 컨텍스트 윈도우, 함수 호출, 비전 기능 및 고급 추론을 갖춘 최첨단 규모의 모델에 액세스할 수 있습니다—모두 프로덕션 배포를 위해 최적화되었습니다.

이것은 단순한 점진적 개선이 아닙니다. 대규모 언어 모델을 효율적으로 제공하는 방법에 대한 근본적인 재고입니다. AI 모델이 크기와 능력에서 계속 성장함에 따라 Cloudflare와 같은 혁신은 고급 AI를 접근 가능하고 저렴하게 만드는 데 필수적일 것입니다.

메시지는 분명합니다: AI의 미래는 더 큰 모델을 구축하는 것만이 아니라 더 스마트하게 서비스하는 것입니다.

출처

최신 소식을 받아보세요

뉴스와 업데이트를 가장 먼저 확인하세요