Colibri: 25GB RAM만으로 7440억 파라미터 모델을 돌리는 혁신 AI 엔진

July 11, 202613 min read

Colibri가 AI 분야에서 특별한 이유

Colibri(콜리브리)는 JustVugg가 개발한 획기적인 오픈소스 AI 추론 엔진으로, 겉보기에 불가능해 보이는 목표를 달성합니다. 7440억 파라미터의 거대한 Mixture-of-Experts(MoE) 모델인 GLM-5.2를 단 약 25GB RAM을 갖춘 소비자용 하드웨어에서 실행하는 것입니다. 이 "작은 엔진, 거대한 모델"은 비싼 GPU 인프라 없이도 최첨단 AI를 일반 사용자에게 제공하는 패러다임 전환을 의미합니다.

혁신의 핵심은 우아한 아키텍처에 있습니다. Colibri는 모델의 dense 부분(어텐션 레이어, 공유 expert, 임베딩——약 170억 파라미터)만 int4 양자화(~9.9GB)로 RAM에 상주시키고, 21,504개의 라우팅 expert(총 ~370GB)는 디스크에서 필요할 때 스트리밍합니다. 순수 C로 작성되었으며 외부 의존성과 Python 런타임이 필요 없고, 전체 엔진은 약 1,300줄의 단일 C 파일에 담겨 있습니다.


혁신적인 기술

Expert 스트리밍 아키텍처

전체 모델을 메모리에 올려야 하는 기존 추론 엔진과 달리, Colibri는 MoE 모델의 근본적 특성을 활용합니다. 토큰당 약 400억 파라미터만 활성화되며, 토큰 간에 바뀌는 라우팅 expert는 약 11GB뿐입니다. 엔진은 선택적 pinned hot-store를 갖춘 정교한 레이어별 LRU 캐시를 구현하고, OS 페이지 캐시를 무료 2차 캐시로 활용합니다.

Multi-Token Prediction(MTP) 추측 디코딩

Colibri는 GLM-5.2의 네이티브 multi-token-prediction head를 추측 디코딩에 사용합니다. MTP head에 int8 양자화를 적용하면 forward pass당 2.22.8 토큰, 초안 수용률 3959%를 달성합니다. 이 무손실 가속 기법은 rejection sampling을 통해 샘플링 환경에서도 품질을 유지합니다.

MLA 어텐션과 압축 KV 캐시

엔진은 압축 KV 캐시를 갖춘 Multi-head Latent Attention(MLA)을 구현해, 토큰당 32,768개가 아닌 576개의 float만 저장합니다——57배 축소로 제한된 RAM에서도 긴 컨텍스트 추론이 가능해집니다.

최적화된 정수 커널

Colibri는 커스텀 AVX2 최적화 정수 dot-product 커널(Q8_0 스타일 int8 activation과 maddubs 명령)을 탑재해 119 GFLOP/s를 달성합니다. int8 matmul은 1.4~2.5배, 배치 모드 int4 연산은 1.8배 빨라집니다.


실제 성능과 영향

성능 지표는 Colibri의 실용성을 보여줍니다. WSL2, 25GB RAM, 1GB/s NVMe 스토리지를 갖춘 개발 머신에서 콜드 상태 0.050.1 token/s, 128GB RAM과 더 빠른 스토리지를 갖춘 Apple M5 Max에서는 약 1 token/s까지 확장됩니다. GPU 속도에는 미치지 못하지만, frontier AI 모델 접근의 민주화를 의미합니다.

엔진은 약 32초 만에 기동하며 상주 메모리는 9.9GB뿐이라 중급 소비자 하드웨어에서도 바로 사용할 수 있습니다. 비동기 expert readahead 시스템은 한 expert 블록을 처리하는 동안 다음 블록을 디스크에서 미리 읽어 I/O 병목을 최소화합니다.


Colibri가 주목받는 이유

AI 접근성의 민주화

Colibri는 최첨단 모델이 $10,000 이상의 GPU 셋업을 필요로 하지 않음을 증명하며 AI 커뮤니티의 상상력을 사로잡았습니다. 사용자들은 이를 "로컬 AI 접근성을 향한 한 걸음"으로 칭하며, 7440억 파라미터 모델을 일반 노트북에 가져옵니다. 클라우드 컴퓨팅 자원 접근이 제한된 지역의 연구자, 개발자, 애호가에게 특히 중요합니다.

오픈소스와 제로 의존성

외부 의존성 없는 순수 C 구현으로 이식성이 뛰어나고 감사하기 쉽습니다. Apache 2.0 라이선스는 상업적 활용 가능성을 보장하면서 개방적 접근을 유지합니다. GitHub에서 241 stars, 25 forks를 기록하며 로컬 AI 커뮤니티에서 빠르게 주목받고 있습니다.

기술적 우수성

GLM-5.2 forward pass 검증(transformers oracle과 토큰 단위 일치)부터 prefill의 batch-union MoE, C 바이트 레벨 BPE 토크나이저, MemAvailable 기반 자동 캐시 크기 조정까지——세심한 엔지니어링이 기술 사용자들의 존경을 받고 있습니다.

커뮤니티 모멘텀

Reddit r/LocalLLM, r/LocalLLaMA, Facebook AI 그룹, Gigazine 등에서 논의가 이어지며, 벤치마크·최적화 팁·사용 사례 공유가 개선과 채택의 선순환을 만들고 있습니다.


로컬 AI의 미래

Colibri는 단순한 기술적 성과를 넘어, frontier AI가 클라우드 인프라를 필요로 한다는 가정에 도전하는 개념 증명입니다. 개발자는 lightning-indexer 가중치를 갖춘 DSA(sparse attention) 구현에 적극적으로 나서며, 이는 긴 컨텍스트 시나리오에서 성능을 더욱 개선할 것입니다.

오프라인 FP8→int4 변환기는 샤드를 하나씩 다운로드·처리해 전체 756GB FP8 체크포인트 저장을 피합니다——스토리지가 제한된 사용자를 배려한 설계입니다. Colibri를 혁신적일 뿐 아니라 진정으로 실용적으로 만드는 요소입니다.

커뮤니티 기여와 최적화로 프로젝트가 계속 진화하면서, Colibri는 로컬 AI 추론의 표준 도구가 되어 생태계 전반에 유사한 혁신을 촉발하고, AI의 미래가 대규모 데이터센터에 집중될 필요가 없음을 증명할 것입니다.

최신 소식을 받아보세요

뉴스와 업데이트를 가장 먼저 확인하세요