GLM-5.2 등장——오픈소스 AI의 규칙을 다시 쓰다

한 줄 요약
2026년 6월 13일, Z.ai(구 Zhipu, 중국 AI '6대 호랑이' 중 하나)가 지금까지 가장 강력한 플래그십 모델 GLM-5.2를 공개했습니다. 소소한 패치가 아닙니다. 세대를 넘는 도약입니다: 안정적인 100만 토큰 컨텍스트 윈도우, 새로운 sparse attention 아키텍처, 유연한 thinking effort 레벨, 지역 제한 없는 순수 MIT 오픈소스 라이선스.
AI 업계를 지켜봤다면, 오픈소스 모델이 클로즈드소스 frontier를 진짜로 위협하는 일이 얼마나 드문지 압니다. GLM-5.2는 정확히 그것을 해냈습니다.
GLM-5.2가 특별한 이유
진짜 100만 토큰 컨텍스트——마케팅 문구가 아님
모든 AI 랩이 컨텍스트 길이를 자랑합니다. Z.ai는 "100만 토큰을 주장하는 것"과 "실제 엔지니어링 압력 아래에서 안정적으로 제공하는 것"의 차이를 가장 먼저 짚었습니다.
GLM-5.2는 100만 토큰을 받아들이는 데 그치지 않고, 길고 복잡한 실제 코딩 에이전트 궤적 전체에서 품질을 유지합니다. GLM-5.1의 ~20만 토큰 윈도우에서 5배 점프이며, 응답당 최대 131,072 출력 토큰을 반환할 수 있습니다.
"100만 컨텍스트를 주장하는 건 쉽지만, 실제 엔지니어링 압력 아래에서 안정적으로 유지하는 건 훨씬 어렵다."
실제로 코딩 에이전트가 중형 저장소 전체——소스, 테스트, 설정, 대화 기록——을 작업 메모리에 담을 수 있어, 작은 윈도우가 강요하는 끊임없는 요약 없이도 됩니다.
IndexShare: 100만 컨텍스트를 경제적으로 만드는 아키텍처
충분히 주목받지 못한 엔지니어링 이야기입니다. GLM-5.2는 Dynamic Sparse Attention(DSA) 레이어에 IndexShare를 도입했습니다. 4개 Transformer 레이어가 하나의 경량 indexer를 공유하고, 네 레이어 모두에서 동일한 top-k 인덱스를 재사용합니다.
결과? 100만 토큰 컨텍스트에서 토큰당 FLOPs 2.9배 감소——긴 컨텍스트 추론을 가능할 뿐 아니라 경제적으로 viable하게 만듭니다.
추측 디코딩용 MTP(Multi-Token Prediction) 레이어도 개선해 수용 길이를 최대 20% 늘렸고, 이는 직접 더 빠른 응답으로 이어집니다.
유연한 Thinking Effort: High vs Max
GLM-5.2는 두 가지 추론 모드를 도입했습니다:
| 모드 | 최적 용도 |
|---|---|
| High | 표준 코딩 작업, 낮은 지연 |
| Max | 복잡한 다단계 엔지니어링, 최대 능력 |
Z.ai는 도전적인 장기 작업에 Max effort를 권장합니다. Claude Code에서 /effort 명령이 이 설정에 직접 매핑됩니다.
비슷한 토큰 예산에서 모델 능력은 대략 Claude Opus 4.7과 4.8 사이——오픈소스 모델에게는 놀라운 성과입니다.
벤치마크 성능: 오픈소스 왕관 재탈환
코딩 전용 스위트를 넘어 제3자 랭킹도 같은 이야기를 합니다:

Figure: Artificial Analysis Intelligence Index(9개 평가 복합). GLM-5.2는 51점——GLM-5.1(40)에서 +11——전체 4위, Gemini 3.5 Flash(50)와 Claude Opus 4.8(56) 사이.
장기 코딩 벤치마크:
- FrontierSWE(수 시간에 걸친 개방형 기술 프로젝트): GLM-5.2는 Claude Opus 4.8에 1% 차로 뒤지지만 GPT-5.5보다 1%, Opus 4.7보다 11% 앞섬
- PostTrainBench(GPU 기반 post-training 최적화): GLM-5.2는 Opus 4.7과 GPT-5.5를 넘어 Opus 4.8에 이어 2위
- Terminal-Bench 2.1: GLM-5.2 81.0, GLM-5.1 63.5에서 크게 상승——Opus 4.8 85.0에 근접
- SWE-bench Pro: 62.1 vs GLM-5.1 58.4
Fireworks AI는 자사 GPU 스택에서 GLM-5.2를 독립 검증해 GPQA-Diamond 91.4%(Z.ai 보고 91.2%)를 재현——벤더 최적화 cherry-pick이 아님을 확인했습니다.
MIT 라이선스, 지역 제한 없음
큰 의미입니다. GLM-5.2는 순수 MIT 오픈소스——지역 제한 없음, 접근 장벽 없음, 부담 조건 없음. Z.ai는 "국경 없는 기술 접근"이라 부릅니다.
오픈 weight는 출시 직후 공개되어 전 세계 개발자가 즉시 배포할 수 있습니다.
목요일 Z.ai 주가를 움직일 수 있는 이유
Z.ai는 2026년 초 홍콩거래소 상장으로 세계 최초 대형 모델 주식이 되었습니다.
GLM-5.2가 주가 촉매가 될 이유:
- 혁신 속도: 약 4개월 만에 4개 플래그십급 릴리스(GLM-5, GLM-5-Turbo, GLM-5.1, GLM-5.2). 팀이 전력 질주 중임을 시사.
- 오픈소스 해자: 지역 제한 없는 MIT로 글로벌 개발자 mindshare 적극 구축——Meta Llama playbook과 동일.
- 클로즈드소스 거인과의 격차 축소: 오픈 모델이 장기 벤치마크에서 GPT-5.5를 이기면 기술 이정표를 넘어 상업적 신호.
- 출시 당일 제3자 검증: Fireworks AI의 독립 벤치마크 재현은 드물고 강력한 social proof. "벤더를 믿어야 한다"는 각주 제거.
- 엔터프라이즈 준비 아키텍처: IndexShare 효율은 추론 비용 절감——마진 확대로 직결.
내러티브는 깔끔하고, 벤치마크는 강하고, 오픈소스 커뮤니티는 이미 들끓고 있습니다. 관심을 끄는 레시피이고——관심은 주가를 움직입니다.
GLM-5.2 체험하기
- Z.ai GLM Coding Plan (Lite, Pro, Max, Team)——출시 즉시
- Fireworks AI——서버리스 추론, 출시 당일, 완전한 인프라 제어, zero data retention
- Hugging Face——MIT 라이선스 오픈 weight
Ready to Deploy GLM-5.2 in Production?
Need help evaluating GLM-5.2, choosing inference hosting, or integrating it into your coding-agent workflow? Our AI experts can guide model selection, deployment, and production pipelines.

