Small Language Models: The Quiet Revolution
출처: NVIDIA Research (arXiv:2506.02153) 및 NMIMS 뭄바이 (arXiv:2509.04518) | 2026년 6월

서버실의 코끼리
AI 어시스턴트가 이메일을 작성하거나, 지원 티켓을 라우팅하거나, 문서를 요약할 때마다, 수백억 개 파라미터를 가진 거대 모델이 호출되고 있을 가능성이 큽니다——쿼리당 적지 않은 비용, 작은 마을을 돌릴 전력, 눈에 띄는 응답 지연. 한 번의 쿼리라면 괜찮아 보입니다. 규모가 커지면? 눈앞에 숨은 위기입니다.
AI 업계는 오랫동안 근본적인 불일치와 조용히 씨름해 왔습니다: AI 에이전트가 실제로 매일 수행하는 작업은 압도적으로 단순하고 반복적이며 범위가 좁습니다——그런데 우리는 가장 강력하고 비싼 모델을 그에 던지고 있습니다. NVIDIA Research의 기념비적인 포지션 페이퍼와 NMIMS 뭄바이의 설득력 있는 연구가 이제 변화가 필요하다고 주장합니다——답은 소형 언어 모델(SLM) 입니다.
SLM이란 정확히 무엇인가?
"소형"은 상대적이지만, NVIDIA 연구자들은 실용적 정의를 제시합니다: SLM은 노트북, 휴대폰, 엣지 서버 같은 일반 소비자 기기에서 실행되고, 실시간으로 유용할 만큼 빠르게 응답하는 언어 모델입니다. 2025–2026년 기준으로 대략 100억 파라미터 미만 모델에 해당합니다. Phi-3, Gemma 3, Llama 3.2, Mistral 7B를 떠올리면 됩니다. 이들은 장난감이 아닙니다. 유능하고, 파인튜닝 가능하며, 배포 가능한 기계입니다.
시장 맥락을 정리하면:
- 에이전트형 AI 분야는 2034년까지 약 2,000억 달러로 성장할 전망
- 대형 IT 기업의 50% 이상이 이미 AI 에이전트를 적극 사용
- 업계는 LLM 클라우드 인프라에 570억 달러를 투입
- 그러나 에이전트가 실제로 하는 일의 대부분은 반복적이고 범위가 좁은 단순 작업
마지막 항목이 모든 것의 핵심입니다.
SLM 논거의 세 기둥
NVIDIA 포지션 페이퍼는 세 가지 핵심 주장을 펼칩니다——반박하기 어렵습니다.
SLM은 충분히 강력하다
에이전트형 워크플로 안의 대부분 작업은 "소설을 써 달라"나 "양자 얽힘을 설명해 달라"가 아닙니다. "이 JSON에서 이 필드를 추출해", "이 지원 티켓을 분류해", "이 조건이 충족됐는지 판단해"입니다. 범위가 정해지고 구조화되며 반복적입니다. 특정 작업에 파인튜닝된 SLM은 범용 LLM과 맞먹거나 능가하는 정확도를 냅니다——제한된 영역에서는 전문화가 범용성을 이기기 때문입니다. 한 가지를 잘하도록 훈련된 모델은 모든 것을 그럭저럭 하도록 훈련된 모델보다 거의 항상 낫습니다.
SLM은 아키텍처적으로 더 적합하다
에이전트형 시스템은 설계상 모듈식입니다. 복잡한 워크플로에는 플래너, 리트리버, 요약기, 검증기, 포매터가 있을 수 있고 각각 한 가지 역할을 합니다. 각 단계에 700억 파라미터 모델을 배치하는 것은 혈압을 재려고 신경외과 의사를 고용하는 것과 같습니다. 각 역할에 파인튜닝된 SLM은 이 모듈형 아키텍처에 완벽히 맞습니다. 더 빠르고, 더 예측 가능하며, 독립적으로 업데이트하기 쉽습니다. 한 컴포넌트를 재훈련하거나 교체할 때 거대한 단일 덩어리가 아니라 집중된 전문가 하나만 건드립니다.
SLM은 경제적으로 압도적으로 유리하다
여기가 승부처입니다. 700억 파라미터 모델에서 추론을 실행하는 비용은 30억 파라미터 모델보다 수십 배 이상 높습니다. 엔터프라이즈 규모——하루 수백만 번의 에이전트 호출——에서 이 차이는 지속 가능한 사업과 돈 구멍의 차이입니다. 환경 비용도 마찬가지입니다: 모델이 작을수록 탄소 발자국도 작습니다. AI 에너지 소비에 대한 감시가 강해지는 세계에서 이는 그 어느 때보다 중요합니다.
SLM에 새 기술 가르치기: GRPO 돌파
NVIDIA 논문이 SLM의 철학적 논거를 제시한다면, NMIMS 뭄바이 연구는 엔지니어링 증거를 제공합니다. 연구는 SLM의 가장 큰 약점 중 하나——도구 사용, 즉 API 호출, 함수 실행, JSON 같은 구조화 출력 생성——에 맞섭니다.
이는 매우 중요합니다. 날씨 API를 안정적으로 호출하지 못하거나, DB를 조회하지 못하거나, 코드 인터프리터를 호출하지 못하는 AI 에이전트는 사실상 마비 상태입니다. LLM은 규모만으로 이를 극복해 왔습니다. SLM은 전통적으로 어려웠습니다——더 작고 구체적인 데이터셋으로 훈련되어 문맥 이해 범위가 좁고, 정밀한 구조화 출력이 필요할 때 실수하기 쉽습니다.
NMIMS 팀의 해답은 Group Relative Policy Optimization(GRPO)입니다——모델이 옳게 했을 때 보상을 주며 훈련하는 강화 학습 기법입니다. 값비싸고 데이터가 많이 필요한 기존 파인튜닝 대신, GRPO는 피드백 루프에서 학습합니다. 세 가지 보상 구성요소를 설계했습니다:
- 구조화 출력 보상 — 유효하고 잘 formed JSON(도구 호출의 공통어)을 생성하면 보상
- 올바른 도구 선택 보상 — 적절한 작업에 적절한 도구를 고르면 명시적으로 보상, 상황 판단 학습
- 정밀 파라미터 사용 보상 — 도구뿐 아니라 파라미터도 정확히 맞추는 것이 퍼즐의 마지막 조각
결과는 인상적이었습니다: GRPO로 훈련된 SLM은 도구 사용 정확도에서 큰 개선을 보였고, 훨씬 적은 계산 비용으로 더 큰 모델과의 격차를 좁혔습니다. 이는 학술 결과만이 아닙니다. SLM을 진정으로 에이전트 준비 상태로 만드는 청사진이며, 700억 파라미터 모델을 감당할 수 없는 환경에서도 유능한 도구 사용 AI 배포의 문을 엽니다.
이종 혼합 에이전트: 양쪽의 장점
어느 논문도 LLM을 폐지해야 한다고 주장하지 않습니다. 더 정교하고 흥미로운 비전은 이종 혼합 에이전트형 시스템입니다——SLM이 일상 서브태스크의 주요 부담을 담당하고, LLM은 진정으로 넓은 추론, 창의적 종합, 자유 형식 대화가 필요한 드문 순간에만 예약됩니다.
병원을 떠올리세요. 대부분의 환자 접촉은 간호사, 기술자, 일반의——각자 분야의 전문가——가 처리합니다. 신경외과 의사는 정말 필요할 때만 불립니다. 이는 격하가 아니라 최적화입니다. 시스템 전체가 더 빠르고, 더 싸고, 더 신뢰할 수 있습니다. 일상 업무에서 해방된 신경외과 의사는 중요한 순간에 더 날카롭습니다.
이것이 미래 아키텍처입니다: SLM이 기본 주력, LLM이 상시 대기 전문가.
장벽은 실재하지만 넘을 수 있다
NVIDIA 논문은 장벽에 대해 솔직합니다. 업계는 LLM 클라우드 인프라에 570억 달러를 투입했습니다. 기업은 LLM API를 중심으로 워크플로, 벤더 관계, 운영 관성을 쌓았습니다. 전환은 쉽지 않습니다.
그러나 논문은 실용적 전진 경로도 제시합니다: 팀이 에이전트 워크플로를 감사하고, 어떤 서브태스크를 SLM이 처리할 수 있는지 식별하고, 적절한 소형 모델을 파인튜닝·선택하고, 점진적으로 마이그레이션하도록 돕는 LLM-to-SLM 변환 알고리즘입니다. 하룻밤에 스위치를 켤 필요는 없습니다. 한 워크플로부터 시작해 경제성을 증명하고 확장하면 됩니다. 전환은 혁명보다 신중하고 측정 가능한 일련의 단계입니다.
기술을 넘어 중요한 이유
이 이야기에는 비용 절감과 벤치마크 점수를 넘는 차원이 있습니다.
AI 민주화——강력한 AI가 소규모 팀, 스타트업, 지역 병원, 개발도상국 학교에서도 접근 가능해야 한다는 생각——은 데이터센터 없이 돌아가는 모델에 달려 있습니다. 온디바이스 또는 온프레미스 SLM이 그것을 가능하게 합니다. LLM 시대에 가격 때문에 밀려났던 맥락에 유능한 AI를 가져옵니다.
SLM은 데이터 프라이버시에 대한 불안에도 답합니다. 모델이 노트북이나 회사 로컬 서버에서 돌아가면 민감 데이터는 통제 밖으로 나가지 않습니다. 의료, 금융, 법률 분야에서 이는 nice-to-have가 아니라 규제상 필수입니다.
기후 관점도 있습니다. 수백만 에이전트 워크플로가 700억 파라미터 대신 30억 파라미터 모델에서 돌아가는 세계는 의미 있게 더 친환경적인 세계입니다. AI가 경제 구석구석에 닿을수록 에너지 계산이 중요해집니다.
제 견해: 전환은 이미 시작됐다
우리는 변곡점에 있습니다. "클수록 좋다" 서사가 AI를 수년간 지배했고——진짜 돌파를 만들었습니다. GPT-4, Claude, Gemini——이 모델들은 가능성의 범위를 넓혔습니다. 그러나 최전선은 이동했습니다. 질문은 더 이상 "AI가 무엇을 할 수 있는가?"만이 아니라 "AI가 지속 가능하고, 감당 가능하고, 프라이버시를 지키며 무엇을 할 수 있는가?"입니다.
SLM은 그 질문에 답합니다. LLM을 완전히 대체하지는 않을 것입니다——그래서도 안 됩니다. 그러나 에이전트 AI의 넓고 눈에 띄지 않는 중간 지대——라우팅, 분류, 추출, 검증——에서 SLM은 "충분히 좋다"를 넘어 더 낫습니다.
조용한 혁명은 이미 진행 중입니다. 모델은 더 작아지고, 지능은 날카로움을 유지합니다. 그리고 미래는, 알고 보니 주머니에 들어갑니다.
출처
- arXiv:2506.02153 — "Small Language Models are the Future of Agentic AI" (NVIDIA Research, Belcak et al.)
- arXiv:2509.04518 — "Advancing SLM Tool-Use Capability using Reinforcement Learning" (NMIMS Mumbai, Paprunia et al.)

