RAG는 지팡이——파라미터 지식 주입이 그것을 버렸다

칭화대학교 연구팀이 AI의 가장 완고한 문제 중 하나를 풀었습니다——답은 누구보다 예상했던 것보다 우아합니다.
지금까지 쓴 모든 AI 챗봇은 '부정행위'를 하고 있었습니다
AI 업계가 크게 말하지 않는 사실이 있습니다. 대부분의 AI 어시스턴트는 사실 제대로 '아는' 것이 없습니다. 진짜 의미에서요.
최근 사건, 사내 문서, 전문 주제를 물으면 AI는 깊은 이해의 우물에서 답을 꺼내지 않습니다. 낡은 학습 데이터로 추측하거나——때로는 자신 있게 틀리거나——답하기 전에 급히 찾아봅니다. 후자를 RAG(Retrieval-Augmented Generation, 검색 증강 생성)라고 부르며, 지난 몇 년간 AI 지식 문제의 응급 처치였습니다.
RAG는 오픈북 시험과 같습니다. AI는 공부하지 않습니다. 노트만 가져올 수 있습니다. 답하기 전에 검색을 돌리고, 관련 문서를 잡아 읽고, 찾은 내용을 요약하려 합니다. 매번. 모든 질의마다.
쓸 만합니다. 하지만 지팡이입니다. 칭화대 Baoqing Yue, Weihang Su, Qingyao Ai, Yichen Tang, Changyue Wang, Jiacheng Kang, Jingtao Zhan, Yiqun Liu 등 8명의 연구자가 그 지팡이를 던져버릴 무언가를 만들었습니다.
지팡이의 문제는?
해결책으로 가기 전, RAG가 왜 부족한지 솔직히 짚겠습니다.
느립니다. 모든 질의마다 검색이 먼저 돌아가야 AI가 생각을 시작합니다. 답을 받기 전에 검색 엔진을 기다립니다.
얕습니다. AI는 읽을 뿐 학습하지 않습니다. 검색된 자료에 대한 깊은 이해가 없습니다——처음 보는 노트를 훑고 운에 맡깁니다.
취약합니다. 잘못된 문서가 검색되면 잘못된 답이 나옵니다. Garbage in, garbage out——검색 속도로.
규모가 커지면 비쌉니다. 수백만 질의마다 긴 검색 문서를 처리하면 연산 비용이 엄청납니다.
명백한 대안——새 지식으로 AI를 재훈련——은 더 나아 보이지만 실무에서는 종종 더 나쁩니다. 대형 모델 재훈련은 수주, 막대한 compute, catastrophic forgetting 위험을 동반합니다. 새 정보를 흡수하며 이미 알던 것을 잃기 시작합니다. 회사 정책이 바뀔 때마다 최고의 직원을 대학에 다시 보내는 것과 같습니다.
그래서 분야는 불편한 중간에 갇혀 있었습니다. 한쪽은 RAG——빠르게 갱신하지만 얕음. 다른 쪽은 재훈련——깊지만 느리고 비싸며 위험.
DMoE를 통한 Parametric Knowledge Injection이 그 막다른 길의 출구입니다.
핵심 아이디어: 지식을 플러그인 모듈로
DMoE는 Decoupled Mixture-of-Experts의 약자입니다. 이름은 기술적이지만 개념은 아름답게 단순합니다.

그림 2: Dense 모델, 전통 MoE, DMoE를 나란히. 표준 MoE는 feed-forward layer를 모델에 박힌 결합 router-expert stack으로 대체합니다. DMoE는 router와 expert를 frozen base에서 완전히 분리——추론 시 필요한 expert만 끌어와, 모델이 이미 아는 것은 건드리지 않고 지식을 적응적으로 갱신합니다.
AI를 숙련된 셰프라고 상상하세요. 수년의 요리 훈련이 본능에 새겨져 있습니다——그게 base model입니다. 이제 셰프에게 사천 요리, 프랑스 페이스트리, 비건 요리도 마스터하게 하고 싶습니다.
재훈련 방식: 셰프를 6개월 요리 학교에 다시 보냄. 비싸고 느리며, 원래 솜씨 일부를 잊을 수 있음.
RAG 방식: 요리할 때마다 레시피 책을 건넴. 따라는 하지만 진짜 사천 셰프는 아님. 빠른 독서자일 뿐.
DMoE 방식: 요리별로 짧고 집중된 집중 훈련 3개를 주고, 각각을 독립된 스킬셋으로 내재화. 사천 요리 주문 시 사천 전문성 활성화. 프랑스 디저트 필요 시 페이스트리 지식 가동. 셰프의 핵심 솜씨는 변하지 않음. 새 전문성은 옆에 추가될 뿐.
이것이 parametric knowledge injection입니다. 각 expert module은 특정 문서·주제·데이터셋에서 만든 작고 가벼운 학습 지식 조각으로, 메인 AI 밖에 있지만 호출되면 파라미터에 진짜로 흡수됩니다. 컨닝 페이퍼에서 읽는 게 아니라 실제로 아는 것입니다.
DMoE를 특별하게 만드는 세 가지
코어 AI는 절대 건드리지 않음
핵심 헤드라인입니다. DMoE로 새 지식을 추가할 때 base model은 완전히 frozen입니다. 재훈련 없음. 망각 위험 없음. 다운타임 없음. 6자리 compute 청구서 없음.
각 expert module은 LoRA로 만든 작은 trained adapter로, 특정 지식 chunk를 인코딩합니다. 최신 의학 연구 추가? 작은 모듈 하나 훈련. 사내 정책 갱신? 그 모듈 하나 교체. 나머지는 그대로. 지식 추가가 앱 설치만큼 단순해졌습니다.
AI는 도움이 필요할 때를 안다
DMoE는 생성하는 모든 단어에 expert module을 맹목적으로 켜지 않습니다. 그러면 의미가 없어집니다. 대신 token 단위로 실시간 자신감을 모니터링합니다.
대부분은 자체 지도를 믿다가, 앞이 막히면 자동으로 실시간 교통 데이터로 바꾸는 GPS와 같습니다. AI는 평소처럼 답을 생성하고——불확실한 영역에 들어섰을 때만 expert module에 손을 뻗습니다.
이 불확실성의 기술적 척도는 Token Uncertainty——본질적으로 다음 단어에 대한 확률 분포의 entropy입니다:
이 점수가 임계값 τ를 넘으면 router가 작동합니다. 사용 가능한 모든 expert module에 빠른 keyword 검색(BM25)을 돌리고, 가장 관련 있는 것을 골라 끌어옵니다. 자신감이 높을 때는 AI가 혼자 일합니다. 깔끔하고 효율적이며 똑똑합니다.
한 가지 영리한 트릭이 속도를 유지
팀이 우아하게 풀어야 한 문제입니다. AI 모델은 KV-cache라는 속도 메커니즘을 씁니다——이미 처리한 내용의 기억으로, 답 중간에 재계산하지 않게 합니다. AI 사고 과정 여러 지점에 expert module을 붙이면 cache가 엉키고 속도 이점을 잃습니다.
DMoE의 해결: 모든 expert 지식을 처리 파이프라인 맨 마지막 layer에만 붙입니다. 그 전까지는 모두 cache된 채 그대로. expert 지식은 맨 끝에 얹힙니다——이미 초안이 쓰인 문서를 전문가가 최종 검토하는 것처럼, 매 단락을 처음부터 다시 쓰지 않습니다.
결과: 거의 표준 추론 속도로 깊은 파라미터 수준 지식 통합.
숫자는 거짓말하지 않는다
팀은 HotpotQA, ComplexWebQuestions, Quasar-T, StrategyQA 네 가지 엄격한 지식 벤치마크에서 DMoE를 테스트했고, base로 Llama-3.2-1B-Instruct와 Qwen2.5-1.5B-Instruct 두 모델을 사용했습니다.
| 측정 항목 | DMoE 결과 |
|---|---|
| base AI 대비 답 정확도 | 4개 벤치마크 모두에서 향상 |
| 최고 RAG 경쟁(FLARE) 대비 속도 | 약 3배 빠름 |
| 전통 MoE backbone 대비 GPU 메모리 | 7–8 GB vs. 26 GB |
| 전통 MoE 대비 답당 시간 | 2–4초 vs. 20초 이상 |
| 기존 지식 망각? | degradation zero |
더 똑똑. 더 빠름. 더 저렴. 더 안전. 동시에.
실세계에서 열리는 것
헬스케어
병원이 base AI 모델 하나를 배포합니다. 심장내과, 종양학, 응급의학 등 부서마다 expert module. 한 전문과 임상 가이드라인 갱신? 그 모듈 하나 교체. 시스템 나머지는 전혀 영향 없음.
엔터프라이즈
회사 AI 어시스턴트가 내부 정책, 제품 스펙, 고객 이력을 모듈형 지식 팩으로 carries. 새 분기, 새 가격표? 모듈 하나 업데이트. IT 프로젝트 없음. 재훈련 예산 없음. 기다림 없음.
뉴스·금융
미디어·트레이딩 회사가 매일 fresh knowledge module을 push——지속 재훈련 비용·지연 없이 AI에 시사에 대한 진짜 awareness.
교육
AI 튜터가 과목·학년별 curriculum module을 로드하고, 각 학생 질문에 관련된 것만 활성화. 개인화·깊이·효율——같은 base model에서.
RAG는 정말 죽었나?
완전히는 아닙니다——연구자들도 그렇게 주장하지 않습니다.
오픈 웹처럼 거대하고 예측 불가능하며 끊임없이 바뀌는 corpus를 검색해야 할 때 RAG는 여전히 의미 있습니다. 그런 broad retrieval에는 검색 엔진이 맞는 도구입니다.
하지만 AI가 '찾아보는' 수준이 아니라 진짜 '아는' 구조화·도메인 특화·독점 지식에는——DMoE가 근본적으로 더 나은 답입니다. 도서관 카드만 든 AI와 책을 실제로 읽은 AI의 차이입니다.
RAG는 항상 우회였습니다. Parametric Knowledge Injection이 진짜 해결책입니다.
아직 진행 중인 과제
팀은 열린 질문을 솔직히 밝힙니다. 현재 routing은 keyword matching(BM25)——빠르고 실용적이지만 질의의 전체 의미를 항상 잡지는 못함. 미래에는 semantic search routing 가능. 수천 module 규모 expert library 관리에는 새 조직 도구 필요. single-layer attachment는 속도에 좋지만, multi-layer expert 통합은 더 풍부한 지식 깊이를 열 수 있음.
결론
AI에는 태어날 때부터 찍힌 지식 유통기한이 있습니다. 모든 모델은 training cutoff까지는 알지만——그 이후는 신뢰할 수 없습니다.
RAG는 AI에 검색 엔진을 쥐여 주려 했습니다. 도움은 됐지만, 항상 지팡이였고——분야 모두 알고 있었습니다.
DMoE는 그 지팡이를 던집니다. 새 지식을 가벼운 module로 패키징해, 필요할 때 꽂고, 파라미터 수준에서 진짜 흡수——base model은 건드리지 않고, retrieval pipeline 없이, 몇 달 재훈련 없이.
칭화대 팀이 만든 것은 단순히 설명하면 너무 깔끔해 보일 수 있습니다. 하지만 벤치마크는 real이고, 아키텍처는 공개됐으며, 결과가 말해 줍니다. Parametric Knowledge Injection은 더 이상 연구 판타지가 아닙니다. 작동하는 시스템이며——RAG를 매우, 매우 지치게 만들었습니다.
출처
- Yue, B., Su, W., Ai, Q., Tang, Y., Wang, C., Kang, J., Zhan, J., & Liu, Y. (2026). Decoupled Mixture-of-Experts for Parametric Knowledge Injection. arXiv:2606.14243. https://arxiv.org/abs/2606.14243
- arXiv Full Paper HTML. https://arxiv.org/html/2606.14243
- The Moonlight — Literature Review. https://www.themoonlight.io/en/review/decoupled-mixture-of-experts-for-parametric-knowledge-injection

