GPU 클러스터 시대를 끝낼지도 모르는 칩——Skymizer HTX301 LPU 완전 해부
대만의 작은 스타트업이 Computex 2026을 앞두고 놀라운 발표를 했습니다. AI 업계가 주목해야 할 이유를 여기서 설명합니다.
게시일: 2026년 5월 19일
태그: Skymizer, HTX301, LPU, AI 추론, Computex 2026, 대만, 온프레미스 AI, HyperThought

아무도 말하고 싶어 하지 않았던 문제
오랫동안 7000억 파라미터 규모처럼 정말 거대한 AI 모델을 자사 하드웨어에서 구동하는 것은 대부분의 기업에게 현실적인 선택지가 아니었습니다. NVLink/NVSwitch 패브릭으로 연결된 NVIDIA H100 함대, 본격적인 냉각 인프라를 갖춘 데이터센터, 하이퍼스케일러나 자금력 있는 연구기관만이 정당화할 수 있는 자본 예산이 필요했습니다. 그럼에도 클라우드에서 실행하는 쿼리마다 종량 과금이 붙으며 AI 예산을 조용히 갉아먹습니다. 이 '숨은 세금' 때문에 엔지니어링 팀은 자사 AI 시스템을 호출하는 빈도를 제한할 수밖에 없어졌습니다.
대만의 AI 컴파일러·반도체 기업 Skymizer가 바로 이 현실에 정면으로 도전하는 발표를 했습니다.
HTX301이란 무엇인가?
HTX301은 LPU(Language Processing Unit) 추론 칩으로, Computex 2025에서 처음 공개된 소프트웨어/하드웨어 협업 설계 아키텍처인 Skymizer의 HyperThought™ 플랫폼 위에 구축된 최초의 레퍼런스 칩입니다. Computex 2026을 앞두고 발표된 HTX301은 범용 GPU를 목표로 하는 것이 아닙니다. 오직 한 가지에 집중합니다. 대규모 언어 모델의 추론을 가능한 한 효율적으로 실행하는 것입니다.
헤드라인 스펙은 정말 놀라울 정도입니다:
| 스펙 | 상세 |
|---|---|
| 폼팩터 | 단일 PCIe 카드 |
| 카드당 칩 수 | HTX301 × 6 |
| 메모리 | 최대 384GB(LPDDR4/LPDDR5) |
| 최대 모델 크기 | 7000억 파라미터 |
| 전력 소비 | 카드당 약 240W |
| 공정 노드 | 28nm |
| 처리량 | 0.5 TOPS에서 약 30토큰/초 |
| 대역폭 | 약 100 GB/s |
비교를 위해 말하자면, NVIDIA RTX PRO 6000 Blackwell은 동등한 추론 작업에 대해 약 600W를 소비하고, AMD Instinct MI350P PCIe 카드는 Skymizer 제품보다 더 큰 전력을 소비합니다. HTX301은 AMD나 NVIDIA의 주요 PCIe형 AI 가속기 대비 절반 이하의 전력으로 이 모든 것을 실현합니다.
비결: 낡은 기술, 새로운 사고
HTX301을 정말 매력적이면서도 다소 논쟁을 불러일으키는 요소가 있습니다—— 최첨단 3nm 실리콘이나 고가의 HBM이 아니라 28nm 칩과 표준 LPDDR4/LPDDR5 메모리를 사용한다는 점입니다. 최신 공정 노드에 집착하는 업계에서 Skymizer는 정반대 방향으로 나아갔습니다.
왜 이것이 효과가 있을까요? LLM 추론은 연산량의 문제가 아니라 메모리 대역폭의 문제이기 때문입니다. 모델이 토큰을 하나씩 생성하는 동안('디코드' 단계), 병목은 칩이 실행할 수 있는 FLOPS 수가 아니라 모델 가중치를 메모리에서 얼마나 빨리 옮길 수 있는지입니다. Skymizer HTX301은 디코드 우선 칩으로 설계되어, 이 메모리 대역폭을 많이 소비하는 단계에 특화해 최적화되어 있습니다.
기반 HyperThought 플랫폼은 LISA™(Language Instruction Set Architecture)로 구동됩니다——트랜스포머 추론을 위해 특별히 설계된 Skymizer 고유의 ISA입니다. 그 위에 HyperThought에는 다음이 포함됩니다:
- KV 캐시 매니저
- 단계 인식형 스케줄러
- 프리필과 디코드 풀을 실시간으로 재조정하는 동적 배치 엔진
이 소프트웨어 스택은 모델 가중치와 KV 캐시 모두에 적극적인 압축 기술을 적용하며, 오픈소스 llama.cpp대비 가중치 압축에서 9%에서 17.8% 더 우수하다고 보고됩니다.
이 아키텍처가 똑똑한 이유(단순히 저렴해서가 아님)
많은 헤드라인이 놓치는 중요한 뉘앙스가 있습니다. HTX301은 GPU를 완전히 대체하려는 것이 아닙니다. GPU와 병행해 동작하도록 설계되었습니다. GPU는 '프리필' 단계(입력 프롬프트를 병렬 처리하는 단계)에 강하고, HTX301은 '디코드' 단계(출력 토큰을 생성하는 단계)를 맡습니다. 이 프리필/디코드 분리는 현명한 아키텍처상의 베팅입니다——기업은 기존 GPU 투자를 유지하면서 가장 전력을 많이 소비하는 연속적인 추론 워크로드를 HTX301 카드로 오프로드할 수 있습니다.
모든 면에서 동시에 NVIDIA에 맞서려는 것보다 더 신뢰할 수 있는 주장입니다. 이것은 쐐기 전략입니다——NVIDIA의 가격 책정과 할당 모델이 약한 디코드 부하가 높은 온프레미스·프라이버시 민감 추론 시장을 공략하려는 것입니다.
실제 영향: '토큰당 세금'을 없애다
HTX301에 대해 가장 설득력 있는 비즈니스 논거는 기술적이 아니라 경제적입니다. 클라우드 기반 LLM 추론은 토큰당 과금됩니다. AI 에이전트가 작업을 완료하기 위해 자율적으로 LLM을 수천 번 호출하는 에이전트형 AI 워크플로에서는 이 토큰당 과금이 심각한 제약이 됩니다. 팀은 결국 에이전트를 축소하고 쿼리를 제한하며, 역량이 아니라 비용을 중심으로 설계할 수밖에 없습니다.
HTX301에서는 카드가 도입되면 추론이 고정된 인프라 비용으로 무제한이 됩니다. 더 이상 토큰당 불안이 없습니다. 더 이상 제한도 없습니다. 다음과 같은 용도에 혁명적입니다:
- 금융 서비스——컴플라이언스, 사기 탐지, 포트폴리오 추론
- 의료——임상 의사결정 지원, 약물 상호작용 분석
- 제조업——예지 정비, 품질 검사
- 법률——계약서 검토, 기밀성 높은 지식 검색
- IC 설계/소프트웨어 엔지니어링——독자 IP를 클라우드에 노출하지 않고 완전히 온프레미스에서 동작하는 프라이빗 코드 코파일럿, RTL 생성기, 검증 에이전트
대만의 관점: 역사적 전환
칩 스펙을 넘어선 더 큰 이야기가 있습니다. 대만은 역사적으로 세계의 파운드리였습니다——NVIDIA H100, AMD MI300X, Apple M 시리즈 칩이 될 실리콘을 제조해 왔지만, 브랜드 AI 가속기 시장 자체에서 경쟁하는 경우는 거의 없었습니다. Skymizer HTX301은 대만 AI 기업의 브랜드 가속기 시장 본격 진출을 나타냅니다. 그 타이밍은 기업 구매 담당자들이 NVIDIA 대안을 적극적으로 찾고 있는 순간과 완벽하게 맞아떨어집니다.
Skymizer가 이 영역에서 고립된 것은 아닙니다——Groq는 추론 속도를, Cerebras는 대규모 모델 용량을 노리고 있으며, Tenstorrent와 SambaNova도 각자의 틈새를 개척하고 있습니다. 하지만 Skymizer의 깊은 제조 인접성, LISA 기반 소프트웨어 협업 설계 전문성, 그리고 단순한 칩 스펙이 아닌 풀스택 제품의 조합은 주목할 만한 강력한 경쟁자로 만듭니다.
유의할 점: 눈에 띄는 주장에는 눈에 띄는 증거가 필요
공정하게 말하자면, 현재 모든 성능 수치는 출시 전 자료에 기반한 벤더 제공 수치입니다. 독립적인 제3자 벤치마크는 아직 없습니다. 5월 하순 Computex 2026이 독립 검증을 수행할 첫 기회가 될 것입니다. 도전적인 AI 칩 스타트업의 역사는 프로덕션 워크로드와의 접촉을 견디지 못한 인상적인 스펙 시트로 가득합니다.
Computex에서 주목할 점:
- 실제 LLM 계열(Llama 3, Qwen, DeepSeek 등)에 대한 독립 벤치마크
- 프로덕션 워크로드 하에서의 지속적 전력 소비(단순 피크 스펙이 아님)
- 소프트웨어 생태계 호환성(HuggingFace, vLLM 등)
- 가격 책정과 상용 출시 일정
결론
HTX301은 지금까지 2026년 가장 흥미로운 AI 칩 발표입니다——가장 빠르기 때문이 아니라, 프론티어 규모 AI 추론에는 하이퍼스케일 인프라가 필요하다는 근본적 전제 자체에 도전하기 때문입니다. Skymizer 주장의 80%만 실현되더라도 온프레미스 AI 시장을 의미 있게 재편할 것입니다. 단일 PCIe 카드, 240W, 384GB 메모리, 7000억 파라미터. 2026년에 이 한 문장이 현실이 될 리 없다고 생각했지만, 실제로 그렇게 되고 있습니다.
최신 소식을 받아보세요
뉴스와 업데이트를 가장 먼저 확인하세요

