Opt.Gear: 0.5T 토큰으로 학습한 온디바이스 언어 모델
SRAM·대역폭·전력이 제한된 환경을 출발점으로 설계한 온디바이스 텍스트 생성 모델 Opt.Gear(270M/1B)를 오픈소스로 공개합니다.
🤗 HUGGING FACE 🏠 OptAI ✉️ CONTACT
Opt.Gear는 OptAI에서 개발한 오픈소스 모델입니다. 서버용 거대 언어 모델을 단순히 축소한 모델이 아닌, 스마트폰·노트북·로봇·차량·임베디드 보드처럼 SRAM과 메모리 대역폭, 전력, 지연 시간이 모두 제한된 환경을 출발점으로 삼아 설계한 온디바이스 텍스트 생성 모델 제품군입니다. 270M과 1B Dense 모델은 65,536 토큰의 Context Window를 제공합니다. 이번 릴리즈에서는 Supervised Fine-Tuning(SFT) 가중치와 함께 ONNX, Qualcomm NPU, Apple ANE용 배포 바이너리를 공개합니다.
이 글은 Opt.Gear 시리즈의 첫 번째 글로, Opt.Gear-270M과 Opt.Gear-1B를 소개합니다. 양자화 성능 확보를 위해 수행된 QAT 모델 Opt.Gear-QAT, 마이크로컨트롤러용 초소형 모델 Opt.Gear-1M 편이 이어집니다.
Key points
- 학습 효율성: 2T 토큰 후보 코퍼스에서 선별한 0.5T 토큰만으로, 지식 증류 없이 학습했습니다. 현존 파운데이션 모델 중 가장 데이터 효율적인 학습 레시피입니다.
- 빠른 온디바이스 추론: 새로운 하이브리드 아키텍처로 NPU에서 동급 모델 대비 최대 ×4.9 빠른 prefill·decoding 속도를 달성했습니다.
- 효율적인 아키텍처: 컨텍스트가 길어질수록 커지는 KV-cache를 줄이기 위해, convolution 기반의 ConvKV-Gated Mixer를 결합한 하이브리드 아키텍처를 도입했습니다.
- 온디바이스 최적화: NPU가 잘 처리하는 정적 linear·convolution·element-wise 연산 중심으로 설계되어, 노트북·모바일·엣지 보드에서의 효율적인 로컬 실행에 최적화되었습니다.
Summary of Opt.Gear
Gear-1B는 품질과 효율의 균형을, Gear-270M은 더 낮은 지연 시간과 작은 모바일·엣지 환경을 초점으로 합니다. 두 모델은 동일한 하이브리드 설계와 64K 컨텍스트를 공유하며, 한국어-영어 이중언어 텍스트 생성, 요약, 지시 이행과 같은 작업에 적합합니다.
이 모델은 로컬 슬라이딩 윈도우 어텐션과 전역 글로벌 어텐션, 그리고 convolution 기반의 ConvKV-Gated Mixer를 결합한 하이브리드 어텐션 메커니즘을 사용합니다. 이 하이브리드 설계는 복잡한 긴 컨텍스트 작업에 필요한 성능적 손실 없이 경량 모델의 처리 속도와 낮은 메모리 사용량을 제공합니다.
| Opt.Gear-1B | Opt.Gear-270M | |
|---|---|---|
| Hidden size | 1,152 | 640 |
| Decoder layers | 26 | 18 |
| FFN dimension | 6,912 | 2,048 |
| Query / KV heads | 4 / 1 | 4 / 1 |
| Head size | 256 | 256 |
| ConvKV kernel | 3 | 3 |
| Max sequence length | 65,536 | 65,536 |
| Tokenizer / Vocab size | KORMo / 125,184 | KORMo / 125,184 |
| FFN activation | GeGLU | GeGLU |
ConvKV-Gated Mixer: 왜 빠른가
온디바이스 추론의 병목은 연산량보다 메모리 접근인 경우가 많습니다. 자기회귀 디코딩에서는 토큰을 생성할 때마다 KV-cache를 읽고 다시 써야 하는데, 이 상태가 온칩 SRAM을 벗어나는 순간 외부 DRAM 트래픽이 지연과 전력 소모의 주요 원인이 됩니다.
슬라이딩 윈도우 어텐션도 캐시를 윈도우 크기 W로 묶어 둘 뿐, W가 커지면 라이브 디코딩 상태도 그대로 커집니다. ConvKV-Gated Mixer는 이 패턴 자체를 바꿉니다. 토큰 윈도우 대신 kernel 크기로 고정된 convolution 버퍼만 유지합니다:
다수의 로컬 어텐션 레이어를 ConvKV-Gated Mixer로 대체하고, 장거리 정보 라우팅은 소수의 글로벌 GQA 레이어가 담당합니다. softmax와 행렬곱 없이 정적 linear·convolution·element-wise 연산만 사용하므로 CPU, GPU, NPU 어디에나 쉽게 매핑됩니다(NPU 친화적 설계의 핵심입니다).
Pre-trained & SFT
8장의 H200 GPU 환경에서 파운데이션 모델 설계에 대한 Ablation Study와 학습을 진행하기 위해서는, 수십 T 토큰 규모의 데이터를 학습시키는 것이 상당한 시간과 자원을 요구합니다. 따라서 단기간에 효율적으로 파운데이션 모델을 학습시키기 위해, 1B와 270M은 영어·한국어·수학·일반 웹 소스에서 약 2T 토큰의 후보 코퍼스를 모은 뒤 필터링, 중복 제거, mixture rebalancing으로 0.5T 토큰을 선별했습니다. 최종적으로 영어 약 92%, 한국어 6%, 수학 2%로 구성되어 학습하였습니다.
학습 레시피는 세 단계로 구성됩니다:
- 사전 학습: 선별된 0.5T 토큰으로 4K 컨텍스트에서 대규모 사전 학습
- Long-Context 확장: prolong-data-64k 코퍼스로 영어·한국어 각 10B 토큰씩 2단계 추가 학습을 거쳐 컨텍스트를 4K → 32K → 64K로 점진 확장
- 지도 미세 조정(SFT): 일반 지시 이행 SFT 후, 수학·분석 응답을 위한 reasoning 지향 SFT를 분리 적용하는 2단계 설계
최종 체크포인트는 탄탄한 기초 역량과 심층적인 문맥 이해 및 추론 능력을 균형 있게 유지하면서, 다양한 다운스트림 태스크에 대한 높은 적응력을 보여줍니다.
최근의 소형 모델 다수는 대형 teacher 모델의 증류에 의존합니다. 하지만 8xH200 환경에서 online KD는 100B 토큰 학습에만 약 30일이 필요하고, offline KD는 Top-K=32 logits 기준 1TB 저장소에 약 6B 토큰분밖에 담지 못합니다. Gear는 증류 없이 학습함으로써 재현 가능한 레시피를 유지하고, 아키텍처와 데이터 효율성 자체를 투명하게 측정할 수 있도록 했습니다.
Benchmark Performance
텍스트 생성의 다양한 측면을 다루기 위해 다양한 데이터 세트와 측정 항목의 대규모 컬렉션을 기준으로 평가되었습니다(LM Evaluation Harness 사용). Gear의 결과는 모든 벤치마크의 절대 우위보다 적은 학습 토큰, 비증류, 한국어 성능의 조합에 의미가 있습니다.
| Korean benchmarks | Opt.Gear-270M | SmolLM2-135M | Gemma3-270M |
|---|---|---|---|
| Trained Tokens | 0.5T | 2T | 6T |
| Distilled | ✗ | ✗ | ✓ |
| KMMLU | 30.0 | 29.1 | 28.0 |
| KoBEST | 51.9 | 48.7 | 50.0 |
| HAERAE | 21.5 | 18.9 | 20.4 |
| Korean benchmark | Opt.Gear-1B | Gemma-3-1B |
Llama-3.2-1B |
EXAONE4-1.2B |
LFM2.5-1.2B |
|---|---|---|---|---|---|
| Trained Tokens | 0.5T | 2T | 6T | 12T | 36T |
| KMMLU | 36.0 | 30.7 | 29.9 | 32.6 | 29.2 |
| KoBEST | 60.3 | 59.5 | 51.8 | 50.7 | 59.1 |
| CLIcK | 39.7 | 37.8 | 30.6 | 32.9 | 38.3 |
| HAERAE | 44.2 | 35.3 | 32.6 | 30.2 | 33.9 |
Language Model Evaluation Harness, one shared configuration, July 2026. Full tables — including the English suite and the 270M class — are on the benchmarks page.
주목할 점은 데이터 효율성입니다. Gemma3, Llama3.2, EXAONE4 등의 베이스라인이 2T~12T 토큰과 지식 증류를 활용하는 반면, Gear-270M과 Gear-1B는 증류 없이 0.5T 토큰만으로 동급 이상의 성능 — 특히 한국어 벤치마크(KMMLU, KoBEST, CLIcK, HAERAE) 전반의 우위 — 를 달성했습니다.
Inference Performance
실제 엣지 환경에서의 텍스트 생성 속도를 측정하기 위해 다양한 프로세서(CPU/GPU/NPU)와 런타임(Qualcomm AI Engine Direct, llama.cpp, CoreML)에 걸친 크로스 벤치마크를 수행했습니다. W4A16 양자화, embedding·LM head 16-bit 기준입니다.
Qualcomm Snapdragon NPU
Opt.Gear-1B는 Snapdragon 8 Elite GEN5 NPU에서 prefill 7,042 tokens/s를 기록하며, Llama3.2-1B(4,481 tok/s), Gemma3-1B(3,226 tok/s)를 큰 폭으로 앞섰습니다. 모바일 환경에서도 서버급 프롬프트 처리량을 달성할 수 있음을 보여줍니다.
| Model | Snapdragon 8 Elite GEN5 | Snapdragon 8 Elite |
|---|---|---|
| Opt.Gear-1B | 7042 / 86 | 5882 / 80 |
| Llama3.2-1B | 4481 / 65 | 3013 / 50 |
| Gemma3-1B | 3226 / 61 | 2724 / 51 |
| Qwen3-1.7B | 2466 / 41 | 1739 / 32 |
| EXAONE4.0-1.2B | 4386 / 57 | 3436 / 49 |
Apple iPhone (CoreML)
| Model | CPU | GPU | NPU | |
|---|---|---|---|---|
| iPhone 17 Pro: A19 Pro | ||||
| Opt.Gear-1B | 613 / 58 | 2050 / 98 | 3085 / 97 | |
| Llama3.2-1B | 362 / 41 | 1308 / 74 | 1073 / 34 | |
| Gemma3-1B | 544 / 45 | 1852 / 60 | 2380 / 90 | |
| EXAONE4.0-1.2B | 286 / 40 | 1192 / 66 | 590 / 20 | |
| iPhone 16 Pro: A18 Pro | ||||
| Opt.Gear-1B | 642 / 56 | 999 / 40 | 2589 / 80 | |
| Llama3.2-1B | 381 / 40 | 615 / 42 | 696 / 25 | |
| Gemma3-1B | 587 / 46 | 1010 / 34 | 1862 / 70 | |
| EXAONE4.0-1.2B | 254 / 33 | 379 / 34 | 319 / 15 | |
* ANE(Apple Neural Engine)는 메모리 병목의 영향을 크게 받습니다. Full-attention 아키텍처인 Llama3.2와 EXAONE4.0은 NPU에서 큰 폭의 성능 저하를 보이는 반면, Opt.Gear-1B는 GPU(2,050 tok/s)와 NPU(3,085 tok/s) 모두에서 최고 성능을 기록했습니다.
Build with Opt.Gear
Opt.Gear는 Hugging Face에서 오픈 가중치로 다운로드할 수 있으며, Transformers, llama.cpp, ExecuTorch, vLLM 추론을 지원합니다. Qualcomm Hexagon NPU와 Apple ANE에 최적화된 실행 바이너리도 함께 제공됩니다.
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "OptAI/Opt.Gear-1B" # TODO: 실제 리포지토리 ID로 교체
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
messages = [{"role": "user", "content": "온디바이스 AI가 왜 중요한지 설명해줘."}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
# llama.cpp — TODO: GGUF 파일명 확정 후 교체
llama-cli -m opt-gear-1b-q4.gguf -p "안녕하세요" -n 128
Base 모델은 생성 종료 시
<EOS>를, Instruction 모델은 <EOT>를 출력합니다. 파인튜닝 시 대상 런타임과 동일한 종료 토큰 규약으로 학습 예제를 마무리해야 합니다. 온디바이스 추론에서는 잘못된 종료 처리가 디코딩 낭비와 지연 증가로 직결됩니다.
llama.cpp의 NPU 백엔드는 Sliding Window Attention 패턴의 하드웨어 가속 할당을 지원하지 않아, 해당 조합에서는 prefill 성능이 크게 저하됩니다. Snapdragon NPU에서는 QAIRT(Qualcomm AI Engine Direct) 경로 사용을 권장합니다.
Limitation and Future works
0.5T 토큰이라는 제한된 학습 예산은 복잡한 추론·수학 작업에서 Gear-270M과 Gear-1B의 능력을 제약하기도 합니다. 향후에는 학습 토큰 수를 늘리는 것뿐 아니라 토큰당 얻는 역량을 높이는 방향 — 고품질 데이터 선별, 도메인 인지 mixture 최적화, 커리큘럼 스케줄링, 추론·수학 특화 데이터 — 에 집중할 계획입니다.
Summary
Opt.Gear는 잘 설계된 아키텍처와 선별된 데이터만으로도 온디바이스에서 의미 있는 성능을 낼 수 있음을 보여줍니다. 증류 없이 0.5T 토큰으로 학습된 1B 모델이 한국어 벤치마크 전반에서 2T~12T 토큰으로 학습된 동급 모델을 앞서고, Snapdragon NPU에서 최대 7,042 tok/s의 prefill 속도를 달성했습니다. 다음 글에서는 양자화 인지 학습을 다루는 Opt.Gear-QAT와 마이크로컨트롤러용 초소형 모델 Opt.Gear-1M을 소개합니다. 커뮤니티의 피드백을 기다리며, Opt.Gear로 만들어질 엣지 애플리케이션들을 기대합니다.
Citation
@misc{optgear2026,
title = {{Opt-Gear} Technical Report},
author = {{OptAI Gear Team}},
year = {2026},
url = {https://huggingface.co/OptAI}
}
Correspondence: contact@opt-ai.kr · Hugging Face: huggingface.co/OptAI
Gemma-3-1B
Llama-3.2-1B
EXAONE4-1.2B
LFM2.5-1.2B