Opt.Gear-QAT · 2026/08/02

Opt.Gear-QAT: QAT로 지키는 온디바이스 성능

Hessian 기반 scale 초기화와 LSQ를 결합한 Opt.Gear-1B의 Quantization-Aware Training 레시피를 소개합니다.

By Opt.Gear Team

어두운 보라색 배경 위의 Opt.Gear-QAT 워드마크
Opt.Gear-QAT

🤗 HUGGING FACE 🏠 OptAI ✉️ CONTACT

Opt.Gear는 온디바이스 환경을 목표로 자체 개발한 foundation model입니다. 범용 언어 모델인 Opt.Gear-1B와 Opt.Gear-270M, 그리고 마이크로컨트롤러를 위한 약 1M 규모의 초경량 모델로 구성되어 있습니다.

Opt.Gear Model Family
이 글은 Opt.Gear 시리즈의 두 번째 글입니다. 모델 아키텍처와 학습 레시피를 다룬 1편: Opt.Gear 소개에 이어, 이번 글에서는 양자화 인지 학습(QAT)을 다룹니다. 마이크로컨트롤러용 초소형 모델 Opt.Gear-1M 편이 이어집니다.

작은 모델을 만드는 것만으로는 실제 디바이스에서 충분하지 않습니다. 모델의 파라미터 수뿐 아니라 가중치가 차지하는 메모리, 메모리 대역폭, 연산 정밀도와 가속기가 지원하는 커널이 최종 추론 성능을 결정합니다.

문제는 모델을 4비트로 줄였을 때 원래 성능을 얼마나 유지할 수 있느냐입니다.

Opt.Gear-1B에서는 학습이 끝난 모델이 실제 배포용 INT4 grid에 직접 적응하도록 Quantization-Aware Training, 즉 QAT를 수행했습니다. 이 가중치는 이후 다른 INT4 PTQ 알고리즘에 적용해도 성능 손실을 최소화합니다.

Key points

  • Group size 32의 symmetric INT4 weight quantization
  • 16-bit activation을 사용하는 W4A16 구성
  • Calibration activation을 이용한 Hessian 기반 scale 초기화
  • Learned Step Size Quantization(LSQ)을 통한 weight와 scale의 공동 최적화
  • 단 1,000 training step으로 수행한 짧은 QAT adaptation

Quantization parameters of Opt.Gear-1B

Opt.Gear-1B QAT에는 다음과 같은 최종 배포 조건을 적용했습니다.

항목 설정
Weight precision INT4
Activation precision INT16
Quantization format W4A16
Weight quantization Symmetric
Group size 32
Scale initialization Hessian-based output reconstruction
Scale optimization Learned Step Size Quantization
QAT length 1,000 steps

Group size 32는 32개 weight 단위로 독립적인 scale을 사용하는 구성입니다. Per-tensor quantization보다 scale metadata는 증가하지만, 서로 다른 분포를 가진 weight 영역에 각각 적합한 범위를 설정할 수 있습니다.

Symmetric quantization에서는 zero-point를 0으로 고정하고 scale을 중심으로 양수와 음수 영역을 표현합니다. 이는 quantization 연산과 배포 커널을 단순화하는 데 유리하지만, 최적의 scale을 찾지 못하면 제한된 INT4 grid를 효율적으로 사용하지 못할 수 있습니다.

따라서 Opt.Gear-1B에서는 단순한 max-based scale initialization 대신, calibration activation으로 측정한 layer output distortion을 이용했습니다.

Opt.Gear-1B QAT Pipeline

1. Quantization scale is important

Uniform weight quantization은 실수 weight를 제한된 정수 grid에 투영합니다:

Wq = Δ · clip( round( W / Δ ), qmin, qmax )

여기서 Δ는 quantization scale, 즉 step size입니다. INT4에서는 표현 가능한 정수 값이 매우 적기 때문에 scale 설정이 결정적입니다:

2. Hessian-based scale initialize

RTN과 같은 단순한 PTQ 방식은 일반적으로 weight의 최대 절댓값이나 range를 기준으로 scale을 결정합니다. 구현은 간단하지만, 모든 weight perturbation이 모델 출력에 동일한 영향을 준다고 가정한다는 한계가 있습니다. 실제로는 같은 크기의 weight 오차라도 입력 activation이 자주 통과하는 방향에서 발생한 오차가 layer output에 더 큰 영향을 줍니다.

Opt.Gear-1B에서는 calibration input으로 각 레이어의 민감도를 추정하고, 다음의 output reconstruction objective로 group별 초기 INT4 scale을 결정했습니다:

Δ* = argminΔ ‖ WX − QΔ(W)X ‖²F

이 접근은 GPTQ의 second-order output reconstruction 관점에서 출발하지만, GPTQ 전체 알고리즘을 그대로 적용한 것은 아닙니다. Opt.Gear에서는 이 목적함수를 QAT의 초기 group-wise scale을 찾는 데 사용하고, 이후 weight와 scale을 전체 training objective로 함께 최적화합니다.

3. LSQ-based QAT

Hessian 기반 초기화는 각 레이어의 초기 output distortion을 줄이는 데 효과적입니다. 하지만 layer-wise reconstruction objective가 language model 전체의 성능을 직접 최적화하는 것은 아닙니다. 각 레이어에서 작게 발생한 오차가 여러 레이어를 지나며 누적될 수 있고, 어떤 오차는 token prediction에 거의 영향을 주지 않는 반면 다른 오차는 최종 logit을 크게 바꿀 수 있습니다.

따라서 Hessian initialization으로 좋은 시작점을 찾은 뒤, 전체 language modeling objective를 이용한 QAT가 필요합니다. Opt.Gear-1B에서는 Hessian 기반 scale을 초기값으로 설정한 뒤, Learned Step Size Quantization(LSQ) 방식으로 scale을 학습 가능한 parameter로 두었습니다.

Forward 과정에서는 실제 배포에 사용될 symmetric INT4 grid를 그대로 모사합니다:

W̃ = clip( W / Δg, qmin, qmax ),    Wq = Δg · round( W̃ )

round 연산은 직접 미분할 수 없기 때문에 backward 과정에서는 Straight-Through Estimator(STE)로 gradient를 근사합니다. LSQ는 weight뿐 아니라 step size Δ에도 task loss의 gradient가 전달되도록 합니다. 이때 scale의 gradient는 각 group의 원소 수와 양수 quantization level 수에 따라 정규화되는데, 이는 scale 업데이트가 weight 업데이트를 압도하지 않으면서 group별 step size가 모델 파라미터와 공동으로 최적화되도록 하는 장치입니다.

QAT 과정에서는 두 가지 적응이 함께 일어납니다:

Hessian 기반 초기화와 LSQ는 서로 다른 역할을 담당합니다:

단계 역할
Hessian 기반 초기화 QAT 시작 시 layer output distortion이 작은 scale 선택
LSQ 기반 QAT 전체 language modeling loss에 맞춰 weight와 scale 최적화
동일한 W4A16 grid 유지 학습과 최종 export 사이의 quantization mismatch 방지

Performance of QAT

Opt.Gear-1B와 Gemma3-1B의 Base, QAT, PTQ 결과를 공통된 여섯 개 영어·한국어 benchmark에서 비교했습니다. RTN, AWQ, GPTQ 결과는 QAT 학습 후 checkpoint의 master weight를 각 PTQ 방식으로 다시 양자화한 결과이며, QAT 행은 학습된 scale을 포함한 최종 QAT quantizer를 평가한 결과입니다.

Method MMLU HellaSwag WinoGrande KMMLU KoBEST HAERAE Avg. Δ
Opt.Gear-1B
Base 43.2 56.0 58.2 36.0 60.3 44.2 49.7
QAT 41.3 54.0 58.3 35.0 60.4 42.7 48.6 -1.0
RTN 39.8 53.9 56.9 33.8 59.8 39.9 47.4 -2.3
AWQ 39.5 52.6 56.5 32.7 59.6 38.2 46.5 -3.1
GPTQ 39.6 53.5 57.1 34.4 59.6 41.0 47.5 -2.1
Gemma3-1B
Base 39.8 60.0 58.7 30.7 59.5 35.3 47.3
QAT 35.8 51.4 55.0 26.9 56.2 31.2 42.8 -4.6
RTN 32.5 48.5 53.8 21.2 55.1 23.6 39.1 -8.2
AWQ 34.3 50.5 53.7 23.3 56.4 29.7 41.3 -6.0
GPTQ 34.9 49.6 54.9 23.3 55.1 27.1 40.8 -6.5
* Avg.는 여섯 benchmark 점수의 단순 평균, Δ는 각 모델의 Base 평균과의 차이입니다.
* 굵게 표시한 값은 각 모델의 양자화 결과 중 가장 높은 값입니다.
* Llama3.2-1B, Qwen3-1.7B, EXAONE4-1B의 PTQ 결과는 테크 리포트를 참고하세요.

Opt.Gear-1B의 여섯 benchmark 단순 평균은 Base 49.7에서 QAT 48.6으로 약 1.0점 감소에 그쳤습니다. 영어 세 지표의 평균 하락은 약 1.3점, 한국어 세 지표의 평균 하락은 약 0.8점입니다. 중요한 점은 group size 32의 symmetric W4A16이라는 실제 배포 조건을 그대로 적용하고도, 단 1,000-step의 QAT로 영어와 한국어 성능을 함께 보존했다는 것입니다.

동일한 조건에서 Gemma3-1B는 Base 평균 47.3에서 QAT 평균 42.8로 약 4.6점 감소했습니다. 모델의 architecture와 pretraining 과정, QAT recipe가 서로 다르므로 이 차이를 하나의 요소만으로 설명할 수는 없습니다. 다만 이 결과는 Opt.Gear-1B에 사용한 Hessian initialization과 LSQ가 짧은 step의 QAT에서도 안정적인 출발점과 수렴 경로를 제공했음을 시사합니다.

Quantization stability

Opt.Gear-1B의 QAT 결과는 learned scale에서 가장 잘 동작하면서도, QAT-trained weight 자체가 다른 INT4 quantizer에 비교적 안정적으로 대응합니다.

Model Quantizer Avg QAT 대비 변화
Opt.Gear-1B-QAT
Learned QAT scale 48.6
RTN 47.4 -1.3
AWQ 46.5 -2.1
GPTQ 47.5 -1.1
Gemma3-1B-QAT
Learned QAT scale 42.8
RTN 39.1 -3.6
AWQ 41.3 -1.4
GPTQ 40.8 -1.9

Gemma3-1B 역시 QAT checkpoint를 기반으로 PTQ를 수행했지만, RTN으로 quantizer를 교체했을 때 평균 3.6점이 감소했습니다. 동일한 RTN 재양자화 조건에서 Opt.Gear-1B는 평균 1.3점만 감소해 더 높은 안정성을 보였습니다.

Major findings
Opt.Gear-1B QAT checkpoint는 특정 scale parameter만 학습된 결과물이 아니라, weight 자체가 양자화 친화적으로 조정된 checkpoint입니다. 어떤 INT4 quantizer를 얹어도 성능이 안정적으로 유지되므로, 배포 파이프라인의 양자화 도구 선택에 자유도가 생깁니다.

Conclusion

Opt.Gear-1B의 QAT는 다음 세 가지 원칙을 바탕으로 설계했습니다:

  1. Weight 값의 범위만 보지 않고, calibration activation을 통해 출력에 미치는 영향을 측정한다.
  2. Hessian 기반 output reconstruction으로 좋은 group-wise INT4 scale에서 학습을 시작한다.
  3. Learned Step Size Quantization으로 weight와 scale을 최종 task objective에 맞게 함께 최적화한다.

초기화부터 QAT와 최종 export까지 group size 32의 동일한 symmetric W4A16 grid를 사용함으로써, 학습된 quantization 구조가 배포 변환 과정에서 사라지지 않도록 했습니다. 그 결과 Opt.Gear-1B는 단 1,000-step의 QAT 이후에도 여섯 개 영어·한국어 benchmark의 단순 평균에서 Base 대비 약 1.0점의 차이만을 보였습니다.

다음 글에서는 이 설계 철학을 마이크로컨트롤러 규모까지 확장한 Opt.Gear-1M을 소개합니다.

Citation

@misc{optgear2026,
    title  = {{Opt-Gear} Technical Report},
    author = {{OptAI Gear Team}},
    year   = {2026},
    url    = {https://huggingface.co/OptGear}
}

Correspondence: contact@opt-ai.kr · Hugging Face: huggingface.co/OptAI

← All posts Get the models →

언어 모델은 부정확한 내용을 생성할 수 있으며, OptAI의 견해를 대표하지 않을 수 있습니다. 의존하거나 게시하거나 배포할 내용은 반드시 검토해 주세요.