Meta, Llama 4 Maverick 한국어 특화 언어팩 공식 출시
Meta가 Llama 4 Maverick 기반의 한국어 특화 언어팩을 공식 릴리스했다. 한국어 벤치마크(KLUE, HAE-RAE)에서 기존 대비 평균 11.4%p 성능 향상을 기록했으며, 로컬 추론 시 4비트 양자화 기준 메모리 사용량이 18GB 수준으로 소비자급 GPU에서도 구동 가능하다.
출시 배경과 언어팩 구성
Meta는 2026년 9월 18일, Llama 4 Maverick의 한국어 특화 언어팩(Korean Language Pack v1.0)을 Hugging Face 공식 계정을 통해 공개했다. 이번 언어팩은 한국어 말뭉치 320억 토큰을 추가 학습한 어댑터 레이어와 한국어 전용 토크나이저 확장 패치로 구성된다. 기존 Maverick 베이스 모델 가중치를 그대로 유지하면서 LoRA 방식으로 병합 가능해 기존 파이프라인 변경 없이 적용할 수 있다.
성능 수치 및 하드웨어 요구사항
공식 기술 보고서에 따르면 KLUE 벤치마크 전 태스크 평균에서 베이스 Maverick 대비 11.4%p 향상, HAE-RAE 벤치마크에서는 9.8%p 향상을 달성했다. 추론 환경별 메모리 요구량은 다음과 같다.
- 4비트 양자화(GGUF Q4_K_M): VRAM 18GB — RTX 4090 단일 GPU 구동 가능
- 8비트 양자화: VRAM 34GB — A6000 또는 듀얼 RTX 4090 권장
- BF16 풀 정밀도: VRAM 68GB — A100 80GB 권장
처리 속도는 4비트 기준 RTX 4090에서 토큰 생성 속도 약 42 tokens/sec로 측정됐다.
한국 개발자 적용 가이드
언어팩 적용은 transformers 4.48 이상 또는 llama.cpp 최신 빌드에서 지원된다. Hugging Face CLI로 어댑터를 내려받은 뒤 merge_and_unload() 한 줄로 병합할 수 있으며, 상업적 이용은 Llama 4 커뮤니티 라이선스 조건을 준수해야 한다. 라이선스 및 가격은 공식 페이지 참조. 국내 스타트업이나 크리에이터 툴 개발자라면 RAG 파이프라인의 한국어 리트리버 품질 향상에 즉시 활용할 수 있을 것으로 기대된다.