k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-09-144분

Meta, Llama 4 Scout·Maverick 공식 GGUF 양자화 가중치 배포 — 4비트·8비트 공개

Meta가 Llama 4 Scout와 Maverick의 공식 GGUF 양자화 가중치를 Hugging Face에 직접 배포하기 시작했다. 기존에는 커뮤니티가 비공식으로 변환해 배포하던 방식에서 벗어나, Meta 공식 레포에서 Q4_K_M·Q8_0 포맷을 제공함으로써 무결성과 라이선스 명확성이 확보됐다. 로컬에서 llama.cpp·Ollama로 즉시 실행할 수 있어 국내 온프레미스 환경 도입이 한층 쉬워졌다.

metaopen-sourcellm

공식 배포의 의미

그동안 Llama 4 계열의 GGUF 가중치는 bartowski, unsloth 등 커뮤니티 변환 버전에 의존해야 했다. Meta가 공식 배포를 시작함으로써:

  • 라이선스 명확성: Llama 4 Community License가 공식 가중치에 직접 첨부되어 기업 법무 검토가 단순화
  • 무결성 보장: SHA-256 체크섬을 Meta 공식 레포에서 제공
  • 지원 포맷: Q4_K_M(권장, 품질·속도 균형), Q8_0(고품질), IQ3_M(초경량) 세 가지

| 모델 | 포맷 | 파일 크기 | 최소 VRAM/RAM | |------|------|-----------|---------------| | Llama 4 Scout (17B active) | Q4_K_M | 약 11 GB | 16 GB RAM | | Llama 4 Scout (17B active) | Q8_0 | 약 19 GB | 24 GB RAM | | Llama 4 Maverick (17B active) | Q4_K_M | 약 12 GB | 16 GB RAM |

로컬 실행 빠른 시작 (Ollama 기준)

# Ollama 최신 버전 업데이트 후
ollama pull meta/llama4-scout:q4_k_m
ollama run meta/llama4-scout:q4_k_m

# llama.cpp 직접 실행
./llama-cli \
  -m llama4-scout-q4_k_m.gguf \
  -n 512 \
  --ctx-size 131072 \
  -p "한국어로 REST API 설계 원칙을 설명해줘."

한국 개발자·크리에이터 활용 포인트

  • 온프레미스 RAG 파이프라인: 금융·의료 등 데이터 외부 전송이 제한된 환경에서 LangChain·LlamaIndex와 결합해 사내 지식베이스 구축 가능
  • 크리에이터 워크플로: 영상 스크립트 초안, 자막 번역 등 반복 작업을 외부 API 비용 없이 로컬에서 처리
  • 파인튜닝 기반 확보: 공식 가중치는 Unsloth·TRL 등 파인튜닝 프레임워크의 베이스 모델로 바로 사용 가능하며, LoRA 어댑터 학습 시 재현성이 높아짐
  • 주의: Maverick의 전체 MoE 파라미터(400B+)를 완전 정밀도로 실행하려면 다중 GPU 서버가 필요하며, GGUF Q4_K_M은 활성 파라미터(17B) 기준임
출처: Meta AI / Hugging Face Official Repository