Meta, Llama 4 Scout 양자화 공식 릴리즈—RTX 4090 단일 GPU 구동 확인
Meta가 Llama 4 Scout의 INT4·INT8 공식 양자화 가중치를 Hugging Face에 공개했다. 16GB VRAM 단일 GPU에서 full-context 10M 토큰을 처리할 수 있어, 클라우드 비용 없이 로컬 추론 파이프라인을 구축하려는 한국 개발자에게 실질적 대안이 된다.
무엇이 공개됐나
Meta는 2026년 7월 26일 Llama 4 Scout(17B 활성 파라미터, MoE 구조)의 공식 양자화 체크포인트를 Hugging Face 모델 허브에 업로드했다. 제공 포맷은 다음과 같다.
| 포맷 | 파일 크기 | 권장 VRAM | |---|---|---| | BF16 원본 | ~34 GB | 80 GB (A100×2) | | INT8 (공식) | ~18 GB | 24 GB (RTX 3090/4090) | | INT4 (공식) | ~10 GB | 16 GB (RTX 4080/4090) |
INT4 기준 RTX 4090 단일 카드에서 토큰 생성 속도는 약 42 tok/s(llama.cpp CUDA 백엔드, 2K 컨텍스트)로 보고됐다.
한국 개발자·크리에이터 활용 포인트
로컬 RAG 파이프라인 구축: Scout는 10M 토큰 컨텍스트를 공식 지원하므로, 대규모 코드베이스나 문서를 청크 분할 없이 한 번에 넣고 질의할 수 있다. LangChain·LlamaIndex 모두 Llama 4 Scout 로더를 이미 지원한다.
콘텐츠 크리에이터 워크플로: 유튜브 자막·블로그 초안·SNS 카피 등 반복 생성 작업을 API 호출 비용 없이 로컬에서 돌릴 수 있다. Ollama ollama pull llama4-scout:int4 한 줄로 설치된다.
엔터프라이즈 온프레미스 수요: 금융·의료 등 데이터 국외 반출이 민감한 기업은 클라우드 API 없이 규정 준수 추론 환경을 구성할 수 있다.
주의사항 및 라이선스
- Llama 4 라이선스는 MAU 7억 명 초과 서비스에는 별도 Meta 상업 계약이 필요하다. 스타트업·개인 프로젝트는 대부분 무료 사용 범위 내에 해당한다.
- INT4 양자화는 한국어 복잡 추론 벤치마크(KoBEST)에서 BF16 대비 평균 1.8% 점수 하락이 보고됐다. 정밀도가 중요한 작업에는 INT8을 권장한다.
- 공식 가중치 다운로드는 Hugging Face 계정 및 Meta 라이선스 동의 후 가능하며, 가격은 무료다.