📰 AI 뉴스2026-07-124분
Meta, Llama 4 Scout 양자화 공식 배포—로컬 RTX 4090서 구동 가능
Meta가 Llama 4 Scout의 4-bit/8-bit 공식 양자화 버전을 Hugging Face와 llama.cpp 포맷으로 동시 배포했다. 소비자용 GPU(RTX 4090 24GB)에서 풀 컨텍스트 추론이 가능해져, 외부 API 없이 온프레미스 LLM 파이프라인 구축이 현실적인 선택지가 됐다.
llamaopen-sourcelocal-llm
무엇이 달라졌나
Meta는 2026년 7월 12일, Llama 4 Scout(17B 활성 파라미터, 총 109B MoE 아키텍처)의 공식 양자화 가중치를 공개했다. 지원 포맷은 다음과 같다.
- GGUF Q4_K_M: llama.cpp·Ollama 즉시 사용 가능, VRAM 약 12GB 필요
- GGUF Q8_0: 정밀도 우선, VRAM 약 22GB 필요
- BitsAndBytes NF4: Hugging Face Transformers +
load_in_4bit=True한 줄 로드
기존 커뮤니티 비공식 양자화 대비 퍼플렉시티 저하 7% 감소, 토큰 생성 속도는 RTX 4090 기준 평균 38 tok/s(Q4_K_M) 로 측정됐다.
한국 개발자 실전 세팅 가이드
Ollama로 5분 만에 구동
# Ollama 최신 버전(0.6.x 이상) 필요
ollama pull meta/llama4-scout:q4_k_m
ollama run meta/llama4-scout:q4_k_m
Python + BitsAndBytes
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Llama-4-Scout-17B-Instruct",
load_in_4bit=True,
device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-4-Scout-17B-Instruct")
VRAM이 부족한 경우 llm_int8_enable_fp32_cpu_offload=True 옵션으로 일부 레이어를 CPU RAM에 오프로드할 수 있다(권장 시스템 RAM 64GB 이상).
왜 중요한가 — 크리에이터·개발자 관점
- 비용 절감: 월 수십만 원대 API 비용을 서버 전기세 수준으로 대체 가능. 특히 대량 배치 처리(번역, 코드 리뷰 자동화)에서 효과적이다.
- 데이터 프라이버시: 사내 코드·문서가 외부 서버를 거치지 않아 NDA·보안 정책 준수에 유리하다.
- 크리에이터 활용: 유튜브 스크립트 초안, 썸네일 카피, 다국어 자막 생성 등 반복 작업을 로컬 자동화할 수 있다.
- 한계: 10만 토큰 이상의 긴 컨텍스트 처리는 Q4 양자화 시 정확도 저하가 관찰된다. 장문 분석에는 Q8_0 또는 클라우드 API 병행을 권장한다.
라이선스는 Llama 4 Community License를 따르며, 월 활성 사용자 7억 명 이상의 서비스는 별도 상업 계약이 필요하다. 가중치 다운로드는 Hugging Face 모델 카드에서 Meta 약관 동의 후 즉시 가능하다.
출처: Meta AI Blog / Hugging Face Model Hub