k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-09-055분

Meta, Llama 3.3 405B 4비트 양자화 공식 배포 — 소비자 GPU 구동 가능

Meta가 Llama 3.3 405B 모델의 공식 4비트 GGUF·AWQ 양자화 가중치를 Hugging Face를 통해 공개했다. 단일 RTX 4090(24 GB VRAM) 또는 M2 Ultra Mac Studio(192 GB 통합 메모리)에서 구동 가능한 수준으로 압축돼, 클라우드 비용 없이 로컬에서 대규모 모델을 실험하려는 개발자·크리에이터에게 실질적인 선택지가 열렸다.

metallamaopensource

양자화 스펙 및 하드웨어 요구사항

Meta가 공식 릴리스한 양자화 포맷은 두 가지다.

| 포맷 | 파일 크기 | 최소 VRAM/RAM | 추론 속도(RTX 4090 기준) | |------|-----------|--------------|------------------------| | Q4_K_M (GGUF) | 약 218 GB | 224 GB RAM(CPU 오프로드) / VRAM 24 GB + RAM 200 GB 혼합 | ~6 tokens/s | | AWQ INT4 | 약 210 GB | VRAM 80 GB × 3 (멀티 GPU) | ~14 tokens/s |

Apple Silicon 환경에서는 M2 Ultra 192 GB 구성으로 llama.cpp의 Metal 백엔드를 사용할 때 약 4~5 tokens/s 생성 속도가 보고됐다. 실사용 수치는 컨텍스트 길이와 시스템 구성에 따라 달라진다.

오픈소스 생태계 연동

공식 양자화 가중치 출시와 함께 주요 로컬 추론 도구들이 즉시 지원을 업데이트했다.

  • Ollama: ollama pull llama3.3:405b-q4_K_M 단일 명령으로 다운로드·실행 가능
  • LM Studio: GUI에서 자동 하드웨어 감지 후 적합한 레이어 오프로드 비율 설정
  • llama.cpp: --n-gpu-layers 옵션으로 VRAM 용량에 맞춰 GPU 적재 레이어 수 수동 조정 권장
  • vLLM: AWQ 포맷은 A100 80 GB × 3 이상 멀티-GPU 서버에서 배치 추론 용도로 권장

크리에이터·개발자 활용 시나리오

로컬 구동의 가장 큰 이점은 데이터 프라이버시API 비용 제로다. 특히 다음 케이스에서 유용하다.

  1. 코드 리뷰 자동화: 사내 코드베이스를 외부 클라우드로 전송하지 않고 405B급 성능으로 분석
  2. 콘텐츠 초안 생성: 장문 블로그·기술 문서 초안을 로컬에서 반복 생성하며 프롬프트 튜닝
  3. 파인튜닝 실험: 양자화 베이스 위에 QLoRA 어댑터를 붙여 도메인 특화 모델 빠르게 프로토타이핑

가중치는 Llama 3 Community License 하에 배포되며 상업적 이용 시 Meta 라이선스 조건을 반드시 확인해야 한다.

출처: Meta AI Blog / Hugging Face Model Hub