Meta, Llama 4 코드 특화 파생 모델 오픈소스 공개
Meta가 Llama 4 아키텍처 기반의 코드 생성 특화 파생 모델을 Hugging Face에 오픈소스로 공개했다. 17개 프로그래밍 언어 벤치마크에서 기존 Llama 4 Scout 대비 코드 완성 정확도가 평균 22% 높아, 로컬 환경에서 Copilot 대체 가능성이 주목받고 있다.
모델 개요 및 스펙
Meta가 공개한 이번 코드 특화 모델은 Llama 4 베이스 아키텍처에서 코드 코퍼스 비중을 전체 학습 데이터의 60%까지 높여 파인튜닝한 결과물이다. 두 가지 사이즈로 배포됐다.
| 항목 | Lite 버전 | Pro 버전 | |---|---|---| | 파라미터 | 8B | 70B | | 컨텍스트 윈도우 | 128K 토큰 | 128K 토큰 | | 양자화 지원 | INT4, INT8 | INT4, INT8, FP8 | | 최소 VRAM (INT4) | 6GB | 40GB | | 라이선스 | Llama 4 Community License | Llama 4 Community License |
벤치마크 결과(HumanEval+, LiveCodeBench 기준) Lite 버전은 GPT-4.1 Mini와 유사한 수준, Pro 버전은 Claude Sonnet 4.6 코드 태스크에 근접하는 점수를 기록했다고 Meta 측이 밝혔다.
지원 언어 및 주요 기능
- 17개 언어: Python, TypeScript, JavaScript, Rust, Go, Kotlin, Swift, Java, C++, C#, PHP, Ruby, Scala, Shell, SQL, HTML/CSS, Solidity
- Fill-in-the-Middle(FIM) 지원: 커서 위치 기반 코드 완성으로 Copilot 방식 통합 가능
- 함수 시그니처 → 구현부 자동 생성: 독스트링만 작성하면 함수 바디를 완성하는
code-infill모드 제공 - 한국어 주석 → 코드 변환: 한글로 작성된 요구사항 주석을 코드로 변환하는 성능이 기존 Llama 4 Scout 대비 31% 향상
국내 개발자 로컬 셋업 가이드
Lite 버전 (RTX 3080/4070 이상): Ollama 최신 버전에서 ollama pull meta/llama4-code:8b-instruct-q4_K_M 명령으로 바로 내려받아 사용 가능하다. Cursor의 Custom Model 설정에서 http://localhost:11434를 엔드포인트로 지정하면 로컬 Copilot 대체 환경이 완성된다.
Pro 버전 (A100 40GB 이상 서버 환경): vLLM 0.5 이상을 사용해 --tensor-parallel-size 2 옵션으로 듀얼 GPU 서빙이 가능하며, FP8 양자화 적용 시 처리량이 INT8 대비 1.6배 높다.
상업적 이용 시 주의: Llama 4 Community License는 월간 활성 사용자 7억 명 초과 서비스에는 별도 Meta 상업 라이선스가 필요하다. 국내 스타트업 규모에서는 대부분 무료 범위 내 사용이 가능하나 라이선스 전문 원문 확인을 권장한다.