Meta, Llama 4 Behemoth API 정식 공개—2조 파라미터 추론 외부 접근 허용
Meta가 Llama 4 Behemoth 모델의 외부 API 접근을 정식 GA로 전환하며, 개발자는 Meta AI API를 통해 직접 호출할 수 있게 됐다. 기존 Scout·Maverick 대비 수학·코딩 벤치마크에서 최대 38% 높은 성능을 기록해 복잡한 추론 파이프라인 구축에 새로운 선택지가 생겼다.
Behemoth란 무엇이고 무엇이 달라졌나
Llama 4 Behemoth는 Meta가 공개한 Llama 4 패밀리 중 최상위 모델로, 약 2조(2T) 파라미터 규모의 Mixture-of-Experts(MoE) 아키텍처를 채택했다. 기존에는 내부 연구 및 Meta AI 제품에만 제한적으로 사용됐으나, 이번 GA 전환으로 Meta AI API 엔드포인트를 통해 외부 개발자도 직접 호출할 수 있다. 컨텍스트 윈도우는 256K 토큰으로, 대용량 코드베이스 분석이나 긴 문서 요약 워크플로에 즉시 적용 가능하다.
성능 수치 및 한국어 개발자 활용 포인트
Meta 내부 벤치마크 기준으로 Behemoth는 MATH-500에서 96.8점, HumanEval에서 91.2점을 기록했으며, Llama 4 Maverick 대비 추론 정확도가 평균 38% 향상됐다고 밝혔다. 한국어 지원의 경우 Llama 4 Scout·Maverick에서 이미 다국어 파인튜닝이 적용된 기반 위에 Behemoth가 구축되어, 한국어 코드 주석 생성·문서화 자동화 시나리오에서도 유의미한 품질 개선이 기대된다. 다만 응답 지연(latency)은 Scout 대비 평균 3~4배 높아, 실시간 UX보다는 배치성 태스크에 적합하다.
요금 및 접근 방법
가격은 입력·출력 토큰 단위로 책정되며, 구체적인 단가는 Meta AI API 공식 페이지 참조. 현재 Llama API(api.llama.com) 를 통해 API 키 발급 후 OpenAI SDK 호환 엔드포인트로 바로 사용할 수 있어, 기존 OpenAI 기반 코드에서 base_url과 모델명만 교체하면 빠르게 테스트할 수 있다. 오픈소스 가중치 다운로드는 별도 라이선스 검토가 필요하며, Behemoth 가중치의 일반 공개 여부는 현재 미정이다.
주의사항 및 다음 단계
- 레이트 리밋: GA 초기 단계로 분당 요청 수(RPM) 제한이 Maverick 대비 낮게 설정되어 있으므로, 프로덕션 투입 전 반드시 한도 확인 필요
- 비용 설계: 256K 컨텍스트를 풀로 사용하면 토큰 비용이 급증할 수 있어, 슬라이딩 윈도우 또는 청킹 전략 병행 권장
- 규정 준수: Meta의 Llama 4 사용 정책상 월간 활성 사용자 7억 명 초과 서비스는 별도 상업 계약 필요