Meta, Llama 4 Maverick 함수 호출 정식 지원 — 한국어 Tool Use 벤치마크 동시 공개
Meta가 Llama 4 Maverick 모델에 구조화된 함수 호출(Function Calling) 기능을 공식 추가하고, JSON 스키마 기반 Tool Use 인터페이스를 오픈소스로 공개했다. 동시에 한국어 포함 다국어 Tool Use 벤치마크 결과를 Hugging Face에 업로드해, 로컬 배포 환경에서의 한국어 에이전트 신뢰도를 독립적으로 검증할 수 있게 됐다. 이번 업데이트는 오픈소스 에이전트 프레임워크(LangChain, LlamaIndex 등)와의 네이티브 통합을 직접 겨냥한 것으로, 자체 인프라를 운영하는 한국 개발팀에게 클라우드 종속 없는 에이전트 구축 선택지가 생겼다.
Llama 4 Maverick 함수 호출 스펙 상세
Meta가 공개한 함수 호출 인터페이스는 OpenAI tools 파라미터 형식과 유사한 JSON 스키마를 채택해 기존 코드베이스 마이그레이션 비용을 최소화했다. 주요 스펙은 다음과 같다.
- 동시 호출 가능 함수 수: 단일 턴 최대 8개 병렬 호출
- 응답 포맷:
tool_calls배열로 반환, 각 호출에 고유call_id부여 - 스트리밍 지원: SSE 기반 청크 스트리밍에서 부분 JSON 조각 순차 전달
- 컨텍스트 길이: 128K 토큰 범위 내에서 함수 호출 히스토리 유지
response = client.chat.completions.create(
model="meta-llama/Llama-4-Maverick",
messages=messages,
tools=[
{
"type": "function",
"function": {
"name": "get_product_info",
"description": "상품 ID로 재고·가격 조회",
"parameters": {
"type": "object",
"properties": {
"product_id": {"type": "string"}
},
"required": ["product_id"]
}
}
}
],
tool_choice="auto"
)
한국어 Tool Use 벤치마크 결과 분석
Meta가 공개한 다국어 Tool Use 벤치마크(llama4-tool-bench-multilingual)는 영어·한국어·일본어·스페인어 등 12개 언어로 구성된 총 4,800개 태스크를 포함한다. 한국어 부문 주요 결과는 다음과 같다.
| 모델 | 한국어 Tool 정확 호출률 | 파라미터 추출 F1 | 환각 호출률 | |---|---|---|---| | Llama 4 Maverick | 87.3% | 0.891 | 4.1% | | Llama 4 Scout | 79.6% | 0.843 | 7.8% | | (참고) 영어 Maverick | 91.2% | 0.923 | 2.9% |
한국어와 영어 간 정확도 격차가 약 3.9%p로, 이전 세대 대비 절반 수준으로 줄었다. 벤치마크 데이터셋과 평가 코드는 Hugging Face meta-llama/llama4-tool-bench 리포지터리에서 Apache 2.0 라이선스로 공개됐다.
로컬 배포 시 한국 개발자 실용 가이드
하드웨어 요구사항: Llama 4 Maverick을 FP16으로 풀 로드하려면 VRAM 80GB 이상(A100 80GB × 2 권장)이 필요하다. 4비트 양자화(GGUF Q4_K_M) 적용 시 약 26GB로 축소되며, RTX 4090 단일 카드 구동이 가능하다. 단, 양자화 모델에서는 함수 호출 정확도가 약 4~6%p 하락할 수 있음을 공식 문서에서 명시했다.
프레임워크 연동: LangChain 0.3.x 이상에서 ChatOllama 또는 ChatOpenAI(로컬 엔드포인트) 클래스를 통해 즉시 연동 가능하다. LlamaIndex의 FunctionCallingAgent도 동일 인터페이스를 지원한다.
라이선스 주의: Llama 4 시리즈는 Meta의 커스텀 라이선스를 따르며, 월간 활성 사용자 7억 명 초과 서비스는 별도 상업 라이선스 협의가 필요하다. 한국 스타트업·중소 개발팀은 대부분 해당 제한에 걸리지 않지만, 서비스 규모 성장 시 재검토가 필요하다.