Meta, Llama 4 Maverick 함수 호출 API 정식 GA—멀티턴 툴 체이닝 지원
Meta가 Llama 4 Maverick 모델에 함수 호출(Function Calling)과 멀티턴 툴 체이닝을 정식 지원하며 개발자 API를 GA로 전환했다. 기존 오픈소스 모델 대비 구조화된 출력 정확도가 높아져 에이전트 파이프라인 구성이 한층 간결해진다. Hugging Face와 Together AI를 통한 호스팅 엔드포인트도 동시에 제공되어 별도 인프라 없이 즉시 사용 가능하다.
무엇이 바뀌었나
Meta는 2026년 7월 15일 Llama 4 Maverick의 함수 호출 API를 정식 GA로 전환했다. 이번 업데이트의 핵심은 멀티턴 툴 체이닝(Multi-turn Tool Chaining) 지원으로, 단일 대화 세션 안에서 여러 외부 함수를 순차·병렬로 호출하고 그 결과를 컨텍스트에 누적할 수 있다.
주요 스펙은 다음과 같다.
- 컨텍스트 윈도우: 128K 토큰 유지
- 동시 툴 호출 수: 최대 8개 병렬 실행
- 구조화 출력: JSON Schema 강제 모드 지원
- 응답 포맷: OpenAI 호환
tool_calls스키마 채택
가격은 공식 페이지 참조.
한국 개발자에게 왜 중요한가
기존 Llama 4 Maverick은 텍스트 생성 성능은 뛰어났으나 함수 호출 안정성이 낮아 에이전트 파이프라인에 도입하기 어려웠다. 이번 GA로 OpenAI 호환 스키마를 그대로 사용할 수 있어, 기존 GPT-4.1 기반 코드에서 엔드포인트 URL과 모델명만 교체하면 마이그레이션이 가능하다.
오픈소스 기반이므로 온프레미스 배포 시 API 호출 비용 없이 사내 데이터와 연동하는 에이전트를 구성할 수 있다는 점도 주목할 만하다.
실전 적용 가이드
빠른 시작 체크리스트
- Together AI 또는 Hugging Face Inference Endpoints에서
meta-llama/Llama-4-Maverick엔드포인트 활성화 - 기존 OpenAI SDK의
base_url을 교체하고tools파라미터 그대로 전달 - 멀티턴 시나리오에서는
tool_results메시지를role: tool로 삽입 - JSON Schema 강제 모드 활성화:
response_format: { type: "json_schema" }추가
주의사항: 병렬 호출 8개 초과 시 초과분은 큐잉 처리되므로, 타임아웃은 기본값 30초보다 넉넉히 설정할 것을 권장한다. 로컬 배포 시에는 VRAM 요구량이 BF16 기준 80GB 이상이므로 양자화 버전(GGUF Q4_K_M) 사용을 검토하라.