k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-204분

Meta, Llama 4 Maverick 함수 호출 및 JSON 모드 정식 GA

Meta가 Llama 4 Maverick 모델에 구조화된 함수 호출(Function Calling)과 JSON 모드를 정식 지원하며, 오픈소스 에이전트 파이프라인 구축 비용을 크게 낮출 수 있게 됐다. 기존 OpenAI 호환 API 스펙을 그대로 따라 기존 코드베이스 마이그레이션 부담이 최소화된다는 점이 한국 개발자에게 특히 주목받고 있다.

metallamaopen-source

무엇이 달라졌나

Meta는 2026년 7월 20일 Llama 4 Maverick(활성 파라미터 17B, 총 400B MoE 구조)의 공식 추론 엔드포인트에 Function CallingJSON Mode를 정식 GA로 전환했다. 이전까지는 베타 플래그를 명시해야 했고, 병렬 호출(Parallel Tool Call) 시 오류율이 높았으나 이번 릴리스에서 안정성 지표가 내부 벤치마크 기준 99.2%로 개선됐다고 밝혔다.

함수 스키마 형식은 OpenAI tools 배열 스펙과 동일하게 맞춰, client = OpenAI(base_url=...) 한 줄 교체만으로 기존 GPT-4o 기반 에이전트 코드를 Llama 4 Maverick으로 전환할 수 있다.

성능·비용 수치

| 항목 | 수치 | |------|------| | 활성 파라미터 | 17B (MoE, 총 400B) | | 컨텍스트 윈도우 | 1M 토큰 | | 함수 호출 레이턴시(p50) | 340ms (Meta 공식 발표) | | 셀프호스팅 VRAM 최소 요구 | A100 80GB × 2 (4-bit 양자화 기준) | | Together AI 호스팅 가격 | 공식 페이지 참조 |

Together AI, Fireworks AI, Groq 등 주요 추론 플랫폼이 동시에 GA 엔드포인트를 열었으며, Groq의 경우 LPU 특성상 TTFT(Time To First Token) 평균 60ms 수준을 보고하고 있다.

한국 개발자 적용 포인트

  1. 오픈소스 에이전트 비용 절감: 클로즈드 모델 API 대비 셀프호스팅 시 토큰당 비용을 대폭 낮출 수 있어, 반복 호출이 많은 RAG 파이프라인이나 멀티스텝 에이전트에 적합하다.
  2. OpenAI SDK 호환: LangChain, LlamaIndex, Instructor 등 기존 툴체인을 그대로 활용할 수 있어 전환 공수가 사실상 없다.
  3. 온프레미스 규정 준수: 금융·의료 등 데이터 외부 전송이 제한되는 도메인에서 사내 GPU 서버에 직접 배포해 함수 호출 기능을 온전히 쓸 수 있게 됐다.
  4. Ollama 지원: ollama pull llama4:maverick 이후 /api/chat 엔드포인트에서 tools 파라미터가 즉시 동작하며, 로컬 개발·테스트 환경 구성이 간편하다.

공식 모델 가중치 및 API 문서는 Meta AI 공식 사이트와 Hugging Face meta-llama/Llama-4-Maverick 리포지터리에서 확인할 수 있다.

출처: Meta AI Blog