k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-214분

Google DeepMind, Gemma 3 27B 온디바이스 함수 호출 정식 GA

Google DeepMind가 Gemma 3 27B 모델의 함수 호출(Function Calling) 기능을 로컬·엣지 환경에서 정식 지원한다고 발표했다. 클라우드 API 없이 서버나 디바이스 내부에서 도구 호출 파이프라인을 완결할 수 있어, API 비용과 레이턴시를 동시에 줄이려는 한국 개발자에게 실질적 대안이 된다.

google-deepmindopen-sourcefunction-calling

무엇이 바뀌었나

Google DeepMind는 2026년 7월 21일 Gemma 3 27B의 Function Calling GA를 공식 발표했다. 이전까지 Gemma 시리즈의 함수 호출은 실험적 플래그(flag)를 통해서만 사용할 수 있었으나, 이번 GA로 다음이 가능해졌다.

  • tool_config 파라미터를 통해 최대 64개 병렬 툴 정의 지원
  • JSON Schema 기반 파라미터 검증이 추론 레이어에서 네이티브 처리
  • 4-bit GPTQ 양자화 버전 기준 RTX 4090(24 GB VRAM) 단일 GPU에서 구동 가능
  • Ollama 0.4+, llama.cpp b3700+ 빌드에서 --tool 플래그로 즉시 활성화

한국 개발자·크리에이터에게 왜 중요한가

  1. 비용 구조 변화: Gemini 2.5 Flash API 함수 호출 대비 클라우드 비용 $0—전기세와 GPU 상각만 고려하면 되는 구조.
  2. 데이터 프라이버시: 금융·의료·법률 도메인 스타트업이 민감 데이터를 외부 API로 전송하지 않고 사내 서버에서 에이전트 루프를 완결 가능.
  3. 오프라인 에이전트: 인터넷 연결이 불안정한 제조 현장, 키오스크, 엣지 IoT 환경에서도 멀티스텝 툴 체인 실행.
  4. 한국어 성능: Gemma 3 27B는 공개 벤치마크(KMMLU) 기준 72.4점으로 동급 오픈소스 모델 중 상위권이며, 한국어 지시 이행 품질이 함수 호출 시에도 유지된다고 팀이 밝혔다.

빠른 시작 — Ollama 기준

# 모델 풀
ollama pull gemma3:27b

# 툴 호출 예시 (curl)
curl http://localhost:11434/api/chat -d '{
  "model": "gemma3:27b",
  "messages": [{"role": "user", "content": "서울 날씨 알려줘"}],
  "tools": [{
    "type": "function",
    "function": {
      "name": "get_weather",
      "description": "도시 현재 날씨 조회",
      "parameters": {
        "type": "object",
        "properties": {"city": {"type": "string"}},
        "required": ["city"]
      }
    }
  }]
}'

참고: 가격(클라우드 호스팅 버전)은 Google AI Studio 및 Vertex AI 공식 페이지 참조. 로컬 실행은 무료 오픈소스 가중치 사용.

출처: Google DeepMind Blog