📰 AI 뉴스2026-07-214분
Google DeepMind, Gemma 3 27B 온디바이스 함수 호출 정식 GA
Google DeepMind가 Gemma 3 27B 모델의 함수 호출(Function Calling) 기능을 로컬·엣지 환경에서 정식 지원한다고 발표했다. 클라우드 API 없이 서버나 디바이스 내부에서 도구 호출 파이프라인을 완결할 수 있어, API 비용과 레이턴시를 동시에 줄이려는 한국 개발자에게 실질적 대안이 된다.
google-deepmindopen-sourcefunction-calling
무엇이 바뀌었나
Google DeepMind는 2026년 7월 21일 Gemma 3 27B의 Function Calling GA를 공식 발표했다. 이전까지 Gemma 시리즈의 함수 호출은 실험적 플래그(flag)를 통해서만 사용할 수 있었으나, 이번 GA로 다음이 가능해졌다.
tool_config파라미터를 통해 최대 64개 병렬 툴 정의 지원- JSON Schema 기반 파라미터 검증이 추론 레이어에서 네이티브 처리
- 4-bit GPTQ 양자화 버전 기준 RTX 4090(24 GB VRAM) 단일 GPU에서 구동 가능
- Ollama 0.4+, llama.cpp
b3700+빌드에서--tool플래그로 즉시 활성화
한국 개발자·크리에이터에게 왜 중요한가
- 비용 구조 변화: Gemini 2.5 Flash API 함수 호출 대비 클라우드 비용 $0—전기세와 GPU 상각만 고려하면 되는 구조.
- 데이터 프라이버시: 금융·의료·법률 도메인 스타트업이 민감 데이터를 외부 API로 전송하지 않고 사내 서버에서 에이전트 루프를 완결 가능.
- 오프라인 에이전트: 인터넷 연결이 불안정한 제조 현장, 키오스크, 엣지 IoT 환경에서도 멀티스텝 툴 체인 실행.
- 한국어 성능: Gemma 3 27B는 공개 벤치마크(KMMLU) 기준 72.4점으로 동급 오픈소스 모델 중 상위권이며, 한국어 지시 이행 품질이 함수 호출 시에도 유지된다고 팀이 밝혔다.
빠른 시작 — Ollama 기준
# 모델 풀
ollama pull gemma3:27b
# 툴 호출 예시 (curl)
curl http://localhost:11434/api/chat -d '{
"model": "gemma3:27b",
"messages": [{"role": "user", "content": "서울 날씨 알려줘"}],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "도시 현재 날씨 조회",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"]
}
}
}]
}'
참고: 가격(클라우드 호스팅 버전)은 Google AI Studio 및 Vertex AI 공식 페이지 참조. 로컬 실행은 무료 오픈소스 가중치 사용.
출처: Google DeepMind Blog