k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-09-104분

Google DeepMind, Gemma 3n 온디바이스 추론 정식 공개 — 모바일 NPU 최적화 가중치 포함

Google DeepMind가 스마트폰·엣지 디바이스를 겨냥한 오픈웨이트 모델 Gemma 3n을 Hugging Face와 Kaggle을 통해 정식 배포했다. E2B(Effective 2B)·E4B 두 가지 사이즈로 제공되며, Android MediaPipe LLM Inference API와 직결되어 한국 모바일 앱 개발자의 온디바이스 AI 통합 허들이 크게 낮아질 전망이다.

google-deepmindopen-sourcemobile

Gemma 3n 아키텍처 핵심

Gemma 3n은 기존 Gemma 시리즈와 달리 MatFormer(Matryoshka Transformer) 구조를 채택해 하나의 가중치 파일로 여러 추론 크기를 지원한다. 실제 파라미터 수는 5B·8B이지만 레이어 선택적 활성화로 E2B(실효 2B)·E4B(실효 4B) 연산량만 사용한다.

공개 스펙 | 항목 | E2B | E4B | |------|-----|-----| | 실효 파라미터 | ~2B | ~4B | | KV 캐시 (4-bit) | 약 512 MB | 약 1 GB | | 권장 RAM | 4 GB | 6 GB | | 라이선스 | Gemma Terms of Use (상업 허용) | 동일 | | 양자화 | INT4, INT8 공식 제공 | 동일 |

오디오 인코더를 내장해 텍스트 없이 음성 입력을 직접 처리할 수 있으며, 이미지·텍스트·오디오를 하나의 세션에서 혼합 입력하는 멀티모달 추론이 가능하다. 가격: 오픈웨이트 무료 배포, 클라우드 API 비용은 공식 페이지 참조.

Android / iOS 통합 방법

// Android — MediaPipe LLM Inference API 예시
val options = LlmInferenceOptions.builder()
    .setModelPath("/data/local/tmp/gemma3n-e2b-int4.task")
    .setMaxTokens(1024)
    .setPreferredBackend(Backend.GPU) // 또는 NPU
    .build()
val llmInference = LlmInference.createFromOptions(context, options)
val result = llmInference.generateResponse("사용자 메시지")

iOS의 경우 MediaPipe iOS SDK 또는 llama.cpp Metal 백엔드를 통해 동일 가중치를 사용할 수 있다. Google AI Edge Gallery 앱으로 디바이스에서 즉시 체험 가능하며, AI Edge SDK는 Pixel 9 시리즈 NPU를 자동 감지해 가속 추론을 활성화한다.

한국 개발자 주목 포인트

온디바이스 추론이 가능해지면 사용자 데이터가 서버로 전송되지 않으므로 금융·헬스케어 앱의 개인정보보호법(PIPA) 컴플라이언스 부담이 줄어든다. 또한 네트워크 의존 없이 동작하므로 지하철·터널 등 오프라인 환경에서도 AI 기능이 유지된다. 한국어 토크나이저는 Gemma 3 계열과 동일한 256K 어휘 사전을 사용해 한국어 문자 단위 분절 문제가 이전 버전 대비 개선됐다고 DeepMind 기술 블로그는 밝혔다.

출처: Google DeepMind Technical Blog