Google DeepMind, Gemma 3n 모바일 최적화 모델 정식 공개—온디바이스 추론 실용화
Google DeepMind가 스마트폰·엣지 디바이스를 겨냥한 오픈소스 모델 Gemma 3n을 Hugging Face와 Kaggle을 통해 정식 배포했다. E2B·E4B 두 사이즈로 제공되며, 4GB RAM 환경에서도 실시간 추론이 가능해 온디바이스 AI 앱 개발 진입 장벽을 낮춘다. MediaPipe LLM Inference API와 즉시 연동되어 Android·iOS 앱에 네이티브 통합이 가능하다.
Gemma 3n이란
Gemma 3n은 Google DeepMind가 모바일·임베디드 환경 전용으로 설계한 경량 오픈소스 LLM이다. 기존 Gemma 3 시리즈와 달리 MatFormer 아키텍처를 적용해 추론 시 실제 활성화 파라미터 수를 동적으로 조절한다. 공개 사이즈는 다음과 같다.
| 모델 | 전체 파라미터 | 유효(Effective) 파라미터 | 최소 RAM | |---|---|---|---| | Gemma 3n E2B | 5B | 2B | 4GB | | Gemma 3n E4B | 8B | 4B | 6GB |
가중치 라이선스는 Gemma Terms of Use(상업 이용 허용, 재배포 시 원본 라이선스 명시)를 따른다.
개발자 통합 경로
- MediaPipe LLM Inference API: 안드로이드 Kotlin/Java, iOS Swift에서 5줄 이내 코드로 온디바이스 추론 파이프라인 구성 가능.
- LiteRT(구 TFLite) 변환:
ai-edge-torch라이브러리로 INT4 양자화 모델 변환 시 E2B 기준 모델 크기 약 1.3GB. - Hugging Face Transformers:
AutoModelForCausalLM.from_pretrained("google/gemma-3n-E2B-it")표준 인터페이스 지원. - Ollama 지원:
ollama pull gemma3n:e2b명령으로 즉시 로컬 서버 구동 가능(2026-07-06 기준 Ollama 라이브러리 등록 완료).
한국 개발자·크리에이터 활용 시나리오
서버 비용 없이 동작하는 온디바이스 모델은 개인정보 처리 규제(개인정보보호법 개정안)에 민감한 헬스케어·핀테크 앱에 특히 유리하다. 한국어 벤치마크(KoBEST 기준) E4B 모델이 E2B 대비 평균 11.4점 높은 점수를 기록해, 한국어 품질이 중요한 서비스라면 E4B 선택이 권장된다. 크리에이터 툴 측면에서는 인터넷 연결 없이 동작하는 자막 생성·실시간 번역 앱 프로토타입 제작에 즉시 활용 가능하다.