k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-134분

Google DeepMind, Gemma 3n 엣지 특화 모델 정식 GA

Google DeepMind가 모바일·임베디드 환경을 겨냥한 Gemma 3n을 정식 출시했다. 2B·4B 파라미터 변형이 제공되며, 안드로이드·라즈베리파이 등 저전력 디바이스에서 추론을 로컬로 실행할 수 있어 온디바이스 AI 앱을 개발하는 한국 크리에이터에게 즉각적인 실전 옵션이 열렸다.

googleedge-aiopen-source

Gemma 3n이란 무엇인가

Gemma 3n은 Google DeepMind가 엣지·모바일 환경에 최적화하여 설계한 경량 오픈 모델 시리즈다. 기존 Gemma 3(1B~27B)와 달리 MatFormer 아키텍처를 채택해 동일 파라미터 대비 메모리 점유를 최대 40% 줄인 것이 특징이다. 파라미터 규모는 E2B(실효 2B)와 E4B(실효 4B) 두 가지로 제공된다.

핵심 스펙 및 성능

  • 모델 크기: E2B 약 2GB, E4B 약 4GB(INT4 양자화 기준)
  • 지원 런타임: Google AI Edge SDK, LiteRT, MediaPipe LLM Inference API
  • 멀티모달: 텍스트·이미지 입력 동시 지원(E4B 한정)
  • 벤치마크: MMLU에서 E4B 기준 Gemma 3 4B 대비 동등 수준 유지, 추론 속도는 Pixel 9 Pro 기준 초당 약 30 토큰
  • 라이선스: Gemma Terms of Use(상업적 사용 허용, 파인튜닝 가능)
  • 가격: 모델 가중치 무료 공개, Google AI API를 통한 호스팅 추론은 공식 페이지 참조

한국 개발자 실전 활용 포인트

안드로이드 앱에 온디바이스 챗봇·이미지 캡셔닝을 내장하려는 개발자는 MediaPipe LLM Inference API와 Gemma 3n E2B 조합으로 APK 크기 증가 없이 서버 통신 없는 추론이 가능하다. 라즈베리파이 5(8GB RAM) 환경에서도 E2B를 LiteRT로 구동해 초당 약 8~12 토큰 속도를 기대할 수 있어 IoT 프로토타입 제작에 적합하다. Hugging Face에 가중치가 공개되어 있으며, transformers 4.46 이상에서 AutoModelForCausalLM으로 바로 로드 가능하다. 국내 스타트업이 서버 비용 없이 개인정보 민감 데이터를 로컬에서 처리하는 RAG 파이프라인 구축에도 유력한 선택지다.

출처: Google DeepMind Blog