k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-124분

Google, Gemini 2.5 Flash-Lite 정식 GA—초저지연 온디바이스 추론 지원

Google DeepMind가 Gemini 2.5 Flash-Lite를 정식 출시하며 엣지 디바이스 및 서버리스 환경에서의 초저지연 추론을 공식 지원한다. 기존 Flash 대비 응답 지연이 최대 40% 감소했으며, 한국어 토크나이저 효율이 개선돼 국내 개발자의 비용 절감 효과가 기대된다.

googlegeminiedge-ai

Gemini 2.5 Flash-Lite란?

Google DeepMind가 2026년 7월 12일 Gemini 2.5 Flash-Lite를 Gemini API 및 Vertex AI에서 정식 GA로 전환했다. 이 모델은 Gemini 2.5 Flash의 경량화 파생 버전으로, 배치 처리 없이 실시간 스트리밍 응답이 필요한 챗봇·코파일럿·모바일 앱 시나리오를 주요 타깃으로 한다. 컨텍스트 윈도우는 100만 토큰을 유지하면서도 첫 토큰 응답 시간(TTFT)을 기존 Flash 대비 평균 40% 단축했다고 Google은 밝혔다.

한국어 토크나이저 개선과 비용 영향

이번 릴리스에서 가장 주목할 변화는 한국어·일본어 등 CJK 언어군에 대한 토크나이저 효율 개선이다. 기존 Flash 모델에서 한국어 문장은 영어 대비 토큰 소비가 최대 1.8배 많았으나, Flash-Lite는 이를 약 1.3배 수준으로 낮췄다. 동일한 한국어 프롬프트를 처리할 때 토큰 수가 줄어들기 때문에, API 호출 비용이 실질적으로 감소한다. 가격은 공식 페이지 참조.

개발자 적용 시나리오

서버리스 함수(Cloud Run, AWS Lambda 등) 환경에서 콜드 스타트 시간이 짧고 모델 로딩 오버헤드가 적어 즉각적인 통합이 가능하다. Vertex AI의 경우 gemini-2.5-flash-lite 모델 ID로 기존 Flash 코드에서 한 줄만 교체하면 전환이 완료된다. 또한 Android ML Kit와의 통합 경로가 공식 문서에 추가돼, 온디바이스 추론을 검토 중인 모바일 개발자도 진입 장벽이 낮아졌다. 크리에이터 툴 측면에서는 실시간 자막 생성·라이브 번역 파이프라인에 Flash-Lite를 우선 적용하는 레퍼런스 아키텍처가 함께 공개됐다.

출처: Google DeepMind Blog