📰 AI 뉴스2026-07-304분
Google, Gemini 2.5 Flash-Lite 정식 GA—초저지연 추론 API 공개
Google DeepMind가 Gemini 2.5 Flash-Lite를 정식 GA로 전환하며 Google AI Studio 및 Vertex AI를 통해 외부 개발자에게 전면 개방했다. Flash 대비 응답 지연이 최대 40% 낮고 토큰당 비용도 절감되어, 실시간 챗봇·스트리밍 코드 보조 등 지연에 민감한 프로덕션 워크로드에 즉시 적용 가능하다.
googlegeminiapi
Gemini 2.5 Flash-Lite란 무엇인가
Gemini 2.5 Flash-Lite는 Gemini 2.5 패밀리 중 가장 경량화된 모델로, 추론 속도와 비용 효율을 최우선으로 설계했다. 컨텍스트 윈도우는 **100만 토큰(1M context)**을 지원하며, 멀티모달 입력(텍스트·이미지·오디오·비디오)을 모두 처리할 수 있다. 이번 GA 전환으로 SLA(서비스 수준 계약)가 공식 적용되어 프로덕션 배포의 안정성이 보장된다.
개발자·크리에이터에게 달라지는 점
지연(Latency) 측면에서 Gemini 2.5 Flash 대비 TTFT(Time To First Token)가 평균 40% 단축된 것으로 Google이 공개한 벤치마크에 명시되어 있다. 이는 스트리밍 UX가 중요한 IDE 플러그인, 실시간 번역, 라이브 코드 리뷰 도구에서 체감 차이가 크다.
가격은 공식 페이지 참조. Vertex AI 기준 서울 리전(asia-northeast3)에서도 동일하게 서비스되며, Google AI Studio에서는 무료 티어 할당량 내 즉시 테스트할 수 있다.
주요 API 변경점:
- 모델 ID:
gemini-2.5-flash-lite(Preview 접미사 제거) - 스트리밍 응답: Server-Sent Events 방식 동일 유지
- 함수 호출(Function Calling) 및 JSON 모드 정식 지원
- 시스템 인스트럭션 최대 32K 토큰 허용
import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-2.5-flash-lite")
response = model.generate_content(
"다음 Python 코드의 버그를 찾아 수정해줘: ...",
stream=True
)
for chunk in response:
print(chunk.text, end="", flush=True)
한국 개발자 적용 시 체크리스트
- 기존 Flash 사용자: 모델 ID만
gemini-2.5-flash-lite로 교체하면 마이그레이션 완료. 응답 포맷·SDK 호환성 변경 없음. - Vertex AI 서울 리전:
asia-northeast3엔드포인트에서 GA 버전 즉시 사용 가능. 데이터 레지던시 요건을 충족해야 하는 B2B 서비스에 적합. - 비용 최적화: 요약·분류·태깅 등 단순 반복 작업은 Flash-Lite로 내리고, 복잡한 다단계 추론은 Flash 또는 Pro로 라우팅하는 계층형 모델 전략 권장.
- 할당량 확인: GA 전환 후 분당 요청(RPM) 및 일일 토큰(TPD) 한도가 Preview 시절과 다를 수 있으므로 Google Cloud 콘솔에서 재확인 필요.
출처: Google DeepMind 공식 블로그