📰 AI 뉴스2026-07-184분
Google Gemini API, 암묵적 컨텍스트 캐싱 정식 도입—긴 프롬프트 비용 최대 75% 절감
Google DeepMind가 Gemini 1.5 Pro·Flash 대상으로 '암묵적 컨텍스트 캐싱(Implicit Context Caching)'을 정식 활성화했다. 동일 프리픽스 토큰이 반복 요청에 재사용되면 자동으로 캐시가 적용되며, 개발자가 별도 API 호출 없이 비용 절감 효과를 누릴 수 있다. 대형 시스템 프롬프트나 RAG 문서 청크를 고정으로 사용하는 서비스에서 즉각적인 인프라 비용 감소가 기대된다.
googlegeminicost-optimization
암묵적 캐싱이 기존 방식과 다른 점
기존 Gemini API의 명시적 캐싱(Explicit Caching)은 개발자가 cachedContent 리소스를 직접 생성·관리해야 했다. 암묵적 캐싱은 Google 인프라가 요청 프리픽스를 자동 식별해 캐시를 생성한다. 조건은 프리픽스 토큰 1,024개 이상이고, 캐시 히트 시 해당 토큰은 정가의 25% 요금만 부과된다. 캐시 미스가 발생해도 추가 비용은 없다.
지원 모델과 비용 수치
| 모델 | 입력 정가(1M 토큰) | 캐시 히트 요금 | |---|---|---| | Gemini 1.5 Pro | $3.50 | $0.875 | | Gemini 1.5 Flash | $0.075 | $0.01875 |
캐시 저장 비용은 시간당 1M 토큰 기준 Gemini 1.5 Pro $4.50, Flash $1.00. 24시간 이상 동일 시스템 프롬프트를 사용하는 챗봇·RAG 서비스라면 저장 비용 대비 절감액이 크게 역전된다.
한국 개발자 적용 포인트
- 법률·금융 RAG 서비스: 수천 토큰의 약관·규정 문서를 시스템 프롬프트에 고정 삽입하는 패턴이 자동으로 혜택을 받는다. 코드 변경 없이 청구서 감소 확인 가능.
- 멀티턴 고객센터 봇: 긴 페르소나 지시문과 상품 카탈로그를 프리픽스로 고정하면 대화당 평균 입력 비용이 최대 60~75% 감소.
- 모니터링: Google Cloud Console의
cached_token_count메트릭을 대시보드에 추가해 캐시 히트율을 추적하고, 프롬프트 구조를 프리픽스 최대화 방향으로 점진적으로 개선하는 것을 권장.
출처: Google AI for Developers 공식 문서