k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-244분

Google, Gemini 2.5 Flash 추론 토큰 비용 40% 인하—Thinking 예산 제어 API 추가

Google DeepMind가 Gemini 2.5 Flash의 내부 추론(Thinking) 토큰 단가를 기존 대비 40% 인하하고, 개발자가 추론 깊이를 0~24,576 토큰 범위에서 직접 제어할 수 있는 `thinkingBudget` 파라미터를 Google AI Studio 및 Vertex AI에 정식 추가했다. 이로써 비용과 응답 품질 사이의 트레이드오프를 코드 한 줄로 조정할 수 있게 되어, 예산 민감한 스타트업 및 프리랜서 개발자의 실사용 접근성이 높아졌다.

geminigoogle-deepmindcost-optimization

변경된 가격 구조

Google은 2026년 7월 24일부로 Gemini 2.5 Flash 가격 정책을 아래와 같이 개정했다.

| 항목 | 변경 전 | 변경 후 | |---|---|---| | 입력 토큰 (128K 이하) | $0.075 / 1M | $0.075 / 1M (유지) | | 입력 토큰 (128K 초과) | $0.15 / 1M | $0.15 / 1M (유지) | | 추론(Thinking) 토큰 | $3.50 / 1M | $2.10 / 1M (-40%) | | 출력 토큰 | $0.30 / 1M | $0.30 / 1M (유지) |

위 수치는 공시 기준이며 Vertex AI 약정 할인 및 프로모션 크레딧은 별도. 최신 단가는 공식 페이지 참조.

thinkingBudget 파라미터 사용법

thinkingBudget 값을 0으로 설정하면 추론 단계를 완전히 비활성화해 Thinking 토큰 비용이 발생하지 않는다. 최대값 24,576은 복잡한 수학·코드 디버깅 태스크에 권장된다.

import google.generativeai as genai

model = genai.GenerativeModel("gemini-2.5-flash")

# 빠른 응답 우선 (Thinking 비활성)
response_fast = model.generate_content(
    "이 함수의 시간복잡도를 알려줘",
    generation_config=genai.GenerationConfig(
        thinking_config={"thinking_budget": 0}
    )
)

# 고품질 추론 (최대 Thinking)
response_deep = model.generate_content(
    "아래 분산 트랜잭션 코드의 데드락 가능성을 분석해줘",
    generation_config=genai.GenerationConfig(
        thinking_config={"thinking_budget": 24576}
    )
)

한국 개발자 활용 시나리오 3가지

  1. 챗봇·고객 응대 서비스: thinkingBudget: 0으로 설정해 응답 지연 최소화, Thinking 비용 제로로 운영 가능.
  2. 코드 리뷰 자동화 CI 파이프라인: 간단한 린팅은 예산 0, PR 전체 아키텍처 리뷰는 예산 8,192 수준으로 단계별 차등 적용.
  3. 수능·자격증 학습 앱: 문제 난이도에 따라 동적으로 예산을 조절하는 로직 구현 시 월 API 비용을 실측 기준 약 30~35% 절감 가능(Google 발표 내부 벤치마크 기준).

이번 인하로 Gemini 2.5 Flash Thinking은 동급 추론 모델 중 가장 낮은 토큰 단가대를 형성하게 됐으며, 특히 Vertex AI 기반으로 한국 리전(asia-northeast3) 서비스를 운영 중인 팀에게 즉각적인 비용 절감 효과가 기대된다.

출처: Google DeepMind Official Blog