k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-074분

Anthropic, Claude Sonnet 4.6 하이브리드 추론 모드 정식 GA

Anthropic이 Claude Sonnet 4.6에 '확장 사고(Extended Thinking)' 온·오프 전환 기능을 정식 제공하며, 단일 API 호출로 속도와 깊이를 동시에 제어할 수 있게 됐다. 복잡한 코드 리뷰나 멀티스텝 추론이 필요한 에이전트 파이프라인에서 토큰 예산을 직접 지정할 수 있어 비용 예측이 쉬워진다.

anthropicllmapi

무엇이 달라졌나

Anthropic은 2026년 7월 7일 Claude Sonnet 4.6의 하이브리드 추론 모드를 정식 GA로 전환했다. 기존 베타에서는 Extended Thinking 활성화 여부가 계정 단위로 고정됐지만, 이번 업데이트부터는 API 요청의 thinking 파라미터로 요청별 전환이 가능하다.

{
  "model": "claude-sonnet-4-6",
  "thinking": {
    "type": "enabled",
    "budget_tokens": 8000
  }
}

budget_tokens 값은 1,024~32,000 범위에서 지정할 수 있으며, 0으로 설정하면 표준 응답 모드로 폴백된다.

성능·비용 수치

Anthropic 공식 벤치마크 기준, budget_tokens: 8000 설정 시 SWE-bench Verified에서 72.3% 정확도를 기록했다(표준 모드 대비 +9.1%p). 입력·출력 토큰 단가는 공식 페이지 참조. 단, thinking 블록 토큰은 출력 토큰에 합산되므로 비용 시뮬레이션 시 이를 반드시 고려해야 한다.

한국 개발자 활용 포인트

  • 코드 리뷰 에이전트: PR 당 thinking 예산을 4,000토큰으로 제한해 비용을 일정하게 유지하면서도 로직 오류 탐지율을 높일 수 있다.
  • RAG 파이프라인: 단순 청크 검색은 thinking 비활성화, 최종 답변 합성 단계만 활성화하는 2단계 설계가 유효하다.
  • Claude Code 연동: Claude Code SDK에서 --thinking-budget 플래그로 동일 파라미터를 노출하므로 터미널 워크플로에서도 즉시 적용 가능하다.
출처: Anthropic 공식 블로그