k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-09-133분

OpenAI, Batch API v2 정식 GA — 처리량 10배·결과 스트리밍 지원

OpenAI가 Batch API v2를 정식 출시하며 단일 배치당 최대 10만 건 요청 처리와 결과 부분 스트리밍을 지원한다. 기존 v1 대비 처리량이 최대 10배 늘었고 비용은 표준 API 요금의 50%가 유지되어, 대량 데이터 파이프라인을 운영하는 개발자에게 직접적인 비용 절감 효과가 기대된다.

openaiapideveloper

무엇이 달라졌나

Batch API v2는 기존 v1의 핵심 제약이었던 단일 배치 5만 건 상한10만 건으로 두 배 확대했다. 또한 배치 완료 전에도 처리된 결과를 순차적으로 받아볼 수 있는 부분 스트리밍(Partial Result Streaming) 엔드포인트가 추가됐다. 이로써 전체 배치가 끝날 때까지 블로킹되던 기존 방식보다 파이프라인 레이턴시를 크게 줄일 수 있다.

가격 및 지원 모델

요금은 기존과 동일하게 표준 온디맨드 요금의 50% 수준이 유지된다. 정확한 모델별 단가는 공식 페이지 참조. v2에서 새로 지원되는 모델은 다음과 같다.

  • GPT-4.1, GPT-4.1-mini (신규 추가)
  • o3, o4-mini (추론 모델 배치 첫 지원)
  • 기존 지원 모델(GPT-4o 계열) 그대로 유지

처리 완료 SLA는 24시간 이내로 동일하지만, 내부 벤치마크 기준 평균 완료 시간은 6~8시간으로 단축됐다고 OpenAI는 밝혔다.

한국 개발자 활용 포인트

대량 문서 임베딩, 번역 파이프라인, 반복 평가(Eval) 워크플로에서 즉시 활용 가능하다. Python SDK openai>=2.4.0 업데이트 후 client.batches.create() 호출 시 version="v2" 파라미터를 추가하면 된다. 부분 스트리밍은 SSE 방식으로 제공되며 기존 스트리밍 처리 코드를 그대로 재사용할 수 있어 마이그레이션 부담이 낮다. 특히 RAG 색인 구축이나 대규모 콘텐츠 생성 작업을 정기 배치로 돌리는 팀은 월 인프라 비용을 실질적으로 절반 수준으로 낮출 수 있다.

출처: OpenAI Platform Changelog