Hugging Face, 추론 프로바이더 API 한국 리전 정식 지원 시작
Hugging Face Inference Providers가 AWS Seoul(ap-northeast-2) 리전을 정식 지원하기 시작하면서, 한국 개발자는 오픈소스 모델 추론 레이턴시를 기존 대비 최대 60% 줄일 수 있게 됐다. Llama 4 Scout, Mistral Small 3.2, Qwen2.5-Coder-32B 등 주요 모델이 서울 엔드포인트에서 즉시 호출 가능하며, 기존 Inference API 코드 변경 없이 region 파라미터만 추가하면 전환된다.
무엇이 달라졌나
Hugging Face는 2026년 7월 27일 Inference Providers의 서울 리전(ap-northeast-2) 정식 GA를 발표했다. 기존에는 미국(us-east-1)·유럽(eu-west-1) 두 리전만 지원해 한국 사용자는 평균 왕복 레이턴시 180~220ms를 감수해야 했다. 서울 리전 전환 후 내부 벤치마크 기준 평균 TTFT(Time to First Token) 62ms, 왕복 레이턴시 35~55ms 수준으로 낮아졌다.
지원 모델 목록(서울 리전 즉시 사용 가능):
| 모델 | 파라미터 | 최대 컨텍스트 | |------|---------|-------------| | Llama 4 Scout (INT4) | 17B active | 128K | | Mistral Small 3.2 | 22B | 128K | | Qwen2.5-Coder-32B-Instruct | 32B | 32K | | Phi-4-Mini | 3.8B | 16K |
개발자 적용 방법
기존 InferenceClient 사용자는 provider 및 region 파라미터만 추가하면 된다.
from huggingface_hub import InferenceClient
client = InferenceClient(
model="meta-llama/Llama-4-Scout-17B-16E-Instruct",
provider="aws",
region="ap-northeast-2", # 서울 리전
token="hf_..."
)
response = client.chat_completion(
messages=[{"role": "user", "content": "코드 리뷰해줘"}],
max_tokens=512
)
TypeScript/Node.js 환경에서는 @huggingface/inference 패키지 v3.4.0 이상에서 동일한 옵션이 지원된다. REST API 직접 호출 시에는 엔드포인트를 https://router.ap-northeast-2.huggingface.co/v1/로 변경하면 된다.
비용 및 주의사항
서울 리전 추론 요금은 기존 미국 리전 대비 약 8% 높게 책정되어 있으며, 정확한 per-token 단가는 Hugging Face 공식 가격 페이지 참조. Serverless Inference 무료 티어(월 1,000 요청)는 리전 무관 동일하게 적용된다.
한 가지 유의할 점은 현재 서울 리전에서 Dedicated Endpoint(전용 인스턴스) 생성은 미지원이며, 2026년 Q3 내 추가 예정이다. 높은 처리량이 필요한 프로덕션 워크로드는 당분간 Serverless 방식으로만 사용 가능하다. 데이터 레지던시 요건이 있는 서비스는 서울 리전 사용으로 국내 데이터 처리를 보장할 수 있어 금융·의료 분야 SaaS 개발자에게도 유용하다.