HuggingFace, 서울 리전 Inference Providers 정식 지원 개시
Hugging Face가 Inference Providers 서비스의 서울(ap-northeast-2) 리전 엔드포인트를 정식 가동했다. 국내 개발자는 GDPR·데이터 국외 이전 이슈 없이 수백 개의 공개 모델을 낮은 레이턴시로 호출할 수 있다. 기존 Inference API와 동일한 인증 토큰을 사용하며, Serverless 및 Dedicated Endpoint 두 가지 모드를 모두 지원한다.
서울 리전 엔드포인트 사양
서울 리전 Dedicated Endpoint는 NVIDIA A100 80GB 및 L4 인스턴스를 선택적으로 프로비저닝할 수 있다. 콜드 스타트 없는 Serverless 모드에서는 평균 응답 레이턴시가 기존 미국 리전 대비 약 60~70ms 단축된 수치를 보인다(서울 클라이언트 기준 내부 측정). 지원 모델은 Hub에 공개된 Llama 계열, Mistral 계열, Qwen 2.5, Phi-4 등 수백 종이며, 텍스트·임베딩·이미지 분류 태스크를 포함한다.
한국 규제 환경과의 접점
개인정보보호법 및 금융보안원 가이드라인상 국외 데이터 이전에 민감한 국내 기업은 서울 리전 Dedicated Endpoint를 통해 데이터가 국내 AWS 인프라 내에 머무는 구성을 공식적으로 취할 수 있게 됐다. Hugging Face는 SOC 2 Type II 및 ISO 27001 인증을 보유하고 있으며, 리전별 데이터 처리 명세서(Data Processing Agreement)를 별도 제공한다. 가격은 공식 페이지 참조.
크리에이터·스타트업 활용 시나리오
No-code 파이프라인을 구성하는 크리에이터라면 Hugging Face의 Spaces + 서울 리전 Endpoint 조합으로 사용자 체감 속도를 즉시 개선할 수 있다. 스타트업 팀은 Serverless 모드로 트래픽 없을 때 과금이 발생하지 않는 구조를 활용해 MVP 단계의 인프라 비용을 최소화할 수 있다. Python SDK(huggingface_hub>=0.24)에서 region='ap-northeast-2' 파라미터 한 줄 추가로 전환이 완료된다.