Google DeepMind, Veo 3 영상 생성 API 개발자 프리뷰 공개
Google DeepMind가 텍스트·이미지 프롬프트로 최대 8초 분량의 1080p 영상을 생성하는 Veo 3 API를 Google AI Studio 및 Vertex AI에서 개발자 프리뷰로 공개했다. 립싱크 오디오 생성과 카메라 모션 제어 파라미터가 API 레벨에서 직접 지원돼, 영상 크리에이터 툴 개발 진입장벽이 크게 낮아졌다.
Veo 3 API 핵심 스펙
| 항목 | 사양 | |------|------| | 최대 해상도 | 1920×1080 (1080p) | | 최대 길이 | 8초 (프리뷰 기준) | | 입력 모달리티 | 텍스트 / 이미지(첫 프레임) / 텍스트+이미지 혼합 | | 오디오 생성 | 립싱크·배경음 포함 선택 가능 | | 출력 포맷 | MP4 (H.264) | | 가격 | 공식 페이지 참조 |
카메라 모션은 camera_motion 파라미터로 "pan_left", "zoom_in", "orbit" 등 사전 정의 프리셋을 지정하거나 "free" 모드로 자연어 서술이 가능하다.
API 호출 예시 (Python + Vertex AI SDK)
from google.cloud import aiplatform
from vertexai.preview.vision_models import VideoGenerationModel
aiplatform.init(project="my-project", location="us-central1")
model = VideoGenerationModel.from_pretrained("veo-3-preview")
response = model.generate_video(
prompt="A developer types code in a dark café, bokeh lights, cinematic",
duration_seconds=6,
aspect_ratio="16:9",
resolution="1080p",
camera_motion="slow_zoom_in",
generate_audio=True,
safety_filter_level="block_some",
)
# GCS URI로 결과 저장
print(response.video_uri) # gs://my-bucket/output/veo3_xxxx.mp4
한국 크리에이터·개발자에게 미치는 영향
숏폼 영상 자동화 파이프라인 YouTube Shorts·Instagram Reels용 상품 소개 영상을 텍스트 스크립트 한 줄로 자동 생성하는 SaaS를 소규모 팀이 구축할 수 있는 기술 문턱이 마련됐다. 기존에는 Runway·Pika 등 서드파티 API를 거쳐야 했으나, Vertex AI 생태계 내에서 영상 생성·자막 처리(Cloud Speech-to-Text)·번역(Cloud Translation)을 단일 프로젝트로 통합 가능해진다.
콘텐츠 진위성 대응 Google은 Veo 3 출력 영상 전체에 SynthID 워터마크를 자동 삽입한다. 향후 국내 AI 생성물 표시 의무 규정 대응 시 감사 로그로 활용할 수 있다.
현재 제한 사항
- 프리뷰 기간 중 실제 인물 얼굴 생성은 정책상 제한
- 한국 리전(
asia-northeast3) 미지원, 현재us-central1·europe-west4만 가용 - 단일 요청 영상 길이 8초 상한 (연속 이어붙이기 API는 로드맵 미정)
- GA 전환 일정 미공개, 프리뷰 중 SLA 미보장