k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-09-174분

Google DeepMind, Gemini Robotics-ER API 개발자 프리뷰 공개

Google DeepMind가 로봇·물리적 에이전트 개발을 위한 Gemini Robotics-ER(Embodied Reasoning) API를 개발자 프리뷰로 공개했다. 3D 공간 추론과 동작 계획을 단일 멀티모달 엔드포인트로 제공해, 로봇 제어 파이프라인 구축 시 별도 비전·플래닝 모델을 통합할 필요가 없어 한국 하드웨어·자동화 스타트업의 개발 진입 장벽이 크게 낮아질 전망이다.

google-deepmindroboticsapi

Gemini Robotics-ER이란?

Gemini Robotics-ER은 DeepMind가 기존 Gemini 멀티모달 아키텍처 위에 물리적 환경 추론 레이어를 추가한 특화 모델이다. 단일 API 호출로 RGB-D 이미지·포인트 클라우드 입력 → 3D 바운딩 박스 예측 → 6-DOF 그립 포즈 출력 까지 처리하며, 기존에 ViT + 별도 플래닝 스택이 필요했던 작업을 대폭 단순화한다.

주요 제공 기능:

  • Spatial Grounding: 자연어 쿼리로 장면 내 특정 객체의 3D 좌표 반환
  • Action Planning: 단계별 조작 계획을 JSON 시퀀스로 출력 (MoveArm, Grasp, Place 등 표준 액션 타입)
  • Sim-to-Real 브리지: Isaac Sim·MuJoCo 시뮬레이터와 호환되는 포즈 포맷 직접 출력

입력 스펙 및 API 구조

| 항목 | 사양 | |---|---| | 이미지 해상도 | 최대 1920×1080 (RGB/RGBD) | | 포인트 클라우드 | PLY·PCD 포맷, 최대 512K 포인트 | | 응답 지연 | 내부 벤치마크 평균 340ms (단일 프레임 추론) | | 언어 쿼리 최대 길이 | 2,048 토큰 | | SDK | Python 3.10+, REST JSON |

요청 예시 (Python SDK):

from google.ai import robotics_er

client = robotics_er.Client(api_key="YOUR_KEY")
result = client.ground_and_plan(
    image_path="scene.png",
    query="빨간 컵을 트레이 위로 옮겨줘",
    output_format="action_sequence"
)
print(result.actions)  # [{"type": "Grasp", "pose": {...}}, ...]

가격은 프리뷰 기간 무료 쿼터(월 10,000 요청) 제공 후 GA 시 공식 페이지 참조.

한국 개발자·크리에이터에게 주는 의미

물류·제조 자동화 분야에서 국내 로봇 스타트업들은 그간 ROS2 + 커스텀 비전 모델 조합에 상당한 엔지니어링 공수를 투입해왔다. Gemini Robotics-ER API가 3D 추론과 액션 플래닝을 SaaS 형태로 추상화함으로써, 로봇 본체 제어 로직에만 집중할 수 있는 환경이 마련된다.

또한 크리에이터·인터랙티브 미디어 영역에서도 활용 가능성이 열린다. 모션 캡처 없이 자연어 지시만으로 3D 씬 내 오브젝트의 물리적 동작을 계획할 수 있어, 게임 NPC AI나 메타버스 환경 내 에이전트 구현에 새로운 접근법을 제시한다.

개발자 프리뷰 신청은 Google AI for Developers 공식 페이지에서 웨이트리스트 등록으로 진행되며, 한국어 문서와 Colab 노트북 샘플은 공개 시점에 공식 GitHub 저장소(google-deepmind/robotics-er-samples)에 배포될 예정이다.

출처: Google DeepMind Blog