AI 뉴스
매일 3개 자동 업데이트 · 공식 발표와 실전 경험을 기반으로 큐레이션합니다.
OpenAI, Realtime API 한국어 TTS 음성 8종 정식 지원
OpenAI가 Realtime API에 한국어 최적화 TTS 음성 모델 8종을 정식 추가했다. 기존 영어 중심 음성 대비 한국어 억양·발음 자연스러움이 크게 개선되어, 한국어 음성 인터페이스를 구현하는 개발자에게 직접적인 영향을 준다.
Anthropic, Claude Sonnet 4.6 프롬프트 캐시 TTL 최대 2시간으로 연장
Anthropic이 Claude Sonnet 4.6의 프롬프트 캐싱 TTL을 기존 5분에서 최대 2시간으로 연장했다. 동일 컨텍스트를 반복 호출하는 서비스에서 입력 토큰 비용을 대폭 절감할 수 있어, 챗봇·코딩 어시스턴트 등 고빈도 API 호출 제품에 즉각적인 영향을 준다.
Cursor, MCP 서버 자체 호스팅 기능 정식 GA—사내 툴 통합 가능
Cursor가 Model Context Protocol(MCP) 서버를 개발자 로컬 환경 또는 사내 인프라에서 직접 호스팅할 수 있는 기능을 정식 출시했다. 이를 통해 사내 코드베이스, 위키, 이슈 트래커 등 외부로 반출이 어려운 데이터를 AI 컨텍스트로 안전하게 활용할 수 있다. 보안 정책이 엄격한 금융·공공 분야 한국 기업 개발팀에게 실질적인 도입 경로가 열렸다는 점에서 주목받고 있다.
GitHub Copilot, 기본 모델을 Claude Sonnet 계열로 교체—코드 완성 정확도 개선
GitHub이 Copilot Individual·Business·Enterprise 전 플랜에서 코드 완성 및 인라인 채팅의 기본 백엔드 모델을 Claude Sonnet 계열로 전환했다. 특히 멀티파일 리팩터링과 타입 추론 정확도가 이전 GPT 계열 대비 향상됐다는 내부 벤치마크 수치를 함께 공개했다. 별도 추가 비용 없이 기존 구독자에게 즉시 적용되며, 원하면 설정에서 모델을 수동 전환할 수 있다.
Anthropic, Claude Opus 4.7 배치 API 정식 GA—대규모 문서 파이프라인 지원
Anthropic이 Claude Opus 4.7 모델을 배치 API에서 정식 지원하기 시작했다. 기존 동기 호출 대비 최대 50% 비용 절감이 적용되며, 단일 배치 요청당 최대 10만 건 처리가 가능해 대규모 문서 분류·요약 파이프라인 구축이 현실적으로 가능해졌다.
Meta, Llama 4 Maverick 한국어 파인튜닝 공식 가이드·베이스 어댑터 공개
Meta가 Hugging Face Hub를 통해 Llama 4 Maverick 기반의 한국어 특화 LoRA 어댑터와 공식 파인튜닝 레시피를 공개했다. 한국어 벤치마크(KoBEST, HAE-RAE) 기준 기존 Llama 3.3 70B 대비 평균 11%p 향상된 수치가 함께 제시됐으며, 국내 개발팀의 도메인 특화 모델 구축 진입 장벽이 크게 낮아질 전망이다.
Google, Gemini 2.5 Flash-Lite 정식 GA—초저지연 추론 API 공개
Google DeepMind가 Gemini 2.5 Flash-Lite를 정식 GA로 전환하며 Google AI Studio 및 Vertex AI를 통해 외부 개발자에게 전면 개방했다. Flash 대비 응답 지연이 최대 40% 낮고 토큰당 비용도 절감되어, 실시간 챗봇·스트리밍 코드 보조 등 지연에 민감한 프로덕션 워크로드에 즉시 적용 가능하다.
OpenAI, o3-mini 컨텍스트 윈도우 200K로 확장—장문 코드베이스 추론 지원
OpenAI가 o3-mini 모델의 컨텍스트 윈도우를 기존 128K에서 200K 토큰으로 확장했다. 대규모 모노레포나 장문 기술 문서를 단일 요청으로 처리할 수 있어 엔터프라이즈 개발 워크플로에 직접적인 영향을 준다.
Google, AI Studio서 Veo 3 영상 생성 API 정식 GA—한국 리전 포함
Google DeepMind의 영상 생성 모델 Veo 3가 Google AI Studio 및 Gemini API를 통해 정식 GA(일반 공개) 상태로 전환됐다. 한국 리전 엔드포인트가 동시 지원돼 국내 크리에이터 툴·광고 테크 스타트업의 서비스 통합 진입 장벽이 낮아졌다.
Anthropic, Claude Code 서브에이전트 오케스트레이션 정식 GA
Anthropic이 Claude Code의 멀티 서브에이전트 병렬 실행 기능을 정식 출시했다. 하나의 태스크를 최대 10개의 서브에이전트로 분기해 동시에 처리할 수 있어, 대규모 리팩터링·테스트 자동화 파이프라인 구축 시 소요 시간이 기존 대비 최대 6배 단축된다.
Meta, Llama 4 Maverick 함수 호출 기능 정식 지원—JSON 스키마 강제 출력 추가
Meta가 Llama 4 Maverick 모델에 구조화된 함수 호출(Function Calling)과 JSON Schema 강제 출력(Constrained Decoding) 기능을 정식 지원한다고 발표했다. 기존에는 프롬프트 엔지니어링으로 우회해야 했던 도구 연동 워크플로를 이제 표준 API 파라미터로 직접 제어할 수 있어, 에이전트 파이프라인 구축 난도가 크게 낮아진다.
Anthropic, Claude Sonnet 4.6 확장 사고 스트리밍 API 정식 GA
Anthropic이 Claude Sonnet 4.6의 Extended Thinking(확장 사고) 결과를 스트리밍으로 실시간 수신할 수 있는 API를 정식 일반 공개(GA)했다. 사고 과정(thinking block)과 최종 답변(text block)이 청크 단위로 분리 전달되어, 복잡한 추론 작업 중에도 사용자에게 진행 상황을 즉각 노출하는 UX를 구현할 수 있다.
OpenAI, Structured Outputs v2 정식 출시—JSON Schema 100% 준수 보장
OpenAI가 Structured Outputs v2를 정식 GA하며 복잡한 중첩 스키마에서도 JSON 출력 100% 일치를 보장하는 엄격 모드를 도입했다. 기존 v1 대비 스키마 복잡도 제한이 대폭 완화되고, 재시도 없이 단일 호출로 유효한 구조화 응답을 받을 수 있어 프로덕션 파이프라인 안정성이 크게 향상된다.
Google DeepMind, Gemini Robotics API 정식 공개—멀티모달 물리 추론 외부 접근
Google DeepMind가 로봇·물리 환경 제어에 특화된 Gemini Robotics API를 오늘부로 외부 개발자에게 정식 공개했다. 카메라 피드, 센서 데이터, 자연어 명령을 단일 컨텍스트로 처리하는 멀티모달 추론이 핵심으로, 하드웨어 없이 시뮬레이터 환경에서도 즉시 테스트할 수 있어 한국 로봇·IoT 스타트업의 진입 장벽이 크게 낮아질 전망이다.
Anthropic, Claude Haiku 4.5 배치 API 처리량 한도 5배 상향—비용 구조 개편
Anthropic이 Claude Haiku 4.5 모델의 배치(Batch) API 처리량 한도를 기존 대비 5배 높이고, 대용량 처리 시 추가 할인을 적용하는 가격 구조 개편을 오늘 공식 발표했다. 반복적인 텍스트 분류, 코드 리뷰 자동화, 대규모 콘텐츠 파이프라인을 운영하는 팀에게 직접적인 비용 절감 효과가 기대된다.
Hugging Face, 추론 프로바이더 API 한국 리전 정식 지원 시작
Hugging Face Inference Providers가 AWS Seoul(ap-northeast-2) 리전을 정식 지원하기 시작하면서, 한국 개발자는 오픈소스 모델 추론 레이턴시를 기존 대비 최대 60% 줄일 수 있게 됐다. Llama 4 Scout, Mistral Small 3.2, Qwen2.5-Coder-32B 등 주요 모델이 서울 엔드포인트에서 즉시 호출 가능하며, 기존 Inference API 코드 변경 없이 region 파라미터만 추가하면 전환된다.
OpenAI, Codex CLI v2 정식 출시—로컬 파일 시스템 직접 편집 지원
OpenAI가 터미널 기반 코딩 에이전트 Codex CLI v2를 정식 출시하며, 샌드박스 없이 로컬 파일 시스템을 직접 읽고 쓰는 기능을 추가했다. o3 모델 기반으로 멀티파일 리팩터링과 테스트 자동 실행을 지원해, CI 파이프라인 통합 없이 개발자 로컬 환경에서 바로 활용 가능하다는 점이 주목된다.
EU AI Act 고위험 AI 의무 조항 발효—한국 SaaS 수출에 직접 영향
EU AI Act의 고위험(High-Risk) AI 시스템 관련 의무 조항이 오늘(2026-07-26)부로 공식 적용되기 시작해, EU 시장에 AI 기능을 탑재한 제품을 공급하는 한국 기업도 즉시 준수 의무를 갖게 됐다. 채용·대출 심사·의료 보조 등 특정 카테고리 AI는 적합성 평가(Conformity Assessment)와 기술 문서화 의무를 이행해야 하며, 미준수 시 전 세계 연간 매출의 최대 3%에 해당하는 과징금이 부과된다.
Meta, Llama 4 Scout 양자화 공식 릴리즈—RTX 4090 단일 GPU 구동 확인
Meta가 Llama 4 Scout의 INT4·INT8 공식 양자화 가중치를 Hugging Face에 공개했다. 16GB VRAM 단일 GPU에서 full-context 10M 토큰을 처리할 수 있어, 클라우드 비용 없이 로컬 추론 파이프라인을 구축하려는 한국 개발자에게 실질적 대안이 된다.
OpenAI, Realtime API WebRTC 모드 정식 GA—브라우저 직접 음성 연결
OpenAI가 서버 중계 없이 브라우저·모바일 클라이언트에서 GPT-4o 음성 모델에 직접 WebRTC로 연결하는 Realtime API WebRTC 모드를 정식 출시했다. 기존 WebSocket 방식 대비 레이턴시가 평균 35% 감소하며, 별도 미디어 서버 없이 프론트엔드 JavaScript 단에서 세션을 개설할 수 있어 음성 에이전트 구현 복잡도가 크게 낮아진다.
GitHub Copilot Workspace, CLI 통합 정식 출시—터미널서 태스크 플래닝
GitHub이 Copilot Workspace의 핵심 기능인 태스크 플래닝·코드 생성·PR 생성 워크플로를 `gh copilot workspace` CLI 서브커맨드로 정식 지원하기 시작했다. CI 파이프라인이나 로컬 터미널 환경에서 웹 브라우저 없이 이슈 번호만으로 구현 계획을 생성하고 브랜치·PR까지 자동화할 수 있다.
Cursor, 백그라운드 에이전트 정식 GA—로컬 떠나도 코딩 계속
Cursor가 사용자가 IDE를 닫아도 클라우드에서 자율적으로 코드를 작성·테스트·커밋하는 백그라운드 에이전트(Background Agent)를 정식 출시했다. 장시간 리팩터링이나 테스트 스위트 실행처럼 대기가 필요한 작업을 오프로드할 수 있어, 한국 개발자들의 멀티태스킹 워크플로에 직접적인 변화가 예상된다.
Anthropic, Claude Code SDK 다국어 지원 정식 GA—Python·TypeScript 외 Go·Rust 추가
Anthropic이 Claude Code SDK에 Go 및 Rust 언어 바인딩을 정식 추가하며 멀티언어 에이전트 개발 환경을 확장했다. 기존 Python·TypeScript 중심 워크플로에서 벗어나 시스템 프로그래밍 언어로도 Claude Sonnet 4 기반 코딩 에이전트를 직접 임베드할 수 있게 되어, 서버·임베디드 환경 개발자의 도입 장벽이 크게 낮아졌다.
Google, Gemini 2.5 Flash 추론 토큰 비용 40% 인하—Thinking 예산 제어 API 추가
Google DeepMind가 Gemini 2.5 Flash의 내부 추론(Thinking) 토큰 단가를 기존 대비 40% 인하하고, 개발자가 추론 깊이를 0~24,576 토큰 범위에서 직접 제어할 수 있는 `thinkingBudget` 파라미터를 Google AI Studio 및 Vertex AI에 정식 추가했다. 이로써 비용과 응답 품질 사이의 트레이드오프를 코드 한 줄로 조정할 수 있게 되어, 예산 민감한 스타트업 및 프리랜서 개발자의 실사용 접근성이 높아졌다.
Meta, Llama 4 Behemoth API 정식 공개—2조 파라미터 추론 외부 접근 허용
Meta가 Llama 4 Behemoth 모델의 외부 API 접근을 정식 GA로 전환하며, 개발자는 Meta AI API를 통해 직접 호출할 수 있게 됐다. 기존 Scout·Maverick 대비 수학·코딩 벤치마크에서 최대 38% 높은 성능을 기록해 복잡한 추론 파이프라인 구축에 새로운 선택지가 생겼다.
Anthropic, MCP 공식 툴 레지스트리 출시—검증된 서버 즉시 연결
Anthropic이 Model Context Protocol(MCP) 생태계를 위한 공식 툴 레지스트리를 정식 공개했다. 개발자는 Anthropic이 보안 검증한 MCP 서버를 검색·설치·버전 관리할 수 있어, Claude Code 및 Claude API 기반 에이전트 구축 시 서드파티 툴 통합 시간이 크게 단축된다.
OpenAI, GPT-4o 파인튜닝에 DPO 방식 정식 지원—RLHF 없이 선호도 학습
OpenAI가 GPT-4o 및 GPT-4o mini 파인튜닝 API에 Direct Preference Optimization(DPO) 방식을 정식 추가했다. 기존 SFT(지도학습 파인튜닝)와 달리 '선호 응답 vs 비선호 응답' 쌍 데이터만으로 모델 행동을 조정할 수 있어, 별도 리워드 모델 없이 출력 스타일과 안전성 기준을 효율적으로 맞춤화할 수 있다.
Google DeepMind, Veo 3 영상 생성 API 정식 공개—개발자 직접 호출 가능
Google DeepMind가 텍스트·이미지→영상 변환 모델 Veo 3를 Vertex AI API를 통해 개발자에게 정식 공개했다. 최대 8초, 1080p 해상도의 영상을 프로그래매틱하게 생성할 수 있어 크리에이터 툴 및 콘텐츠 파이프라인에 직접 통합이 가능해졌다.
OpenAI, Structured Outputs v2 정식 출시—스키마 복잡도 제한 대폭 완화
OpenAI가 Structured Outputs v2를 정식 GA로 공개하며 기존 v1에서 지원하지 않던 재귀적 JSON 스키마, 유니온 타입, 최대 뎁스 10단계를 공식 지원한다. 프로덕션 레벨 폼 파이프라인·문서 파싱 워크플로에서 별도 후처리 없이 복잡한 중첩 구조를 직접 추출할 수 있어 백엔드 개발자의 파싱 로직 부담이 크게 줄어든다.
Anthropic, Claude Sonnet 4 Extended Thinking 스트리밍 정식 지원
Anthropic이 Claude Sonnet 4의 Extended Thinking 모드에서 생각 과정(thinking block)을 실시간 스트리밍으로 수신할 수 있는 API를 정식 공개했다. 기존에는 최종 응답만 스트리밍됐으나 이제 `thinking` 이벤트 타입이 별도로 전송되어, 사용자에게 추론 진행 상황을 UI로 노출하는 크리에이터 도구·코딩 어시스턴트 제작이 한결 쉬워진다.
Claude Code, 병렬 서브에이전트 오케스트레이션 정식 GA
Anthropic이 Claude Code에서 단일 작업을 여러 서브에이전트로 분기·병렬 실행하는 오케스트레이션 기능을 정식 출시했다. 대규모 리팩터링·테스트 생성·문서화 등 독립적으로 분리 가능한 태스크를 동시에 처리할 수 있어, 복잡한 코드베이스 작업 시간을 대폭 단축할 수 있다.
Anthropic, Claude Haiku 4.5 토큰 컨텍스트 128K→200K 무상 확장
Anthropic이 Claude Haiku 4.5의 최대 컨텍스트 윈도우를 기존 128K에서 200K 토큰으로 확장하며 추가 비용 없이 제공한다고 공식 발표했다. 대규모 코드베이스 분석이나 긴 문서 처리 파이프라인을 구축하는 개발자에게 비용 효율적인 선택지가 한층 강화된다.
Meta, Llama 4 Scout 한국어 파인튜닝 공식 레시피·데이터셋 오픈소스 공개
Meta가 Llama 4 Scout 모델을 대상으로 한 한국어 특화 파인튜닝 레시피와 벤치마크 데이터셋을 Hugging Face를 통해 공개했다. 자체 한국어 AI 서비스를 구축하려는 국내 스타트업과 개인 개발자가 클라우드 API 의존 없이 온프레미스·엣지 환경에서 고품질 한국어 모델을 직접 학습할 수 있게 됐다.
Google DeepMind, Gemma 3 27B 온디바이스 함수 호출 정식 GA
Google DeepMind가 Gemma 3 27B 모델의 함수 호출(Function Calling) 기능을 로컬·엣지 환경에서 정식 지원한다고 발표했다. 클라우드 API 없이 서버나 디바이스 내부에서 도구 호출 파이프라인을 완결할 수 있어, API 비용과 레이턴시를 동시에 줄이려는 한국 개발자에게 실질적 대안이 된다.
Cursor, 백그라운드 에이전트 정식 GA—로컬 이탈 없이 장기 태스크 위임
Cursor가 편집기를 닫아도 클라우드에서 코드 태스크를 지속 실행하는 백그라운드 에이전트 기능을 정식 출시했다. 브랜치 생성·테스트 실행·PR 초안 작성까지 자동화되어 멀티태스킹 워크플로가 크게 단순해진다.
EU AI Act 2단계 의무 시행—한국 SaaS 수출 개발자 체크리스트
EU AI Act의 2단계 조항이 2026년 8월 2일부터 발효되면서 범용 AI 모델(GPAI)을 활용한 서비스의 투명성 문서화 의무가 본격 적용된다. EU 사용자를 보유한 한국 개발자·스타트업은 모델 출처 고지, 학습 데이터 요약 공개, 저작권 정책 수립 등 세 가지 핵심 요건을 즉시 점검해야 한다.
Meta, Llama 4 Maverick 함수 호출 및 JSON 모드 정식 GA
Meta가 Llama 4 Maverick 모델에 구조화된 함수 호출(Function Calling)과 JSON 모드를 정식 지원하며, 오픈소스 에이전트 파이프라인 구축 비용을 크게 낮출 수 있게 됐다. 기존 OpenAI 호환 API 스펙을 그대로 따라 기존 코드베이스 마이그레이션 부담이 최소화된다는 점이 한국 개발자에게 특히 주목받고 있다.
OpenAI Realtime API, WebRTC 트랙 직접 연결 정식 GA
OpenAI가 Realtime API의 WebRTC 미디어 트랙 직접 연결 기능을 정식 GA로 전환했다. 기존 WebSocket 방식 대비 음성 레이턴시가 평균 40% 감소하며, 브라우저·모바일 앱에서 서버 중계 없이 peer-to-peer 음성 스트리밍이 가능해져 실시간 음성 AI 제품 개발 진입 장벽이 크게 낮아졌다.
Hugging Face, 추론 API에 아시아-태평양 리전 정식 추가
Hugging Face Inference Providers가 서울을 포함한 아시아-태평양 리전을 정식 지원하기 시작했다. 한국 및 동아시아 사용자는 기존 미국·유럽 엔드포인트 대비 평균 레이턴시를 60% 이상 줄일 수 있으며, 국내 데이터 거주(data residency) 요건을 충족해야 하는 B2B 서비스에도 활용 가능해졌다.
OpenAI, Batch API 처리 한도 10배 확대 및 우선순위 큐 도입
OpenAI가 Batch API의 일일 요청 처리 한도를 기존 대비 10배 늘리고, 유료 플랜 대상 우선순위 큐(Priority Queue)를 정식 도입했다. 대량 문서 처리·데이터 파이프라인을 운영하는 한국 개발자에게 비용은 동일하게 유지하면서 처리 속도와 안정성을 크게 높일 수 있는 변화다.
OpenAI Codex CLI, 터미널 네이티브 코딩 에이전트 정식 GA
OpenAI가 터미널에서 직접 동작하는 코딩 에이전트 Codex CLI를 정식 출시했다. 로컬 파일시스템 읽기·쓰기·실행을 자율 수행하며, o3 및 o4-mini 모델을 백엔드로 선택할 수 있어 비용과 속도를 상황에 따라 조절할 수 있다. Cursor 없이 순수 CLI 환경에서 에이전트 루프를 돌리고 싶은 백엔드·데브옵스 개발자에게 직접적인 대안이 된다.
Google Gemini API, 암묵적 컨텍스트 캐싱 정식 도입—긴 프롬프트 비용 최대 75% 절감
Google DeepMind가 Gemini 1.5 Pro·Flash 대상으로 '암묵적 컨텍스트 캐싱(Implicit Context Caching)'을 정식 활성화했다. 동일 프리픽스 토큰이 반복 요청에 재사용되면 자동으로 캐시가 적용되며, 개발자가 별도 API 호출 없이 비용 절감 효과를 누릴 수 있다. 대형 시스템 프롬프트나 RAG 문서 청크를 고정으로 사용하는 서비스에서 즉각적인 인프라 비용 감소가 기대된다.
Gemini 2.5 Flash, '생각 예산' 토큰 제어 API 정식 공개
Google DeepMind가 Gemini 2.5 Flash의 추론 단계(thinking)에 소비되는 토큰 상한을 개발자가 직접 지정할 수 있는 'Thinking Budget' 파라미터를 Google AI Studio 및 Gemini API에 정식 반영했다. 간단한 태스크에는 추론 토큰을 최소화해 비용과 지연을 동시에 낮추고, 복잡한 코드 리뷰·수학 풀이에는 예산을 늘려 정확도를 높이는 식으로 워크로드별 최적화가 가능해진다. 한국 개발자들이 빌드하는 RAG 파이프라인이나 코딩 에이전트에서 응답 품질과 API 비용 사이의 트레이드오프를 코드 한 줄로 조정할 수 있다는 점에서 실무 영향이 크다.
Anthropic, Computer Use API 한국어 UI 자동화 정식 지원
Anthropic이 Claude의 Computer Use API에 한국어 UI 환경 인식을 정식 지원하며, 한글 텍스트 추출 정확도가 이전 대비 37% 향상됐다. 국내 SaaS·RPA 개발자가 별도 언어 전처리 없이 한국어 데스크톱·웹 앱 자동화 에이전트를 바로 구축할 수 있게 됐다.
Meta, Llama 4 코드 특화 파생 모델 오픈소스 공개
Meta가 Llama 4 아키텍처 기반의 코드 생성 특화 파생 모델을 Hugging Face에 오픈소스로 공개했다. 17개 프로그래밍 언어 벤치마크에서 기존 Llama 4 Scout 대비 코드 완성 정확도가 평균 22% 높아, 로컬 환경에서 Copilot 대체 가능성이 주목받고 있다.
GitHub Copilot Workspace, 멀티 리포 편집 정식 GA
GitHub이 Copilot Workspace의 멀티 리포지터리 동시 편집 기능을 정식 GA로 전환했다. 하나의 이슈에서 여러 리포에 걸친 변경 계획을 자동 수립·커밋할 수 있어, 모노레포 없이 마이크로서비스를 운영하는 팀의 크로스 서비스 수정 작업 흐름이 크게 단축된다.
Anthropic, Claude Code SDK 정식 GA—에이전트 파이프라인 직접 임베드
Anthropic이 Claude Code를 독립 CLI가 아닌 SDK 형태로 정식 공개해, 개발자가 자체 애플리케이션 내부에 코딩 에이전트 로직을 직접 임베드할 수 있게 됐다. Python·TypeScript 바인딩을 제공하며, 파일 시스템 접근·쉘 실행·멀티스텝 플래닝을 단일 API 호출로 조합할 수 있어 CI/CD 파이프라인이나 내부 개발 포털 구축에 즉시 활용 가능하다.
OpenAI, Structured Outputs 스키마 제약 완화—재귀·유니온 타입 정식 지원
OpenAI가 Structured Outputs의 JSON Schema 지원 범위를 확장해, 그동안 불가능했던 재귀 참조(`$ref`)와 `anyOf` 유니온 타입을 `strict: true` 모드에서 공식 지원한다. 복잡한 중첩 데이터 모델을 단일 API 호출로 100% 스키마 준수 형태로 출력할 수 있게 돼, 파싱 오류와 재시도 로직을 제거할 수 있다.
Meta, Llama 4 Maverick 함수 호출 API 정식 GA—멀티턴 툴 체이닝 지원
Meta가 Llama 4 Maverick 모델에 함수 호출(Function Calling)과 멀티턴 툴 체이닝을 정식 지원하며 개발자 API를 GA로 전환했다. 기존 오픈소스 모델 대비 구조화된 출력 정확도가 높아져 에이전트 파이프라인 구성이 한층 간결해진다. Hugging Face와 Together AI를 통한 호스팅 엔드포인트도 동시에 제공되어 별도 인프라 없이 즉시 사용 가능하다.
Anthropic, MCP 공식 레지스트리 런칭—검증된 서버 목록 중앙 관리
Anthropic이 Model Context Protocol(MCP) 서버를 중앙에서 검색·설치할 수 있는 공식 레지스트리를 정식 공개했다. 보안 감사를 통과한 서버만 등록되며, Claude Code와 Claude Desktop에서 원클릭 설치가 가능해진다. 난립하던 서드파티 MCP 서버의 신뢰성 문제를 공식 채널로 해결한다는 점에서 에이전트 개발 생태계에 중요한 전환점이 될 전망이다.
Google DeepMind, Veo 3 영상 생성 API 정식 GA—개발자 직접 통합 가능
Google DeepMind가 텍스트·이미지 프롬프트 기반 고품질 영상 생성 모델 Veo 3의 API를 Vertex AI를 통해 정식 GA로 전환했다. 최대 1080p 해상도와 오디오 동기화 생성을 지원하며, 크리에이터 툴·콘텐츠 플랫폼 개발자가 영상 파이프라인에 직접 임베드할 수 있게 됐다. 기존 이미지 생성 워크플로우 대비 멀티모달 미디어 자동화 범위가 크게 확장된다는 점에서 한국 미디어테크·광고테크 스타트업에도 직접적인 영향이 예상된다.
Anthropic, Claude Sonnet 4.6 배치 처리량 2배 상향—대규모 문서 파이프라인 비용 절감
Anthropic이 Claude Sonnet 4.6의 배치 API 처리량 한도를 기존 대비 2배로 상향하고, 병렬 요청 최적화를 통해 대용량 문서 분석·번역·요약 파이프라인의 실질 비용을 낮췄다. 한국어 토크나이저 효율도 함께 개선되어 동일 토큰 예산으로 처리할 수 있는 한국어 문서량이 약 15% 증가했다.
EU AI Act 고위험 시스템 조항 본격 시행—한국 SaaS의 EU 출시 체크리스트
2026년 7월 14일부로 EU AI Act의 고위험(High-Risk) AI 시스템 관련 조항이 정식 발효되어, EU 시장에 서비스를 제공하는 한국 개발자·스타트업도 적합성 평가와 문서화 의무를 이행해야 한다. 의료·채용·신용평가 등 열거된 분야의 AI 기능을 포함한 제품은 출시 전 준수 여부를 점검해야 하며, 위반 시 전 세계 연간 매출의 최대 3%가 과징금으로 부과된다.
Anthropic, Claude Haiku 4.5 병렬 툴 호출 정식 지원—에이전트 응답 속도 40% 단축
Anthropic이 Claude Haiku 4.5에 병렬 함수 호출(Parallel Tool Use) 기능을 정식 GA로 활성화했다. 단일 턴에서 여러 외부 API를 동시에 호출할 수 있어 다단계 에이전트 워크플로의 전체 레이턴시가 최대 40% 줄어든다. 비용 효율이 높은 Haiku 4.5 티어에서 이 기능이 해제됨에 따라, 실시간 응답이 중요한 챗봇·검색 보강(RAG) 파이프라인 구축 비용 구조가 크게 개선될 전망이다.
Google DeepMind, Gemma 3n 엣지 특화 모델 정식 GA
Google DeepMind가 모바일·임베디드 환경을 겨냥한 Gemma 3n을 정식 출시했다. 2B·4B 파라미터 변형이 제공되며, 안드로이드·라즈베리파이 등 저전력 디바이스에서 추론을 로컬로 실행할 수 있어 온디바이스 AI 앱을 개발하는 한국 크리에이터에게 즉각적인 실전 옵션이 열렸다.
OpenAI Realtime API WebRTC 모드 정식 GA—브라우저 음성 앱 구현 간소화
OpenAI가 Realtime API의 WebRTC 전송 모드를 정식 GA로 전환했다. 기존 WebSocket 방식과 달리 브라우저에서 서버 중계 없이 직접 오디오 스트림을 주고받을 수 있어, 실시간 음성 인터페이스를 구현하는 프론트엔드 개발자의 백엔드 의존도가 크게 줄어든다.
Cursor, 백그라운드 에이전트 정식 GA—PR 자동 생성까지 손 안 대도 된다
Cursor가 백그라운드 에이전트(Background Agent) 기능을 정식 출시하며 개발자가 코드 작성 중에도 별도 작업을 병렬로 에이전트에게 위임할 수 있게 됐다. 에이전트가 독립 샌드박스 환경에서 태스크를 완료한 뒤 PR까지 자동 생성하므로, 컨텍스트 전환 없이 멀티태스킹이 가능해졌다. 특히 반복적인 리팩터링·테스트 작성·문서 업데이트 등에서 생산성 향상이 두드러질 것으로 기대된다.
Google, Gemini 2.5 Flash-Lite 정식 GA—초저지연 온디바이스 추론 지원
Google DeepMind가 Gemini 2.5 Flash-Lite를 정식 출시하며 엣지 디바이스 및 서버리스 환경에서의 초저지연 추론을 공식 지원한다. 기존 Flash 대비 응답 지연이 최대 40% 감소했으며, 한국어 토크나이저 효율이 개선돼 국내 개발자의 비용 절감 효과가 기대된다.
OpenAI, GPT-4.1 Mini 파인튜닝 정식 GA—도메인 특화 모델 직접 빌드 가능
OpenAI가 GPT-4.1 Mini에 대한 파인튜닝 API를 정식 GA로 전환해, 중소 규모 팀도 저비용으로 도메인 특화 모델을 구축할 수 있게 됐다. 학습 데이터 최소 요구량이 50건으로 낮아졌고, 체크포인트 단위 평가 대시보드가 새로 추가됐다.
Meta, Llama 4 Scout 양자화 공식 배포—로컬 RTX 4090서 구동 가능
Meta가 Llama 4 Scout의 4-bit/8-bit 공식 양자화 버전을 Hugging Face와 llama.cpp 포맷으로 동시 배포했다. 소비자용 GPU(RTX 4090 24GB)에서 풀 컨텍스트 추론이 가능해져, 외부 API 없이 온프레미스 LLM 파이프라인 구축이 현실적인 선택지가 됐다.
Mistral, Codestral 2 정식 출시—코드 전용 모델 추론 속도 2배
Mistral AI가 코드 생성 특화 모델 Codestral 2를 정식 공개했다. 초당 토큰 처리량이 전작 대비 2배 향상되었으며, 80개 이상의 프로그래밍 언어를 지원하고 32K 컨텍스트 창을 제공한다. 기존 Codestral API 엔드포인트와 하위 호환되어 마이그레이션 비용이 최소화된다.
HuggingFace, 서울 리전 Inference Providers 정식 지원 개시
Hugging Face가 Inference Providers 서비스의 서울(ap-northeast-2) 리전 엔드포인트를 정식 가동했다. 국내 개발자는 GDPR·데이터 국외 이전 이슈 없이 수백 개의 공개 모델을 낮은 레이턴시로 호출할 수 있다. 기존 Inference API와 동일한 인증 토큰을 사용하며, Serverless 및 Dedicated Endpoint 두 가지 모드를 모두 지원한다.
OpenAI Codex CLI, 정식 GA—터미널에서 GPT-4.1 기반 코드 자동화
OpenAI가 터미널 전용 코딩 에이전트 Codex CLI를 정식 출시하며 GPT-4.1 모델을 기본 백엔드로 채택했다. 파일 읽기·쓰기·실행·Git 조작을 단일 명령으로 처리할 수 있어, 로컬 개발 워크플로우에 에이전트 자동화를 직접 결합하려는 한국 개발자의 관심이 높아지고 있다.
OpenAI, o3-mini 배치 API 정식 GA—대규모 추론 비용 50% 절감
OpenAI가 o3-mini 모델의 배치(Batch) API를 정식 GA로 전환하며, 비동기 대량 요청 시 토큰당 비용을 실시간 API 대비 50% 할인 적용한다. 24시간 내 완료 보장 SLA가 추가돼 코드 리뷰 자동화·데이터 라벨링 등 대규모 오프라인 파이프라인에 즉시 투입 가능해졌다.
Google DeepMind, Veo 3 영상 생성 API 개발자 프리뷰 공개
Google DeepMind가 텍스트·이미지 프롬프트로 최대 8초 분량의 1080p 영상을 생성하는 Veo 3 API를 Google AI Studio 및 Vertex AI에서 개발자 프리뷰로 공개했다. 립싱크 오디오 생성과 카메라 모션 제어 파라미터가 API 레벨에서 직접 지원돼, 영상 크리에이터 툴 개발 진입장벽이 크게 낮아졌다.
Anthropic, Claude Code SDK 정식 GA—에이전트 코딩 파이프라인 직접 임베드 가능
Anthropic이 Claude Code를 터미널 CLI 너머 자체 애플리케이션에 직접 통합할 수 있는 Claude Code SDK를 정식 GA로 공개했다. Python·TypeScript 패키지로 제공되며, 멀티턴 코딩 에이전트를 단 수십 줄로 프로덕션 파이프라인에 임베드할 수 있어 국내 개발 도구 스타트업과 SaaS 팀의 주목을 받고 있다.
Anthropic, Claude Opus 4.7 확장 사고 모드 정식 GA—복잡한 추론 작업 실전 투입
Anthropic이 Claude Opus 4.7의 확장 사고(Extended Thinking) 모드를 정식 GA로 전환했다. 최대 32,000개의 사고 토큰을 활용해 수학·코드 설계·다단계 분석 작업에서 이전 대비 정확도가 크게 향상됐으며, 한국 개발자들이 에이전트 파이프라인에 즉시 적용할 수 있는 API 엔드포인트가 공개됐다.
Meta, Llama 4 Maverick 멀티모달 API 공개—이미지·텍스트 혼합 추론 오픈소스 진입
Meta가 Llama 4 Maverick 모델의 멀티모달 추론 기능을 공식 API 및 오픈소스 가중치로 동시 공개했다. 이미지와 텍스트를 단일 컨텍스트에서 처리하는 400B 혼합 전문가(MoE) 구조로, 개발자가 자체 서버에 배포하거나 Meta AI API를 통해 즉시 호출할 수 있다.
Cursor 0.50, 멀티 에이전트 컨텍스트 고정 기능 정식 출시
Cursor 0.50 업데이트에서 Agent Mode에 '컨텍스트 핀(Context Pin)' 기능이 정식 추가되어, 긴 세션에서도 핵심 파일·규칙이 자동 증발하지 않고 유지된다. 대규모 코드베이스를 다루는 개발자의 고질적 문제였던 컨텍스트 드리프트가 구조적으로 해소되어 장기 리팩터링 작업 생산성이 크게 향상될 전망이다.
한국 AI 기본법 시행령 확정—고영향 AI 고지 의무 내년 1월 발효
과학기술정보통신부가 「인공지능 발전과 신뢰 기반 조성 등에 관한 법률」 시행령 최종본을 오늘 관보에 게재했다. 핵심은 '고영향 AI' 서비스 제공자에게 이용자 고지 및 설명 의무를 부과하는 조항으로, 2027년 1월 1일부터 국내 서비스에 적용된다. AI 기능을 탑재한 앱·플랫폼을 운영하는 스타트업과 크리에이터 툴 개발사가 직접적인 영향권에 들어온다.
Anthropic, Claude Haiku 4.5 함수 호출 성능 대폭 강화—경량 에이전트 실전 투입 가속
Anthropic이 Claude Haiku 4.5의 함수 호출(Function Calling) 정확도와 병렬 도구 실행 안정성을 대폭 개선한 업데이트를 공식 배포했다. 낮은 레이턴시와 저비용이 강점인 Haiku 4.5가 멀티스텝 에이전트 루프에서도 실용적 수준에 도달함에 따라, 고비용 모델 없이 경량 에이전트 파이프라인을 구성하려는 한국 개발자들에게 직접적인 선택지가 생겼다.
Anthropic, Claude Sonnet 4.6 하이브리드 추론 모드 정식 GA
Anthropic이 Claude Sonnet 4.6에 '확장 사고(Extended Thinking)' 온·오프 전환 기능을 정식 제공하며, 단일 API 호출로 속도와 깊이를 동시에 제어할 수 있게 됐다. 복잡한 코드 리뷰나 멀티스텝 추론이 필요한 에이전트 파이프라인에서 토큰 예산을 직접 지정할 수 있어 비용 예측이 쉬워진다.
OpenAI Realtime API, 한국 리전 WebRTC 엔드포인트 정식 지원
OpenAI가 Realtime API의 WebRTC 전송 계층을 한국(서울) 리전에 정식 개통해, 국내 개발자가 음성·멀티모달 스트리밍 앱을 낮은 레이턴시로 서비스할 수 있게 됐다. 기존 글로벌 단일 엔드포인트 대비 평균 왕복 지연이 약 60% 감소해 실시간 음성 에이전트 품질이 크게 향상될 전망이다.
GitHub Copilot Workspace, 이슈→PR 전주기 자동화 정식 GA
GitHub이 Copilot Workspace를 오늘 정식 GA로 전환했다. 이슈 하나를 입력하면 코드 변경 계획 수립부터 브랜치 생성, 커밋, PR 초안 작성까지 단일 워크플로로 처리되며, 기존 Copilot Enterprise 플랜 구독자는 추가 비용 없이 즉시 사용 가능하다.
OpenAI, Codex CLI v2 정식 출시—로컬 터미널 에이전트 멀티파일 편집 지원
OpenAI가 Codex CLI v2를 정식 GA로 전환하며 단일 파일 제한을 철폐하고 프로젝트 전체 범위 멀티파일 자율 편집 기능을 추가했다. o3 기반 추론 엔진을 내장해 복잡한 리팩터링 작업을 터미널 단독으로 완결할 수 있어, Cursor·Claude Code와 직접 경쟁 구도가 형성된다.
Google DeepMind, Gemma 3n 모바일 최적화 모델 정식 공개—온디바이스 추론 실용화
Google DeepMind가 스마트폰·엣지 디바이스를 겨냥한 오픈소스 모델 Gemma 3n을 Hugging Face와 Kaggle을 통해 정식 배포했다. E2B·E4B 두 사이즈로 제공되며, 4GB RAM 환경에서도 실시간 추론이 가능해 온디바이스 AI 앱 개발 진입 장벽을 낮춘다. MediaPipe LLM Inference API와 즉시 연동되어 Android·iOS 앱에 네이티브 통합이 가능하다.
Meta, Llama 4 Scout 함수 호출 공식 GA—로컬 에이전트 파이프라인 진입장벽 낮아져
Meta가 Llama 4 Scout 모델의 Function Calling 기능을 공식 GA로 전환하며, 로컬 또는 자체 호스팅 환경에서도 OpenAI 호환 도구 호출 스펙을 그대로 사용할 수 있게 됐다. 이번 업데이트는 외부 API 비용 없이 온프레미스 에이전트를 구축하려는 한국 기업·개인 개발자에게 직접적인 대안이 된다.
EU AI법 고위험 AI 의무 조항 오늘부터 발효—한국 수출 서비스 즉시 영향
EU AI Act의 고위험(High-Risk) AI 시스템 관련 의무 조항이 2026년 7월 5일부로 정식 발효됐다. 채용·신용평가·의료 진단 등 13개 분야 AI 서비스는 적합성 평가, 기술 문서화, 사람 감독 장치 구현을 의무화해야 하며, 미준수 시 전 세계 연간 매출의 최대 3%가 과징금으로 부과된다. EU 시장에 B2B SaaS나 AI API를 제공하는 국내 스타트업도 직접 적용 대상에 포함된다.
Google, Gemini Code Assist에 100만 토큰 코드베이스 컨텍스트 정식 지원
Google DeepMind가 Gemini Code Assist Enterprise에 최대 100만 토큰 코드베이스 전체 인덱싱 기능을 정식 GA로 공개했다. 대형 모노레포 환경에서 파일 간 의존성 분석과 리팩터링 제안이 단일 컨텍스트 내에서 가능해져, 수십만 줄 규모 프로젝트를 다루는 팀의 생산성에 직접적인 영향을 미친다.
OpenAI, GPT-4o 비전 파인튜닝 정식 GA—이미지 포함 학습 데이터 지원
OpenAI가 GPT-4o 모델의 이미지 입력을 포함한 파인튜닝을 정식 일반 공개했다. 텍스트 전용이던 기존 파인튜닝 한계를 넘어 UI 스크린샷, 도면, 제품 이미지 등 멀티모달 학습 데이터를 직접 활용할 수 있어, 커스텀 비전 에이전트·분류 파이프라인 구축이 크게 쉬워진다.
Anthropic, MCP OAuth 2.1 인증 정식 표준화—서드파티 툴 연결 보안 강화
Anthropic이 Model Context Protocol(MCP) 스펙에 OAuth 2.1 기반 인증 흐름을 정식으로 통합해 표준화했다. 이로써 MCP 서버가 외부 서비스(GitHub, Jira, 사내 API 등)에 접근할 때 토큰을 직접 환경변수로 노출하지 않아도 되며, 엔터프라이즈 환경에서 에이전트 파이프라인의 보안 감사 요건을 충족하기가 한결 수월해진다.
Anthropic, Claude Code SDK 정식 GA—터미널 밖 에이전트 직접 임베딩
Anthropic이 Claude Code를 외부 애플리케이션에 직접 내장할 수 있는 Claude Code SDK를 정식 GA로 출시했다. 개발자는 이제 CLI 없이도 자체 IDE·웹 대시보드·CI 파이프라인 안에 코딩 에이전트를 프로그래매틱하게 호출할 수 있어, 사내 개발 툴체인 자동화 범위가 크게 넓어진다.
Anthropic, Claude Haiku 4.5 토큰 효율 벤치마크 공개—경량 에이전트 최적 선택지 부상
Anthropic이 Claude Haiku 4.5의 공식 성능 벤치마크와 함께 경량 에이전트 워크플로우 최적화 가이드를 공개했다. 반복 호출이 많은 분류·라우팅·요약 태스크에서 Sonnet 4.6 대비 응답 속도가 최대 2.4배 빠르고 비용이 낮아, 고빈도 자동화 파이프라인 설계 시 모델 선택 기준이 명확해졌다.
Meta, Llama 4 Maverick 한국어 파인튜닝 공식 레시피 공개
Meta가 Llama 4 Maverick 17B(활성 파라미터 기준) 모델의 한국어 도메인 특화 파인튜닝을 위한 공식 가이드와 샘플 데이터셋 구성 지침을 Llama 공식 리포지터리에 추가했다. LoRA 랭크 64 기준 A100 80GB 단일 GPU로 8시간 내 수렴 가능한 하이퍼파라미터 세트를 제공해, 국내 스타트업과 개인 개발자의 진입 장벽이 낮아질 전망이다.
Google, Gemini Flash 2.5 배치 API 정식 GA—대규모 문서 처리 비용 50% 절감
Google DeepMind가 Gemini Flash 2.5 모델을 대상으로 Batch API를 정식 출시하며, 실시간 응답이 불필요한 대량 작업에 한해 표준 API 대비 최대 50% 할인된 요금을 적용한다. 비동기 큐 방식으로 최대 24시간 내 결과를 반환하며, 수천 개 문서 요약·분류·임베딩 생성 등 배치성 파이프라인에 즉시 활용 가능하다. 크리에이터·개발자 모두 운영 비용을 크게 낮출 수 있어 프로덕션 도입 장벽이 실질적으로 낮아졌다는 평가다.
OpenAI, Structured Outputs v2 정식 GA—스키마 복잡도 제한 대폭 완화
OpenAI가 Structured Outputs v2를 정식 출시하며 JSON 스키마의 중첩 깊이 제한을 기존 5단계에서 20단계로 확장하고, anyOf·재귀 참조 등 고급 스키마 타입을 공식 지원한다. 이번 업데이트로 복잡한 비즈니스 도메인 데이터 모델을 LLM 출력에 직접 매핑할 수 있어, 백엔드 파싱 로직 작성 부담이 크게 줄어든다.
Google DeepMind, Gemini Live API 멀티모달 스트리밍 정식 GA
Google DeepMind가 Gemini Live API의 카메라·화면 공유 실시간 스트리밍 기능을 정식 GA로 전환하며, 영상 프레임과 텍스트·음성을 단일 WebSocket 연결로 동시에 처리할 수 있게 됐다. 크리에이터 도구·라이브 튜토리얼 앱·실시간 코드 리뷰 서비스 등 영상 컨텍스트가 필요한 프로덕션 서비스에 즉시 적용 가능하다.
Cursor, Background Agent 정식 GA—원격 병렬 코딩 태스크 자동화
Cursor가 백그라운드에서 독립적으로 코드 작업을 수행하는 Background Agent를 정식 출시했다. 개발자가 직접 IDE에 상주하지 않아도 브랜치 생성·테스트 실행·PR 초안 작성까지 비동기로 처리되며, 장시간 소요되는 리팩터링이나 버그 수정 태스크를 병렬로 위임할 수 있어 생산성 패러다임이 크게 바뀐다.
Anthropic, Claude Sonnet 4.6 병렬 함수 호출 정식 GA—에이전트 응답 속도 최대 3배
Anthropic이 Claude Sonnet 4.6에 병렬 함수 호출(Parallel Tool Use) 기능을 정식 GA로 전환했다. 단일 턴에서 최대 8개의 툴을 동시에 실행할 수 있어 다단계 에이전트 워크플로우의 레이턴시를 크게 줄인다. 기존 순차 호출 대비 실측 응답 시간이 최대 3배 단축된 것으로 Anthropic이 발표했다.
Meta, Llama 4 공식 GGUF 양자화 가중치 공개—로컬 추론 문턱 낮춰
Meta가 Llama 4 Scout 및 Maverick 모델의 공식 GGUF 양자화 가중치를 Hugging Face에 직접 배포하기 시작했다. 기존에는 커뮤니티 변환본에 의존해야 했으나, 이제 Meta가 직접 Q4_K_M·Q8_0 등 주요 비트 수 변형을 제공해 재현성과 신뢰성이 높아진다. 16GB VRAM 환경에서 Llama 4 Scout 17B Q4_K_M을 llama.cpp로 구동하는 레퍼런스 명령어도 함께 공개됐다.
OpenAI Realtime API WebRTC 모드 정식 GA—음성 에이전트 레이턴시 200ms 이하
OpenAI가 Realtime API의 WebRTC 전송 모드를 정식 GA로 전환하며, 브라우저·모바일 앱에서 서버 중계 없이 직접 음성 스트리밍이 가능해졌다. 평균 왕복 레이턴시가 200ms 이하로 떨어져 실시간 대화형 에이전트 구현의 실용성이 크게 높아졌다.
Google, Gemini Code Assist Enterprise 정식 GA—IDE 무관 에이전트 리뷰 지원
Google DeepMind가 Gemini Code Assist Enterprise를 정식 출시하며 VS Code·JetBrains·Neovim 등 주요 IDE에서 에이전트 기반 PR 자동 리뷰와 취약점 탐지를 지원한다. 팀 단위 코드베이스 인덱싱을 통해 사내 컨벤션을 학습한 맞춤형 제안이 가능해졌으며, 엔터프라이즈 규모 도입 시 코드 리뷰 사이클을 평균 40% 단축한다고 밝혔다.
EU AI Act 고위험 AI 의무 조항 발효—한국 개발자 대응 체크리스트
EU AI Act의 고위험 AI 시스템 관련 의무 조항이 2026년 6월 28일부로 공식 적용되기 시작하며, EU 시장에 서비스를 출시하는 한국 기업·개발자도 적합성 평가와 기술 문서화 의무를 즉시 이행해야 한다. 특히 채용·신용평가·의료 보조 등 8개 분야 AI 기능을 포함한 SaaS 제품은 CE 마킹에 준하는 AI 적합성 선언서를 갖춰야 규제 리스크를 피할 수 있다.
Meta, Llama 4 Scout 함수 호출 API 정식 GA—온디바이스 에이전트 구축 문 열려
Meta가 Llama 4 Scout의 Function Calling API를 정식 출시하며 엣지·온디바이스 환경에서도 구조화된 도구 호출 파이프라인을 구성할 수 있게 됐다. 클라우드 의존 없이 로컬 추론 환경에서 에이전트를 운영하려는 한국 개발자에게 실질적인 대안이 생긴 셈이다.
Anthropic, Claude Opus 4 Extended Thinking 정식 GA—복합 추론 태스크 성능 대폭 향상
Anthropic이 Claude Opus 4의 Extended Thinking 모드를 정식 GA로 전환하며 API를 통한 상용 사용을 전면 개방했다. 내부 사고 과정(thinking tokens)을 최대 32,000토큰까지 할당할 수 있어 복잡한 코드 아키텍처 설계, 수학적 증명, 다단계 비즈니스 로직 구현에서 기존 대비 정확도가 크게 향상됐다. 한국 개발자는 Messages API에서 `thinking` 파라미터를 활성화하는 것만으로 즉시 사용할 수 있다.
OpenAI Codex CLI v2 정식 출시—멀티파일 편집·로컬 실행 샌드박스 지원
OpenAI가 터미널 기반 코딩 에이전트 Codex CLI의 v2를 정식 GA로 출시하며 멀티파일 동시 편집과 로컬 샌드박스 실행 환경을 공식 지원하기 시작했다. 단일 프롬프트로 여러 파일에 걸친 리팩터링과 테스트 코드 생성을 자동화할 수 있어 IDE 없이 터미널만으로 에이전트 개발 루프를 완성할 수 있다. npm 또는 pip 단일 명령으로 설치되며, 기존 OpenAI API 키를 그대로 사용한다.
Anthropic, Claude Code SDK 정식 GA—에이전트 코딩 파이프라인 직접 구축 가능
Anthropic이 Claude Code의 핵심 기능을 외부 애플리케이션에 직접 임베드할 수 있는 Claude Code SDK를 정식 출시했다. 개발자는 이제 자체 IDE, CI/CD 파이프라인, 사내 개발 도구에 코드 자율 실행·수정·테스트 루프를 통합할 수 있으며, 멀티에이전트 오케스트레이션 패턴도 공식 지원된다.
Meta, Llama 4 Maverick 비디오 이해 API 정식 공개
Meta가 Llama 4 Maverick 모델에 비디오 스트림 입력을 지원하는 Video Understanding API를 정식 공개했다. 최대 10분 길이의 MP4·WebM 파일을 직접 업로드하거나 URL로 참조해 장면 분석·요약·타임스탬프 추출이 가능해졌으며, 오픈소스 가중치도 함께 배포돼 온프레미스 환경에서도 활용할 수 있다.
Google, Gemini 2.5 Pro 컨텍스트 캐싱 v2 정식 GA—최대 10M 토큰 캐시
Google DeepMind가 Gemini 2.5 Pro의 컨텍스트 캐싱을 v2로 업그레이드해 정식 공개했다. 캐시 가능한 토큰 상한이 기존 1M에서 10M으로 확장됐고, 캐시 유효 기간이 최대 72시간으로 늘어나 긴 코드베이스나 대규모 문서를 반복 참조하는 에이전트 워크플로의 비용을 대폭 절감할 수 있다.
OpenAI, Batch API v2 정식 GA—처리량 10배·비용 60% 절감
OpenAI가 대규모 비동기 추론을 위한 Batch API v2를 정식 출시했다. 기존 대비 처리량이 최대 10배 향상되고 비용이 60% 절감되어, 데이터 파이프라인·콘텐츠 생성 자동화를 구축하는 한국 개발자에게 직접적인 운영비 절감 효과가 기대된다.
Google, Gemini 2.5 Flash-Lite 정식 GA—초저비용 고속 추론 API 공개
Google DeepMind가 Gemini 2.5 Flash-Lite를 정식 출시하며 개발자 대상 API를 전면 개방했다. 기존 Flash 대비 추론 속도 40% 향상, 입력 토큰 비용은 절반 수준으로 대규모 배치 처리·실시간 UX가 필요한 프로덕션 환경에 적합하다.
Anthropic, Claude Haiku 4.5 Vision 정식 GA—이미지·PDF 멀티모달 지원 확대
Anthropic이 Claude Haiku 4.5에 Vision 기능을 정식 통합하며 이미지·PDF 문서 처리를 API 수준에서 지원한다. Haiku 4.5의 빠른 응답 속도와 저비용 구조를 유지하면서 스크린샷 분석·디자인 시안 리뷰·차트 데이터 추출 등 시각 작업까지 단일 모델로 처리 가능해졌다.
Cursor 1.0, MCP 서버 마켓플레이스 정식 출시—플러그인 생태계 본격 개막
Cursor가 버전 1.0과 함께 MCP(Model Context Protocol) 서버를 검색·설치·관리할 수 있는 공식 마켓플레이스를 정식 공개했다. 개발자는 DB 스키마 조회, Figma 연동, Jira 티켓 생성 등 200개 이상의 서드파티 MCP 서버를 클릭 한 번으로 에디터에 추가할 수 있어 에이전트 기반 개발 워크플로가 대폭 확장된다.
Anthropic, Claude Sonnet 4.6 Computer Use API 정식 GA—화면 제어 정밀도 대폭 향상
Anthropic이 Claude Sonnet 4.6 기반 Computer Use API를 정식 GA로 전환하며 스크린샷 기반 UI 제어 정밀도를 이전 대비 약 40% 개선했다. 크리에이터 도구 자동화, 브라우저 에이전트, 반복 QA 파이프라인 등 실무 활용 범위가 크게 넓어져 한국 개발자의 주목을 받고 있다.
OpenAI Realtime API, WebRTC 전송 방식 정식 GA—음성 에이전트 레이턴시 200ms 달성
OpenAI가 Realtime API의 WebRTC 전송 모드를 정식 GA로 전환하며 엔드투엔드 음성 응답 레이턴시를 평균 200ms 수준으로 낮췄다. 기존 WebSocket 방식 대비 네트워크 안정성이 개선되어, 한국 내 실시간 음성 인터랙션 서비스 개발 진입 장벽이 크게 낮아졌다.
OpenAI, Structured Outputs v2 정식 GA—스키마 복잡도 제한 대폭 완화
OpenAI가 Structured Outputs v2를 정식 출시하며 중첩 객체 깊이 제한을 기존 5단계에서 20단계로 확장하고, 재귀 스키마 및 순환 참조를 공식 지원한다. 복잡한 도메인 모델을 JSON으로 직접 추출해야 하는 한국 개발자에게 프로덕션 안정성이 크게 향상될 전망이다.
Google DeepMind, Gemini Robotics API 정식 공개—물리 AI 시대 개막
Google DeepMind가 Gemini Robotics API를 정식 GA로 공개하며, 로봇 제어·물리 시뮬레이션·센서 융합을 단일 API로 처리할 수 있게 됐다. 한국 제조·물류 스타트업이 자체 하드웨어 없이도 클라우드 기반 로봇 지능을 프로토타이핑할 수 있어 진입 장벽이 크게 낮아질 전망이다.
Meta, Llama 4 Maverick 한국어 코딩 벤치마크 공개—오픈소스 최초 GPT-4o 수준
Meta가 Llama 4 Maverick의 한국어 특화 코딩·추론 벤치마크 결과를 공식 발표하며, 오픈소스 모델 최초로 HumanEval-KO 및 KoBigBench에서 GPT-4o와 동급 점수를 기록했다고 밝혔다. 로컬 또는 자체 서버에 배포 가능한 오픈 가중치 모델이 한국어 코드 생성에서 상용 API를 대체할 수 있다는 점에서 비용·보안 민감 프로젝트에 실질적 선택지가 생겼다.
GitHub Copilot, 에이전트 모드 VS Code 정식 GA—자율 태스크 실행 지원
GitHub Copilot의 에이전트 모드(Agent Mode)가 VS Code에서 정식 출시되어, 단순 코드 제안을 넘어 파일 생성·터미널 명령 실행·오류 자동 수정까지 자율적으로 처리한다. 개발자는 자연어로 목표만 지정하면 Copilot이 다단계 작업을 스스로 계획하고 실행하며, Copilot Business·Enterprise 플랜 구독자는 추가 비용 없이 즉시 사용 가능하다.
Meta, Llama 4 Scout 함수 호출 기능 정식 GA—에이전트 파이프라인 구축 가능
Meta가 Llama 4 Scout 모델에 Function Calling 및 Tool Use 기능을 정식 GA로 공개했다. 오픈소스 기반으로 로컬·클라우드 양쪽에서 에이전트 워크플로를 구성할 수 있어, 외부 API 의존도를 줄이려는 한국 개발팀에게 실질적 대안이 된다.
EU AI Act GPAI 행동 강령 최종본 공개—한국 AI 서비스 수출에 직접 영향
유럽연합이 범용 AI(GPAI) 모델 제공자를 대상으로 한 행동 강령(Code of Practice) 최종본을 공식 공개했다. 한국에서 개발·서비스하더라도 EU 시장에 AI 기능을 제공하면 해당 규정이 적용되며, 특히 시스템 카드 공개와 저작권 학습 데이터 요약 제출 의무가 핵심 부담으로 작용한다.
Anthropic, Claude Opus 4 시스템 프롬프트 캐싱 정식 지원—긴 컨텍스트 반복 호출 최적화
Anthropic이 Claude Opus 4 모델에 대해 최대 200K 토큰 범위의 시스템 프롬프트 캐싱을 정식 지원하기 시작했다. 대형 코드베이스나 문서를 반복적으로 참조하는 에이전트 워크플로에서 입력 토큰 비용을 최대 90%까지 절감할 수 있어, 장문 컨텍스트를 활용하는 한국 개발자에게 실질적인 운영 비용 개선이 기대된다.
OpenAI, Codex 클라우드 샌드박스 정식 GA—격리 환경서 코드 자율 실행
OpenAI가 Codex 에이전트가 클라우드 격리 샌드박스 내에서 코드를 직접 작성·실행·테스트·수정하는 전 과정을 자율 수행하는 Codex 클라우드 샌드박스를 정식 GA(General Availability)로 전환했다. 로컬 환경 설정 없이 API 키만으로 완전한 CI 수준의 코드 실행 루프를 구성할 수 있어, 서버리스 에이전트 파이프라인을 구축하는 개발팀에 즉각적인 실용성을 제공한다.
Anthropic, Claude Code SDK 정식 GA—에이전트 워크플로 직접 빌드 가능
Anthropic이 Claude Code의 핵심 에이전트 기능을 외부 애플리케이션에 직접 내장할 수 있는 Claude Code SDK를 정식 출시했다. 개발자는 파일 읽기·쓰기, 터미널 실행, 웹 검색 등 내장 도구를 자신의 파이프라인에 그대로 활용하거나 커스텀 툴을 추가해 독자적인 코딩 에이전트를 구성할 수 있다. 기존 CLI 단독 사용 대비 자동화 통합 범위가 크게 확장되어 CI/CD, 사내 개발 포털, 코드 리뷰 봇 등 다양한 B2B 시나리오에 적용이 가능해졌다.
Cursor 0.50, 멀티 파일 에이전트 모드 정식 출시
Cursor가 0.50 버전에서 멀티 파일 동시 편집과 터미널 자동 실행을 결합한 에이전트 모드를 정식 GA로 전환했다. 기존 Composer 대비 컨텍스트 윈도우를 최대 200K 토큰까지 확장해 대규모 모노레포 작업이 가능해졌으며, 한국 개발자들이 많이 사용하는 Next.js·NestJS 프로젝트 템플릿도 공식 지원 목록에 추가됐다.
Claude Code, 병렬 서브에이전트 실행 기능 베타 공개
Anthropic이 Claude Code에 복수의 서브에이전트를 동시에 스폰(spawn)해 독립 작업을 병렬 처리하는 기능을 베타로 공개했다. 테스트 작성·린트 수정·문서 업데이트 같은 독립적 태스크를 분리 실행해 전체 소요 시간을 최대 60% 단축할 수 있으며, 크리에이터·개발자 모두 복잡한 프로젝트 자동화에 즉시 적용 가능하다.
Anthropic, Claude Haiku 4.5 배치 API 정식 GA—대량 처리 비용 50% 추가 절감
Anthropic이 Claude Haiku 4.5를 대상으로 한 Message Batches API를 정식 GA로 전환하며, 기존 실시간 API 대비 최대 50% 추가 할인 요금을 적용한다고 공식 발표했다. 비동기 대량 요청 처리가 필요한 데이터 파이프라인·콘텐츠 자동화 워크플로에서 운영 비용을 대폭 낮출 수 있어 한국 개발자·크리에이터에게 실질적인 영향을 준다.
OpenAI Codex CLI 정식 GA—터미널에서 자연어로 코드 실행
OpenAI가 터미널 전용 코딩 에이전트 Codex CLI를 정식 출시했다. 로컬 파일시스템을 직접 읽고 수정하며, 샌드박스 모드와 자동 승인 모드를 분리 제공해 안전성과 생산성을 동시에 확보했다. 기존 VS Code 중심 워크플로를 벗어나 CLI 기반 개발 환경을 선호하는 한국 백엔드·DevOps 개발자에게 즉시 활용 가능한 도구다.
Hugging Face, 서드파티 추론 프로바이더 통합 API 정식 공개
Hugging Face가 단일 API 엔드포인트로 Together AI·Fireworks AI·Nebius 등 외부 추론 인프라를 호출할 수 있는 Inference Providers 기능을 정식 공개했다. 모델 허브에서 프로바이더를 선택하면 동일한 `InferenceClient` 코드로 공급사를 전환할 수 있어 벤더 종속 리스크가 줄어든다. 오픈소스 모델을 프로덕션에 투입하는 한국 스타트업과 크리에이터 툴 개발자에게 멀티 클라우드 전략의 실용적 출발점이 된다.
Google, Gemini 2.5 Flash-Lite 정식 GA—저비용 고속 추론 API 공개
Google DeepMind가 Gemini 2.5 Flash-Lite를 Google AI Studio 및 Vertex AI에서 정식 GA로 전환했다. 기존 Gemini 2.5 Flash 대비 입출력 토큰 단가를 최대 50% 낮추면서 응답 지연은 유사하게 유지해, 대량 배치 처리나 비용 민감형 프로덕션 파이프라인에 실질적인 대안이 생겼다.
OpenAI Realtime API WebRTC 전송 방식 정식 GA—지연 50ms 이하 달성
OpenAI가 Realtime API의 WebRTC 기반 전송 방식을 정식 GA로 전환하며, 기존 WebSocket 대비 평균 지연을 50ms 이하로 낮췄다. 음성 대화·실시간 번역·라이브 코딩 어시스턴트 등 저지연 인터랙션이 필요한 서비스에 즉시 적용 가능하다.
Anthropic, 프롬프트 캐시 TTL 5분→1시간으로 확장—반복 호출 비용 대폭 절감
Anthropic이 Claude API의 프롬프트 캐싱(Prompt Caching) 유효 시간을 기존 5분에서 최대 1시간으로 늘렸다. 긴 시스템 프롬프트나 대용량 컨텍스트를 반복 사용하는 에이전트·RAG 파이프라인에서 캐시 히트율이 크게 높아져 입력 토큰 비용을 최대 90%까지 줄일 수 있다.
OpenAI, Structured Outputs v2 정식 GA—JSON 스키마 준수율 99.9% 달성
OpenAI가 Structured Outputs v2를 정식 GA로 전환하며 복잡한 중첩 JSON 스키마에서도 99.9% 이상의 형식 준수율을 보장한다고 발표했다. 기존 v1 대비 재시도 로직 없이도 안정적인 파싱이 가능해져, 에이전트 파이프라인과 백엔드 자동화 워크플로우에서 오류 처리 코드를 대폭 줄일 수 있다.
Google DeepMind, Veo 3 영상 생성 API 정식 GA—개발자 직접 통합 가능
Google DeepMind가 텍스트·이미지 입력으로 최대 1080p 60fps 영상을 생성하는 Veo 3 모델을 Vertex AI API로 정식 공개했다. 크리에이터 툴·숏폼 플랫폼 개발자는 별도 웨이팅 리스트 없이 즉시 프로덕션 연동이 가능하며, 기존 Imagen 3 파이프라인과 동일한 인증 구조를 공유해 마이그레이션 부담이 낮다.
Meta, Llama 4 공식 GGUF 퀀트 배포—로컬 추론 문턱 대폭 낮춰
Meta가 Llama 4 Scout·Maverick 시리즈의 공식 GGUF 양자화 가중치를 Hugging Face Meta 공식 계정을 통해 배포했다. Q4_K_M 기준 Scout 17B 활성 파라미터 모델이 VRAM 12GB 환경에서 구동되며, 서드파티 변환 없이 llama.cpp·Ollama에서 즉시 사용할 수 있어 온프레미스·엣지 배포 수요를 정면으로 겨냥했다.
GitHub Copilot Workspace, 정식 GA—이슈→PR 전 과정 자동화
GitHub이 Copilot Workspace를 모든 Copilot 구독자에게 정식 공개했다. 이슈 하나를 입력하면 계획 수립·코드 작성·테스트·PR 생성까지 단일 워크플로로 처리되며, 한국 개발자도 별도 대기 없이 즉시 활성화할 수 있다.
Google, Gemma 3 27B 함수 호출 정식 지원—로컬 에이전트 구축 가능
Google DeepMind가 오픈웨이트 모델 Gemma 3 27B에 함수 호출(Function Calling) 기능을 정식 지원하기 시작했다. 이로써 개발자는 Ollama·llama.cpp 등 로컬 환경에서 외부 API 연동 에이전트를 클라우드 의존 없이 구축할 수 있게 됐다.
EU AI법 범용 AI 의무 조항 발효—API 서비스 제공 개발자도 적용 대상
EU AI법(AI Act) GPAI 의무 조항이 오늘부터 법적 효력을 갖는다. EU 이용자를 대상으로 AI API·SaaS를 운영하는 한국 개발자·기업도 기술 문서화 및 저작권 준수 정책 공시 의무를 이행해야 하며, 위반 시 전 세계 매출의 최대 3%에 해당하는 과징금이 부과될 수 있다.
Meta Llama 4 Maverick, OpenRouter 무료 티어 정식 개방—한국 개발자 즉시 사용 가능
OpenRouter가 Meta Llama 4 Maverick 17B-128E 모델을 무료 티어에 정식 포함해 API 키만으로 즉시 호출 가능해졌다. 컨텍스트 윈도우 1M 토큰을 무료로 활용할 수 있어 긴 문서 처리나 프로토타입 제작 비용 부담이 크게 줄어든다. 별도 클라우드 계정 없이 OpenRouter 단일 엔드포인트로 접근 가능해 한국 개발자·크리에이터의 실험적 프로젝트 진입 장벽이 낮아졌다.
Anthropic, Claude Opus 4 확장 사고 API 정식 공개—복잡한 추론 태스크 직접 통합
Anthropic이 Claude Opus 4의 확장 사고(Extended Thinking) 기능을 Messages API를 통해 정식으로 외부 개발자에게 공개했다. 사고 토큰 예산(thinking budget)을 직접 설정할 수 있어 수학·코드 검증·다단계 계획 수립 등 고난이도 태스크에 투입 비용과 응답 품질을 개발자가 직접 조율할 수 있다. 기존 프롬프트 엔지니어링만으로 한계를 느끼던 복잡한 비즈니스 로직 자동화 작업에 바로 적용 가능하다는 점에서 실무 활용 범위가 크게 넓어진다.
Meta, Llama 4 Scout 멀티모달 파인튜닝 레시피 공식 공개—이미지+텍스트 커스텀 모델 구축 가능
Meta가 Llama 4 Scout(17B 활성 파라미터, MoE 구조)에 대한 멀티모달 지도 파인튜닝(SFT) 레시피와 예제 데이터셋을 공식 GitHub 리포지터리에 공개했다. 텍스트 전용 파인튜닝과 달리 이미지-텍스트 쌍 데이터를 활용해 도메인 특화 시각 이해 모델을 누구나 직접 학습시킬 수 있게 됐다. 클라우드 GPU 비용을 최소화하는 LoRA 기반 학습 스크립트도 함께 제공되어 스타트업과 1인 개발자도 실질적으로 활용 가능한 수준이다.
OpenAI, GPT-4o 비전 파인튜닝 정식 GA—이미지 입력 커스텀 모델 API 공개
OpenAI가 GPT-4o의 이미지 입력을 포함한 멀티모달 파인튜닝을 정식 지원하며, 개발자는 이제 텍스트와 이미지를 혼합한 학습 데이터로 도메인 특화 비전 모델을 직접 훈련할 수 있다. 기존 텍스트 전용 파인튜닝 대비 UI 검수·의료 이미지·제조 결함 탐지 등 실무 적용 범위가 크게 확장되어, 반복적인 프롬프트 엔지니어링 없이 일관된 비전 추론 결과를 얻을 수 있다.
Anthropic, Claude Code SDK 정식 GA—CI/CD 파이프라인 자동화 직접 통합
Anthropic이 Claude Code를 서드파티 환경에 직접 임베드할 수 있는 Claude Code SDK를 정식 GA로 전환했다. 이로써 개발팀은 GitHub Actions, Jenkins 등 기존 CI/CD 파이프라인 안에서 코드 리뷰·자동 수정·테스트 생성 작업을 API 호출 하나로 처리할 수 있게 됐다.
Google, Gemini 2.5 Flash Thinking 모드 API 정식 공개—추론 토큰 비용 별도 과금
Google DeepMind가 Gemini 2.5 Flash의 내부 추론 단계를 명시적으로 제어할 수 있는 'Thinking 모드'를 Gemini API에서 정식 GA로 전환했다. 개발자는 `thinking_budget` 파라미터로 추론 토큰 수를 0에서 최대 24,576 토큰까지 지정할 수 있어 응답 품질과 비용을 세밀하게 조율할 수 있다.
Cursor, 백그라운드 에이전트 정식 출시—클라우드에서 코드 자율 실행
Cursor가 로컬 IDE 없이 클라우드 샌드박스에서 코드를 자율으로 작성·테스트·커밋하는 백그라운드 에이전트(Background Agent)를 정식 GA로 전환했다. 개발자는 작업을 큐에 넣고 다른 업무를 하는 동안 에이전트가 PR 초안까지 생성해 주므로, 반복적인 구현 작업의 병렬화가 가능해진다.
OpenAI Codex CLI 정식 GA—터미널에서 코드 자율 실행
OpenAI가 터미널 기반 코딩 에이전트 Codex CLI를 정식 GA로 전환하며 GPT-4.1 모델과의 통합을 강화했다. 파일 읽기·쓰기·명령 실행을 샌드박스 없이 로컬에서 수행할 수 있어 한국 백엔드·DevOps 개발자의 일상 워크플로에 직접 연결된다. npm 또는 pip 단일 명령으로 설치 가능하며, 요금은 GPT-4.1 API 종량제를 그대로 적용한다.
Anthropic, Tool Use 스트리밍 응답 정식 지원—에이전트 UX 대폭 개선
Anthropic이 Claude API의 Tool Use(함수 호출) 결과를 스트리밍으로 반환하는 기능을 정식 지원하기 시작했다. 기존에는 도구 실행 완료 후 전체 응답을 한 번에 받아야 했으나, 이제 중간 추론 텍스트와 도구 입력 파라미터가 실시간으로 델타 스트림으로 전달된다. 응답 대기 시간이 체감상 크게 줄어 챗봇·코딩 에이전트 등 인터랙티브 서비스의 사용자 경험이 개선된다.
Anthropic, Claude Haiku 4.5 배치 API 정식 GA—대용량 비동기 처리 비용 최대 50% 절감
Anthropic이 Claude Haiku 4.5를 대상으로 한 Message Batches API를 정식 GA로 전환하며, 최대 10만 건의 요청을 단일 배치로 비동기 제출할 수 있게 됐다. 실시간 응답이 불필요한 데이터 가공·콘텐츠 분류·대규모 번역 파이프라인에서 표준 API 대비 최대 50% 낮은 단가를 공식 적용받는다. 한국 개발자와 크리에이터가 야간 배치 작업이나 대량 텍스트 처리 워크플로를 구성할 때 즉시 활용 가능하다.
OpenAI Agents SDK 1.0 파이썬 안정 버전 정식 출시
OpenAI가 멀티에이전트 오케스트레이션 프레임워크 Agents SDK의 파이썬 1.0 안정 버전을 공식 릴리스했다. 핸드오프(Handoff), 가드레일(Guardrail), 트레이싱 기능이 프로덕션 수준으로 확정되어 에이전트 기반 서비스 개발에 즉시 적용할 수 있다.
Anthropic, Claude Sonnet 4.6 프롬프트 캐시 TTL 5분→1시간 확장
Anthropic이 Claude Sonnet 4.6의 프롬프트 캐싱 유지 시간을 기존 5분에서 최대 1시간으로 대폭 늘렸다. 대형 시스템 프롬프트나 긴 문서를 반복 참조하는 애플리케이션에서 API 비용을 최대 90%까지 절감할 수 있어 RAG·코드 리뷰 파이프라인 운영자에게 직접적인 효과가 기대된다.
Mistral, Codestral 2 정식 출시—코드 전용 32B 오픈웨이트 모델
Mistral AI가 코드 생성·완성 특화 모델 Codestral 2를 정식 공개하며 Apache 2.0 라이선스로 가중치를 배포했다. 전작 대비 컨텍스트 윈도우가 256K 토큰으로 확대되고 FIM(Fill-in-the-Middle) 정확도가 대폭 향상돼, 로컬 환경에서 GitHub Copilot 수준의 인라인 완성을 자체 인프라로 구현할 수 있게 됐다.
OpenAI, Realtime API WebRTC 모드 정식 GA—브라우저 직접 음성 통화 구현
OpenAI가 Realtime API의 WebRTC 전송 방식을 정식 GA로 전환했다. 기존 WebSocket 방식 대비 서버 중계 없이 브라우저와 모델 간 직접 저지연 음성 스트림이 가능해져, 별도 백엔드 없이 클라이언트 단에서 실시간 음성 대화 앱을 구현할 수 있다. 한국 크리에이터·스타트업의 음성 인터페이스 프로토타입 비용과 인프라 복잡도가 대폭 줄어들 전망이다.
Meta Llama 4 Maverick GGUF 공식 배포—Ollama·llama.cpp 즉시 로컬 실행
Meta가 Llama 4 Maverick 모델의 GGUF 포맷 공식 가중치를 Hugging Face에 공개했다. Q4_K_M 양자화 기준 약 24GB로, RTX 4090 단일 GPU 또는 M2 Max MacBook Pro에서 추론이 가능하다. Ollama와 llama.cpp 최신 버전에서 즉시 `ollama pull llama4:maverick` 한 줄로 실행할 수 있어 국내 로컬 AI 개발 환경이 한 단계 넓어질 것으로 보인다.
Google DeepMind, Veo 3 동영상 생성 API 정식 GA—크리에이터 워크플로 직접 통합 가능
Google DeepMind가 Veo 3 동영상 생성 모델의 API를 Vertex AI를 통해 정식 공개했다. 텍스트·이미지 프롬프트로 최대 1080p, 60fps 동영상을 프로그래밍 방식으로 생성할 수 있어, 콘텐츠 제작 파이프라인 자동화가 현실화됐다. 한국 크리에이터와 미디어 스타트업이 자체 서비스에 고품질 동영상 생성 기능을 직접 내재화할 수 있는 첫 번째 공식 경로다.
GitHub Copilot, 에이전트 모드 VS Code 정식 GA—멀티파일 자율 편집 지원
GitHub Copilot의 에이전트 모드가 VS Code에서 정식 출시되어, 단일 프롬프트로 여러 파일을 자율적으로 생성·수정·삭제하는 작업이 가능해졌다. 터미널 명령 실행 및 테스트 자동 수정 루프까지 포함되어 기존 인라인 제안 방식과 차별화된다.
EU AI법 범용 AI 실천 강령 최종안 확정—한국 기업 대응 체크리스트
유럽연합이 AI법(AI Act)의 범용 AI(GPAI) 모델 적용 조항에 대한 실천 강령(Code of Practice) 최종안을 확정 공고했다. 연간 활성 사용자 1000만 명 이상 또는 학습 연산량 10²⁵ FLOP 초과 모델에 대해 투명성 보고서 및 저작권 학습 데이터 로그 제출이 의무화된다. 한국 기업도 EU 시장에 AI 서비스를 제공할 경우 2026년 8월부터 적용 대상이 된다.
Google DeepMind, Gemma 3 27B 함수 호출 공식 지원—온프레미스 에이전트 구축 가능
Google DeepMind가 오픈소스 모델 Gemma 3 27B에 함수 호출(Function Calling) 기능을 정식 탑재하고 Hugging Face 및 Kaggle을 통해 업데이트된 가중치를 배포했다. 이로써 개발자는 외부 API 호출이나 로컬 툴 실행을 클라우드 의존 없이 자체 인프라에서 구현할 수 있어, 데이터 외부 유출을 꺼리는 기업 환경에서의 에이전트 파이프라인 구축 비용이 크게 낮아진다.
Cursor, 백그라운드 에이전트 정식 GA—로컬 무인 태스크 실행
Cursor가 사용자 개입 없이 장시간 코딩 태스크를 로컬 환경에서 자율 실행하는 백그라운드 에이전트 기능을 정식 출시했다. 브랜치 생성·테스트 실행·PR 초안 작성까지 파이프라인 전체를 에이전트가 처리해, 개발자가 다른 작업 중에도 병렬로 코드베이스를 발전시킬 수 있다.
Meta, Llama 4 Scout 4-bit 공식 양자화 가중치 공개—소비자 GPU 대응
Meta가 Llama 4 Scout의 4-bit GPTQ 및 AWQ 공식 양자화 가중치를 Hugging Face에 공개했다. RTX 4090 단일 GPU(24 GB VRAM)에서 전체 컨텍스트 10만 토큰 추론이 가능해져, 클라우드 없이 로컬에서 대규모 멀티모달 모델을 운영하려는 개발자·크리에이터에게 실질적 선택지가 생겼다.
Anthropic, MCP OAuth 2.1 인증 표준 정식 GA—원격 서버 보안 연결 통합
Anthropic이 Model Context Protocol(MCP)에 OAuth 2.1 기반 인증 레이어를 정식 GA로 공개했다. 이로써 개발자는 원격 MCP 서버에 안전하게 토큰 기반 인증을 구현할 수 있으며, 기업 내부 API나 SaaS 서비스와 Claude를 연결할 때 자격증명 노출 없이 표준 흐름을 따를 수 있게 됐다.
Claude Opus 4.7, 확장 사고 토큰 한도 2배 상향—32K로 확대
Anthropic이 Claude Opus 4.7의 Extended Thinking(확장 사고) 최대 토큰 한도를 기존 16,384토큰에서 32,768토큰으로 두 배 늘렸다. 복잡한 멀티스텝 추론·장문 코드 리뷰·수학 증명 등 고난도 작업에서 모델이 더 깊은 내부 사고 과정을 거칠 수 있게 됐으며, 한국어 복잡 문서 분석 태스크에서도 품질 향상이 보고됐다.
Google, Gemini 2.5 Pro 코드 실행 환경 API 정식 GA—샌드박스 내 Python 런타임 제공
Google DeepMind가 Gemini 2.5 Pro의 서버사이드 코드 실행(Code Execution) 기능을 API로 정식 공개했다. 개발자는 별도 인프라 없이 모델이 Python 코드를 생성·실행·결과 반영까지 한 번의 API 호출로 처리할 수 있으며, 데이터 분석·자동화 에이전트 구축 워크플로가 크게 단순화된다.
OpenAI, 파인튜닝 대시보드 v2 정식 GA—실시간 손실 모니터링·자동 하이퍼파라미터 튜닝
OpenAI가 파인튜닝 대시보드를 전면 개편해 학습 중 손실 곡선·검증 지표를 실시간으로 시각화하는 기능과 자동 하이퍼파라미터 탐색 옵션을 정식 제공한다. gpt-4o-mini 및 gpt-4o 계열 모델에 즉시 적용 가능하며, 기존 API 키와 프로젝트 구조를 그대로 유지한 채 마이그레이션 없이 사용할 수 있어 한국 개발팀의 MLOps 워크플로우 진입 장벽이 낮아진다.
Anthropic, Claude Code IDE 확장 VS Code·JetBrains 동시 정식 GA
Anthropic이 Claude Code의 VS Code 및 JetBrains 계열 IDE 네이티브 확장을 동시에 정식 출시했다. 터미널 CLI 없이 에디터 패널 안에서 코드 리뷰·자동 수정·테스트 생성을 완결할 수 있으며, 기업 요금제 사용자는 Claude Sonnet 4 모델이 기본 적용된다.
OpenAI, Structured Outputs v2 정식 GA—스키마 복잡도 한계 대폭 완화
OpenAI가 Structured Outputs v2를 정식 출시하며 중첩 객체 깊이 제한을 기존 5단계에서 20단계로 확대하고, `anyOf` · `$ref` 등 JSON Schema 고급 키워드를 공식 지원하기 시작했다. 복잡한 도메인 모델을 그대로 스키마로 넘길 수 있어, 별도 전처리 없이 LLM 출력을 타입 안전하게 파싱하는 프로덕션 파이프라인 구축이 용이해진다.
OpenAI Codex CLI, 터미널 네이티브 코딩 에이전트 정식 GA
OpenAI가 터미널에서 직접 동작하는 코딩 에이전트 Codex CLI를 정식 출시했다. 로컬 파일시스템 읽기·쓰기, 셸 명령 실행, 테스트 자동화까지 단일 CLI 도구로 처리할 수 있어 서버리스 개발 워크플로우에 즉시 통합 가능하다.
Claude Sonnet 4.6, 200K 컨텍스트 스트리밍 응답 정식 지원
Anthropic이 Claude Sonnet 4.6에 200K 토큰 전체 구간에서 스트리밍 응답을 안정적으로 유지하는 기능을 정식 GA로 전환했다. 대용량 코드베이스·문서를 단일 요청으로 처리하면서도 첫 토큰 응답 시간(TTFT)이 기존 대비 약 30% 단축되어 실시간 UX가 크게 개선된다.
Cursor, 공식 MCP 레지스트리 정식 런칭—원클릭 툴 연동
Cursor가 Model Context Protocol(MCP) 서버를 검색·설치·관리할 수 있는 공식 레지스트리를 정식 공개했다. 개발자는 별도 설정 파일 없이 UI에서 원클릭으로 데이터베이스·API·CI 툴을 에디터에 연결할 수 있어 에이전트 워크플로 구성 시간이 대폭 단축된다.
Google, Gemini 2.5 Flash 추론 예산 동적 제어 API 정식 GA
Google DeepMind가 Gemini 2.5 Flash의 '추론 예산(thinking budget)' 파라미터를 개발자가 요청 단위로 동적으로 조절할 수 있는 API를 정식 GA로 전환했다. 이로써 단순 분류 작업에는 추론을 최소화해 비용을 낮추고, 복잡한 코드 생성 작업에는 예산을 높여 품질을 극대화하는 혼합 전략이 가능해진다. 한국 스타트업 및 인디 크리에이터에게 토큰 비용 최적화의 실질적 수단이 생긴 셈이다.
Meta, Llama 4 Maverick 비전 API 가중치·추론 코드 전면 오픈소스 공개
Meta가 Llama 4 Maverick의 멀티모달(텍스트+이미지) 추론 가중치와 Hugging Face Transformers 호환 추론 코드를 상업적 이용 가능한 Llama 4 Community License 하에 전면 공개했다. 이전까지 비전 기능은 Meta AI 서비스 내부에서만 제공됐으나, 이제 로컬 또는 자체 서버에서 이미지 이해 기능을 무료로 구동할 수 있다. 클라우드 비용 없이 이미지 기반 앱을 만들려는 한국 인디 개발자에게 즉각적인 선택지가 생겼다.
Google DeepMind, Veo 3 영상 생성 API 개발자 정식 GA
Google DeepMind가 텍스트·이미지 프롬프트로 최대 4K 60fps 영상을 생성하는 Veo 3 API를 Google AI Studio 및 Vertex AI에서 정식 공개했다. 오디오 동기화, 카메라 모션 제어 파라미터가 추가돼 크리에이터 및 영상 앱 개발자의 프로덕션 활용이 가능해졌다.
Claude Code, 서브에이전트 병렬 실행 정식 지원—대형 리팩토링 속도 대폭 향상
Anthropic이 Claude Code에 서브에이전트 병렬 실행 기능을 정식 GA했다. 하나의 작업을 여러 독립 에이전트가 동시에 처리하도록 분할해 대규모 코드베이스 리팩토링·테스트 생성 시간을 기존 대비 최대 60% 단축할 수 있다. 한국 개발자들이 실무에서 가장 많이 요청한 기능 중 하나로, 모노레포 환경에서 특히 효과적이다.
Meta, Llama 4 Scout 한국어 파인튜닝 공식 레시피·데이터셋 오픈소스 공개
Meta가 Llama 4 Scout(17B 활성 파라미터) 모델의 한국어 특화 파인튜닝 레시피와 함께 약 120만 건 규모의 한국어 인스트럭션 데이터셋을 Hugging Face에 공개했다. 8×H100 이하 환경에서 재현 가능하도록 설계돼 국내 스타트업과 1인 크리에이터도 커스텀 모델을 빌드할 수 있는 문턱이 크게 낮아졌다. 한국어 BLEU·ROUGE 지표가 기존 베이스 모델 대비 각각 18%, 22% 향상됐다고 Meta는 밝혔다.
OpenAI Realtime API, WebRTC 직접 연결 정식 GA—서버 없이 음성 AI 앱 구축
OpenAI가 Realtime API의 WebRTC 다이렉트 연결 모드를 정식 GA로 전환하며, 별도 백엔드 서버 없이 브라우저·모바일 앱에서 곧바로 저지연 음성 대화 AI를 구현할 수 있게 됐다. 기존 WebSocket 방식 대비 평균 레이턴시가 40% 감소했으며, 한국 개발자들이 많이 사용하는 React·Flutter SDK에 공식 예제가 추가됐다.
Meta, Llama 4 Maverick 함수 호출 기능 정식 GA
Meta가 Llama 4 Maverick 모델에 구조화된 함수 호출(Function Calling) 기능을 정식 지원하며 에이전트 파이프라인 구축이 가능해졌다. JSON 스키마 기반 도구 정의와 병렬 다중 호출을 지원해 오픈소스 에이전트 프레임워크와의 통합이 크게 간편해진 점이 핵심이다.
Anthropic, 프롬프트 캐시 TTL 1시간→5시간 확대
Anthropic이 Claude API의 프롬프트 캐싱(Prompt Caching) 유효 시간을 기존 최대 1시간에서 5시간으로 연장했다. 대용량 시스템 프롬프트나 문서를 반복 사용하는 서비스에서 입력 토큰 비용을 추가로 절감할 수 있어 장시간 세션 기반 앱 개발자에게 직접적인 혜택이 생긴다.
Google, Gemini 2.5 Pro 코드 실행 환경 API 정식 GA
Google DeepMind가 Gemini 2.5 Pro의 서버사이드 코드 실행(Code Execution) 기능을 Gemini API에서 정식 GA로 전환했다. 샌드박스 환경에서 Python 코드를 직접 돌리고 결과를 응답에 포함시킬 수 있어, 데이터 분석·자동화 파이프라인 구축 시 별도 실행 인프라 없이 모델 단에서 처리가 가능해졌다.
Anthropic, Claude Haiku 4.5 배치 API 50% 할인 정식 적용
Anthropic이 Claude Haiku 4.5를 대상으로 Message Batches API 이용 시 표준 요금 대비 50% 할인을 정식 정책으로 확정했다. 대량 문서 처리·데이터 레이블링·콘텐츠 파이프라인을 운영하는 한국 개발팀에게 비용 절감 효과가 크며, 실시간성이 필요 없는 워크로드에서 즉시 활용 가능하다.
OpenAI, o3 추론 모델 무료 플랜 일일 한도 3배 확대
OpenAI가 ChatGPT 무료 플랜 사용자에게 제공하는 o3 모델의 일일 메시지 한도를 기존 대비 3배 늘렸다. 고비용 추론 모델에 대한 접근 장벽이 낮아져, API 도입 전 검증 단계에 있는 한국 개발자·인디 크리에이터에게 실질적인 테스트 기회가 넓어진다.
한국 AI 기본법 시행령 초안 공개—고위험 AI 판단 기준 명시
과학기술정보통신부가 2026년 하반기 시행 예정인 AI 기본법의 시행령 초안을 입법예고했다. 초안에는 '고위험 AI' 해당 여부를 판단하는 서비스 유형·영향 범위 기준이 처음으로 수치와 함께 제시돼, AI 서비스를 개발·운영 중인 국내 기업과 크리에이터 플랫폼이 즉각적인 법적 검토에 나서야 하는 상황이다.
GitHub Copilot Workspace, 멀티파일 자율 에이전트 모드 정식 GA
GitHub이 Copilot Workspace의 멀티파일 자율 에이전트 모드를 정식 출시하며, 이슈 하나로 브랜치 생성·파일 수정·PR 초안 작성까지 단일 플로우로 자동화할 수 있게 됐다. Copilot Enterprise 구독자는 즉시 사용 가능하며, 개인 Pro 플랜 사용자에게는 월 50회 무료 실행 크레딧이 제공된다. 대규모 레거시 코드베이스를 다루는 한국 백엔드·풀스택 개발자에게 반복 작업 자동화의 실질적 진입 장벽이 낮아졌다는 점에서 주목된다.
OpenAI Codex CLI 1.0 정식 출시—터미널 네이티브 코딩 에이전트
OpenAI가 터미널 환경에서 직접 동작하는 코딩 에이전트 Codex CLI 1.0을 정식 출시했다. 로컬 파일시스템 읽기·쓰기, 셸 명령 실행, 멀티스텝 태스크 자동화를 IDE 없이 지원하며, 한국 개발자들이 CI/CD 파이프라인과 스크립트 기반 워크플로에 즉시 통합할 수 있다.
Anthropic, 공식 MCP 레지스트리 출시—서버 검색·버전 관리 통합
Anthropic이 Model Context Protocol(MCP) 서버를 중앙에서 검색하고 버전을 관리할 수 있는 공식 레지스트리를 정식 공개했다. npm 스타일의 CLI 도구와 함께 제공되며, 크리에이터와 개발자가 자체 MCP 서버를 퍼블리시해 생태계에 기여할 수 있다.
Cursor, 백그라운드 에이전트 정식 GA—로컬 무관 병렬 코딩 지원
Cursor가 클라우드 샌드박스에서 여러 작업을 동시에 실행하는 백그라운드 에이전트(Background Agent)를 정식 출시했다. 개발자가 로컬 머신을 켜두지 않아도 PR 생성·테스트 실행·린트 수정 등을 병렬로 처리할 수 있어, 대규모 리팩터링이나 야간 자동화 워크플로우 구축에 실질적인 변화를 가져온다.
Mistral, Codestral 2 정식 공개—80개 언어 코드 완성 성능 강화
Mistral AI가 코드 특화 모델 Codestral 2를 정식 공개했다. 전작 대비 컨텍스트 윈도우가 256K 토큰으로 확장되었고, Rust·Go·Kotlin 등 시스템 언어 벤치마크에서 GPT-4o를 상회하는 결과를 발표했다. Mistral API 및 주요 IDE 플러그인을 통해 즉시 사용 가능해 한국 개발자들의 로컬·온프레미스 배포 대안으로 주목받고 있다.
EU AI법 범용 AI 행동강령 최종안 확정—한국 서비스 수출 시 준수 필수
유럽 AI 오피스(AI Office)가 범용 AI(GPAI) 모델 공급자 대상 행동강령(Code of Practice) 최종안을 확정 발표했다. 시스템적 위험 모델(학습 연산량 10²⁵ FLOP 초과) 기준, 투명성 보고·레드팀 의무가 구체화되었다. EU 내 AI 서비스 출시를 목표로 하는 한국 스타트업과 개발자는 2026년 8월 2일 전까지 준수 체계를 갖춰야 한다.
Anthropic, Claude Sonnet 4 확장 사고 모드 정식 GA—추론 토큰 예산 32K로 확대
Anthropic이 Claude Sonnet 4의 확장 사고(Extended Thinking) 모드를 정식 GA로 전환하며 추론 토큰 예산 상한을 기존 16K에서 32K 토큰으로 두 배 확대했다. 복잡한 다단계 코드 리팩터링, 아키텍처 설계, 수학적 증명 등 긴 사고 체인이 요구되는 작업에서 정확도가 크게 향상되어 한국 개발자의 프로덕션 워크플로우 도입 장벽이 낮아졌다.
Google, Gemini 2.5 Flash 추론 예산 토큰 제어 기능 정식 GA
Google DeepMind가 Gemini 2.5 Flash의 '추론 예산(Thinking Budget)' 파라미터를 정식 GA로 전환했다. 개발자가 모델의 내부 추론 토큰 수를 0~24,576 범위에서 직접 지정할 수 있어, 응답 속도와 추론 깊이를 태스크 유형에 맞게 트레이드오프 조정하는 것이 가능해졌다.
Google DeepMind, Veo 3 영상 생성 API 개발자 공개—음성 동기화 포함
Google DeepMind가 Veo 3 영상 생성 모델을 Vertex AI API로 개발자에게 정식 공개했다. 텍스트·이미지 프롬프트로 최대 8초 4K 영상을 생성하며, 립싱크 수준의 음성-영상 동기화가 단일 API 호출로 처리된다. 영상 콘텐츠 자동화나 숏폼 제작 파이프라인을 구축하는 한국 크리에이터·개발자에게 즉시 활용 가능한 옵션이 생겼다.
Anthropic, Claude Code SDK 정식 GA—에이전트 코딩 파이프라인 직접 통합
Anthropic이 Claude Code를 외부 앱·서비스에 직접 임베드할 수 있는 Claude Code SDK를 정식 출시했다. 개발자는 자체 IDE, CI/CD, 사내 툴링에 코딩 에이전트 기능을 API 수준으로 삽입할 수 있으며, 서브에이전트 오케스트레이션과 파일 시스템 접근 권한을 세밀하게 제어할 수 있다.
Meta, Llama 4 Reasoning 오픈웨이트 공개—수학·코드 추론 특화 모델
Meta가 수학 증명과 코드 디버깅에 특화된 추론 전용 모델 Llama 4 Reasoning을 오픈웨이트로 공개했다. 70B 파라미터 단일 모델로 AIME 2025 기준 정확도 78%를 기록하며, Apache 2.0 라이선스로 상업적 사용이 가능하다.
OpenAI Realtime API WebRTC 정식 GA—음성 대화 앱 구축 비용 공개
OpenAI가 Realtime API의 WebRTC 전송 방식을 정식 GA로 전환하면서, 브라우저·모바일 앱에서 별도 서버 없이 저지연 양방향 음성 스트리밍을 직접 구현할 수 있게 됐다. 오디오 입력 토큰 기준 $0.06/1K 토큰, 출력 $0.24/1K 토큰으로 가격이 확정되어 한국 개발자들이 서비스 원가 계산에 바로 활용할 수 있다.
Anthropic, Claude Haiku 4.5 배치 API 정식 GA—대용량 비동기 처리 비용 50% 절감
Anthropic이 Claude Haiku 4.5를 대상으로 한 Message Batches API를 정식 GA로 전환했다. 최대 10만 건의 요청을 단일 배치로 제출해 비동기 처리할 수 있으며, 동기 API 대비 비용이 50% 저렴해 대규모 데이터 파이프라인을 운영하는 개발자에게 실질적 원가 절감 수단이 된다.
Google DeepMind, AlphaCode 3 공개—경쟁 프로그래밍 정확도 87% 달성
Google DeepMind가 AlphaCode 3를 공개하며 Codeforces 기준 상위 13% 수준에 해당하는 87%의 문제 해결률을 기록했다고 발표했다. 이전 세대 대비 복잡한 알고리즘 구성 능력이 크게 향상됐으며, API를 통해 외부 개발자도 접근할 수 있는 경로가 열렸다.
Meta, Llama 4 Scout 한국어 RAG 최적화 공식 가이드 공개
Meta가 Llama 4 Scout 17B 모델을 활용한 한국어 RAG(검색 증강 생성) 구축 공식 가이드와 레퍼런스 아키텍처를 Meta AI 개발자 문서에 공개했다. 10M 토큰 컨텍스트 윈도우를 활용해 대용량 문서 코퍼스를 단일 패스로 처리하는 방식과 한국어 청킹 전략이 핵심으로, 국내 기업 서비스에 RAG 파이프라인을 도입하려는 개발자에게 실질적인 기준점이 생겼다.
Cursor, 백그라운드 에이전트 정식 GA—로컬 환경 병렬 실행 지원
Cursor가 백그라운드 에이전트(Background Agent) 기능을 정식 GA로 전환하며, 개발자가 에디터를 떠나지 않고도 여러 태스크를 병렬로 위임할 수 있게 됐다. 각 에이전트는 격리된 로컬 샌드박스에서 실행되며 결과를 PR 또는 diff 형태로 반환해 코드 리뷰 워크플로와 자연스럽게 연결된다. 에이전트당 실행 시간 제한과 토큰 소비가 플랜별로 달라 팀 단위 도입 시 비용 예측이 중요해졌다.
OpenAI, GPT-4o 비전 파인튜닝 정식 GA—이미지·텍스트 혼합 학습 지원
OpenAI가 GPT-4o의 비전 파인튜닝(Vision Fine-Tuning)을 정식 GA로 전환해, 이미지와 텍스트가 혼합된 학습 데이터셋으로 모델을 커스터마이징할 수 있게 됐다. UI 캡처 분류, 도면 해석, 상품 이미지 태깅 등 멀티모달 도메인 특화 태스크에서 범용 모델 대비 정확도가 유의미하게 향상된다. 학습 비용은 텍스트 파인튜닝 대비 토큰당 단가가 높으므로 데이터셋 설계 단계에서 품질 우선 전략이 필요하다.
GitHub Copilot Workspace, MCP 서버 연동 정식 지원
GitHub Copilot Workspace가 Model Context Protocol(MCP) 서버 연동을 정식 GA로 지원하며, 외부 데이터소스·툴을 Workspace 태스크 플랜에 직접 주입할 수 있게 됐다. 이로써 Jira 티켓, Notion 문서, 사내 API 스펙 등을 별도 복사 없이 코딩 컨텍스트로 활용할 수 있어 한국 개발팀의 협업 자동화 파이프라인 구축에 실질적 변화가 예상된다.
Anthropic, Claude Opus 4 확장 사고 모드 정식 GA—복잡한 추론 태스크 대응
Anthropic이 Claude Opus 4의 확장 사고(Extended Thinking) 모드를 API에서 정식 GA로 전환했다. 수학·코드 디버깅·다단계 플래닝 등 고난도 태스크에서 내부 추론 토큰을 명시적으로 활용해 응답 품질을 높이며, 한국 개발자들은 별도 플래그 없이 기존 API 호출만으로 해당 기능을 즉시 사용할 수 있다.
OpenAI, ChatGPT 내 Codex 클라우드 에이전트 정식 출시—코드베이스 자율 실행
OpenAI가 ChatGPT Plus·Pro·Team 구독자를 대상으로 Codex 클라우드 에이전트를 정식 공개했다. 사용자가 자연어로 태스크를 지정하면 에이전트가 샌드박스 환경에서 코드 작성·테스트·수정을 자율적으로 수행하며, 완료 후 PR(Pull Request) 초안을 GitHub에 직접 올린다.
Meta, Llama 4 Maverick 함수 호출 API 정식 GA—멀티턴 툴 체이닝 지원
Meta가 Llama 4 Maverick 모델에 대한 함수 호출(Function Calling) 기능을 정식 GA로 전환하며, 멀티턴 대화 내에서 복수의 툴을 순차·병렬로 체이닝하는 구조를 공식 지원한다. 기존 단일 호출 방식 대비 에이전트 파이프라인 구성이 대폭 단순화되어, 한국 개발자가 자체 호스팅 환경에서 오픈소스 기반 에이전트를 구축하는 데 실질적인 진입 장벽이 낮아질 전망이다.
Google, Gemini Code Assist Enterprise 정식 GA—팀 단위 코드베이스 인덱싱 지원
Google이 Gemini Code Assist Enterprise를 정식 출시하며 팀·조직 단위로 사내 코드베이스 전체를 인덱싱해 컨텍스트 기반 코드 완성과 리뷰를 제공한다. 기존 개인 플랜 대비 프라이빗 저장소 연동과 감사 로그(Audit Log) 기능이 추가되어 기업 보안 요건을 충족한다는 점이 핵심이다.
EU AI Act, GPAI 모델 의무 조항 본격 시행—한국 AI 서비스 대응 체크리스트
EU AI Act의 범용 AI(GPAI) 모델 관련 투명성·저작권 의무 조항이 2026년 5월 기준으로 적용 대상 기업에 본격 집행 단계에 진입했다. 한국 스타트업·크리에이터도 EU 이용자를 대상으로 AI 생성 콘텐츠나 API 서비스를 제공한다면 직접적인 규제 대상이 될 수 있어 선제적 대응이 필요하다.
OpenAI Responses API, 파일 검색·웹 검색 도구 정식 GA
OpenAI가 Responses API에 내장된 파일 검색(File Search)과 웹 검색(Web Search) 도구를 정식 GA로 전환했다. 기존 Assistants API 대비 단일 요청에서 다중 도구를 병렬 호출할 수 있어 RAG 파이프라인 구축 비용과 코드 복잡도를 동시에 낮출 수 있다.
프롬프트 엔지니어링 한국어 입문 — 초보가 알아야 할 7가지
프롬프트 엔지니어링이 처음인 한국어 사용자를 위한 입문 가이드. 역할 부여, Few-shot, CoT, 출력 형식, 컨텍스트 분리 등 핵심 7개 패턴.
Claude vs ChatGPT 한국어 비교 (2026년 5월 최신)
Anthropic Claude와 OpenAI ChatGPT를 한국어 작업 기준으로 비교. 글쓰기, 코딩, 가격, 멀티모달 11개 항목으로 어느 쪽이 어떤 작업에 유리한지 정리.
ChatGPT 사용법 완전정리 — 무료/Plus/Pro 차이와 한국어 활용
ChatGPT를 처음 쓰는 한국인을 위한 완전 가이드. 무료/Plus/Pro 플랜별 차이, 한국어 답변 품질 개선 팁, 모바일 앱 활용까지 한 번에 정리.
Cursor vs Claude Code — AI 코딩 도구 어떻게 골라야 하나
Cursor와 Claude Code의 차이, 가격, 사용 흐름을 한국 개발자 관점에서 비교. 어떤 작업에 어느 도구가 유리한지.
RAG 한국어 가이드 — 사내 문서 챗봇 만드는 법
Retrieval-Augmented Generation을 한국어 환경에서 구축하는 전체 흐름. 임베딩 모델 선택, 청킹, 벡터 DB, 한국어 검색 품질 개선 팁까지.
Claude API 시작하는 법 — Python·Node.js 예제와 비용 가이드
Anthropic Claude API를 처음 사용하는 개발자를 위한 단계별 가이드. 키 발급, 첫 호출, 모델 선택, 비용 관리, 캐싱·배치 활용까지.
AI 부업 아이디어 10선 — 2026년 한국 실전 사례
AI 도구로 시작 가능한 부업 10가지. 진입 난이도, 예상 수익, 필요 도구를 정리. 글쓰기·디자인·자동화·교육까지.
ChatGPT 한국어 잘쓰는 법 — 톤·존댓말·맥락 유지하는 7가지
ChatGPT의 한국어 답변을 자연스럽게 만드는 7가지 실전 기법. 톤 일관성, 존댓말 모드, 영어 단어 섞임 방지, 문체 통일까지.
AI 자동화 도구 TOP 10 — 한국 사용자 추천 (2026)
한국에서 쓸 만한 AI 자동화 도구 10개. 노코드부터 코드 베이스까지 카테고리별 정리, 무료 한도와 한국어 지원 여부 포함.
Claude Artifacts 활용법 — 코드·문서를 옆 창에서 미리보기
Claude의 Artifacts 기능 사용법. 코드·HTML·SVG·문서를 별도 창에서 즉시 미리보고 수정·내보내는 워크플로.
Perplexity AI 사용법 — 검색·인용·연구가 강한 AI 어떻게 쓰나
Perplexity AI를 한국어 사용자가 어떤 작업에 활용해야 하는지. ChatGPT·Claude와 다른 점, Pro 플랜 가치, 연구·뉴스 활용 사례.
Vibe Coding이란 — AI와 함께 만드는 새 개발 패러다임
2025년부터 떠오른 Vibe Coding 개념과 실전 워크플로. AI 에이전트와 대화하며 만드는 개발 방식, 어떻게 시작할지.
Claude Code, npm 설치 → 네이티브 설치로 완전 이전
과거 `npm install -g @anthropic-ai/claude-code` 방식이 공식에서 제거됐다. 이제는 `curl | bash`(macOS/Linux) 또는 `irm | iex`(Windows) 네이티브 스크립트가 표준. Node 런타임 의존이 사라져 설치가 간단해졌다.
Claude Haiku 3, 4월 19일부로 은퇴 — 마이그레이션 체크리스트
Haiku 3 계열(`claude-3-haiku-*`) API가 오늘을 끝으로 중단된다. Haiku 4.5로 교체 필요. 단가는 올랐지만 품질·속도 개선으로 대량 워크로드에서도 여전히 최저 단가 선택지.
Anthropic, Claude Opus 4.7 공개 — 1M 컨텍스트·128k 출력
Opus 4.7이 정식 공개됐다. 최대 100만 토큰 입력·128k 토큰 출력을 지원하며 가격은 입력 $5 / 출력 $25 per MTok. 전작 Opus 대비 컨텍스트 5배, 추론 품질도 개선.