k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-07-215분

Meta, Llama 4 Scout 한국어 파인튜닝 공식 레시피·데이터셋 오픈소스 공개

Meta가 Llama 4 Scout 모델을 대상으로 한 한국어 특화 파인튜닝 레시피와 벤치마크 데이터셋을 Hugging Face를 통해 공개했다. 자체 한국어 AI 서비스를 구축하려는 국내 스타트업과 개인 개발자가 클라우드 API 의존 없이 온프레미스·엣지 환경에서 고품질 한국어 모델을 직접 학습할 수 있게 됐다.

metallamaopensource

공개 리소스 구성

Meta가 공개한 패키지는 세 가지 핵심 컴포넌트로 구성된다.

| 컴포넌트 | 설명 | 규모 | |---|---|---| | 파인튜닝 레시피 | LoRA·QLoRA 설정 파일 및 학습 스크립트 | PyTorch 2.4+ 기준 | | 한국어 SFT 데이터셋 | 지시-응답 쌍, 뉴스·법률·코드 도메인 | 약 120만 샘플 | | 평가 벤치마크 | KoBEST·KLUE 확장판 + 코드 생성 테스트 | 8개 태스크 |

  • 베이스 모델: Llama 4 Scout (파라미터 규모 및 아키텍처 세부 사항은 공식 페이지 참조)
  • 라이선스: Llama 4 Community License — 상업적 이용 가능, 월간 활성 사용자 7억 명 초과 시 별도 계약 필요
  • 최소 학습 환경: A100 80GB × 2 (QLoRA 4-bit 기준), 예상 학습 시간 약 18시간

국내 개발자 관점에서의 의미

기존에는 한국어 고품질 생성 모델을 자체 운영하려면 EXAONE, HyperCLOVA X 등 국내 모델이나 해외 API에 의존해야 했다. 이번 공개로 달라지는 점은 다음과 같다.

  1. 데이터 프라이버시: 의료·금융·법률 등 외부 전송이 어려운 데이터를 온프레미스에서 직접 학습 가능.
  2. 비용 구조 변화: 추론 비용을 API 종량제 대신 GPU 서버 고정 비용으로 전환할 수 있어, 트래픽이 일정 수준 이상인 서비스에서 유리.
  3. 커스터마이징 자유도: 도메인 특화 어휘, 사내 용어집, 특수 문체를 데이터에 반영해 범용 모델 대비 정확도를 높일 수 있다.

빠른 시작 체크리스트

공개된 레포지토리를 기반으로 한국어 파인튜닝을 시작하기 위한 단계별 준비 사항이다.

1. Hugging Face에서 llama-4-scout-ko-recipe 레포 클론
2. requirements.txt 설치 (transformers ≥ 4.47, peft ≥ 0.14)
3. config/qlora_ko.yaml에서 학습률·배치 사이즈 조정
4. 제공된 120만 샘플 중 도메인 필터링 후 서브셋 구성
5. KoBEST 벤치마크로 파인튜닝 전후 성능 비교
  • 상세 라이선스 조건 및 최신 업데이트는 Meta AI 공식 페이지 및 Hugging Face 모델 카드 참조
  • 국내 GPU 클라우드(NHN Cloud, KT Cloud 등)와의 호환성은 각 공급사 문서 확인 권장
출처: Meta AI Official Blog