독파모 AI 학습데이터 무료 공개|AI허브 29종·1.56조 토큰 활용법

독자 AI 파운데이션 모델 프로젝트, 이른바 ‘독파모’의 AI 학습데이터 29종이 AI허브에 무료 공개됐습니다. 전체 규모는 약 3,544만 건이며, 토큰으로 환산하면 약 1조5,600억 토큰입니다.

공개 데이터에는 대규모 사전학습 텍스트부터 추론·AI 에이전트·레드티밍·영상·음성·산업 현장·피지컬 AI 데이터까지 포함됩니다. 국내 기업과 연구자, 학생 등 대한민국 국민은 AI허브에서 신청 절차를 거쳐 이용할 수 있습니다.

핵심 정리
이번에 공개된 것은 독파모 평가 점수나 모델 가중치가 아니라 5개 정예팀이 모델 개발 과정에서 구축한 AI 학습용 데이터입니다. 무료 다운로드가 가능하지만 데이터 재판매·제3자 제공·국외 반출은 별도 제한을 확인해야 합니다.
독파모 AI 학습데이터 무료 공개|AI허브 29종·1.56조 토큰 활용법

1. 독파모 AI 학습데이터 공개 규모

과학기술정보통신부와 한국지능정보사회진흥원은 2026년 8월 27일 독파모 5개 정예팀이 1차 단계평가 과정에서 구축한 AI 학습용 데이터를 공개했습니다.

항목 공개 내용 해석
데이터 종류 29종 텍스트·영상·음성·추론·안전·피지컬 AI
데이터 건수 약 3,544만 건 영상·텍스트·음성 질의응답 등 개별 데이터 수
토큰 규모 약 1조5,600억 토큰 텍스트 등을 모델 학습 단위로 환산한 규모
구축·가공 예산 150억원 정예팀별 개발 전략에 맞춰 구축
이용 대상 국내 기업·연구자·학생 등 AI허브 이용 신청 필요

과기정통부는 전체 데이터가 이론적으로 70~80B급 대형 AI 모델 학습에 이용될 수 있는 규모라고 설명했습니다. 그러나 데이터 규모가 크다는 사실만으로 같은 수준의 모델을 만들 수 있다는 의미는 아닙니다.

실제 모델 개발에는 데이터 정제와 중복 제거, 토크나이저 설계, 학습 목적에 맞는 데이터 혼합 비율, GPU 자원, 학습 알고리즘과 평가 체계가 함께 필요합니다.

3,544만 건과 1.56조 토큰은 서로 다른 단위입니다.
‘건’은 영상·음성·텍스트 파일이나 질의응답 같은 데이터 항목 수이고, ‘토큰’은 텍스트를 AI 모델이 처리할 수 있도록 나눈 학습 단위입니다. 두 수치를 직접 나눠 데이터 품질이나 문서 길이를 판단해서는 안 됩니다.

2. 독파모 5개 정예팀별 공개 데이터

이번 데이터는 네이버클라우드, 업스테이지, SK텔레콤, NC AI, LG AI연구원이 각자의 모델 개발 전략에 맞춰 구축했습니다. 동일한 한국어 데이터 모음이 아니라 팀별 목표와 활용 방식이 다릅니다.

정예팀 주요 공개 데이터 적합한 활용 분야
네이버클라우드 공개·방송 영상, 영상 기반 캡션, 음성 질의응답 영상 이해, VLM, 이미지 생성, 음성 질의응답
업스테이지 1조 토큰 규모 사전학습 데이터, 사후학습 데이터 50만 건 LLM 사전학습, 추론·판단·실행형 AI 에이전트
SK텔레콤 수학·과학·법률 추론, 음성·이미지, 한국형 레드티밍 고난도 추론, 전문도메인, 모델 안전성 평가
NC AI 제조 기술문서, 민원 상담 음성, 멀티턴·멀티모달 등 7종 산업 AI, 긴 문맥, 상담 AI, 텍스트·음성·이미지 통합
LG AI연구원 국내 가정환경·가사활동 기반 피지컬 AI 멀티모달 데이터 로봇 비전, 행동 이해, VLM, 가정용 피지컬 AI

네이버클라우드 데이터

공개 영상 234만 건과 방송 영상 52만 건, 영상클립 기반 텍스트 1,550만 건, 음성 질의응답 1,200만 건이 구축됐습니다. 텍스트에는 영상 장면을 문장 단위로 설명한 캡션 등이 포함됩니다.

업스테이지 데이터

약 1조 토큰 규모의 대규모 사전학습 데이터와 50만 건의 사후학습 데이터를 구축했습니다. 사전학습 데이터는 기초 언어능력을 만드는 데, 사후학습 데이터는 추론·판단·실행 능력을 개선하는 데 활용할 수 있습니다.

SK텔레콤 데이터

수학·과학·법률 등 전문영역의 고난도 다단계 추론데이터와 음성·이미지 사후학습 데이터가 포함됩니다. 국내 법령과 한국 사회의 가치관을 반영한 한국형 레드티밍 데이터도 약 1만 건 구축됐습니다.

NC AI 데이터

제조 분야 기술문서와 민원 상담 음성 등 실제 산업 현장 데이터를 바탕으로 7종을 구축했습니다. 긴 문맥 이해, 단계별 추론, 멀티턴 대화, 질의응답과 멀티모달 학습에 활용할 수 있습니다.

LG AI연구원 데이터

국내 50개 실제 가정환경에서 50종 이상의 가사 활동을 촬영해 17만 개 이상의 영상클립 등을 구축했습니다. 객체·분할·자세·맥락 정보가 다층적으로 라벨링돼 로봇과 피지컬 AI 학습에 활용할 수 있습니다.

독파모 정예팀의 평가 결과와 모델 경쟁 구도는 아래 글에서 확인할 수 있습니다.

3. 사전학습·사후학습·레드티밍 데이터 차이

데이터 유형 주요 목적 활용 예시
사전학습 언어·지식·문맥 이해의 기본 능력 형성 LLM 신규 학습, 도메인 기반모델 개발
사후학습 지시 이행·추론·판단·대화 성능 개선 챗봇, AI 에이전트, 업무 자동화
멀티모달 텍스트·이미지·영상·음성의 통합 이해 VLM, 영상 검색, 음성 상담, 로봇 비전
레드티밍 취약점·유해응답·규범 위반 가능성 점검 모델 안전성 평가와 보완 학습
피지컬 AI 공간·객체·행동·상황의 물리적 이해 가정용 로봇, 행동 인식, 로봇 제어

기존 모델을 미세조정하려는 개발자라면 전체 사전학습 데이터를 모두 받을 필요가 없을 수 있습니다. 서비스 목적에 따라 사후학습·추론·멀티턴·레드티밍 데이터를 먼저 검토하는 것이 저장공간과 전처리 비용을 줄이는 데 유리합니다.

4. AI허브 독파모 데이터 다운로드 방법

독파모 데이터는 AI허브의 별도 메뉴인 ‘독자 AI모델 데이터’에서 찾을 수 있습니다. 데이터 다운로드는 모바일이 아닌 PC에서만 가능합니다.

  1. PC에서 AI허브에 접속합니다.
  2. 회원가입 후 본인인증과 로그인을 완료합니다.
  3. AI 데이터찾기 → 독자 AI모델 데이터 메뉴로 이동합니다.
  4. 네이버클라우드·업스테이지·SK텔레콤·NC AI·LG AI연구원 중 정예팀을 선택합니다.
  5. 한국어 또는 영상·이미지·멀티모달 분야를 선택합니다.
  6. 데이터 소개와 파일 구조, 용량, 이용조건을 확인합니다.
  7. 다운로드 버튼을 누르고 본인 확인·이용 목적을 제출합니다.
  8. 승인 후 전체 또는 필요한 파일을 선택해 내려받습니다.

파일 용량이 큰 데이터는 웹브라우저 다운로드보다 AI허브가 제공하는 전용 다운로드 방식이나 셸 다운로드를 사용해야 할 수 있습니다. 데이터 소개 페이지의 다운로드 안내와 파일 병합 방법을 먼저 확인하는 것이 좋습니다.

5. 일반 다운로드와 AI허브 안심존의 차이

29종 데이터가 모두 같은 방식으로 제공되는 것은 아닙니다. 일반 다운로드 버튼이 표시되는 데이터가 있는 반면, 안전성·개인정보·저작권 보호가 필요한 일부 데이터는 온라인 안심존 신청 방식으로 제공됩니다.

구분 일반 다운로드 안심존
이용 방식 승인 후 로컬 저장 통제된 온라인·오프라인 환경에서 분석
주요 대상 일반 학습용 공개 데이터 보안·권리 보호가 필요한 데이터
절차 본인 확인·목적 제출·승인 이용 신청·심사·승인·결과 반출 심사

현재 AI허브 목록에서도 AI Safety Alignment 데이터와 AI 파운데이션 모델 레드티밍 데이터 등 일부 항목은 ‘다운로드’가 아닌 ‘신청하기’로 표시됩니다. 필요한 데이터가 안심존 대상이면 해당 데이터 페이지의 신청서와 보안조건을 따라야 합니다.

6. 기업·연구자·학생은 어떻게 활용할 수 있나

기업·스타트업

  • 고객상담 챗봇의 멀티턴 대화 성능 개선
  • 제조 기술문서 검색과 질의응답 서비스 개발
  • 한국어 전문도메인 추론 모델 평가
  • 음성·이미지·텍스트 결합 멀티모달 서비스 개발
  • 출시 전 모델의 유해응답·안전성 점검

대학·연구기관

  • 한국어 LLM과 VLM의 학습·평가 연구
  • 사전학습과 사후학습 데이터 혼합 비율 비교
  • 한국형 레드티밍 벤치마크 연구
  • 산업·법률·수학·과학 분야 추론 성능 평가
  • 피지컬 AI의 장면·행동 이해 연구

학생·개인 개발자

  • 전체 데이터 대신 샘플 데이터로 구조 확인
  • 소규모 사후학습 데이터로 LoRA 미세조정 실습
  • 멀티턴 질의응답 데이터 전처리 프로젝트
  • 레드티밍 데이터 기반 모델 안전성 평가 실습
  • 포트폴리오용 데이터 분석·시각화

개인 개발자는 1조 토큰 전체를 내려받아 처음부터 모델을 학습하는 방식보다 목적에 맞는 데이터셋 하나를 선택해 샘플 구조와 라이선스를 확인한 후 소규모 실험을 시작하는 것이 현실적입니다.

7. 무료 데이터의 저작권·상업적 이용 주의사항

AI허브의 ‘무료 개방’은 이용료 없이 신청해 활용할 수 있다는 뜻입니다. 데이터를 아무 조건 없이 복제·판매·재배포할 수 있다는 의미는 아닙니다.

무료 다운로드와 자유로운 재배포는 다릅니다.
AI허브 이용정책은 AI 제품·서비스를 위한 영리·비영리 연구개발 활용을 허용하지만, 데이터셋 자체의 판매와 제3자 제공·양도·대여, 국외 반출에는 제한 또는 별도 협의가 적용됩니다.
  • 데이터 활용 시 한국지능정보사회진흥원 사업 결과임을 표시해야 합니다.
  • 승인 없이 다른 개인·법인·단체에 데이터를 제공할 수 없습니다.
  • 다운로드한 데이터셋 자체를 판매하거나 재배포해서는 안 됩니다.
  • 데이터 판매 등 별도 상업적 이용은 수행기관과 협의해야 합니다.
  • 국외 법인·단체·개인이 이용하거나 데이터를 국외로 반출하려면 별도 합의가 필요합니다.
  • 비식별 정보를 이용해 특정 개인을 재식별해서는 안 됩니다.
  • 개인정보가 발견되면 즉시 AI허브에 신고하고 해당 데이터를 삭제해야 합니다.

일반적인 AI허브 이용정책과 별도로 개별 데이터 페이지에 추가 이용조건이 표시될 수 있습니다. 모델 학습이나 상용서비스 개발 전에 데이터 소개, 라이선스, 출처표시, 결과물 공개와 국외 클라우드 업로드 허용 여부를 각각 확인해야 합니다.

8. 모델 학습 전 데이터 품질검증 체크리스트

NIA와 한국정보통신기술협회는 공개 전에 데이터 품질, 개인정보, 유해성과 라이선스 제약 여부를 검증했습니다. 그러나 특정 모델이나 서비스에 바로 적합하다는 의미는 아니므로 이용자도 목적별 검증을 수행해야 합니다.

  1. 데이터 구조 확인: JSON·JSONL·CSV·영상·음성 파일과 라벨 형식을 확인합니다.
  2. 중복 검사: 동일하거나 유사한 문장·영상·질의응답 비율을 점검합니다.
  3. 오염 검사: 평가용 데이터나 정답이 학습 데이터에 포함됐는지 확인합니다.
  4. 개인정보 검사: 이름·전화번호·주소·음성 식별정보가 남아 있는지 점검합니다.
  5. 유해성 검사: 혐오·차별·폭력·불법행위 데이터의 비중과 사용 목적을 확인합니다.
  6. 라벨 품질 확인: 캡션·분류·추론 과정·객체 라벨의 일관성을 표본 검수합니다.
  7. 도메인 적합성 확인: 개발할 서비스의 사용자·업무·언어와 데이터가 일치하는지 확인합니다.
  8. 라이선스 기록: 데이터명, 버전, 다운로드일, 이용조건과 출처표시 문구를 기록합니다.
  9. 학습 전 분리: 훈련·검증·테스트 세트가 서로 중복되지 않도록 분리합니다.

네이버클라우드·업스테이지·SK텔레콤·NC AI는 품질검증 등을 거친 구축 데이터를 전체 개방하기로 했습니다. LG AI연구원은 사업상 의무개방량인 50% 이상을 준수해 공개 대상을 통계적으로 선별했습니다. 따라서 29종이 각 팀이 보유한 모든 원천데이터를 의미하는 것은 아닙니다.

결론: 데이터 규모보다 목적과 이용조건을 먼저 확인해야 한다

독파모 학습데이터 개방은 국내 기업과 연구자가 대규모 한국어·멀티모달·추론·안전성 데이터를 직접 검토할 수 있다는 점에서 의미가 큽니다. 특히 사전학습 데이터뿐 아니라 AI 에이전트, 전문도메인 추론, 한국형 레드티밍과 피지컬 AI 데이터가 함께 공개됐다는 점이 특징입니다.

다만 29종·3,544만 건을 모두 내려받는 것이 최선은 아닙니다. 개발하려는 모델과 서비스의 목적을 먼저 정하고, 샘플과 메타데이터를 확인한 뒤 필요한 데이터만 신청해야 합니다. 이후 라이선스·개인정보·중복·품질을 다시 검증해야 실제 학습 비용과 법적 위험을 줄일 수 있습니다.

자주 묻는 질문

Q1. 독파모 AI 학습데이터는 누구나 무료로 받을 수 있나요?

국내 기업과 연구자, 학생 등 대한민국 국민은 AI허브에서 무료로 신청할 수 있습니다. 다만 회원가입, 본인 확인, 이용 목적 제출과 데이터별 승인 절차가 필요할 수 있습니다.

Q2. 스마트폰에서도 데이터를 다운로드할 수 있나요?

AI허브는 독자 AI모델 데이터 다운로드가 PC에서만 가능하다고 안내합니다. 데이터 용량이 큰 경우 전용 다운로드 또는 셸 다운로드 환경도 필요할 수 있습니다.

Q3. 1.56조 토큰이면 70~80B 모델을 바로 만들 수 있나요?

아닙니다. 이론적으로 해당 규모의 대형 모델 학습에 사용할 수 있다는 설명입니다. 실제 개발에는 GPU, 데이터 정제, 혼합 비율, 토크나이저, 학습 알고리즘과 평가 체계가 추가로 필요합니다.

Q4. 독파모 모델 가중치도 함께 공개됐나요?

이번 발표의 핵심은 정예팀이 구축한 AI 학습용 데이터 29종의 공개입니다. 모델 가중치 공개와는 별개의 사안입니다.

Q5. 무료 데이터를 상업용 AI 서비스에 사용할 수 있나요?

AI허브 일반 이용정책은 영리·비영리 연구개발 목적의 활용을 규정하고 있습니다. 다만 데이터셋 자체의 판매·재배포, 제3자 제공과 국외 반출은 제한되며 개별 데이터의 추가 이용조건이 우선합니다.

Q6. 모든 데이터를 일반 다운로드로 받을 수 있나요?

아닙니다. 대부분은 승인 후 다운로드할 수 있지만 일부 안전성·권리 보호 데이터는 온라인 안심존에서만 이용하도록 신청 절차가 적용될 수 있습니다.

Q7. 독파모 5개 팀이 구축한 모든 데이터가 공개된 것인가요?

아닙니다. 사업 공고상 구축·가공 예산으로 확보한 데이터의 50% 이상을 개방하는 조건이 적용됐습니다. 네이버클라우드·업스테이지·SK텔레콤·NC AI는 검증된 구축 데이터를 전체 개방하기로 했고, LG AI연구원은 50% 이상을 통계적으로 선별해 공개했습니다.

함께 보면 좋은 글

공식 자료 및 확인처

자료 발표일: 2026년 8월 27일 · 내용 확인일: 2026년 8월 28일

이 블로그의 인기 게시물

갤럭시 S26 AI 기능 실제 활용법|써보면 유용한 기능과 굳이 안 써도 되는 기능

윈도우 10 서비스 종료, 내 컴퓨터는 어떻게 될까요?

DISM/SFC 명령어 완전 정리 (초보자용) — Windows 손상·업데이트 오류 복구 가이드