← Insights 목록
AI2026.09.29

110만 시간 오픈 음성 데이터셋 YODAS v3 공개

#Speech AI#Open Dataset#Multilingual

ESPnet 팀이 음성 데이터셋 YODAS의 세 번째 버전을 허깅페이스에 공개했다. 규모는 110만 시간으로 1세대(약 37만 시간)의 세 배이며, 100개가 넘는 언어를 담고 그중 34개 언어는 1,000시간 이상을 확보했다. 라이선스는 CC BY 3.0, OPUS 포맷 기준 용량은 60TB다. 전량이 48kHz로 배포되고 92%가 실효 32kHz 이상이며, 70%는 복수 채널을 포함한다.

"오늘날 AI 연구에서 진짜 왕을 만드는 것은 학습 데이터다."Hugging Face, YODAS v3

왜 중요한가

기존 공개 음성 데이터는 인식(ASR) 용도에 맞춰 16kHz로 다운샘플된 경우가 많아, 음성 합성이나 오디오 향상·코덱 학습에는 쓰기 어려웠다. YODAS v3가 48kHz 원본 품질과 다채널 데이터를 유지한 것은 하나의 데이터셋으로 인식·합성·향상·공간 음향까지 다룰 수 있다는 뜻이다. 공개 자료만으로 Whisper급(68만 시간 이상) 모델을 처음부터 학습할 수 있는 규모라는 점도 의미가 크다.

실무 적용

전체를 내려받을 필요는 없다. 대상 언어와 채널 조건으로 서브셋을 먼저 추려 수십 GB 단위로 시작하는 편이 현실적이다. 단어·발화 단위 타임스탬프가 포함되어 있어 자막 정렬이나 구간 검색 기능을 붙이기 쉽고, CC BY 3.0이므로 상업 활용 시 출처 표기 의무를 배포물에 반영해야 한다. 한국어처럼 상대적으로 데이터가 적은 언어는 확보 시간부터 확인한 뒤 계획을 세우는 것이 안전하다.

교차 참고

Wemeet의 관점

Wemeet은 음성 기능을 검토할 때 모델 성능보다 데이터의 언어 분포를 먼저 본다. 영어 벤치마크 수치가 좋아도 한국어 실사용에서 무너지는 사례를 반복해 봤기 때문이다. 이런 대형 공개 데이터셋의 실질적 가치는 '직접 학습'보다 '평가셋 확보'에 있다. 도입 전 우리 서비스 환경과 닮은 구간을 뽑아 비교 테스트를 돌리는 것이 훨씬 빠른 의사결정 경로다.

이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.

원문 보기 — Hugging Face ↗