누가 언제 말했는지, 1억 파라미터로
엔비디아가 허깅페이스에 Nemotron 3 Diarization을 공개했다. 대화 음성에서 "누가 언제 말했는지"만 전담하는 9920만 파라미터 공개 가중치 모델로, 16kHz 단일 채널 오디오를 받아 화자별 발화 확률로 변환한다. VoiceArena의 Diarization-Bench에서 화자 분리 오류율(DER) 14.72%로 1위에 올랐고, 1.04초 지연 조건에서 기존 기준선 대비 평균 40%의 상대 DER 감소를 보고했다.
"실시간과 녹음 대화 모두에서 최대 8명의 화자를 지원한다."NVIDIA / Hugging Face
왜 중요한가
음성 인식은 이미 충분히 정확해졌지만, 회의록·상담 녹취·인터뷰처럼 사람이 여러 명인 상황에서는 문장을 맞게 받아써도 화자가 섞이면 쓸 수 없는 기록이 된다. 이 모델이 겨냥한 지점이 정확히 거기다. 30.4초 오프라인부터 0.32초 초저지연까지 네 가지 지연-품질 구성을 골라 쓰게 해, 사후 정리용과 실시간 자막용을 같은 모델로 처리한다. 오프라인 구성에서는 배치 32 기준 실시간 대비 1만 5113배 속도(RTFx)를 낸다고 한다. 화자 수가 많아질수록 개선폭이 커졌다는 점도 실제 회의 환경에 유리한 특성이다.
실무 적용
제작 실무에서는 ASR 모델과 묶어 "화자가 지정된 전사"를 만드는 구성이 가장 현실적이다. 1억 파라미터급이라 자체 서버나 사내 환경에서 돌릴 여지가 크고, 그만큼 녹취 파일을 외부 API로 보내지 않아도 된다는 점이 상담·의료·법률 같은 영역에서 의미가 있다. 다만 라이선스가 아파치가 아니라 OpenMDW 1.1이므로 상업 적용 전에 조건을 확인해야 하고, 8명 상한과 겹쳐 말하기 처리 수준은 자체 샘플로 검증하는 편이 안전하다.
교차 참고
- Hugging Face: Basis Conversations 1500 — 22개 언어 2645명이 참여한 2~4인 동시 발화 대화 음성 1500시간을 상업 이용까지 허용해 공개한 데이터셋이다.
- Hugging Face: Open Yap 1K — 끼어들기와 겹침, 맞장구를 그대로 남긴 48kHz 듀얼 채널 영어 대화 1000시간으로, 낯선 사람이 아닌 친구·가족 조합을 녹음했다.
Wemeet의 관점
Wemeet은 이 발표를 "음성 AI의 병목이 인식에서 구조화로 옮겨간 신호"로 본다. 텍스트를 잘 받아쓰는 것보다 그 텍스트에 누가·언제·어떤 순서로라는 구조를 붙이는 일이 실제 업무 가치를 만든다. 대화 데이터셋들이 같은 시기에 겹침과 턴테이킹을 보존한 형태로 공개되는 흐름도 같은 방향을 가리킨다.
이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.
원문 보기 — Hugging Face ↗