100억 벡터, AI 검색의 기준이 바뀐다
Qdrant 팀이 Hugging Face에 공개한 Qdrant-FineWeb-10B는 지금까지 나온 오픈소스 벡터 검색 벤치마크 중 가장 큽니다 — 밀집(dense) 벡터 100.7억 개와 희소(sparse) 벡터 100.7억 개, 벡터만 24.47TB, 원문·메타데이터까지 더하면 28.66TB 규모입니다. 임베딩은 다국어 모델 gte-multilingual-base로 만들었고, 10만 개 질의에 대해 무차별 대입으로 계산한 상위 1000개 정답까지 함께 담았습니다. 이 정답을 만드는 데만 1000조 회가 넘는 거리 계산이 들어갔습니다.
"우리는 벡터 검색 커뮤니티에 10억 벡터 규모에서 정확한 최근접 이웃 정답을 계산하고 데이터베이스를 평가할 수 있는 고성능 오픈소스 프레임워크가 없다는 사실을 깨달았다."Qdrant, Hugging Face Blog
왜 중요한가
그동안 벡터 검색 벤치마크는 1000만~1억 벡터에서 멈췄고, 상당수는 ‘정답’ 자체가 없어 정확도를 제대로 잴 수 없었습니다. 실제 서비스는 이미 그 100배 규모에서 돌아가는데 평가 기준만 소꿉놀이에 머물러 있었던 셈입니다. 이번 공개에는 재현 가능한 벤치마킹 프레임워크 Supernova와 PubMed-Multi-Vector(2390만 벡터), Coyo-VE(1540만 벡터) 같은 동반 데이터셋도 함께 붙었습니다.
실무 적용
RAG를 붙인 서비스를 운영한다면 ‘우리 데이터가 10배로 늘어도 이 검색 품질이 유지되는가’를 이제는 공개 기준으로 확인할 수 있습니다. 특히 밀집·희소 벡터를 같은 데이터셋에서 비교할 수 있다는 점이 중요합니다 — 한국어처럼 고유명사·전문용어가 많은 도메인에서는 희소 검색을 섞는 하이브리드가 체감 정확도를 크게 끌어올리는 경우가 잦기 때문입니다. 벤더 자료의 recall 수치를 그대로 믿기보다, 이런 공개 정답셋으로 직접 재보는 편이 안전합니다.
교차 참고
- Hugging Face: KV Caching Explained — 검색 다음 단계인 생성 비용을 줄이는 기본기로, T4 GPU 실험에서 1분 1초가 11.7초로 약 5.2배 빨라지는 대신 메모리를 더 쓰는 교환 관계를 보여 줍니다.
- Hugging Face: VLM Run Gateway — 오픈 웨이트 OCR·비전 모델을 하나의 API 뒤에서 바꿔 가며 비교할 수 있게 한 서비스로, ‘모델을 갈아 끼우며 검증한다’는 같은 흐름 위에 있습니다.
Wemeet의 관점
Wemeet은 AI 기능을 붙일 때 모델보다 검색 품질이 체감 성능을 좌우한다고 봅니다 — 엉뚱한 문서를 꺼내 오면 아무리 좋은 모델도 그럴듯한 오답을 만들 뿐입니다. 규모가 커질수록 ‘무엇을 얼마나 정확히 찾아오는가’를 숫자로 관리하는 팀과 감으로 관리하는 팀의 격차가 벌어질 것입니다.
이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.
원문 보기 — Hugging Face Blog (Qdrant) ↗