LightOnOCR-3, 문서 OCR과 레이아웃을 한 모델로
LightOn이 문서 OCR과 레이아웃 추출, 시각 요소 그라운딩을 하나의 모델로 처리하는 LightOnOCR-3 계열을 Hugging Face 블로그로 공개했다. 0.8B, 1B, 4B 세 가지 크기이며 0.8B와 4B는 Qwen3.5 비전-언어 구조를 기반으로 한다. 라이선스는 연구와 상업 이용이 모두 가능한 Apache 2.0이다.
"LightOnOCR-3 models offer a ready-to-use, easier-to-maintain alternative to complex document understanding pipelines."LightOn, Hugging Face Blog
왜 중요한가
발표된 수치로는 4B 모델이 olmOCR-Bench에서 86.3점으로, 35.1B 규모의 Infinity Parser Pro에 1.3점 차로 뒤질 뿐이다. ParseBench에서는 4B와 0.8B가 각각 75.1, 74.6으로 1·2위를 차지했다. 바운딩 박스, 이미지 설명, 차트 데이터까지 내놓으면서도 경쟁 모델보다 출력 토큰이 9~14% 적고 같은 구조의 Chandra-OCR-2보다 단일 페이지 처리가 19% 빠르다고 한다. 이는 저자 측 벤치마크이므로 실제 문서로 재검증이 필요하다.
실무 적용
검출, 인식, 표 복원을 따로 이어 붙이던 문서 파이프라인을 모델 하나로 줄일 수 있어 유지보수 부담이 줄어든다. 0.8B는 자체 서버나 엣지에서도 돌려볼 만한 크기다. 계약서·영수증·보고서 같은 한국어 문서에 쓰려면 먼저 소규모 샘플로 정확도를 측정하는 것이 안전하다.
교차 참고
- Hugging Face: Falcon OCR Arabic — 270M 파라미터의 아랍어 특화 OCR이 12,000건 가까운 실문서 벤치마크에서 81.9% 텍스트 정확도를 기록
Wemeet의 관점
Wemeet은 OCR 같은 기반 기술이 작고 열린 모델로 내려오는 흐름을 반긴다. 이제 경쟁력은 모델 자체보다 문서 종류별 검증 절차와 후처리 설계에서 갈린다고 본다. 도입 전에 우리 데이터로 직접 재보는 습관이 가장 싼 보험이다.
이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.
원문 보기 — Hugging Face Blog ↗