← Insights 목록
Allen AI, 조 단위 MoE 학습 프레임워크 Olmo-core 3 공개
Allen AI가 대규모 MoE(전문가 혼합) 언어 모델을 조 단위 파라미터까지 효율적으로 학습시키는 오픈소스 프레임워크 Olmo-core 3를 공개했다. 병렬화 방식을 FSDP에서 DDP 중심으로 바꾸고 전문가·파이프라인 병렬화, 옵티마이저 분산을 더해 처리량을 끌어올렸다.
"MoE 모델은 입력마다 모든 파라미터를 쓰지 않으면서도 훨씬 많은 학습 요소를 담을 수 있는 더 효율적인 접근이다."Allen AI, Introducing Olmo-core 3
왜 중요한가
B300 GPU 기준 GPU당 초당 약 1만 9천 토큰이던 처리량이 약 5만 2천 토큰으로 2.7배 올랐고, 512개 GPU로 총 1.2조 파라미터(토큰당 활성 약 584억) 모델까지 확장했다고 한다. 저정밀도 MXFP8 형식은 BF16 대비 학습 처리량을 약 21% 높이고 메모리를 8GiB 줄였다. 대형 모델 학습의 병목이 모델 구조보다 인프라 최적화에 있다는 점을 수치로 보여 준다.
실무 적용
직접 조 단위 모델을 학습할 일은 드물지만, 오픈 가중치 모델이 빠르게 커지는 이유와 추론 비용 구조를 이해하는 데 도움이 된다. MoE는 활성 파라미터가 적어 서빙 비용이 낮아지는 만큼, 자체 호스팅이나 파인튜닝을 검토할 때 "총 파라미터"보다 "활성 파라미터"를 기준으로 비교하는 습관이 필요하다.
교차 참고
- Hugging Face: New in llama.cpp: Decision Models — 로컬 추론 쪽에서 나온 새 모델 활용 방식을 소개한 글.
- NN/g: The 3 Roles of Context for AI Agents — 모델 규모와 별개로 에이전트 품질을 좌우하는 컨텍스트 설계 관점.
Wemeet의 관점
학습 인프라 경쟁은 결국 오픈 모델의 선택지를 넓혀 고객사가 쓸 수 있는 AI의 단가를 낮춘다. Wemeet은 모델이 커질수록 "어떤 모델을 쓰느냐"보다 "어떤 업무에 어떤 비용으로 붙이느냐"가 더 중요해진다고 본다. 서비스 기획 단계에서 모델 선택을 열어 두는 구조가 유리하다.
이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.
원문 보기 — Hugging Face ↗