← Insights 목록
AI2026.09.24

다음 2초의 행동을 예측하는 오픈 모델

#world-models#robotics#open-weights

블랙포레스트랩스가 허깅페이스에 FLUX 3 Action을 공개했다. 카메라 프레임과 텍스트 지시문을 입력받아 다음 약 2초에 해당하는 32개의 행동을 예측하는 70억 파라미터 디퓨전 트랜스포머로, 이미지 생성 모델로 알려진 팀이 이번에는 "행동"을 출력하는 쪽으로 넘어왔다. 로봇 데이터셋 DROID로 파인튜닝한 버전이 RoboLab 벤치마크에서 1위를 기록했다.

"DROID로 파인튜닝한 결과 RoboLab 벤치마크에서 42.92% 성공률로 1위에 올랐으며, 160억 파라미터 Cosmos 3 Nano 정책의 36.8%를 앞섰다."Black Forest Labs / Hugging Face

왜 중요한가

파라미터가 절반도 안 되는 모델이 더 큰 모델을 앞섰다는 숫자보다 중요한 건 배포 방식이다. 영상 VAE와 Qwen3-VL-4B 텍스트 인코더를 동결한 채 행동 예측부만 학습하는 구조여서, 로봇 팔 집기·놓기 과제는 원격 조작 시연 약 200회로 붙었다고 한다. 여기에 LeRobot 프레임워크 연동과 공개 가중치가 더해지면, 그동안 대형 연구소 안에만 있던 액션 모델이 소규모 팀의 실험 대상이 된다. 같은 모델이 로봇 팔뿐 아니라 게임 에이전트와 드론 조작까지 옮겨 붙었다는 점도 눈여겨볼 만하다.

실무 적용

웹·앱 제작과는 거리가 있어 보이지만, 시사점은 인터페이스 쪽에 있다. 화면을 보고 다음 조작을 예측하는 모델이 값싸게 파인튜닝되기 시작하면, "사람이 보고 누르는 화면"과 "모델이 보고 조작하는 화면"의 요구사항이 갈린다. 후자에서는 상태가 시각적으로 명확히 드러나는지, 되돌리기가 가능한지가 정확도를 좌우한다. 도입을 검토한다면 라이선스를 먼저 읽어야 한다. 아파치 같은 완전 개방 라이선스가 아니라 FLUX Kommunity License v1.0이 적용되므로 상업적 사용 조건을 확인해야 한다.

교차 참고

  • Google: Introducing Gemini Robotics ER 2 — 작업 진행도를 스스로 판단해 실패한 단계만 다시 시도하게 하는 진행 분류 정확도를 57.4%로 끌어올린 모델 발표다.
  • Google: Project Genie — 탐색하는 대로 환경을 실시간 생성하는 월드 모델 프로토타입으로, 미국 AI Ultra 구독자에게 제한 공개됐다.

Wemeet의 관점

Wemeet은 이 발표를 "월드 모델 경쟁의 무게중심이 시연에서 파인튜닝으로 이동한 신호"로 읽는다. 더 큰 모델을 발표하는 것보다, 200번의 시연으로 우리 과제에 붙일 수 있느냐가 실제 도입을 결정하기 때문이다. 이미지 생성에서 이미 봤던 흐름이기도 하다. 성능 1위 모델보다 파인튜닝 생태계를 가진 모델이 오래 남았다.

이 글은 아래 원문을 바탕으로 Wemeet이 한국어로 요약·정리한 큐레이션입니다.

원문 보기 — Hugging Face ↗