로봇 정책, 왜 '설명'이 아니라 '예측'이 필요할까

로봇 매니퓰레이션의 오랜 난제는 학습 분포 밖 일반화예요. 학습 씬에서 성공하던 정책이 물체 모양·위치·조명만 바뀌어도 무너지는 경우, 정말 많습니다. 이유는 단순해요. 정책이 과제 이면의 물리 법칙을 이해한 게 아니라, 데모를 흉내낸 것뿐이기 때문이죠.

기존 표준은 이렇습니다. 사전학습된 VLM(Vision-Language Model)에 액션 모듈을 붙여 VLA(Vision-Language-Action)를 만드는 방식이에요. 이 접근은 범용 매니퓰레이션을 꽤 멀리까지 끌어왔습니다. 그런데 여기엔 구조적 한계가 있어요. VLM 백본은 세상을 '설명'하도록 학습됐지, 세상이 '어떻게 변할지'를 예측하도록 학습된 게 아니에요.

컵을 그리퍼로 집었을 때 컵이 어떻게 들리는지, 수건이 어떻게 접히는지, 놓친 물체가 어디로 떨어지는지—이런 동역학(dynamics)은 VLM에 없어요. 그래서 VLA는 의미론적 일반화는 잘 하지만, 물리적 일반화는 약합니다. 이 지점에서 등장한 게 **World Action Model(WAM)**이에요.

근거자료: NVIDIA Developer Blog - Beyond VLAs: How World Action Models Reshape Robot Manipulation

이 글에서는 WAM이 무엇이고, VLA와 어떻게 다르며, NVIDIA의 오픈 월드 모델 Cosmos 3가 왜 WAM의 강력한 출발점인지 실무 관점에서 정리해볼게요.

Robotic arm performing manipulation task illustrating world action model policy in action Developer Related Image

WAM이 바꾸는 것: '행동 학습'에서 '세계 진화 학습'으로

WAM의 핵심은 한 줄로 요약돼요. 언어 백본을 비디오 월드 모델로 교체한다. 백본 자체가 세상이 어떻게 진화하는지를 모델링하기 때문에, post-training 단계에서 물리를 처음부터 가르칠 필요가 없어요. 이미 물리 prior가 심어진 모델을 **특화(specialize)**시키는 거죠.

NVIDIA 연구 논문 World Action Models are Zero-shot Policies는 비디오와 액션을 **동시에 예측(joint prediction)**하는 것이 VLA가 쉽게 얻지 못하는 세 가지 성질을 만든다고 보여줍니다.

1) 다양한 데이터에서 학습한다

VLA는 명령→궤적 매핑을 배우기 때문에, 사실상 거의 동일한 데모가 반복적으로 필요해요. 반면 WAM은 물리(밀면 어떻게 움직이는지, 집으면 어떻게 들리는지, 놓으면 어디로 떨어지는지)를 배웁니다. 즉 모든 상호작용 데이터가 학습 신호가 돼요. VLA에서는 버려졌을 잡다한 데이터가 WAM에서는 자산이 되고, 결과적으로 데이터 수집 비용이 내려갑니다.

2) 오픈 월드에서 일반화한다

물리는 의미론보다 일반적이에요. 물체가 떨어지거나 미끄러지는 방식은 물체가 바뀌어도 그대로죠. 그래서 동역학을 학습한 모델은 한 번도 학습하지 않은 씬과 모션으로 그 지식을 그대로 가져갑니다.

3) 적은 데모로 새 로봇에 적응한다

물리 상호작용을 이미 아는 모델은 새로운 팔(arm)이나 그리퍼에 특화될 때 훨씬 적은 과제 데이터만 필요해요.

Cosmos 3: WAM의 강력한 출발점

Cosmos 3는 Mixture-of-Transformers(MoT) 아키텍처 기반의 옴니모달 월드 파운데이션 모델입니다.

[멀티모달 입력]
      │
      ▼
[Autoregressive Transformer] ── 텍스트/이산 토큰 추론
      │
      ▼ (가이드)
[Diffusion Transformer] ── 이미지·비디오·오디오·액션을 반복 디노이징으로 생성
  • 텍스트는 next-token 디코딩, 나머지(이미지/비디오/오디오/액션)는 iterative denoising으로 합성됩니다.
  • 사이즈는 세 가지: Cosmos Edge(4B), Cosmos Nano(16B), Cosmos 3 Super(64B).
  • 학습 데이터 규모: 약 7.67억 이미지, 3.48억 개 실세계 동역학 비디오, 800만 액션 샘플(로봇 매니퓰레이션·자율주행·카메라 모션·에고센트릭 모션 포함).

Cosmos3-Nano-Policy-DROID: 월드 모델 → 로봇 정책

DROID 플랫폼(Franka Panda + Robotiq gripper)을 위한 16B 정책 체크포인트입니다. 언어 지시와 멀티카메라 관측을 받아 로봇 액션 궤적을 생성해요. 4B 버전(Cosmos3-Edge-Policy-DROID)은 온디바이스 배포용입니다.

옴니 파운데이션에서 파생된 세 가지 성질이 특히 실무적이에요.

  • 행동하면서 상상한다(imagines while it acts). 액션을 출력할 때, 그 액션을 실행했을 때 로봇 카메라가 볼 미래 비디오까지 같은 모델에서 동시에 생성됩니다.
  • 옴니 아키텍처를 그대로 유지한다. post-training이 아무것도 제거하지 않아요. 정책 체크포인트가 관절 위치만 뱉는 게 아니라 여전히 추론하고 비디오를 생성합니다.
  • prior가 측정 가능하다. 동일 레시피·데이터·컴퓨트로 학습한 DROID 정책 두 개를 비교했을 때, 베이스 체크포인트 출발은 RoboLab 성공률 28.1%, 멀티도메인 액션 데이터로 학습된 옴니 체크포인트 출발은 36.8%. 스케일이 아니라 아키텍처에서 오는 개선이라는 명확한 증거예요.

AI diffusion transformer architecture diagram visualizing Cosmos 3 multimodal world model Software Concept Art

배포 관점: WAM은 어디에 올리는가

WAM은 액션 헤드만이 아니라 생성형 월드 모델 전체를 짊어집니다. 컴팩트 VLA보다 크지만, Cosmos 3는 하나의 트레이드오프로 몰아넣지 않고 배포 티어를 나눠 제공합니다.

티어모델하드웨어특징
워크스테이션 서빙Cosmos3-Nano-Policy (16B)단일 NVIDIA RTX PRO 6000로봇 옆에서 서빙, 네트워크로 관측 스트리밍·액션 청크 수신
온디바이스Cosmos3-Edge-Policy-DROID (4B)NVIDIA Jetson Thor640×360 관측, 추론당 32개 액션, 15Hz 실시간 제어
엣지 확장Edge (4B)RTX PRO GPU, DGX, GeForce RTX, Jetson(T2000/T3000 포함)동일 정책 워크로드 임베디드 실행

이 기술의 한계와 주의사항

  • 모델 크기 부담: 16B/64B 급은 로봇 온보드에 바로 못 올립니다. 결국 서빙 인프라(네트워크 지연 포함)가 성능의 일부가 돼요.
  • 엠보디먼트별 post-training 필수: Franka, 듀얼암, UR, WidowX 등 각 로봇마다 별도 post-training 런이 필요합니다. 같은 파운데이션에서 출발한다는 게 전부는 아니에요.
  • 평가 지표의 편향: RoboLab 성공률은 특정 벤치마크입니다. 실제 공장/물류 환경의 long-horizon 과제 성능이 그대로 36.8%로 나온다고 기대하면 안 돼요.
  • 비디오 생성 오버헤드: '행동하면서 상상한다'는 건 매 추론마다 비디오 디노이징 비용이 붙을 수 있다는 뜻입니다. 실시간 제어 루프에서는 액션 헤드만 뽑는 모드가 필요할 수 있어요.

한국 개발 생태계에서의 적용 맥락

국내 SI·제조 자동화 환경에서는 폐쇄망 온프레미스 서빙이 기본값인 경우가 많아요. Cosmos3-Nano-Policy를 RTX PRO 6000에 올려 로봇과 같은 네트워크에 두는 구성이 현실적입니다. 반대로 물류·서비스 로봇처럼 모바일 엠보디먼트라면 Jetson Thor 기반 4B Edge 정책이 사실상 유일한 선택지죠. 다만 국내는 DROID 같은 대규모 오픈 데이터셋이 부족해서, 자체 데이터를 LeRobotDataset 포맷으로 정규화하는 데이터 파이프라인 구축이 도입 속도를 좌우합니다.

다음 단계 학습 방향

  1. Cosmos 3 오픈 컬렉션을 Hugging Face/GitHub에서 받아 자체 데이터로 post-training 한 번 돌려보기.
  2. LeRobotDataset 포맷에 익숙해지기—로봇 학습 생태계의 사실상 표준입니다.
  3. VLA와 WAM을 동일 과제·동일 데이터로 A/B 비교해서, 어떤 태스크에서 WAM의 물리 prior가 실제 이득을 주는지 확인.
  4. 비디오 예측 헤드를 붙일지, 액션만 뽑을지 추론 예산 관점에서 설계.

NVIDIA Jetson Thor edge device running real-time robot control inference at 15Hz

정리: '행동을 배우는' 시대에서 '세계를 배우는' 시대로

WAM은 로봇 정책 학습의 패러다임을 행동 모방 → 세계 진화 모델링으로 옮깁니다. Cosmos 3가 이 접근을 실용적으로 만드는 이유는 세 가지예요.

  • 오픈 파운데이션 + SOTA 출발점: 베이스 모델, 데이터셋, post-training 레시피, 학습된 가중치, 평가 도구, 서빙 스택이 상업적 이용 가능 라이선스로 공개됩니다.
  • 빠른 적응: 강한 물리 prior 덕분에 새 정책에 필요한 과제 데이터가 줄어요. 자체 데이터를 LeRobotDataset으로 변환하고 공개 레시피를 돌리면 됩니다.
  • 하나의 파운데이션, 여러 로봇: Franka, 듀얼암, UR, WidowX는 각자 post-training이 필요하지만, 모두 동일한 사전학습 파운데이션에서 출발해 월드 모델을 처음부터 학습할 필요가 없어요.

가장 빠른 검증 방법은 단순합니다. 현재 쓰는 VLA와 Cosmos 3 기반 WAM을 같은 데이터로 post-training 해서 비교하는 것. 이 한 번의 실험이 도입 여부를 결정해줄 거예요.

함께 보면 좋은 글

본 콘텐츠는 신뢰할 수 있는 출처를 바탕으로 AI 도구를 활용하여 초안이 작성되었으며, 편집자의 검토를 거쳐 발행되었습니다. 전문가의 조언을 대체하지 않습니다.