비디오 생성 인공지능의 발전 속에 현실의 물리 법칙을 이해하는 월드 모델 연구가 주목받고 있다. 최근 장시간 상호작용 비디오 월드 모델 구축을 위한 개방형 프레임워크인 SolarWM이 전체 개발 과정과 함께 오픈소스로 공개되었다. 데이터 수집부터 사전학습 모델까지 모두 공개되어 개발자의 실무 활용 가치가 높다.

개방형 비디오 월드 모델 SolarWM 공개

장시간 상호작용 비디오 월드 모델을 구축하기 위한 개방형 프레임워크인 SolarWM이 소스코드와 함께 오픈소스로 공개되었다. 이번 공개는 데이터 수집, 정제, 라벨링부터 학습 및 추론 코드, 그리고 사전학습 모델에 이르는 전체 개발 사이클을 완벽하게 포괄한다. 덕분에 개발자들은 독자적인 환경에서도 검증된 프레임워크를 기반으로 월드 모델 학습을 즉시 테스트해 볼 수 있다.

이 프레임워크는 짧은 학습 영상만으로도 실시간으로 분 단위에서 시간 단위에 이르는 장시간 롤아웃을 가능하게 하는 기술적 완성도를 자랑한다. 단 몇 초의 짧은 제한 조건하에서도 장시간 일관성 있는 상호작용 영상을 정밀하게 시뮬레이션할 수 있어 자율주행이나 로봇 제어 등 물리적 예측이 요구되는 다양한 실무 도메인에 유용하게 접목될 수 있다.

대규모 데이터셋과 학습 규모

SolarWM의 뛰어난 성능은 방대한 규모의 물리 데이터셋에서 기인한다. 본 프레임워크는 약 25TB에 달하는 데이터 큐레이션을 지원하며, 다양한 소스로부터 확보한 143만 개의 영상 클립을 프레임 단위로 조율하여 균일하고 명확한 데이터 관측 계약을 제공한다. 이 강력한 파이프라인 덕분에 여러 도메인 데이터를 일관성 있게 병합 학습하는 일이 가능하다.

다만 원천 데이터셋의 구성에 대해서는 출처에 따른 정보 차이가 발견된다. 어떤 기록에는 10개의 데이터셋이 가공된 것으로 설명된 반면, 공식 프로젝트 페이지 등에서는 14개의 데이터셋에서 추출되었다고 안내하고 있어 다소 엇갈리는 수치를 보인다. 그럼에도 불구하고 다양한 구조의 백본을 유연하게 결합하여 대규모 데이터를 수월하게 학습시키는 완성도에는 변함이 없다.

SolarWM은 143만 개의 영상 클립과 25TB 규모의 물리 데이터를 통합하여 학습에 활용한다.

모델 구조와 단기 학습의 장기 롤아웃

SolarWM 아키텍처는 효율적인 연산 성능과 폭넓은 활용을 지원하기 위해 다양한 매개변수를 지원한다. 이 프레임워크는 네이티브 표현을 그대로 유지한 채 50억(5B)에서 330억(33B) 매개변수 범위를 아우르는 모델들을 선택적으로 인스턴스화할 수 있도록 지원한다.

매우 뛰어난 효율성을 바탕으로 설계된 이 인과 모델은 불과 5초 길이의 아주 짧은 학습 영상 시퀀스만으로도 장시간의 관계성을 확보해 낸다. 이렇게 학습을 완료한 모델은 분 단위에서 길게는 시간 단위에 이르기까지 무리 없이 실시간으로 상호작용하는 롤아웃을 완벽하게 구현하며, 연산 부담은 획기적으로 낮췄다.

SolarWM은 50억에서 330억 매개변수 범위를 지원하며 5초 분량의 학습만으로 수 시간의 상호작용을 구현한다.

개발자를 위한 활용 시사점

SolarWM 프레임워크의 등장은 장시간 비디오 생성과 월드 모델 실무 연구를 진행하는 개발자들에게 고무적인 소식이다. 전체 개발 소스코드와 사전학습된 가중치 모델이 오픈소스로 전면 제공되므로, 실무 개발자는 자신의 커스텀 개발 데이터에 맞춰 즉시 테스트 환경을 빌드할 수 있다.

여기에 유연한 모델 백본 설계 덕분에 기존에 운용 중인 다양한 비디오 생성 아키텍처 파이프라인과의 통합이 용이하다. 활발한 커뮤니티 협업을 통한 데이터셋의 추가적인 확장과 빠른 성능 개선 작업 역시 강력하게 기대되는 지점이다. 개발자들은 이 개방형 프레임워크를 기반으로 더욱 고도화된 상호작용 시뮬레이션 모델을 구현해 볼 수 있다.


참고