← 모든 독해

LLM이 있는데, 월드모델은 왜 필요할까?

SIMA 2와 Genie 3의 결합에서 출발해 환경 예측의 학습 원리와 로봇 계획·주행 시험의 차이를 살펴본다.

AI가 지시를 알아듣고 다음 행동을 고르는 일과, 그 행동 뒤에 환경이 어떻게 달라질지 예측하는 일은 어떻게 연결될까. 월드모델을 이해하려면 이 두 역할부터 살펴볼 필요가 있다. 최근 연구에서는 언어·시각을 이해하는 에이전트가 생성된 환경 안에서 행동한다. 오래된 게임 실험에서 끝난 이야기가 아니다.

01

지시를 이해하는 에이전트와 환경을 만드는 모델

DeepMind의 SIMA 2는 Gemini를 바탕으로 지시와 화면을 이해하고 행동하는 에이전트다. 연구진은 Genie 3가 만든 환경에서도 이 에이전트가 움직이는 사례를 공개했다. 이때 행동을 고르는 쪽은 SIMA 2이고, 그 행동 뒤에 나타날 환경을 만드는 쪽은 Genie 3다.

이 결합을 보면 월드모델을 LLM과 무관한 옛 기술로 분류하기 어렵다. 언어와 시각을 이해하는 능력에 환경 변화를 예측하는 기능이 연결된다. 역할을 구분해서 설명할 수 있지만 두 종류의 모델이 언제나 분리되어야 한다는 뜻은 아니다.

자료: SIMA 2와 생성 환경의 결합 · deepmind.google · Genie 3의 환경 생성과 적용 범위 · deepmind.google

02

경험에서 다음 상황을 배운다

월드모델은 경험을 통해 환경의 변화 방식을 배워 다음 상황을 예측하는 모델이다. 행동을 조건으로 받는 경우라면 지금 관측한 상태에 어떤 행동을 더했을 때 무엇이 달라질지 계산할 수 있다. 예측을 여러 번 비교하면 실행할 행동을 고르는 데도 쓸 수 있다.

로봇이 물체를 옮기는 경우를 생각해 보자. 행동 전의 관측, 제어 명령, 행동 뒤의 관측을 함께 학습 데이터로 주면 모델은 명령과 결과의 관계를 배운다. 학습 과정에서는 예측과 기록의 차이를 줄인다. 모든 월드모델이 처음부터 행동 명령을 입력받는 것은 아니다. 영상에서 다음 상태를 예측하도록 먼저 배우는 방식도 있다.

사람이 정한 물리 방정식으로 변화를 계산하는 시뮬레이터와 데이터에서 변화 패턴을 배우는 모델은 출발점이 다르다. 두 방식을 결합할 수도 있다. 화면을 사실적으로 만드는 능력만으로는 행동 결과의 정확성까지 확인할 수 없다.

자료: V-JEPA 2의 학습과 로봇 계획 · arxiv.org · 2018년 World Models의 가상 환경 학습 · worldmodels.github.io

03

연습 환경, 로봇의 계획, 주행 시스템의 시험

V-JEPA 2는 영상에서 표현을 학습하고, 행동 조건 모델인 V-JEPA 2-AC는 로봇의 관측과 제어 정보를 이용해 다음 표현을 예측한다. 후보 행동으로 예상한 결과를 목표와 비교해 계획에 활용하는 구조다. 이 연구의 로봇 시연에는 목표 사진과 중간 안내가 제공됐다. 주어진 조건을 빼고 무엇이든 스스로 해내는 로봇으로 소개하면 실제 결과보다 범위가 넓어진다.

Waymo World Model에서는 예측이 다른 자리에 쓰인다. 주행 시스템을 시험할 카메라·라이다 환경을 생성하는 용도다. 과거에 찍은 도로 영상을 실차가 그대로 따라가는 절차가 아니다. 생성 환경에서 경험하는 에이전트, 목표에 맞춰 행동을 고르는 로봇, 주행 시스템을 시험하는 시뮬레이션을 나누어 보면 같은 월드모델이라는 이름 아래 무엇을 하는지 분명해진다.

예측 결과를 어디에 쓰는지에 따른 구분
사례예측의 쓰임함께 볼 조건
SIMA 2 × Genie 3에이전트가 경험할 환경 생성가상 환경의 경험이 현실 전반의 성능을 증명하지 않음
V-JEPA 2-AC후보 행동과 목표를 비교해 계획목표 사진과 중간 안내가 제공된 시연
Waymo World Model주행 시스템용 카메라·라이다 시험 환경실차가 녹화 영상을 따라 운전하는 과정과 구별

자료: SIMA 2와 생성 환경의 결합 · deepmind.google · V-JEPA 2의 학습과 로봇 계획 · arxiv.org · Waymo World Model의 주행 시뮬레이션 · community.waymo.com

04

2018년 게임 사례가 오늘의 한계를 뜻하지는 않는다

2018년 World Models 연구는 게임의 기록으로 배운 가상 환경에서 행동을 학습했다. 일부 조건에서는 예측 모델의 빈틈을 이용하는 행동도 보고됐다. 가상 환경 안에서 좋은 결과를 얻더라도 원래 환경에서 통할지는 따로 평가해야 한다는 문제를 보여준 사례다.

그 뒤의 연구는 다양한 시각 환경, 멀티모달 에이전트와의 결합, 실제 로봇의 행동 계획, 센서 시뮬레이션으로 적용 범위를 넓혔다. 2018년의 실패 하나를 최신 모델 전체의 실패로 옮겨 말할 근거는 없다. 반대로 새 시연이 그럴듯하다는 이유로 모든 환경에서 예측이 정확하다고 결론 낼 수도 없다.

새 월드모델을 볼 때는 예측의 출력과 그 쓰임을 함께 살펴야 한다. 환경 화면을 만드는지, 내부 표현으로 후보 행동을 비교하는지, 시스템의 시험 조건을 생성하는지에 따라 확인할 결과가 달라진다. 언어로 원리를 설명하는 능력과 행동 결과를 신뢰할 만하게 예측하는 정확성은 별개의 평가 질문이다.

자료: 2018년 World Models의 가상 환경 학습 · worldmodels.github.io · SIMA 2와 생성 환경의 결합 · deepmind.google · Genie 3의 환경 생성과 적용 범위 · deepmind.google · V-JEPA 2의 학습과 로봇 계획 · arxiv.org · Waymo World Model의 주행 시뮬레이션 · community.waymo.com

FACT BOUNDARY

과장하지 않기 위해 남긴 경계

  • 각 사례는 발표 주체의 연구와 시연을 근거로 설명했다. 테크독해가 최신 모델 전체의 성능을 독립적으로 재현한 결과는 아니다.
  • 2018년 게임 연구의 실패는 당시 조건의 결과이며 현재 모든 월드모델에서 같은 실패가 발생한다는 증거가 아니다.
  • Genie 3의 생성 환경, V-JEPA 2-AC의 로봇 계획, Waymo의 주행 시험은 서로 다른 용도와 평가 조건을 갖는다.
SOURCE LEDGER

확인한 공개 자료

  1. 01SIMA 2와 생성 환경의 결합 · deepmind.google↗
  2. 02Genie 3의 환경 생성과 적용 범위 · deepmind.google↗
  3. 03V-JEPA 2의 학습과 로봇 계획 · arxiv.org↗
  4. 042018년 World Models의 가상 환경 학습 · worldmodels.github.io↗
  5. 05Waymo World Model의 주행 시뮬레이션 · community.waymo.com↗