1시간 전

NitroGen: 게임을 보며 조작하는 범용 에이전트, 로봇 AI의 다음 데이터가 될 수 있을까?

NitroGen: 게임을 보며 조작하는 범용 에이전트, 로봇 AI의 다음 데이터가 될 수 있을까?

게임을 잘하는 AI를 만드는 일은 오래전부터 진행돼 왔습니다. 스타크래프트, 바둑, 체스처럼 특정 게임의 규칙을 학습하는 시스템도 있었고, 최근에는 화면을 보고 게임패드나 키보드를 조작하는 에이전트도 등장했습니다.

하지만 NitroGen은 목표가 조금 다릅니다.

하나의 게임에서 최고 점수를 얻는 특화형 AI가 아니라, 여러 게임의 화면을 보고 공통된 방식으로 행동하는 범용 시각-행동 에이전트를 만들려는 연구입니다.

NitroGen은 1,000개 이상의 게임에서 수집한 약 40,000시간의 게임플레이 영상과 행동 데이터를 이용해 학습한 오픈 비디오-액션 파운데이션 모델입니다. 화면을 입력으로 받고, 게임패드 버튼과 조이스틱 조작을 출력합니다.

이 연구가 중요한 이유는 게임 AI의 성능 자체보다, 시각적 관측을 실제 행동으로 연결하는 범용 모델과 데이터 구축 방식을 보여주기 때문입니다. 게임에서 학습한 인터랙션 능력은 향후 Embodied AI와 로봇 제어로 확장될 가능성도 있습니다.

NitroGen 한눈에 보기

구분

내용

연구명

NitroGen: An Open Foundation Model for Generalist Gaming Agents

분야

시각-행동 모델, 범용 게임 에이전트, Embodied AI

발표

CVPR 2026

수상

CVPR 2026 Honorable Mention

학습 데이터

1,000개 이상 게임, 약 40,000시간 플레이 영상

입력

게임 화면의 RGB 이미지

출력

게임패드 버튼과 조이스틱 행동

공개 자원

데이터셋, 모델 가중치, 평가 환경 및 유니버설 시뮬레이터

핵심 방향

여러 환경에 전이 가능한 범용 시각-행동 정책

다만 위 표의 수치는 논문과 공식 프로젝트 페이지를 기준으로 한 것입니다. NitroGen은 게임용 에이전트 연구이며, 현재 곧바로 실제 로봇을 제어하는 모델로 공개된 것은 아닙니다.

기존 게임 AI와 무엇이 다른가?

기존 게임 AI는 대체로 특정 게임에 최적화돼 있었습니다.

  • 게임의 내부 상태를 직접 읽습니다.

  • 게임마다 별도의 API나 시뮬레이터를 사용합니다.

  • 특정 규칙과 보상 함수에 맞춰 학습합니다.

  • 게임별로 다른 행동 공간을 사용합니다.

이 방식은 한 게임의 성능을 높이는 데는 효과적입니다. 그러나 게임이 바뀌면 환경과 행동 체계를 새로 설계해야 하는 경우가 많습니다.

NitroGen은 다른 접근을 취합니다. 게임의 내부 상태를 직접 읽는 대신 화면 픽셀을 관측하고, 여러 게임에 공통으로 적용할 수 있는 게임패드 행동 공간을 사용합니다.

즉, 에이전트는 게임 내부의 정답지를 받는 것이 아니라 다음과 같은 흐름으로 행동합니다.

화면 관측
   ↓
현재 상황의 시각적 해석
   ↓
다음 행동 예측
   ↓
게임패드 입력
   ↓
변화한 화면 재관측
   ↺

이 구조는 인간이 게임을 플레이하는 방식과도 어느 정도 닮아 있습니다. 사람은 일반적으로 게임 엔진의 내부 변수나 상태값을 직접 읽지 않고 화면을 보며 버튼을 누르기 때문입니다.

4만 시간의 비디오에서 행동을 어떻게 얻었을까?

NitroGen의 핵심은 모델 구조만이 아닙니다. 더 중요한 부분은 대규모 행동 데이터셋을 구축한 방식입니다.

인터넷에는 게임플레이 영상이 많이 공개돼 있지만, 대부분은 화면만 있고 플레이어가 언제 어떤 버튼을 눌렀는지에 대한 라벨은 없습니다. NitroGen 연구진은 이 문제를 게임 영상에 표시된 컨트롤러 오버레이로 해결했습니다.

플레이어가 게임패드를 조작하는 영상에는 화면 한쪽에 버튼과 조이스틱 상태가 표시되는 경우가 있습니다. 연구진은 이 오버레이를 찾고, 영상 프레임마다 버튼과 조이스틱의 상태를 복원했습니다.

논문에서 제시한 데이터 규모는 다음과 같습니다.

  • 초기 수집량: 약 71,000시간

  • 행동 밀도 필터링 후: 약 40,000시간

  • 게임 수: 1,000개 이상

  • 영상 수: 38,739개

  • 콘텐츠 제작자: 818명

모든 영상이 그대로 학습에 사용된 것은 아닙니다. 행동 입력이 충분히 표시되는 구간만 남겼고, 화면에 나타난 컨트롤러 오버레이는 모델이 단순히 오버레이만 보고 행동을 복사하는 지름길을 쓰지 못하도록 마스킹했습니다.

이 부분은 중요한 시사점을 줍니다.

대규모 행동 데이터는 처음부터 완벽하게 라벨링된 형태로만 존재하는 것이 아닙니다. 공개 영상과 로그에서 행동 신호를 복원하고, 품질을 필터링하며, 모델이 잘못된 지름길을 학습하지 않도록 데이터 전처리 구조를 설계하는 것도 중요한 연구 대상입니다.

NitroGen은 무엇을 학습하는가?

NitroGen은 화면 한 장을 보고 앞으로 이어질 행동을 한 번에 예측합니다. 논문에서는 단일 행동이 아니라 **16개의 행동 청크(action chunk)**를 생성하는 방식을 사용합니다.

행동 청크는 다음과 같은 장점이 있습니다.

  • 매 순간 행동을 따로 예측할 때보다 시간적으로 일관된 조작이 가능합니다.

  • 움직임이 이어지는 플랫폼 게임이나 전투 상황에 적합합니다.

  • 시각 관측과 행동 시퀀스를 연결해 학습할 수 있습니다.

모델은 SigLIP 2 기반의 비전 인코더와 행동 생성기를 결합합니다. 입력은 256×256 RGB 이미지이고, 출력은 게임패드 버튼을 나타내는 이진 벡터와 조이스틱 위치를 나타내는 연속 벡터입니다.

여기서 중요한 것은 게임별로 완전히 다른 출력 구조를 만들지 않았다는 점입니다. 방향키, 버튼, 트리거와 조이스틱을 공통된 행동 공간으로 표현함으로써 하나의 모델이 여러 게임에 적용될 수 있도록 했습니다.

여러 게임에서 실제로 작동할까?

NitroGen은 10개 게임, 30개 태스크로 구성된 평가 환경을 사용합니다. 2D 사이드 스크롤러와 로그라이크 게임뿐 아니라 3D 오픈월드, 액션 RPG, 스포츠 게임도 포함합니다.

평가 태스크는 크게 다음과 같이 나뉩니다.

  • 전투

  • 내비게이션

  • 게임별 고유 메커니즘

예를 들어 특정 위치까지 이동하거나, 적과 전투하거나, 게임 안의 고유한 조작을 수행하는 식입니다.

연구 결과에서 NitroGen은 게임별 추가 파인튜닝 없이 여러 장르와 시각 스타일에서 비자명한 성공률을 보였습니다. 고정된 레이아웃을 가진 게임뿐 아니라 절차적으로 생성돼 매번 환경이 달라지는 게임에서도 작동했다는 점이 흥미롭습니다.

이는 모델이 단순히 특정 화면을 암기한 것만은 아닐 가능성을 보여줍니다. 화면에서 상황을 파악하고, 그 상황에 맞는 행동 패턴을 어느 정도 일반화했다는 의미입니다.

다만 ‘범용’이라는 표현을 과장해서는 안 됩니다. NitroGen의 범용성은 게임 화면과 게임패드 행동이라는 제한된 영역 안에서 확인된 것입니다. 언어 지시를 이해하거나, 장기간의 복잡한 목표를 스스로 계획하거나, 현실 환경에서 안전하게 행동하는 문제까지 해결한 것은 아닙니다.

사전학습이 새로운 게임에도 도움이 되는 이유

NitroGen 연구에서 특히 주목할 부분은 사전학습 모델의 전이 효과입니다.

연구진은 특정 게임을 사전학습 데이터에서 제외한 뒤, 제한된 데이터로 해당 게임에 파인튜닝하는 실험을 진행했습니다. 그리고 같은 구조와 연산 예산으로 처음부터 학습한 모델과 비교했습니다.

그 결과 사전학습 모델은 처음부터 학습한 모델보다 새로운 게임에서 더 높은 성능을 보였습니다. 논문 초록에서는 scratch 학습 대비 최대 52%의 상대적 성공률 향상을 보고합니다.

이 결과는 단순히 “게임을 많이 봤다”는 의미를 넘어섭니다. 여러 게임에서 반복적으로 등장하는 다음과 같은 시각-행동 패턴을 먼저 학습했을 가능성이 있습니다.

  • 캐릭터 이동과 카메라 조작

  • 장애물과 적에 대한 회피

  • 화면 중심의 목표 추적

  • 점프와 회피 타이밍

  • 전투 상황에서의 연속 조작

  • 새로운 공간을 탐색하는 행동

새 게임을 만났을 때도 완전히 처음부터 행동을 학습하는 것이 아니라, 기존에 익힌 인터랙션의 기본기를 활용할 수 있다는 것입니다.

이 연구가 Embodied AI에 중요한 이유

게임은 현실 세계와 다르지만, 에이전트 학습을 위한 유용한 특징을 가지고 있습니다.

  • 화면을 보며 행동해야 합니다.

  • 행동의 결과가 다시 화면에 반영됩니다.

  • 장면과 목표가 계속 변합니다.

  • 실패와 재시도가 가능합니다.

  • 다양한 환경에서 반복적으로 데이터를 수집할 수 있습니다.

이 구조는 Embodied AI의 기본 문제와 닮아 있습니다.

로봇도 카메라와 센서로 환경을 관측하고, 이동·조작 명령을 실행한 다음, 행동 결과를 다시 관측합니다. 따라서 게임에서 학습한 시각-행동 표현과 행동 생성 방식은 로봇의 이동이나 조작 정책을 설계할 때 참고할 수 있습니다.

물론 차이도 큽니다.

게임에서는 버튼 입력이 즉시 적용되고 실패해도 장비가 파손되지 않습니다. 반면 현실의 로봇은 센서 지연, 마찰, 무게, 충돌, 통신 오류와 안전 문제가 존재합니다. 게임에서 잘 작동한 정책을 그대로 로봇에 적용할 수는 없습니다.

따라서 NitroGen의 의미는 “게임 AI가 곧 로봇 AI가 된다”는 데 있지 않습니다. 오히려 시각 관측과 행동 데이터를 대규모로 연결하는 사전학습 방법을 Embodied AI 연구에 제공한다는 데 있습니다.

게임 데이터에서 로봇 데이터로

NitroGen을 보며 로봇 분야에서 생각해볼 수 있는 질문은 다음과 같습니다.

로봇이 실제 작업을 수행하는 영상을 충분히 모으면, 특정 작업을 넘어 여러 작업에 적용할 수 있는 범용 작업 에이전트를 학습할 수 있을까?

여기서 중요한 것은 영상의 양만이 아닙니다. 각 시점에 로봇이 무엇을 보고 있었고, 어떤 명령을 받았으며, 실제로 어떤 행동을 했고, 결과가 성공했는지를 함께 기록해야 합니다.

로봇 데이터에는 다음과 같은 정보가 필요합니다.

  • 카메라와 깊이 센서 영상

  • 로봇의 위치와 자세

  • 관절·바퀴 상태

  • 속도와 힘 정보

  • 제어 명령

  • 원격조작 입력

  • 작업 목표

  • 성공·실패 결과

  • 충돌·미끄러짐·중단 등 예외 상황

게임 영상에서 컨트롤러 오버레이가 행동 라벨의 단서가 됐던 것처럼, 로봇에서는 제어 로그와 원격조작 기록이 행동 라벨의 핵심이 됩니다.

인준님 프로젝트와 연결되는 Data Flywheel

이 지점에서 NitroGen은 인준님이 검토 중인 T2 실제 환경 데이터 기반 Data Flywheel과 연결됩니다.

T2가 한국의 실제 환경에서 작업을 수행할 때마다 단순히 작업 성공 여부만 기록하는 것이 아니라, 관측·명령·행동·결과를 함께 축적할 수 있습니다. 그러면 한 번의 작업 로그가 다음 모델 학습과 시뮬레이션 개선에 활용되는 자산이 됩니다.

T2 실제 작업 수행
        ↓
시각·센서·제어·결과 데이터 수집
        ↓
시간 동기화·정제·품질 검증
        ↓
성공·실패·예외 사례 분류
        ↓
범용 시각-행동 모델 학습
        ↓
새로운 작업에 제한적 배포
        ↓
배포 결과와 실패 데이터 재수집
        ↺

이 구조에서 데이터는 한 번 쓰고 버리는 로그가 아닙니다. 실제 운영이 늘어날수록 모델이 다양한 환경과 예외 상황을 경험하고, 모델이 개선될수록 더 많은 작업을 안정적으로 수행하며, 다시 더 좋은 데이터를 만들어내는 순환 구조입니다.

NitroGen이 보여준 것은 이 플라이휠의 초기 형태라고 볼 수 있습니다.

  • 다양한 환경의 영상 데이터를 모읍니다.

  • 행동 신호를 복원합니다.

  • 공통 행동 공간을 정의합니다.

  • 하나의 모델로 여러 환경을 학습합니다.

  • 새로운 환경에 파인튜닝하며 전이 효과를 측정합니다.

T2에서는 게임패드 대신 로봇의 이동·관절·그리퍼·작업 명령이 행동 공간이 됩니다. 게임의 성공률 대신 작업 성공률, 충돌률, 사람 개입 횟수와 실제 환경 전이 성능을 평가해야 합니다.

T2 범용 작업 에이전트를 만들기 위한 조건

1. 행동과 관측의 시간 동기화

센서 영상이 촬영된 시점과 제어 명령이 실행된 시점이 정확히 맞아야 합니다. 타임스탬프가 어긋나면 모델은 행동의 원인과 결과를 잘못 연결할 수 있습니다.

2. 공통 행동 공간 설계

작업마다 행동 표현이 완전히 달라지면 하나의 모델로 학습하기 어렵습니다. 이동, 회전, 팔의 움직임, 그리퍼 조작과 정지 명령을 일정한 형식으로 표현할 필요가 있습니다.

3. 실패 데이터 보존

성공한 작업만 모으면 모델은 정상 상황만 배우게 됩니다. 충돌 직전의 상태, 물체를 놓친 상황, 미끄러짐, 센서 누락과 사람의 개입도 중요한 학습 데이터입니다.

4. 안전 계층 분리

범용 모델이 행동을 생성하더라도 비상 정지, 속도 제한과 충돌 방지 같은 안전 제어는 별도의 계층으로 유지해야 합니다. 학습 모델의 출력이 항상 안전하다고 가정해서는 안 됩니다.

5. 실제 환경 중심의 평가

시뮬레이션 성공률이나 오프라인 재현율만으로는 충분하지 않습니다. 실제 T2에서 새로운 장소, 조명, 작업 대상과 예외 상황을 얼마나 잘 처리하는지 확인해야 합니다.

대규모 데이터의 양보다 중요한 것

NitroGen은 4만 시간이라는 압도적인 데이터 규모로 주목받았습니다. 하지만 로봇 프로젝트에 이 숫자를 그대로 적용할 필요는 없습니다.

로봇에서는 데이터의 품질과 다양성이 더 중요할 수 있습니다.

  • 같은 작업만 반복한 1,000시간보다 여러 환경에서 수행한 100시간이 유용할 수 있습니다.

  • 성공 사례만 모은 데이터보다 실패 원인이 기록된 데이터가 중요할 수 있습니다.

  • 영상만 있는 데이터보다 행동 명령과 결과가 연결된 데이터가 가치 있습니다.

  • 평균적인 장면보다 드물지만 위험한 예외 상황이 안전성 개선에 더 직접적일 수 있습니다.

결국 핵심은 데이터의 총량이 아니라 환경의 다양성, 행동 라벨의 정확성, 결과의 추적 가능성입니다.

NitroGen의 한계와 남은 과제

NitroGen은 의미 있는 연구 결과를 보여주지만, 실제 범용 에이전트로 가기까지는 해결해야 할 문제가 많습니다.

게임과 현실 사이의 차이

게임은 물리 엔진으로 제한되지만 현실에는 예측하기 어려운 마찰, 센서 오류, 물체 편차와 사람의 움직임이 존재합니다.

행동 라벨의 불완전성

게임 영상의 컨트롤러 오버레이는 유용한 행동 신호지만 완벽한 정답 라벨은 아닙니다. 오버레이 지연과 파싱 오류가 있을 수 있으며, 플레이어별 버튼 매핑도 다릅니다.

장기 계획과 언어 지시

현재 NitroGen은 화면에서 게임패드 행동을 생성하는 데 초점이 있습니다. 복잡한 언어 지시를 이해하고 장기 작업을 계획하는 에이전트와는 아직 거리가 있습니다.

안전성과 책임성

게임에서 실패는 다시 시작하면 되지만, 로봇의 실패는 사람과 장비에 피해를 줄 수 있습니다. 현실에 적용하려면 행동 생성 모델과 독립적인 안전·검증 계층이 필요합니다.

실제 운영 환경

연구 평가에서는 정해진 게임과 태스크를 사용하지만, 현장에서는 네트워크 오류, 센서 고장, 작업 대상 변화와 예상 밖의 사람 개입까지 고려해야 합니다.

결론: 범용 에이전트의 경쟁력은 행동 데이터에서 시작된다

NitroGen은 1,000개 이상의 게임에서 수집한 약 40,000시간의 플레이 영상으로 시각 입력을 행동으로 변환하는 범용 게임 에이전트를 학습했습니다.

이 연구의 핵심은 특정 게임을 잘하는 AI를 만든 것이 아닙니다. 다양한 환경을 하나의 공통 행동 공간으로 연결하고, 인터넷 규모의 영상에서 행동 데이터를 복원하며, 여러 게임에 전이 가능한 시각-행동 모델을 공개했다는 점입니다.

게임에서 학습한 인터랙션 능력이 곧바로 로봇 제어로 이어지는 것은 아닙니다. 그러나 시각 관측과 행동을 연결하는 모델, 대규모 행동 데이터셋, 공통 행동 공간과 반복적인 평가 구조는 Embodied AI와 로봇 연구에도 중요한 참고점이 됩니다.

인준님이 추진하는 T2 Data Flywheel 전략도 같은 방향을 바라봅니다.

T2가 실제 환경에서 수행하는 작업을 관측·행동·결과 데이터로 축적하고, 이를 범용 작업 에이전트 학습에 활용한다면, 개별 작업 자동화를 넘어 다양한 현장에 전이할 수 있는 Physical AI 기반을 만들 수 있습니다.

결국 범용 에이전트의 경쟁력은 모델의 크기만으로 결정되지 않습니다.

얼마나 다양한 환경에서, 얼마나 정확하게 행동 데이터를 수집하고, 그 데이터를 다음 행동 개선으로 연결하느냐가 범용 에이전트의 핵심 경쟁력입니다.

핵심 정리

  • NitroGen은 1,000개 이상 게임과 약 40,000시간의 플레이 영상으로 학습한 오픈 시각-행동 파운데이션 모델입니다.

  • 화면의 RGB 이미지를 입력으로 받아 게임패드 버튼과 조이스틱 행동을 생성합니다.

  • 게임 영상의 컨트롤러 오버레이에서 행동 신호를 복원해 대규모 비디오-액션 데이터셋을 구축했습니다.

  • 하나의 모델을 여러 게임과 태스크에 적용하는 범용 시각-행동 정책을 지향합니다.

  • 미학습 게임 파인튜닝에서 사전학습 모델의 전이 효과를 확인했습니다.

  • 게임에서 현실 로봇으로 바로 이전할 수는 없지만, Embodied AI의 데이터·모델 설계에 중요한 참고점을 제공합니다.

  • T2의 실제 작업 데이터, 원격조작 로그와 실패 사례를 축적하면 범용 작업 에이전트로 확장하는 Data Flywheel을 구성할 수 있습니다.

  • 로봇에 적용할 때는 시간 동기화, 공통 행동 공간, 실패 데이터, 독립적인 안전 계층과 실제 환경 평가가 필요합니다.

참고 자료

이 글은 NitroGen 논문과 공식 프로젝트 자료를 기준으로 작성했습니다. 모델 성능과 공개 자원은 이후 버전에 따라 달라질 수 있습니다.

49
  • 본 콘텐츠는 정보 제공을 목적으로 하며, 특정 금융투자상품의 매매 권유, 종목 추천, 투자 자문을 목적으로 작성된 것이 아닙니다. 너디스은(는) 콘텐츠에 포함된 자료와 정보의 정확성 및 완전성을 보증하지 않으며, 이를 근거로 한 투자 등 의사결정의 결과에 대해 책임을 지지 않습니다.
  • 본 콘텐츠는 2026년 9월 작성 시점의 정보를 기준으로 하며, 이후 시장 상황·정책·기술 동향 등의 변화에 따라 내용이 달라질 수 있습니다. 투자에는 원금 손실 위험이 따르며, 모든 투자 판단과 그 결과는 투자자 본인에게 귀속됩니다.
  • 콘텐츠에 포함된 견해는 작성자 개인의 주관적 판단이 포함될 수 있습니다. 최종 의사결정 전 공신력 있는 자료를 직접 확인하시기 바랍니다.

지금 많이 보는 글