(사진=스페이스XAI)
(사진=스페이스XAI)

스페이스XAI가 영상 생성의 고질적인 문제로 꼽혀온 장면 간 연속성을 개선한 ‘그록 이매진 비디오 1.5(Grok Imagine Video 1.5)’ 에이전트를 공개했다. 단순히 영상 생성 모델의 화질을 높이는 데 그치지 않고 여러 개의 장면을 하나의 일관된 영상으로 연결하는 데 초점을 맞춘 것이 특징이다.

스페이스XAI는 5일(현지시간) 새로운 ‘그록 이매진 비디오 1.5’ 에이전트를 공개하며 더 높은 화질과 향상된 스토리텔링, 여러 샷을 자연스럽게 연결하는 기능을 제공한다고 밝혔다.

이번 업데이트는 새로운 ‘비디오 1.6’ 모델을 선보이는 것이 아니라, 기존 비디오 1.5 모델 위에 장면을 계획하고 여러 생성 결과를 연결하는 오케스트레이션 계층을 추가한 형태다.

기반은 스페이스XAI의 ‘이미지 2.0(Image 2.0)’ 모델이다. 지시사항을 정확하게 따르고 사용자 제공 요소와 캐릭터, 장소, 소품 등의 일관성을 유지하는 데 초점을 맞춘 모델이다. 최대 5개의 참조 이미지를 활용할 수 있도록 지원, 영상 에이전트가 동일한 캐릭터의 얼굴과 의상, 배경, 소품 등을 여러 장면에서 유지하는 데 활용할 수 있다.

이는 기존 AI 영상 생성 기술이 가진 한계를 겨냥한 것이다. 하나의 짧은 영상 안에서는 인물과 사물을 비교적 안정적으로 유지하더라도 카메라가 다른 각도로 전환되거나 장소가 바뀌면 캐릭터의 얼굴이나 의상, 배경의 구조가 달라지는 문제가 발생하기 쉽다. 장면이 이어지지 않고 각각 독립적으로 생성된 결과가 연결되면서 전체 영상이 ‘슬라이드쇼’처럼 보이는 경우도 많았다.

이 문제를 멀티샷 연속성(multi-shot continuity) 관점에서 해결했다. 에이전트가 하나의 요청을 여러 장면으로 나누고 필요한 이미지와 영상 생성 과정을 조율하면서 이전 장면의 정보를 다음 장면으로 전달하는 방식이다. 개별 영상의 품질뿐 아니라 인물의 정체성, 의상과 소품, 장소와 조명, 행동의 연결성, 전체적인 시각적 스타일을 유지하는 것이 중요하다.

특히 이미지 2.0이 먼저 캐릭터와 환경 등 시각적 상태를 구축하고 비디오 1.5가 이를 영상으로 움직이는 구조는 기술적으로 자연스러운 조합이다. 다만 새로운 에이전트가 정확히 어떤 방식으로 장면 상태를 관리하고 결과를 자동으로 평가·재생성하는지에 대한 구체적인 아키텍처는 공개하지 않았다.

이번 업데이트는 그록 이매진의 최근 기능 확장과도 연결된다. 스페이스XAI는 앞서 비디오 1.5에 참조 이미지와 캐릭터, 장면, 음성 등을 활용할 수 있는 기능을 추가했으며, 이미지 2.0을 통해 관련 이미지 간 일관성도 강화했다. 이번 에이전트는 이러한 기능을 개별 도구가 아니라 연결된 제작 과정으로 활용하는 데 초점을 맞춘다.

현재 비디오 1.5는 최대 15초 길이의 영상을 생성할 수 있으며 오디오도 함께 생성한다. 따라서 장편 영화를 한 번에 만드는 도구라기보다는 여러 개의 짧은 장면을 일관성 있게 이어 붙이는 AI 기반 스토리 제작 환경에 가까운 형태다.

박찬 기자 cpark@aitimes.com