AI

Grok Imagine 첫 프레임·마지막 프레임 출시, 이제 두 장면 사이를 영상으로 만든다

Grok Imagine Video 1.5에 시작 프레임과 종료 프레임을 함께 고정하는 기능이 들어왔다. 단순 이미지 투 비디오와 무엇이 달라졌는지, 루프 영상에는 어떻게 쓸 수 있는지 공식 문서를 기준으로 정리했다.

AI 영상에서 은근히 답답했던 문제가 하나 있었습니다.

시작 장면은 이미지로 정확히 정할 수 있는데, 어디에서 끝날지는 모델에게 맡겨야 한다는 점이었죠.

Grok Imagine이 이 부분을 바꿨습니다. 이제 첫 프레임과 마지막 프레임을 함께 지정하고, 그 사이에서 어떤 일이 일어날지만 AI에게 맡길 수 있습니다.

무엇이 새로 생긴 걸까요?

xAI의 최신 Video Generation 문서에는 grok-imagine-video-1.5의 생성 방식으로 First & Last frame이 명시돼 있습니다.

last_frame을 넣으면 마지막 장면을 고정할 수 있고, 여기에 image까지 함께 넣으면 그 이미지는 첫 프레임으로 고정됩니다. 모델은 두 프레임 사이를 이어 영상을 생성합니다.

재미있는 점은 마지막 프레임만 넣는 것도 가능하다는 겁니다. 이 경우 시작 장면은 AI가 만들고, 사용자가 지정한 마지막 이미지에 도착하도록 생성합니다.

입력결과
텍스트장면 전체를 AI가 생성
첫 프레임지정 이미지에서 시작
마지막 프레임AI가 시작 장면을 만들고 지정 이미지로 종료
첫 + 마지막 프레임두 이미지를 고정하고 그 사이를 생성

쉽게 말해 출발점과 목적지는 사람이 정하고, 이동 과정은 AI가 만드는 방식입니다.

기존 이미지 투 비디오와 차이가 큽니다

Grok Imagine Video 1.5는 원래도 입력 이미지를 영상의 시작 프레임으로 사용하는 이미지 투 비디오를 지원했습니다.

하지만 마지막 장면을 프롬프트로 설명하는 것과 마지막 이미지를 직접 고정하는 것은 전혀 다릅니다.

예를 들어 첫 이미지가 평범한 도로의 자동차이고 마지막 이미지가 미래 도시의 같은 자동차라면, 두 이미지를 넣고 “자동차가 달리는 동안 주변이 미래 도시로 변한다”고 지시할 수 있습니다.

예전에는 “미래 도시에서 끝내라”고 써도 최종 프레임을 정확히 맞출 수 없었습니다. 이제는 목적지 자체를 이미지로 줄 수 있습니다.

변신·전후 비교 영상에서 특히 쓸 만합니다

이 기능과 잘 맞는 건 변화 전후가 분명한 짧은 영상입니다.

  • 낮에서 밤으로 바뀌는 풍경
  • 스케치에서 완성 그림으로 변하는 과정
  • 낡은 건물이 복원되는 장면
  • 일반 자동차가 콘셉트카로 변하는 장면
  • 여름 풍경이 겨울 풍경으로 바뀌는 장면
  • 제품이 특정 위치에서 움직여 최종 광고 컷에 도착하는 장면

두 장의 상태를 먼저 제대로 만들어두고, Grok에게 그 사이의 움직임만 맡기는 식입니다.

루프 영상도 만들기 쉬워졌습니다

첫 프레임과 마지막 프레임을 같거나 매우 비슷하게 만들면 반복 재생을 전제로 한 영상에도 활용할 수 있습니다.

예를 들어 커피잔에서 김이 올라오는 이미지를 시작과 끝에 두고, 중간에서 김과 카메라만 움직였다가 원래 상태로 돌아오게 지시하는 방식입니다.

다만 같은 이미지를 양 끝에 넣었다고 완벽한 무봉제 루프가 자동으로 보장되는 것은 아닙니다. 끝부분의 움직임 속도와 방향이 첫 부분과 다르면 연결점이 보일 수 있어 결과 확인과 편집은 여전히 필요합니다.

프롬프트는 여전히 중요합니다

첫 장과 끝 장을 지정한다고 단순 모핑만 하는 기능은 아닙니다.

사람이 의자에 앉아 있는 이미지를 첫 프레임, 창가에 서 있는 이미지를 마지막 프레임으로 썼다면 “인물이 의자에서 일어나 천천히 창가로 걸어간다. 카메라는 고정한다”처럼 중간 행동을 설명할 수 있습니다.

구조를 한 줄로 줄이면 이렇습니다.

첫 장면 + 중간에 일어날 일 + 마지막 장면

첫·마지막 프레임은 어디서 시작하고 어디에 도착할지를 정하고, 프롬프트는 그 사이에 무슨 일이 벌어질지를 정합니다.

현재 Video 1.5는 어디까지 지원할까요?

xAI 공식 문서 기준 Grok Imagine Video 1.5는 480p, 720p, 1080p를 지원하며 영상 길이는 최대 15초까지 설정할 수 있습니다.

다만 해상도 제한은 생성 방식에 따라 다릅니다. 공식 문서는 텍스트 투 비디오와 이미지 투 비디오에서 1080p를 지원하지만, Reference-to-Video는 최대 720p라고 명시합니다.

Video 1.5 자체는 6월 16일 정식 API 모델로 공개됐습니다. 당시 xAI는 움직임과 물리 표현, 오디오와 음성, 생성 속도 개선을 핵심 변화로 소개했습니다. 이번 첫·마지막 프레임 제어는 그 모델의 제작 제어 기능을 한 단계 더 넓힌 셈입니다.

처음 테스트한다면 차이를 너무 크게 만들지 않는 편이 좋습니다

시작과 끝이 정해졌다고 해서 어떤 두 이미지든 자연스럽게 이어지는 것은 아닙니다.

인물, 카메라 위치, 배경, 조명, 자세가 한꺼번에 크게 달라지면 AI가 중간에서 해결해야 할 문제가 많아집니다.

처음에는 같은 인물과 비슷한 카메라 구도를 유지하고, 하나의 변화만 주는 편이 결과를 판단하기 쉽습니다. 예를 들어 “서 있는 사람 → 의자에 앉은 사람” 정도부터 시작하는 식이죠.

AI 영상 경쟁, 이제 화질보다 ‘통제’가 중요해집니다

이번 업데이트에서 눈에 들어오는 건 단순히 입력 이미지가 한 장 더 늘었다는 사실이 아닙니다.

생성형 영상이 실제 제작 도구가 되려면 멋진 장면을 우연히 뽑는 것보다 원하는 컷을 얼마나 정확히 설계할 수 있느냐가 중요합니다. 이미지 쪽의 편집 제어 이야기는 ChatGPT Images 2.5 글에서 다뤘습니다.

Grok Imagine은 이미 텍스트·이미지 기반 생성, Reference-to-Video, 영상 편집과 연장을 지원하고 있습니다. 여기에 시작점과 종료점 제어가 추가됐습니다.

특히 여러 짧은 컷을 이어 광고나 스토리 영상을 만드는 사람에게는 꽤 실용적인 변화입니다. 컷의 끝을 다음 장면과 연결하기가 훨씬 쉬워지기 때문입니다.

그래서

Grok Imagine의 첫·마지막 프레임 기능은 화려한 신모델 발표보다 작아 보이지만, 실제 영상 제작에서는 꽤 반가운 업데이트입니다.

이제 “이 사진을 움직여줘”에서 한 단계 더 나아가 “여기서 시작해서 정확히 여기까지 가줘”라고 요구할 수 있게 됐습니다.

앞으로 볼 부분은 두 프레임의 차이가 커졌을 때 인물과 사물을 얼마나 안정적으로 보존하는지, 그리고 반복 생성에서도 중간 동작을 얼마나 일관되게 만들어내는지입니다. 공개된 기능 설명만 보면 Grok Imagine이 단순 생성기보다 ‘컷을 설계하는 도구’ 쪽으로 확실히 이동하고 있습니다.

출처

확인한 자료

01xAI Video Generation 문서https://docs.x.ai/developers/model-capabilities/video/generation02xAI Video 1.5 모델 문서https://docs.x.ai/developers/models/grok-imagine-video-1.503xAI Grok Imagine Video 1.5 발표https://x.ai/news/grok-imagine-video-1-504과거 Grok 커뮤니티 질문https://www.reddit.com/r/grok/comments/1owvuin/can_grok_imagine_do_frame_to_frame_video/

글 검색