Grok Imagine 첫 프레임·마지막 프레임 출시, 이제 두 장면 사이를 영상으로 만든다
Grok Imagine Video 1.5에 시작 프레임과 종료 프레임을 함께 고정하는 기능이 들어왔다. 단순 이미지 투 비디오와 무엇이 달라졌는지, 루프 영상에는 어떻게 쓸 수 있는지 공식 문서를 기준으로 정리했다.
AI 영상에서 은근히 답답했던 문제가 하나 있었습니다.
시작 장면은 이미지로 정확히 정할 수 있는데, 어디에서 끝날지는 모델에게 맡겨야 한다는 점이었죠.
Grok Imagine이 이 부분을 바꿨습니다. 이제 첫 프레임과 마지막 프레임을 함께 지정하고, 그 사이에서 어떤 일이 일어날지만 AI에게 맡길 수 있습니다.
무엇이 새로 생긴 걸까요?
xAI의 최신 Video Generation 문서에는 grok-imagine-video-1.5의 생성 방식으로 First & Last frame이 명시돼 있습니다.
last_frame을 넣으면 마지막 장면을 고정할 수 있고, 여기에 image까지 함께 넣으면 그 이미지는 첫 프레임으로 고정됩니다. 모델은 두 프레임 사이를 이어 영상을 생성합니다.
재미있는 점은 마지막 프레임만 넣는 것도 가능하다는 겁니다. 이 경우 시작 장면은 AI가 만들고, 사용자가 지정한 마지막 이미지에 도착하도록 생성합니다.
| 입력 | 결과 |
|---|---|
| 텍스트 | 장면 전체를 AI가 생성 |
| 첫 프레임 | 지정 이미지에서 시작 |
| 마지막 프레임 | AI가 시작 장면을 만들고 지정 이미지로 종료 |
| 첫 + 마지막 프레임 | 두 이미지를 고정하고 그 사이를 생성 |
쉽게 말해 출발점과 목적지는 사람이 정하고, 이동 과정은 AI가 만드는 방식입니다.
기존 이미지 투 비디오와 차이가 큽니다
Grok Imagine Video 1.5는 원래도 입력 이미지를 영상의 시작 프레임으로 사용하는 이미지 투 비디오를 지원했습니다.
하지만 마지막 장면을 프롬프트로 설명하는 것과 마지막 이미지를 직접 고정하는 것은 전혀 다릅니다.
예를 들어 첫 이미지가 평범한 도로의 자동차이고 마지막 이미지가 미래 도시의 같은 자동차라면, 두 이미지를 넣고 “자동차가 달리는 동안 주변이 미래 도시로 변한다”고 지시할 수 있습니다.
예전에는 “미래 도시에서 끝내라”고 써도 최종 프레임을 정확히 맞출 수 없었습니다. 이제는 목적지 자체를 이미지로 줄 수 있습니다.
변신·전후 비교 영상에서 특히 쓸 만합니다
이 기능과 잘 맞는 건 변화 전후가 분명한 짧은 영상입니다.
- 낮에서 밤으로 바뀌는 풍경
- 스케치에서 완성 그림으로 변하는 과정
- 낡은 건물이 복원되는 장면
- 일반 자동차가 콘셉트카로 변하는 장면
- 여름 풍경이 겨울 풍경으로 바뀌는 장면
- 제품이 특정 위치에서 움직여 최종 광고 컷에 도착하는 장면
두 장의 상태를 먼저 제대로 만들어두고, Grok에게 그 사이의 움직임만 맡기는 식입니다.
루프 영상도 만들기 쉬워졌습니다
첫 프레임과 마지막 프레임을 같거나 매우 비슷하게 만들면 반복 재생을 전제로 한 영상에도 활용할 수 있습니다.
예를 들어 커피잔에서 김이 올라오는 이미지를 시작과 끝에 두고, 중간에서 김과 카메라만 움직였다가 원래 상태로 돌아오게 지시하는 방식입니다.
다만 같은 이미지를 양 끝에 넣었다고 완벽한 무봉제 루프가 자동으로 보장되는 것은 아닙니다. 끝부분의 움직임 속도와 방향이 첫 부분과 다르면 연결점이 보일 수 있어 결과 확인과 편집은 여전히 필요합니다.
프롬프트는 여전히 중요합니다
첫 장과 끝 장을 지정한다고 단순 모핑만 하는 기능은 아닙니다.
사람이 의자에 앉아 있는 이미지를 첫 프레임, 창가에 서 있는 이미지를 마지막 프레임으로 썼다면 “인물이 의자에서 일어나 천천히 창가로 걸어간다. 카메라는 고정한다”처럼 중간 행동을 설명할 수 있습니다.
구조를 한 줄로 줄이면 이렇습니다.
첫 장면 + 중간에 일어날 일 + 마지막 장면
첫·마지막 프레임은 어디서 시작하고 어디에 도착할지를 정하고, 프롬프트는 그 사이에 무슨 일이 벌어질지를 정합니다.
현재 Video 1.5는 어디까지 지원할까요?
xAI 공식 문서 기준 Grok Imagine Video 1.5는 480p, 720p, 1080p를 지원하며 영상 길이는 최대 15초까지 설정할 수 있습니다.
다만 해상도 제한은 생성 방식에 따라 다릅니다. 공식 문서는 텍스트 투 비디오와 이미지 투 비디오에서 1080p를 지원하지만, Reference-to-Video는 최대 720p라고 명시합니다.
Video 1.5 자체는 6월 16일 정식 API 모델로 공개됐습니다. 당시 xAI는 움직임과 물리 표현, 오디오와 음성, 생성 속도 개선을 핵심 변화로 소개했습니다. 이번 첫·마지막 프레임 제어는 그 모델의 제작 제어 기능을 한 단계 더 넓힌 셈입니다.
처음 테스트한다면 차이를 너무 크게 만들지 않는 편이 좋습니다
시작과 끝이 정해졌다고 해서 어떤 두 이미지든 자연스럽게 이어지는 것은 아닙니다.
인물, 카메라 위치, 배경, 조명, 자세가 한꺼번에 크게 달라지면 AI가 중간에서 해결해야 할 문제가 많아집니다.
처음에는 같은 인물과 비슷한 카메라 구도를 유지하고, 하나의 변화만 주는 편이 결과를 판단하기 쉽습니다. 예를 들어 “서 있는 사람 → 의자에 앉은 사람” 정도부터 시작하는 식이죠.
AI 영상 경쟁, 이제 화질보다 ‘통제’가 중요해집니다
이번 업데이트에서 눈에 들어오는 건 단순히 입력 이미지가 한 장 더 늘었다는 사실이 아닙니다.
생성형 영상이 실제 제작 도구가 되려면 멋진 장면을 우연히 뽑는 것보다 원하는 컷을 얼마나 정확히 설계할 수 있느냐가 중요합니다. 이미지 쪽의 편집 제어 이야기는 ChatGPT Images 2.5 글에서 다뤘습니다.
Grok Imagine은 이미 텍스트·이미지 기반 생성, Reference-to-Video, 영상 편집과 연장을 지원하고 있습니다. 여기에 시작점과 종료점 제어가 추가됐습니다.
특히 여러 짧은 컷을 이어 광고나 스토리 영상을 만드는 사람에게는 꽤 실용적인 변화입니다. 컷의 끝을 다음 장면과 연결하기가 훨씬 쉬워지기 때문입니다.
그래서
Grok Imagine의 첫·마지막 프레임 기능은 화려한 신모델 발표보다 작아 보이지만, 실제 영상 제작에서는 꽤 반가운 업데이트입니다.
이제 “이 사진을 움직여줘”에서 한 단계 더 나아가 “여기서 시작해서 정확히 여기까지 가줘”라고 요구할 수 있게 됐습니다.
앞으로 볼 부분은 두 프레임의 차이가 커졌을 때 인물과 사물을 얼마나 안정적으로 보존하는지, 그리고 반복 생성에서도 중간 동작을 얼마나 일관되게 만들어내는지입니다. 공개된 기능 설명만 보면 Grok Imagine이 단순 생성기보다 ‘컷을 설계하는 도구’ 쪽으로 확실히 이동하고 있습니다.