AI 영상 생성 입문: 주요 개념과 프롬프트 작성 요령

최근 제미나이를 이용해 영상을 생성해보며 관련 개념을 어느 정도 알아둘 필요가 있다는 생각이 들어 정리해봤습니다. 본 글에서 소개하는 프롬프트까지 작성하지 않더라도 원하는 영상을 AI에게 설명할때 참고할 만한 유용한 내용입니다. 

최초작성 2026.10.7

AI를 사용하여 영상을 생성하다 보면 영상 속 캐릭터가 지시한 대로 움직이지 않고 엉뚱한 동작을 할 때가 종종 발생합니다.

  • 앞으로 걸어가라고 했는데 갑자기 뒤를 돈다.
  • 계단을 끝까지 올라가야 하는데 중간에서 멈추어 뒤로 돌아선다. 
  • 가만히 있어야 하는 사람이 갑자기 움직인다.
  • 의도하지 않은 엉뚱한 말을 한다.

이런 현상은 동작이나 장면에 대한 지시가 충분히 구체적이지 않거나 하나의 영상에서 여러 동작과 조건을 동시에 표현해야 하는 경우 AI가 의도하지 않은 동작이나 장면을 생성함으로 인해 발생할 수 있습니다.

따라서 AI 영상 생성 모델의 특성을 어느 정도 이해한 상태에서 프롬프트를 작성하면 이런 원치 않은 결과가 나오는 걸 줄일 수 있을 듯합니다. 

이 글에서는 AI 영상 생성을 처음 접하는 사람이 이해하기 쉽도록 주요 개념과 프롬프트 작성 방법을 정리해봅니다.

참고: AI 영상 생성 모델과 서비스는 매우 빠르게 발전하고 있습니다. First/Last Frame, Reference Image, 오디오 생성 등 특정 기능에 관한 설명은 2026년 10월 기준입니다. 실제 사용할 때는 해당 서비스의 최신 문서를 함께 확인하는 것이 좋습니다.

.

1. AI 영상 생성은 동영상 편집 프로그램과 다르다

AI 영상 생성은 기존 동영상 편집 프로그램과 다르다는 것을 먼저 이해해야 합니다.

.

일반적인 동영상 편집 프로그램에서는

캐릭터를 오른쪽으로 100픽셀 이동시킨다.

라고 지정하면 프로그램은 정해진 위치만큼 정확하게 이동시킵니다.

.

하지만 생성형 AI에게

남자가 오른쪽으로 세 걸음 걷는다.

라고 입력한다고 해서 반드시 정확히 세 걸음을 걷는다는 보장은 없습니다.

.

AI는 프롬프트를 프로그램 코드처럼 한 줄씩 정확하게 실행하는 것이 아니라 프롬프트와 입력 이미지 등의 조건을 바탕으로 그 조건에 어울리는 영상 시퀀스를 생성하기 때문입니다.

.

여기서 한 가지 주의할 점이 있습니다.

.

AI가 항상

첫 번째 프레임 생성 → 두 번째 프레임 생성 → 세 번째 프레임 생성

처럼 앞 프레임을 본 뒤 다음 프레임을 하나씩 이어 붙이는 방식으로 동작한다고 생각하면 정확하지 않을 수 있습니다.

.

영상 생성 AI가 내부적으로 영상을 만드는 방법은 모델마다 다르기 때문입니다.

.

대표적으로는 다음과 같은 방식이 있습니다.

확산(Diffusion) 기반 모델

처음에는 노이즈에 가까운 상태에서 시작해 점차 영상의 형태를 만들어가는 방식입니다.

최근 이미지와 영상 생성 AI에서 많이 사용되는 방식 중 하나입니다.

Transformer 기반 모델

영상의 여러 요소와 시간에 따른 관계를 처리하는 데 Transformer 구조를 활용하는 방식입니다.

여러 방식을 결합한 모델

최근에는 Diffusion과 Transformer처럼 서로 다른 기술을 결합하여 사용하는 경우도 많습니다.

.

실제로 어떤 기술이 사용되는지는 모델마다 다르고 계속 발전하고 있기 때문에 영상을 만드는 입장에서는 내부 구조를 모두 알 필요는 없습니다.

중요한 것은 AI가

첫 번째 동작 실행 → 두 번째 동작 실행 → 세 번째 동작 실행

처럼 우리가 작성한 명령을 프로그램 코드처럼 차례대로 실행하지 않을 수 있다는 점입니다.

.

따라서

AI는 프롬프트와 입력 이미지 등의 조건을 참고하여 그 조건에 어울리는 영상을 생성한다.

정도로 이해하면 충분합니다.

.

프롬프트 작성시 다음처럼 

      영상을 만들고 싶은 장면(Scene)과 움직임(Motion)을 설명한다.

라고 생각하는 것이 좋습니다.

.

2. Text to Video와 Image to Video

AI 영상 생성에서 많이 접하게 되는 방식은 크게 다음 두 가지입니다.

  • Text to Video - 텍스트를 입력하여 영상 생성
  • Image to Video - 이미지와 텍스트를 입력하여 영상 생성

.

Text to Video

텍스트로 만들고 싶은 영상을 설명하여 영상을 생성하는 방식입니다.

예를 들어 다음처럼 입력할 수 있습니다.

한 여성이 밤의 조용한 거리를 천천히 걷는다.
카메라는 그녀의 뒤에서 천천히 따라간다.
젖은 도로 위로 네온사인이 반사된다.
차분한 분위기의 영화적인 조명.

이 경우 AI가 다음과 같은 요소를 대부분 직접 결정해야 합니다.

  • 여성의 얼굴
  • 옷
  • 거리
  • 건물
  • 화면 구성
  • 카메라 위치
  • 조명
  • 움직임

따라서 자유도는 높지만 생성할 때마다 결과의 변화도 커질 수 있습니다.

Text to Video 프롬프트를 작성할 때는 우선 다음 두 가지를 생각하면 이해하기 쉽습니다.

  1. 화면에 무엇이 보이는가
  2. 화면 속 요소들이 어떻게 움직이는가

.

Image to Video

Image to Video는 이미지를 입력하고 그 이미지를 바탕으로 영상을 생성하는 방식입니다.

.

AI 모델에 따라 이미지의 역할은 조금씩 다를 수 있습니다.

예를 들어 일부 Image to Video 기능에서는 입력 이미지가 첫 번째 프레임 역할을 하며 인물, 구도, 조명, 스타일 등의 정보를 제공합니다.

이 경우 텍스트 프롬프트에서는 이미 화면에 보이는 요소를 다시 장황하게 설명하기보다 움직임에 집중하는 편이 좋습니다.

예를 들어 사람 사진을 한 장 입력하고 다음과 같이 작성할 수 있습니다.

여성은 오른손을 천천히 들어 가볍게 흔들며 인사한다.
자연스럽게 미소 짓는다.
카메라는 촬영 내내 완전히 고정된 상태를 유지한다.

.

Image to Video에서는 입력 이미지가 이미 다음과 같은 정보를 제공할 수 있습니다.

  • 인물
  • 얼굴
  • 옷
  • 배경
  • 구도
  • 조명
  • 전체적인 스타일

따라서 프롬프트에서는 어떻게 움직여야 하는지에 집중하는 편이 좋습니다.

.

다만 모든 모델에서 이미지 입력 기능이 첫 프레임 방식인 것은 아닙니다.

일부 서비스에서는 이미지를 영상의 시작 화면으로 사용하는 것이 아니라 Reference Image, 즉 인물이나 물체, 스타일을 참고하기 위한 이미지로 사용하는 기능도 제공합니다.

.

따라서 사용하는 서비스의  AI 모델에서 다음 기능이 각각 어떤 의미인지 확인하는 것이 좋습니다.

  • Image to Video
  • Start Frame
  • Reference Image

.

한글 프롬프트를 사용해도 될까?

서비스의 AI 모델마다 다릅니다.

한글 프롬프트가 잘 동작하는 서비스라면 그대로 사용해도 됩니다.

하지만 원하는 결과가 잘 나오지 않거나 공식 문서에서 지원 프롬프트 언어를 영어로 명시하고 있다면 같은 내용을 영어로 변환하여 테스트해 보는 것도 좋습니다.

AI 영상을 처음 만든다면 Text to Video보다 Image to Video부터 시작하는 것을 추천합니다. 이미 시작 화면이 정해져 있기 때문에 결과를 예상하고 제어하기가 상대적으로 쉽기 때문입니다.

.

3. 영상 생성에서 Motion은 중요한 개념이다

이미지 생성에서는 기본적으로 “무엇이 보이는가”가 중요합니다.

영상에서는 여기에 “어떻게 움직이는가”가 추가됩니다.

.

영상 속 움직임은 크게 다음 세 종류로 나누어 생각하면 이해하기 쉽습니다.

  • Subject Motion
  • Camera Motion
  • Scene Motion

.

Subject Motion — 피사체 움직임

Subject Motion은 사람이나 물체의 움직임입니다.

예를 들면 다음과 같습니다.

여성이 오른손을 들어 올린다.
개가 카메라를 향해 달려온다.
남자가 천천히 의자에 앉는다.

Camera Motion — 카메라 움직임

Camera Motion은 카메라의 움직임입니다.

영상 프롬프트를 작성하다 보면 영화 촬영에서 사용하는 카메라 용어를 자주 접하게 됩니다.

Locked Camera -- 고정 카메라
카메라는 촬영 내내 완전히 고정된 상태를 유지한다.
Push In -- 피사체 쪽으로 접근
카메라가 피사체를 향해 천천히 접근한다.
Pull Back -- 피사체에서 멀어짐
카메라가 피사체에서 천천히 멀어진다.
Pan -- 좌우 회전
카메라 위치는 그대로 유지한 채 왼쪽 또는 오른쪽으로 회전한다.
Tilt -- 상하 회전
카메라 위치는 그대로 유지한 채 위쪽 또는 아래쪽으로 회전한다.
Dolly -- 카메라 자체의 전후 이동
카메라가 실제로 앞으로 또는 뒤로 부드럽게 이동한다.
Orbit -- 피사체 주위를 원형으로 이동
카메라가 피사체를 중심으로 주위를 돌며 촬영한다.
Arc -- 피사체 주변의 곡선 경로 이동
카메라가 피사체 주변의 일부 구간을 곡선 경로로 이동한다.
Zoom -- 렌즈 초점거리 변경
카메라 위치는 유지하면서 렌즈의 초점거리를 변경하여 피사체가 가까워지거나 멀어지는 것처럼 보이게 한다.
Tracking -- 피사체 추적
카메라가 움직이는 피사체를 따라간다.
Handheld Camera -- 핸드헬드 촬영
손으로 카메라를 들고 촬영한 것처럼 자연스럽고 미세한 흔들림이 있다.

특히 Push In/Dolly와 Zoom은 비슷해 보이지만 다른 촬영 방식입니다.

Push In이나 Dolly In에서는 카메라 자체가 피사체 쪽으로 이동합니다.

반면 Zoom In에서는 카메라의 위치는 유지되고 렌즈의 초점거리만 바뀝니다.

두 방식은 피사체와 배경의 원근감이 다르게 표현될 수 있기 때문에 프롬프트에서도 구분해서 사용하는 것이 좋습니다.

.

Scene Motion — 환경 움직임

Scene Motion은 주변 환경에서 발생하는 움직임입니다.

예를 들면 다음과 같습니다.

바람이 여성의 머리카락을 부드럽게 흔든다.
뜨거운 라면에서 김이 천천히 피어오른다.
달리는 자동차 뒤로 먼지가 일어난다.
나뭇잎이 바람에 부드럽게 흔들린다.

이처럼 작은 환경 움직임을 추가하면 정지 이미지를 단순히 움직인 것 같은 느낌이 줄어들고 영상이 훨씬 자연스럽게 느껴질 때가 많습니다.

.

4. 한 클립에는 하나의 주요 행동을 넣는다

처음 AI로 영상을 생성해보는 사람이 실수하기 쉬운 부분 중 하나가 짧은 영상 안에 너무 많은 행동을 넣는 것입니다.

예를 들어 8초짜리 영상에 다음 내용을 모두 넣었다고 생각해 보겠습니다.

남자가 앞으로 걸어간다.
계단을 올라간다.
뒤를 돌아본다.
손을 흔든다.
의자에 앉는다.
커피를 마신다.
카메라를 바라보며 웃는다.

.

사람에게는 간단한 행동의 연속처럼 보이지만 AI에게는 상당히 복잡한 문제입니다.

.

특히 짧은 영상에서 여러 행동을 순서대로 수행하도록 하면

  • 행동 순서가 바뀌거나
  • 일부 행동을 건너뛰거나
  • 첫 동작이 끝나기 전에 다음 행동을 시작하거나
  • 인물의 형태가 무너지거나
  • 원하지 않는 동작이 추가되는

현상이 발생하기 쉽습니다.

.

처음에는 다음 원칙으로 생각하면 편합니다.

One Clip = One Main Action

즉,

하나의 클립에는 하나의 주요 행동

정도로 생각하는 것입니다.

.

다만 이것은 영상 생성 모델의 절대적인 기술적 제한이 아니라 초보자가 원하는 결과를 안정적으로 얻기 위한 실전 원칙입니다.

여기서 말하는 하나의 주요 행동은 반드시 신체 동작 하나만 의미하는 것은 아닙니다.예를 들어 “계단을 올라 세 번째 계단에서 멈춘다.” 는 엄밀하게 보면 '올라간다'와 '멈춘다'라는 두 동작입니다. 하지만 영상의 목표를 “세 번째 계단까지 이동한다.”라는 하나의 주요 행동과 그 종료 조건으로 볼 수 있습니다.

중요한 것은 서로 관계없는 여러 행동을 짧은 클립 안에 지나치게 많이 넣지 않는 것입니다.

.

여러 행동이 필요하다면 순서를 명확하게 한다

일부 최신 모델은 여러 동작의 순서를 프롬프트에서 지정하는 방식도 지원합니다.

예를 들어

먼저 남자가 고개를 든다.
그다음 카메라를 바라본다.
마지막으로 오른손을 들어 한 번 흔든다.

처럼 작성할 수 있습니다.

.

일부 서비스에서는 대략적인 시간 흐름을 함께 지정할 수도 있습니다.

예를 들어

0~2초: 남자가 고개를 든다.
2~4초: 카메라를 바라본다.
4~6초: 오른손을 들어 가볍게 흔든다.

처럼 표현하는 방식입니다.

.

다만 시간 지정 방식이나 이를 얼마나 정확하게 따르는지는 모델마다 다릅니다.

따라서 초보자라면 먼저 하나의 주요 행동으로 단순화하는 방법을 사용하고, 필요할 때 순차적인 행동이나 시간 지정을 추가하는 것이 좋습니다.

.

영상 길이(Duration)도 함께 생각한다

예를 들어 5초짜리 영상에서

걷기
→ 문 열기
→ 방에 들어가기
→ 의자에 앉기
→ 노트북 열기

까지 모두 수행하도록 하는 것은 쉽지 않습니다.

.

각 행동을 표현할 시간이 필요하기 때문입니다.

.

5초 영상이라면

남자가 문 앞으로 걸어간 뒤 문을 연다.

정도로 제한하고,

.

다음 클립에서는

남자가 방으로 들어가 의자에 앉는다.

처럼 나누는 것이 좋습니다.

.

Scene과 Shot

영상 제작 용어도 조금 알아두면 도움이 됩니다.

.

Scene은 하나의 상황이나 장소를 의미합니다.

예를 들어

카페에서 두 사람이 이야기하는 장면

전체를 하나의 Scene이라고 생각할 수 있습니다.

.

반면 Shot은 카메라가 끊기지 않고 촬영하는 한 구간입니다.

같은 카페 Scene 안에서도 여러 Shot을 만들 수 있습니다.

Wide Shot
카페 안에서 두 사람이 앉아 있는 모습 전체를 보여준다.
Medium Shot
한 사람의 상반신을 중심으로 보여준다.
Close-up
얼굴을 크게 보여준다.

.

AI 영상을 만들 때는 Scene 전체를 한 번에 완벽하게 만들려고 하기보다

Shot 하나씩 생성한다.

라고 생각하는 편이 좋습니다.

.

복잡한 동작은 Shot으로 분해한다

예를 들어 다음 동작을 만들려고 하는데 계속 실패한다고 가정해 보겠습니다.

남자가 계단을 올라간다.
세 번째 계단에서 멈춘다.
뒤를 돌아 카메라를 바라본다.
손을 흔든다.

한 번에 성공시키려고 하기보다 여러 Shot으로 나눌 수 있습니다.

.

Shot 1

남자는 계단을 천천히 올라 세 번째 계단에서 멈춘다.
카메라는 촬영 내내 고정되어 있다.

영상이 완성되면 세 번째 계단에 서 있는 마지막 장면을 캡처합니다.

이 이미지를 다음 Shot의 Start Frame으로 사용합니다.

.

Shot 2

남자는 발의 위치를 그대로 유지한다.
상체와 얼굴을 천천히 카메라 쪽으로 돌린다.
카메라는 계속 고정되어 있다.

다시 마지막 이미지를 다음 Shot의 Start Frame으로 사용합니다.

.

Shot 3

남자는 자연스럽게 미소 지으며 오른손으로 한 번 손을 흔든다.
다른 신체 움직임은 최소화한다.

이런 식으로 문제를 나누면 원하는 영상이 만들어질 가능성을 높일 수 있습니다.

.

5. 프롬프트는 구성요소를 나누어 생각한다

프로그래머라면 영상 프롬프트의 구성요소를 나누어서 생각하는 것이 편할 수 있습니다.

기본적으로 다음과 같이 생각할 수 있습니다.

Subject
Action
Camera
Environment
Style
Audio

조금 더 세분화하면 다음과 같은 형태로 확장할 수 있습니다.

.

[Subject]

누가 또는 무엇이 등장하는가

[Action]

어떤 행동을 하는가

[Direction]

어느 방향으로 움직이는가

[Composition / Framing]

화면 안에서 피사체를 어떻게 보여줄 것인가

예를 들어

  • Wide Shot
  • Medium Shot
  • Close-up
  • 화면 중앙 배치
  • 화면 왼쪽 또는 오른쪽 배치

등입니다.

Text to Video에서는 시작 이미지가 없기 때문에 이러한 화면 구성에 관한 설명이 특히 도움이 될 수 있습니다.

[Camera]

카메라는 어떻게 움직이는가

[Environment Motion]

배경이나 주변에는 어떤 움직임이 있는가

[Timing]

빠르게 움직이는가, 천천히 움직이는가 또는 어떤 순서로 움직이는가

[Style]

실사, 애니메이션, 영화, 광고 등의 스타일

[Lighting]

아침 햇살, 실내 조명, 네온 조명 등의 빛

[Audio]

대사, 효과음, 주변음

.

모든 항목을 반드시 넣어야 하는 것은 아닙니다.

원하는 결과를 만드는 데 필요한 요소만 선택하면 됩니다.

예를 들어 다음처럼 작성할 수 있습니다.

젊은 여성이 지하철 승강장에 서 있다.
여성은 스마트폰을 바라보며 자신의 오른손 엄지로 짧은 메시지를 입력한다.
메시지를 입력한 뒤 고개를 들어 살짝 미소 짓는다.
미디엄 숏으로 여성의 상반신을 화면 중앙에 보여준다.
카메라는 촬영 내내 고정된 상태를 유지한다.
뒤쪽에서는 통근객들이 자연스럽게 걸어간다.
따뜻한 아침 햇살.
얕은 심도.
사진처럼 사실적인 한국 라이프스타일 광고 스타일.
잔잔한 지하철역 주변음.
대사는 없다.

.

여기서 '오른손 엄지'는 인물의 신체 기준이고, 이동 위치를 설명할 때 사용하는 '화면 오른쪽'은 화면 기준입니다.

반드시 항목별로 작성할 필요는 없습니다.

실제로 사용할 때는 자연스럽게 연결해서 작성해도 됩니다.

중요한 것은 프롬프트가 길어지는 것이 아니라

누가
무엇을 하고
어디에서 어떻게 보이며
어떻게 움직이고
카메라는 어떻게 촬영하는가

가 명확하게 드러나는 것입니다.

.

6. 프롬프트는 단순하게 시작하고 한 번에 하나씩 변경한다

생성형 AI를 사용하다 보면 원하는 결과가 나오지 않을수록 프롬프트가 점점 길어지는 경우가 있습니다.

처음에는 “남자가 뒷걸음질하며 걷는다”정도로 시작했다가 원하는 결과가 나오지 않으면 다음처럼  조건이 계속 추가되기도 합니다. 

남자는 반드시 뒷걸음질해야 하며 절대로 뒤를 돌아보거나 앞으로 걷거나 몸을 돌리거나 멈추거나 옆으로 움직여서는 안 된다.

.

하지만 프롬프트가 길다고 반드시 결과가 좋아지는 것은 아닙니다.

오히려 여러 조건을 동시에 만족시키려고 하면서 동작이 이상해질 수도 있습니다.

따라서 처음에는 단순한 프롬프트로 시작한 뒤 필요한 조건을 하나씩 추가하는 것이 좋습니다.

.

프로그래밍의 디버깅과 비슷합니다.

먼저 “남자가 정면을 바라본 상태로 천천히 뒷걸음질한다.”로 테스트합니다.

잘 동작한다면 “남자가 정면을 바라본 상태로 천천히 뒷걸음질하여 계단 쪽으로 이동한다.”라고 확장합니다.

다시 잘 동작한다면 “남자가 정면을 바라본 상태로 계단 쪽으로 뒷걸음질한 뒤 세 번째 계단 위치에서 멈춘다.”처럼 조건을 추가합니다.

그다음 필요하다면 카메라 움직임 등을 추가합니다.

.

결과가 마음에 들지 않는다고 해서 동시에

  • 카메라
  • 캐릭터 행동
  • 조명
  • 속도
  • 배경
  • 스타일

을 모두 변경하면 어떤 변경 때문에 결과가 좋아졌거나 나빠졌는지 알기 어렵습니다.

.

따라서 다음과 같이 한 가지씩 변경하는 것이 좋습니다.

Prompt v1
↓
행동 수정
↓
Prompt v2
↓
카메라 수정
↓
Prompt v3
↓
속도 수정
↓
Prompt v4

.

이러한 Iteration, 즉 반복 개선 과정 자체가 AI 영상 제작에서 매우 중요합니다.

처음부터 완벽한 프롬프트 하나를 만드는 것보다 결과를 확인하면서 문제가 있는 부분을 조금씩 수정하는 편이 현실적입니다.

.

7. 긍정형 표현과 구체적인 행동을 사용한다

일부 영상 생성 모델에서는 하지 말아야 할 행동을 나열하는 것보다 원하는 상태를 직접 설명하는 편이 효과적일 수 있습니다.

예를 들어 “카메라를 움직이지 마세요.” 보다는 “카메라는 촬영 내내 완전히 고정된 상태를 유지한다.”라고 적습니다.

마찬가지로 “뒤돌아보지 않는다.” 보다 “남자는 촬영 내내 정면을 향한 자세를 유지한다.” 라고 작성할 수 있습니다.

.

즉, “하지 말아야 하는 행동”보다는 가능하면 “원하는 상태가 무엇인지”직접 설명하는 것입니다.

다만 모델마다 Negative Prompt의 지원 여부와 처리 방식이 다르므로 모든 모델에 똑같이 적용되는 절대적인 규칙은 아닙니다.

.

추상적인 표현보다 화면에서 확인할 수 있는 행동을 적는다

다음 프롬프트를 생각해 보겠습니다.

여성이 매우 행복해 보인다.

.

사람은 쉽게 이해할 수 있지만 AI 입장에서는 애매할 수 있습니다.

'행복해 보인다'는 것이

  • 웃는 것인지
  • 뛰는 것인지
  • 손뼉을 치는 것인지
  • 고개를 흔드는 것인지

명확하지 않기 때문입니다.

.

따라서 다음처럼 바꿀 수 있습니다.

여성은 환하게 미소 짓는다.
양쪽 어깨를 살짝 들어 올린 뒤 오른손으로 작게 한 번 손을 흔든다.

즉, “감정” 보다는 “화면에서 직접 확인할 수 있는 행동” 을 작성하는 것이 좋습니다.

.

8. Start Frame의 품질과 자세가 중요하다

Image to Video를 사용한다면 시작 이미지인 Start Frame의 품질이 영상 결과를 크게 좌우할 수 있습니다.

AI는 시작 이미지를 중요한 시각적 조건으로 사용하여 영상을 생성하기 때문입니다.

특히 다음과 같은 문제가 있는 이미지는 가능하면 피하는 것이 좋습니다.

  • 손가락이 이미 이상하게 표현된 이미지
  • 얼굴이 흐릿한 이미지
  • 사람이 너무 작게 나온 이미지
  • 팔다리가 다른 물체와 복잡하게 겹친 이미지
  • 앞으로 어떻게 움직여야 할지 예상하기 어려운 자세
  • 인물이 프레임 가장자리에 너무 가까이 있는 이미지

.

입력 이미지에 이미 존재하는 문제가 영상 생성 과정에서 더 크게 드러나는 경우도 있습니다.

또한 Start Frame은 단순히 화질만 좋다고 해서 좋은 시작 이미지가 되는 것은 아닙니다.

이미지 안에 보이는 자세나 움직임의 흔적도 이후 영상에 영향을 줄 수 있습니다.

.

예를 들어 자동차 뒤쪽에 먼지가 크게 날리고 바퀴에 강한 Motion Blur가 표현되어 있다면 이미지는 “자동차가 빠르게 움직이고 있다.”는 느낌을 줍니다.

그 상태에서 “자동차는 촬영 내내 완전히 멈춰 있다.”라고 지시하면 입력 이미지와 프롬프트가 서로 충돌할 수 있습니다.

마찬가지로 사람이 달리는 자세를 하고 있는데 “사람은 현재 위치에서 움직이지 않는다.”라고 하면 원하는 결과를 얻기 어려울 수 있습니다.

.

따라서 Start Frame을 선택할 때는 “내가 만들려고 하는 다음 움직임과 자연스럽게 연결되는 자세인가?”도 함께 확인하는 것이 좋습니다.

.

중요한 영상을 만들 때는 바로 영상을 생성하기보다 다음 순서로 작업하는 편이 성공률이 높은 경우가 많습니다.

이미지 생성
↓
원하는 구도와 자세의 Start Frame 선택
↓
Image to Video

.

9. First/Last Frame과 Reference Image를 활용한다

First Frame과 Last Frame

일부 최신 영상 생성 모델에서는 첫 번째 이미지만 지정하는 것이 아니라 마지막 이미지까지 지정하여 두 상태 사이의 영상을 생성하는 기능을 제공합니다.

예를 들어

첫 번째 이미지
남자가 의자 앞에 서 있다.
마지막 이미지
남자가 의자에 앉아 있다.

라는 두 이미지를 제공하면 AI에게

이 상태에서 저 상태까지 자연스럽게 변화시켜라.

라고 알려주는 것과 비슷합니다.

.

정확한 최종 자세나 위치가 중요한 장면에서는 상당히 유용한 기능입니다.

2026년 10월 현재 Google Cloud의 Veo 3.1은 첫 프레임과 마지막 프레임을 지정한 영상 생성을 지원합니다.

다만 사용하는 환경이나 모델 버전에 따라 세부 기능과 제한은 다를 수 있으므로 실제 사용 환경의 최신 문서를 확인하는 것이 좋습니다.

.

Reference Image와 Character Consistency

여러 장면에서 같은 캐릭터를 사용하면 장면마다 얼굴이나 외형이 달라 보이는 문제가 발생할 수 있습니다.

.

예를 들어 장면 1에서는 “검은 머리 + 둥근 얼굴”이었던 사람이 장면 2에서는 “갈색 머리 + 조금 다른 얼굴”로 바뀔 수 있습니다.

이를 Character Consistency, 즉 캐릭터 일관성 문제라고 합니다.

.

일부 영상 생성 모델에서는 이런 문제를 줄이기 위해 Reference Image를 사용할 수 있습니다.

캐릭터의 기준 이미지를 제공한 뒤 여러 장면에서 같은 인물을 유지하도록 하는 방식입니다.

하지만 Reference Image를 사용한다고 해서 얼굴과 옷이 100% 동일하게 유지된다는 보장은 없습니다.

특히

  • 얼굴의 방향이 크게 바뀌거나
  • 카메라가 얼굴에 매우 가까이 접근하거나
  • 인물이 빠르게 움직이거나
  • 조명이 크게 바뀌거나
  • 장면 자체가 크게 변하면

인물의 외형이 달라질 가능성이 높아질 수 있습니다.

.

여러 Shot에서는 장면 전체의 일관성도 생각한다

여러 Shot을 연결할 때는 얼굴만 유지하면 되는 것이 아닙니다.

다음과 같은 요소도 Shot 사이에서 달라질 수 있습니다.

  • 옷
  • 헤어스타일
  • 배경
  • 소품
  • 조명
  • 색감
  • 전체적인 영상 스타일

예를 들어 첫 번째 Shot에서는 파란 셔츠를 입고 있던 인물이 다음 Shot에서 다른 색상의 셔츠를 입고 나타나거나, 카페의 테이블과 의자 배치가 갑자기 달라질 수 있습니다.

.

따라서 여러 Shot을 하나의 영상으로 연결하려면 캐릭터뿐 아니라

인물 + 배경 + 소품 + 조명 + 스타일

의 일관성도 함께 확인하는 것이 좋습니다.

.

가능하다면 Shot 생성할때 마다 똑같은 Reference Image를  제공하거나 앞 Shot의 마지막 프레임을 다음 Shot의 Start Frame으로 사용하는 방식이 도움이 될 수 있습니다.

Reference Image의 지원 여부와 사용할 수 있는 이미지 수 등은 모델과 서비스에 따라 다릅니다.

.

10. 카메라와 캐릭터를 동시에 복잡하게 움직이지 않는다

다음과 같은 장면은 AI에게 상당히 어려울 수 있습니다.

캐릭터가 빠르게 달린다.
카메라는 캐릭터 주위를 360도로 Orbit한다.
캐릭터가 뒤를 돌아본다.
동시에 카메라가 빠르게 Push In한다.

캐릭터의 움직임도 복잡하고 카메라 움직임도 복잡합니다.

.

이런 경우

  • 얼굴이 변하거나
  • 몸이 뒤틀리거나
  • 배경 구조가 무너지거나
  • 카메라 이동 경로가 이상해지는

현상이 발생할 가능성이 높아집니다.

.

처음에는 둘 중 하나를 단순하게 만드는 것이 좋습니다.

예를 들어 “복잡한 캐릭터 움직임 + 고정 카메라” 또는 “거의 움직이지 않는 캐릭터 + 움직이는 카메라”처럼 구성합니다.

익숙해진 뒤 복잡한 카메라 워크를 추가하는 편이 좋습니다.

영상 생성 모델이 발전하면서 복잡한 움직임을 처리하는 능력도 계속 개선되고 있지만, 안정적인 결과가 중요하다면 움직임을 단순하게 구성하는 것이 여전히 도움이 됩니다.

.

11. 방향과 위치를 명확하게 표현한다

영상에서 방향 표현은 생각보다 중요합니다.

예를 들어 다음은 서로 다른 동작입니다.

.

뒷걸음질한다

남자는 얼굴과 몸을 정면으로 유지한 채 뒷걸음질한다.

몸의 방향은 그대로이지만 이동 방향은 뒤쪽입니다.

몸을 돌려 멀어진다

남자는 몸을 반대 방향으로 돌린 뒤 앞으로 걸어 카메라에서 멀어진다.

카메라에서 멀어진다

남자는 카메라에서 점점 멀어지는 방향으로 이동한다.

카메라 쪽으로 걸어온다

남자는 카메라를 향해 걸어온다.

따라서 단순히

뒤로 간다.

라고 작성하면 AI가

  • 뒷걸음질할지
  • 몸을 돌릴지
  • 화면 안쪽으로 이동할지

임의로 판단할 수 있습니다.

.

신체 기준과 화면 기준을 구분한다

예를 들어

오른손을 들어 올린다.

에서 오른쪽은 캐릭터 자신의 신체 기준입니다.

.

반면

화면 오른쪽으로 이동한다.

에서 오른쪽은 영상을 보는 사람의 화면 기준입니다.

.

따라서 위치나 이동 방향을 설명할 때는 가능하면

  • 화면 왼쪽(Screen Left)
  • 화면 오른쪽(Screen Right)
  • 프레임 왼쪽
  • 프레임 오른쪽

처럼 화면 기준을 사용하면 혼동을 줄일 수 있습니다.

.

사람이 여러 명이면 기준점을 사용한다

사람이 여러 명 등장하는 영상에서 “남자가 움직인다.”라고 하면 어떤 남자를 의미하는지 모호합니다.

이럴 때는 다음처럼 위치를 기준으로 구분할 수 있습니다.

화면 왼쪽에 있는 남자는 움직이지 않고 그대로 서 있다.
화면 중앙에 있는 여성은 앞으로 걸어간다.
화면 오른쪽에 있는 남자는 오른손을 들어 올린다.

.

캐릭터의 옷이나 역할로 구분할 수도 있습니다.

빨간 셔츠를 입은 남자는 움직이지 않는다.
검은 모자를 쓴 여성은 화면 오른쪽으로 걸어간다.

.

12. FPS, Resolution, Aspect Ratio를 이해하자

영상 생성 화면에서 자주 보게 되는 항목입니다.

Resolution

Resolution은 영상의 해상도입니다.

대표적으로

  • 1280 × 720
  • 1920 × 1080
  • 3840 × 2160

등이 있습니다.

해상도가 높을수록 일반적으로 더 선명하게 표현할 수 있지만 생성 비용이나 처리 시간이 증가할 수 있습니다.

모델이 업스케일 기능을 제공한다면 모든 테스트 영상을 처음부터 최고 해상도로 만들기보다 낮은 해상도로 여러 번 테스트한 뒤 최종 후보를 선택하여 업스케일하는 것도 좋은 방법입니다.

지원 가능한 최대 해상도는 사용하는 영상 생성 모델이나 서비스에 따라 다릅니다.

.

FPS

FPS는 Frames Per Second의 약자입니다.

1초 동안 재생되는 이미지, 즉 프레임의 개수를 의미합니다.

예를 들어 “24 FPS”라면 1초 동안 24장의 이미지가 재생됩니다.

영화 느낌의 영상에서 24FPS가 많이 사용됩니다.

다만 FPS가 높다고 해서 AI가 생성하는 사람의 움직임이나 물리 표현 자체가 반드시 더 좋아지는 것은 아닙니다.

.

Aspect Ratio

Aspect Ratio는 화면의 가로세로 비율입니다.

대표적으로 다음과 같습니다.

YouTube 일반 영상 - 16:9
YouTube Shorts, TikTok, Instagram Reels  - 9:16
정사각형 콘텐츠  - 1:1

영상 제작을 시작하기 전에 최종 업로드 플랫폼을 먼저 결정하는 것이 좋습니다.

예를 들어 가로형 16:9 영상을 만든 뒤 억지로 9:16 세로 영상으로 자르면 인물이나 중요한 물체가 잘릴 수 있습니다.

.

13. 대사가 포함된 영상은 말하는 사람과 내용을 명확하게 한다

2026년 10월 기준: 영상과 함께 음성이나 효과음을 생성하는 기능은 일부 모델에서 지원하며 모델별 차이가 큽니다.

최근에는 영상뿐 아니라 음성이나 효과음까지 함께 생성할 수 있는 모델도 있습니다.

대사를 넣을 때는 누가 어떤 언어로 무엇을 말하는지 명확하게 구분하는 것이 좋습니다.

.

예를 들어 다음과 같이 작성할 수 있습니다.

여성은 카메라를 정면으로 바라본다.
여성은 자연스러운 목소리로 다음 문장을 한국어로 한 번만 말한다.
"오늘도 좋은 하루 보내세요."
말을 마친 뒤 자연스럽게 미소 짓는다.
다른 대사는 없다.

.

이처럼

  • 말하는 사람
  • 언어
  • 실제 대사
  • 말한 뒤 행동
  • 추가 대사 여부

를 구분하면 좋습니다.

.

하지만 AI가 생성하는 음성에서는

  • 대사가 바뀌거나
  • 불필요한 말을 추가하거나
  • 발음이 이상하거나
  • 입 모양과 음성이 정확하게 맞지 않는

문제가 발생할 수도 있습니다.

.

대사가 매우 중요한 영상이라면

영상 생성
↓
별도 음성 생성
↓
Lip Sync
↓
영상 편집

방식이 더 안정적인 경우도 있습니다.

.

14. 영상 안의 글자는 특히 주의한다

AI 이미지와 마찬가지로 영상 안에 정확한 글자를 계속 유지하는 것은 까다로운 작업입니다.

예를 들어 가게 간판에

청년 가게

라고 적혀 있다고 해도 영상이 움직이는 과정에서

청년 가게
청 가게
청가

처럼 글자가 바뀔 수 있습니다.

.

특히 카메라가 움직이거나 간판이 작게 보이거나 화면에서 회전하면 글자가 변할 가능성이 커질 수 있습니다.

따라서 중요한

  • 로고
  • 가게 이름
  • 광고 문구
  • 자막
  • 가격

등은 가능하면

AI 영상 생성
↓
영상 편집 프로그램에서 글자 추가

방식을 사용하는 것이 안정적입니다.

유튜브나 다른 플랫폼에 AI로 생성한 영상을 게시한다면 해당 플랫폼에서 요구하는 AI 생성·변경 콘텐츠의 표시 또는 공개 정책도 함께 확인하는 것이 좋습니다.

.

15. 가장 중요한 것은 프롬프트보다 작업 방식이다

AI 영상 생성을 처음 접하면 다음처럼 생각하기 쉽습니다.

완벽한 프롬프트 하나만 만들면 원하는 영상이 바로 만들어질 것이다.

.

하지만 실제 작업은 조금 다릅니다.

사용한 AI 모델에 따라 차이는 있겠지만, 한 번에 긴 영상을 완성하려고 하기보다 장면별 또는 동작별로 여러 개의 짧은 영상을 생성한 뒤 영상 편집 프로그램에서 연결하는 방식이 원하는 결과를 만들기 쉬운 경우가 많습니다.

실제 작업 흐름은 다음과 같이 생각할 수 있습니다.

간단한 프롬프트 작성
↓
영상 생성
↓
문제 확인
↓
한 가지 조건 수정
↓
다시 생성
↓
좋은 결과 선택
↓
다음 Shot 제작
↓
영상 편집

.

즉 AI 영상 제작은 Prompt Engineering만의 문제가 아니라

설계
실험
비교
반복
편집

의 과정이라고 생각하는 편이 좋습니다.

.

프로그래머에게는 오히려 익숙한 방식일 수도 있습니다.

코드를 한 번 작성해서 프로그램이 완성되는 것이 아니라

작성
→ 실행
→ 오류 확인
→ 수정
→ 다시 실행

을 반복하는 것과 상당히 비슷하기 때문입니다.

.

마무리

AI 영상 생성 모델은 빠르게 발전하고 있지만 아직 우리가 작성한 명령을 항상 정확하게 수행하는 동영상 프로그래밍 언어는 아닙니다.

따라서 AI 영상 생성을 잘하려면 “AI에게 복잡한 지시를 많이 하는 것보다 AI가 쉽게 생성할 수 있는 문제로 바꾸는 능력”이 중요합니다.

결국 좋은 AI 영상은 단순히 긴 프롬프트를 적기보단 다음 요소들을 고려해야 합니다. 

명확한 장면
단순하고 구체적인 동작
좋은 시작 이미지
적절한 화면 구성과 카메라 지시
반복적인 테스트

.

앞으로 영상 생성 모델이 발전하면서 지금은 어렵게 느껴지는

  • 캐릭터 일관성
  • 물리적인 상호작용
  • 정확한 동작 수행
  • 긴 영상 생성
  • 글자 유지
  • 음성과 입 모양의 일치

등도 계속 개선될 것으로 보입니다.

.

하지만 모델이 바뀌더라도 “장면을 작은 단위로 나누고, 움직임을 명확하게 정의하고, 결과를 확인하면서 반복적으로 개선하는 방식”은 AI 영상 제작의 기본적인 작업 방법으로 계속 활용할 수 있을 것 같습니다.

.

참고 자료

  • OpenAI — Video generation models as world simulators: 초기 Sora의 Diffusion Transformer와 Spacetime Patch 구조 설명.
  • Google Research — Photorealistic Video Generation with Diffusion Models: W.A.L.T의 Transformer 기반 비디오 확산 모델 연구.
  • Runway — Image to Video Prompting Guide: 입력 이미지, 움직임 중심 프롬프트, Sequential Prompting, 입력 이미지의 Motion Cue 등에 관한 설명.
  • Runway — Text to Video Prompting Guide: Subject, Environment, Lighting, Composition, Style, Motion 등을 이용한 프롬프트 작성 방법.
  • Runway — Camera Terms, Prompts, & Examples: Pan, Tilt, Dolly, Orbit, Arc, Zoom 등 촬영 용어 설명.
  • Runway — What languages can I prompt in?: 영어 이외 언어 프롬프트 사용에 관한 안내.
  • Google Cloud — Veo 3.1: Text/Image to Video, First/Last Frame, Reference Image, Sound Generation 등의 지원 기능과 사양.
  • Google Cloud — Veo 관련 Prompting Guide: Shot Composition, Camera Motion, 스타일 및 프롬프트 구성 방법.
  • Google Cloud — Generate videos using first and last video frames: First/Last Frame 기능 설명.
  • Google DeepMind — Veo 3.1: 캐릭터 및 장면 일관성, Reference Image 등 주요 기능 설명.
  • YouTube Help — 생성형 AI 콘텐츠 사용 공개: AI로 생성하거나 의미 있게 변경한 사실적 콘텐츠에 대한 공개 정책.

관련 글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다