AI 쇼츠 만드는 순서: 대본, 이미지, 영상, 음성, 자막
AI 쇼츠 제작 순서는 대본을 먼저 쓰고 장면별 이미지와 영상 클립을 만든 뒤 음성과 자막을 얹어 한 편의 세로 영상으로 합치는 작업 흐름입니다. 클립을 먼저 만들지 않고 대본과 장면 계획표부터 정해야 다시 만드는 횟수가 줄어듭니다.
같은 말:AI 쇼츠 만들기AI 쇼츠 제작 순서AI 유튜브 쇼츠AI 숏폼 제작쇼츠 자동화
목차
🤔 클립은 여러 개 만들었는데 한 편의 영상이 되지 않을 때
AI 영상 도구로 멋진 클립을 몇 개 만들고 나면 막상 이어 붙일 때 문제가 드러납니다. 장면마다 주인공 얼굴이 다르고, 클립 길이가 내레이션과 맞지 않고, 화면 속 글자는 깨져 있습니다. 클립을 다시 만들다 보면 크레딧이 금방 바닥나고, 결국 한 편을 완성하지 못한 채 끝나는 경우가 많습니다.
클립부터 만든 것이 원인인 경우가 대부분입니다. 영화 촬영장에서 카메라를 켜기 전에 장면 계획표부터 짜듯, AI 쇼츠도 대본과 장면 계획을 먼저 정하고 그에 맞춰 클립을 만들어야 다시 만드는 횟수가 줄어듭니다. 이 편에서는 대본부터 업로드까지 짧은 세로 영상 한 편을 만드는 순서를 도구와 상관없이 정리합니다.
🔑 AI 쇼츠 제작 순서의 정의
AI 쇼츠 제작 순서는 대본을 먼저 쓰고 장면별 이미지와 영상 클립을 만든 뒤 음성과 자막을 얹어 한 편의 세로 영상으로 합치는 작업 흐름입니다.
쇼츠는 유튜브의 짧은 세로 영상 형식입니다. 유튜브 도움말 기준으로 쇼츠는 3분까지 올릴 수 있고 정사각형이나 세로 비율이어야 합니다. 인스타그램 릴스나 틱톡도 세로 영상이라 같은 순서로 만들 수 있습니다.
🗺️ 전체 순서 한눈에 보기
| 단계 | 하는 일 | 결과물 | 주의할 점 |
|---|---|---|---|
| 1. 대본 | 전할 내용을 문장으로 씁니다 | 내레이션 원고 | 직접 읽어 보고 길이를 잽니다 |
| 2. 장면 계획표 | 문장마다 보여 줄 화면을 정합니다 | 장면별 표 | 장면 하나에 클립 하나 |
| 3. 장면 이미지 | 장면마다 첫 화면 이미지를 만듭니다 | 세로 이미지 여러 장 | 같은 기준 이미지로 인물 유지 |
| 4. 영상 클립 | 이미지를 움직여 클립을 만듭니다 | 짧은 클립 여러 개 | 여러 번 뽑을 크레딧을 잡아 둡니다 |
| 5. 음성 | 원고를 읽은 내레이션을 만듭니다 | 음성 파일 | 클립에 딸려 온 소리를 정리합니다 |
| 6. 자막과 편집 | 클립과 음성, 자막을 합칩니다 | 완성 영상 | 한글 자막은 여기서 얹습니다 |
| 7. 확인과 업로드 | 오류를 확인하고 올립니다 | 게시물 | AI 공개와 표시 의무를 확인합니다 |
✍️ 1단계와 2단계: 대본과 장면 계획표
대본이 먼저입니다. 무엇을 보여 줄지가 아니라 무엇을 말할지부터 정하면 장면이 저절로 나뉩니다. 대본을 쓴 뒤에는 직접 읽어 보며 초시계로 길이를 잽니다. 읽는 속도는 사람과 음성 합성 도구마다 달라서 직접 재 보는 편이 정확합니다.
그다음 문장마다 보여 줄 화면을 표로 정리합니다. 영상 제작에서 콘티라고 부르는 장면 계획표입니다. 한강 잠수교를 설명하는 30초 쇼츠라면 이런 표가 나옵니다. 가상의 예시입니다.
| 장면 | 길이 | 화면 | 내레이션 | 자막 |
|---|---|---|---|---|
| 1 | 8초 | 수면 바로 위에 낮게 놓인 다리를 멀리서 비추는 장면 | 한강에는 물에 잠기도록 만든 다리가 있습니다 | 물에 잠기는 다리 |
| 2 | 8초 | 강물이 불어나 다리 위를 덮는 장면 | 비가 많이 오면 이 다리는 통행을 막습니다 | 수위가 오르면 통제 |
| 3 | 8초 | 다리를 잘라 위아래 두 층 구조를 보여 주는 단면 | 바로 위에는 또 하나의 다리가 겹쳐 있습니다 | 2층 구조 |
| 4 | 6초 | 두 다리 사이 높이를 표시하는 붉은 치수선 | 그래서 한 다리가 잠겨도 다른 다리로 건넙니다 | 위층은 그대로 |
장면 하나를 클립 하나로 만드는 것이 기본입니다. 한 클립에 장면 여러 개를 억지로 담으면 원하는 순서대로 나오지 않을 때 전부 다시 만들어야 합니다.
🖼️ 3단계: 장면 이미지 만들기
AI 영상 생성 뜻에서 본 것처럼, 글에서 바로 영상을 만들기보다 첫 화면 이미지를 먼저 확정하고 움직이는 쪽이 실패가 적습니다. 장면 이미지를 만들 때는 세 가지를 지킵니다.
- 처음부터 세로 9:16으로 만듭니다: 가로 이미지를 잘라 쓰면 피사체가 잘립니다
- 인물은 같은 기준 이미지로 유지합니다: 장면마다 기준 얼굴을 참조로 넣습니다. 방법은 인물과 캐릭터 일관성에서 다뤘습니다
- 글자를 넣지 않습니다: 프롬프트에 글자와 숫자를 넣지 말라는 문장을 붙여 배경에 알아볼 수 없는 문자가 생기는 것을 막습니다
🎬 4단계: 영상 클립 만들기
장면 이미지를 영상 모델에 넣고, 카메라 움직임과 대상의 움직임만 글로 적습니다. "천천히 다가가는 카메라", "물이 차오르며 다리 위를 덮는다"처럼 한 장면에 움직임 한두 가지면 충분합니다.
클립 사이가 튀지 않게 하려면 앞 클립의 마지막 화면을 다음 클립의 첫 화면으로 넘깁니다. 구글 Veo는 첫 화면과 끝 화면을 함께 지정하는 기능을 두고 있어서, 두 장면을 잇는 전환 클립을 만들 때도 씁니다.
크레딧은 넉넉히 잡습니다. 한 번에 원하는 클립이 나오는 경우는 드물어서 장면마다 두세 번은 다시 만들게 됩니다. 2026년 9월 28일 구글 플로우 도움말 기준으로 계산하면 다음과 같습니다.
| 기준 | 클립 수 | 필요한 크레딧 (Omni Flash 720p 10초 = 15크레딧) |
|---|---|---|
| 한 번에 다 나올 때 | 4개 | 60 |
| 장면마다 두 번씩 만들 때 | 8개 | 120 |
| 장면마다 세 번씩 만들 때 | 12개 | 180 |
구글 플로우는 구독 없이 하루 50크레딧을 주므로, 한 번에 다 나와도 60크레딧인 한 편을 무료로 하루에 끝내기는 어렵습니다. 무료 계정은 연습과 시험용으로 보고, 정기적으로 올릴 계획이라면 유료 요금제의 월 크레딧으로 계산합니다. 실제 제작 과정과 운영비 계산은 신비한 건축사전 스타일 쇼츠 만드는 과정에 자세히 있습니다.
🎙️ 5단계: 음성 만들기
내레이션은 직접 녹음하거나 음성 합성(TTS, 글을 읽어 주는 AI) 도구로 만듭니다. 이때 두 가지를 챙깁니다.
- 클립에 딸려 온 소리를 정리합니다: 소리까지 만드는 영상 모델로 만든 클립에는 물소리나 배경음이 이미 들어 있습니다. 내레이션을 얹으려면 원래 소리를 줄이거나 지웁니다
- 남의 목소리를 흉내 내지 않습니다: 음성 합성 도구 가운데 목소리를 복제하는 기능이 있는데, 실존 인물의 목소리를 허락 없이 복제해 쓰면 초상과 같은 권리 문제가 생깁니다
🔤 6단계: 자막과 편집
클립과 음성을 편집 프로그램에서 합치고 자막을 얹습니다. 화면에 들어가야 하는 한글은 이 단계에서 넣습니다. 영상 모델은 글자를 그림으로 그려서, 구글 플로우로 한글 라벨을 요청한 실험에서는 수위 상승이 4위 상승으로 바뀌어 나왔습니다.
규격도 이 단계에서 확인합니다. 구글 플로우 무료 계정으로 받은 클립은 가로 720, 세로 1280이라 쇼츠에서 흔히 쓰는 가로 1080, 세로 1920보다 작습니다. 화질을 키우는 기능을 쓰거나 유료 요금제의 높은 해상도로 만듭니다.
✅ 7단계: 올리기 전에 확인할 것
- 화면 오류를 확인합니다: 손가락, 글자, 로고, 배경에 어긋난 곳이 없는지 봅니다. 확인 목록은 AI 이미지 검수 목록에 정리했습니다
- AI 사용을 공개합니다: 유튜브는 실제로 일어나지 않은 사실적인 장면이나 실제 인물이 하지 않은 말과 행동, 실제 사건 영상을 바꾼 콘텐츠를 올릴 때 AI 사용 공개를 요구합니다. 명백히 비현실적인 내용이나 대본과 썸네일에만 AI를 쓴 경우는 공개 대상이 아닙니다
- 수익 정책을 확인합니다: 유튜브는 2025년 7월 15일 반복 콘텐츠 정책의 이름을 진정성 없는 콘텐츠로 바꾸고, 대량 생산된 느낌을 주는 틀에 박힌 AI 생성 콘텐츠를 여기에 포함했습니다
- 광고라면 표시 의무를 확인합니다: AI 가상인물이 제품을 추천하는 영상에는 가상인물 표시가 필요합니다. 기준은 저작권과 광고 표시 편에서 다룹니다
⚠️ AI 쇼츠를 만들 때 자주 하는 실수
- 클립부터 만듭니다: 대본 없이 만든 클립은 길이와 순서가 맞지 않아 대부분 다시 만들게 됩니다
- 한 클립에 장면을 여러 개 넣습니다: 원하는 순서가 한 번에 나오지 않으면 전부 다시 만들어야 합니다
- 같은 형식을 찍어 내듯 반복합니다: 수익 정책의 제한 대상이 될 수 있습니다. 주제마다 직접 확인한 정보를 담는 편이 안전합니다
❓ 자주 묻는 질문
쇼츠 한 편은 몇 초로 만드는 것이 좋나요?
유튜브 쇼츠는 3분까지 올릴 수 있지만 AI로 만든다면 클립 수가 곧 비용입니다. 처음에는 클립 서너 개, 30초 안팎으로 시작해 한 편을 끝까지 완성해 보는 편이 낫습니다. 길이를 늘리기보다 첫 장면에서 무엇을 보여 줄지를 먼저 정하는 편이 낫다고 봅니다.
이 과정을 한 도구에서 다 할 수는 없나요?
일부는 됩니다. 구글 플로우는 클립을 장면 단위로 모아 이어 붙이는 기능이 있고, 힉스필드 같은 서비스는 이미지 생성과 영상 생성, 해상도 올리기를 한곳에서 합니다. 다만 한글 자막과 내레이션 정리는 대부분 편집 프로그램에서 마무리하게 됩니다.
AI로 만든 쇼츠도 수익을 낼 수 있나요?
유튜브 파트너 프로그램의 조건을 채우면 가능합니다. 다만 대량 생산된 느낌의 틀에 박힌 AI 콘텐츠는 진정성 없는 콘텐츠로 보아 수익 창출이 제한될 수 있고, AI 사용 공개를 반복해서 하지 않으면 콘텐츠 삭제나 파트너 프로그램 정지 조치가 있을 수 있다고 유튜브가 안내합니다.
📋 3줄 요약
-
AI 쇼츠는 대본과 장면 계획표를 먼저 쓰고 장면별 이미지와 영상 클립, 음성, 자막 순서로 만든 뒤 편집 프로그램에서 한 편으로 합칩니다.
-
구글 플로우 도움말 기준 Omni Flash 720p 10초 클립 하나에 15크레딧이 들어 클립 네 개짜리 한 편에 60크레딧이 필요하므로 하루 50크레딧인 무료 계정은 연습용에 가깝습니다.
-
유튜브는 실제로 일어나지 않은 사실적인 장면에 AI 사용 공개를 요구하고 틀에 찍어 낸 듯한 대량 생산 AI 영상은 수익 창출 제한 대상이 될 수 있어 직접 확인한 정보를 담아야 합니다.
📚 참고 자료
- 유튜브 고객센터, 쇼츠 업로드: https://support.google.com/youtube/answer/15424877
- 유튜브 고객센터, 변경되거나 합성된 콘텐츠 공개: https://support.google.com/youtube/answer/14328491
- 유튜브 고객센터, 수익 창출 정책: https://support.google.com/youtube/answer/1311392
- 구글 플로우 고객센터, AI 크레딧 관리: https://support.google.com/flow/answer/16526234
- 구글 Gemini API 문서, Veo: https://ai.google.dev/gemini-api/docs/veo

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
AI로 만든 쇼츠 화면에 한글 제목 자막이 들어가야 합니다. 가장 안전한 방법은 무엇일까요?

