구글 옴니(Gemini Omni) 장점과 사용법, 다른 모델과 어떤 점이 다를까요?
구글 옴니(Gemini Omni)는 글, 이미지, 소리, 영상을 한 번에 입력받아 소리까지 붙은 영상을 만들어 내는 통합 멀티모달 모델입니다. 대화로 영상을 고치는 방식과 Veo 3.1과의 차이, 사용처와 요금을 공식 데모 영상과 함께 정리했습니다.

구글 옴니(Gemini Omni)는 글, 이미지, 소리, 영상을 한 번에 입력받아 소리까지 붙은 영상을 만들어 내는 통합 멀티모달 모델입니다. 2026년 5월 19일 Google I/O에서 공개됐고, 실제 쓰이는 변형은 Gemini Omni Flash입니다. 국내에서는 구글 옴니나 옴니 플래시로 불립니다.
구글에는 이미 Veo라는 영상 모델이 있습니다. 그래서 옴니가 무엇이 다른지, 둘 중 무엇을 써야 하는지가 첫 질문이 됩니다. 이 글에서는 옴니의 구조와 대화형 편집 방식을 공식 데모 영상으로 보여주고, Veo 3.1과의 역할 차이, 사용처와 요금을 정리합니다.
구글 옴니는 어떤 모델일까요?
멀티모달이라는 말이 프롬프트나 모델 이름보다 상대적으로 낯설 수 있습니다. 여러 종류의 입력을 한 모델이 함께 다룬다는 뜻입니다. 옴니는 그 범위가 넓습니다. 글, 이미지, 소리, 영상, 스케치를 한 프롬프트에 섞어 넣으면 영상과 편집된 사진, 아바타를 돌려줍니다.
기존 방식은 영상 모델과 오디오 모델을 따로 돌린 뒤 붙였습니다. 옴니는 한 번에 처리합니다. 화면 내용과 카메라 움직임, 장면의 물리 상태를 함께 보고 어떤 소리가 맞는지 판단합니다. 그래서 소리가 겉돌지 않습니다.
물리 표현도 이 구조에서 나옵니다. 중력, 운동 에너지, 유체 흐름을 이해한다고 구글은 설명합니다.
위 영상은 구글이 공개한 옴니 데모입니다. 원본 출처: Watch 9 Google videos of Gemini Omni and Gemini 3.5 Flash (구글 공식 블로그)
대화로 영상을 고친다는 것은 무슨 뜻일까요?
옴니에서 가장 눈에 띄는 지점입니다. 만든 영상이 마음에 들지 않을 때 프롬프트를 새로 써서 다시 뽑는 것이 아니라, 바꿀 부분만 말로 설명합니다. 구글 공식 데모를 순서대로 보면 이해가 빠릅니다.
먼저 원본입니다. 실내에서 바이올린을 연주하는 장면입니다.
여기에 배경을 야외로 바꾸고 바이올린을 보이지 않게 해 달라고 요청한 결과입니다. 연주자와 동작, 활의 움직임은 그대로 두고 요청한 부분만 바뀌었습니다.
이어서 각도를 바꿔 달라고 한 결과입니다. 앞선 두 번의 요청 내용을 유지한 채 시점만 뒤로 옮겨 갔습니다.
위 세 영상은 구글이 공개한 옴니 멀티턴 편집 데모입니다. 원본 출처: Watch 9 Google videos of Gemini Omni and Gemini 3.5 Flash (구글 공식 블로그)
기술적으로는 Interactions API가 이 동작을 맡습니다. 이전 생성 결과에 붙은 번호를 다음 요청에 함께 넘기면, 모델이 앞선 맥락을 그대로 이어받습니다. 소재를 다시 올릴 필요가 없습니다.
Veo 3.1과는 어떻게 나눠 써야 할까요?
구글이 영상 모델을 두 개 두고 있어서 헷갈리기 쉽습니다. 경쟁 관계가 아니라 작업 단계가 다릅니다.
| 항목 | 구글 옴니 | Veo 3.1 |
|---|---|---|
| 성격 | 여러 입력을 함께 다루는 대화형 모델 | 영상에 특화된 고품질 생성기 |
| 입력 | 글, 이미지, 소리, 영상, 스케치 | 글 중심, 시작 이미지 |
| 수정 방식 | 대화로 여러 번 고침 | 프롬프트를 바꿔 새로 생성 |
| 해상도 상한 | 720p | 4K |
| API 상태 | 2026년 6월 30일 공개, 프리뷰 | 2025년 말부터 안정 운영 |
| 맞는 단계 | 아이디어와 반복 수정 | 마무리 결과물 |
정리하면 옴니는 시안을 빠르게 굴리는 도구이고, Veo 3.1은 완성본을 뽑는 도구입니다. 해상도가 720p에서 막히므로 옴니 결과를 그대로 최종 납품물로 쓰기는 어렵습니다. 옴니로 구도와 연출을 잡고 Veo로 다시 뽑는 흐름이 현실적입니다.
다른 회사 모델과의 비교는 영상 AI 모델별 실제 영상 비교 글에 정리해 두었습니다.
어디서 어떻게 쓸 수 있을까요?
2026년 8월 기준 사용 경로는 네 갈래입니다.
- 제미나이 앱과 YouTube Shorts: 가장 쉬운 경로입니다. 무료 등급에서도 열리고, 10초 클립을 만듭니다.
- Flow: 구글의 영상 제작 도구입니다. 무료 등급은 하루 50크레딧 안팎, Pro 등급은 월 1,000크레딧을 줍니다.
- Google Vids: 워크스페이스의 영상 문서 도구에 들어가 있습니다.
- API와 AI Studio: 모델 이름은
gemini-omni-flash-preview입니다. 영상 출력 100만 토큰당 $17.50이고, 720p 기준 초당 약 $0.10입니다. 무료 API 등급은 없습니다.
구글 옴니를 쓸 때 알아둬야 할 제한적인 점도 있습니다.
- 유럽 경제 지역과 스위스, 영국에서는 영상 편집 기능이 열리지 않습니다.
- 영어만 완전히 지원됩니다. 한국어 프롬프트는 검증되지 않은 상태라 영어로 옮겨 넣는 편이 안정적입니다.
- 소리를 참조 자료로 넣는 기능은 아직 지원되지 않습니다. 소리 출력은 모든 생성에서 동작합니다.
- 온도 조정이나 시스템 지시문 같은 세부 제어는 쓸 수 없습니다.
3줄 요약
- 구글 옴니는 글, 이미지, 소리, 영상을 한 번에 받아 소리까지 붙은 영상을 만드는 통합 멀티모달 모델입니다.
- 가장 큰 장점은 대화형 편집입니다. 바꿀 부분만 말하면 나머지 화면은 유지한 채 그 부분만 고칩니다.
- 해상도가 720p에서 막히고 API도 프리뷰 단계라, 아이디어와 수정은 옴니로, 최종본은 Veo 3.1로 나누는 방식이 현실적입니다.
Sources
- Generate and edit videos with Gemini Omni Flash (Gemini API 공식 문서)
- Gemini Omni Flash 모델 문서 (Google AI for Developers)
- Watch 9 Google videos of Gemini Omni and Gemini 3.5 Flash (구글 공식 블로그)
- Gemini Omni Flash now available in Google Vids (구글 워크스페이스 블로그)
- Gemini Developer API 가격 책정
- 100 things we announced at Google I/O 2026 (구글 공식 블로그)
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.
다음으로 읽어볼 글

클링 AI와 Veo 3.1은 글이나 이미지를 넣으면 움직이는 영상을 만들어 주는 생성 모델입니다. 초당 단가는 Veo 3.1 표준이 $0.75, 클링 3.0이 $0.10으로 7.5배 차이 납니다. 두 모델에 Seedance 2.0과 Wan을 더해 실제 생성 영상과 항목별 성능을 비교했습니다.
2026. 8. 1.
AX(AI Transformation)는 AI를 업무 절차와 판단 구조에 결합해 조직이 일하는 방식을 다시 설계하는 전환입니다. AX 뜻과 DX와의 차이, 엔비디아의 토큰 사용량 평가, 컨설팅 현장에서 확인한 평범한 병목을 공개 연구 자료와 함께 정리했습니다.
2026. 8. 1.
제미나이 CLI(Gemini CLI)는 구글이 만든 오픈소스 터미널 AI 코딩 에이전트입니다. 개인 구글 계정으로 로그인하면 하루 1,000회까지 무료로 쓸 수 있습니다. 설치 세 가지 방법, 첫 실행과 모델 선택, 요금제별 한도, 코덱스 CLI와 클로드 코드의 차이를 정리했습니다.
2026. 8. 2.
구글 클라우드에서 24시간 실행되는 에이전트형 AI 비서, 제미나이 스파크의 Task, Schedule, Skill 사용법과 요금제, 그리고 구글 워크스페이스의 Gmail과 Drive를 읽어 맥락을 파악하는 개인 인텔리전스를 정리합니다.
2026. 7. 31.구글 옴니가 다른 영상 모델과 가장 크게 구별되는 지점은 무엇일까요?
