AI CITY BUILDERS ← 지식 아카이브

[FLOW] 이게 영화야? 구글 VEO 3 미쳤다!

2025년 5월 28일 23:36 조회 20,802회 지식 아카이브

목차

  1. 00:00:38
  2. 00:02:17
  3. 00:02:44
  4. 00:04:41
  5. 00:05:05
  6. 00:06:10
  7. 00:09:17
  8. 00:10:47
  9. 00:13:11
  10. 00:14:46
  11. 00:16:01
  12. 00:19:10
  13. 00:21:35

구글 비오 3(Veo 3)와 플로우(Flow)의 개요 및 주요 특징

구글 비오 3(Veo 3)는 구글 딥마인드(Google DeepMind)가 개발한 영상 생성 인공지능 모델입니다. 플로우(Flow)는 비오 3 모델을 활용하여 비디오를 생성하고 편집할 수 있는 웹 기반 서비스 플랫폼입니다.

멀티모달(Multimodal) 영상 생성 AI란? 단일 텍스트 프롬프트 입력만으로 영상 비주얼, 등장인물의 대사, 배경음악, 효과음(SFX)을 동시에 생성하는 기술을 의미합니다.

기존의 AI 서비스들이 텍스트, 이미지, 음성을 각각 별개의 모델로 생성하여 합성해야 했던 것과 달리, 비오 3는 단 한 번의 프롬프트 처리로 모든 요소를 일합성된 형태로 출력합니다.

구글 AI 멤버십 요금제 및 크레딧 구조

구글 비오 3 서비스를 이용하기 위해서는 구글의 AI 멤버십 구독이 필요합니다. 요금제에 따라 월별 제공되는 크레딧 수가 차등 지급됩니다.

비오 3 기반 영상 1회 생성 시 약 100 크레딧(한화 약 1,000원 상당)이 소요됩니다. 구글 AI 멤버십을 구독할 경우 제미나이(Gemini), 플로우(Flow), 노트북LM(NotebookLM), 구글 드라이브(Google Drive) 등 구글의 주요 AI 및 클라우드 생태계를 통합하여 사용할 수 있습니다.

플로우(Flow)의 세부 설정 및 프롬프트 제어 기술

플로우 내 비디오 생성 설정과 프롬프트 작성 규칙에 따라 출력 품질과 음성 표현 방식이 크게 달라집니다.

  1. 아웃풋 프롬프트(Output Prompts): 1회 프롬프트 입력 시 동시에 생성할 영상의 개수(1~4개)를 지정합니다.
  2. 품질 옵션(Quality): 생성 속도를 우선하는 Fast Quality, 품질을 극대화하는 Highest Quality, 그리고 음성을 동시 합성하는 Experimental Audio 옵션으로 구성됩니다.
  3. 대소문자에 따른 음성 처리 규칙: 대사 입력 시 대문자로 표기하면 알파벳을 하나씩 정음(Spelling)하여 읽고, 소문자로 표기하면 단어 단위의 연속된 음성으로 발음합니다. (예: 대문자 'HER' 입력 시 H-E-R로 발음, 소문자 'her' 입력 시 단어로 발음)
  4. 음향 효과 제어: 키보드 타건음, 마이크 근접 녹음(Close-up mic recording) 등 세부 음향 조건을 영어 프롬프트에 명시하여 고품질 ASMR 음성을 생성할 수 있습니다.
  5. 다국어 대사 연출: 메인 프롬프트는 영어를 지원하지만, 대사 영역에 큰따옴표("")를 사용해 한국어 대사를 입력하면 한국어 발음을 명확하게 구현합니다. 한국인 억양이 반영된 영어 발음 표현도 가능합니다.

시각적 투명도 및 오디오 렌더링 성능

비오 3는 고난도의 물리적 반사 효과와 복합 오디오를 사실적으로 표현합니다.

투명도 조절 및 피사체 반사 연출: 어두운 실내에서 비 내리는 창밖 도시 야경을 촬영하는 구도 생성 시, 유리창의 완벽한 투과율, 피사체의 은은한 투영, 유리창 표면에 흐르는 빗물 효과를 정교하게 상합하여 반사 표면을 구현합니다.

발자국 소리, 빗소리, 배경 음악 등 개별 오디오 트랙이 피사체의 움직임과 정밀하게 동기화(Synchronization)되어 별도의 후속 음향 편집 없이도 완성도 높은 시네마틱/광고 영상을 출력합니다.

비오 3(Veo 3)의 한계점 및 종합 평가

구글 비오 3는 멀티모달 영상 생성의 개가를 이루었으나, 실무 적용 시 일부 기술적 한계가 존재합니다.

지식 아카이브 전체 보기 유튜브에서 보기