구글이 9월 24일 장면이 바뀌어도 앞뒤가 이어지는 긴 영상을 만드는 AI 연구를 공개했다. Gemini와 Veo를 바탕으로 여러 AI가 기획, 제작, 검토를 나눠 맡는 방식이다. 구글은 이를 이루는 Co-Director, CANVAS, A²RD, VQQA를 소개하고 10분짜리 시연 영상도 함께 내놓았다.
가장 어려운 문제는 짧은 영상들을 하나의 이야기로 이어 붙이는 일이다. 장면마다 화질이 좋아도 인물의 옷이 달라지거나 같은 방의 구조가 바뀌면 흐름이 깨진다. 구글은 기존 제작 방식에서 초반에 생긴 작은 오류가 뒤쪽 영상까지 번지는 점을 문제로 꼽았다. 결국 사람이 같은 장면을 반복해서 손봐야 한다는 것이다.
인물과 장소, 어떻게 그대로 유지하나
Co-Director는 영상 전체의 목적, 이야기 구성, 화면 분위기를 먼저 정한다. 이어 역할을 나눈 AI들이 장면별 줄거리와 시각 자료를 묶어 제작 계획을 세운다. 이를 바탕으로 이미지와 움직임, 해설 음성, 음악을 만든다. 완성된 영상을 AI가 평가한 결과는 다음 제작 단계의 선택을 조정하는 데 쓰인다.
CANVAS는 등장인물, 장소, 물건의 상태를 기록해 두었다가 장면이 바뀔 때 참고한다. 한동안 나오지 않던 장소로 다시 돌아가도 이전 모습을 그대로 이어 가려는 방식이다. 구글은 박물관 절도 장면을 비교 사례로 제시했다. 구글 설명에 따르면 CANVAS는 비교 대상에서 나타난 도둑의 모자가 사라지는 문제나 전시실 구조가 달라지는 문제를 줄였다.
A²RD는 영상을 구간별로 만들면서 앞선 장면의 내용과 움직임을 기억한다. 이야기를 새로 펼칠 때와 기존 인물이나 장소의 모습을 지켜야 할 때 생성 방식을 다르게 조절한다. 구글은 10분짜리 시연에서 등장인물의 얼굴, 옷의 세부 요소, 공간 구조가 끝까지 이어지는 모습을 보여 줬다.
영상에 오류가 생기면 어떻게 고치나
VQQA는 영상에 맞는 질문을 만들어 AI가 답하게 하는 방식으로 문제를 찾는다. 화면 일부를 직접 칠해 고치는 대신, AI에게 주는 지시문인 프롬프트를 고쳐 영상을 다시 만든다. 이렇게 나온 여러 결과물을 처음 요청과 비교한 뒤 가장 높은 평가를 받은 영상을 고른다. 구글은 연주자가 장면마다 다른 악기를 들고 있는 오류를 고친 사례를 소개했다.
구글은 직접 잰 시험에서 이야기와 인물, 배경의 일관성이 좋아졌다고 밝혔다. Co-Director의 한 시험 최고 품질 점수는 81.4였다. 이 연구의 의미는 제작자가 장면을 잇고 반복해서 고치는 작업을 AI에 맡기려는 데 있다. 실제 제작에서 얼마나 손이 덜 갈지는 생성 시간과 비용, 사람이 추가로 고쳐야 하는 정도를 함께 봐야 한다.
