텍스트와 이미지 하나로 수 분짜리 영상을 만드는 13.6B 파라미터 오픈소스 모델
단순한 프롬프트 입력만으로 색이 변하지 않고 품질이 유지되는 긴 영상을 생성할 수 있습니다. 텍스트, 이미지, 기존 영상 세 가지 방식을 하나의 모델로 통합해 처리하는 영상 생성 도구입니다. 최근에는 음성으로 입모양을 맞춰주는 아바타 기능까지 추가되어 활용 범위가 넓어졌습니다.
최신 업데이트: 아바타 1.5 버전 공개
2026년 5월 21일에 LongCat-Video-Avatar-1.5가 공개되었습니다. 이전 버전과 달리 Wav2Vec2 대신 Whisper-Large를 사용해 입모양 동기화 정확도를 높였습니다. 애니메이션이나 동물 등 스타일화된 영역까지 지원하며, 단일 및 다중 오디오 입력을 모두 처리합니다. 단계 증류 기술을 적용해 추론 단계를 8번으로 줄여 속도를 크게 향상시켰습니다.
긴 영상 생성과 효율적인 추론
이 모델은 영상 연속 생성 태스크로 사전 학습되어 수 분 길이의 영상을 만들 때에도 색이 흐려지거나 품질이 떨어지지 않습니다. 시간과 공간 축을 따라 거친 것에서 정교한 것으로 생성하는 전략을 사용해 720p, 30fps 영상을 몇 분 안에 생성합니다. Block Sparse Attention을 적용해 고해상도에서도 효율성을 유지합니다. 내부 및 공개 벤치마크 평가에서 주요 오픈소스 모델 및 최신 상용 솔루션과 동등한 성능을 보인다고 설명합니다.
설치 및 실행 방법
Python 3.10 환경에서 conda로 가상 환경을 만든 후 torch와 flash-attn을 설치해야 합니다. 모델 가중치는 Hugging Face에서 huggingface-cli로 다운로드합니다. 텍스트-영상, 이미지-영상, 영상 연속 생성 등 각 태스크에 맞는 스크립트를 torchrun으로 실행합니다. 단일 GPU뿐 아니라 다중 GPU 환경에서도 컨텍스트 병렬 처리를 통해 실행할 수 있습니다. Streamlit 기반 웹 인터페이스도 제공되어 코드를 직접 쓰지 않고도 테스트할 수 있습니다.
아바타 기능 사용 시 팁
음성-영상 생성 시 오디오 CFG 값을 3~5 사이로 설정하면 입모양 동기화가 가장 잘 맞습니다. 프롬프트에 등장인물의 외모, 행동, 장면 맥락 등 상세한 묘사를 넣으면 일관성과 자연스러움이 높아집니다. 반복되는 동작을 줄이려면 --ref_img_index를 0~24 사이로, --mask_frame_range를 적절히 조정해야 합니다. 1.5 버전에서는 --use_distill 옵션을 반드시 추가해야 하며, VRAM 사용량을 줄이려면 --use_int8을 함께 사용할 수 있습니다.
적용 전 확인 사항
모델 가중치는 MIT 라이선스로 공개되어 있어 상업적 이용이 가능합니다. 다만 모든 하위 애플리케이션에 대해 포괄적으로 평가된 것은 아니므로, 민감하거나 고위험 시나리오에 배포하기 전 정확성과 안전성을 직접 검증해야 합니다. 데이터 보호와 콘텐츠 안전 관련 법규를 준수하는 것은 개발자의 책임입니다. 특정 언어별 성능 차이 등 대규모 언어 모델의 일반적 한계를 고려하여 사용 범위를 결정하는 것이 좋습니다.