AI 테스트 RTX-5090

[RTX 5090 32GB] 로컬 AI로 한국어 영상 만들기, LTX-2.5는 5초 영상을 20초에 만들었고 대사도 또렷했다

2026년 10월 04일 10회 1시간 전
[RTX 5090 32GB] 로컬 AI로 한국어 영상 만들기, LTX-2.5는 5초 영상을 20초에 만들었고 대사도 또렷했다

Lightricks의 영상 생성 모델 LTX-2.5를 RTX 5090 32GB에서 ComfyUI로 돌려 봤습니다. 공식 템플릿 기본 설정 그대로, 소리가 들어간 5초짜리 1280×704 영상 한 편을 약 20초에 만들었습니다. VRAM은 최대 31.2GB로 32GB를 거의 다 썼습니다.

  • 풀HD(1920×1088) 5초 영상은 50.5초, 15초 영상(1280×704)은 69.0초가 걸렸습니다. 모두 실패 없이 끝났습니다.
  • 한국어 질문도 알아듣고, 한국어 대사도 말합니다. "안녕하세요, 오늘은 로컬 AI로 영상을 만들어 보겠습니다."를 지시한 대로 말하는 영상이 나왔습니다.
  • 한국에서 써도 되는 모델입니다. 라이선스에 지역 제한이 없고, 연 매출 1,000만 달러 미만이면 무료입니다. 같은 시기에 나온 MiniMax H3는 한국이 제외 지역이라 테스트하지 않았습니다.

이 글의 영상은 모두 AI(LTX-2.5)로 만든 것이고, 등장하는 인물은 실존 인물이 아닙니다. 영상에는 소리가 들어 있습니다. 재생한 뒤 음소거를 풀면 들립니다.

LTX-2.5 요약: 5초 영상 한 편 20.0초(5번 평균, 19.8~20.3초), 프로그램을 켠 뒤 첫 실행 49.3초, VRAM 최대 31.2GB, 풀HD 5초 50.5초, 15초 영상 69.0초, 한국 사용 가능

RTX 5090에서 ComfyUI 공식 템플릿으로 잰 핵심 숫자입니다.

AI로 만든 영상(LTX-2.5). 1280×704, 5초, 24fps. 빗소리와 국물 끓는 소리가 함께 들어 있습니다.

어떻게 테스트했나

항목내용
그래픽카드RTX 5090 32GB (드라이버 616.92), 시스템 램 64GB
프로그램ComfyUI 0.38.2 (Comfy Desktop), PyTorch 2.12.1
작업 흐름ComfyUI에 들어 있는 공식 템플릿 "LTX-2.5: Text to Video". 질문·해상도·길이·시드만 바꿈
기본 설정0.9메가픽셀 16:9(1280×704), 5초, 24fps, 질문 늘려 쓰기(prompt_enhance) 끔
측정생성 시간은 ComfyUI가 기록한 실행 시작~끝. VRAM·GPU 사용률·전력·시스템 램은 0.5초마다 기록. 단계별 시간은 ComfyUI가 알려 주는 노드 실행 신호로 나눠 잼
반복기본 조건(1280×704, 5초)은 시드만 바꿔 5번. 해상도·길이·질문별 측정은 한 번씩
날짜2026년 10월 4일

이 블로그는 평소 Unsloth Studio 기본값으로 재지만, Unsloth Studio의 영상 목록에는 LTX-2.3까지만 있고 LTX-2.5가 없습니다. 그래서 이번 글은 ComfyUI로 쟀습니다. 직전 글인 Qwen-Image-2.1 이미지 테스트와는 프로그램이 다르다는 점을 알고 봐 주세요.

ComfyUI 창에 video_ltx2_5_t2v 작업 흐름이 열려 있다. 해상도 선택기와 Text to Video (LTX-2.5) 노드, 비디오 저장 노드가 연결돼 있다

ComfyUI에서 공식 템플릿을 연 모습입니다.

LTX-2.5는 어떤 모델인가

항목내용
만든 곳Lightricks
공개2026년 7월
크기영상·소리를 만드는 부분 22B, 글을 이해하는 부분은 Gemma 4 12B
특징(제작사 설명)영상과 소리를 함께 생성, 한 번에 여러 장면(멀티샷), 또렷한 얼굴과 글자
이번에 쓴 판증류(distilled) 모델의 INT8 판. 적은 단계로 빨리 만드는 판입니다
라이선스LTX-2.x Community License(2026년 8월 11일자)

이 표가 뜻하는 것은, LTX-2.5가 그림만이 아니라 대사와 효과음까지 한 번에 만드는 모델이라는 점입니다. 영상을 만든 뒤 소리를 따로 붙이는 방식이 아닙니다.

쓴 파일과 크기

역할파일크기
영상·소리 모델(INT8)ltx-2.5-22b-distilled-transformer-comfy-int8-convrot21.5GB
글 이해 모델(INT8)gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot15.4GB
영상 VAEltx-2.5-video-vae-bf161.5GB
해상도 2배 올리는 모델ltx-2.5-latent-spatial-upscaler-x2-bf16-1.01.0GB
소리 VAEltx-2.5-audio-vae-bf160.4GB
합계39.7GB

이 표가 뜻하는 것은, 디스크에 약 40GB가 필요하고 파일 합계가 VRAM 32GB보다 크다는 점입니다. 그래서 ComfyUI가 필요한 부분만 그래픽카드에 올렸다 내렸다 하면서 돌립니다. 질문을 늘려 쓰는 기능을 켜려면 Gemma 4 E2B 파일(5.2GB)이 하나 더 필요하지만, 이번에는 껐습니다.

ComfyUI의 Text to Video (LTX-2.5) 노드. prompt_enhance false, duration 5, frame_rate 24, 모델 파일 이름들. 왼쪽 해상도 선택기는 16:9, 메가픽셀 0.9, 배수 32

템플릿에서 바꿀 수 있는 값입니다. 질문, 길이(초), 시드, 초당 프레임, 그리고 왼쪽의 비율과 메가픽셀입니다.

한국에서 써도 되나

됩니다. LTX-2.x Community License에는 한국을 빼는 조항이 없습니다. 지역 제한은 국제 제재 대상 지역과 수출 통제 위반만 해당합니다. 유료 라이선스가 필요한 곳은 이렇게 정해져 있습니다.

Entities with annual revenues of at least $10,000,000 ... are required to obtain a paid license

LTX-2.x Community License Agreement 2.1절

쉽게 말하면 연 매출이 1,000만 달러 이상인 회사만 돈을 내고, 그 아래는 상업적으로 써도 무료입니다. 예를 들어 개인 블로그나 작은 유튜브 채널에서 이 모델로 만든 영상을 올리는 것은 허락 범위 안입니다. 결과물에 대한 권리도 Lightricks가 주장하지 않습니다.

모델한국에서 사용상업 이용
LTX-2.5가능연 매출 1,000만 달러 미만 무료
MiniMax H3불가(한국·미국·유럽연합·영국 제외). 별도 허락 필요허락 지역 안에서만 가능. 연 매출 2,000만 달러를 넘으면 사전 허락 필요
Wan 2.2가능Apache 2.0, 제한 없음
Qwen-Image-2.1(이미지)가능불가(연구·평가용)

이 표가 뜻하는 것은, 요즘 공개 모델은 "무료로 받을 수 있다"와 "내가 써도 된다"가 다르다는 점입니다. 지킬 것도 있습니다. LTX-2.5 라이선스는 적용되는 AI 규제를 따르고, AI가 만든 콘텐츠라는 표시를 지우지 말라고 요구합니다. 그래서 이 글의 영상마다 AI로 만든 영상이라고 적었습니다. 이 내용은 라이선스 문구를 읽고 정리한 것이고, 법률 조언은 아닙니다.

얼마나 빠른가

같은 질문을 시드만 바꿔 다섯 번 연달아 만들었습니다(1280×704, 5초, 24fps).

순서생성 시간VRAM 최대시스템 램 최대전력 평균
119.8초28.4GB30.5GB384W
220.3초28.4GB30.5GB379W
320.2초28.4GB30.4GB380W
419.9초28.4GB30.4GB380W
520.0초28.4GB30.4GB369W
평균20.0초28.4GB30.4GB378W

이 표가 뜻하는 것은, 다섯 번의 차이가 0.5초 안쪽(19.8~20.3초, 표준편차 0.2초)이라 한 번 잰 값도 믿을 만하다는 점입니다. 시스템 램은 PC 전체가 쓰는 양이고, 모델을 올리기 전에는 23GB였습니다.

상황에 따라 달라지는 시간

상황생성 시간VRAM 최대더 걸리는 까닭
같은 질문, 시드만 바꿈20.0초(5번 평균)28.4GB-
질문을 바꿈25.0초, 26.0초31.0GB글 이해 모델로 질문을 다시 읽음(3~5초)
모델만 내렸다가 다시 실행33.5초31.2GB모델을 그래픽카드에 다시 올림
프로그램을 켠 뒤 첫 실행49.3초31.1GB모델 파일을 디스크에서 처음 읽음

이 표가 뜻하는 것은, 처음 한 번은 50초쯤 걸리고, 그 뒤로는 질문을 바꿔도 25초 안팎이라는 점입니다. 앞에서 본 질문 6가지(한국어 장면, 대사, 애니메이션풍 등)는 23.7~28.8초였습니다.

20초는 어디에 쓰이나

단계별 시간. 이 글(ComfyUI 0.38.2, 5번 평균 20.1초): 1단계 그리기 3.3초, 2단계 그리기 5.4초, 영상 풀기 8.5초, 합치기·저장 2.6초. 다른 측정(ComfyUI 0.33.0, 40.5초): 1단계 10.7초, 2단계 7.2초, 영상 풀기 8.9초, 나눠 적지 않은 부분 13.7초

같은 조건의 다른 측정과 단계별로 견준 그림입니다.

단계하는 일시간(5번 평균)비중
1단계 그리기절반 해상도로 8단계3.3초17%
해상도 2배 올리기잠재 공간에서 가로·세로 2배0.1초0%
2단계 그리기원래 해상도로 3단계5.4초27%
영상 풀기(VAE 디코드)계산 결과를 실제 영상 화면으로 바꿈8.5초42%
소리 풀기소리를 실제 음성 파일로 바꿈0.3초1%
영상 합치기·저장영상과 소리를 합쳐 MP4로 저장2.6초13%

이 표가 뜻하는 것은, 그리는 시간(8.7초)과 영상을 풀어내는 시간(8.5초)이 거의 같다는 점입니다. 그래서 그리는 단계를 더 줄여도 전체 시간은 크게 줄지 않습니다. 프로그램을 켠 뒤 첫 실행에서는 모델을 올리는 시간이 섞여 질문 읽기가 13.8초, 1단계 그리기가 13.1초로 늘었습니다.

다른 측정과 시간이 다른 이유

같은 RTX 5090, 같은 해상도·프레임 수로 잰 다른 글에는 40초 안팎의 값이 있습니다. 일본 블로그 '黒箱AI実測録'의 8월 16일 측정은 첫 실행 43.2초, 두 번째 40.5초였습니다. 이 글의 20.0초와 두 배 차이가 납니다.

항목이 글(10월 4일)다른 측정(8월 16일)
ComfyUI0.38.20.33.0
PyTorch2.12.12.13.0
1단계 그리기3.3초10.7초
2단계 그리기5.4초7.2초
영상 풀기8.5초8.9초
전체20.0초40.5초
시스템 램 최대30.5GB(PC 전체)73GB

이 표가 뜻하는 것은, 영상 풀기는 거의 같고 그리는 단계에서 차이가 났다는 점입니다. 두 측정 사이에 ComfyUI가 0.33에서 0.38로 올라갔습니다. 다만 무엇이 빨라지게 했는지는 확인하지 못했습니다. ComfyUI 버전 차이일 수도 있고, 재는 구간이 달랐을 수도 있습니다. 같은 글은 영상 VAE 파일을 바꿔 31.7~33.1초로 줄였다고도 적었는데, 이 글에서는 그 방법을 시험하지 않았습니다. 15초 영상도 8월 12일의 또 다른 측정(TrueNorthAI)에서는 메모리 부족으로 실패했다고 하지만, 이번에는 69.0초에 끝났습니다.

그러니 이 글의 숫자는 "2026년 10월 4일, ComfyUI 0.38.2에서"라는 조건과 함께 읽어 주세요. 버전이 다르면 두 배까지 달라질 수 있습니다.

해상도를 올리면

해상도별 생성 시간: 960×512 12.4초, 1280×704 20.1초, 1664×896 33.5초, 1920×1088 50.5초

같은 질문으로 해상도만 바꿨습니다. 길이는 5초로 같습니다.

설정실제 크기생성 시간VRAM 최대전력 평균파일 크기
0.5메가픽셀960×51212.4초28.0GB306W0.9MB
0.9메가픽셀(기본)1280×70420.1초28.0GB376W1.4MB
1.5메가픽셀1664×89633.5초29.1GB405W2.2MB
2.0메가픽셀1920×108850.5초28.6GB421W3.0MB

이 표가 뜻하는 것은, 풀HD 영상도 1분 안에 나온다는 점입니다. 해상도를 올려도 VRAM은 28~29GB로 거의 그대로였고, 시간만 늘었습니다. 픽셀이 4배(0.5 → 2.0메가픽셀)가 되자 시간은 4.1배가 됐습니다.

AI로 만든 영상(LTX-2.5). 1920×1088, 5초. 50.5초가 걸렸습니다.

길이를 늘리면

길이별 생성 시간: 5초 20.1초, 10초 41.8초, 15초 69.0초

같은 질문, 같은 해상도(1280×704)로 길이만 바꿨습니다.

길이프레임 수생성 시간영상 1초당VRAM 최대온도 최대
5초12120.1초4.0초28.0GB67℃
10초24141.8초4.2초27.9GB70℃
15초36169.0초4.6초27.9GB72℃

이 표가 뜻하는 것은, 영상 1초를 만드는 데 4~5초가 든다는 점입니다. 길이를 3배로 늘려도 VRAM은 늘지 않았고, 15초 영상도 한 번에 만들어졌습니다.

AI로 만든 영상(LTX-2.5). 1280×704, 15초(361프레임). 69.0초가 걸렸습니다.

결과물은 어떤가

여기서부터는 영상을 직접 보고 들은 평가입니다. 질문마다 한 번씩 만든 첫 결과를 그대로 실었습니다(골라내지 않았습니다).

한국어로 물어도 된다

맨 위 영상과 같은 장면을 한국어 질문으로 만들었습니다. "비 오는 밤 서울의 좁은 골목, 우동 가게, 카메라가 창문 쪽으로 천천히 다가간다, 빗소리와 국물 끓는 소리"입니다.

AI로 만든 영상(LTX-2.5). 한국어 질문. 골목에서 시작해 가게 안 냄비까지 카메라가 다가갑니다.

한국어 질문 영상의 장면 4개: 골목 전경, 가게 앞, 주방, 끓는 냄비

한국어 질문 영상에서 뽑은 장면 4개(처음, 1.7초, 3.3초, 끝).

영어 질문과 구도는 다르지만, 골목·우동 가게·다가가는 카메라가 모두 들어갔습니다. 한국어 질문일 때 생성 시간은 28.2초로, 영어로 질문을 바꿨을 때(23.7~28.8초)와 같은 범위였습니다.

대사

대사를 따옴표로 적어 주면 인물이 그 문장을 말합니다. 한국어와 영어를 하나씩 시험했고, 두 영상 모두 지시한 문장대로 말했습니다(직접 들어 확인).

AI로 만든 영상(LTX-2.5), 실존 인물 아님. 지시한 대사: "안녕하세요, 오늘은 로컬 AI로 영상을 만들어 보겠습니다."

AI로 만든 영상(LTX-2.5), 실존 인물 아님. 지시한 대사: "Today we are testing a local video model on a single graphics card."

입 모양이 대사와 맞게 움직이고, 뒤로 카페 소음과 키보드 소리도 들어갔습니다. 대사가 있는 영상의 평균 음량은 -11~-13dB로, 빗소리만 있는 영상(-31dB)보다 뚜렷하게 컸습니다.

그림풍, 움직임, 글자

AI로 만든 영상(LTX-2.5). 애니메이션풍. 뒷모습에서 시작해 고개를 돌려 웃는 동작이 지시대로 나왔습니다.

AI로 만든 영상(LTX-2.5). 빠른 움직임과 물 튀김. 카메라가 개 옆을 따라갑니다.

AI로 만든 영상(LTX-2.5). 간판 글자 "EVUELA AI LAB"이 영상 내내 틀리지 않고 유지됐습니다.

영상 모델에서 어려운 것으로 꼽히는 글자 유지가 잘 됐습니다. 간판이 흔들리는 5초 동안 글자가 뭉개지거나 바뀌지 않았습니다. 빠르게 달리는 개의 다리와 물 튀김도 크게 어색하지 않았습니다. 한글 글자가 들어간 영상은 이번에 시험하지 않았습니다.

돌리면서 알게 된 것

  • 새로 받을 파일이 많습니다. 처음이라면 약 40GB를 받아야 하고, Hugging Face에서 LTX-2.5 저장소에 로그인해 사용 동의를 먼저 해야 합니다.
  • VRAM 32GB를 거의 다 씁니다. 생성 중 최대 31.2GB였습니다. 다른 프로그램이 VRAM을 쓰고 있으면 더 느려질 수 있습니다.
  • 질문을 자주 바꾸면 조금씩 더 걸립니다. 같은 질문을 시드만 바꿔 여러 장 뽑을 때가 가장 빠릅니다(20초).
  • 시간의 40%는 영상을 풀어내는 단계입니다. 그리는 단계 수를 줄여도 전체 시간은 크게 줄지 않습니다.
  • ComfyUI 버전에 따라 시간이 크게 다릅니다. 8월의 다른 측정은 같은 조건에서 40초였습니다. 오래된 판을 쓰고 있다면 먼저 올려 보세요.
  • 템플릿을 화면에서 실행하면 문제없습니다. 다만 템플릿 파일을 명령줄 도구(comfy-cli 1.18)로 바로 제출했더니 값이 잘못 들어가 오류가 났습니다. 측정은 실행 형식으로 바꾼 작업 흐름을 ComfyUI에 직접 보내서 했습니다.

정리

  • RTX 5090 + ComfyUI 공식 템플릿에서 5초 영상(1280×704, 소리 포함) 한 편에 20.0초였습니다(5번 평균, 19.8~20.3초). 프로그램을 켠 뒤 첫 실행은 49.3초였습니다.
  • 풀HD 5초는 50.5초, 15초 영상은 69.0초였습니다. 영상 1초에 4~5초가 듭니다.
  • VRAM은 최대 31.2GB, 파일은 39.7GB입니다. 32GB 그래픽카드를 꽉 채워 씁니다.
  • 한국어 질문과 한국어 대사가 모두 됐고, 영어 간판 글자가 영상 내내 유지됐습니다.
  • 한국에서 쓸 수 있고, 연 매출 1,000만 달러 미만이면 상업 이용도 무료입니다. AI로 만든 영상이라는 표시는 해야 합니다.

이 글의 한계

  • RTX 5090 한 대, ComfyUI 공식 템플릿 기본 설정(증류 INT8 판)으로만 쟀습니다. 16GB·24GB 그래픽카드에서는 재지 않았습니다.
  • 사진을 움직이게 하는 기능(image to video), 첫·끝 장면 지정, 여러 장면(멀티샷), 질문 늘려 쓰기는 시험하지 않았습니다.
  • 품질은 눈과 귀로 본 평가이고, 질문마다 한 번씩만 만들었습니다. 시드가 바뀌면 결과도 달라집니다. 시간은 기본 조건만 5번 반복했고, 해상도·길이별 값은 한 번씩 잰 것입니다.
  • 다른 측정과 시간이 다른 이유는 확인하지 못했습니다. 영상 VAE를 바꾸는 방법 등 빨라지는 설정은 시험하지 않았습니다.
  • 측정 날짜는 2026년 10월 4일입니다. ComfyUI와 모델 파일이 바뀌면 시간도 달라질 수 있습니다.

자주 묻는 질문

LTX-2.5는 한국에서 써도 되나요?

네. LTX-2.x Community License에는 한국을 빼는 조항이 없습니다. 연 매출 1,000만 달러 미만이면 상업적으로 써도 무료입니다. AI가 만든 콘텐츠라는 표시는 지우지 말아야 합니다.

RTX 5090이 아니어도 돌아가나요?

이 글에서는 5090에서만 쟀습니다. 이번 설정에서 VRAM을 31GB까지 썼으니, 그보다 작은 그래픽카드에서는 모델 일부가 시스템 램으로 넘어가 더 느려질 것으로 보입니다. 직접 확인하지는 않았습니다.

영상에 소리도 같이 만들어지나요?

네. 대사, 빗소리 같은 효과음, 배경 소음이 영상과 함께 만들어집니다. 따로 소리를 붙일 필요가 없습니다.

한국어로 질문하거나 한국어 대사를 넣을 수 있나요?

둘 다 됐습니다. 한국어 질문으로 지시한 장면이 나왔고, 따옴표 안에 적은 한국어 문장을 인물이 그대로 말했습니다.

Unsloth Studio로는 못 돌리나요?

2026년 10월 4일 기준 Unsloth Studio의 영상 목록에는 LTX-2와 LTX-2.3만 있고 LTX-2.5는 없었습니다. 그래서 ComfyUI로 테스트했습니다.

참고: Lightricks/LTX-2.5 모델 카드 · LTX-2.x Community License Agreement · Lightricks/LTX-2 GitHub · MiniMax H3 라이선스 · Wan 2.2 TI2V 5B · 黒箱AI実測録의 LTX-2.5 측정(8월 16일) · TrueNorthAI의 LTX-2.5 측정(8월 12일) · 이 블로그의 Qwen-Image-2.1 테스트, Unsloth Studio로 바꾼 이유, GPU 체험

관련 게시글

댓글 0개