Lightricks의 영상 생성 모델 LTX-2.5를 RTX 5090 32GB에서 ComfyUI로 돌려 봤습니다. 공식 템플릿 기본 설정 그대로, 소리가 들어간 5초짜리 1280×704 영상 한 편을 약 20초에 만들었습니다. VRAM은 최대 31.2GB로 32GB를 거의 다 썼습니다.
- 풀HD(1920×1088) 5초 영상은 50.5초, 15초 영상(1280×704)은 69.0초가 걸렸습니다. 모두 실패 없이 끝났습니다.
- 한국어 질문도 알아듣고, 한국어 대사도 말합니다. "안녕하세요, 오늘은 로컬 AI로 영상을 만들어 보겠습니다."를 지시한 대로 말하는 영상이 나왔습니다.
- 한국에서 써도 되는 모델입니다. 라이선스에 지역 제한이 없고, 연 매출 1,000만 달러 미만이면 무료입니다. 같은 시기에 나온 MiniMax H3는 한국이 제외 지역이라 테스트하지 않았습니다.
이 글의 영상은 모두 AI(LTX-2.5)로 만든 것이고, 등장하는 인물은 실존 인물이 아닙니다. 영상에는 소리가 들어 있습니다. 재생한 뒤 음소거를 풀면 들립니다.

RTX 5090에서 ComfyUI 공식 템플릿으로 잰 핵심 숫자입니다.
AI로 만든 영상(LTX-2.5). 1280×704, 5초, 24fps. 빗소리와 국물 끓는 소리가 함께 들어 있습니다.
어떻게 테스트했나
| 항목 | 내용 |
|---|---|
| 그래픽카드 | RTX 5090 32GB (드라이버 616.92), 시스템 램 64GB |
| 프로그램 | ComfyUI 0.38.2 (Comfy Desktop), PyTorch 2.12.1 |
| 작업 흐름 | ComfyUI에 들어 있는 공식 템플릿 "LTX-2.5: Text to Video". 질문·해상도·길이·시드만 바꿈 |
| 기본 설정 | 0.9메가픽셀 16:9(1280×704), 5초, 24fps, 질문 늘려 쓰기(prompt_enhance) 끔 |
| 측정 | 생성 시간은 ComfyUI가 기록한 실행 시작~끝. VRAM·GPU 사용률·전력·시스템 램은 0.5초마다 기록. 단계별 시간은 ComfyUI가 알려 주는 노드 실행 신호로 나눠 잼 |
| 반복 | 기본 조건(1280×704, 5초)은 시드만 바꿔 5번. 해상도·길이·질문별 측정은 한 번씩 |
| 날짜 | 2026년 10월 4일 |
이 블로그는 평소 Unsloth Studio 기본값으로 재지만, Unsloth Studio의 영상 목록에는 LTX-2.3까지만 있고 LTX-2.5가 없습니다. 그래서 이번 글은 ComfyUI로 쟀습니다. 직전 글인 Qwen-Image-2.1 이미지 테스트와는 프로그램이 다르다는 점을 알고 봐 주세요.

ComfyUI에서 공식 템플릿을 연 모습입니다.
LTX-2.5는 어떤 모델인가
| 항목 | 내용 |
|---|---|
| 만든 곳 | Lightricks |
| 공개 | 2026년 7월 |
| 크기 | 영상·소리를 만드는 부분 22B, 글을 이해하는 부분은 Gemma 4 12B |
| 특징(제작사 설명) | 영상과 소리를 함께 생성, 한 번에 여러 장면(멀티샷), 또렷한 얼굴과 글자 |
| 이번에 쓴 판 | 증류(distilled) 모델의 INT8 판. 적은 단계로 빨리 만드는 판입니다 |
| 라이선스 | LTX-2.x Community License(2026년 8월 11일자) |
이 표가 뜻하는 것은, LTX-2.5가 그림만이 아니라 대사와 효과음까지 한 번에 만드는 모델이라는 점입니다. 영상을 만든 뒤 소리를 따로 붙이는 방식이 아닙니다.
쓴 파일과 크기
| 역할 | 파일 | 크기 |
|---|---|---|
| 영상·소리 모델(INT8) | ltx-2.5-22b-distilled-transformer-comfy-int8-convrot | 21.5GB |
| 글 이해 모델(INT8) | gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot | 15.4GB |
| 영상 VAE | ltx-2.5-video-vae-bf16 | 1.5GB |
| 해상도 2배 올리는 모델 | ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0 | 1.0GB |
| 소리 VAE | ltx-2.5-audio-vae-bf16 | 0.4GB |
| 합계 | 39.7GB |
이 표가 뜻하는 것은, 디스크에 약 40GB가 필요하고 파일 합계가 VRAM 32GB보다 크다는 점입니다. 그래서 ComfyUI가 필요한 부분만 그래픽카드에 올렸다 내렸다 하면서 돌립니다. 질문을 늘려 쓰는 기능을 켜려면 Gemma 4 E2B 파일(5.2GB)이 하나 더 필요하지만, 이번에는 껐습니다.

템플릿에서 바꿀 수 있는 값입니다. 질문, 길이(초), 시드, 초당 프레임, 그리고 왼쪽의 비율과 메가픽셀입니다.
한국에서 써도 되나
됩니다. LTX-2.x Community License에는 한국을 빼는 조항이 없습니다. 지역 제한은 국제 제재 대상 지역과 수출 통제 위반만 해당합니다. 유료 라이선스가 필요한 곳은 이렇게 정해져 있습니다.
Entities with annual revenues of at least $10,000,000 ... are required to obtain a paid license
LTX-2.x Community License Agreement 2.1절
쉽게 말하면 연 매출이 1,000만 달러 이상인 회사만 돈을 내고, 그 아래는 상업적으로 써도 무료입니다. 예를 들어 개인 블로그나 작은 유튜브 채널에서 이 모델로 만든 영상을 올리는 것은 허락 범위 안입니다. 결과물에 대한 권리도 Lightricks가 주장하지 않습니다.
| 모델 | 한국에서 사용 | 상업 이용 |
|---|---|---|
| LTX-2.5 | 가능 | 연 매출 1,000만 달러 미만 무료 |
| MiniMax H3 | 불가(한국·미국·유럽연합·영국 제외). 별도 허락 필요 | 허락 지역 안에서만 가능. 연 매출 2,000만 달러를 넘으면 사전 허락 필요 |
| Wan 2.2 | 가능 | Apache 2.0, 제한 없음 |
| Qwen-Image-2.1(이미지) | 가능 | 불가(연구·평가용) |
이 표가 뜻하는 것은, 요즘 공개 모델은 "무료로 받을 수 있다"와 "내가 써도 된다"가 다르다는 점입니다. 지킬 것도 있습니다. LTX-2.5 라이선스는 적용되는 AI 규제를 따르고, AI가 만든 콘텐츠라는 표시를 지우지 말라고 요구합니다. 그래서 이 글의 영상마다 AI로 만든 영상이라고 적었습니다. 이 내용은 라이선스 문구를 읽고 정리한 것이고, 법률 조언은 아닙니다.
얼마나 빠른가
같은 질문을 시드만 바꿔 다섯 번 연달아 만들었습니다(1280×704, 5초, 24fps).
| 순서 | 생성 시간 | VRAM 최대 | 시스템 램 최대 | 전력 평균 |
|---|---|---|---|---|
| 1 | 19.8초 | 28.4GB | 30.5GB | 384W |
| 2 | 20.3초 | 28.4GB | 30.5GB | 379W |
| 3 | 20.2초 | 28.4GB | 30.4GB | 380W |
| 4 | 19.9초 | 28.4GB | 30.4GB | 380W |
| 5 | 20.0초 | 28.4GB | 30.4GB | 369W |
| 평균 | 20.0초 | 28.4GB | 30.4GB | 378W |
이 표가 뜻하는 것은, 다섯 번의 차이가 0.5초 안쪽(19.8~20.3초, 표준편차 0.2초)이라 한 번 잰 값도 믿을 만하다는 점입니다. 시스템 램은 PC 전체가 쓰는 양이고, 모델을 올리기 전에는 23GB였습니다.
상황에 따라 달라지는 시간
| 상황 | 생성 시간 | VRAM 최대 | 더 걸리는 까닭 |
|---|---|---|---|
| 같은 질문, 시드만 바꿈 | 20.0초(5번 평균) | 28.4GB | - |
| 질문을 바꿈 | 25.0초, 26.0초 | 31.0GB | 글 이해 모델로 질문을 다시 읽음(3~5초) |
| 모델만 내렸다가 다시 실행 | 33.5초 | 31.2GB | 모델을 그래픽카드에 다시 올림 |
| 프로그램을 켠 뒤 첫 실행 | 49.3초 | 31.1GB | 모델 파일을 디스크에서 처음 읽음 |
이 표가 뜻하는 것은, 처음 한 번은 50초쯤 걸리고, 그 뒤로는 질문을 바꿔도 25초 안팎이라는 점입니다. 앞에서 본 질문 6가지(한국어 장면, 대사, 애니메이션풍 등)는 23.7~28.8초였습니다.
20초는 어디에 쓰이나

같은 조건의 다른 측정과 단계별로 견준 그림입니다.
| 단계 | 하는 일 | 시간(5번 평균) | 비중 |
|---|---|---|---|
| 1단계 그리기 | 절반 해상도로 8단계 | 3.3초 | 17% |
| 해상도 2배 올리기 | 잠재 공간에서 가로·세로 2배 | 0.1초 | 0% |
| 2단계 그리기 | 원래 해상도로 3단계 | 5.4초 | 27% |
| 영상 풀기(VAE 디코드) | 계산 결과를 실제 영상 화면으로 바꿈 | 8.5초 | 42% |
| 소리 풀기 | 소리를 실제 음성 파일로 바꿈 | 0.3초 | 1% |
| 영상 합치기·저장 | 영상과 소리를 합쳐 MP4로 저장 | 2.6초 | 13% |
이 표가 뜻하는 것은, 그리는 시간(8.7초)과 영상을 풀어내는 시간(8.5초)이 거의 같다는 점입니다. 그래서 그리는 단계를 더 줄여도 전체 시간은 크게 줄지 않습니다. 프로그램을 켠 뒤 첫 실행에서는 모델을 올리는 시간이 섞여 질문 읽기가 13.8초, 1단계 그리기가 13.1초로 늘었습니다.
다른 측정과 시간이 다른 이유
같은 RTX 5090, 같은 해상도·프레임 수로 잰 다른 글에는 40초 안팎의 값이 있습니다. 일본 블로그 '黒箱AI実測録'의 8월 16일 측정은 첫 실행 43.2초, 두 번째 40.5초였습니다. 이 글의 20.0초와 두 배 차이가 납니다.
| 항목 | 이 글(10월 4일) | 다른 측정(8월 16일) |
|---|---|---|
| ComfyUI | 0.38.2 | 0.33.0 |
| PyTorch | 2.12.1 | 2.13.0 |
| 1단계 그리기 | 3.3초 | 10.7초 |
| 2단계 그리기 | 5.4초 | 7.2초 |
| 영상 풀기 | 8.5초 | 8.9초 |
| 전체 | 20.0초 | 40.5초 |
| 시스템 램 최대 | 30.5GB(PC 전체) | 73GB |
이 표가 뜻하는 것은, 영상 풀기는 거의 같고 그리는 단계에서 차이가 났다는 점입니다. 두 측정 사이에 ComfyUI가 0.33에서 0.38로 올라갔습니다. 다만 무엇이 빨라지게 했는지는 확인하지 못했습니다. ComfyUI 버전 차이일 수도 있고, 재는 구간이 달랐을 수도 있습니다. 같은 글은 영상 VAE 파일을 바꿔 31.7~33.1초로 줄였다고도 적었는데, 이 글에서는 그 방법을 시험하지 않았습니다. 15초 영상도 8월 12일의 또 다른 측정(TrueNorthAI)에서는 메모리 부족으로 실패했다고 하지만, 이번에는 69.0초에 끝났습니다.
그러니 이 글의 숫자는 "2026년 10월 4일, ComfyUI 0.38.2에서"라는 조건과 함께 읽어 주세요. 버전이 다르면 두 배까지 달라질 수 있습니다.
해상도를 올리면

같은 질문으로 해상도만 바꿨습니다. 길이는 5초로 같습니다.
| 설정 | 실제 크기 | 생성 시간 | VRAM 최대 | 전력 평균 | 파일 크기 |
|---|---|---|---|---|---|
| 0.5메가픽셀 | 960×512 | 12.4초 | 28.0GB | 306W | 0.9MB |
| 0.9메가픽셀(기본) | 1280×704 | 20.1초 | 28.0GB | 376W | 1.4MB |
| 1.5메가픽셀 | 1664×896 | 33.5초 | 29.1GB | 405W | 2.2MB |
| 2.0메가픽셀 | 1920×1088 | 50.5초 | 28.6GB | 421W | 3.0MB |
이 표가 뜻하는 것은, 풀HD 영상도 1분 안에 나온다는 점입니다. 해상도를 올려도 VRAM은 28~29GB로 거의 그대로였고, 시간만 늘었습니다. 픽셀이 4배(0.5 → 2.0메가픽셀)가 되자 시간은 4.1배가 됐습니다.
AI로 만든 영상(LTX-2.5). 1920×1088, 5초. 50.5초가 걸렸습니다.
길이를 늘리면

같은 질문, 같은 해상도(1280×704)로 길이만 바꿨습니다.
| 길이 | 프레임 수 | 생성 시간 | 영상 1초당 | VRAM 최대 | 온도 최대 |
|---|---|---|---|---|---|
| 5초 | 121 | 20.1초 | 4.0초 | 28.0GB | 67℃ |
| 10초 | 241 | 41.8초 | 4.2초 | 27.9GB | 70℃ |
| 15초 | 361 | 69.0초 | 4.6초 | 27.9GB | 72℃ |
이 표가 뜻하는 것은, 영상 1초를 만드는 데 4~5초가 든다는 점입니다. 길이를 3배로 늘려도 VRAM은 늘지 않았고, 15초 영상도 한 번에 만들어졌습니다.
AI로 만든 영상(LTX-2.5). 1280×704, 15초(361프레임). 69.0초가 걸렸습니다.
결과물은 어떤가
여기서부터는 영상을 직접 보고 들은 평가입니다. 질문마다 한 번씩 만든 첫 결과를 그대로 실었습니다(골라내지 않았습니다).
한국어로 물어도 된다
맨 위 영상과 같은 장면을 한국어 질문으로 만들었습니다. "비 오는 밤 서울의 좁은 골목, 우동 가게, 카메라가 창문 쪽으로 천천히 다가간다, 빗소리와 국물 끓는 소리"입니다.
AI로 만든 영상(LTX-2.5). 한국어 질문. 골목에서 시작해 가게 안 냄비까지 카메라가 다가갑니다.

한국어 질문 영상에서 뽑은 장면 4개(처음, 1.7초, 3.3초, 끝).
영어 질문과 구도는 다르지만, 골목·우동 가게·다가가는 카메라가 모두 들어갔습니다. 한국어 질문일 때 생성 시간은 28.2초로, 영어로 질문을 바꿨을 때(23.7~28.8초)와 같은 범위였습니다.
대사
대사를 따옴표로 적어 주면 인물이 그 문장을 말합니다. 한국어와 영어를 하나씩 시험했고, 두 영상 모두 지시한 문장대로 말했습니다(직접 들어 확인).
AI로 만든 영상(LTX-2.5), 실존 인물 아님. 지시한 대사: "안녕하세요, 오늘은 로컬 AI로 영상을 만들어 보겠습니다."
AI로 만든 영상(LTX-2.5), 실존 인물 아님. 지시한 대사: "Today we are testing a local video model on a single graphics card."
입 모양이 대사와 맞게 움직이고, 뒤로 카페 소음과 키보드 소리도 들어갔습니다. 대사가 있는 영상의 평균 음량은 -11~-13dB로, 빗소리만 있는 영상(-31dB)보다 뚜렷하게 컸습니다.
그림풍, 움직임, 글자
AI로 만든 영상(LTX-2.5). 애니메이션풍. 뒷모습에서 시작해 고개를 돌려 웃는 동작이 지시대로 나왔습니다.
AI로 만든 영상(LTX-2.5). 빠른 움직임과 물 튀김. 카메라가 개 옆을 따라갑니다.
AI로 만든 영상(LTX-2.5). 간판 글자 "EVUELA AI LAB"이 영상 내내 틀리지 않고 유지됐습니다.
영상 모델에서 어려운 것으로 꼽히는 글자 유지가 잘 됐습니다. 간판이 흔들리는 5초 동안 글자가 뭉개지거나 바뀌지 않았습니다. 빠르게 달리는 개의 다리와 물 튀김도 크게 어색하지 않았습니다. 한글 글자가 들어간 영상은 이번에 시험하지 않았습니다.
돌리면서 알게 된 것
- 새로 받을 파일이 많습니다. 처음이라면 약 40GB를 받아야 하고, Hugging Face에서 LTX-2.5 저장소에 로그인해 사용 동의를 먼저 해야 합니다.
- VRAM 32GB를 거의 다 씁니다. 생성 중 최대 31.2GB였습니다. 다른 프로그램이 VRAM을 쓰고 있으면 더 느려질 수 있습니다.
- 질문을 자주 바꾸면 조금씩 더 걸립니다. 같은 질문을 시드만 바꿔 여러 장 뽑을 때가 가장 빠릅니다(20초).
- 시간의 40%는 영상을 풀어내는 단계입니다. 그리는 단계 수를 줄여도 전체 시간은 크게 줄지 않습니다.
- ComfyUI 버전에 따라 시간이 크게 다릅니다. 8월의 다른 측정은 같은 조건에서 40초였습니다. 오래된 판을 쓰고 있다면 먼저 올려 보세요.
- 템플릿을 화면에서 실행하면 문제없습니다. 다만 템플릿 파일을 명령줄 도구(comfy-cli 1.18)로 바로 제출했더니 값이 잘못 들어가 오류가 났습니다. 측정은 실행 형식으로 바꾼 작업 흐름을 ComfyUI에 직접 보내서 했습니다.
정리
- RTX 5090 + ComfyUI 공식 템플릿에서 5초 영상(1280×704, 소리 포함) 한 편에 20.0초였습니다(5번 평균, 19.8~20.3초). 프로그램을 켠 뒤 첫 실행은 49.3초였습니다.
- 풀HD 5초는 50.5초, 15초 영상은 69.0초였습니다. 영상 1초에 4~5초가 듭니다.
- VRAM은 최대 31.2GB, 파일은 39.7GB입니다. 32GB 그래픽카드를 꽉 채워 씁니다.
- 한국어 질문과 한국어 대사가 모두 됐고, 영어 간판 글자가 영상 내내 유지됐습니다.
- 한국에서 쓸 수 있고, 연 매출 1,000만 달러 미만이면 상업 이용도 무료입니다. AI로 만든 영상이라는 표시는 해야 합니다.
이 글의 한계
- RTX 5090 한 대, ComfyUI 공식 템플릿 기본 설정(증류 INT8 판)으로만 쟀습니다. 16GB·24GB 그래픽카드에서는 재지 않았습니다.
- 사진을 움직이게 하는 기능(image to video), 첫·끝 장면 지정, 여러 장면(멀티샷), 질문 늘려 쓰기는 시험하지 않았습니다.
- 품질은 눈과 귀로 본 평가이고, 질문마다 한 번씩만 만들었습니다. 시드가 바뀌면 결과도 달라집니다. 시간은 기본 조건만 5번 반복했고, 해상도·길이별 값은 한 번씩 잰 것입니다.
- 다른 측정과 시간이 다른 이유는 확인하지 못했습니다. 영상 VAE를 바꾸는 방법 등 빨라지는 설정은 시험하지 않았습니다.
- 측정 날짜는 2026년 10월 4일입니다. ComfyUI와 모델 파일이 바뀌면 시간도 달라질 수 있습니다.
자주 묻는 질문
LTX-2.5는 한국에서 써도 되나요?
네. LTX-2.x Community License에는 한국을 빼는 조항이 없습니다. 연 매출 1,000만 달러 미만이면 상업적으로 써도 무료입니다. AI가 만든 콘텐츠라는 표시는 지우지 말아야 합니다.
RTX 5090이 아니어도 돌아가나요?
이 글에서는 5090에서만 쟀습니다. 이번 설정에서 VRAM을 31GB까지 썼으니, 그보다 작은 그래픽카드에서는 모델 일부가 시스템 램으로 넘어가 더 느려질 것으로 보입니다. 직접 확인하지는 않았습니다.
영상에 소리도 같이 만들어지나요?
네. 대사, 빗소리 같은 효과음, 배경 소음이 영상과 함께 만들어집니다. 따로 소리를 붙일 필요가 없습니다.
한국어로 질문하거나 한국어 대사를 넣을 수 있나요?
둘 다 됐습니다. 한국어 질문으로 지시한 장면이 나왔고, 따옴표 안에 적은 한국어 문장을 인물이 그대로 말했습니다.
Unsloth Studio로는 못 돌리나요?
2026년 10월 4일 기준 Unsloth Studio의 영상 목록에는 LTX-2와 LTX-2.3만 있고 LTX-2.5는 없었습니다. 그래서 ComfyUI로 테스트했습니다.
참고: Lightricks/LTX-2.5 모델 카드 · LTX-2.x Community License Agreement · Lightricks/LTX-2 GitHub · MiniMax H3 라이선스 · Wan 2.2 TI2V 5B · 黒箱AI実測録의 LTX-2.5 측정(8월 16일) · TrueNorthAI의 LTX-2.5 측정(8월 12일) · 이 블로그의 Qwen-Image-2.1 테스트, Unsloth Studio로 바꾼 이유, GPU 체험
댓글 0개