AI 테스트 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] Qwen3.8 27B GSQ-RCO는 왜 2t/s밖에 안 나올까, 설정 세 가지를 바꾸자 29t/s가 됐다

EVUELA 2026년 10월 02일 3회 1시간 전
[RTX 5060 Ti 16GB] Qwen3.8 27B GSQ-RCO는 왜 2t/s밖에 안 나올까, 설정 세 가지를 바꾸자 29t/s가 됐다

27B 모델을 16GB 그래픽카드에 맞춰 3비트로 줄인 Qwen3.8 27B GSQ-RCO(IQ3_S, 파일 12.12GB)를 RTX 5060 Ti 16GB PC의 LM Studio에서 돌려 봤습니다. 결론부터 말하면 LM Studio 기본 설정으로는 약 1.9t/s(초당 토큰)로 쓰기 어려웠고, 설정 세 가지를 바꾸자 약 29t/s가 됐습니다. 15배 빨라졌습니다.

느린 이유도 확인했습니다. 기본 설정에서 LM Studio는 이 모델의 65개 레이어 가운데 56~58개만 GPU에 올리고, 나머지를 CPU 스레드 2개로 돌렸습니다. Qwen3.8 27B 양자화 4종 테스트에서 4비트·3비트 파일이 2t/s에 머문 원인을 그때는 찾지 못했는데, 이번에 런타임 로그에서 확인했습니다.

테스트 PC 사양

부품사양
GPUNVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W)
GPU 연결PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원)
GPU 드라이버616.92
CPUIntel Core i5-9400F (6코어 6스레드)
메인보드MSI H310M PRO-VD PLUS
시스템 램DDR4 32GB (16GB × 2, 2666MT/s)
저장장치Crucial MX500 1TB SATA SSD (모델 파일 위치)
운영체제Windows 11 Pro 25H2 (빌드 26200)
LM Studio0.4.25
런타임llama.cpp CUDA 12 런타임 2.47.0 (LM Studio 기본 선택)

Ornith 1.5 9B, Qwen3.5 9B 테스트와 같은 PC입니다. GPU는 최신이지만 CPU는 6코어짜리 오래된 부품입니다. 이번 테스트에서는 이 CPU가 속도를 정했습니다.

테스트한 모델: Qwen3.8 27B GSQ-RCO

오스트리아 과학기술연구소(ISTA)의 DASLab이 알리바바 Qwen3.8 27B를 줄여서 올린 파일입니다. 양자화는 모델의 숫자를 더 적은 비트로 줄여 저장하는 방법입니다. 보통의 양자화 파일은 모든 부분을 비슷한 방식으로 줄이는데, 이 파일은 부분(텐서)마다 얼마나 줄일지를 따로 정했다고 모델 카드에 적혀 있습니다. GSQ와 RCO는 그 두 가지 방법의 이름입니다.

항목내용
파라미터27B (270억 개), 65레이어
받은 파일IQ3_S-mtp 12.12GB + 이미지 인식 파일(mmproj) 0.93GB. LM Studio 표시 13.05GB
평균 비트가중치 하나당 3.5비트 (제작사 표기)
최대 컨텍스트262,144토큰
기능이미지 입력, 도구 호출, 생각(Thinking) 켬·끔, MTP
라이선스Apache 2.0

모델 카드의 벤치마크 점수는 아래와 같습니다. 제작사 측정이고, 이 글에서 따로 확인한 값은 아닙니다(모델 카드).

파일크기AIME25 (수학)GPQA Diamond (과학)LiveCodeBench v6 (코딩)
원본 (BF16)53.8GB100.0089.9085.71
GSQ-RCO IQ3_S11.8GB100.0089.3985.71
GSQ-RCO IQ2_S9.3GB100.0086.3682.29
unsloth UD-IQ3_S12.0GB96.6789.9084.00

제작사는 IQ3_S가 원본과 점수 차이가 거의 없다고 설명합니다. 그리고 실행할 때 레이어를 모두 GPU에 올리라고(-ngl 99) 안내합니다. 이 안내가 뒤에 나오는 "빠른 설정"과 이어집니다.

LM Studio My Models 화면의 Qwen3.8 27B GSQ-RCO 모델 정보

My Models 화면. IQ3_S, 아키텍처 qwen35에 MTP 표시가 있고 크기는 13.05GB입니다.

LM Studio 기본 설정값

먼저 설정을 바꾸지 않고, LM Studio가 이 모델에 잡아 주는 기본값을 확인했습니다.

LM Studio Load 탭의 GSQ-RCO 기본 설정

Load 탭 기본값. 컨텍스트 8,192, GPU 오프로드 65(전체 레이어), CPU Thread Pool Size 2입니다. 아래에 "실제로 올라가는 레이어 수는 다를 수 있다"는 안내가 있습니다.

Load 탭 고급 설정, Speculative Decoding MTP

아래로 내리면 Speculative Decoding이 MTP로 켜져 있습니다.

설정기본값뜻
컨텍스트 길이8,192모델이 한 번에 기억하는 토큰 수. 최대 262,144
GPU 오프로드65 (전체)GPU에 올릴 레이어 수. 화면에는 65로 나오지만 실제로는 56~58개만 올라감
CPU Thread Pool Size2CPU에 남은 레이어를 계산하는 스레드 수
Speculative DecodingMTP (Max draft tokens 3)다음 토큰 몇 개를 미리 짐작해 두고, 맞으면 한꺼번에 받아들여 속도를 올리는 기능
Limit Model Offload to Dedicated GPU Memory켬모델이 전용 VRAM을 넘지 않게 GPU에 올리는 양을 줄이는 설정(Settings의 Hardware에 있음)
생각(Enable Thinking)켬, 한도 없음답하기 전에 속으로 먼저 풀어 보는 단계
온도 / Top K / 반복 패널티0.1 / 40 / 1.1답을 고르는 방식

Inference 탭, 생각 켬과 온도 0.1

Inference 탭. Enable Thinking이 켜져 있고 Reasoning Budget은 Unrestricted(한도 없음)입니다.

GSQ-RCO 모델 로드 창, 예상 메모리 14.38GB

기본 설정의 모델 로드 창. 예상 메모리는 14.38GB, GPU 오프로드는 65로 표시됩니다.

기본 설정 결과: 약 1.9t/s

기본 설정 그대로 로드하면 VRAM은 13.5GB를 썼습니다. 16GB에 들어가는 크기인데도 속도는 아래와 같았습니다. 느려서 다른 글보다 횟수를 줄여서 쟀습니다.

항목결과
800자 글, 생각 끔 (2번)1.86 / 1.94t/s. 한 편에 5분 22초~6분 33초
800자 글, 생각 켬 (1번, 2,000토큰에서 끊음)생각만 1,976토큰. 14분 37초 동안 답이 시작되지 않음
산수, 생각 끔 (5번)5번 모두 오답("한 사람당 7개, 남는 것 4개"), 약 6초
산수, 생각 켬 (1번)정답, 1분
3,000자 요약첫 토큰까지(TTFT) 6.7초, 전체 70초
사진 설명, 생각 끔68초
글 쓰는 동안 GPU평균 30W, 최고 53°C

GPU 전력이 30W밖에 되지 않습니다. 같은 PC에서 9B 모델은 120W 넘게 썼습니다. GPU가 거의 쉬고 있다는 뜻입니다.

기본 설정에서 글을 쓰는 동안 GPU 사용률 6~7%, 전력 약 30W

기본 설정으로 글을 쓰는 동안. 왼쪽부터 GPU 사용률, 전력, 온도, PC 전체의 VRAM 사용량입니다. 사용률이 6~7%입니다.

기본 설정에서 산수 문제를 푼 화면, 초당 3.01토큰

기본 설정의 산수 문제(생각 켬). 50초 생각한 뒤 정답을 냈고, 통계 줄에 3.01t/s가 보입니다.

느린 이유: 레이어 56개만 GPU에 올라갔다

모델을 로드할 때 LM Studio의 런타임 로그를 받아 보니 아래 두 줄이 있었습니다.

로그 내용뜻
n_gpu_layers already set by user to 5665개 레이어 중 56개만 GPU에 올림. 로드할 때마다 56~58개로 조금씩 달랐음
llama threadpool init, n_threads = 2CPU에 남은 레이어를 스레드 2개로 계산

토큰 하나를 만들려면 65개 레이어를 차례로 모두 지나야 합니다. 56개가 GPU에서 빨리 끝나도, CPU에 남은 7~9개가 끝날 때까지 기다려야 합니다. 그 7~9개를 6코어 CPU의 스레드 2개로 계산하니 전체가 2t/s가 됐습니다.

Load 탭에는 GPU 오프로드가 65로 표시됩니다. 하지만 "Limit Model Offload to Dedicated GPU Memory"가 켜져 있으면 LM Studio가 VRAM에 맞춰 실제 레이어 수를 줄입니다. 화면의 숫자와 실제가 다릅니다.

Settings의 Hardware 화면, Limit Model Offload to Dedicated GPU Memory 켬

Settings의 Hardware 화면. 기본값은 켬입니다. "모델을 전용 GPU 메모리와 램에만 올린다"는 설명이 있습니다.

속도가 나오는 설정 찾기

설정을 하나씩 바꿔 가며 800자 글(생각 끔)을 2번씩 시켰습니다.

설정GPU에 올라간 레이어생성 속도VRAMGPU 사용률
기본 설정56~58 / 651.86~1.94t/s13.5GB7~55%
MTP만 끔로그에 남지 않음2.85~2.94t/s11.6GB17%
Limit Model Offload만 끔60 / 652.88~3.06t/s14.2GB19%
Limit 끔 + GPU 오프로드 최대65 / 6516.4~16.8t/s15.0GB + 공유 메모리 약 0.5GB96%
Limit 끔 + GPU 오프로드 최대 + MTP 끔65 / 6528.6~28.7t/s13.1GB94%

마지막 줄만 GPU가 쉬는 것을 확인한 뒤 다시 잰 값입니다(설정을 찾는 동안 처음 쟀을 때는 25.5t/s). 나머지 줄은 설정을 찾는 동안 잰 값입니다.

이 표에서 알 수 있는 것은 세 가지입니다.

  • 레이어가 하나라도 CPU에 남으면 느립니다. 60개를 올려도 3t/s였고, 65개를 다 올려야 속도가 나왔습니다.
  • Limit 설정만 꺼서는 안 됩니다. 꺼도 LM Studio가 60개만 올립니다. 로드 창에서 GPU 오프로드를 65로 직접 올려야 합니다. 반대로 Limit을 켠 채 오프로드만 최대로 해도 56개에 머물렀습니다.
  • 이 모델은 MTP를 끄는 쪽이 빠릅니다. MTP를 켜면 VRAM을 약 2GB 더 써서 16GB를 넘고, 넘친 부분이 공유 메모리(시스템 램)로 갑니다. 그래서 16t/s대로 떨어졌습니다.

바꾼 설정 세 가지

어디서무엇을
Settings → HardwareLimit Model Offload to Dedicated GPU Memory를 끔
모델 로드 창GPU 오프로드를 65(최대)로 올림
모델 로드 창 (Show advanced settings)Speculative Decoding을 Off로 바꿈

Limit Model Offload to Dedicated GPU Memory를 끈 화면

Limit 설정을 끈 화면. "전용 GPU 메모리가 가득 차면 공유 메모리로 넘기는 것을 허용한다"로 설명이 바뀝니다.

Limit을 끈 뒤 Load 탭의 GPU 오프로드가 59로 표시된 화면

Limit을 끄면 Load 탭의 GPU 오프로드가 59로 바뀝니다. LM Studio가 고른 값이고, 65가 아닙니다.

모델 로드 창에서 컨텍스트 32,768, GPU 오프로드 65로 바꾼 화면

모델 로드 창에서 GPU 오프로드를 65로, 컨텍스트를 32,768로 올린 화면입니다.

모델 로드 창에서 Speculative Decoding을 Off로 바꾼 화면

같은 창을 아래로 내려 Speculative Decoding을 Off로 바꾼 화면입니다.

Limit 설정은 LM Studio 전체에 적용됩니다. 끈 채로 VRAM보다 큰 모델을 올리면 넘친 부분이 공유 메모리로 가서 오히려 느려질 수 있습니다. 테스트가 끝난 뒤에는 다시 켜 두었습니다.

아래부터는 이 세 가지를 바꾼 "빠른 설정"으로 다른 모델과 같은 항목을 잰 결과입니다.

빠른 설정의 VRAM

컨텍스트VRAM 사용로드 시간16GB에서
8,19213.1GB12.4초원활
32,76814.6GB10.6초제한적 (여유 2GB 미만, 속도는 유지)
65,53615.0GB + 시스템 램 약 1.6GB 더11.4초제한적 (넘침)
131,07214.9GB + 시스템 램 약 5.9GB 더15.5초제한적 (넘침)

32,768까지는 VRAM에 들어가고 속도도 유지됐습니다. 65,536부터는 VRAM이 가득 차서 넘친 부분이 시스템 램으로 갑니다. 65,536과 131,072는 로드만 확인했고 속도는 재지 않았습니다. 262,144는 기본 설정에서 로드했을 때 시스템 램이 31.7GB까지 차서, 빠른 설정에서는 시도하지 않았습니다. 이 모델을 16GB에서 쓸 때 맞는 컨텍스트는 32,768까지입니다.

빠른 설정에서 글을 쓰는 동안 GPU 사용률 93~96%, 전력 약 160W

빠른 설정으로 글을 쓰기 시작한 순간(컨텍스트 32,768). 사용률이 93~96%, 전력이 약 160W로 올라갑니다. 기본 설정에서는 6~7%, 30W였습니다.

생성 속도: 생각 끔 28.7t/s

"다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"을 시켰습니다.

조건생성 속도생각에 쓴 토큰끝날 때까지답
생각 끔 (3번)28.6 / 28.7 / 28.7t/s022.7~24.5초1,447~1,594자
생각 켬, 컨텍스트 8,192 (3번)28.8~29.0t/s7,948~8,086약 4분 40초2번은 답 없음, 1번은 252자에서 끊김
생각 켬, 컨텍스트 32,768 (1번)29.0t/s9,2585분 36초879자, 끝까지 씀

생각을 끄면 23초쯤에 글이 끝납니다. 다만 800자를 요청했는데 1,400~1,600자를 썼습니다.

생각을 켜면 기본 컨텍스트 8,192에서는 답이 나오지 않았습니다. 생각만으로 8,000토큰을 써서 컨텍스트가 가득 찼기 때문입니다. 32,768로 올리면 답이 끝까지 나오고 글자 수도 879자로 맞았습니다. 대신 5분 넘게 기다려야 합니다. 생각 과정을 펼쳐 보면 글자 수를 800자에 맞추려고 낱말을 하나씩 세고 있습니다.

빠른 설정, 생각 끔으로 쓴 800자 글과 통계 26.68t/s

빠른 설정, 생각 끔. 통계 줄에 26.68t/s, 614토큰이 보입니다.

생각 과정에서 글자를 하나씩 세는 화면

생각 켬으로 같은 글을 시킨 지 1분 반 뒤. 문장을 써 놓고 글자를 하나씩 세고 있습니다.

11분 29초 생각한 뒤 쓴 800자 글

같은 채팅이 끝난 화면. 채팅에서는 11분 29초 생각했고 모두 18,101토큰을 썼습니다. 생각 길이는 할 때마다 다릅니다.

캡처 속 속도(약 26t/s)는 표보다 조금 낮습니다. 캡처는 화면을 띄운 채 찍었고, 표의 값은 GPU가 쉬는 것을 확인한 뒤 API로 잰 값입니다.

산수 문제: 생각을 끄면 0번, 켜면 5번 정답

"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 5번씩 물었습니다. 정답은 10개, 3개입니다.

조건정답답걸린 시간
생각 끔5번 중 0번5번 모두 "한 사람당 7개, 남는 것 4개"0.6~0.9초
생각 켬5번 중 5번"한 사람당 10개, 남는 것 3개"약 6초 (생각 149토큰)

생각을 켜면 6초 만에 정답을 냈고 형식도 지켰습니다. 글쓰기와 달리 산수에서는 생각이 149토큰으로 짧습니다. 설정을 바꿔도 답의 내용은 같았습니다. 기본 설정에서도 생각 끔은 같은 오답, 생각 켬은 같은 정답이었고, 걸리는 시간만 1분에서 6초로 줄었습니다.

빠른 설정, 생각 켬으로 푼 산수 문제

생각 켬. 5.64초 생각하고 정답을 냈습니다. 생각 과정은 두 문단으로 짧습니다.

빠른 설정, 생각 끔으로 낸 산수 오답

생각 끔. "한 사람당 7개, 남는 것 4개"라는 틀린 답입니다.

긴 글 요약

이 블로그의 업데이트 기록을 앞에서부터 잘라 넣고 세 문장으로 요약하게 했습니다(컨텍스트 32,768, 생각 끔).

넣은 글입력 토큰첫 토큰까지(TTFT)생성 속도기본 설정에서는
3,000자1,4861.9초28.6t/s첫 토큰까지 6.7초, 1.95t/s
15,000자7,4027.1초28.7t/s재지 않음

두 번 모두 지시대로 세 문장으로 요약했습니다. 15,000자 요약에서는 게임 이름 '한알한알'을 '한알한글'로 잘못 적었습니다. 10만 자 요약은 하지 않았습니다. 131,072 컨텍스트에서는 VRAM이 넘쳐서 이 설정의 속도가 나오지 않기 때문입니다.

15,000자 글을 요약한 답과 통계

15,000자 요약. 세 문장으로 답했고 첫 토큰까지 8.65초였습니다.

전력과 온도

800자 글을 쓰는 동안 1초마다 GPU 전력과 온도를 쟀습니다(컨텍스트 32,768, 생각 끔).

항목빠른 설정기본 설정
대기 전력14~16W12W
글 쓰는 동안 평균약 169W30W
최고 전력176W38W
최고 온도70°C53°C
평균 GPU 사용률94%55%
토큰 하나당 에너지약 5.7J약 12.8J

빠른 설정에서는 전력이 전력 제한 180W 가까이 올라갑니다. 전력은 5배 넘게 쓰지만 속도가 훨씬 빨라서, 토큰 하나를 만드는 데 드는 에너지는 절반 아래로 줄었습니다. 이 값은 GPU 전력만 잰 것이고 CPU 전력은 들어 있지 않습니다.

대화가 길어지면

앞 대화 길이첫 토큰까지(TTFT)생성 속도기본 설정의 첫 토큰까지
약 1천 토큰1.2초28.4t/s7.8초
약 8천 토큰8.0초28.7t/s42.7초
약 2만 1천 토큰16.6초27.0t/s재지 않음

대화가 2만 토큰까지 길어져도 생성 속도는 27t/s 아래로 내려가지 않았습니다. 첫 토큰까지의 시간은 길어집니다. 9B 모델(같은 길이에서 5.5~5.9초)보다 3배쯤 걸립니다.

긴 문서를 넣은 채팅에서 이어서 물은 답

약 1만 토큰 글을 넣은 채팅에서 이어서 물은 화면. 첫 토큰까지 0.52초였습니다. 앞 내용이 이미 처리돼 있어서 빠릅니다.

긴 문서에서 정보 찾기

약 1만 토큰 글의 10·30·50·70·90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고 찾게 했습니다. 숨기지 않은 글에서 "없음"이라고 답하는지도 봤습니다.

숨긴 위치10%30%50%70%90%숨기지 않음
결과찾음찾음찾음찾음찾음"없음"

다섯 곳 모두 찾았고, 지시한 형식 그대로 "이름: 보리차, 태어난 해: 2019"라고 답했습니다. 답이 시작될 때까지는 약 10.5초였습니다. 기본 설정에서는 같은 질문에 57초가 걸렸습니다.

긴 문서 가운데에 숨긴 정보를 찾은 답

글의 가운데(50%)에 숨긴 정보를 찾은 화면. 첫 토큰까지 11.33초였습니다.

한국어 품질

두 설정에서 받은 한국어 답 34개를 모두 확인했습니다.

항목결과
외국 문자 섞임34개 답 중 0개
없는 낱말기본 설정의 사진 설명에서 모래시계를 "재모래시계"라고 씀. 빠른 설정에서는 "모래시계"로 바르게 씀
이름 틀림15,000자 요약에서 '한알한알'을 '한알한글'로 씀
없는 말"NVIDIA의 CUDA 코어"처럼 실제로는 없는 표현이 있음
분량생각 끔에서는 800자 요청에 1,400~1,600자. 생각 켬에서는 879자
말투모두 존댓말. 문장은 자연스럽고 글의 짜임이 좋음

같은 PC에서 잰 9B 모델들보다 글의 짜임이 탄탄했습니다. 한자 같은 외국 문자는 한 번도 섞이지 않았습니다.

없는 소설과 이미지

지어낸 책인 "한국 소설가 윤서하가 2018년에 발표한 장편소설 『푸른 등대의 겨울』의 줄거리"를 물었습니다.

조건걸린 시간답
생각 켬35초"신뢰할 만한 자료가 없다"고 답함. "줄거리를 임의로 만들어 드리는 것은 적절하지 않다"고 밝힘
생각 끔3.5초"존재하지 않는 인물과 작품입니다"라고 답함

없는 소설을 물었을 때의 답

생각 켬. 17.83초 생각한 뒤 작품이 확인되지 않는다고 답했습니다.

이미지는 모래시계 두 개가 놓인 사진을 주고 3문장으로 설명하게 했습니다. 오른쪽 모래시계 뒤에는 전자 부품이 보이는 사진입니다.

조건걸린 시간답
생각 켬13.3초모래시계 두 개, 오른쪽 뒤로 컴퓨터 부품과 케이블이 비친다고 설명
생각 끔5.3초모래시계 두 개, 오른쪽은 컴퓨터 부품이 보이는 케이스 안에 있다고 설명

생각을 꺼도 두 모래시계의 차이를 짚었습니다. 기본 설정에서는 같은 질문에 68초가 걸렸습니다.

모래시계 사진을 설명한 답

생각 켬. 왼쪽은 일반 모래시계, 오른쪽은 회로 보드와 전자 부품이 들어 있다고 설명했습니다.

정리

같은 PC에서 잰 다른 모델과 나란히 놓으면 아래와 같습니다. 800자 글, 생각 끔 기준입니다.

모델파일VRAM (8,192)생성 속도16GB에서
Qwen3.8 27B GSQ-RCO, 빠른 설정IQ3_S 12.12GB13.1GB약 29t/s원활
Qwen3.8 27B GSQ-RCO, 기본 설정IQ3_S 12.12GB13.5GB약 1.9t/s제한적
Qwen3.8 27B IQ2_S (기본 설정)IQ2_S 9.30GB9.9GB약 33t/s원활
Ornith 1.5 9B (기본 설정)Q8_0 9.79GB10.6GB약 50t/s원활
Qwen3.5 9B (기본 설정)Q6_K_XL 8.76GB9.7GB약 46t/s원활
  • LM Studio 기본 설정으로는 쓰기 어렵습니다. 레이어 일부가 CPU에 남아 약 1.9t/s입니다. 화면에는 GPU 오프로드가 65로 나오지만 실제로는 56~58개만 올라갑니다.
  • 설정 세 가지를 바꾸면 약 29t/s가 됩니다. Limit Model Offload를 끄고, GPU 오프로드를 65로 올리고, Speculative Decoding을 끕니다.
  • 컨텍스트는 32,768까지가 맞습니다. 65,536부터는 VRAM이 넘칩니다.
  • 생각은 질문에 따라 고릅니다. 산수는 생각을 켜야 맞고 6초면 끝납니다. 글쓰기는 생각을 켜면 5분 넘게 걸리고, 컨텍스트 8,192에서는 답이 나오지 않습니다.
  • 27B 모델을 16GB에서 3비트로 돌릴 수 있습니다. 88번 글에서는 2비트(IQ2_S)까지 줄여야 속도가 나왔는데, 그때 4비트·3비트가 느렸던 것도 같은 이유(레이어 일부가 CPU에 남음)였을 가능성이 큽니다. 그 파일들을 같은 설정으로 다시 재지는 않았습니다.

내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에서 직접 잰 값으로 볼 수 있습니다.

자주 묻는 질문

LM Studio에서 모델이 2t/s밖에 안 나오는데 VRAM은 남아 있습니다. 왜 그런가요?

레이어 일부가 GPU가 아니라 CPU에 남아 있을 수 있습니다. 이 글의 모델은 기본 설정에서 65개 레이어 중 56~58개만 GPU에 올라갔고, 나머지를 CPU 스레드 2개로 계산해 약 1.9t/s였습니다. 글을 쓰는 동안 GPU 사용률이 10% 안팎이고 전력이 30W 정도라면 이 경우일 가능성이 높습니다.

어떤 설정을 바꾸면 빨라지나요?

세 가지를 바꿨습니다. Settings의 Hardware에서 Limit Model Offload to Dedicated GPU Memory를 끄고, 모델 로드 창에서 GPU 오프로드를 최대(65)로 올리고, Speculative Decoding을 Off로 바꿨습니다. 이렇게 하니 약 1.9t/s에서 약 29t/s가 됐습니다.

Limit Model Offload를 꺼 둬도 괜찮은가요?

이 설정을 끄면 VRAM보다 큰 모델을 올릴 때 넘친 부분이 공유 메모리(시스템 램)로 갑니다. 그러면 오히려 느려질 수 있습니다. 이 글에서도 MTP를 켠 채로는 약 0.5GB가 넘쳐 16t/s대로 떨어졌습니다. VRAM에 다 들어가는지 확인하면서 쓰고, 큰 모델을 올릴 때는 다시 켜 두는 것이 안전합니다.

Qwen3.8 27B GSQ-RCO는 VRAM이 얼마나 필요한가요?

IQ3_S 파일을 레이어 전부 GPU에 올리고 MTP를 끄면 컨텍스트 8,192에서 13.1GB, 32,768에서 14.6GB를 썼습니다. 16GB 그래픽카드에서는 32,768까지가 맞습니다. 12GB 그래픽카드에는 이 파일이 다 들어가지 않습니다.

생각(Thinking)은 켜는 게 좋은가요?

산수처럼 계산이 필요한 질문은 켜야 합니다. 생각을 끄면 5번 모두 틀렸고, 켜면 6초 만에 5번 모두 맞았습니다. 글쓰기는 생각을 켜면 생각에만 8,000~9,000토큰을 써서 5분 넘게 걸립니다. 생각을 켜고 글을 쓰게 하려면 컨텍스트를 32,768로 올려야 답이 끝까지 나옵니다.

관련 게시글

댓글 0개