알리바바의 Qwen3.8 27B를 RTX 5060 Ti 16GB PC의 LM Studio에서 기본 설정 그대로 돌려 봤습니다. 양자화가 다른 파일 4개(4비트 Q4_K_M, 3비트 Q3_K_XL·IQ3_S, 2비트 IQ2_S)를 차례로 썼습니다. 결론부터 말하면 4비트와 3비트는 모두 약 2t/s(초당 토큰)로, 800자 글 하나에 5분이 걸렸습니다. 2비트 IQ2_S만 약 33t/s로 15배 빨랐고, 이때는 GPU가 전력 한도(180W)까지 일했습니다. 다만 2비트는 생각을 끄면 답의 정확도가 눈에 띄게 떨어졌습니다.
테스트 PC 사양
| 부품 | 사양 |
|---|---|
| GPU | NVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W) |
| GPU 연결 | PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원) |
| GPU 드라이버 | 616.92 (CUDA 13.4) |
| CPU | Intel Core i5-9400F (6코어 6스레드) |
| 메인보드 | MSI H310M PRO-VD PLUS |
| 시스템 램 | DDR4 32GB (16GB × 2, 2666MT/s) |
| 저장장치 | Crucial MX500 1TB SATA SSD (모델 파일 위치) |
| 운영체제 | Windows 11 Pro 25H2 (빌드 26200) |
| LM Studio | 0.4.25 |
| 런타임 | llama.cpp CUDA 12 런타임 2.47.0 (테스트 당일 자동 업데이트, LM Studio 기본 선택) |
Gemma 4 12B, Gemma 4 26B A4B를 테스트한 PC와 같습니다. GPU는 최신이지만 CPU와 램은 몇 년 된 부품입니다.
테스트한 모델: Qwen3.8 27B
Qwen3.8 27B는 알리바바 Qwen 팀이 2026년 8월 공개한 모델입니다. 토큰마다 모든 파라미터를 쓰는 dense 모델이고, 64개 레이어로 되어 있습니다. 긴 입력을 적은 메모리로 다루는 Gated DeltaNet 레이어와 일반 어텐션 레이어를 섞어 썼습니다. 라이선스는 Apache 2.0입니다. 모델 소개와 RTX 5090 결과는 RTX 5090에서 잰 Qwen3.8 27B 글에 있습니다.
이번에는 같은 모델을 양자화(모델을 몇 비트로 줄였는지)만 다르게 4개 파일로 받아 비교했습니다.
| 파일 | 만든 곳 | 크기 (이미지 입력 파일 포함) | MTP 레이어 | 생각 단계 |
|---|---|---|---|---|
| Q4_K_M (4비트) | lmstudio-community | 17.74GB | 있음 | 끔·low·medium·xhigh(기본) |
| Q3_K_XL (3비트) | unsloth | 14.07GB | 있음 | 켬(기본)·끔 |
| IQ3_S (3비트) | unsloth | 12.97GB | 있음 | 켬(기본)·끔 |
| IQ2_S (2비트) | unsloth | 9.30GB | 없음 | 켬(기본)·끔 |
MTP는 모델이 다음 토큰을 미리 짐작해 속도를 올리는 추가 레이어입니다. IQ2_S 파일에만 이 레이어가 없어서, LM Studio의 GPU 오프로드 레이어 수도 64개로 표시됩니다(다른 파일은 65개).

My Models 화면의 Q4_K_M 판. Q4_K_M, MTP, 17.74GB로 표시됩니다.

같은 화면의 IQ2_S 판. 아키텍처에 MTP 표시가 없고, 크기는 9.30GB입니다.
LM Studio 기본 설정값
설정은 바꾸지 않고 LM Studio 기본값으로 테스트했습니다. 다만 파일마다 기본값이 달랐습니다. lmstudio-community 판(Q4_K_M)은 모델에 맞춘 추천 설정이 들어 있고, unsloth 판(3비트·2비트)은 LM Studio 일반 기본값으로 보입니다(추정).

Q4_K_M Load 탭 기본값. 컨텍스트 8,192, GPU 오프로드 65(전체 레이어), CPU 스레드 2입니다.

Q4_K_M 고급 설정. Speculative Decoding이 MTP로 켜져 있고 Flash Attention도 켜져 있습니다.

IQ2_S는 MTP 레이어가 없어 Speculative Decoding이 꺼져 있습니다.

Q4_K_M Inference 탭. 생각 단계(Reasoning Effort)가 Extra High, 생각(Enable Thinking)이 켜져 있습니다.

IQ2_S(unsloth) Inference 탭. 생각은 켬·끔만 있고, 온도가 0.1입니다.
| 설정 | Q4_K_M (lmstudio-community) | 3비트·2비트 (unsloth) | 뜻 |
|---|---|---|---|
| 컨텍스트 길이 | 8,192 | 8,192 | 모델이 한 번에 기억하는 토큰 수. 최대 262,144 |
| GPU 오프로드 | 65 (전체) | 65 (IQ2_S는 64, 전체) | GPU에 올릴 레이어 수 |
| Speculative Decoding | MTP 켬 | MTP 켬 (IQ2_S는 끔) | 다음 토큰을 미리 짐작해 속도를 올리는 기능 |
| Flash Attention | 켬 | 켬 | 긴 입력에서 메모리와 시간을 아끼는 계산 방식 |
| CPU 스레드 | 2 | 2 | CPU가 계산에 쓰는 스레드 수 |
| 생각 | Extra High (기본) | 켬 (기본) | 답하기 전에 풀이를 먼저 만드는 기능 |
| 온도 | 1 | 0.1 | 낮을수록 매번 비슷한 답 |
| Top K / Top P / Min P | 20 / 0.95 / 끔 | 40 / 0.95 / 0.05 | 다음 토큰을 고르는 범위 |
| 반복 패널티 | 끔 | 1.1 | 같은 말 반복을 줄이는 값 |
온도와 샘플링 값이 달라서, 양자화 차이만 따로 떼어 비교한 것은 아닙니다. 사람들이 LM Studio에서 파일을 받아 그대로 쓸 때의 결과로 봐 주세요.
VRAM과 로드: 예상 메모리가 16GB를 넘는 것은 Q4_K_M뿐

Q4_K_M 모델 로드 창. 예상 메모리가 19.54GB로, 이 GPU의 VRAM(15.90GB)보다 큽니다.

IQ2_S 모델 로드 창. 예상 메모리 10.24GB로 VRAM에 여유 있게 들어갑니다.
| 파일 | LM Studio 예상 (로드 창) | VRAM 증가 | 시스템 램 증가 | 로드 시간 |
|---|---|---|---|---|
| Q4_K_M | 19.54GB | 12.6GB | 17.4GB | 17.7초 |
| Q3_K_XL | 15.50GB | 13.5GB | 13.1GB | 51.1초 |
| IQ3_S | 14.28GB | 13.4GB | 12.3GB | 14.0초 |
| IQ2_S | 10.24GB | 9.9GB | 8.3GB | 9.5초 |
기본 컨텍스트(8,192)에서 잰 값입니다. Q4_K_M은 VRAM에 다 들어가지 않아 일부가 시스템 램에 남았습니다. 3비트 두 파일은 LM Studio 예상으로는 VRAM에 들어가는 크기입니다. 시스템 램이 크게 늘어난 것은 "모델을 메모리에 유지" 설정 때문에 파일이 램에도 올라가기 때문으로 보입니다.
테스트 1. 800자 글 쓰기 속도: 2비트만 빨랐다
"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점을 800자 정도로 써 주세요"를 API로 물었습니다.
| 파일 | 생각 끔 | 생각 켬(기본) | 800자 글 한 편 (생각 끔) |
|---|---|---|---|
| Q4_K_M | 2.1~2.2t/s (3회) | 2.1t/s (1회) | 4~5분 |
| Q3_K_XL | 1.4t/s (1회) | - | 6분 36초 |
| IQ3_S | 2.1t/s (1회) | - | 4분 27초 |
| IQ2_S | 33.4~33.6t/s (3회) | 33.6~35.4t/s (3회) | 33~45초 |
| 참고: RTX 5090, Q4_K_M | 약 72t/s | 약 88~107t/s | 약 9초 |
4비트와 3비트는 이 PC에서 너무 느려서 끝까지 재지 못했습니다. 한 번 답하는 데 5분 안팎이 걸려, Q4_K_M은 속도·산수까지, 3비트 두 파일은 800자 글 1회만 잰 뒤 멈췄습니다. Q3_K_XL의 1.4t/s는 다른 파일을 내려받는 동안 잰 값이라 실제보다 낮을 수 있습니다.

Q4_K_M에 짧은 산수 질문을 했는데, 15초가 지나도 "Processing Prompt 95%"에서 기다리는 화면입니다.

Q4_K_M 채팅 통계. 2.62t/s입니다. 이 채팅에서는 생각 버튼이 켜져 있었는데도 생각 없이 바로 답해 틀렸습니다(원인 미확인). API로 잰 기본 설정에서는 5번 모두 생각한 뒤 맞혔습니다.

IQ2_S의 생각 과정. 영어로 구성을 짜고, 한국어 초안까지 생각 안에서 씁니다.

IQ2_S 채팅 화면. 37초 생각한 뒤 글을 썼고, 31.55t/s, 1,565토큰, 첫 토큰까지 0.64초입니다.
테스트 2. 왜 4비트·3비트는 느렸을까
글을 쓰는 동안 작업 표시줄의 모니터를 찍어 비교했습니다.

Q4_K_M이 답하는 동안. CPU 90%, GPU 12%입니다.

IQ2_S가 답하는 동안. GPU 93%, GPU 온도 69°C입니다.
느린 파일은 GPU가 거의 쉬고 CPU만 바빴습니다. IQ3_S로 잰 GPU 사용률은 평균 7.5%, 전력은 25W였습니다. 계산의 대부분이 CPU에서 돌고 있다는 뜻으로 보입니다(추정). 원인을 좁히려고 아래를 확인했습니다.
| 확인한 것 | 결과 | 원인인가 |
|---|---|---|
| VRAM이 모자란가 | IQ3_S는 예상 14.28GB로 VRAM에 들어가는데도 2.1t/s | 아님 |
| 런타임 업데이트(2.46.0 → 2.47.0) | 2.46.0으로 되돌려도 IQ3_S 2.17t/s | 아님 |
| MTP | IQ3_S에서 MTP를 끄면 2.1 → 3.3t/s, Q4_K_M은 2.2 → 2.5t/s | 조금 영향, 주원인은 아님 |
결국 이 PC에서 3비트 이상이 느린 이유는 확인하지 못했습니다. 같은 모델의 Q4_K_M이 RTX 5090 PC에서는 약 72t/s였고, 같은 5060 Ti PC에서 Gemma 4 26B A4B는 약 21t/s였습니다. 이 모델, 이 PC(i5-9400F, PCIe 3.0 x8), LM Studio 기본 설정의 조합에서 생기는 문제로 보입니다(추정). 같은 16GB GPU라도 PC 구성에 따라 결과가 다를 수 있습니다.
테스트 3. 전력과 온도 (IQ2_S)
IQ2_S가 800자 글을 쓰는 동안(생각 끔) 0.5초마다 GPU 전력·온도·사용률을 기록했습니다.
| 항목 | 1회 | 2회 |
|---|---|---|
| 대기 전력 | 16.0W | 19.0W |
| 글 쓰는 동안 평균 전력 | 175.7W | 179.0W |
| 최고 전력 | 180.8W | 180.5W |
| 최고 온도 | 77°C | 74°C |
| 평균 GPU 사용률 | 92.4% | 92.2% |
| 토큰당 에너지 (GPU만) | 4.99J | 5.05J |
IQ2_S는 GPU 전력 제한(180W)까지 썼습니다. 느린 파일(25~38W)과 정반대입니다. 같은 PC의 Gemma 4 26B A4B는 30~36W였습니다.
테스트 4. 산수: 생각을 끄면 틀린다
"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요?"를 물었습니다. 정답은 한 사람당 10개, 3개 남음입니다.

IQ2_S 생각 켬. 3.37초 생각하고 정답을 냈습니다.

IQ2_S 생각 끔. "한 사람당 7개, 남는 것 4개"라는 틀린 답입니다.
| 파일·설정 | 정답 횟수 | 나온 답 | 평균 응답 시간 |
|---|---|---|---|
| Q4_K_M 생각 xhigh (기본) | 5번 중 5번 | 모두 "10개, 3개" | 45.3초 |
| Q4_K_M 생각 low | 5번 중 5번 | 모두 "10개, 3개" | 37.7초 |
| Q4_K_M 생각 끔 | 5번 중 1번 | 11·1, 11·4, 17·4, 10·3(풀이를 쓰고 맞힘), 13·4 | 8.0초 |
| IQ2_S 생각 켬 (기본) | 5번 중 5번 | 모두 "10개, 3개" | 3.9초 |
| IQ2_S 생각 끔 | 5번 중 0번 | 7·4, 20·4를 번갈아 | 0.6초 |
생각을 켜면 두 파일 모두 5번 다 맞혔습니다. IQ2_S는 생각을 켜도 4초 안에 답했습니다. 생각을 끄면 틀렸고, IQ2_S는 온도가 0.1이라 같은 오답을 반복했습니다.
테스트 5. 긴 글 요약과 컨텍스트 (IQ2_S)
이 블로그의 업데이트 기록을 잘라 넣고 세 문장으로 요약하게 했습니다(생각 끔).

3,000자 요약. 첫 토큰까지 2.02초였습니다.
| 입력 | 컨텍스트 | 입력 토큰 | 첫 토큰까지(TTFT) | 프롬프트 처리 속도(PP) | 생성 속도 |
|---|---|---|---|---|---|
| 3,000자 | 32,768 | 1,486 | 2.0초 | 약 740t/s | 33.8t/s |
| 15,000자 | 32,768 | 7,402 | 7.7초 | 약 960t/s | 34.6t/s |
| 100,000자 | 131,072 | 44,315 | 1,678초 (28분) | 약 26t/s | 4.3t/s |
컨텍스트 32,768까지는 빨랐습니다. 131,072에서는 첫 토큰까지 28분을 기다렸습니다. 이때 VRAM은 15.5GB로 가득 찼고, 넘친 3.2GB는 윈도우의 공유 GPU 메모리(시스템 램)로 넘어갔습니다. 모델 가중치는 VRAM에 있었지만, 컨텍스트용 메모리가 넘친 것으로 보입니다(추정). LM Studio Hardware 화면에도 "컨텍스트는 공유 메모리를 쓸 수 있다"고 적혀 있습니다.
| 컨텍스트 | VRAM 증가 | LM Studio 예상 |
|---|---|---|
| 8,192 | 9.9GB | 8.66GiB |
| 32,768 | 11.4GB | 11.95GiB |
| 131,072 | 14.6GB + 공유 메모리 약 3.2GB | 19.07GiB |
16GB GPU에서 IQ2_S를 쓴다면 컨텍스트는 32,768 정도가 알맞습니다. 131,072는 로드는 되지만, 긴 글을 넣으면 쓰기 어려울 만큼 느려졌습니다. 32,768과 131,072 사이는 재지 않았습니다.
테스트 6. 대화가 길어지면 (IQ2_S)
앞선 대화가 약 1천, 8천, 2만 토큰 쌓인 상태를 만들고 이어서 다섯 문장을 쓰게 했습니다(생각 끔, 컨텍스트 32,768).
| 앞 대화 길이 | 첫 토큰까지 | 생성 속도 |
|---|---|---|
| 1,030토큰 | 1.3초 | 35.1t/s |
| 7,874토큰 | 8.7초 | 34.2t/s |
| 21,374토큰 | 17.9초 | 31.8t/s |
대화가 2만 토큰을 넘어도 생성 속도는 10% 정도만 줄었습니다. 같은 PC의 Gemma 4 26B A4B는 17.5 → 8.2t/s로 절반 이하가 됐습니다.

약 1만 토큰 글을 넣은 채팅에서 이어서 물은 답. 앞부분은 캐시를 다시 써서 첫 토큰까지 0.33초였습니다.
테스트 7. 긴 문서에서 정보 찾기 (IQ2_S)
약 1만 토큰 글의 10·30·50·70·90% 위치에 "블로그 관리자가 키우는 고양이 이름은 보리차, 2019년생"이라는 문장을 숨기고 찾게 했습니다. 문장이 없는 글에도 같은 질문을 해서 지어내는지 확인했습니다.
| 숨긴 위치 | 10% | 30% | 50% | 70% | 90% | 숨기지 않음 |
|---|---|---|---|---|---|---|
| 결과 | 찾음 | 찾음 | 찾음 | 찾음 | 찾음 | "없음" (정답) |
| 첫 토큰까지 | 11.4초 | 11.3초 | 11.3초 | 11.3초 | 11.3초 | 11.3초 |

약 2만 자 글의 가운데(50%)에 숨긴 정보를 찾은 화면입니다.
2비트로 줄였어도 다섯 곳 모두 찾았고, 없는 정보를 지어내지 않았습니다.
한국어 품질
받은 한국어 답에서 한자·일본어 같은 외국 문자가 섞였는지 찾아봤습니다.
- Q4_K_M: 생각 끔 800자 글에서 "主流(주류)" 한 단어가 섞였습니다.
- IQ2_S: 생각 끔 없는 소설 답에서 "以下几种(아래 몇 가지)"라는 중국어가 섞였습니다.
- IQ2_S는 분량을 잘 지키지 못했습니다. 800자를 부탁했는데 생각을 끄면 2,450~3,155자를 썼습니다. 생각을 켜면 531~677자였습니다.
- IQ2_S 글에는 "7B급 모델이라면 최소 16GB 이상의 VRAM이 권장된다"처럼 부정확한 설명도 있었습니다.
테스트 8. 없는 소설과 이미지 (IQ2_S)
실제로는 없는 작품인 "윤서하 작가의 2018년 소설 『푸른 등대의 겨울』의 줄거리"를 물었습니다.

생각 켬. 6초 생각한 뒤 "제공해 드릴 수 있는 정보가 없다"고 답했습니다.
생각을 켜면 줄거리를 지어내지 않았습니다. 생각을 끄면 "작품은 존재하지 않는 것으로 확인된다"고 하면서도, 이어서 "윤서하는 한국에서 활동 중인 작가로 알려져 있다"는 확인되지 않은 내용을 덧붙이고 비슷한 작품을 추천하려 했습니다. 2비트에서 생각을 끄면 지어내는 경향이 생겼습니다.

이미지 설명. 모래시계 두 개, 오른쪽 모래시계의 회로 부품, 뒤쪽 오디오 장비까지 맞게 설명했습니다.
이미지 설명은 생각 켬(8.5초)·끔(4.1초) 모두 정확했습니다.
정리
| 항목 | Qwen3.8 27B IQ2_S | Qwen3.8 27B Q4_K_M | 참고: 같은 PC Gemma 4 26B A4B |
|---|---|---|---|
| 파일 크기 | 9.30GB | 17.74GB | 15.63GB |
| VRAM (기본 컨텍스트) | 9.9GB | 12.6GB (일부는 시스템 램) | 12.4GB (일부는 시스템 램) |
| 생성 속도 (생각 끔) | 33.5t/s | 2.2t/s | 21.1t/s |
| 글 쓰는 동안 GPU 전력 | 176~179W | 25~38W (IQ3_S 기준) | 30~36W |
| 산수 (생각 켬 / 끔) | 5/5 / 0/5 | 5/5 / 1/5 | 5/5 / 0/5 |
| 정보 찾기 (5곳) | 5곳 모두 + "없음" 정답 | 재지 않음 | 5곳 모두 + "없음" 정답 |
- 16GB GPU에서 Qwen3.8 27B를 쓸 만한 속도로 돌린 것은 2비트 IQ2_S뿐이었습니다. 약 33t/s로, 4비트·3비트(약 2t/s)보다 15배 빨랐습니다.
- 2비트는 생각을 켜고 쓰는 것이 맞습니다. 끄면 산수를 모두 틀렸고, 없는 작가 정보를 지어내고, 중국어가 섞였습니다. 켜도 4~30초면 답이 나왔습니다.
- 컨텍스트는 32,768 정도가 알맞습니다. 131,072에서 긴 글을 넣으면 첫 토큰까지 28분이 걸렸습니다.
- 3비트 이상이 느린 원인은 찾지 못했습니다. VRAM 부족도, 런타임 업데이트도 아니었고, MTP를 끄면 조금만 빨라졌습니다.
RTX 5090에서 같은 모델(Q4_K_M)을 잰 결과는 Qwen3.8 27B RTX 5090 글에 있습니다. 같은 16GB PC에서는 Gemma 4 12B(약 44t/s)와 Gemma 4 26B A4B(약 21t/s)도 참고할 만합니다. 여러 모델의 속도는 GPU 체험에서 한눈에 비교할 수 있습니다.
자주 묻는 질문
RTX 5060 Ti 16GB로 Qwen3.8 27B를 돌릴 수 있나요?
로드는 4개 파일 모두 됐습니다. 하지만 이 PC에서 쓸 만한 속도가 나온 것은 2비트 IQ2_S(9.30GB)뿐이었습니다. 약 33t/s였고, 4비트 Q4_K_M과 3비트 파일은 약 2t/s였습니다.
Q4_K_M은 왜 이렇게 느린가요?
Q4_K_M(17.74GB)은 VRAM에 다 들어가지 않아 일부가 시스템 램에 남습니다. 다만 VRAM에 들어가는 3비트 IQ3_S도 약 2t/s였기 때문에, VRAM만의 문제는 아니었습니다. 런타임과 MTP도 확인했지만 정확한 원인은 찾지 못했습니다.
2비트로 줄이면 품질이 많이 떨어지나요?
생각을 켜면 산수 5번 모두 정답, 긴 문서 정보 찾기 5곳 모두 성공, 없는 소설도 지어내지 않았습니다. 생각을 끄면 산수를 모두 틀리고, 없는 정보를 덧붙이고, 중국어가 섞였습니다. 2비트는 생각을 켜고 쓰는 것을 권합니다.
16GB GPU에서 컨텍스트는 얼마로 두면 되나요?
IQ2_S 기준으로 32,768에서는 VRAM 11.4GB에 빠르게 돌았습니다. 131,072에서는 VRAM이 차고 공유 메모리로 넘쳐, 10만 자 글을 넣었을 때 첫 토큰까지 28분이 걸렸습니다. 32,768 정도를 권합니다.
MTP를 끄면 빨라지나요?
이 PC에서는 조금 빨라졌습니다. IQ3_S는 2.1 → 3.3t/s, Q4_K_M은 2.2 → 2.5t/s였고 VRAM도 약 1.3GB 줄었습니다. 하지만 2비트(약 33t/s)만큼 빨라지지는 않았습니다.
댓글 0개