AI 테스트 RTX-5090

Qwen3.8 27B는 왜 답을 안 할까, 생각 단계 하나 낮추자 12초 만에 나왔다 (5090 실측)

EVUELA 2026년 09월 29일 33회 1시간 전
Qwen3.8 27B는 왜 답을 안 할까, 생각 단계 하나 낮추자 12초 만에 나왔다 (5090 실측)

Qwen3.8 27B는 알리바바 Qwen 팀이 2026년 8월에 공개한 270억 파라미터 모델입니다. 이미지 입력, 도구 호출, 생각(thinking)을 모두 지원하고, LM Studio에서는 추천 모델(Staff Pick)로 올라와 있습니다. RTX 5090 PC의 LM Studio에서 기본 설정 그대로 돌려 봤습니다. 결과부터 말하면 "800자 정도의 글을 써 달라"는 부탁에 1분 넘게 생각만 하다가 답을 한 글자도 내지 못했습니다. 모델이 나빠서가 아니라, 기본 설정 두 가지가 서로 맞지 않았기 때문입니다. 설정을 하나만 바꾸면 12초 만에 답을 받을 수 있었습니다.

테스트 PC 사양

부품사양
GPUNVIDIA GeForce RTX 5090 (VRAM 32GB)
GPU 드라이버616.92 (CUDA 13.4)
CPUIntel Core Ultra 9 285K (24코어 24스레드)
메모리DDR5 64GB (6000MT/s)
운영체제Windows 11 Pro (빌드 26200)
LM Studio0.4.25

같은 PC에서 앞서 Gemma 4 12B QAT와 Bonsai 27B를 같은 질문으로 테스트했습니다. 비교가 필요한 부분은 그 결과를 함께 적었습니다.

테스트한 모델: Qwen3.8 27B (Q4_K_M)

Qwen3.8 27B는 모든 파라미터를 매번 쓰는 dense 모델입니다. 64개 층으로 되어 있고, 긴 입력을 적은 메모리로 다루는 Gated DeltaNet 층과 일반 어텐션 층을 섞어 썼습니다. 이번에 받은 것은 LM Studio 검색에서 바로 나오는 lmstudio-community 판(Q4_K_M, 4비트 양자화)입니다. 같은 모델의 unsloth 판도 있지만 이번 테스트에는 쓰지 않았습니다.

LM Studio 모델 검색 화면의 Qwen3.8 27B

LM Studio 모델 검색 화면. 추천 모델 맨 위에 있고, 이미지 입력(Vision)·도구 호출(Tool Use)·생각(Reasoning)을 지원한다고 표시됩니다. 내려받을 크기는 17.74GB입니다.

항목내용
만든 곳알리바바 Qwen 팀 (2026년 8월 공개)
파일Qwen3.8-27B-Q4_K_M.gguf 16.81GB + 이미지 입력용 파일 0.93GB
구조dense 27B, 64층 (Gated DeltaNet + Gated Attention)
최대 컨텍스트262,144토큰 (RoPE 확장 시 약 100만 토큰)
기능이미지 입력, 도구 호출, 생각 단계 조절(끔·낮음·보통·켬·매우 높음)
라이선스Apache 2.0

LM Studio My Models의 Qwen3.8 27B 모델 정보

My Models의 모델 정보. 구조 항목에 qwen35와 함께 MTP가 표시됩니다.

제작사는 모델 카드에서 GPQA Diamond 89.2, SWE-bench Pro 61.7, OSWorld-Verified 84.3, Terminal Bench 2.1 73.0점을 받았다고 밝혔습니다. 이 점수는 제작사가 직접 잰 값이고, 원본(BF16) 기준입니다. 이번에 돌린 4비트 판과는 차이가 있을 수 있습니다 (Qwen3.8-27B 모델 카드). 모델 소개는 Qwen3.8-27B 소개 글에 따로 정리해 두었습니다.

LM Studio 기본 설정값

설정은 바꾸지 않고 LM Studio가 이 모델에 잡아 주는 기본값을 그대로 썼습니다. 이번 모델에는 앞선 테스트에서 못 보던 설정이 두 가지 있었습니다.

LM Studio Load 탭의 Qwen3.8 27B 기본 설정

Load 탭. 컨텍스트 8,192, GPU 오프로드 65(전체 층)가 기본값입니다.

Speculative Decoding MTP가 켜진 고급 설정

고급 설정. Speculative Decoding이 MTP로 켜져 있고(최대 3토큰), Flash Attention도 켜져 있습니다.

Reasoning Effort Extra High가 기본인 Inference 탭

Inference 탭. 생각 단계(Reasoning Effort)가 가장 높은 Extra High로 잡혀 있고, 생각 길이 제한은 없습니다(Unrestricted).

Qwen3.8 27B 샘플링 기본값 Top K 20 Top P 0.95

샘플링 기본값. Top K 20, Top P 0.95입니다.

설정기본값뜻
컨텍스트 길이8,192한 번에 기억하는 토큰 수. 생각과 답을 합쳐 이 안에 들어가야 합니다
GPU 오프로드65 (전체)모델의 모든 층을 GPU에 올립니다
Speculative DecodingMTP (최대 3토큰)모델 안의 예측 층으로 다음 토큰 몇 개를 미리 짐작해 속도를 올립니다
생각 단계Extra High (가장 높음)답하기 전에 풀이를 얼마나 길게 할지 정합니다
온도 / Top K / Top P1.0 / 20 / 0.95제작사가 생각 모드에 권장한 값과 같습니다

첫째는 MTP입니다. 모델에 다음 토큰을 미리 짐작하는 층이 들어 있어서, 따로 작은 모델을 받지 않아도 속도를 올릴 수 있습니다. 둘째는 생각 단계입니다. 기본값이 가장 높은 단계라서, 답하기 전에 매우 길게 생각합니다. 이 둘째 설정이 뒤에서 문제가 됩니다.

Qwen3.8 27B 불러오기 창 예상 메모리 19.54GB

불러오기 창에서 LM Studio가 계산한 예상 메모리는 19.54GB였습니다.

테스트 1. 불러오는 시간과 VRAM

컨텍스트 길이만 바꿔 다시 불러오며, 불러오기 직전과 직후의 GPU 메모리 차이를 쟀습니다.

컨텍스트 길이모델이 쓴 VRAM불러오는 시간참고: Bonsai 27B (1비트)
8,192 (기본값)약 19.7GB10.4초약 6.0GB
32,768약 21.4GB9.5초약 7.7GB
131,072약 27.9GB9.8초약 13.8GB
262,144 (최대)약 29.5GB11.6초약 21.9GB

기본 설정에서 약 19.7GB를 써서, 16GB 그래픽카드에는 들어가지 않습니다. 24GB 카드는 컨텍스트 32,768까지는 들어가지만, 윈도우가 쓰는 몫을 빼면 여유가 2GB가 안 됩니다. 최대 컨텍스트에서는 32GB인 RTX 5090도 전체 사용량이 약 31GB로, 거의 가득 찼습니다.

컨텍스트를 32배로 늘려도 메모리는 약 10GB만 늘었습니다. 같은 27B 구조를 1비트로 줄인 Bonsai 27B는 같은 조건에서 약 16GB가 늘었으니, 긴 입력용 메모리는 이쪽이 더 적게 씁니다. 그래픽카드 크기별로 들어가는지는 GPU 체험에서 바로 확인할 수 있습니다.

테스트 2. 800자 글을 부탁했더니 답이 없었다

"다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"을 물었습니다. 채팅 화면에서 한 번, API로 세 번 물었는데 네 번 모두 답이 비어 있었습니다.

글자 수를 세며 생각하는 Qwen3.8 27B

생각 과정을 펼쳐 보면, 쓸 글의 글자 수를 한 글자씩 세고 있습니다.

생각만 하다 컨텍스트 길이 제한으로 멈춘 화면

1분 12초 동안 생각한 뒤 "컨텍스트 길이 제한 도달"로 멈췄습니다. 8,112토큰을 만들었지만 답은 없습니다.

생각 과정을 열어 보니 원인이 보였습니다. 모델이 "800자 정도"를 정확히 맞추려고 초안을 쓰고 글자 수를 한 글자씩 세는 일을 반복했습니다. 그러다 생각에만 약 8,000토큰을 써서, 기본 컨텍스트 8,192를 다 채우고 끝났습니다. 가장 높은 생각 단계와 짧은 기본 컨텍스트가 서로 맞지 않는 것입니다.

그래서 컨텍스트를 32,768로 늘린 경우와, 생각 단계를 낮춘 경우를 API로 따로 쟀습니다.

생각 단계컨텍스트생각 토큰답 글자 수답이 끝날 때까지초당 토큰
Extra High (기본값)8,192약 8,000 (가득 참)0자 (4번 모두)76~86초95.2~107.1
Extra High (기본값)32,76810,025809자108.8초97.6
Medium (보통)32,768653 / 715936자 / 787자13.2초 / 12.0초88.2 / 92.6
Low (낮음)32,768697 / 853873자 / 570자11.9초 / 12.5초97.6 / 92.4
생각 끔8,19201,456~1,519자9.2~9.4초71.4~73.5

컨텍스트를 늘리면 Extra High도 답을 냈습니다. 809자로 요청에 가장 가까웠지만, 생각에 1만 토큰을 쓰느라 답을 받기까지 약 1분 49초가 걸렸습니다. 생각 단계를 Low나 Medium으로 낮추면 12~13초에 570~936자짜리 답이 나왔습니다. 생각을 끄면 가장 빨랐지만, 800자를 부탁했는데 1,500자 안팎으로 두 배 가까이 길게 썼습니다.

LM Studio 채팅 입력창의 Reasoning Effort 선택 메뉴

생각 단계는 채팅 입력창 아래 Reasoning Effort 버튼에서 바로 바꿀 수 있습니다.

생각 단계 Low로 받은 Qwen3.8 27B 답변

생각 단계를 Low로 바꾸자 9.57초 생각한 뒤 답을 냈습니다. 초당 93.15토큰, 1,198토큰입니다. 가운데 줄이 그어진 부분은 "12~16GB면 13B~30B" 사이의 물결표(~) 두 개를 LM Studio가 취소선으로 표시한 것입니다.

테스트 3. MTP는 속도를 얼마나 올릴까

위 표에서 이상한 점이 하나 있습니다. 생각을 켠 쪽(초당 약 95~107토큰)이 끈 쪽(초당 약 72토큰)보다 빠릅니다. MTP를 끄고 같은 질문을 다시 물어 원인을 확인했습니다.

설정MTP 켬 (기본값)MTP 끔차이
생각 끔초당 71.4~73.5토큰초당 64.4토큰약 12% 빠름
생각 Low초당 92.4~97.6토큰초당 64.4토큰약 45% 빠름
모델이 쓴 VRAM (컨텍스트 8,192)약 19.7GB약 17.6GB약 2.2GB 더 씀

MTP를 끄면 생각을 켜든 끄든 초당 64.4토큰으로 같았습니다. 즉 속도 차이는 MTP가 만든 것입니다. 생각 과정은 영어로, 비슷한 표현을 되풀이하며 진행돼서 미리 짐작한 토큰이 맞을 때가 많습니다. 채팅 화면에서도 생각 중에는 짐작한 토큰의 69%가 맞았고, 한국어 답만 쓸 때는 그보다 낮았습니다. 대신 MTP는 VRAM을 약 2.2GB 더 씁니다. 24GB 카드에서 메모리가 빠듯하다면 MTP를 끄는 것도 방법입니다.

테스트 4. 산수 문제

"사과 한 상자에 24개, 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면?"을 물었습니다. 정답은 한 사람당 10개, 3개 남음입니다.

Qwen3.8 27B의 산수 생각 과정과 정답

생각은 영어로 짧게 진행됐고, 1.19초 만에 정답을 냈습니다.

생각을 끈 Qwen3.8 27B의 틀린 산수 답

생각을 끄면 0.14초 만에 "한 사람당 9개, 남는 것 4개"라는 틀린 답을 냈습니다.

API로 5번씩 반복한 결과입니다.

설정정답한 번에 걸린 시간참고: Gemma 4 12B참고: Bonsai 27B
생각 Extra High (기본값)5번 중 5번약 1.6초5번 중 5번5번 중 2번
생각 Low5번 중 5번약 1.3초--
생각 끔5번 중 2번약 0.5초5번 중 0번5번 중 1번

생각을 켜면 단계와 상관없이 모두 맞혔습니다. 짧은 문제에서는 Extra High도 생각을 120~160토큰만 써서 2초 안에 끝났습니다. 생각을 끄면 7개·2개, 12개·1개, 11개·4개처럼 틀렸습니다. 맞힌 2번은 "형식으로만 답하라"는 지시를 어기고 계산 과정을 먼저 쓴 경우였습니다. 계산을 글로 풀어야 맞히는 셈입니다.

테스트 5. 긴 글 요약

이 블로그의 업데이트 기록을 3,000자, 15,000자, 100,000자로 잘라 넣고 세 문장으로 요약하게 했습니다. 생각은 끄고, 답은 300토큰까지만 받았습니다.

입력입력 토큰첫 글자까지생성 속도참고: 첫 글자까지 (Gemma 4 12B / Bonsai 27B)
3,000자1,5310.84초초당 71.2토큰0.49초 / 0.44초
15,000자7,2242.35초초당 73.3토큰0.93초 / 1.69초
100,000자45,65219.15초초당 63.1토큰7.53초 / 13.36초

약 4만 5천 토큰을 넣었을 때 첫 글자까지 19.2초가 걸렸습니다. 입력을 읽는 속도로 따지면 초당 약 2,400토큰으로, 세 모델 중 가장 느립니다. 대신 요약은 세 개 모두 날짜와 고친 내용을 맞게 담았고, 외국어도 섞이지 않았습니다.

테스트 6. 없는 소설을 물어보면

실제로는 없는 작품인 "한국 소설가 윤서하가 2018년에 발표한 『푸른 등대의 겨울』의 줄거리"를 물었습니다.

없는 소설에 정보를 찾을 수 없다고 답한 Qwen3.8 27B

8.95초 생각한 뒤 "정보를 찾을 수 없다"고 답하고, 추가 정보를 알려 달라고 했습니다.

설정답걸린 시간
생각 Extra High (기본값)정보를 찾을 수 없다17.8초
생각 Low정보를 찾을 수 없다 (중국어 "书名" 한 단어 섞임)4.3초
생각 끔"존재하지 않는 인물과 작품입니다"1.7초

세 설정 모두 줄거리를 지어내지 않았습니다. 같은 질문에 Bonsai 27B는 출판사와 줄거리를 지어냈고, Gemma 4 12B는 "확인할 수 없다"고 답했습니다. 다만 생각을 끄면 "존재하지 않는다"고 단정했는데, 모델이 모든 책을 아는 것은 아니니 이 말도 정확하지는 않습니다.

테스트 7. 이미지 넣기

모래시계 두 개가 있는 사진을 넣고 무엇이 보이는지 세 문장으로 설명하게 했습니다. 오른쪽 모래시계 뒤에는 컴퓨터 부품과 케이블이 보이는 사진입니다.

모래시계 사진을 설명하는 Qwen3.8 27B

3.49초 생각한 뒤 답했습니다. 내용은 정확했지만 "회로基板"처럼 한자가 한 단어 섞였습니다.

나무 테이블, 모래시계 두 개, 오른쪽 모래시계 안의 전자 부품, 뒤쪽의 LED가 달린 오디오 장비까지 빠짐없이 알아봤습니다. 채팅 화면에서는 "회로기판"을 "회로基板"으로 써서 한자가 섞였습니다. API로 두 번 더 물었을 때는 한자가 없었고, 한 번은 나무 틀을 "금속 프레임"이라고 조금 다르게 설명했습니다. 생각 단계를 Low로 두면 3.4초, 기본값이면 6.6초에 답했습니다.

정리

  • 기본 설정 그대로면 긴 글 부탁에 답이 안 나올 수 있습니다. 생각 단계 기본값(Extra High)이 짧은 기본 컨텍스트(8,192)를 다 써 버립니다. 컨텍스트를 32,768 이상으로 늘리거나, 생각 단계를 Low·Medium으로 낮추세요.
  • 생각 단계는 Low나 Medium이 쓰기 좋았습니다. 800자 글은 12~13초, 산수는 5번 모두 정답이었습니다.
  • 한국어는 안정적이었습니다. 이번에 받은 답 약 40개 중 한자·중국어 단어가 섞인 것은 3개였습니다. 없는 소설도 지어내지 않았습니다.
  • 메모리는 넉넉해야 합니다. 기본 설정에서 약 19.7GB라 16GB 카드에는 들어가지 않고, 24GB 카드는 빠듯합니다.
  • MTP는 공짜가 아닙니다. 생각 중 속도를 약 45% 올리지만 VRAM을 약 2.2GB 더 씁니다.

같은 PC에서 잰 모델 중 한국어 답의 품질은 가장 좋았고, 대신 속도는 12B 모델(초당 약 145토큰)의 절반 정도였습니다. 16GB 그래픽카드를 쓴다면 RTX 5060 Ti 16GB에서 Gemma 4 12B를 돌린 결과가 더 현실적인 선택지입니다. 같은 Qwen 계열의 가벼운 모델은 Qwen3.6-35B-A3B 글을 참고하세요.

자주 묻는 질문

Qwen3.8 27B가 LM Studio에서 답을 안 하고 멈춰요. 왜 그런가요?

생각 단계 기본값(Extra High)에서 생각이 길어져, 기본 컨텍스트 8,192를 다 채우면 답을 쓰기 전에 멈춥니다. 화면에는 "컨텍스트 길이 제한 도달"이 표시됩니다. Load 탭에서 컨텍스트를 32,768 이상으로 늘리거나, 채팅 입력창 아래 Reasoning Effort를 Low나 Medium으로 바꾸면 해결됩니다.

Qwen3.8 27B는 VRAM을 얼마나 쓰나요?

Q4_K_M 판 기준으로 기본 컨텍스트 8,192에서 약 19.7GB였습니다. 32,768에서 약 21.4GB, 131,072에서 약 27.9GB, 최대인 262,144에서 약 29.5GB를 썼습니다. MTP를 끄면 약 2.2GB 줄어듭니다. RTX 5090에서 잰 값입니다.

16GB 그래픽카드로 Qwen3.8 27B를 돌릴 수 있나요?

Q4_K_M 판은 기본 설정에서도 약 19.7GB가 필요해서 16GB 카드의 VRAM에는 다 들어가지 않습니다. 일부 층을 CPU로 넘기면 불러올 수는 있지만 속도가 크게 떨어집니다. 16GB 카드에서는 12B 안팎의 모델이 더 알맞습니다.

RTX 5090에서 속도는 얼마나 나오나요?

생각을 끄면 초당 약 72토큰, 생각을 켜면 초당 약 88~107토큰이었습니다. 생각을 켠 쪽이 빠른 이유는 MTP가 생각 과정에서 더 잘 맞기 때문입니다. MTP를 끄면 두 경우 모두 초당 64.4토큰이었습니다.

관련 게시글

댓글 0개