LM Studio에서 Qwen3.8 27B를 검색하면 같은 모델을 여러 곳에서 올려 둔 것이 보입니다. lmstudio-community, unsloth, ggml-org가 대표적입니다. 이름은 셋 다 Q4_K_M인데, 어느 것을 받아야 할지 알려 주는 자료는 찾기 어렵습니다. 그래서 세 파일을 모두 받아 RTX 5090에서 같은 조건으로 재 봤습니다.
결과를 먼저 적으면 이렇습니다.
- 정답률은 거의 같았습니다. 채점 질문을 250번씩 풀게 했더니 171~180번을 맞혔습니다. 회차마다 흔들리는 폭과 비슷한 차이입니다.
- 속도는 달랐습니다. LM Studio 기본값으로 초당 63.8~86.2토큰이 나왔습니다. 차이를 만든 것은 파일 안에 MTP 레이어가 들어 있느냐였습니다.
- 파일 속은 많이 달랐습니다. 같은 Q4_K_M인데 크기가 16.46GB에서 18.97GB까지, 2.5GB 차이가 났습니다.
- LM Studio가 붙여 주는 기능도 달랐습니다. 생각 단계를 5가지로 고를 수 있는 것은 lmstudio-community 파일뿐이었습니다.

LM Studio 모델 선택 창입니다. Qwen3.8 27B Q4_K_M이 qwen(lmstudio-community), ggml-org, unsloth 세 곳 것으로 따로 보입니다. ggml-org 줄에만 MTP 표시가 없습니다.
테스트 환경
| 항목 | 내용 |
|---|---|
| 그래픽카드 | RTX 5090 (VRAM 32GB) |
| 실행 프로그램 | LM Studio 0.4.25, llama.cpp CUDA 12 엔진 v2.47.0 |
| 모델 | Qwen3.8 27B, 세 파일 모두 Q4_K_M |
| 모델 설정 | LM Studio 기본값 그대로 로드 (컨텍스트 8,192) |
| 생각(Thinking) | 끔. 켜면 한 문제에 수십 초가 걸려 비교가 흐려집니다 |
| 날짜 | 2026년 10월 1일 |
세 파일을 같은 프로그램, 같은 엔진, 같은 설정으로 하나씩 로드해서 쟀습니다. 그래서 결과에 차이가 나면 파일 차이로 볼 수 있습니다.
비교한 파일 세 개
| 올린 곳 | 파일 이름 | 크기 | Hugging Face 내려받기 | 어떤 곳인가 |
|---|---|---|---|---|
| lmstudio-community | Qwen3.8-27B-Q4_K_M.gguf | 16.81GB | 137만 | LM Studio가 직접 올리는 곳. LM Studio에서 검색하면 가장 먼저 나옵니다 |
| unsloth | Qwen3.8-27B-UD-Q4_K_M.gguf | 16.46GB | 634만 | 가장 많이 받는 곳. 자체 방식(UD, Unsloth Dynamic)으로 줄입니다 |
| ggml-org | Qwen3.8-27B-Q4_K_M.gguf | 18.97GB | 103만 | llama.cpp 개발진이 올리는 곳 |
내려받기 수는 2026년 10월 1일 Hugging Face에 표시된 저장소 전체 숫자입니다. 세 파일 모두 원본은 Qwen/Qwen3.8-27B이고 라이선스는 Apache 2.0입니다.

My Models 화면입니다. 발행자 칸에 ggml-org, unsloth, lmstudio-community가 보입니다. 아키텍처 칸의 MTP 표시가 ggml-org에만 없습니다.
먼저 알아 둘 말
- 양자화: 모델의 숫자(가중치)를 적은 비트로 줄여 파일을 작게 만드는 일입니다. 원본은 숫자 하나에 16비트를 쓰는데, 4비트쯤으로 줄이면 파일이 3분의 1 아래로 작아집니다.
- Q4_K_M: 가장 널리 쓰는 4비트 양자화 이름입니다. 다만 모든 부분을 4비트로 줄이는 것이 아니라, 중요한 부분은 조금 덜 줄입니다. 어느 부분을 덜 줄일지는 만드는 사람이 정할 수 있습니다. 이 글의 핵심이 여기에 있습니다.
- imatrix: 양자화할 때 참고하는 데이터입니다. 실제 글을 모델에 넣어 보고 어떤 숫자가 중요한지 미리 잰 뒤, 중요한 숫자를 더 정확하게 남깁니다.
- MTP: 다음 토큰 여러 개를 미리 맞혀 두는 속도 기능입니다. 미리 맞힌 것이 맞으면 그만큼 빨리 넘어갑니다. Qwen3.8 27B에는 이 기능에 쓰는 작은 레이어가 따로 있습니다. LM Studio 설정 화면에서는 Speculative Decoding 항목에 나옵니다.
양자화가 무엇인지 더 알고 싶으면 GPU 가속과 양자화(GGUF) 이해하기를 참고하세요.
파일 안을 열어 보니
GGUF 파일의 앞부분에는 레이어마다 어떤 방식으로 줄였는지가 적혀 있습니다. 이 부분을 직접 읽어서 정리했습니다.

막대 길이는 파일 크기, 색은 줄인 방식입니다. 같은 Q4_K_M인데 구성이 모두 다릅니다.
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| 파일 크기 | 16.81GB | 16.46GB | 18.97GB |
| 가중치 하나당 평균 비트 | 4.92 | 4.82 | 5.64 |
| 쓴 방식 | Q4_K, Q6_K 두 가지 | Q3_K부터 Q8_0까지 8가지 | Q4_K, Q6_K, Q8_0 세 가지 |
| imatrix | 쓰지 않음 | 씀 (1,251묶음) | 쓰지 않음 |
| MTP 레이어 | 들어 있음 | 들어 있음 | 없음 (저장소에 별도 파일로 있음) |
| 대화 템플릿 길이 | 8,952자 | 9,993자 | 8,952자 |
이 표가 뜻하는 것은 세 가지입니다.
- ggml-org 파일이 큰 이유: 어텐션(글의 앞뒤 관계를 보는 부분) 레이어를 8비트로 남겼습니다. 파일의 7.2GB가 8비트입니다. 그래서 이름은 Q4_K_M이지만 평균은 5.64비트입니다.
- unsloth 파일이 가장 작은 이유: 레이어마다 중요도를 따져 3비트부터 8비트까지 다르게 줬습니다. 덜 중요한 곳은 더 줄이고 중요한 곳은 덜 줄이는 방식입니다. 대화 템플릿(질문과 답을 모델이 알아듣는 형식으로 바꾸는 틀)도 unsloth만 다르게 고쳐 넣었습니다.
- ggml-org 파일에는 MTP 레이어가 없습니다. 저장소에 mtp로 시작하는 파일이 따로 있습니다. 이번에는 본 파일만 비교했습니다.
LM Studio 기본 설정은 어떻게 달랐나
세 파일을 LM Studio에 그대로 올리면 설정이 한 군데 다릅니다. Speculative Decoding 항목입니다.

My Models의 로드 설정입니다. lmstudio-community와 unsloth는 Speculative Decoding이 MTP로 켜져 있고, ggml-org는 Off입니다. 나머지 값은 같습니다.
MTP 레이어가 들어 있는 두 파일은 LM Studio가 알아서 MTP를 켭니다. ggml-org 파일은 레이어가 없어서 꺼져 있고, 명령어로 억지로 켜서 로드하면 로드가 실패했습니다.

lmstudio-community 파일의 로드 창입니다. 예상 메모리 19.54GB, GPU 오프로드 65레이어입니다.

ggml-org 파일의 로드 창입니다. 예상 메모리 20.90GB, GPU 오프로드 64레이어입니다. MTP 레이어가 없어 한 레이어 적습니다.
이미지 기능과 생각 단계도 달랐다
세 파일을 로드하면 채팅 입력창 아래 버튼부터 다릅니다.

위에서부터 lmstudio-community, unsloth, ggml-org입니다. ggml-org는 본 파일만 받은 상태라 Vision 버튼이 없고, + 버튼을 눌러도 파일 첨부만 나옵니다.
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| 이미지 기능(Vision) | 있음 | 있음 | 이번 테스트에서는 없음 (본 파일만 받음) |
| 고를 수 있는 생각 단계 | off, low, medium, xhigh, on (기본 xhigh) | off, on (기본 on) | off, on (기본 on) |
이 표가 뜻하는 것은 두 가지입니다.
- 이미지 기능은 받는 방법에 따라 달라집니다. 사진을 보려면 모델 본 파일 말고 이미지 인식 부품(mmproj) 파일이 따로 있어야 합니다. lmstudio-community와 unsloth는 예전에 LM Studio 안에서 받아서 이 부품이 모델 폴더에 함께 들어 있었습니다. ggml-org는 이번에 Hugging Face에서 본 파일 하나만 직접 받았기 때문에 이 부품이 없고, 그래서 이미지 기능이 붙지 않았습니다. ggml-org 저장소에도 mmproj 파일이 올라와 있고, LM Studio 검색 화면에는 Vision 표시가 있습니다. LM Studio 안에서 받으면 함께 받아질 것으로 보이지만 직접 확인하지는 않았습니다. 그래서 아래 사진 설명 테스트에서는 ggml-org를 뺐습니다.
- 생각 단계를 5가지로 고를 수 있는 것은 lmstudio-community뿐입니다. 다른 두 파일은 켜기와 끄기만 됩니다. 생각을 조금만 하게 하고 싶을 때(low, medium)는 lmstudio-community 파일이 편합니다. Qwen3.8 27B는 생각 단계에 따라 답이 나오는 시간이 크게 달라집니다. 이 내용은 생각 단계 하나 낮추자 12초 만에 나왔다에 정리했습니다.

LM Studio 검색 화면의 ggml-org 저장소입니다. 기능(Capabilities)에 Vision이 표시됩니다.
VRAM
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| LM Studio 예상 메모리 | 19.54GB | 19.16GB | 20.90GB |
| 로드 뒤 늘어난 VRAM (컨텍스트 8,192) | 19.7GB | 19.4GB | 18.7GB |
| 로드 뒤 전체 VRAM (컨텍스트 32,768) | 22.8GB | 22.5GB | 21.7GB |
실제로 잰 VRAM은 파일이 가장 큰 ggml-org가 오히려 가장 적었습니다. 이유는 두 가지로 보입니다. 다른 두 파일은 이미지 인식 부품(약 0.9GB)이 같이 올라가고, MTP를 쓰는 만큼 메모리를 더 씁니다. ggml-org는 이미지 인식 부품을 받지 않았고 MTP도 없습니다. 그래서 VRAM은 세 파일을 같은 조건으로 비교한 값이 아닙니다. 세 파일 모두 32GB 카드에서는 원활하게 돌았습니다.
생성 속도
800자 글을 쓰게 하고 초당 토큰 수(t/s)를 쟀습니다. 파일마다 5번씩 재서 평균을 냈습니다.

위는 LM Studio 기본값 그대로, 아래는 MTP를 끄거나 켜서 맞춰 잰 값입니다.
| 조건 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| LM Studio 기본값 | 77.5 t/s (76.0~78.6) | 86.2 t/s (82.6~90.1) | 63.8 t/s (63.6~64.0) |
| MTP 끔 | 68.7 t/s | 71.2 t/s | 61.1 t/s |
| MTP 켬 | 76.9 t/s | 79.7 t/s | 켤 수 없음 |
| 첫 토큰까지 시간 | 0.09초 | 0.10초 | 0.08초 |
이 표가 뜻하는 것은 이렇습니다.
- 기본값에서는 unsloth가 가장 빠르고 ggml-org가 가장 느렸습니다. 가장 빠른 것과 느린 것이 약 35% 차이입니다.
- 차이의 대부분은 MTP입니다. 같은 파일에서 MTP를 켜면 약 12% 빨라졌습니다(68.7 → 76.9, 71.2 → 79.7).
- MTP를 모두 꺼도 ggml-org가 가장 느렸습니다. 8비트로 남긴 레이어가 많아 한 토큰마다 읽어야 할 양이 많기 때문으로 보입니다(추정).
- unsloth는 MTP를 켠 채로 두 번 쟀는데 86.2와 79.7로 값이 달랐습니다. MTP는 미리 맞힌 토큰이 얼마나 맞느냐에 따라 효과가 달라져서, 쓰는 글에 따라 속도가 흔들립니다.
채팅 화면에서도 같은 차이가 보였습니다. MTP가 켜진 파일은 통계 줄 끝에 미리 맞힌 토큰 중 몇 %가 맞았는지가 나옵니다.

lmstudio-community. 초당 77.77토큰, 미리 맞힌 토큰의 54.4%가 맞았습니다.

unsloth. 초당 81.72토큰, 미리 맞힌 토큰의 54.5%가 맞았습니다.

ggml-org. 초당 61.64토큰이고, MTP가 꺼져 있어 맞힌 비율 표시가 없습니다.
긴 글을 읽고 답하기
컨텍스트를 32,768로 다시 로드하고, 약 1만 5천 자(7,402토큰) 글을 주고 세 문장으로 요약하게 했습니다.
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| 첫 토큰까지 시간 | 2.73초 | 2.60초 | 2.14초 |
| 요약 생성 속도 | 92.4 t/s | 93.0 t/s | 61.4 t/s |
긴 글을 읽는 데 걸린 시간은 ggml-org가 가장 짧았습니다. 다만 한 번씩만 잰 값이라 차이가 확실하다고 말하기는 어렵습니다. 요약을 쓰는 속도는 MTP가 켜진 두 파일이 약 50% 빨랐습니다. 요약은 원문의 말을 다시 쓰는 일이 많아서 MTP가 미리 맞히기 쉬웠던 것으로 보입니다.
이어서 2만 자 글의 다섯 곳(10·30·50·70·90% 위치)에 사실 하나를 숨기고 찾게 했습니다. 세 파일 모두 다섯 곳을 다 찾았고, 숨기지 않은 글에는 세 파일 모두 "없음"이라고 바르게 답했습니다.
정답률
채점 질문 50개를 만들어 파일마다 5번씩, 모두 250번 풀게 했습니다. 산수 20개, 파이썬 코드 결과 맞히기 10개, 논리 8개, 지식 12개입니다. 정답은 미리 계산하거나 코드를 실제로 돌려서 정했고, "답만 쓰세요"라고 해서 기계로 채점했습니다.

250번 중 lmstudio-community 176번, unsloth 180번, ggml-org 171번을 맞혔습니다.
세 파일의 차이는 9번(3.6%포인트)입니다. 그런데 같은 파일도 회차마다 33개에서 37개 사이로 흔들렸습니다. 한 회차에서 3~4개가 오르내리는 시험에서 5회 합계가 9개 차이 나는 것은 우연으로도 나올 수 있는 크기입니다. 그래서 이 결과로 "unsloth가 더 똑똑하다"고 말할 수는 없습니다. 말할 수 있는 것은 세 파일의 실력이 눈에 띄게 다르지 않다는 것까지입니다.
생각을 끄고 답만 쓰게 했기 때문에 암산에서 많이 틀렸습니다. 아래는 그런 예입니다. 48,000원에서 25%를 빼면 36,000원, 다시 10%를 빼면 32,400원인데 31,200원이라고 답했습니다.

정답은 32400입니다. 생각을 끄면 이런 암산 실수가 세 파일 모두에서 나왔습니다.
한국어 글에 섞인 외국 문자
800자 글 5개에 한국어가 아닌 문자가 섞였는지도 봤습니다. lmstudio-community는 태국 문자가 한 번("มหา"), ggml-org는 한자가 한 번("借用") 나왔고, unsloth는 없었습니다. 5번 중 한 번씩이라 파일의 차이라고 하기에는 표본이 적습니다. Qwen3.8 27B가 가끔 외국 문자를 섞는다는 점은 Qwen3.8 27B 생각 단계 글에서도 다뤘습니다.
사진 설명
모래시계 두 개가 나무 책상 위에 놓인 사진을 주고 "이 사진에 무엇이 보이는지 한국어로 3문장으로 설명해 주세요"라고 물었습니다. 이미지 인식 부품이 있는 두 파일에 3번씩 물었습니다.
ggml-org 파일은 비전(Vision) 기능이 없어서 이 테스트를 할 수 없었습니다. 비전은 모델이 사진을 보는 기능입니다. 이번에 받은 ggml-org 파일은 LM Studio 입력창에 Vision 버튼이 없고, 사진을 첨부하는 메뉴도 나오지 않았습니다. 그래서 사진을 넣을 수 없었습니다. 모델의 성능이 모자라서 뺀 것이 아닙니다. 본 파일만 받아 이미지 인식 부품이 빠져 있기 때문이고, 자세한 이유는 위의 '이미지 기능과 생각 단계도 달랐다'에 적었습니다.
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| 모래시계가 두 개라고 설명 | 3번 중 3번 | 3번 중 3번 | 비전 기능이 없어 하지 못함 |
| 오른쪽 모래시계 뒤의 전자 부품을 설명 | 3번 중 3번 | 3번 중 3번 | 비전 기능이 없어 하지 못함 |
| 답 하나에 걸린 시간 | 1.3~2.8초 | 1.2~1.8초 | 비전 기능이 없어 하지 못함 |
두 파일 모두 모래시계 두 개, 어두운 나무 책상, 오른쪽 모래시계 뒤의 컴퓨터 부품, 흐릿한 배경의 오디오 장비까지 맞게 설명했습니다. 사진 설명에서는 두 파일의 차이가 보이지 않았습니다.

lmstudio-community. 모래시계 두 개와 오른쪽의 전자 부품, 배경의 오디오 장비를 설명했습니다.

unsloth. 같은 사진에 거의 같은 내용으로 답했습니다.
없는 소설을 물었을 때
실제로는 없는 소설의 줄거리를 물어서, 모른다고 하는지 지어내는지 봤습니다. 질문은 "한국 소설가 윤서하가 2018년에 발표한 장편소설 『푸른 등대의 겨울』의 줄거리를 알려 주세요"입니다. 세 파일에 3번씩 물었습니다.
세 파일 모두 3번 다 줄거리를 지어내지 않았습니다. 그런 작가와 작품은 확인되지 않는다고 답했습니다. 다만 아래 화면처럼 답 중간에 한자가 섞이거나("작家的", "실제存在的"), 비슷한 분위기의 책을 추천하면서 확인되지 않은 제목을 말하는 경우가 있었습니다. 없는 작품을 없다고 하는 것까지는 믿을 만하지만, 덧붙이는 추천은 따로 확인해야 합니다.

lmstudio-community. 존재하지 않는 작품이라고 답했습니다. 둘째 문단에 한자가 섞여 있습니다.
MCP 도구를 붙였을 때
대화 템플릿이 다르면 도구 호출에서 차이가 날 수 있습니다. 그래서 로컬 AI에 MCP 도구를 붙인 테스트와 같은 질문 30개를 세 파일에 3번씩 물었습니다. 도구는 웹 페이지 읽기, 현재 시간, 파일 읽기 세 가지입니다.

도구가 필요한 질문은 도구 없이 0번, 도구를 주면 57~58번 맞혔습니다. 잘못된 도구 호출은 세 파일 모두 0번입니다.
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| 도구가 필요한 질문, 도구 없이 | 60번 중 0번 | 60번 중 0번 | 60번 중 0번 |
| 도구가 필요한 질문, 도구 있을 때 | 59번 중 58번 | 60번 중 57번 | 60번 중 58번 |
| 잘못된 도구 호출 | 0번 | 0번 | 0번 |
| 도구가 필요 없는 질문 | 30번 중 30번 | 30번 중 30번 | 30번 중 30번 |
| 답 하나에 걸린 시간(가운데 값) | 1.9초 | 1.9초 | 3.1초 |
도구 호출은 세 파일 모두 똑같이 잘 됐습니다. 도구를 잘못 부른 경우가 한 번도 없었습니다. 틀린 답 6개 중 5개는 같은 문제였습니다. 파일을 읽고 3월 매출을 더하는 계산인데, 파일은 제대로 읽고 덧셈에서 틀렸습니다. lmstudio-community가 59번인 것은, 테스트 초반에 테스트용 웹 서버가 꺼져 있던 한 문항을 뺐기 때문입니다.
정리: 어떤 파일을 받을까
| 항목 | lmstudio-community | unsloth | ggml-org |
|---|---|---|---|
| 파일 크기 | 16.81GB | 16.46GB | 18.97GB |
| 기본값 생성 속도 | 77.5 t/s | 86.2 t/s | 63.8 t/s |
| 채점 질문 (250번) | 176번 | 180번 | 171번 |
| MCP 도구 질문 | 59번 중 58번 | 60번 중 57번 | 60번 중 58번 |
| LM Studio에서 MTP | 자동으로 켜짐 | 자동으로 켜짐 | 켤 수 없음 |
| 이미지 기능 | 있음 | 있음 | 본 파일만 받으면 없음 |
| 생각 단계 | 5가지 | 켜기·끄기 | 켜기·끄기 |
- LM Studio에서 쓴다면 lmstudio-community나 unsloth가 낫습니다. 정답률은 세 파일이 비슷한데, 이 둘은 MTP가 자동으로 켜져서 더 빠르고, 받아 둔 상태 그대로 사진도 볼 수 있었습니다. 파일도 2GB 이상 작습니다.
- 둘 중에서는 쓰임에 따라 고르면 됩니다. 생각 단계를 세밀하게 조절하고 싶으면 lmstudio-community, 조금이라도 작고 빠른 쪽을 원하면 unsloth입니다.
- 이름이 같다고 같은 파일은 아닙니다. 같은 Q4_K_M이라도 올린 곳에 따라 크기가 2.5GB 다르고, 속도 기능이 들어 있는지도 달랐습니다. 받기 전에 파일 크기와 MTP 표시를 확인해 볼 만합니다.
- ggml-org 파일은 품질이 더 좋을 것으로 기대했지만, 평균 5.64비트로 덜 줄였는데도 이번 질문들에서는 차이가 보이지 않았습니다.
이 테스트의 한계
- 모델 하나(Qwen3.8 27B), 양자화 한 단계(Q4_K_M), 그래픽카드 한 대(RTX 5090)에서 잰 결과입니다. 다른 모델이나 더 낮은 비트에서는 결과가 다를 수 있습니다.
- 채점 질문 50개로는 작은 품질 차이를 가려내기 어렵습니다. 원본 모델과 답이 얼마나 다른지를 숫자로 재는 방법(KLD)은 이번에 쓰지 않았습니다.
- 16GB 그래픽카드에서는 파일 크기 2.5GB 차이가 VRAM에 들어가느냐를 가를 수 있습니다. 16GB 카드에서 Qwen3.8 27B를 돌린 결과는 RTX 5060 Ti 16GB 테스트에 있고, 내 카드로 어떤 모델이 돌아가는지는 GPU 체험에서 볼 수 있습니다.
자주 묻는 질문
lmstudio-community와 unsloth 중 무엇을 받아야 하나요?
Qwen3.8 27B Q4_K_M으로 재 본 결과로는 둘 다 괜찮습니다. 정답률은 비슷했고, 두 파일 모두 LM Studio에서 MTP가 자동으로 켜졌습니다. unsloth 파일이 0.35GB 작고 기본값 속도가 조금 더 빨랐습니다.
같은 Q4_K_M인데 왜 파일 크기가 다른가요?
Q4_K_M은 모든 부분을 4비트로 줄이는 방식이 아니라, 일부를 덜 줄이는 방식이기 때문입니다. 어느 레이어를 몇 비트로 둘지는 만드는 곳이 정합니다. ggml-org 파일은 어텐션 레이어를 8비트로 남겨서 18.97GB였고, unsloth 파일은 레이어마다 3~8비트를 섞어 16.46GB였습니다.
MTP가 무엇이고, 꼭 켜야 하나요?
MTP는 다음 토큰 여러 개를 미리 맞혀 두어 생성 속도를 높이는 기능입니다. 이번 테스트에서는 켜면 약 12% 빨라졌습니다. 파일 안에 MTP 레이어가 있으면 LM Studio가 자동으로 켭니다. 로드 설정의 Speculative Decoding 항목에서 확인할 수 있습니다.
ggml-org 파일로도 MTP를 쓸 수 있나요?
이번에 받은 본 파일만으로는 쓸 수 없었습니다. MTP를 켜서 로드하면 로드가 실패했습니다. ggml-org 저장소에는 MTP용 파일이 따로 올라와 있는데, 이 글에서는 본 파일만 비교해서 그 파일은 테스트하지 않았습니다.
ggml-org 파일로는 사진을 볼 수 없나요?
본 파일 하나만 받으면 볼 수 없었습니다. LM Studio에 Vision 버튼이 나오지 않고 이미지 첨부 메뉴도 없었습니다. 사진을 보려면 이미지 인식 부품(mmproj) 파일이 함께 있어야 합니다. ggml-org 저장소에도 이 파일이 있고 LM Studio 검색 화면에는 Vision으로 표시되므로, 부품까지 받으면 될 것으로 보입니다. 다만 이 글에서는 직접 확인하지 않았습니다.
양자화한 곳에 따라 답의 품질이 달라지나요?
이번 테스트에서는 뚜렷한 차이를 찾지 못했습니다. 채점 질문 250번 중 171~180번을 맞혔고, 2만 자 글 속 정보 찾기, 없는 소설 질문, MCP 도구 호출은 세 파일이 같았습니다. 다만 질문 수가 많지 않아서 작은 차이는 있을 수 있습니다.
댓글 0개