PrismML의 Bonsai 27B는 270억 파라미터 모델 Qwen3.6-27B를 1비트로 줄여, 파일 크기를 3.8GB까지 낮춘 모델입니다. 보통 27B 모델을 4비트로 줄여도 17GB 안팎이라, 숫자만 보면 놀라운 크기입니다. RTX 5090 PC의 LM Studio에서 기본 설정 그대로 돌려 봤습니다. 결과부터 말하면 속도는 초당 약 140토큰으로 빨랐지만, 한국어로 물은 질문에 중국어·일본어·아랍어·러시아어·힌디어가 섞인 답이 돌아왔습니다.
테스트 PC 사양
| 부품 | 사양 |
|---|---|
| GPU | NVIDIA GeForce RTX 5090 (VRAM 32GB) |
| GPU 드라이버 | 616.92 (CUDA 13.4) |
| CPU | Intel Core Ultra 9 285K (24코어 24스레드) |
| 메모리 | DDR5 64GB (6000MT/s) |
| 운영체제 | Windows 11 Pro (빌드 26200) |
| LM Studio | 0.4.25, llama.cpp CUDA 12 런타임 2.45.0 |
같은 PC에서 앞서 Gemma 4 12B QAT를 같은 질문으로 테스트했습니다. 비교가 필요한 부분은 그 결과를 함께 적었습니다.
테스트한 모델: Bonsai 27B (1비트)
PrismML은 기존 모델을 아주 적은 비트로 줄이는 작업을 하는 회사입니다. Bonsai 27B는 Qwen3.6-27B의 구조를 그대로 두고 가중치를 1비트로 바꿨습니다. 가중치 하나에 평균 1.125비트를 쓰는데, 흔히 쓰는 4비트 양자화의 4분의 1 수준입니다. 제작사는 이 모델이 원본(FP16) 점수의 약 90%를 유지한다고 밝혔습니다. 다만 이 수치는 제작사가 직접 잰 영어 중심 벤치마크 결과입니다 (Bonsai 27B 모델 카드).
| 항목 | 내용 |
|---|---|
| 원본 모델 | Qwen3.6-27B |
| 파일 | Bonsai-27B-Q1_0.gguf 3.80GB + 이미지 입력용 파일 0.93GB |
| 양자화 | Q1_0 (가중치당 1.125비트) |
| 최대 컨텍스트 | 262,144토큰 |
| 기능 | 이미지 입력, 도구 호출, 생각(thinking) |
| 라이선스 | Apache 2.0 |

LM Studio의 My Models 화면. Q1_0 형식, 디스크 크기 4.73GB(이미지 입력용 파일 포함)로 표시됩니다.
허깅페이스 모델 카드에는 "일반 llama.cpp로는 불러올 수 없고 PrismML이 고친 llama.cpp가 필요하다"고 적혀 있습니다. 하지만 이번 테스트에서는 LM Studio 0.4.25의 기본 엔진(CUDA 12 런타임 2.45.0)으로 별도 설치 없이 바로 불러와졌습니다.
LM Studio 기본 설정값
설정은 바꾸지 않고 LM Studio가 이 모델에 잡아 주는 기본값을 그대로 썼습니다. 이 모델은 제작사 권장값(온도 0.7, Top K 20, Top P 0.95)이 기본으로 들어가 있었습니다.

Load 탭. 컨텍스트 8,192, GPU 오프로드 64(전체 층)가 기본값입니다.

Flash Attention은 기본으로 켜져 있고, KV 캐시 양자화는 꺼져 있습니다.

Inference 탭. 생각(Enable Thinking)이 켜져 있고 온도는 0.7입니다.

샘플링 기본값. Top K 20, 반복 패널티 1.1, Top P 0.95, Min P 0.05입니다.
| 설정 | 기본값 | 뜻 |
|---|---|---|
| 컨텍스트 길이 | 8,192 | 한 번에 기억하는 토큰 수. 최대 262,144까지 지원 |
| GPU 오프로드 | 64 (전체) | 모델의 64개 층을 모두 GPU에 올립니다 |
| Flash Attention | 켬 | 긴 입력에서 메모리와 시간을 아끼는 계산 방식 |
| 생각(thinking) | 켬 | 답하기 전에 풀이 과정을 먼저 만듭니다 |
| 온도 / Top K / Top P | 0.7 / 20 / 0.95 | 제작사 권장값과 같습니다 |
| 반복 패널티 | 1.1 | 같은 말을 되풀이하지 않게 하는 값 |

불러오기 창에서 LM Studio가 계산한 예상 메모리는 5.22GB였습니다.
테스트 1. 불러오는 시간과 VRAM
불러오는 데 3.4초가 걸렸습니다. 컨텍스트 길이만 바꿔 다시 불러오며, 불러오기 직전과 직후의 GPU 메모리 차이를 쟀습니다.
| 컨텍스트 길이 | 모델이 쓴 VRAM | 불러오는 시간 | 참고: Gemma 4 12B |
|---|---|---|---|
| 8,192 (기본값) | 약 6.0GB | 3.4초 | 약 9.0GB |
| 32,768 | 약 7.7GB | 3.4초 | 약 9.3GB |
| 131,072 | 약 13.8GB | 3.4초 | 약 11.0GB |
| 262,144 (최대) | 약 21.9GB | 3.6초 | 약 13.1GB |
기본 설정에서는 약 6GB로, 27B 모델이라고 믿기 어려울 만큼 적게 씁니다. 그런데 컨텍스트를 늘리면 빠르게 불어나서, 최대 컨텍스트에서는 약 21.9GB를 썼습니다. 파일 크기가 두 배 가까운 Gemma 4 12B(7.15GB)보다 오히려 8.8GB 더 많습니다. 모델 파일은 작아졌지만, 긴 대화를 기억하는 데 쓰는 메모리(KV 캐시)는 원래 27B 모델만큼 필요하기 때문으로 보입니다. "4GB짜리 27B"는 짧은 대화에서만 맞는 말이고, 긴 문서를 다루려면 VRAM이 넉넉해야 합니다.
테스트 2. 생성 속도와 외국어 섞임
"집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점을 800자 정도로 써 주세요"를 물었습니다. 채팅 화면에서 한 번, API로 생각 켬·끔 각각 3번씩 잰 기록입니다.

답변 중간에 힌디어(पहले), 일본어, 중국어가 섞이다가, 영어로 "반복에 빠졌으니 깨끗한 버전을 다시 쓰겠다"고 말합니다.

"정확한 한국어 답변"이라며 다시 썼지만, 같은 오류가 그대로 반복됐습니다.

결국 초당 139.15토큰으로 8,152토큰을 만든 뒤 "컨텍스트 길이 제한 도달"로 멈췄습니다.
| 회차 | 생각 | 초당 토큰 | 생성 토큰 (그중 생각) | 답이 끝날 때까지 | 외국어 섞임 |
|---|---|---|---|---|---|
| 채팅 화면 | 켬 | 139.15 | 8,152 (컨텍스트 가득 참) | - | 있음 |
| API 1 | 켬 | 140.3 | 2,705 (2,329) | 19.4초 | 있음 |
| API 2 | 켬 | 139.9 | 2,411 (1,921) | 17.5초 | 있음 |
| API 3 | 켬 | 140.5 | 4,995 (4,562) | 35.7초 | 있음 |
| API 1 | 끔 | 144.9 | 804 (0) | 5.9초 | 있음 |
| API 2 | 끔 | 146.0 | 845 (0) | 6.0초 | 있음 |
| API 3 | 끔 | 145.3 | 813 (0) | 5.8초 | 있음 |
속도만 보면 훌륭합니다. 27B 모델인데 초당 140~146토큰으로, 같은 PC에서 잰 12B 모델(초당 143~148토큰)과 거의 같습니다. 문제는 내용입니다. API로 받은 답 6개가 모두 외국어가 섞여 있었습니다. 실제로 섞인 말은 "量化", "重要です", "الخصوصية", "версии", "पहले" 같은 중국어·일본어·아랍어·러시아어·힌디어였습니다. 생각을 켜면 풀이에만 1,900~4,600토큰을 써서 답을 받기까지 17~36초가 걸렸습니다.
테스트 3. 산수 문제
"사과 한 상자에 24개, 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면?"을 물었습니다. 정답은 한 사람당 10개, 3개 남음입니다.

생각은 영어로 진행됐습니다. 도중에 정답(10개, 3개)을 찾았지만, 문제 해석을 계속 바꾸다가 다른 답으로 끝났습니다.

21.79초를 생각한 뒤 "한사람당 1개, nam는 thing 0re"라는 틀리고 깨진 답을 냈습니다.

생각을 끄면 0.28초 만에 "한 사람당 4개, namning yge 1"이라고 답했습니다.
API로 5번씩 반복한 결과입니다.
| 설정 | 깨끗한 정답 | 나머지 결과 | 참고: Gemma 4 12B |
|---|---|---|---|
| 생각 켬 (기본값) | 5번 중 2번 | 숫자는 맞지만 글자가 깨짐 1번("nam neng 3 gai"), 답 없음 2번 | 5번 중 5번 |
| 생각 끔 | 5번 중 1번 | "1개·0개" 3번(그중 1번은 중국어 풀이), "4개·1개" 1번 | 5번 중 0번 |
눈여겨볼 것은 "답 없음" 2번입니다. 생각을 8,117토큰이나 이어 가다가 기본 컨텍스트(8,192)를 다 채워서, 57초 동안 답을 한 글자도 내지 못하고 끝났습니다. 이 모델을 기본 설정으로 쓰면 간단한 질문에도 이런 일이 생길 수 있습니다. 생각을 켜 둘 거라면 컨텍스트를 기본값보다 넉넉하게 잡는 편이 안전합니다.
테스트 4. 긴 글 요약
이 블로그의 업데이트 기록을 3,000자, 15,000자, 100,000자로 잘라 넣고 세 문장으로 요약하게 했습니다. 생각은 끄고, 답은 300토큰까지만 받았습니다.
| 입력 | 입력 토큰 | 첫 글자까지 | 생성 속도 | 참고: Gemma 4 12B 첫 글자까지 |
|---|---|---|---|---|
| 3,000자 | 1,486 | 0.44초 | 초당 136.6토큰 | 0.49초 |
| 15,000자 | 7,402 | 1.69초 | 초당 133.7토큰 | 0.93초 |
| 100,000자 | 44,315 | 13.36초 | 초당 110.7토큰 | 7.53초 |
짧은 글은 빨랐지만, 약 4만 4천 토큰을 넣었을 때는 첫 글자까지 13.4초가 걸려 12B 모델보다 두 배 가까이 느렸습니다. 입력을 읽는 속도로 따지면 초당 약 3,300토큰입니다. 요약 내용도 세 개 모두 아랍어("الصفحة"), 일본어, 러시아어 단어가 섞였고, 15,000자 요약은 "세 문장" 지시를 넘겨 쓰다가 300토큰에서 잘렸습니다.
테스트 5. 없는 소설을 물어보면
실제로는 없는 작품인 "한국 소설가 윤서하가 2018년에 발표한 『푸른 등대의 겨울』의 줄거리"를 물었습니다.

있는 작품처럼 출판사("퍼선출판, Penguin Korea")와 주제를 지어냈고, 답의 절반이 중국어입니다.

답변 끝부분은 전부 중국어였고, 같은 작가의 다른 작품까지 지어냈습니다.
Bonsai 27B는 없는 작품의 출판사, 주제, 같은 작가의 다른 작품 이름까지 지어냈습니다. 같은 질문에 Gemma 4 12B는 "확인할 수 없다"고 답했습니다. 사실 확인이 필요한 용도라면 이 모델의 답을 그대로 믿기 어렵습니다.
테스트 6. 이미지 넣기
모래시계 두 개가 있는 사진을 넣고 무엇이 보이는지 설명하게 했습니다.

내용은 맞았지만 sandglass, design, traditionnel(프랑스어) 같은 외국어가 섞였습니다.

19.88초 동안 생각한 뒤 답했고, 초당 140.57토큰, 첫 토큰까지 0.90초였습니다.
나무 테이블 위의 모래시계 두 개, 오른쪽 모래시계 안의 전자 회로와 케이블까지 내용은 정확히 알아봤습니다. 다만 한 문단 안에 "sandglass", "Contrast" 같은 영어와 "traditionnel"이라는 프랑스어가 섞였고, 세 문장짜리 설명을 위해 약 20초를 생각했습니다.
정리
- 크기와 속도는 기대 이상입니다. 파일 3.8GB, 기본 설정 VRAM 약 6GB, 초당 약 140토큰. 27B 모델을 이 정도로 가볍게 돌릴 수 있다는 것 자체는 인상적입니다.
- 한국어로 쓰기에는 아직 어렵습니다. 이번에 받은 한국어 답변 대부분에 외국어가 섞였고, 산수는 깨끗한 정답이 5번 중 2번이었습니다.
- 생각이 끝나지 않는 경우가 있습니다. 기본 컨텍스트 8,192에서는 생각만 하다가 답 없이 끝나는 일이 5번 중 2번 있었습니다.
- 긴 컨텍스트는 메모리를 많이 씁니다. 최대 컨텍스트에서는 약 21.9GB로, 작은 파일 크기와는 다른 이야기가 됩니다.
제작사가 밝힌 "원본의 90%"는 영어 중심 벤치마크 기준입니다. 한국어로 쓸 모델을 찾는다면, 같은 PC에서 한국어 답변이 안정적이었던 Gemma 4 12B QAT가 현재로서는 더 나은 선택이었습니다. 원본인 Qwen 계열 모델에 대해서는 Qwen3.8-27B 소개 글과 Qwen3.6-35B-A3B 글을 참고하세요.
자주 묻는 질문
Bonsai 27B는 LM Studio에서 바로 돌아가나요?
LM Studio 0.4.25의 기본 엔진(llama.cpp CUDA 12 런타임 2.45.0)으로 별도 설치 없이 불러와졌습니다. 허깅페이스 모델 카드에는 PrismML이 고친 llama.cpp가 필요하다고 적혀 있지만, 이 버전의 LM Studio에서는 필요하지 않았습니다.
Bonsai 27B는 VRAM을 얼마나 쓰나요?
기본 컨텍스트 8,192에서 약 6.0GB였습니다. 컨텍스트를 늘리면 32,768에서 약 7.7GB, 131,072에서 약 13.8GB, 최대인 262,144에서는 약 21.9GB까지 늘었습니다. RTX 5090에서 잰 값입니다.
Bonsai 27B의 한국어 실력은 어떤가요?
이번 테스트에서는 한국어 답변 대부분에 중국어, 일본어, 아랍어, 러시아어, 힌디어 같은 외국어가 섞였습니다. 없는 소설을 물었을 때는 출판사와 줄거리를 지어냈습니다. 한국어로 믿고 쓰기에는 어려웠습니다.
RTX 5090에서 속도는 얼마나 나오나요?
기본 설정(생각 켬)에서 초당 약 140토큰, 생각을 끄면 초당 145~146토큰이었습니다. 다만 생각을 켜면 풀이에 수천 토큰을 써서, 답을 받기까지 17~36초가 걸리기도 했습니다.
댓글 0개