PrismML의 Ternary Bonsai 2 27B(PQ2_0, 파일 7.21GB)를 RTX 5060 Ti 16GB PC에서 제작사 기본 설정으로 돌려 봤습니다. 결론부터 말하면 27B(270억 파라미터) 모델인데 16GB 그래픽카드에서 초당 약 48토큰(t/s)이 나왔습니다. 같은 PC에서 잰 9B 모델들(약 46~50t/s)과 비슷한 속도입니다. VRAM은 제작사 기본 컨텍스트 32,768에서 9.3GB, 이미지 입력용 파일까지 붙여도 10.1GB였습니다.
다만 기본 생각 단계(xhigh)는 매우 깁니다. 800자 글 하나에 생각만 11,684~18,611토큰을 써서 답을 받기까지 4분 22초~7분이 걸렸습니다. 생각 단계를 medium으로 낮추면 같은 글이 14~21초에 끝났고, 산수 문제도 5번 모두 맞혔습니다.
이 글의 숫자는 모두 이 PC에서 직접 잰 값입니다. 측정은 API로 33개 답을 받아 확인했고, 화면 캡처는 llama-server에 들어 있는 채팅 화면에서 따로 찍었습니다. 같은 모델을 RTX 5090에서 잰 85번 글과 같은 질문을 썼습니다.
테스트 PC와 실행 프로그램
| 부품 | 사양 |
|---|---|
| GPU | NVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W) |
| GPU 연결 | PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원) |
| GPU 드라이버 | 616.92 |
| CPU | Intel Core i5-9400F (6코어 6스레드) |
| 시스템 램 | DDR4 32GB (16GB × 2, 2666MT/s) |
| 저장장치 | Crucial MX500 1TB SATA SSD |
| 운영체제 | Windows 11 Pro 25H2 |
| 실행 프로그램 | PrismML llama.cpp 포크의 llama-server (prism-b10754, CUDA 13.3) |
이 모델은 LM Studio로 열리지 않습니다. 새 압축 형식(PTQ1_0, PQ2_0)을 써서 PrismML이 고친 llama.cpp에서만 읽힙니다. 그래서 PrismML이 GitHub에 올린 윈도우용 실행 파일(CUDA 13.3)을 받아 llama-server로 돌렸습니다. 같은 PC의 다른 모델은 LM Studio로 쟀기 때문에, 이 글의 속도 비교는 실행 프로그램이 다르다는 점을 감안해서 봐 주세요.

llama-server를 켜고 브라우저로 연 채팅 화면. 입력창 오른쪽에 Ternary-Bonsai-2, 27B, PQ2_0이 표시됩니다.
테스트한 모델: Ternary Bonsai 2 27B
Qwen3.8-27B의 구조를 그대로 두고, 가중치를 -1, 0, +1 세 값 중 하나로 바꾼 모델입니다(터너리). PrismML이 2026년 9월 18일에 공개했습니다. 파일은 두 가지가 있는데, 제작사는 블랙웰 그래픽카드(RTX 50 시리즈)에서는 PQ2_0이 글을 더 빨리 쓴다고 적었습니다. RTX 5060 Ti도 블랙웰이라 이 글은 PQ2_0으로 쟀습니다. 85번 글(RTX 5090)은 더 작은 PTQ1_0으로 쟀습니다.
| 항목 | 내용 |
|---|---|
| 파라미터 | 27.36B (글 처리 24.35B + 단어 표 2.54B + 이미지 처리 0.46B) |
| 파일 | PQ2_0 7.21GB (가중치 하나에 2.13비트) / PTQ1_0 5.95GB (1.75비트) |
| 이미지 입력용 파일(mmproj) | Q8_0 0.63GB |
| 최대 컨텍스트 | 262,144토큰 |
| 생각 단계 | xhigh(기본)·medium·none. 제작사는 low를 지원하지 않는다고 밝힘 |
| 라이선스 | Apache 2.0 |
제작사는 14개 벤치마크 평균이 84.78점으로, 원본(FP16) 86.32점의 98.2%라고 밝혔습니다. 영어 중심 벤치마크를 제작사가 직접 잰 값입니다. 제작사의 속도 표에는 RTX 5060 Ti가 없고, RTX 4090에서 PQ2_0이 81.2t/s, RTX 5090에서 129.9t/s로 적혀 있습니다.
제작사 기본 설정값
제작사 공식 실행 스크립트(Bonsai-demo의 start_llama_server.ps1)가 이 PC에서 고르는 값을 그대로 썼습니다. 스크립트는 PC 메모리 크기를 보고 컨텍스트를 정합니다. 램 32GB인 이 PC에서는 32,768이었습니다(램 64GB인 5090 PC는 65,536).
| 설정 | 값 | 뜻 |
|---|---|---|
| -ngl 99 | 모든 레이어 GPU | 모델 전체를 그래픽카드에 올림 |
| -fa on | Flash Attention 켬 | 메모리를 덜 쓰고 빠르게 계산하는 방식 |
| -c | 32,768 | 한 번에 기억하는 토큰 수(컨텍스트) |
| 온도 / Top P / Top K / Min P | 1.0 / 0.95 / 20 / 0.05 | 제작사가 생각 켬에 권하는 값 |
| --mmproj | Q8_0 | 이미지 입력용 파일을 함께 올림 |
| 생각 단계 | xhigh | 요청에 reasoning_effort를 넣어 medium·none으로 바꿀 수 있음 |
VRAM: 기본 설정에서 9.3GB
컨텍스트만 바꿔 서버를 다시 켜며, 켜기 직전과 직후의 GPU 메모리 차이를 쟀습니다. 이미지 입력용 파일을 뺀 값입니다.
| 컨텍스트 | VRAM 사용 | 로드 시간 | 16GB에서 | 참고: RTX 5090 (PTQ1_0) |
|---|---|---|---|---|
| 8,192 | 7.8GB | 5.6~6.0초 | 원활 | 7.1GB |
| 32,768 (제작사 기본) | 9.3GB | 5.6초 | 원활 | 8.6GB |
| 32,768 + 이미지 입력용 파일 | 10.1GB | 12.7초 | 원활 | - |
| 65,536 | 11.3GB | 5.8초 | 원활 | 10.6GB |
| 131,072 | 15.2GB | 6.0초 | 빠듯 (PC 전체 VRAM 사용량 15.6GB) | 14.7GB |
65,536까지는 여유 있게 들어갑니다. 131,072는 들어가긴 하지만 윈도우와 브라우저가 쓰는 몫까지 합치면 16GB가 거의 찹니다. 262,144는 5090에서 22.8GB였기 때문에 이 PC에서는 시도하지 않았습니다. 모델을 처음 로드할 때는 디스크에서 읽느라 18.3초가 걸렸고, 두 번째부터는 6초 안팎이었습니다.
원본 Qwen3.8 27B를 3비트로 줄인 파일(12.12GB)은 같은 PC에서 13.1GB를 썼습니다(99번 글). 같은 27B 모델인데 VRAM을 약 4GB 덜 씁니다.
생성 속도: 약 48t/s, 기본 생각 단계는 4~7분
"다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"을 생각 단계별로 3번씩 시켰습니다.
| 생각 단계 | 생성 속도 | 생각에 쓴 토큰 | 답 글자 수 | 끝날 때까지 |
|---|---|---|---|---|
| xhigh (기본) | 45.2 / 46.3 / 45.7t/s | 18,611 / 11,684 / 16,007 | 827 / 927 / 864자 | 7분 0초 / 4분 22초 / 6분 1초 |
| medium | 48.4 / 48.4 / 48.3t/s | 575 / 132 / 592 | 739 / 1,152 / 861자 | 19.8초 / 14.3초 / 21.5초 |
| none (생각 끔) | 48.1 / 48.4 / 48.3t/s | 0 | 2,334 / 2,328 / 2,546자 | 22.0초 / 21.7초 / 25.3초 |
토큰을 만드는 속도는 생각 단계와 상관없이 45~48t/s로 거의 같습니다. 달라지는 것은 기다리는 시간입니다. xhigh는 800자 글에 생각을 최대 18,611토큰 써서 7분이 걸렸습니다. 5090에서는 최대 15,845토큰, 2분 23초였습니다. 생각 길이는 비슷한데 이 PC는 쓰는 속도가 약 40%라 기다리는 시간이 그만큼 길어졌습니다.
생각을 끄면 800자 요청에 2,300~2,500자를 써서 세 배 가까이 길었습니다. 글자 수를 가장 잘 맞춘 것은 medium(739~1,152자)이었습니다.

xhigh로 보낸 직후의 생각 과정. 질문을 영어로 옮기고, 영어로 초안을 쓰기 시작합니다. 39초 동안 1,823토큰을 썼습니다.

같은 채팅이 끝난 화면. 13,743토큰을 5분 9초 동안 44.42t/s로 만들었습니다. 가운데 줄이 그어진 부분은 물결표(~) 두 개를 화면이 취소선으로 표시한 것입니다.

medium. 생각을 펼치면 영어로 할 일을 정리하고 한국어 초안을 한 번 쓴 뒤 다시 씁니다. 답은 981토큰, 22초, 44.36t/s였습니다.

생각 끔(none). 780토큰, 16초, 46.82t/s입니다. 첫 문단에 "CPU로溢하(오버플로)"처럼 한자가 섞인 곳이 있습니다.
캡처 속 속도(44~47t/s)는 표보다 조금 낮습니다. 캡처는 브라우저 채팅 화면을 띄운 채 찍었고, 표의 값은 GPU가 쉬는 상태에서 API로 잰 값입니다.
컨텍스트 8,192에서도 답이 나왔지만 아슬아슬했다
LM Studio가 대부분의 모델에 잡는 8,192로 컨텍스트를 줄이면 어떻게 되는지도 봤습니다. 5090에서는 xhigh가 생각만 하다 컨텍스트를 다 채워 답이 비었습니다.
| 생각 단계 | 생각에 쓴 토큰 | 답 글자 수 | 걸린 시간 |
|---|---|---|---|
| xhigh (기본) | 5,826 | 894자 | 2분 13초 |
| medium | 226 | 1,301자 | 19.2초 |
이번에는 xhigh도 답을 냈습니다. 하지만 위 표에서 보듯 xhigh의 생각은 11,684~18,611토큰까지 늘어나기 때문에, 8,192에서 답이 나온 것은 운이 좋았던 경우입니다. 컨텍스트를 짧게 잡는다면 생각 단계를 medium으로 두는 편이 안전합니다.
산수 문제: 생각을 켜면 5번 모두 정답, 끄면 0번
"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 5번씩 물었습니다. 정답은 10개, 3개입니다.
| 생각 단계 | 정답 | 한 번에 걸린 시간 | 생각에 쓴 토큰 |
|---|---|---|---|
| xhigh (기본) | 5번 중 5번 | 3.1~4.2초 | 115~165 |
| medium | 5번 중 5번 | 2.8~3.4초 | 98~132 |
| none (생각 끔) | 5번 중 0번 | 0.4~0.7초 | 0 |
생각을 켜면 xhigh, medium 모두 3~4초 안에 맞혔습니다. 800자 글과 달리 산수에서는 생각이 짧았습니다. 생각을 끄면 "9개·4개", "2개·1개", "8개·3개", "10개·0개", "11개·0개"처럼 매번 다른 오답이 나왔습니다. 5090에서도 5번 중 0번이었습니다.

xhigh. 생각을 펼치면 24×3=72, 72−19=53, 53÷5=10 나머지 3을 영어로 차례로 계산합니다. 120토큰, 2.6초였습니다.

생각 끔으로 채팅 화면에서 물었을 때는 풀이를 적고 맞혔습니다. 다만 "형식으로만 답하라"는 지시를 어겼습니다. API로 5번 물었을 때는 모두 틀렸습니다.
긴 글 요약과 긴 대화
이 블로그의 업데이트 기록을 앞에서부터 잘라 넣고 세 문장으로 요약하게 했습니다(생각 끔). TTFT는 질문을 보낸 뒤 첫 토큰이 나올 때까지의 시간입니다.
| 넣은 글 | 입력 토큰 | 첫 토큰까지(TTFT) | 생성 속도 | 참고: Qwen3.5 9B (같은 PC, LM Studio) |
|---|---|---|---|---|
| 3,000자 | 1,486 | 1.49초 | 46.8t/s | 0.87초 |
| 15,000자 | 7,402 | 6.23초 | 45.0t/s | 2.4초 |
요약 두 개 모두 세 문장으로 답했고, 내용도 대체로 원문과 맞았습니다. 3,000자 요약에는 "모바일 환경의 장면을 개선"처럼 어색한 표현이 하나 있었습니다. 다만 글을 읽는 속도(프롬프트 처리)는 초당 약 1,000토큰으로, 같은 PC의 9B 모델보다 2~3배 느렸습니다. 긴 문서를 자주 넣는다면 답이 시작되기까지 기다리는 시간이 깁니다. 10만 자 요약은 컨텍스트 131,072가 필요해서 이 PC에서는 재지 않았습니다.

채팅 화면에서 15,000자를 넣은 화면. 위쪽 통계는 7,402토큰을 7.3초에 읽었다는 뜻(1,011토큰/초)이고, 답은 137토큰을 43.83t/s로 썼습니다.
앞 대화가 길어질수록 느려지는지도 봤습니다(컨텍스트 32,768, 생각 끔).
| 앞 대화 길이 | 첫 토큰까지(TTFT) | 생성 속도 |
|---|---|---|
| 약 1천 토큰 | 1.1초 | 47.8t/s |
| 약 8천 토큰 | 7.1초 | 45.0t/s |
| 약 2만 1천 토큰 | 14.8초 | 41.6t/s |
대화가 2만 토큰까지 길어지면 생성 속도는 약 13% 줄고, 첫 토큰까지는 15초 가까이 걸렸습니다. 다만 같은 채팅에서 이어서 물으면 앞 내용을 다시 읽지 않아서 빠릅니다.

약 1만 토큰 글에서 숨긴 정보를 찾은 뒤(9.8초), 같은 채팅에서 이어서 물은 화면. 두 번째 질문은 새로 읽을 토큰이 29개라 0.3초 만에 읽었습니다.
긴 문서에서 정보 찾기
약 1만 토큰 글의 10·30·50·70·90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고 찾게 했습니다. 숨기지 않은 글에서 "없음"이라고 답하는지도 봤습니다.
| 숨긴 위치 | 10% | 30% | 50% | 70% | 90% | 숨기지 않음 |
|---|---|---|---|---|---|---|
| 결과 | 찾음 | 찾음 | 찾음 | 찾음 | 찾음 | "없음" |
다섯 곳 모두 찾았고, 없는 정보를 지어내지도 않았습니다. 답은 지시한 형식 그대로 "이름: 보리차, 태어난 해: 2019"였습니다. 한 번에 약 9.3초가 걸렸는데, 대부분 글을 읽는 시간입니다.
전력과 온도
800자 글을 쓰는 동안 1초마다 GPU 전력과 온도를 쟀습니다(컨텍스트 32,768, 생각 끔, 2번).
| 항목 | Ternary Bonsai 2 27B | 참고: Qwen3.5 9B (같은 PC) |
|---|---|---|
| 대기 전력 | 15~18W | 14~17W |
| 글 쓰는 동안 평균 | 156~158W | 128~130W |
| 최고 전력 | 165W | 139W |
| 최고 온도 | 68~69°C | 61~64°C |
| 평균 GPU 사용률 | 94% | 88~90% |
| 토큰 하나당 에너지 | 약 3.2J | 약 2.8J |
9B 모델보다 약 30W 더 쓰고 온도도 5°C쯤 높았지만, 전력 제한 180W 안이었습니다.

800자 글을 쓰는 동안의 nvidia-smi. 왼쪽부터 시각, GPU 사용률 93~95%, 전력 155~159W, 온도 60~63°C, PC 전체 VRAM 사용량 약 11,030MiB입니다.
한국어 품질
API로 받은 한국어 답 33개를 모두 확인했습니다.
| 항목 | 결과 |
|---|---|
| 외국 문자 섞임 | 33개 중 4개: "运行的", "用途", "虚构", "的主力·从头·逐步". xhigh 답에서는 0개 |
| 오타 | "제에 있는 PC"(집에 있는), "클라우드 클라우드", "가전·일용 PC", "출간연년", "실내 환경가" |
| 낱말 실수 | 양자화를 "정량화"로 씀. 모래시계를 "모상"으로 씀(채팅 화면) |
| 말투 | 대부분 존댓말. medium 답 일부와 이미지 설명 하나는 "~다"체 |
외국 문자가 섞인 비율은 5090(33개 중 3개)과 비슷합니다. 모두 생각 끔이나 medium 답이었고, 한 낱말이 한자로 바뀌는 식이었습니다. 채팅 화면에서 따로 받은 답에도 "溢", "公开的", 아랍 문자 "وك"가 한 번씩 보였습니다. 글을 그대로 내보내려면 한 번 다듬어야 합니다.
없는 소설과 사진 설명
지어낸 책인 "한국 소설가 윤서하가 2018년에 발표한 장편소설 『푸른 등대의 겨울』의 줄거리"를 물었습니다.
| 생각 단계 | 걸린 시간 | 답 |
|---|---|---|
| xhigh | 7.5초 | 확인되지 않는다고 답하고 줄거리를 지어내지 않음 |
| medium | 12.6초 | 줄거리는 지어내지 않았지만, "한국서연(KO-BOOK)", "알람서점"처럼 없는 서점·사이트를 확인 방법으로 권함 |
| none | 3.3초 | "실제 존재하지 않는 작품"이라고 답함 |
세 번 모두 줄거리를 지어내지 않았습니다. 대신 확인하는 방법을 알려 줄 때 없는 서점이나 데이터베이스 이름을 만들어 냈습니다. 채팅 화면에서 xhigh로 다시 물었을 때도 "KBDP(kdbp.co.kr)", "알라디나" 같은 없는 이름이 나왔습니다. 모델이 권하는 사이트 이름과 주소는 그대로 믿지 않는 것이 좋습니다.

xhigh. 줄거리는 지어내지 않았지만, 확인 방법으로 "KBDP(kdbp.co.kr)", "알라디나"처럼 없는 이름을 적었고 "인터네셔널브وك"에는 아랍 문자가 섞였습니다. 538토큰, 11초였습니다.
이미지는 모래시계 두 개가 놓인 사진을 주고 3문장으로 설명하게 했습니다. 오른쪽 모래시계 뒤에는 전자 부품이 보이는 사진입니다.
| 생각 단계 | 걸린 시간 | 답 |
|---|---|---|
| xhigh (API) | 5.3초 | 모래시계 두 개, 나무 테이블, 뒤쪽의 전자기기와 케이블. 오른쪽 모래시계 안의 부품은 따로 짚지 않음 |
| medium (API) | 8.6초 | 오른쪽 모래시계 뒤로 전자 기기의 내부 구조가 보이고, 왼쪽 뒤에 음향 장비가 있다고 설명 |
| xhigh (채팅 화면) | 15초 | 오른쪽은 유리 케이스 안에 기판과 케이블이 보이고, 왼쪽 뒤에 음향 장비가 있다고 설명 |
사진 내용은 대체로 정확했습니다. 사진을 읽는 데는 약 1,050토큰을 1.5~1.9초에 처리했습니다.

채팅 화면에서 사진을 붙여 물은 결과. 사진은 1,052토큰으로 1.8초에 읽었고, 오른쪽 모래시계 뒤의 기판과 케이블, 왼쪽의 음향 장비까지 설명했습니다. "나무 모상", "랩"처럼 낱말이 틀린 곳이 있습니다.
정리
같은 PC에서 잰 다른 모델과 나란히 놓으면 아래와 같습니다. Ternary Bonsai 2 27B만 llama-server로 쟀고, 나머지는 LM Studio로 쟀습니다.
| 모델 | 파일 | VRAM | 생성 속도 (생각 끔) | 실행 |
|---|---|---|---|---|
| Ternary Bonsai 2 27B | PQ2_0 7.21GB | 9.3GB (32,768) | 약 48t/s | llama-server |
| Qwen3.8 27B GSQ-RCO | IQ3_S 12.12GB | 13.1GB (8,192) | 약 29t/s (빠른 설정) | LM Studio |
| Qwen3.8 27B IQ2_S | IQ2_S 9.30GB | 9.9GB (8,192) | 약 33t/s | LM Studio |
| Qwen3.5 9B | Q6_K_XL 8.76GB | 9.7GB (8,192) | 약 46t/s | LM Studio |
| Ornith 1.5 9B | Q8_0 9.79GB | 10.6GB (8,192) | 약 50t/s | LM Studio |
- 16GB에서 원활합니다. 제작사 기본 설정(컨텍스트 32,768)에서 9.3GB, 이미지 입력용 파일까지 10.1GB입니다. 65,536까지 여유 있게 들어갑니다.
- 이 PC에서 잰 27B 파일 가운데 가장 빠릅니다. 약 48t/s로 9B 모델들과 비슷하고, 3비트로 줄인 Qwen3.8 27B(약 29t/s)보다 빠릅니다. 대신 긴 글을 읽는 속도는 9B 모델보다 2~3배 느립니다.
- 생각 단계는 medium을 권합니다. 기본값 xhigh는 800자 글에 4~7분이 걸렸습니다. medium은 14~21초에 끝났고 산수도 5번 모두 맞혔습니다. 제작사도 짧은 답에는 medium을 권합니다.
- 생각을 끄면 산수는 모두 틀렸습니다. 계산이 들어가는 질문에는 생각을 켜 두세요.
- 설치는 번거롭습니다. LM Studio로 열리지 않아서 PrismML의 llama.cpp를 따로 받아야 합니다.
내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에서 직접 잰 값으로 볼 수 있습니다. 1세대 모델은 Bonsai 27B 테스트에서 볼 수 있습니다.
이 글의 한계
- 2026년 10월 3일, PrismML llama.cpp prism-b10754 기준입니다. 실행 프로그램이 바뀌면 속도가 달라질 수 있습니다.
- 이 PC에서는 PQ2_0만 쟀습니다. 더 작은 PTQ1_0 파일은 재지 않았습니다. 85번 글(RTX 5090)은 PTQ1_0으로 쟀기 때문에, 두 글의 VRAM·속도 차이에는 그래픽카드 차이와 파일 차이가 함께 들어 있습니다.
- 생각 끔(none)도 제작사가 생각 켬에 권하는 샘플링 값(온도 1.0 등)으로 쟀습니다. 제작사는 생각 끔에는 온도 0.7, Top P 0.8을 따로 권합니다.
- 10만 자 요약과 컨텍스트 262,144는 재지 않았습니다.
- LM Studio로 잰 다른 모델과는 실행 프로그램이 달라서, 속도 비교는 참고로만 봐 주세요.
자주 묻는 질문
Ternary Bonsai 2 27B는 LM Studio에서 돌아가나요?
2026년 10월 3일 기준 LM Studio 0.4.25에서는 열리지 않습니다. 이 모델의 형식(PTQ1_0, PQ2_0)은 PrismML이 고친 llama.cpp에서만 읽힙니다. PrismML GitHub에서 실행 파일을 받아 llama-server로 돌리면 됩니다.
RTX 5060 Ti 16GB에서 속도는 어느 정도인가요?
800자 글 기준으로 약 48t/s였습니다(PQ2_0, 제작사 기본 설정). 생각 단계를 바꿔도 속도는 45~48t/s로 거의 같지만, 기본 단계 xhigh는 생각이 길어서 글 하나에 4~7분이 걸렸습니다.
생각 단계는 무엇으로 두면 좋나요?
medium을 권합니다. 800자 글이 14~21초에 끝났고 산수 문제도 5번 모두 맞혔습니다. 요청에 "reasoning_effort": "medium"을 넣으면 됩니다. 생각을 끄면 산수는 5번 모두 틀렸습니다.
RTX 5090과 비교하면 어떤가요?
5090에서는 PTQ1_0 파일로 약 119t/s였습니다(85번 글). 이 PC는 약 48t/s로 40% 정도입니다. 정답률과 외국 문자가 섞이는 비율은 두 PC가 비슷했습니다.
댓글 0개