AI 테스트 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] Ornith 1.5 9B는 가장 큰 Q8로 받아도 될까, VRAM 10.6GB에 50t/s가 나왔다

EVUELA 2026년 10월 02일 4회 53분 전
[RTX 5060 Ti 16GB] Ornith 1.5 9B는 가장 큰 Q8로 받아도 될까, VRAM 10.6GB에 50t/s가 나왔다

코딩용으로 많이 받는 Ornith 1.5 9B(Q8_0, 파일 9.79GB)를 RTX 5060 Ti 16GB PC의 LM Studio에서 기본 설정 그대로 돌려 봤습니다. 결론부터 말하면 16GB 그래픽카드에서 원활하게 돌아갑니다. VRAM은 10.6GB를 썼고, 생성 속도는 생각(Thinking)을 끄면 약 50t/s(초당 토큰), 켜면 56~65t/s였습니다.

눈에 띈 점은 생각이 짧다는 것입니다. 생각을 켠 채 800자 글을 시켜도 15~20초면 끝났습니다. 같은 날 같은 PC에서 잰 Qwen3.5 9B는 같은 글에 2~3분이 걸렸습니다. 아쉬운 점도 있었습니다. 한국어 답 28개 가운데 2개에 한자가 섞였고, "형식으로만 답하라"는 지시는 지키지 않았습니다.

테스트 PC 사양

부품사양
GPUNVIDIA GeForce RTX 5060 Ti (VRAM 16GB, 전력 제한 180W)
GPU 연결PCIe 3.0 x8 (메인보드가 PCIe 3.0까지 지원)
GPU 드라이버616.92
CPUIntel Core i5-9400F (6코어 6스레드)
메인보드MSI H310M PRO-VD PLUS
시스템 램DDR4 32GB (16GB × 2, 2666MT/s)
저장장치Crucial MX500 1TB SATA SSD (모델 파일 위치)
운영체제Windows 11 Pro 25H2 (빌드 26200)
LM Studio0.4.25
런타임llama.cpp CUDA 12 런타임 2.47.0 (LM Studio 기본 선택)

Gemma 4 12B 테스트, Qwen3.8 27B 테스트와 같은 PC입니다. GPU는 최신이지만 CPU와 램은 몇 년 된 부품입니다.

테스트한 모델: Ornith 1.5 9B

Ornith 1.5 9B는 Ornith 팀이 공개한 9B(90억 파라미터) 모델입니다. 모델 카드에는 Qwen3.5와 Gemma 4를 바탕으로 추가 학습을 했고, 코딩·추론·에이전트(도구를 써서 일을 이어 가는 방식) 작업에 맞췄다고 적혀 있습니다. 허깅페이스에서 지난 한 달 동안 약 506만 번 내려받았습니다(2026년 10월 2일 확인).

항목내용
파라미터9B
받은 파일Q8_0(8비트 양자화) 9.79GB + 이미지 인식 파일(mmproj) 0.92GB. LM Studio 표시 10.71GB
다른 양자화Q4_K_M 5.78GB, Q5_K_M 6.64GB, Q6_K 7.56GB
최대 컨텍스트262,144토큰
기능이미지 입력, 도구 호출, 생각 켬·끔
라이선스MIT

9B 모델은 작아서 가장 큰 Q8_0을 받아도 16GB에 들어갑니다. 그래서 품질 손실이 가장 적은 Q8_0으로 테스트했습니다. 양자화는 모델의 숫자를 더 적은 비트로 줄여 저장하는 방법이고, 비트가 클수록 원본에 가깝습니다.

모델 카드의 벤치마크 점수는 아래와 같습니다. 제작사 측정이고, 이 글에서 따로 확인한 값은 아닙니다(모델 카드).

벤치마크점수(제작사 측정)
SWE-bench Verified (실제 코드 고치기)70.6%
Terminal-Bench 2.1 (터미널 작업)46.2%
GPQA Diamond (과학)86.4%
MCP-Atlas (도구 사용)54.2%

LM Studio My Models 화면의 Ornith 1.5 9B 모델 정보

My Models 화면. Q8_0, 아키텍처 qwen35에 MTP 표시가 있고, 크기는 10.71GB입니다.

LM Studio 기본 설정값

설정은 바꾸지 않고, LM Studio가 이 모델에 잡아 주는 기본값으로 테스트했습니다. 컨텍스트(모델이 한 번에 기억하는 글의 길이)를 바꿔 보는 테스트만 예외입니다.

LM Studio Load 탭의 Ornith 1.5 9B 기본 설정

Load 탭 기본값. 컨텍스트 8,192, GPU 오프로드 33(전체 레이어)입니다.

Load 탭 고급 설정, Speculative Decoding MTP

아래로 내리면 Speculative Decoding이 MTP로 켜져 있습니다. Flash Attention도 켜져 있습니다.

설정기본값뜻
컨텍스트 길이8,192한 번에 기억하는 토큰 수. 최대 262,144
GPU 오프로드33 (전체)33개 레이어를 모두 GPU에 올림
Speculative DecodingMTP (Max draft tokens 3)다음 토큰 몇 개를 미리 짐작해 두고, 맞으면 한꺼번에 받아들여 속도를 올리는 기능
Flash Attention켬메모리를 덜 쓰고 빠르게 계산하는 방식
생각(Enable Thinking)켬, 한도 없음답하기 전에 속으로 먼저 풀어 보는 단계
온도0.1낮을수록 매번 비슷한 답
Top K / Top P / Min P40 / 0.95 / 0.05다음 토큰 후보를 고르는 범위
반복 패널티1.1같은 말을 되풀이하지 않게 하는 값

모델 카드가 권하는 값은 온도 1.0, Top P 0.95, Top K 20(코딩은 온도 0.6)입니다. LM Studio 기본값과 다릅니다. 이 글의 결과는 모두 LM Studio 기본값으로 잰 것입니다.

Inference 탭, 생각 켬과 온도 0.1

Inference 탭. Enable Thinking이 켜져 있고 Reasoning Budget은 Unrestricted(한도 없음), 온도는 0.1입니다.

Inference 탭의 샘플링 설정

샘플링 기본값. Top K 40, 반복 패널티 1.1, Top P 0.95, Min P 0.05입니다.

VRAM: 기본 설정에서 10.6GB

모델을 로드하기 전과 뒤의 VRAM 사용량 차이를 쟀습니다. 컨텍스트를 키우면 기억할 자리가 늘어나 VRAM도 늘어납니다.

Ornith 1.5 9B 모델 로드 창, 예상 메모리 11.79GB

모델 로드 창. 기본 컨텍스트 8,192에서 예상 메모리는 11.79GB로 표시됩니다.

컨텍스트VRAM 사용로드 시간16GB에서
8,192 (기본)10.6GB10.2초원활
32,76811.5GB10.1초원활
65,53612.6GB9.9초원활
131,07214.8GB10.4초제한적 (여유 2GB 미만)
262,144 (최대)14.8GB + 시스템 램 약 5.6GB 더14.9초제한적 (일부가 시스템 램으로)

65,536까지는 VRAM이 3GB 넘게 남습니다. 131,072는 로드되고 속도도 그대로였지만 남는 VRAM이 1GB 남짓입니다. 262,144는 VRAM이 가득 차서 시스템 램을 다른 단계보다 약 5.6GB 더 썼습니다. 이 단계는 로드만 확인했고 속도는 재지 않았습니다.

모델을 처음 로드할 때는 디스크에서 읽어 오느라 25~40초가 걸렸습니다. 표의 시간은 두 번째부터의 값입니다.

글을 쓰는 동안의 GPU 사용률, 전력, 온도, VRAM

컨텍스트 32,768로 로드한 뒤 글을 쓰기 시작한 순간. GPU 사용률이 11%에서 86~91%로, 전력이 18W에서 116~120W로 올라갑니다. 맨 오른쪽은 PC 전체의 VRAM 사용량입니다.

생성 속도: 생각 끔 50t/s, 생각 켬 56~65t/s

"다음 주제로 800자 정도의 글을 써 주세요: 집에 있는 PC로 AI 모델을 돌릴 때 알아야 할 점"을 생각 끔·켬으로 3번씩 시켰습니다.

조건생성 속도생각에 쓴 토큰끝날 때까지
생각 끔48.5 / 49.7 / 52.0t/s08.3~11.3초
생각 켬 (기본)56.1 / 58.8 / 64.7t/s365 / 524 / 92014.6~20.1초
생각 켬, 컨텍스트 32,76856.7t/s40716.2초

생각을 켜도 20초 안에 답이 끝났습니다. 생각에 쓴 토큰이 365~920개로 적기 때문입니다. 같은 날 잰 Qwen3.5 9B는 같은 질문에 생각만 4,900~7,200토큰을 써서 2~3분이 걸렸습니다.

생각을 켰을 때 t/s가 오히려 높은 것은 Speculative Decoding 때문으로 보입니다. 아래 캡처처럼 이 모델은 생각을 영어로 하는데, 채팅 화면의 초안 적중률(draft tokens accepted)이 생각 끔 48%, 생각 켬 62%였습니다.

Ornith 1.5 9B가 생각하는 과정

생각 과정을 펼친 화면. 영어로 글에 넣을 항목 8개를 먼저 정리합니다.

생각 켬으로 쓴 800자 글의 끝부분과 통계

생각 켬으로 쓴 글. 통계 줄에 56.70t/s, 1,881토큰, 초안 적중률 62.5%가 보입니다.

생각 끔으로 쓴 800자 글의 끝부분과 통계

생각 끔으로 쓴 글. 42.92t/s, 508토큰입니다. 5번 항목에 한자가 섞인 "환경搭建"이 보입니다.

캡처 속 속도는 표보다 5~15% 낮습니다. 캡처는 원격 화면을 띄운 채 찍었고, 그동안 화면 표시가 GPU를 7% 정도 나눠 썼기 때문입니다. 표의 값은 원격 화면을 내리고 GPU가 쉬는 것을 확인한 뒤 API로 잰 값입니다.

Speculative Decoding(MTP)을 끄면

이 모델은 MTP가 기본으로 켜져 있어서, 끄고도 한 번 쟀습니다.

조건MTP 켬 (기본)MTP 끔
생각 끔 800자 글48.5~52.0t/s42.1~42.2t/s
생각 켬 800자 글56.1~64.7t/s42.2t/s
VRAM (컨텍스트 8,192)10.6GB9.6GB

MTP를 켜면 VRAM을 1GB 더 쓰는 대신 속도가 19~50% 올라갑니다. 16GB에서는 VRAM이 남으므로 기본값대로 켜 두는 쪽이 낫습니다.

산수 문제: 답은 맞지만 형식 지시는 어김

"사과 한 상자에 24개가 들어 있습니다. 3상자를 사서 19개를 먹고, 남은 것을 5명이 똑같이 나누면 한 사람당 몇 개이고 몇 개가 남나요? '한 사람당 X개, 남는 것 Y개' 형식으로만 답하세요."를 5번씩 물었습니다. 정답은 10개, 3개입니다.

조건마지막 답이 맞은 횟수형식으로만 답한 횟수걸린 시간
생각 끔5번 중 5번0번1.3~3.4초
생각 켬5번 중 5번0번2.8~3.1초

마지막 답은 10번 모두 맞았습니다. 하지만 10번 모두 풀이 과정을 함께 적어서, "형식으로만 답하라"는 지시는 한 번도 지키지 않았습니다. 생각 끔에서는 5번 중 2번이 첫 줄에 "한 사람당 8개, 남는 것 12개"라고 틀린 답을 먼저 쓰고, 계산한 뒤에 10개, 3개로 고쳤습니다. 답의 첫 줄만 읽는 프로그램에 연결해 쓴다면 문제가 될 수 있습니다.

생각 켬으로 푼 산수 문제

생각 켬. 1.96초 생각하고 정답을 냈습니다. 답 위에 풀이 세 줄을 함께 적었습니다.

생각 끔으로 푼 산수 문제

생각 끔. 정답이지만 여기에서도 풀이를 먼저 적었습니다.

긴 글 요약

이 블로그의 업데이트 기록을 앞에서부터 잘라 넣고 세 문장으로 요약하게 했습니다. 생각은 껐습니다. TTFT는 질문을 보낸 뒤 첫 토큰이 나올 때까지의 시간입니다.

넣은 글입력 토큰컨텍스트첫 토큰까지(TTFT)생성 속도
3,000자1,48632,7680.75초61.1t/s
15,000자7,40232,7682.5초55.7t/s
100,000자44,315131,07219.2초51.3t/s

10만 자를 넣어도 20초 안에 답이 시작됐습니다. 131,072 컨텍스트는 VRAM이 거의 가득 찼지만 속도는 떨어지지 않았습니다. 요약 내용은 대체로 원문과 맞았습니다. 한 곳이 틀렸습니다. 15,000자 요약에서 3,215줄은 style.css의 길이인데, 새로 만든 admin.css도 3,215줄이라고 적었습니다. 그리고 "세 문장"이 아니라 제목이 붙은 세 묶음으로 길게 썼습니다.

15,000자 글을 요약한 답과 통계

15,000자 요약. 세 문장 대신 번호가 붙은 세 묶음으로 답했습니다.

전력과 온도

800자 글을 쓰는 동안 1초마다 GPU 전력과 온도를 쟀습니다(컨텍스트 32,768, 생각 끔, 2번).

항목Ornith 1.5 9BQwen3.8 27B IQ2_S (같은 PC)
대기 전력약 17W-
글 쓰는 동안 평균122~124W176~179W
최고 전력132W-
최고 온도60~63°C77°C
평균 GPU 사용률85~87%92%
토큰 하나당 에너지약 2.5J약 5.0J

전력 제한 180W까지 올라가지 않았고 온도도 60°C 초반이었습니다. 같은 PC에서 잰 Qwen3.8 27B IQ2_S와 비교하면 토큰 하나를 만드는 데 드는 에너지가 절반입니다.

대화가 길어지면

앞 대화가 길어질수록 느려지는지 봤습니다(컨텍스트 32,768, 생각 끔).

앞 대화 길이첫 토큰까지(TTFT)생성 속도
약 1천 토큰0.48초59.0t/s
약 8천 토큰2.9초50.4t/s
약 2만 1천 토큰5.9초52.5t/s

대화가 2만 토큰까지 길어져도 생성 속도는 50t/s 아래로 내려가지 않았습니다. 첫 토큰까지의 시간만 6초로 늘었습니다.

긴 문서를 넣은 채팅에서 이어서 물은 답

약 1만 토큰 글을 넣은 채팅에서 이어서 물은 화면. 첫 토큰까지 0.26초였습니다. 앞 내용이 이미 처리돼 있어서 빠릅니다.

긴 문서에서 정보 찾기

약 1만 토큰 글의 10·30·50·70·90% 위치에 "블로그 관리자가 키우는 고양이 보리차는 2019년에 태어났다"는 문장을 하나 숨기고 찾게 했습니다. 숨기지 않은 글에서 "없음"이라고 답하는지도 봤습니다.

숨긴 위치10%30%50%70%90%숨기지 않음
결과찾음찾음찾음찾음찾음"없음"

다섯 곳 모두 찾았고, 없는 정보를 지어내지도 않았습니다.

긴 문서 가운데에 숨긴 정보를 찾은 답

글의 가운데(50%)에 숨긴 정보를 찾은 화면. 첫 토큰까지 4.34초였습니다.

한국어 품질

받은 한국어 답 28개를 모두 확인했습니다.

항목결과
외국 문자 섞임28개 답 중 2개에 한자 3곳: "12~16GB면中型 모델을", "파라미터数以로", "저자名的 오타"
영어 섞임"성능의 trade-off", "SSD(ideally NVMe)"처럼 영어 낱말을 그대로 쓴 곳이 있음
오타"라이브러니"(라이브러리)
주제 벗어남생각 끔 글 가운데 "돌릴 때"를 "학습시킬 때"로 받아들여 학습 이야기를 길게 쓴 답이 있음
말투대부분 존댓말. 문장은 자연스러움

한자가 섞이는 일은 조건을 바꿔 다시 잴 때마다 한두 번씩 나왔습니다. 다른 측정에서는 "好消息", "집にある PC"처럼 중국어·일본어가 섞인 답도 있었습니다. 글 전체로 보면 드물지만, 한국어 글을 그대로 내보내는 용도라면 한 번 읽어 보고 써야 합니다.

없는 소설과 이미지

지어낸 책인 "한국 소설가 윤서하가 2018년에 발표한 장편소설 『푸른 등대의 겨울』의 줄거리"를 물었습니다.

조건답
생각 켬"내용을 알 수 없습니다"라고 답하고 줄거리를 지어내지 않음
생각 끔"알고 있는 정보가 없습니다"라고 답함. 다만 "검색한 결과"라고 썼는데, 실제로는 검색 기능이 없음

없는 소설을 물었을 때의 답

생각 켬. 6.51초 생각한 뒤 정보가 없다고 답했습니다.

이미지는 모래시계 두 개가 놓인 사진을 주고 3문장으로 설명하게 했습니다. 오른쪽 모래시계 뒤에는 전자 부품이 보이는 사진입니다.

조건걸린 시간답
생각 켬8.2초모래시계 두 개, 오른쪽은 금속 프레임과 전자 장비에 둘러싸인 형태, 뒤쪽 오디오 장비까지 설명
생각 끔1.8초모래시계 두 개는 맞음. "양쪽 모두 목재 프레임"이라고 해서 오른쪽의 전자 부품은 놓침

모래시계 사진을 설명한 답

생각 켬. 왼쪽은 일반 모래시계, 오른쪽은 뒤에 회로판과 전선이 보인다고 설명했습니다.

정리

같은 PC에서 잰 다른 모델과 나란히 놓으면 아래와 같습니다. 모두 LM Studio 기본 설정, 생각 끔 800자 글 기준입니다.

모델파일VRAM (8,192)생성 속도 (생각 끔)16GB에서
Ornith 1.5 9BQ8_0 9.79GB10.6GB약 50t/s원활
Qwen3.5 9BQ6_K_XL 8.76GB9.7GB약 46t/s원활
Gemma 4 12B QATQ4_0 6.93GB8.6GB약 44t/s원활
Qwen3.8 27B IQ2_SIQ2_S 9.30GB9.9GB약 33t/s원활
Gemma 4 26B A4B QATQ4_0 15.63GB12.4GB약 21t/s제한적
  • 16GB에서 원활합니다. 가장 큰 Q8_0을 받아도 VRAM 10.6GB, 컨텍스트 65,536까지 3GB 넘게 남습니다.
  • 생각을 켜 두고 써도 됩니다. 생각이 짧아서 800자 글이 20초 안에 끝나고, 산수는 3초면 답합니다.
  • MTP는 켜 두는 쪽이 낫습니다. VRAM 1GB를 더 쓰고 속도가 19~50% 올라갑니다.
  • 형식 지시는 잘 안 지킵니다. 답은 맞지만 풀이를 함께 적고, 생각을 끄면 틀린 답을 먼저 쓴 뒤 고치기도 했습니다.
  • 한국어 글에 한자가 가끔 섞입니다. 28개 답 중 2개였습니다.

내 그래픽카드에서 다른 모델이 어느 정도 속도로 도는지는 GPU 체험에서 직접 잰 값으로 볼 수 있습니다.

자주 묻는 질문

Ornith 1.5 9B는 VRAM이 얼마나 필요한가요?

Q8_0 파일을 LM Studio 기본 설정(컨텍스트 8,192)으로 로드하면 10.6GB를 씁니다. 컨텍스트 32,768에서는 11.5GB, 65,536에서는 12.6GB, 131,072에서는 14.8GB였습니다. 12GB 그래픽카드라면 Q6_K(7.56GB)나 Q4_K_M(5.78GB)이 맞습니다. 이 두 파일은 이 글에서 재지 않았습니다.

RTX 5060 Ti 16GB에서 속도는 어느 정도인가요?

800자 글 기준으로 생각 끔 48.5~52.0t/s, 생각 켬 56.1~64.7t/s였습니다. 생각을 켜도 글 하나가 15~20초에 끝났습니다.

Speculative Decoding(MTP)은 꺼야 하나요?

켜 두는 쪽이 빠릅니다. 끄면 VRAM은 10.6GB에서 9.6GB로 줄지만 속도가 약 42t/s로 내려갑니다. LM Studio는 이 파일에 MTP를 기본으로 켭니다.

한국어 답은 믿을 만한가요?

문장은 자연스럽습니다. 다만 28개 답 중 2개에 한자가 섞였고, 영어 낱말을 그대로 쓴 곳과 오타도 있었습니다. 없는 책을 물었을 때는 지어내지 않았습니다.

컨텍스트는 얼마로 두면 좋은가요?

16GB에서는 65,536까지 VRAM이 3GB 넘게 남습니다. 131,072도 로드되고 10만 자 요약이 20초 안에 시작됐지만, 남는 VRAM이 1GB 남짓이라 다른 프로그램이 VRAM을 쓰면 느려질 수 있습니다.

관련 게시글

댓글 0개