AI 테스트 RTX-5060TI 16GB

[RTX 5060 Ti 16GB] 로컬 AI 판단 전용 모델 d1-3B, 한국어 144문제를 얼마나 맞힐까, 쉬운 100개는 모두 맞히고 답 하나 0.06초였다

2026년 10월 11일 34회 2시간 전
[RTX 5060 Ti 16GB] 로컬 AI 판단 전용 모델 d1-3B, 한국어 144문제를 얼마나 맞힐까, 쉬운 100개는 모두 맞히고 답 하나 0.06초였다

Liquid AI가 10월 7일에 판단 전용 모델 d1-3B의 가중치를 공개했습니다. 판단 전용 모델은 글을 쓰지 않고, 주어진 보기 가운데 무엇이 맞는지를 확률로 답하는 모델입니다. 이 모델을 RTX 5060 Ti 16GB에서 직접 돌려 지난 글과 같은 한국어 144문제를 물었고, 같은 PC에서 Amazon의 Strands Decider 2B도 다시 쟀습니다. 결론부터 적으면 d1-3B는 쉬운 문제 100개를 한국어와 영어 모두 다 맞혔고, 답 하나에 0.06초로 Strands Decider 2B(0.17초)보다 3배 빨랐습니다.

  • 쉬운 문제 100개: d1-3B는 한국어 100개, 영어 100개. Strands Decider 2B는 한국어 95개, 영어 95개를 맞혔습니다.
  • 어려운 문제 44개(비꼼, 이중 부정, 계산): d1-3B는 한국어 34개, 영어 41개. Strands Decider 2B는 한국어 26개, 영어 37개였습니다.
  • 답 하나에 걸린 시간은 d1-3B가 58ms, Strands Decider 2B가 173ms였습니다(중앙값).
  • 모델이 쓴 VRAM은 d1-3B가 6.0GB, Strands Decider 2B가 3.7GB였습니다. 둘 다 16GB에 넉넉히 들어갑니다.
  • d1-3B는 그림도 받습니다. 이 블로그가 만든 그림 4장에 한국어 질문 12개를 물었고 12개를 맞혔습니다.
  • 윈도우에서는 그대로 돌지 않았습니다. 빠른 계산 부품이 윈도우용 PyTorch에 없어서, 모델 코드 안의 느린 대체 계산으로 돌렸습니다.

이 글의 숫자는 RTX 5060 Ti 16GB PC에서 2026년 10월 11일에 직접 잰 값입니다. 문제 144개와 정답은 113번 글에서 만든 것을 그대로 썼고, 글 끝에 파일 주소를 적었습니다.

이 글의 결과를 20초로 요약한 영상입니다(소리 없음).

두 모델 요약. Strands Decider 2B: 쉬운 문제 한국어 95 영어 95, 어려운 문제 한국어 26 영어 37, 답 하나 173ms, VRAM 3.7GB. d1-3B: 쉬운 문제 100과 100, 어려운 문제 34와 41, 58ms, 6.0GB

두 모델을 같은 PC에서 같은 문제 144개로 비교한 결과입니다.

d1-3B는 어떤 모델인가

보통의 언어 모델은 질문을 받으면 글을 한 토큰씩 써 내려갑니다. 판단 전용 모델은 글을 쓰지 않습니다. 상황을 적은 글과 질문, 보기를 함께 넣으면 보기마다 확률을 돌려줍니다. 답이 정해진 모양으로만 나오고 한 번의 계산으로 끝납니다. 문의를 어느 팀에 넘길지, AI 에이전트가 어떤 도구를 부를지 같은 작은 결정에 씁니다. 자세한 설명은 Strands Decider 2B와 Clef-Flash 9B를 비교한 글에 있습니다.

항목d1-3BStrands Decider 2B
만든 곳Liquid AIAmazon (AWS)
공개한 날2026년 10월 7일(발표 글)2026년 10월 1일
바탕 모델LFM2.5-VL-3BQwen3.5 2B
파라미터31억 2천만 개약 19억 개
입력글, 그림글
컨텍스트32,768토큰모델 카드에서 확인하지 못함
받은 파일6.27GB어댑터 0.09GB + 바탕 모델 4.57GB
라이선스LFM Open License v1.0Apache 2.0
실행 방법모델과 함께 받는 파이썬 코드(transformers 5.14 이상)파이썬 패키지 strands-decider 0.1.0

이 표가 뜻하는 것은, d1-3B는 Strands Decider 2B보다 조금 크고 그림까지 받는 모델이라는 점입니다. 모델 카드의 지원 언어 16개 가운데 한국어가 들어 있습니다. Strands Decider 2B의 안내에는 한국어 이야기가 없었습니다.

라이선스는 Apache 2.0이 아닙니다. LFM Open License v1.0은 연 매출이 1천만 달러를 넘는 회사의 상업적 사용을 허락하지 않습니다. 개인과 작은 회사는 상업적으로도 쓸 수 있습니다. 쓰기 전에 원문을 읽어 보시기 바랍니다.

질문은 세 종류이고, 두 모델이 같은 모양을 씁니다.

종류묻는 것돌려주는 것
choice보기 가운데 하나 고르기보기마다 확률
noul예 또는 아니오'예'일 확률
score낮음부터 높음까지의 단계단계마다 확률과 기대 점수

실제 화면: 같은 질문 네 개를 두 모델에 물으면

터미널에서 두 모델에 같은 한국어 질문 네 개를 차례로 보낸 화면입니다. 왼쪽이 d1-3B, 오른쪽이 Strands Decider 2B입니다. 질문 네 개는 113번 글과 같습니다. 답 옆의 숫자는 그 질문 하나에 걸린 시간이고, 막대는 보기마다의 확률입니다.

두 모델에 같은 질문을 보낸 터미널 화면을 나란히 붙였습니다(7초, 소리 없음). 질문 사이의 쉬는 시간은 보기 편하게 넣은 것입니다.

d1-3B의 터미널 화면. 올리는 데 10.4초, VRAM 5.8GB. 결제 문의는 결제 0.950에 62ms, 줄임말 문의는 계정 0.902에 73ms, 환불을 안 해 주시면 안 됩니다는 예('예'일 확률 0.953)로 맞힘. 참 친절한 고객센터군요는 긍정 0.946으로 틀림

d1-3B입니다. 위의 세 질문은 맞혔고, 비꼬는 말은 긍정으로 읽었습니다.

Strands Decider 2B의 터미널 화면. 올리는 데 10.6초, VRAM 3.6GB. 결제 0.773에 192ms, 계정 0.832에 192ms. 환불을 안 해 주시면 안 됩니다는 아니오('예'일 확률 0.138)로 틀림. 참 친절한 고객센터군요는 긍정 0.960으로 틀림

Strands Decider 2B입니다. 이중 부정과 비꼼을 틀렸습니다. 113번 글에서 RTX 5090으로 본 것과 같은 답입니다.

이 화면이 뜻하는 것은 두 가지입니다. "환불을 안 해 주시면 안 됩니다"를 d1-3B는 '환불을 원한다'로 읽었고 Strands Decider 2B는 반대로 읽었습니다. "참 친절한 고객센터군요"는 두 모델 모두 긍정이라고 답했습니다. 그리고 답 하나에 d1-3B는 62~73ms, Strands Decider 2B는 179~192ms가 걸렸습니다.

테스트 PC와 측정 방법

항목내용
그래픽카드RTX 5060 Ti 16GB (드라이버 617.42)
CPU, 램Intel Core i5-9400F, 32GB
운영체제Windows 11 Pro
프로그램Python 3.12.10, PyTorch 2.11.0(CUDA 12.8), transformers 5.19.0, peft 0.21.2, strands-decider 0.1.0
정밀도두 모델 모두 제작사 기본값(bfloat16), 양자화하지 않음
재는 방법문제 하나에 질문 하나를 보내고, 답이 돌아올 때까지의 시간을 잼. 쉬운 문제는 100개를 5번(500번), 어려운 문제는 44개를 5번(220번)
메모리VRAM은 모델을 올리기 전과 뒤의 차이. 시스템 램은 PC 전체 사용량

이 블로그는 평소 Unsloth Studio로 재지만, 판단 전용 모델은 글을 쓰는 모델이 아니라서 Unsloth Studio에 올릴 수 없습니다. 그래서 113번 글과 같은 방법으로, 따로 만든 파이썬 환경에서 제작사 코드로 돌렸습니다. 측정 스크립트도 113번 글의 것에 d1-3B만 더했습니다.

윈도우에서는 한 군데를 바꿔야 돌았다

d1-3B를 안내대로 돌리자 첫 질문에서 이런 오류로 멈췄습니다.

RuntimeError: USE_FLASH_ATTENTION was not enabled for build.

d1-3B의 코드는 그래픽카드에서 flash attention이라는 빠른 계산 부품을 직접 부릅니다. 윈도우용 PyTorch에는 이 부품이 빠져 있습니다. 모델 코드를 읽어 보니 CPU와 맥에서 쓰는 대체 계산이 따로 있었습니다. 그래서 측정 스크립트에서 그래픽카드도 그 대체 계산을 타게 바꿨습니다. 모델 파일과 가중치는 고치지 않았습니다. 바꾼 줄은 글 끝의 스크립트에 있습니다.

그래서 이 글의 d1-3B 시간은 리눅스에서 재는 것보다 느립니다. 제작사가 권하는 model.compile()도 윈도우에서는 실패했습니다(Cannot find a working triton installation). Strands Decider 2B도 113번 글에 적은 대로 윈도우에서 빠른 계산 부품 없이 돌았습니다.

받기 전에 d1-3B 저장소의 파이썬 파일 6개를 읽었습니다. 모델을 불러올 때 이 코드가 내 PC에서 실행되기 때문입니다(trust_remote_code=True). 네트워크에 접속하거나 다른 프로그램을 실행하는 부분은 없었습니다. 받는 버전은 읽어 본 커밋으로 고정했습니다.

쉬운 문제 100개: d1-3B는 200번을 모두 맞혔다

답이 분명한 문제 100개입니다. 한국어로 쓰고 같은 내용을 영어로도 썼습니다. 문의가 어느 팀 것인지, 글의 감정, 뉴스 제목의 주제, 긴급한 일인지, 어느 도구를 쓸지의 다섯 종류입니다.

쉬운 문제 100개 결과 표. Strands 2B 한국어: 문의 24/25, 감정 19/20, 주제 20/20, 긴급 12/15, 도구 20/20, 합계 95. 영어: 24, 20, 20, 11, 20, 합계 95. d1-3B는 한국어와 영어 모두 전부 정답으로 100

맞힌 수와 문제 수입니다. 초록은 90% 이상, 노랑은 70% 이상입니다.

이 표가 뜻하는 것은, 답이 분명한 분류는 d1-3B가 한국어로도 빠짐없이 맞혔다는 점입니다. 113번 글에서 RTX 5090으로 잰 9B 모델 Clef-Flash와 같은 결과입니다. Strands Decider 2B의 95개는 RTX 5090에서 잰 것과 문제 하나까지 같았습니다.

차이는 '긴급한 일인가'에서 났습니다. Strands Decider 2B가 긴급하지 않다고 답한 "서버실에서 타는 냄새가 나고 연기가 보입니다", "지금 운영 서버 데이터베이스가 응답하지 않습니다" 같은 글을 d1-3B는 15개 모두 맞혔습니다. 맞힌 답의 평균 확신도는 95%였습니다.

어려운 문제 44개: 한국어 34개, 비꼬는 말을 못 읽었다

글자 그대로 읽으면 틀리는 문제 44개입니다. 맨 오른쪽 칸은 113번 글에서 RTX 5090으로 잰 Clef-Flash 9B의 한국어 결과입니다. 정답 수는 그래픽카드와 상관없으니 그대로 견줄 수 있습니다.

어려운 문제 44개 결과 표. Strands 2B 한국어: 비꼼 2/6, 부정 3/6, 섞인 문의 4/6, 줄임말 4/6, 해당 없음 6/6, 계산 3/8, 긴 글 4/6, 합계 26. 영어 합계 37. d1-3B 한국어: 3, 5, 5, 6, 6, 5, 4, 합계 34. 영어: 4, 6, 6, 6, 6, 7, 6, 합계 41. Clef-Flash 9B 한국어 합계 42

종류별로 맞힌 수입니다. 빨강은 70% 아래입니다.

이 표가 뜻하는 것은 세 가지입니다.

  • d1-3B는 한국어 34개로, Strands Decider 2B(26개)와 Clef-Flash 9B(42개)의 가운데였습니다. 모델 크기 순서와 같습니다.
  • d1-3B도 한국어가 영어보다 7개 적었습니다(34개 대 41개). Strands Decider 2B의 11개 차이보다는 작지만, 9B 모델처럼 차이가 없어지지는 않았습니다.
  • 줄임말과 '보기에 맞는 것이 없을 때'는 한국어도 6개씩 다 맞혔습니다. "로긴이 안되는디요" 같은 글을 Strands Decider 2B는 틀렸고 d1-3B는 맞혔습니다.

d1-3B가 한국어에서 틀린 문제 10개

종류글정답d1-3B의 답
비꼼배송이 3주나 걸리다니 정말 빠르네요. 대단합니다.부정긍정 (확신 94%)
비꼼전화 연결까지 40분, 참 친절한 고객센터군요.부정긍정 (확신 95%)
비꼼한 번 쓰고 고장 나다니, 품질이 아주 훌륭합니다.부정긍정 (확신 92%)
이중 부정환불 받지 않겠다는 말은 한 적이 없습니다. 처리해 주세요.환불 원함원하지 않음 (확신 79%)
섞인 문의앱 오류는 업데이트하니 고쳐졌습니다. 이제 남은 건 잘못 결제된 배송비를 취소하는 일입니다.결제환불 (확신 52%)
계산3만 원짜리 두 개와 5만 원짜리 한 개를 주문했습니다. (총액이 10만 원을 넘는가)예아니오 (확신 52%)
계산5만 원짜리 두 개에 배송비 3천 원이 붙었습니다. (같은 질문)예아니오 (확신 64%)
계산1만 원짜리 열한 개를 주문했습니다. (같은 질문)예아니오 (확신 59%)
긴 글약 1,800자 글 가운데 결제가 두 번 됐다는 한 문장결제환불 (확신 80%)
긴 글약 1,800자 글 가운데 계정 문제를 적은 한 문장계정기술 오류 (확신 52%)

이 표가 뜻하는 것은, 틀린 문제가 두 무리로 나뉜다는 점입니다. 비꼬는 말 세 개는 92~95%의 확신으로 틀렸습니다. 나머지 일곱 개 가운데 다섯 개는 확신도가 52~64%였습니다. 거의 반반이라고 본 것입니다.

이 10개 가운데 9개는 Strands Decider 2B도 틀린 문제입니다. d1-3B만 틀린 것은 긴 글 하나였고, Strands Decider 2B만 틀린 문제는 9개였습니다. 영어로 물으면 d1-3B가 틀린 것은 비꼼 2개와 계산 1개뿐이었습니다.

확신도가 낮은 답만 다시 물으면

판단 전용 모델은 답과 함께 확신도를 줍니다. 확신도가 낮을 때만 큰 모델에게 다시 묻는 식으로 쓰라는 뜻입니다. 어려운 문제 44개(한국어)에서 d1-3B의 확신도를 세 구간으로 나눠 봤습니다.

확신도답의 수그중 틀린 답
90% 이상27개3개 (모두 비꼼)
70% 이상 90% 미만7개2개
70% 미만10개5개

이 표가 뜻하는 것은, 확신도 70% 미만인 답 10개만 다시 물어도 틀린 10개 가운데 5개를 걸러 낼 수 있다는 점입니다. 다만 비꼬는 말은 확신도가 높아서 이 방법으로 걸러지지 않습니다. 문제 수가 적어서 구간마다의 비율은 참고로만 보시기 바랍니다.

속도와 메모리: 같은 PC에서 3배 차이

속도와 메모리 표. 답 하나 평균: Strands 174.7ms, d1-3B 59.5ms. 중앙값과 95% 지점: 173.0과 190.8ms, 57.7과 68.7ms. 질문 3개를 한 번에: 346ms, 81ms. 올리는 시간 10.5초, 10.7초. VRAM 3.7GB, 6.0GB. GPU 사용률 19%, 45%. 전력 45W, 81W

쉬운 문제 100개를 5번 돌린 값입니다.

항목Strands Decider 2Bd1-3B
답 하나 평균 (한국어, 500번)174.7ms59.5ms
중앙값173.0ms57.7ms
가장 짧은 값 ~ 가장 긴 값160.7~247.3ms53.0~94.4ms
95% 지점190.8ms68.7ms
5번 반복의 평균들173.0~176.6ms59.0~60.5ms
영어로 물었을 때 평균174.2ms59.2ms
어려운 문제 평균, 95% 지점188.6ms, 269.1ms74.3ms, 178.9ms
프로그램을 켠 뒤 첫 답1.5초18.4초
모델을 올리는 시간10.5초10.7초
모델이 쓴 VRAM3.7GB6.0GB
시스템 램 증가0.4GB0.3GB
재는 동안 GPU 사용률, 전력19%, 45W45%, 81W

이 표가 뜻하는 것은 세 가지입니다.

  • 더 큰 모델인 d1-3B가 3배 빨랐습니다. 5번 반복해도 59.0~60.5ms로 거의 같았습니다.
  • d1-3B는 프로그램을 켠 뒤 첫 답에 18.4초가 걸렸습니다. 두 번째 답부터 0.06초입니다. 계속 켜 두고 쓰는 방식에 맞습니다.
  • 한국어와 영어의 속도 차이는 없었습니다.

Strands Decider 2B는 왜 RTX 5090 때보다 3배 느렸나

Strands Decider 2B는 113번 글의 RTX 5090 PC에서 중앙값 53ms였습니다. 이 PC에서는 173ms입니다. 프로그램 버전은 같습니다. 그런데 재는 동안 GPU 사용률이 19%뿐이었습니다. 그래픽카드가 대부분 쉬고 있었다는 뜻입니다. 이 PC의 CPU는 2019년에 나온 6코어 i5-9400F이고, 113번 글의 PC는 Core Ultra 9 285K입니다. 그래픽카드보다 CPU에서 하는 준비 작업에 시간이 걸리는 것으로 보입니다(추정). 어디에서 시간이 걸리는지 나눠서 재지는 않았습니다.

d1-3B는 같은 CPU에서 58ms였습니다. 문제를 하나씩 보내는 쓰임새라면, 오래된 CPU에서는 모델 크기보다 실행 코드가 얼마나 가벼운지가 더 크게 작용했습니다.

질문을 묶어 보내면

두 모델 모두 글 하나에 질문 여러 개를 한 번에 물을 수 있습니다. 문의 글 25개에 "어느 팀인가, 긴급한가, 감정은 무엇인가" 세 가지를 한꺼번에 물었습니다.

모델질문 1개질문 3개를 한 번에질문 하나당
Strands Decider 2B174.8ms345.9ms115.3ms
d1-3B58.5ms81.2ms27.1ms

이 표가 뜻하는 것은, d1-3B는 질문을 두 개 더 얹어도 23ms만 늘어난다는 점입니다. 글은 한 번만 읽고 질문만 따로 계산하기 때문입니다. Strands Decider 2B는 질문 3개에 시간이 2배가 됐습니다.

더 빠르게 쓰는 방법: 여러 문제를 한 묶음으로

d1-3B에는 서로 다른 글 여러 개를 한 번에 계산하는 기능(system_one_batch)이 있습니다. 한국어 쉬운 문제 100개를 묶음 크기만 바꿔 5번씩 돌렸습니다.

묶음 크기별 처리량 막대 그림. 하나씩 17문제/초, 8개씩 69문제/초, 32개씩 59문제/초, 64개씩 59문제/초, 100개씩 59문제/초

d1-3B가 1초에 처리한 문제 수입니다.

묶음 크기100문제에 걸린 시간문제 하나당1초에정답
하나씩5.74~5.85초57.9ms17문제100
8개씩1.44~1.46초14.5ms69문제100
32개씩1.67~1.73초17.0ms59문제100
64개씩1.68~1.73초17.0ms59문제100
100개 한 번에1.67~1.70초16.9ms59문제100

이 표가 뜻하는 것은, 8개씩만 묶어도 4배 빨라진다는 점입니다. 그보다 크게 묶어도 더 빨라지지 않았습니다. 정답은 묶음 크기와 상관없이 100개였고, 하나씩 보낼 때와 답이 모두 같았습니다. 쌓아 둔 글을 한꺼번에 분류하는 일이라면 묶어서 보내는 편이 좋습니다.

가중치를 fp32로 올리면

윈도우에서 코드를 바꾸지 않고 돌리는 방법이 하나 더 있습니다. 가중치를 반 정밀도(bfloat16) 대신 fp32로 올리면 d1-3B가 스스로 대체 계산을 탑니다. 같은 문제로 재 봤습니다.

항목bfloat16 (이 글의 기준)fp32
정답 (쉬운 한국어 / 어려운 한국어)100 / 34100 / 34
답 하나 평균 (쉬운 문제, 한국어)59.5ms70.0ms
어려운 문제 95% 지점178.9ms465.7ms
모델이 쓴 VRAM6.0GB11.9GB
GPU 전력81W149W

이 표가 뜻하는 것은, fp32는 정답이 같고 VRAM과 전력만 두 배 가까이 든다는 점입니다. 긴 글에서는 2.6배 느렸습니다. 16GB 그래픽카드에는 들어가지만 쓸 이유가 없습니다.

그림을 보고 답하기: 12개 중 12개

d1-3B는 그림도 받습니다. 이 블로그가 만든 그림 4장(대표 이미지로 만든 사진, 제목 카드의 막대 그래프, 프로그램 화면 캡처, 표 그림)에 한국어 질문 12개를 물었습니다.

그림 4장과 질문 12개. 모래시계 사진: 몇 개인가, 무슨 물건인가, 그림 종류 모두 맞힘, 질문 하나 408ms. 막대 그래프: 그림 종류, 가장 긴 막대의 모델, 197.5가 적혀 있는가, 512.0이 적혀 있는가 모두 맞힘, 275ms. 프로그램 화면: 답 속의 숫자, 화면에 적힌 속도, 한글이 있는가 모두 맞힘, 102ms. 표 그림: 그림 종류, 빨간 글자가 있는가 모두 맞힘, 668ms

그림마다 물은 질문과 결과입니다.

그림크기입력 토큰질문 하나맞힌 수
모래시계 사진1024×1024약 1,330408ms3 / 3
막대 그래프(제목 카드)1600×832약 800275ms4 / 4
프로그램 화면 캡처977×333약 290102ms3 / 3
표 그림2400×1398약 1,820668ms2 / 2

이 표가 뜻하는 것은 두 가지입니다. 그림 속의 숫자와 글자를 읽어야 하는 질문("그림에 197.5라는 숫자가 적혀 있습니까", "화면 아래에 적힌 속도는 얼마입니까")도 맞혔습니다. 그리고 그림이 클수록 시간이 늘었습니다. 글만 물을 때는 58ms였는데 그림은 0.1~0.7초입니다. 질문 12개는 수가 적어서, 그림 판단을 믿을 수 있다는 근거로 삼기에는 모자랍니다.

단계 점수(score) 질문도 물어봤습니다. 글 9개에 "이 일은 얼마나 급합니까"를 세 단계(기다려도 됨, 오늘 안에, 지금 바로)로 물었고, 9개 모두 정한 단계가 가장 높은 확률로 나왔습니다.

다른 곳의 측정과 견주면

d1-3B를 따로 재 본 다른 글은 찾지 못했습니다. 공개된 지 나흘밖에 되지 않아, 지금 있는 숫자는 모두 제작사가 잰 것입니다.

측정질문 하나질문 3개를 한 번에그림 하나64개 묶음조건
이 글58ms81ms102~668ms59문제/초RTX 5060 Ti, 윈도우, 대체 계산, 한국어, 그림 크기 977×333~2400×1398
Liquid AI (모델 카드)8ms (compile 없이 16ms)21ms17ms475문제/초RTX 4090, flash attention, compile 사용, 그림 384px
Liquid AI (모델 카드)50ms73ms202ms38문제/초NVIDIA Jetson Orin Nano

이 표가 뜻하는 것은, 이 글의 값이 제작사의 RTX 4090 값보다 3.6~8배 느리고, 작은 기기인 Jetson Orin Nano와 비슷한 수준이라는 점입니다. 그래픽카드 차이도 있지만, 윈도우에서 flash attention과 compile을 쓰지 못한 것이 더 큰 이유로 보입니다(추정). 리눅스에서 재면 얼마나 줄어드는지는 확인하지 못했습니다.

정확도는 제작사가 Decision Index 0.2.1에서 48.57점이라고 적었습니다. 영어 중심의 시험이고 제작사가 직접 채점한 값입니다. 한국어로 잰 다른 측정은 찾지 못했습니다.

정리

  • d1-3B는 16GB 그래픽카드에서 VRAM 6.0GB로 돌았습니다. 답 하나에 0.06초, 8개씩 묶으면 1초에 69문제입니다.
  • 답이 분명한 분류는 한국어 100문제를 모두 맞혔습니다. 2B 모델이 놓친 '긴급한 일인가'도 다 맞혔습니다.
  • 어려운 문제는 한국어 44개 중 34개였습니다. 비꼬는 말은 높은 확신으로 틀리고, 계산이 필요한 판단은 반반으로 헷갈렸습니다.
  • 같은 PC에서 Strands Decider 2B보다 정답도 많고 3배 빨랐습니다. VRAM은 2.3GB 더 씁니다.
  • 그림 속 글자와 숫자를 읽는 질문도 한국어로 맞혔습니다. 시간은 그림 크기에 따라 0.1~0.7초입니다.
  • 윈도우에서는 안내대로만 해서는 돌지 않습니다. 대체 계산으로 돌리면 되지만 제작사가 적은 속도는 나오지 않습니다.

내 그래픽카드에 어떤 모델이 들어가는지는 GPU 체험에서 볼 수 있습니다. 같은 PC에서 잰 작은 언어 모델의 속도는 Gemma 4 E2B 글에 있습니다. 판단 전용 모델이 처음 나왔을 때의 이야기는 pplx-decider 글에 적었습니다.

이 글의 한계

  • 문제 144개는 113번 글에서 직접 만든 것입니다. 수가 적고, 만든 사람의 기준이 들어가 있습니다. 어려운 문제는 종류마다 6~8개뿐이라 한두 문제에 비율이 크게 바뀝니다.
  • 정답률은 한 번 잰 값입니다. 이 모델들은 같은 입력에 같은 답을 내서, 반복해도 정답 수는 바뀌지 않습니다.
  • d1-3B는 윈도우에서 flash attention 없이 대체 계산으로 쟀습니다. 리눅스나 WSL에서는 재지 않았습니다. compile은 실패해서 재지 못했습니다.
  • d1-3B는 llama.cpp로도 돌릴 수 있다고 제작사가 밝혔지만 시도하지 않았습니다. 양자화한 파일도 재지 않았습니다.
  • CPU만으로 돌리는 측정은 끝내지 못했습니다. 한국어 100문제를 2번 돌린 데까지는 100개 정답에 답 하나 중앙값 5.6초(i5-9400F)였습니다. 20분이 넘어 멈췄고 결과 파일은 남지 않았습니다. 이 CPU에서는 쓰기 어려운 속도입니다.
  • Clef-Flash 9B는 VRAM 18.3GB를 써서 이 PC에서 재지 못했습니다. 글에 적은 Clef-Flash 9B의 값은 113번 글에서 RTX 5090으로 잰 것입니다.
  • Strands Decider 2B가 이 PC에서 느린 이유는 추정입니다. 단계별로 나눠 재지 않았습니다.
  • 그림 질문 12개와 단계 점수 질문 9개는 수가 적습니다. 그림 4장은 모두 이 블로그가 만든 것이라 종류가 한쪽으로 치우쳐 있습니다.
  • 함께 공개된 d1-omni-600M(글, 그림, 소리)은 재지 않았습니다.
  • 같은 문제를 일반 언어 모델에게 물었을 때와 견주지 않았습니다.
  • 2026년 10월 11일 기준입니다.

자주 묻는 질문

d1-3B는 VRAM이 얼마나 필요한가요?

이 글의 측정에서 모델이 쓴 VRAM은 6.0GB였습니다(bfloat16). 8GB 그래픽카드에도 들어갈 크기지만 8GB에서 직접 재지는 않았습니다. 100문제를 한 번에 묶어 보낼 때도 PyTorch가 잡은 양은 6.3GB였습니다.

윈도우에서 d1-3B를 돌리려면 어떻게 하나요?

안내대로 실행하면 flash attention 오류로 멈춥니다. 모델을 불러온 뒤 모델 코드의 _fused 함수가 항상 False를 돌려주게 바꾸거나, 가중치를 fp32로 올리면 돕니다. 앞의 방법이 VRAM을 절반만 씁니다. 바꾼 코드는 글 끝의 측정 스크립트에 있습니다.

한국어 서비스에 써도 되나요?

문의 종류 나누기나 주제 나누기처럼 답이 분명한 일은 이 글의 시험에서 한국어 100문제를 모두 맞혔습니다. 비꼬는 말은 높은 확신으로 틀렸으니, 고객 불만을 가려내는 일에는 실제 글로 먼저 시험해 보는 편이 좋습니다. 라이선스의 매출 조건도 확인하시기 바랍니다.

출처와 자료

관련 게시글

댓글 0개