Liquid AI가 10월 7일에 판단 전용 모델 d1-3B의 가중치를 공개했습니다. 판단 전용 모델은 글을 쓰지 않고, 주어진 보기 가운데 무엇이 맞는지를 확률로 답하는 모델입니다. 이 모델을 RTX 5060 Ti 16GB에서 직접 돌려 지난 글과 같은 한국어 144문제를 물었고, 같은 PC에서 Amazon의 Strands Decider 2B도 다시 쟀습니다. 결론부터 적으면 d1-3B는 쉬운 문제 100개를 한국어와 영어 모두 다 맞혔고, 답 하나에 0.06초로 Strands Decider 2B(0.17초)보다 3배 빨랐습니다.
- 쉬운 문제 100개: d1-3B는 한국어 100개, 영어 100개. Strands Decider 2B는 한국어 95개, 영어 95개를 맞혔습니다.
- 어려운 문제 44개(비꼼, 이중 부정, 계산): d1-3B는 한국어 34개, 영어 41개. Strands Decider 2B는 한국어 26개, 영어 37개였습니다.
- 답 하나에 걸린 시간은 d1-3B가 58ms, Strands Decider 2B가 173ms였습니다(중앙값).
- 모델이 쓴 VRAM은 d1-3B가 6.0GB, Strands Decider 2B가 3.7GB였습니다. 둘 다 16GB에 넉넉히 들어갑니다.
- d1-3B는 그림도 받습니다. 이 블로그가 만든 그림 4장에 한국어 질문 12개를 물었고 12개를 맞혔습니다.
- 윈도우에서는 그대로 돌지 않았습니다. 빠른 계산 부품이 윈도우용 PyTorch에 없어서, 모델 코드 안의 느린 대체 계산으로 돌렸습니다.
이 글의 숫자는 RTX 5060 Ti 16GB PC에서 2026년 10월 11일에 직접 잰 값입니다. 문제 144개와 정답은 113번 글에서 만든 것을 그대로 썼고, 글 끝에 파일 주소를 적었습니다.
이 글의 결과를 20초로 요약한 영상입니다(소리 없음).

두 모델을 같은 PC에서 같은 문제 144개로 비교한 결과입니다.
d1-3B는 어떤 모델인가
보통의 언어 모델은 질문을 받으면 글을 한 토큰씩 써 내려갑니다. 판단 전용 모델은 글을 쓰지 않습니다. 상황을 적은 글과 질문, 보기를 함께 넣으면 보기마다 확률을 돌려줍니다. 답이 정해진 모양으로만 나오고 한 번의 계산으로 끝납니다. 문의를 어느 팀에 넘길지, AI 에이전트가 어떤 도구를 부를지 같은 작은 결정에 씁니다. 자세한 설명은 Strands Decider 2B와 Clef-Flash 9B를 비교한 글에 있습니다.
| 항목 | d1-3B | Strands Decider 2B |
|---|---|---|
| 만든 곳 | Liquid AI | Amazon (AWS) |
| 공개한 날 | 2026년 10월 7일(발표 글) | 2026년 10월 1일 |
| 바탕 모델 | LFM2.5-VL-3B | Qwen3.5 2B |
| 파라미터 | 31억 2천만 개 | 약 19억 개 |
| 입력 | 글, 그림 | 글 |
| 컨텍스트 | 32,768토큰 | 모델 카드에서 확인하지 못함 |
| 받은 파일 | 6.27GB | 어댑터 0.09GB + 바탕 모델 4.57GB |
| 라이선스 | LFM Open License v1.0 | Apache 2.0 |
| 실행 방법 | 모델과 함께 받는 파이썬 코드(transformers 5.14 이상) | 파이썬 패키지 strands-decider 0.1.0 |
이 표가 뜻하는 것은, d1-3B는 Strands Decider 2B보다 조금 크고 그림까지 받는 모델이라는 점입니다. 모델 카드의 지원 언어 16개 가운데 한국어가 들어 있습니다. Strands Decider 2B의 안내에는 한국어 이야기가 없었습니다.
라이선스는 Apache 2.0이 아닙니다. LFM Open License v1.0은 연 매출이 1천만 달러를 넘는 회사의 상업적 사용을 허락하지 않습니다. 개인과 작은 회사는 상업적으로도 쓸 수 있습니다. 쓰기 전에 원문을 읽어 보시기 바랍니다.
질문은 세 종류이고, 두 모델이 같은 모양을 씁니다.
| 종류 | 묻는 것 | 돌려주는 것 |
|---|---|---|
| choice | 보기 가운데 하나 고르기 | 보기마다 확률 |
| noul | 예 또는 아니오 | '예'일 확률 |
| score | 낮음부터 높음까지의 단계 | 단계마다 확률과 기대 점수 |
실제 화면: 같은 질문 네 개를 두 모델에 물으면
터미널에서 두 모델에 같은 한국어 질문 네 개를 차례로 보낸 화면입니다. 왼쪽이 d1-3B, 오른쪽이 Strands Decider 2B입니다. 질문 네 개는 113번 글과 같습니다. 답 옆의 숫자는 그 질문 하나에 걸린 시간이고, 막대는 보기마다의 확률입니다.
두 모델에 같은 질문을 보낸 터미널 화면을 나란히 붙였습니다(7초, 소리 없음). 질문 사이의 쉬는 시간은 보기 편하게 넣은 것입니다.

d1-3B입니다. 위의 세 질문은 맞혔고, 비꼬는 말은 긍정으로 읽었습니다.

Strands Decider 2B입니다. 이중 부정과 비꼼을 틀렸습니다. 113번 글에서 RTX 5090으로 본 것과 같은 답입니다.
이 화면이 뜻하는 것은 두 가지입니다. "환불을 안 해 주시면 안 됩니다"를 d1-3B는 '환불을 원한다'로 읽었고 Strands Decider 2B는 반대로 읽었습니다. "참 친절한 고객센터군요"는 두 모델 모두 긍정이라고 답했습니다. 그리고 답 하나에 d1-3B는 62~73ms, Strands Decider 2B는 179~192ms가 걸렸습니다.
테스트 PC와 측정 방법
| 항목 | 내용 |
|---|---|
| 그래픽카드 | RTX 5060 Ti 16GB (드라이버 617.42) |
| CPU, 램 | Intel Core i5-9400F, 32GB |
| 운영체제 | Windows 11 Pro |
| 프로그램 | Python 3.12.10, PyTorch 2.11.0(CUDA 12.8), transformers 5.19.0, peft 0.21.2, strands-decider 0.1.0 |
| 정밀도 | 두 모델 모두 제작사 기본값(bfloat16), 양자화하지 않음 |
| 재는 방법 | 문제 하나에 질문 하나를 보내고, 답이 돌아올 때까지의 시간을 잼. 쉬운 문제는 100개를 5번(500번), 어려운 문제는 44개를 5번(220번) |
| 메모리 | VRAM은 모델을 올리기 전과 뒤의 차이. 시스템 램은 PC 전체 사용량 |
이 블로그는 평소 Unsloth Studio로 재지만, 판단 전용 모델은 글을 쓰는 모델이 아니라서 Unsloth Studio에 올릴 수 없습니다. 그래서 113번 글과 같은 방법으로, 따로 만든 파이썬 환경에서 제작사 코드로 돌렸습니다. 측정 스크립트도 113번 글의 것에 d1-3B만 더했습니다.
윈도우에서는 한 군데를 바꿔야 돌았다
d1-3B를 안내대로 돌리자 첫 질문에서 이런 오류로 멈췄습니다.
RuntimeError: USE_FLASH_ATTENTION was not enabled for build.
d1-3B의 코드는 그래픽카드에서 flash attention이라는 빠른 계산 부품을 직접 부릅니다. 윈도우용 PyTorch에는 이 부품이 빠져 있습니다. 모델 코드를 읽어 보니 CPU와 맥에서 쓰는 대체 계산이 따로 있었습니다. 그래서 측정 스크립트에서 그래픽카드도 그 대체 계산을 타게 바꿨습니다. 모델 파일과 가중치는 고치지 않았습니다. 바꾼 줄은 글 끝의 스크립트에 있습니다.
그래서 이 글의 d1-3B 시간은 리눅스에서 재는 것보다 느립니다. 제작사가 권하는 model.compile()도 윈도우에서는 실패했습니다(Cannot find a working triton installation). Strands Decider 2B도 113번 글에 적은 대로 윈도우에서 빠른 계산 부품 없이 돌았습니다.
받기 전에 d1-3B 저장소의 파이썬 파일 6개를 읽었습니다. 모델을 불러올 때 이 코드가 내 PC에서 실행되기 때문입니다(trust_remote_code=True). 네트워크에 접속하거나 다른 프로그램을 실행하는 부분은 없었습니다. 받는 버전은 읽어 본 커밋으로 고정했습니다.
쉬운 문제 100개: d1-3B는 200번을 모두 맞혔다
답이 분명한 문제 100개입니다. 한국어로 쓰고 같은 내용을 영어로도 썼습니다. 문의가 어느 팀 것인지, 글의 감정, 뉴스 제목의 주제, 긴급한 일인지, 어느 도구를 쓸지의 다섯 종류입니다.

맞힌 수와 문제 수입니다. 초록은 90% 이상, 노랑은 70% 이상입니다.
이 표가 뜻하는 것은, 답이 분명한 분류는 d1-3B가 한국어로도 빠짐없이 맞혔다는 점입니다. 113번 글에서 RTX 5090으로 잰 9B 모델 Clef-Flash와 같은 결과입니다. Strands Decider 2B의 95개는 RTX 5090에서 잰 것과 문제 하나까지 같았습니다.
차이는 '긴급한 일인가'에서 났습니다. Strands Decider 2B가 긴급하지 않다고 답한 "서버실에서 타는 냄새가 나고 연기가 보입니다", "지금 운영 서버 데이터베이스가 응답하지 않습니다" 같은 글을 d1-3B는 15개 모두 맞혔습니다. 맞힌 답의 평균 확신도는 95%였습니다.
어려운 문제 44개: 한국어 34개, 비꼬는 말을 못 읽었다
글자 그대로 읽으면 틀리는 문제 44개입니다. 맨 오른쪽 칸은 113번 글에서 RTX 5090으로 잰 Clef-Flash 9B의 한국어 결과입니다. 정답 수는 그래픽카드와 상관없으니 그대로 견줄 수 있습니다.

종류별로 맞힌 수입니다. 빨강은 70% 아래입니다.
이 표가 뜻하는 것은 세 가지입니다.
- d1-3B는 한국어 34개로, Strands Decider 2B(26개)와 Clef-Flash 9B(42개)의 가운데였습니다. 모델 크기 순서와 같습니다.
- d1-3B도 한국어가 영어보다 7개 적었습니다(34개 대 41개). Strands Decider 2B의 11개 차이보다는 작지만, 9B 모델처럼 차이가 없어지지는 않았습니다.
- 줄임말과 '보기에 맞는 것이 없을 때'는 한국어도 6개씩 다 맞혔습니다. "로긴이 안되는디요" 같은 글을 Strands Decider 2B는 틀렸고 d1-3B는 맞혔습니다.
d1-3B가 한국어에서 틀린 문제 10개
| 종류 | 글 | 정답 | d1-3B의 답 |
|---|---|---|---|
| 비꼼 | 배송이 3주나 걸리다니 정말 빠르네요. 대단합니다. | 부정 | 긍정 (확신 94%) |
| 비꼼 | 전화 연결까지 40분, 참 친절한 고객센터군요. | 부정 | 긍정 (확신 95%) |
| 비꼼 | 한 번 쓰고 고장 나다니, 품질이 아주 훌륭합니다. | 부정 | 긍정 (확신 92%) |
| 이중 부정 | 환불 받지 않겠다는 말은 한 적이 없습니다. 처리해 주세요. | 환불 원함 | 원하지 않음 (확신 79%) |
| 섞인 문의 | 앱 오류는 업데이트하니 고쳐졌습니다. 이제 남은 건 잘못 결제된 배송비를 취소하는 일입니다. | 결제 | 환불 (확신 52%) |
| 계산 | 3만 원짜리 두 개와 5만 원짜리 한 개를 주문했습니다. (총액이 10만 원을 넘는가) | 예 | 아니오 (확신 52%) |
| 계산 | 5만 원짜리 두 개에 배송비 3천 원이 붙었습니다. (같은 질문) | 예 | 아니오 (확신 64%) |
| 계산 | 1만 원짜리 열한 개를 주문했습니다. (같은 질문) | 예 | 아니오 (확신 59%) |
| 긴 글 | 약 1,800자 글 가운데 결제가 두 번 됐다는 한 문장 | 결제 | 환불 (확신 80%) |
| 긴 글 | 약 1,800자 글 가운데 계정 문제를 적은 한 문장 | 계정 | 기술 오류 (확신 52%) |
이 표가 뜻하는 것은, 틀린 문제가 두 무리로 나뉜다는 점입니다. 비꼬는 말 세 개는 92~95%의 확신으로 틀렸습니다. 나머지 일곱 개 가운데 다섯 개는 확신도가 52~64%였습니다. 거의 반반이라고 본 것입니다.
이 10개 가운데 9개는 Strands Decider 2B도 틀린 문제입니다. d1-3B만 틀린 것은 긴 글 하나였고, Strands Decider 2B만 틀린 문제는 9개였습니다. 영어로 물으면 d1-3B가 틀린 것은 비꼼 2개와 계산 1개뿐이었습니다.
확신도가 낮은 답만 다시 물으면
판단 전용 모델은 답과 함께 확신도를 줍니다. 확신도가 낮을 때만 큰 모델에게 다시 묻는 식으로 쓰라는 뜻입니다. 어려운 문제 44개(한국어)에서 d1-3B의 확신도를 세 구간으로 나눠 봤습니다.
| 확신도 | 답의 수 | 그중 틀린 답 |
|---|---|---|
| 90% 이상 | 27개 | 3개 (모두 비꼼) |
| 70% 이상 90% 미만 | 7개 | 2개 |
| 70% 미만 | 10개 | 5개 |
이 표가 뜻하는 것은, 확신도 70% 미만인 답 10개만 다시 물어도 틀린 10개 가운데 5개를 걸러 낼 수 있다는 점입니다. 다만 비꼬는 말은 확신도가 높아서 이 방법으로 걸러지지 않습니다. 문제 수가 적어서 구간마다의 비율은 참고로만 보시기 바랍니다.
속도와 메모리: 같은 PC에서 3배 차이

쉬운 문제 100개를 5번 돌린 값입니다.
| 항목 | Strands Decider 2B | d1-3B |
|---|---|---|
| 답 하나 평균 (한국어, 500번) | 174.7ms | 59.5ms |
| 중앙값 | 173.0ms | 57.7ms |
| 가장 짧은 값 ~ 가장 긴 값 | 160.7~247.3ms | 53.0~94.4ms |
| 95% 지점 | 190.8ms | 68.7ms |
| 5번 반복의 평균들 | 173.0~176.6ms | 59.0~60.5ms |
| 영어로 물었을 때 평균 | 174.2ms | 59.2ms |
| 어려운 문제 평균, 95% 지점 | 188.6ms, 269.1ms | 74.3ms, 178.9ms |
| 프로그램을 켠 뒤 첫 답 | 1.5초 | 18.4초 |
| 모델을 올리는 시간 | 10.5초 | 10.7초 |
| 모델이 쓴 VRAM | 3.7GB | 6.0GB |
| 시스템 램 증가 | 0.4GB | 0.3GB |
| 재는 동안 GPU 사용률, 전력 | 19%, 45W | 45%, 81W |
이 표가 뜻하는 것은 세 가지입니다.
- 더 큰 모델인 d1-3B가 3배 빨랐습니다. 5번 반복해도 59.0~60.5ms로 거의 같았습니다.
- d1-3B는 프로그램을 켠 뒤 첫 답에 18.4초가 걸렸습니다. 두 번째 답부터 0.06초입니다. 계속 켜 두고 쓰는 방식에 맞습니다.
- 한국어와 영어의 속도 차이는 없었습니다.
Strands Decider 2B는 왜 RTX 5090 때보다 3배 느렸나
Strands Decider 2B는 113번 글의 RTX 5090 PC에서 중앙값 53ms였습니다. 이 PC에서는 173ms입니다. 프로그램 버전은 같습니다. 그런데 재는 동안 GPU 사용률이 19%뿐이었습니다. 그래픽카드가 대부분 쉬고 있었다는 뜻입니다. 이 PC의 CPU는 2019년에 나온 6코어 i5-9400F이고, 113번 글의 PC는 Core Ultra 9 285K입니다. 그래픽카드보다 CPU에서 하는 준비 작업에 시간이 걸리는 것으로 보입니다(추정). 어디에서 시간이 걸리는지 나눠서 재지는 않았습니다.
d1-3B는 같은 CPU에서 58ms였습니다. 문제를 하나씩 보내는 쓰임새라면, 오래된 CPU에서는 모델 크기보다 실행 코드가 얼마나 가벼운지가 더 크게 작용했습니다.
질문을 묶어 보내면
두 모델 모두 글 하나에 질문 여러 개를 한 번에 물을 수 있습니다. 문의 글 25개에 "어느 팀인가, 긴급한가, 감정은 무엇인가" 세 가지를 한꺼번에 물었습니다.
| 모델 | 질문 1개 | 질문 3개를 한 번에 | 질문 하나당 |
|---|---|---|---|
| Strands Decider 2B | 174.8ms | 345.9ms | 115.3ms |
| d1-3B | 58.5ms | 81.2ms | 27.1ms |
이 표가 뜻하는 것은, d1-3B는 질문을 두 개 더 얹어도 23ms만 늘어난다는 점입니다. 글은 한 번만 읽고 질문만 따로 계산하기 때문입니다. Strands Decider 2B는 질문 3개에 시간이 2배가 됐습니다.
더 빠르게 쓰는 방법: 여러 문제를 한 묶음으로
d1-3B에는 서로 다른 글 여러 개를 한 번에 계산하는 기능(system_one_batch)이 있습니다. 한국어 쉬운 문제 100개를 묶음 크기만 바꿔 5번씩 돌렸습니다.

d1-3B가 1초에 처리한 문제 수입니다.
| 묶음 크기 | 100문제에 걸린 시간 | 문제 하나당 | 1초에 | 정답 |
|---|---|---|---|---|
| 하나씩 | 5.74~5.85초 | 57.9ms | 17문제 | 100 |
| 8개씩 | 1.44~1.46초 | 14.5ms | 69문제 | 100 |
| 32개씩 | 1.67~1.73초 | 17.0ms | 59문제 | 100 |
| 64개씩 | 1.68~1.73초 | 17.0ms | 59문제 | 100 |
| 100개 한 번에 | 1.67~1.70초 | 16.9ms | 59문제 | 100 |
이 표가 뜻하는 것은, 8개씩만 묶어도 4배 빨라진다는 점입니다. 그보다 크게 묶어도 더 빨라지지 않았습니다. 정답은 묶음 크기와 상관없이 100개였고, 하나씩 보낼 때와 답이 모두 같았습니다. 쌓아 둔 글을 한꺼번에 분류하는 일이라면 묶어서 보내는 편이 좋습니다.
가중치를 fp32로 올리면
윈도우에서 코드를 바꾸지 않고 돌리는 방법이 하나 더 있습니다. 가중치를 반 정밀도(bfloat16) 대신 fp32로 올리면 d1-3B가 스스로 대체 계산을 탑니다. 같은 문제로 재 봤습니다.
| 항목 | bfloat16 (이 글의 기준) | fp32 |
|---|---|---|
| 정답 (쉬운 한국어 / 어려운 한국어) | 100 / 34 | 100 / 34 |
| 답 하나 평균 (쉬운 문제, 한국어) | 59.5ms | 70.0ms |
| 어려운 문제 95% 지점 | 178.9ms | 465.7ms |
| 모델이 쓴 VRAM | 6.0GB | 11.9GB |
| GPU 전력 | 81W | 149W |
이 표가 뜻하는 것은, fp32는 정답이 같고 VRAM과 전력만 두 배 가까이 든다는 점입니다. 긴 글에서는 2.6배 느렸습니다. 16GB 그래픽카드에는 들어가지만 쓸 이유가 없습니다.
그림을 보고 답하기: 12개 중 12개
d1-3B는 그림도 받습니다. 이 블로그가 만든 그림 4장(대표 이미지로 만든 사진, 제목 카드의 막대 그래프, 프로그램 화면 캡처, 표 그림)에 한국어 질문 12개를 물었습니다.

그림마다 물은 질문과 결과입니다.
| 그림 | 크기 | 입력 토큰 | 질문 하나 | 맞힌 수 |
|---|---|---|---|---|
| 모래시계 사진 | 1024×1024 | 약 1,330 | 408ms | 3 / 3 |
| 막대 그래프(제목 카드) | 1600×832 | 약 800 | 275ms | 4 / 4 |
| 프로그램 화면 캡처 | 977×333 | 약 290 | 102ms | 3 / 3 |
| 표 그림 | 2400×1398 | 약 1,820 | 668ms | 2 / 2 |
이 표가 뜻하는 것은 두 가지입니다. 그림 속의 숫자와 글자를 읽어야 하는 질문("그림에 197.5라는 숫자가 적혀 있습니까", "화면 아래에 적힌 속도는 얼마입니까")도 맞혔습니다. 그리고 그림이 클수록 시간이 늘었습니다. 글만 물을 때는 58ms였는데 그림은 0.1~0.7초입니다. 질문 12개는 수가 적어서, 그림 판단을 믿을 수 있다는 근거로 삼기에는 모자랍니다.
단계 점수(score) 질문도 물어봤습니다. 글 9개에 "이 일은 얼마나 급합니까"를 세 단계(기다려도 됨, 오늘 안에, 지금 바로)로 물었고, 9개 모두 정한 단계가 가장 높은 확률로 나왔습니다.
다른 곳의 측정과 견주면
d1-3B를 따로 재 본 다른 글은 찾지 못했습니다. 공개된 지 나흘밖에 되지 않아, 지금 있는 숫자는 모두 제작사가 잰 것입니다.
| 측정 | 질문 하나 | 질문 3개를 한 번에 | 그림 하나 | 64개 묶음 | 조건 |
|---|---|---|---|---|---|
| 이 글 | 58ms | 81ms | 102~668ms | 59문제/초 | RTX 5060 Ti, 윈도우, 대체 계산, 한국어, 그림 크기 977×333~2400×1398 |
| Liquid AI (모델 카드) | 8ms (compile 없이 16ms) | 21ms | 17ms | 475문제/초 | RTX 4090, flash attention, compile 사용, 그림 384px |
| Liquid AI (모델 카드) | 50ms | 73ms | 202ms | 38문제/초 | NVIDIA Jetson Orin Nano |
이 표가 뜻하는 것은, 이 글의 값이 제작사의 RTX 4090 값보다 3.6~8배 느리고, 작은 기기인 Jetson Orin Nano와 비슷한 수준이라는 점입니다. 그래픽카드 차이도 있지만, 윈도우에서 flash attention과 compile을 쓰지 못한 것이 더 큰 이유로 보입니다(추정). 리눅스에서 재면 얼마나 줄어드는지는 확인하지 못했습니다.
정확도는 제작사가 Decision Index 0.2.1에서 48.57점이라고 적었습니다. 영어 중심의 시험이고 제작사가 직접 채점한 값입니다. 한국어로 잰 다른 측정은 찾지 못했습니다.
정리
- d1-3B는 16GB 그래픽카드에서 VRAM 6.0GB로 돌았습니다. 답 하나에 0.06초, 8개씩 묶으면 1초에 69문제입니다.
- 답이 분명한 분류는 한국어 100문제를 모두 맞혔습니다. 2B 모델이 놓친 '긴급한 일인가'도 다 맞혔습니다.
- 어려운 문제는 한국어 44개 중 34개였습니다. 비꼬는 말은 높은 확신으로 틀리고, 계산이 필요한 판단은 반반으로 헷갈렸습니다.
- 같은 PC에서 Strands Decider 2B보다 정답도 많고 3배 빨랐습니다. VRAM은 2.3GB 더 씁니다.
- 그림 속 글자와 숫자를 읽는 질문도 한국어로 맞혔습니다. 시간은 그림 크기에 따라 0.1~0.7초입니다.
- 윈도우에서는 안내대로만 해서는 돌지 않습니다. 대체 계산으로 돌리면 되지만 제작사가 적은 속도는 나오지 않습니다.
내 그래픽카드에 어떤 모델이 들어가는지는 GPU 체험에서 볼 수 있습니다. 같은 PC에서 잰 작은 언어 모델의 속도는 Gemma 4 E2B 글에 있습니다. 판단 전용 모델이 처음 나왔을 때의 이야기는 pplx-decider 글에 적었습니다.
이 글의 한계
- 문제 144개는 113번 글에서 직접 만든 것입니다. 수가 적고, 만든 사람의 기준이 들어가 있습니다. 어려운 문제는 종류마다 6~8개뿐이라 한두 문제에 비율이 크게 바뀝니다.
- 정답률은 한 번 잰 값입니다. 이 모델들은 같은 입력에 같은 답을 내서, 반복해도 정답 수는 바뀌지 않습니다.
- d1-3B는 윈도우에서 flash attention 없이 대체 계산으로 쟀습니다. 리눅스나 WSL에서는 재지 않았습니다. compile은 실패해서 재지 못했습니다.
- d1-3B는 llama.cpp로도 돌릴 수 있다고 제작사가 밝혔지만 시도하지 않았습니다. 양자화한 파일도 재지 않았습니다.
- CPU만으로 돌리는 측정은 끝내지 못했습니다. 한국어 100문제를 2번 돌린 데까지는 100개 정답에 답 하나 중앙값 5.6초(i5-9400F)였습니다. 20분이 넘어 멈췄고 결과 파일은 남지 않았습니다. 이 CPU에서는 쓰기 어려운 속도입니다.
- Clef-Flash 9B는 VRAM 18.3GB를 써서 이 PC에서 재지 못했습니다. 글에 적은 Clef-Flash 9B의 값은 113번 글에서 RTX 5090으로 잰 것입니다.
- Strands Decider 2B가 이 PC에서 느린 이유는 추정입니다. 단계별로 나눠 재지 않았습니다.
- 그림 질문 12개와 단계 점수 질문 9개는 수가 적습니다. 그림 4장은 모두 이 블로그가 만든 것이라 종류가 한쪽으로 치우쳐 있습니다.
- 함께 공개된 d1-omni-600M(글, 그림, 소리)은 재지 않았습니다.
- 같은 문제를 일반 언어 모델에게 물었을 때와 견주지 않았습니다.
- 2026년 10월 11일 기준입니다.
자주 묻는 질문
d1-3B는 VRAM이 얼마나 필요한가요?
이 글의 측정에서 모델이 쓴 VRAM은 6.0GB였습니다(bfloat16). 8GB 그래픽카드에도 들어갈 크기지만 8GB에서 직접 재지는 않았습니다. 100문제를 한 번에 묶어 보낼 때도 PyTorch가 잡은 양은 6.3GB였습니다.
윈도우에서 d1-3B를 돌리려면 어떻게 하나요?
안내대로 실행하면 flash attention 오류로 멈춥니다. 모델을 불러온 뒤 모델 코드의 _fused 함수가 항상 False를 돌려주게 바꾸거나, 가중치를 fp32로 올리면 돕니다. 앞의 방법이 VRAM을 절반만 씁니다. 바꾼 코드는 글 끝의 측정 스크립트에 있습니다.
한국어 서비스에 써도 되나요?
문의 종류 나누기나 주제 나누기처럼 답이 분명한 일은 이 글의 시험에서 한국어 100문제를 모두 맞혔습니다. 비꼬는 말은 높은 확신으로 틀렸으니, 고객 불만을 가려내는 일에는 실제 글로 먼저 시험해 보는 편이 좋습니다. 라이선스의 매출 조건도 확인하시기 바랍니다.
출처와 자료
- 모델: LiquidAI/d1-3B, StrandsAgents/strands-decider-2B-hobson-v19 (Hugging Face)
- Liquid AI 블로그: Open d1: Edge decision models for text, vision, and audio
- 이 글의 문제 144개와 정답: decider-testset.json (한국어와 영어, JSON 파일)
- 측정 스크립트: bench_decider.py (윈도우에서 바꾼 부분 포함)
댓글 0개