[RTX 5060 Ti 16GB] 로컬 AI 코딩 모델 Qwen3-Coder 30B A3B, 16GB에서 얼마나 빠를까, 기본값 145t/s인데 컨텍스트를 늘리자 절반이 됐다
RTX 5060 Ti 16GB의 Unsloth Studio에서 Qwen3-Coder 30B A3B(UD-Q3_K_XL)를 돌렸습니다. 기본값은 초당 약 145토큰, 컨텍스트 32,768에서는 약 69토큰이었고 KV 캐시를 줄이면 116토큰이 됩니다. 파이썬 문제 결과도 담았습니다.