[RTX 5060 Ti 16GB] OpenAI의 gpt-oss 20B를 16GB에서 돌리면, 컨텍스트 10만에서도 초당 120토큰이 나왔다
RTX 5060 Ti 16GB의 Unsloth Studio에서 OpenAI의 gpt-oss 20B(UD-Q4_K_XL 11.06GB)를 기본값으로 돌렸습니다. 초당 약 120토큰, 컨텍스트 65,536까지 같은 속도였고, 생각 단계에 따라 시간과 코딩 결과가 크게 달랐습니다.
EVUELA AI LAB에서 원하는 정보를 찾아보세요
"gpt-oss" 검색 결과 2건
RTX 5060 Ti 16GB의 Unsloth Studio에서 OpenAI의 gpt-oss 20B(UD-Q4_K_XL 11.06GB)를 기본값으로 돌렸습니다. 초당 약 120토큰, 컨텍스트 65,536까지 같은 속도였고, 생각 단계에 따라 시간과 코딩 결과가 크게 달랐습니다.
Tools
Local LLM을 실행할 수 있게 해주는 LM Studio를 설치해서 내 PC에서 AI 사용해보자