[RTX 5060 Ti 16GB] 16GB 그래픽카드에서 Gemma 4 26B는 얼마나 빠를까, Unsloth Studio 기본값으로 초당 94토큰이었다
RTX 5060 Ti 16GB의 Unsloth Studio에서 Gemma 4 26B A4B QAT를 기본값으로 돌렸습니다. 초당 약 94토큰, VRAM 14.1GB였습니다. 컨텍스트별 속도, 산수·코딩 결과, Gemma 4 12B와의 비교를 담았습니다.
EVUELA AI LAB에서 원하는 정보를 찾아보세요
"구글" 검색 결과 6건
RTX 5060 Ti 16GB의 Unsloth Studio에서 Gemma 4 26B A4B QAT를 기본값으로 돌렸습니다. 초당 약 94토큰, VRAM 14.1GB였습니다. 컨텍스트별 속도, 산수·코딩 결과, Gemma 4 12B와의 비교를 담았습니다.
구글이 새 최고 모델 Gemini 4 Argon을 발표했습니다. 출력 한도가 6만 4천 토큰에서 100만 토큰으로 늘었고, 도입 가격은 100만 토큰당 입력 2달러, 출력 10달러입니다. 하지만 지금은 정부·병원·통신사 같은 보안 담당 기관 650여 곳만 쓸 수 있습니다. 공식 발표문으로 출력 100만 토큰이 한글로 얼마나 되는지, 왜 순서를 나눠 공개하는지, 구글이 밝힌 시험 점수와 가격을 정리했습니다.
RTX 5060 Ti 16GB PC의 LM Studio에서 Gemma 4 26B A4B QAT(15.63GB)를 기본 설정 그대로 돌려 봤습니다. 모델은 로드됐지만 일부가 시스템 램에 남아, 답을 만드는 동안 CPU는 96%, GPU는 29%였습니다. 생성 속도는 약 21t/s로 같은 PC의 Gemma 4 12B의 절반이었습니다.
RTX 5060 Ti 16GB PC의 LM Studio에서 Gemma 4 12B QAT를 기본 설정 그대로 돌려 본 실측 기록입니다. 초당 약 44토큰, VRAM 약 8.6GB였고, 생각 기능을 끄면 산수를 5번 모두 틀렸습니다. 같은 방법으로 잰 RTX 5090 결과와 함께 비교합니다.
RTX 5090 PC의 LM Studio에서 Gemma 4 12B QAT(Q4_0)를 기본 설정으로 직접 돌린 기록입니다. PC 사양, LM Studio 기본 설정값, 생성 속도, 컨텍스트별 VRAM, 긴 글 요약, 생각 기능 켬·끔 비교, 이미지 입력까지 캡처와 실측값으로 정리했습니다.
AI 뉴스
2026년 9월 22일 함께 나온 GPT-6 Sol·Luna, Claude Opus 5.5, Solar Mini 4와 Gemini 3.8 Flash의 API 가격을 공식 자료 기준으로 한 표에 모았습니다. 같은 작업 1,000회 비용 계산과 할인·인상 날짜, 로컬 GPU 실측 속도도 함께 비교합니다.