Anthropic이 2026년 10월 7일 가장 작은 Claude 모델의 새 판 Claude Haiku 5.5를 냈습니다. 가장 큰 변화는 가격입니다. 프롬프트가 10만 토큰 이하일 때 입력 100만 토큰에 0.10달러, 출력 0.50달러로, 이전 모델 Haiku 4.5(1달러, 5달러)의 10분의 1입니다. 다만 프롬프트가 10만 토큰을 넘으면 값이 다섯 배가 되는 규칙이 함께 생겼습니다.
- 가격: 10만 토큰 이하 요청은 입력 0.10달러, 출력 0.50달러. 10만 토큰을 넘는 요청은 0.50달러, 2.50달러입니다(100만 토큰당).
- Anthropic의 설명: Haiku 4.5와 견줘 평균 실행 비용이 약 75% 줄었다고 밝혔습니다.
- GPT-6 Luna와 같은 값: 10만 토큰 이하의 가격이 OpenAI의 GPT-6 Luna와 똑같습니다.
- 시험 점수(Anthropic 발표): Haiku 4.5보다 크게 올랐고 GPT-6 Luna보다 높습니다. Sonnet 5.5에는 못 미칩니다.
- 직접 계산한 것: 자료 2만 토큰을 읽고 5천 토큰을 쓰는 일을 1,000번 시키면 4.5달러입니다. Haiku 4.5로는 45달러였습니다.
이 글은 Anthropic의 발표문과 개발 문서의 가격표를 직접 읽고 정리했습니다. 시험 점수는 Anthropic이 잰 값이고, 비용 계산과 로컬 AI 전기요금 비교는 이 블로그가 계산한 것입니다. 모델을 직접 돌려 재지는 않았습니다.
이 글의 내용을 20초로 요약한 영상입니다(소리 없음).

Anthropic의 발표문과 개발 문서에서 가져온 값입니다.
Haiku 5.5는 무엇인가
Claude에는 크기가 다른 모델이 여럿 있습니다. 큰 것부터 Fable, Opus, Sonnet, Haiku 순서이고, Haiku가 가장 작고 빠르고 쌉니다. Anthropic은 이번 모델을 이렇게 소개했습니다.
“the cheapest, fastest, and most capable small model we've ever released”
Anthropic, Introducing Claude Haiku 5.5 (2026년 10월 7일)
쉽게 말하면 지금까지 낸 작은 모델 가운데 가장 싸고, 가장 빠르고, 가장 잘한다는 뜻입니다. Anthropic이 이 모델에 맞다고 든 일은 두 종류입니다.
- 양이 많고 값이 중요한 일: 요약, 긴 대화 줄이기, 데이터베이스 질의, 분류, 빠른 조회, 큰 모델이 시키는 작은 심부름(서브에이전트)
- 빨리 답해야 하는 일: 실시간 고객 상담, 브라우저 조작
예를 들면 이렇습니다. 코딩 도구가 큰 모델(Opus 5.5)로 설계를 하고, 파일 찾기나 로그 요약 같은 잔일은 Haiku 5.5에 맡기는 식입니다. Anthropic도 코딩에서는 Opus 5.5나 Sonnet 5.5 옆에서 보조로 쓰는 것을 권했습니다.
| 항목 | 내용 |
|---|---|
| 나온 날 | 2026년 10월 7일 |
| API 이름 | claude-haiku-5-5 |
| 쓸 수 있는 곳 | Claude API, Amazon Web Services, Google Cloud, Microsoft Azure |
| 한 번에 넣는 길이 | 100만 토큰 |
| 최대 출력 | 12만 8천 토큰 |
| 생각 수준(effort) | 조절 가능. 기본값 medium |
| 지식 기준 시점 | 2026년 6월 |
이 표가 뜻하는 것: 크기는 가장 작지만 한 번에 넣을 수 있는 길이와 최대 출력은 큰 모델과 같습니다. 발표문에는 Claude 앱(대화 화면)에서 쓸 수 있는지는 적혀 있지 않았습니다.
가격: Haiku 4.5의 10분의 1, GPT-6 Luna와 같은 값

공식 가격표를 한 표에 모았습니다.
| 모델 | 입력 | 출력 | 캐시 읽기 |
|---|---|---|---|
| Claude Haiku 5.5 (프롬프트 10만 토큰 이하) | $0.10 | $0.50 | $0.01 |
| Claude Haiku 5.5 (프롬프트 10만 토큰 초과) | $0.50 | $2.50 | $0.05 |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 |
| GPT-6 Luna | $0.10 | $0.50 | $0.01 |
| Claude Sonnet 5.5 | $2.00 | $10.00 | $0.10 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 |
이 표가 뜻하는 것: 100만 토큰당 미국 달러입니다. 짧은 요청에서는 Haiku 4.5의 정확히 10분의 1이고, 지난달 나온 GPT-6 Luna와 입력, 출력, 캐시 읽기가 모두 같습니다. 두 회사의 가장 작은 모델이 같은 값이 됐습니다.
일괄 처리(Batch API)로 보내면 여기서 절반이 됩니다. 급하지 않은 요청을 모아서 보내는 방식이고, 10만 토큰 이하 요청은 입력 0.05달러, 출력 0.25달러입니다.
"평균 75% 감소"는 어떻게 나온 숫자인가
토큰 값은 90% 내렸는데 Anthropic은 왜 75%라고 했을까요. 발표문의 주석에 따르면 두 가지를 함께 넣은 숫자입니다.
- 요청 길이: 10만 토큰 이하 요청은 90% 내렸고, 넘는 요청은 50% 내렸습니다. Haiku 4.5로 온 요청의 약 90%가 10만 토큰 이하였다고 합니다.
- 토큰 세는 방식: Haiku 5.5는 글을 토큰으로 자르는 방식이 새것으로 바뀌어, 같은 일에 토큰을 조금 더 씁니다.
둘째가 눈여겨볼 부분입니다. 개발 문서는 새 방식이 같은 글에서 토큰을 약 30% 더 만든다고 적었습니다. 그대로 계산하면 값이 10분의 1이 돼도 실제로 내는 돈은 0.1 × 1.3 = 0.13배, 곧 87% 감소입니다. 한국어 글에서 토큰이 얼마나 늘어나는지는 문서에 없고, 이 글에서도 재지 않았습니다.
같은 일을 시키면 얼마일까
가격표만으로는 감이 오지 않아서 예를 하나 계산했습니다. 지난 API 가격 비교 글과 같은 조건입니다. 참고 자료 2만 토큰을 읽고 결과 5천 토큰을 쓰는 일을 1,000번 시킵니다.

토큰 가격만으로 계산한 값입니다.
| 모델 | 한 번 | 1,000번 |
|---|---|---|
| Claude Haiku 5.5 | $0.0045 | $4.50 |
| GPT-6 Luna | $0.0045 | $4.50 |
| Claude Haiku 4.5 | $0.045 | $45 |
| Claude Sonnet 5.5 | $0.09 | $90 |
| GPT-6 Sol | $0.09 | $90 |
| Claude Opus 5.5 | $0.18 | $180 |
이 표가 뜻하는 것: 계산은 (2만 × 입력 값 + 5천 × 출력 값) ÷ 100만입니다. Haiku 5.5는 2만 × 0.10 + 5천 × 0.50 = 4,500, 곧 한 번에 0.0045달러입니다. 같은 일을 Opus 5.5로 하면 40배가 듭니다.
이 계산은 토큰 수가 같다고 본 값입니다. 실제로는 모델마다 같은 일에 쓰는 토큰이 다르고, 캐시를 쓰면 더 싸집니다. 그리고 싼 모델이 그 일을 제대로 해내는지는 따로 확인해야 합니다.
10만 토큰 경계: 넘으면 값이 다섯 배
이번 가격에서 가장 조심할 부분입니다. 개발 문서는 Haiku 5.5가 프롬프트 길이에 따라 값이 달라진다고 적었습니다. 프롬프트가 10만 토큰을 넘는 요청은 입력 0.50달러, 출력 2.50달러로 계산됩니다. 다른 Claude 모델에는 이런 규칙이 없습니다. Opus 5.5나 Sonnet 5.5는 90만 토큰짜리 요청도 9천 토큰짜리와 토큰당 값이 같습니다.

프롬프트가 10만 토큰을 넘을 때 입력 요금이 어떻게 달라지는지입니다.
| 프롬프트 길이 | Haiku 5.5 입력 요금 | Haiku 4.5 입력 요금 |
|---|---|---|
| 9만 토큰 | $0.009 | $0.09 |
| 11만 토큰 | $0.055 | $0.11 |
이 표가 뜻하는 것: 프롬프트가 9만에서 11만 토큰으로 22% 늘었는데 입력 요금은 약 6.1배가 됩니다. 그래도 Haiku 4.5의 절반이니 손해는 아닙니다. 다만 10만 토큰 바로 위에 걸리는 요청이 많다면 프롬프트를 줄이는 것만으로 비용이 크게 달라집니다.
예를 들어 긴 문서를 통째로 넣어 요약시키는 서비스라면, 문서를 10만 토큰 아래로 나눠 보내는 쪽이 쌉니다. 긴 대화가 쌓이는 상담 봇이라면 대화가 10만 토큰에 가까워지기 전에 앞부분을 요약해 줄이는 것이 좋습니다.
높은 값이 요청 전체에 적용되는지, 10만 토큰을 넘는 부분에만 적용되는지는 가격표 문구만으로는 분명하지 않습니다. 문서는 "10만 토큰을 넘는 프롬프트는 더 높은 값을 낸다"고만 적었습니다. 위 계산은 요청 전체에 적용된다고 읽고 한 것입니다.
시험 점수: Haiku 4.5보다 크게 올랐고, Sonnet 5.5에는 못 미친다
아래는 모두 Anthropic이 발표문에 실은 값입니다. 이 블로그가 잰 값이 아닙니다.

Anthropic 발표문의 표를 옮겼습니다. 숫자가 클수록 좋습니다.
| 시험 | 무엇을 보나 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|---|
| GDPval-AA v2.1 | 사무·지식 업무 | 1620 | 735 | 1437 | 1840 |
| OSWorld 2.1 | 컴퓨터 조작 | 72.4% | 15.7% | 48.9% | 83.9% |
| Terminal-Bench 4.0 | 터미널에서 하는 코딩 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 | 코딩 | 46.4% | 값 없음 | 42.4% | 52.1% |
| Chartography | 그래프 읽기 | 46.4% | 6.4% | 29.1% | 61.6% |
이 표가 뜻하는 것은 세 가지입니다.
- Haiku 4.5와의 차이가 큽니다. 컴퓨터를 조작하는 시험(OSWorld)이 15.7%에서 72.4%로, 터미널 코딩 시험이 0.0%에서 39.2%로 올랐습니다.
- 같은 값인 GPT-6 Luna보다 모든 칸에서 높습니다. 다만 Anthropic이 고른 시험이고 Anthropic이 잰 값이라는 점은 감안해야 합니다.
- Sonnet 5.5에는 못 미칩니다. 터미널 코딩은 39.2%와 70.6%로 차이가 큽니다. Anthropic도 복잡한 코딩 작업은 Sonnet 5.5나 Opus 5.5가 여전히 더 낫다고 적었습니다.
Haiku 가운데 처음으로 생각 수준(effort)을 고를 수 있게 된 것도 달라진 점입니다. 낮게 두면 빠르고 싸게, 높게 두면 더 오래 생각하고 더 잘 답합니다. 기본값은 medium입니다. 수준별 점수는 발표문에 그림으로만 있고 숫자는 적혀 있지 않았습니다.
발표문에는 먼저 써 본 회사들의 말도 실렸습니다. Box는 Haiku 4.5보다 점수가 11점 높고 응답 시간은 절반쯤이었다고 했고, Asana는 지금 쓰는 모델보다 응답 시간이 30% 넘게 줄었다고 했습니다. 각 회사가 자기 서비스에서 잰 값입니다.
로컬 AI를 쓰는 사람에게는
이 블로그는 주로 내 PC에서 돌리는 AI를 다룹니다. API 값이 이만큼 내려가면 "굳이 집에서 돌릴 까닭이 있나"라는 질문이 나옵니다. 그래서 이 블로그가 잰 전력 값으로 견줘 봤습니다.

API의 출력 요금과, 집에서 돌릴 때 그래픽카드가 쓰는 전기요금만 견준 값입니다.
| 방법 | 글 100만 토큰 | 걸리는 시간 | 근거 |
|---|---|---|---|
| Claude Haiku 5.5 API | 약 700원 | 재지 않음 | 출력 0.50달러, 1달러 1,400원으로 어림 |
| Gemma 4 26B A4B QAT, RTX 5060 Ti 16GB | 약 25~64원 | 약 3.0시간 | 토큰 하나에 0.75J, 초당 94토큰 (109번 글) |
| Qwen3.6 35B A3B, RTX 5060 Ti 16GB | 약 37~94원 | 약 3.1시간 | 토큰 하나에 1.1J, 초당 90.4토큰 (110번 글) |
이 표가 뜻하는 것: 계산은 이렇게 했습니다. 토큰 하나에 0.75J이면 100만 토큰에 75만 J, 곧 0.208kWh입니다. 주택용 전력량요금 1kWh당 120~307.3원(누진 1~3단계)을 곱하면 25~64원입니다.
전기요금만 보면 집에서 돌리는 쪽이 여전히 10분의 1쯤입니다. 그런데 이 비교에는 빠진 것이 많습니다.
- 그래픽카드 전기만 넣었습니다. CPU와 나머지 부품이 쓰는 전기, 그래픽카드를 사는 값은 뺐습니다.
- 시간이 다릅니다. 집에서는 100만 토큰에 3시간쯤 걸리고 그동안 PC를 쓰기 어렵습니다. API는 여러 요청을 한꺼번에 보낼 수 있습니다.
- 모델의 수준이 다릅니다. 16GB 그래픽카드에 올라가는 공개 모델과 Haiku 5.5를 같은 문제로 견줘 본 값은 이 글에 없습니다.
- 입력 요금은 뺐습니다. API는 읽는 글에도 돈을 내고, 로컬은 긴 글을 읽는 데 시간이 듭니다.
정리하면 글 100만 토큰을 만드는 데 드는 돈의 차이는 몇백 원입니다. 로컬 AI를 쓰는 까닭은 값보다 자료를 밖으로 보내지 않는다는 점, 인터넷 없이 된다는 점, 쓰는 양에 제한이 없다는 점 쪽에 더 남습니다. 문의 분류처럼 작은 판단을 아주 빠르게 해야 하는 일이라면 0.06초에 답하는 판단 전용 모델처럼 다른 길도 있습니다.
함께 바뀐 것
- Sonnet 5.5의 캐시 읽기 값이 절반으로 내렸습니다. 100만 토큰당 0.20달러에서 0.10달러입니다. Anthropic은 에이전트 작업 대부분에서 약 20% 싸진다고 설명했습니다. Sonnet 5.5 글에 적은 0.20달러는 출시 때의 값입니다.
- 구독자에게 매달 API 크레딧을 줍니다. Max 5x는 100달러, Max 20x는 200달러, Team은 최대 500달러(함께 씀)이고, 이번 주부터 차례로 적용된다고 합니다.
- 보안 관련 제한: 사이버 보안 쪽 제한이 Haiku 4.5보다 엄격해졌고, Sonnet 5.5보다는 느슨합니다. 방어 목적의 작업은 더 넓게 허용하지만 침투 테스트는 막는다고 적었습니다.
정리
- 가격이 핵심입니다. 짧은 요청은 Haiku 4.5의 10분의 1이고 GPT-6 Luna와 같습니다.
- 프롬프트를 10만 토큰 아래로 두세요. 넘으면 값이 다섯 배입니다. 긴 문서는 나눠 보내고, 긴 대화는 미리 줄이는 편이 쌉니다.
- 토큰이 조금 더 듭니다. 값은 90% 내렸지만 토큰 세는 방식이 바뀌어 실제 절감은 그보다 작습니다. Anthropic이 밝힌 평균은 약 75%입니다.
- 어려운 코딩은 큰 모델에. 시험 점수는 Haiku 4.5보다 크게 올랐지만 Sonnet 5.5와는 차이가 있습니다. 요약, 분류, 조회, 큰 모델의 보조에 맞습니다.
- 로컬 AI와의 값 차이는 작아졌습니다. 집에서 돌릴 까닭은 값보다 자료 보호와 자유로운 사용 쪽에 있습니다.
이 글의 한계
- 모델을 직접 돌려 보지 않았습니다. 속도, 한국어 품질, 한국어 글에서 토큰이 얼마나 늘어나는지는 재지 않았습니다.
- 시험 점수는 Anthropic이 잰 값입니다. 다른 곳에서 잰 값과 견주지 못했습니다.
- 비용 계산은 토큰 가격만으로 한 것입니다. 모델마다 같은 일에 쓰는 토큰이 달라 실제 금액은 달라집니다.
- 10만 토큰 규칙의 세부(요청 전체에 적용되는지)는 가격표 문구로만 읽었습니다.
- 전기요금 비교는 그래픽카드 전기만 넣은 어림이고, 환율 1달러 1,400원은 계산을 위해 정한 값입니다.
- 가격과 조건은 2026년 10월 9일에 확인한 내용입니다. 바뀔 수 있습니다.
자주 묻는 질문
Claude Haiku 5.5의 가격은 얼마인가요?
프롬프트가 10만 토큰 이하면 입력 100만 토큰에 0.10달러, 출력 0.50달러입니다. 10만 토큰을 넘으면 0.50달러, 2.50달러입니다. 일괄 처리로 보내면 절반입니다.
Haiku 4.5를 쓰고 있는데 바꿔야 하나요?
값이 크게 내렸고 Anthropic이 발표한 시험 점수도 모든 칸에서 올랐습니다. 다만 토큰 세는 방식이 달라져 같은 글의 토큰 수가 늘고, 프롬프트가 10만 토큰을 넘는 요청은 값이 따로 매겨집니다. 바꾸기 전에 자기 서비스의 요청 길이를 먼저 확인하는 것이 좋습니다. Anthropic은 옮기는 방법을 안내하는 문서를 함께 냈습니다.
GPT-6 Luna와 무엇이 다른가요?
10만 토큰 이하 요청의 값은 같습니다. Anthropic이 발표한 시험에서는 Haiku 5.5가 더 높게 나왔습니다. 두 모델을 같은 문제로 직접 견준 값은 이 글에 없습니다.
코딩에 써도 되나요?
간단한 작업이나 큰 모델의 보조로는 맞습니다. 터미널에서 여러 단계를 거치는 복잡한 코딩 시험에서는 39.2%로, Sonnet 5.5(70.6%)와 차이가 컸습니다.
출처
- Anthropic 발표문: Introducing Claude Haiku 5.5 (2026년 10월 7일)
- Claude 개발 문서: 가격표, 모델 표 (2026년 10월 9일 확인)
- GPT-6 Luna·Sol 가격: 이 블로그의 API 가격 비교 글
- 로컬 AI 전력 측정: 이 블로그의 Gemma 4 26B 글, Qwen3.6 35B 글
댓글 0개