Claude Haiku 5.5 가격과 쓰임새: 맡길 일, 쓰지 말 곳, 서브에이전트 설정
Claude Haiku 5.5(클로드 하이쿠)는 요약·분류·서브에이전트용 작은 모델입니다. 프롬프트 100k 이하 입력 $0.10·출력 $0.50 가격과 effort, Claude Code에서 서브에이전트를 Haiku로 돌리는 설정, 대량 분류 비용 계산법을 공식 문서로 정리했습니다.

Claude Haiku 5.5(클로드 하이쿠 5.5)는 Anthropic이 2026년 10월 7일에 내놓은 대량·반복 작업용 작은 모델입니다. 새 모델이 나오면 보통 "얼마나 똑똑해졌나"부터 보지만, 이 모델은 "어디에 넣으면 건당 비용이 내려가나"로 보는 편이 맞는 것 같아요. 이 글에서는 발표가 꼽은 용도와 쓰지 말 곳, 가격과 effort, Claude Code에서 서브에이전트를 Haiku로 돌리는 설정, API로 대량 분류할 때의 비용 계산을 차례로 봅니다.
저는 9월 말부터 제 작업을 Claude Opus 5.5 하나로 통일해서 씁니다(Opus 5.5 effort 설정 글). 그런데도 Haiku 5.5를 따로 보는 건 제가 만드는 레퍼런스 정리 서비스 refs에서 저장한 글마다 모델이 한 번씩 돌기 때문이에요. 이런 일은 한 건의 품질 못지않게 건당 비용과 속도가 중요합니다.
내용은 공식 발표와 Claude Platform·Claude Code 문서로 확인한 것만 담았습니다(2026년 10월 8일 확인).
Claude Haiku 5.5에 맡길 일
공식 발표는 Haiku 5.5를 대량이고 비용에 민감한 작업용 모델로 소개합니다. 직접 든 예는 세 묶음입니다.
- 빠르고 반복적인 작업: 요약, 컴팩션(길어진 대화를 요약해 맥락 창을 비우는 일), 데이터베이스 쿼리, 분류 요청.
- 코딩 서브에이전트: Opus 5.5나 Sonnet 5.5와 짝을 지어 서브에이전트로 쓰는 조합.
- 속도가 중요한 작업: 실시간 고객 상담, 브라우저 사용. 발표는 Haiku 5.5를 지금까지 나온 모델 중 가장 빠르다고 했는데, 각주를 보면 표준 속도끼리 비교한 것이고 Fast Mode로 돌린 Opus보다는 느립니다.
Claude Platform 문서의 Haiku 5.5 개요도 분류, 추출, 라우팅(요청을 알맞은 곳으로 보내는 일), 서브에이전트 작업을 꼽습니다.
발표에 실린 고객사 인용도 같은 방향입니다. Rogo는 큰 모델이 발표 자료를 만드는 동안 Haiku 5.5 서브에이전트가 10-K(미국 상장사 연차 보고서)에서 자료에 필요한 사업부 매출 줄을 찾아온다고 했어요. Asana는 자사 AI 에이전트 평가에서 지금 쓰는 모델보다 작업 완료 지연이 30% 넘게 줄었다고 했습니다. 둘 다 Anthropic 발표문에 실린 인용이고 제가 확인한 수치는 아닙니다.
쓰지 말 곳: 복잡한 에이전트 코딩
발표문은 맞지 않는 일도 분명히 적었습니다. Terminal-Bench 4.0(터미널에서 에이전트가 작업을 끝내는지 재는 평가)이 다루는 것 같은 복잡한 에이전트 코딩에는 Sonnet 5.5와 Opus 5.5가 여전히 더 나은 선택이고 Haiku 5.5는 범위가 좁은 작업에 맞는다고요. 같은 발표의 표에서 Terminal-Bench 4.0 점수는 Haiku 5.5 39.2%, Sonnet 5.5 70.6%입니다.
발표의 구분을 제 작업에 옮기면 이렇게 나뉩니다. 표 자체는 제 정리이고, 발표가 직접 말한 건 "좁은 작업은 Haiku, 복잡한 에이전트 코딩은 Sonnet·Opus"까지예요.
| Haiku 5.5에 맡길 일 | 큰 모델에 남길 일 |
|---|---|
| 한 건씩 판정하는 분류·라우팅 | 여러 파일을 고치는 기능 구현 |
| 형식이 정해진 요약·추출 | 원인을 찾아야 하는 버그 수정 |
| 서브에이전트의 검색·조회·로그 요약 | 설계 판단과 작업 계획 |
| 빠른 응답이 필요한 상담 | 분류 기준이나 규칙을 처음 정하는 일 |
코딩을 맡길 모델이 고민이라면 같은 날 발표된 변경도 참고할 만합니다. Sonnet 5.5의 캐시 읽기 가격이 100만 토큰당 $0.20에서 $0.10으로 내려가서 대부분의 에이전트 작업에서 약 20% 저렴해졌다고 해요.
가격: 프롬프트 100k 토큰을 기준으로 두 가지
Haiku 5.5의 단가는 프롬프트가 100,000토큰(100k) 이하인지 넘는지로 나뉩니다. 출력 단가도 프롬프트 길이에 따라 정해져요. 아래는 공식 가격표 기준이고 단위는 100만 토큰당 달러입니다.
| 항목 | Haiku 5.5 (100k 이하) | Haiku 5.5 (100k 초과) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 입력 | $0.10 | $0.50 | $1 | $2 |
| 출력 | $0.50 | $2.50 | $5 | $10 |
| 캐시 읽기 | $0.01 | $0.05 | $0.10 | $0.10 |
| 캐시 쓰기(5분) | $0.125 | $0.625 | $1.25 | $2.50 |
| Batch API 입력·출력 | $0.05·$0.25 | $0.25·$1.25 | $0.50·$2.50 | $1·$5 |
발표는 Haiku 4.5보다 운영 비용이 평균 약 75% 덜 든다고 했습니다. 각주에 계산 방법이 있어요. 100k 이하 요청은 Haiku 4.5보다 90%, 넘는 요청은 50% 낮은 가격이고 Haiku 4.5 요청의 90%가 100k 이하였다고 합니다. 여기에 토크나이저(글을 토큰으로 자르는 방식)가 바뀌어 같은 일에 토큰을 조금 더 쓰는 점까지 반영한 평균이에요.
토큰이 얼마나 늘어나는지는 What's new 문서에 있습니다. 같은 글이 Haiku 4.5보다 약 30% 많은 토큰으로 세어지고 정확한 증가 폭은 내용에 따라 다르다고 해요. Haiku 4.5에서 옮긴다면 단가 비율만 보지 말고 실제 프롬프트로 토큰을 다시 세 보는 게 맞습니다.
맥락 창은 1M 토큰, 최대 출력은 128k 토큰으로 Haiku 4.5(200k·64k)보다 커졌습니다. 다만 프롬프트가 100k를 넘으면 단가가 다섯 배가 되니 긴 문서를 통째로 넣는 작업은 계산을 따로 해 봐야 해요. 그래도 100k 초과 단가($0.50·$2.50)가 Sonnet 5.5의 기본 단가($2·$10)보다는 낮습니다.
effort: Haiku 등급에서 처음 생긴 설정
Haiku 5.5는 effort(생각의 깊이를 정하는 설정)를 고를 수 있는 첫 Haiku 모델입니다. 단계는 low, medium, high, xhigh, max 다섯 가지이고 기본값은 API와 Claude Code 모두 medium이에요. Effort 문서와 Haiku 5.5 프롬프트 가이드는 이렇게 권합니다.
low: 가장 싸고 빠릅니다. 채팅, 짧은 도구 작업, 단순한 대량 요청에 씁니다. 긴 에이전트 프롬프트에서는 검색을 건너뛰거나 일찍 멈추거나 확인을 빼먹을 가능성이 커집니다.medium: 기본값입니다. 에이전트 코딩을 포함해 대부분의 일은 여기서 시작하라고 해요.high: 지식 업무, 긴 에이전트 작업, 지시를 엄격하게 따라야 하는 일.xhigh·max: 내 평가에서 품질이 오른 게 확인된 일에만 씁니다. 이 단계에서는 Sonnet 5.5로도 같은 평가를 돌려 성능·비용·속도를 비교하라고 적혀 있어요.
비용 계산에서 놓치기 쉬운 것은 생각(답하기 전에 거치는 추론 과정)입니다. Haiku 5.5는 생각이 기본으로 켜져 있고 생각 토큰도 출력 토큰으로 과금되며 max_tokens에 포함됩니다. Haiku 4.5에서 생각 없이 맞춰 둔 max_tokens라면 답이 잘릴 수 있어요. 가이드에 따르면 Anthropic 테스트에서 프롬프트에 "바로 답해"라고 써도 생각을 막지 못했습니다. 생각을 줄이려면 effort를 낮추는 쪽이 맞습니다.
Claude Code에서 서브에이전트를 Haiku 5.5로 돌리기
서브에이전트는 메인 대화와 따로 떨어진 맥락에서 일을 맡는 보조 에이전트입니다. MCP·스킬과의 차이는 MCP와 Skills 차이에 정리해 두었어요. 여기서는 모델 지정만 다룹니다.
먼저 버전과 별칭 확인
모델 설정 문서는 Haiku 5.5에 Claude Code v2.1.293 이상을 쓰라고 합니다. 이 버전부터 Anthropic API에서 haiku 별칭이 Haiku 5.5를 가리켜요. claude --version으로 확인하고 낮으면 claude update로 올리세요.
Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS에서는 haiku가 아직 Haiku 4.5를 가리킵니다. 이 경우에는 별칭 대신 모델 ID를 적습니다. Haiku 5.5 개요의 표를 보면 Amazon Bedrock만 anthropic.claude-haiku-5-5이고 나머지는 claude-haiku-5-5입니다.
방법 1: 서브에이전트 파일 하나만 Haiku로
가장 안전한 방법입니다. 서브에이전트 파일 맨 위(frontmatter)의 model 항목에 haiku를 적으면 그 서브에이전트만 Haiku로 돕니다. 예를 들어 긴 테스트 로그를 읽고 실패만 추려 오는 서브에이전트라면 프로젝트의 .claude/agents/log-summarizer.md에 이렇게 적습니다.
---
name: log-summarizer
description: 테스트 로그나 긴 명령 출력을 읽고 실패한 항목만 요약한다. 긴 출력을 읽어야 할 때 사용.
tools: Read, Grep, Glob
model: haiku
---
받은 로그에서 실패한 테스트 이름, 오류 메시지 첫 줄, 관련 파일 경로만 목록으로 정리한다.
코드는 고치지 않는다. 원인을 짐작해 적을 때는 "추측"이라고 표시한다.
서브에이전트 문서에 따르면 model에는 haiku, sonnet, opus, fable 같은 별칭이나 claude-haiku-5-5 같은 전체 모델 ID, 메인 대화와 같은 모델을 쓰는 inherit을 적을 수 있습니다. 같은 frontmatter에 effort: low처럼 effort도 따로 정할 수 있어요. 로그 요약처럼 단순한 일이면 low도 후보지만 앞에서 본 것처럼 긴 지시에서는 일찍 멈출 수 있으니 기본값으로 먼저 돌려 보고 비교하는 게 좋습니다.
모델은 이 순서로 정해집니다. 앞의 것이 이깁니다.
- Claude가 서브에이전트를 부를 때 그 호출에 넘긴
model값 - 서브에이전트 파일의
model - 환경 변수
CLAUDE_CODE_SUBAGENT_MODEL - 메인 대화의 모델
방법 2: 내장 Explore를 Haiku로
코드베이스를 검색할 때 Claude가 자주 부르는 내장 서브에이전트 Explore는 기본적으로 메인 대화의 모델로 돕니다. 저처럼 메인을 Opus 5.5로 쓰면 검색도 Opus로 돌아요. 문서는 사용자나 프로젝트 서브에이전트를 Explore라는 이름으로 만들면 내장 Explore를 대신하고 그 파일의 model을 따른다고 설명합니다. 그래서 model: haiku를 적은 Explore 파일을 두면 검색을 저렴한 모델로 돌릴 수 있습니다. 내장 Explore는 읽기 전용이니 직접 만들 때도 tools를 Read, Grep, Glob처럼 읽기 도구로 제한하는 게 맞습니다.
방법 3: 모든 서브에이전트를 한 모델로
설정 파일(settings.json)의 env 블록에 두 변수를 함께 넣으면 서브에이전트 전체가 Haiku로 돕니다(Claude Code v2.1.257 이상).
{
"env": {
"CLAUDE_CODE_SUBAGENT_MODEL": "haiku",
"CLAUDE_CODE_SUBAGENT_MODEL_FORCE": "1"
}
}
CLAUDE_CODE_SUBAGENT_MODEL 하나만 넣으면 기본값일 뿐이라 파일에 모델이 적힌 서브에이전트는 그대로이고 내장 Explore·Plan도 바뀌지 않습니다. 반대로 _FORCE까지 켜면 서브에이전트 파일의 model도, Claude가 호출할 때 넘기는 모델도 무시해서 큰 모델로 돌려야 할 서브에이전트까지 Haiku가 됩니다.
에이전트 팀의 팀원과 워크플로 에이전트도 같은 모델로 돌아요. 대화를 그대로 이어받는 포크와 model: inherit으로 서브에이전트에서 도는 스킬만 메인 대화 모델에 남습니다. 앞에서 본 것처럼 복잡한 코딩은 Haiku에 맞지 않으니 저라면 방법 1부터 쓰겠어요.
적용됐는지 확인
서브에이전트가 도는 동안 /tasks를 열면 서브에이전트 줄에 실제로 도는 모델이 나옵니다(v2.1.242 이상). 파일에 effort를 적었다면 그 레벨도 함께 보여요.
구독으로 쓸 때도 이 설정이 사용량에 닿습니다. Claude Code 비용 문서는 서브에이전트의 요청도 사용량에 잡힌다며 덜 쓰려면 서브에이전트에 더 작은 모델을 고르라고 안내해요. 다만 Haiku로 바꾸면 사용 한도가 얼마나 덜 줄어드는지는 공식 수치를 찾지 못했습니다. 요금제별 한도는 Claude 요금제 비교에 정리했습니다.
API로 대량 분류할 때 비용 계산해 보기
아래는 가상 예시입니다. 고객 문의 10,000건을 카테고리 8개로 나눈다고 해 볼게요. 건당 입력은 지시문 800토큰과 문의 본문 200토큰을 합쳐 1,000토큰, 출력은 생각과 JSON 답을 합쳐 200토큰이라고 가정합니다. 생각에 쓰는 토큰은 effort와 문의 내용에 따라 달라지니 출력 200토큰은 어디까지나 가정입니다.
계산식은 이렇습니다.
비용 = 건수 × 건당 입력 토큰 ÷ 1,000,000 × 입력 단가
+ 건수 × 건당 출력 토큰 ÷ 1,000,000 × 출력 단가
Haiku 5.5(프롬프트 100k 이하)로 넣으면 다음과 같습니다.
- 입력: 10,000 × 1,000 = 1,000만 토큰 × $0.10 = $1.00
- 출력: 10,000 × 200 = 200만 토큰 × $0.50 = $1.00
- 합계 $2.00. 바로 답이 필요 없는 일이라 Batch API(요청을 모아 맡기고 나중에 결과를 받는 방식, 가격 50% 할인)로 보내면 $1.00
같은 토큰 수라고 가정하면 Sonnet 5.5는 $20 + $20 = $40, Opus 5.5는 $40 + $40 = $80입니다. 실제로는 모델마다 생각하는 양이 달라서 출력 토큰이 같지 않으니 단가 차이를 보여 주는 정도로만 보세요.
지시문 800토큰은 모든 요청에 똑같이 들어가니 프롬프트 캐시도 쓸 수 있습니다. Haiku 5.5는 512토큰부터 캐시가 되고(프롬프트 캐싱 문서) 캐시 읽기는 $0.01입니다. 지시문이 매번 캐시에서 읽힌다고 치면 입력은 800만 토큰 × $0.01 = $0.08에 본문 200만 토큰 × $0.10 = $0.20을 더한 $0.28이 됩니다.
처음 캐시에 쓰는 비용은 따로 듭니다. 기본 캐시 수명은 5분이고 읽을 때마다 추가 요금 없이 갱신되니, 요청 간격이 그보다 벌어지면 다시 써야 해요. Batch API에서는 요청이 비동기로 처리돼서 캐시 적중이 보장되지 않습니다.
이 계산은 손으로 하지 말고 Claude Code나 Codex에 스크립트로 짜게 하는 편이 정확합니다(AI 계산 실수 막기). 실제로 돌리기 전에는 이 순서로 확인하면 됩니다.
- 100건쯤 표본을 뽑아 Haiku 5.5로 돌리고 응답의
usage필드에서 실제 입력·출력 토큰을 봅니다. 가정한 200토큰과 얼마나 다른지 여기서 드러나요. - 같은 표본을
low와medium으로 돌려 정확도와 출력 토큰을 비교합니다. - 사람이 붙인 정답이나 큰 모델의 답과 견줘서 맞은 비율을 셉니다.
- 1번에서 얻은 건당 토큰으로 전체 비용을 다시 계산합니다.
Haiku 4.5 코드를 그대로 옮긴다면 마이그레이션 가이드도 확인하세요. temperature, top_p, top_k는 빼는 게 맞습니다. top_k는 어떤 값이든, temperature는 1이 아니면, top_p는 기본값 0.99가 아니면(1도 포함) 400 오류이고 temperature와 top_p를 함께 보내도 오류예요.
messages를 assistant 턴으로 끝내는 프리필도 생각을 꺼 둔 상태까지 포함해 400 오류입니다. 응답이 생각 블록으로 시작할 수 있어서 첫 블록을 답으로 읽던 코드는 type으로 골라 읽어야 해요. Claude Code에서 /claude-api migrate this project to claude-haiku-5-5를 실행하면 내장 Claude API 스킬이 고칠 범위를 물은 뒤 이런 변경을 찾아 고쳐 줍니다.
10월 7일 발표에 따르면 Max나 Team 구독에는 그 주부터 매달 API 크레딧이 순차로 들어옵니다(Max 5x $100, Max 20x $200). 이런 표본 실험을 그 크레딧으로 해 볼 수 있어요. 자세한 내용은 Claude Max API 크레딧에 정리했습니다.
제가 refs에서 재고 있는 것
refs는 제가 저장한 레퍼런스를 읽고 볼 만한 신호인지 판정하고 카테고리와 폴더로 분류한 뒤 요약하는 서비스입니다. 저장할 때마다 이 작업이 돌아서 건당 비용이 쌓여요. 지금 서비스의 기본 판정 모델은 다른 회사의 소형 모델입니다.
여러 소형 모델을 비교하는 평가 스크립트가 이미 있었습니다. 레퍼런스 90개를 표본으로 두고 Opus 5.5의 답을 정답지로 삼아 비교해요. 여기에 Anthropic API로 Haiku 5.5를 직접 부르는 경로를 추가했습니다. 보는 항목은 신호 판정, 카테고리, 폴더, 요약 품질, 지연(p50·p90), 건당 비용입니다. 9월 29일에 같은 평가를 돌렸을 때 Haiku 4.5는 신호 판정에서 Opus 5.5 정답과 76% 일치했어요.
Haiku 5.5 결과는 아직 측정 중입니다. 수치가 나오면 이 글에 덧붙이겠습니다. 결과가 좋으면 기본 모델을 바꿀 수도 있고, 판정은 지금 모델에 두고 요약만 옮길 수도 있습니다. 매일 같은 판단을 반복하는 일이라면 모델을 부르지 않고 규칙이나 스크립트로 처리할 수 있는지도 먼저 따져 볼 만해요(스크립트·크론으로 돌릴 일 가르기).
정리
- Claude Haiku 5.5는 요약, 컴팩션, DB 쿼리, 분류 같은 대량·반복 작업과 Opus·Sonnet 아래의 서브에이전트, 속도가 중요한 상담·브라우저 사용에 맞춰 나왔습니다. 복잡한 에이전트 코딩은 발표도 Sonnet 5.5·Opus 5.5를 권합니다.
- 가격은 프롬프트 100k 토큰 이하에서 100만 토큰당 입력 $0.10·출력 $0.50, 넘으면 $0.50·$2.50입니다. 같은 글이 약 30% 많은 토큰으로 세어지니 Haiku 4.5에서 옮길 때는 토큰을 다시 셉니다.
- Haiku 등급에서 처음으로 effort가 생겼고 기본값은
medium입니다. 생각 토큰은 출력으로 과금되니 비용 계산에 넣습니다. - Claude Code에서는 v2.1.293 이상에서 서브에이전트 파일에
model: haiku를 적는 방법부터 쓰고/tasks로 확인합니다.
출처와 확인 (2026-10-08)
- Anthropic: Introducing Claude Haiku 5.5 (출시일, 용도, 쓰지 말 곳, 75% 각주, 벤치마크 표, 고객사 인용, Sonnet 5.5 캐시 가격 인하, Max·Team API 크레딧)
- Anthropic: Claude Haiku 5.5 overview (모델 ID, 맥락 창·최대 출력, 가격, 기본 effort)
- Anthropic: What's new in Claude Haiku 5.5 (토큰 약 30% 증가, Haiku 4.5 대비 맥락 창·출력)
- Anthropic: Claude Haiku 5.5 migration guide (샘플링 파라미터, 프리필,
/claude-api migrate) - Anthropic: Prompting Claude Haiku 5.5 (effort별 권장, 생각과
max_tokens) - Anthropic: Effort (다섯 단계, Haiku 5.5 권장 레벨)
- Anthropic: Pricing (Haiku 5.5·4.5, Sonnet 5.5, Opus 5.5 단가, Batch 가격)
- Anthropic: Prompt caching (최소 캐시 길이 512토큰)
- Anthropic: Batch processing (50% 할인, 배치의 캐시 적중)
- Claude Code: Subagents (
model항목, 모델 결정 순서, Explore 대체, 전체 강제 설정,/tasks) - Claude Code: Model configuration (v2.1.293, 공급자별
haiku별칭, effort 기본값) - Claude Code: Costs (서브에이전트 사용량과 작은 모델)



