
안녕하세요👋 워크플로우 아키텍트, 수월한입니다.
혹시 클로드 오퍼스 5(Claude Opus 5)로 바꾸고 나서 API 요금이 이상하게 많이 나온 적 있으신가요? 분명 앤트로픽 공식 발표에서는 "가격은 오퍼스 4.8과 동일하다"고 했는데, 막상 청구서를 열어보면 체감 비용이 늘어난 것 같아 혼란스러우셨을 겁니다. 결론부터 말씀드리면, 여러분 잘못이 아닙니다. 오퍼스 5부터 바뀐 구조를 모르고 기본값(high)을 그대로 방치했기 때문입니다.
- 핵심 변화: 오퍼스 5는 사고 과정(thinking)이 기본으로 켜져 있고, 이 thinking 토큰도 눈에 보이는 답변과 똑같이 출력 요율로 과금됩니다.
- 실무 적용: 작업 유형별로 effort(
low~max) 5단계 중 하나를 명시적으로 골라야 합니다. 기본값만 믿고 두면 안 됩니다. - 기대 효과: 같은 결과물을 내면서도 토큰·요금을 눈에 띄게 아낄 수 있습니다.
오퍼스 5, 뭐가 달라졌길래 요금이 다르게 나올까?
오퍼스 5의 가격표 자체는 이전 모델과 완전히 같습니다. 100만 입력 토큰당 5달러, 100만 출력 토큰당 25달러로 오퍼스 4.8과 동일하죠. 그런데도 체감 비용이 다르게 느껴지는 가장 결정적인 이유는 "사고 과정(thinking)"이 켜지는 방식이 바뀌었기 때문입니다.
오퍼스 4.8까지는 thinking 옵션을 직접 켜야만 모델이 답하기 전에 내부적으로 생각하는 과정을 거쳤습니다. 반면 오퍼스 5부터는 이 사고 과정이 기본으로 켜져 있고, effort 파라미터가 "얼마나 깊이 생각할지"를 조절하는 다이얼 역할을 합니다. 문제는 이 사고 과정에서 쓰인 토큰도 화면에 보이는 답변과 똑같이 출력 토큰 요율로 과금된다는 점입니다.
더 헷갈리는 지점은 따로 있습니다. 공식 문서는 오퍼스 5에 한해 이렇게 명시하고 있습니다.
오퍼스 5에서는 effort를 낮춰도 화면에 보이는 답변 자체의 길이는 안정적으로 줄지 않습니다. 실제 절감은 눈에 보이지 않는 thinking 토큰 쪽에서 일어나기 때문에, "답변이 비슷해 보이니 effort 낮춰도 소용없겠다"고 오해하기 쉽습니다.
실제로 한 개발자는 같은 저(low) effort 조건에서 오퍼스 4.8은 약 0.21달러, 오퍼스 5는 약 0.42달러가 나왔다고 보고했습니다 — 정확히 2배입니다. 같은 글은 "매칭된 effort 조건에서 오퍼스 5가 오퍼스 4.8보다 대략 2배 많은 출력 토큰을 쓴다"고도 설명합니다. thinking이 기본으로 켜져 있고, 그 토큰도 출력 요율로 과금되며, 답변 자체도 전반적으로 더 길게 쓰는 경향 때문입니다.
Effort 5단계, 내 작업엔 뭘 써야 할까
오퍼스 5는 effort low, medium, high, xhigh, max 5단계를 전부 지원합니다. 기본값은 high인데, 이걸 작업 성격에 맞게 명시적으로 지정해주는 것이 이번 글의 핵심입니다.
- low — 간단한 분류, 의도 파악, 서브에이전트 라우팅: 속도·비용이 최우선이고 품질 저하를 감수할 수 있는 단순 작업
- medium — 이미 검증된 반복 파이프라인(정형 추출, 분류): 토큰을 크게 아끼면서도 균형 잡힌 품질 유지
- high(기본값) — 복잡한 추론, 코드 리뷰, 일반적인 에이전트 작업: 품질이 속도·비용보다 중요한 대부분의 실무 작업
- xhigh — 30분 넘게 이어지는 장기 코딩·에이전트 작업: 수백만 토큰 예산이 필요한 장시간 자율 작업
- max — 절대적으로 최고 품질이 필요한 프론티어급 문제: 토큰 소모를 신경 쓰지 않고 가장 깊은 추론이 필요한 경우
여기서 중요한 실무 팁이 하나 있습니다. 오퍼스 4.8에서 쓰던 effort 설정을 그대로 오퍼스 5로 들고 오지 마세요. 앤트로픽도 공식 문서에서 "이전 모델의 effort 설정을 이어받았다면, 재사용하지 말고 여러분의 평가 기준으로 새로 스윕해보라"고 권고합니다. 모델마다 effort가 실제로 만들어내는 품질·비용 곡선이 다르기 때문입니다.
Claude Code를 쓰신다면 /effort 명령으로 API의 effort 파라미터와 동일한 척도를 그대로 조정할 수 있습니다. API를 직접 호출하신다면 아래처럼 output_config에 지정하면 됩니다.
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=[{"role": "user", "content": "여기에 프롬프트"}],
)
실수하기 쉬운 지점
effort를 다루다 보면 실무에서 자주 걸려 넘어지는 지점이 세 가지 있습니다.
effort는 세션 중간에 바꾸지 마세요. effort 값이 바뀌면 프롬프트가 렌더링되는 방식 자체가 달라져서, 그 이전 턴들의 프롬프트 캐시가 통째로 무효화됩니다. 대화가 길어질수록 이 캐시 덕분에 요금이 절약되는 구간도 커지므로, 긴 세션에서는 시작할 때 effort를 한 번 정하고 끝까지 그대로 유지하는 편이 훨씬 이득입니다.
오퍼스 4.8까지는 thinking 비활성화가 effort 값과 무관했지만, 오퍼스 5부터는 effort가 xhigh나 max인 상태에서 thinking: {"type": "disabled"}를 요청하면 400 에러가 돌아옵니다. 이전 모델의 코드를 그대로 가져와 쓰다가 갑자기 에러가 난다면 이 규칙부터 의심해보세요.
max_tokens는 thinking 토큰과 실제 답변 토큰을 합친 값에 대한 하드 리밋입니다. xhigh·max처럼 사고를 많이 하는 설정에서 max_tokens를 예전 값 그대로 두면, 모델이 생각하다가 답변할 자리를 다 써버려 응답이 중간에 끊길 수 있습니다. 이 구간에서는 6만 4천 토큰 정도를 기본값으로 잡고 조정하는 것을 권장합니다.
여기에 하나 더, 타이밍상 같이 챙길 요금 함정이 있습니다. 소넷 5(Sonnet 5)의 도입가($2/$10)가 2026년 8월 31일에 끝나고 $3/$15로 오릅니다. "지금은 뭘 써야 싸게 가나"를 저울질하고 계셨다면, 오퍼스 5 effort 조정과 함께 이 시점도 같이 고려하시는 게 좋습니다.
Opus 4.8에서 갈아타도 될까?
지난번 Opus 4.8 출시 정리 글을 보신 분이라면 궁금하실 겁니다. 결론은 "갈아타도 되지만, 코드 두 줄만 바꾸고 끝내면 안 된다"입니다.
모델 ID는 claude-opus-4-8에서 claude-opus-5로 바꾸기만 하면 됩니다. 하지만 그 전에 앞서 설명한 두 가지 변경점을 반드시 확인하세요.
- thinking이 기본으로 켜져 있다는 것 (요금에 직접 영향)
- effort가
xhigh·max일 때 thinking을 끌 수 없다는 것 (에러로 직결)
이 두 가지만 확인하고 넘어가면 마이그레이션 자체는 어렵지 않습니다.
빠른 점검
본격적으로 적용하기 전에, 아래 세 가지만 스스로 체크해보세요.
- 지금 돌리고 있는 워크플로우에서 effort를 명시적으로 지정하고 있나요, 아니면 기본값(
high)에 방치하고 있나요? xhigh나max를 쓰는 요청에서thinking: {"type": "disabled"}코드가 예전 모델 때부터 남아있지는 않나요?- 세션 도중에 effort 값을 습관적으로 바꾸고 있지는 않나요? (프롬프트 캐시 무효화로 이어집니다)
마무리
정리하면, 오퍼스 5는 가격표만 보면 이전과 똑같지만 thinking이 기본으로 켜지면서 "가만히 두면 더 나가는" 구조로 바뀌었습니다. 오늘 소개해 드린 매핑표를 기준으로, 지금 돌리고 계신 워크플로우 중 하나를 골라 effort를 한 단계 낮춰보고 결과물과 요금을 직접 비교해보시는 것부터 시작해보세요. 그 작은 실험 하나가 다음 달 청구서를 바꿔줄 겁니다.
자주 묻는 질문(FAQ)
아니요, 토큰당 단가(100만 입력 5달러, 100만 출력 25달러)는 오퍼스 4.8과 완전히 동일합니다. 다만 사고 과정(thinking)이 기본으로 켜져 있고 그 토큰도 출력 요율로 과금되기 때문에, effort를 신경 쓰지 않고 쓰면 실사용 토큰량이 늘어나 체감 비용이 오를 수 있습니다.
작업 성격에 따라 다릅니다. 이미 검증된 분류·추출 같은 반복 작업은 medium에서도 품질이 거의 유지되는 경우가 많고, 서브에이전트나 간단한 라우팅 작업은 low로도 충분합니다. 반면 복잡한 추론이나 코드 리뷰처럼 품질이 중요한 작업은 high 이상을 유지하는 것이 안전합니다.
/effort 명령을 입력하면 됩니다. API의 output_config.effort 파라미터와 동일한 5단계 척도(low~max)를 그대로 사용합니다.
'📰 수월한 트렌드 > 소식 & 업데이트' 카테고리의 다른 글
| 제미나이 3.7 플래시 출시, 기존 3.6 요금까지 반값 된 이유와 전환 체크리스트 (0) | 2026.08.14 |
|---|---|
| 클로드 페이블 5, 두 달 만에 오퍼스 5한테 밀려난 이유와 지금 선택 기준 (0) | 2026.08.14 |
| Claude Opus 4.8 출시: 4.7 대비 에이전트 코딩 비용 70% 아끼는 API 신기능 (0) | 2026.05.29 |
| 구글 안티그래비티(Antigravity) 2.0 공식 출시! 4대 제품 완벽 가이드와 설치 충돌 버그 우회법 (0) | 2026.05.20 |
| 구글 Gemini 3.5 Flash 전격 출시! 압도적 속도와 에이전트 최적화로 달라질 실무 생산성 핵심 요약 (0) | 2026.05.20 |