안녕하세요, 파이토치 코리아 여러분!
Claude Opus 5와 Claude Fable 5는 모두 100만 토큰 컨텍스트를 제공하지만, 외부 보도에서 다루는 역할과 가격, 데이터 보존 조건, 대체 라우팅(fallback)은 서로 다릅니다. 따라서 공개 벤치마크의 한 줄 순위나 토큰 가격만 보고 팀의 기본 모델을 정하기는 어렵습니다.
이 글에서는 두 모델 중 하나를 절대적인 승자로 고르는 대신, Opus 5를 기본 후보로 두고 Fable 5를 상향 후보로 검증하는 방법을 정리합니다. 모델을 실제 운영에 넣기 전에 사용할 수 있는 비교표, 세 가지 생산 시나리오, 로그 필드, 7일 재실행 테스트까지 함께 살펴보겠습니다.
개요 / Introduction
먼저 세 줄로 요약하면 다음과 같습니다.
- 대부분의 복잡한 일상 작업은 Opus 5를 기본 후보로 먼저 검증합니다.
- 작업이 매우 길거나 모호하고, 반복 실패 또는 높은 실패 비용이 확인될 때 Fable 5를 상향 후보에 추가합니다.
- 최종 비교 단위는 토큰 단가가 아니라 채택된 작업 비용(Accepted-task Cost)이며, 요청한 모델과 실제 응답 모델을 모두 기록해야 합니다.
Axios와 The Verge는 Opus 5를 일상적인 기업·개발 작업의 기본 후보로, Fable 5를 가장 복잡하고 장시간 자율 실행되는 작업의 상위 후보로 정리했습니다. 두 보도 모두 Opus 5의 공개 가격이 Fable 5의 절반이라는 점을 핵심 변화로 다룹니다.
다만 이 글은 두 모델을 동일 조건으로 실행한 독립 벤치마크가 아닙니다. 2026년 7월 26일에 다시 확인한 제3자 보도, Artificial Analysis 평가와 공개 연구 자료를 바탕으로 만든 검증 프레임워크입니다. 공개 벤치마크는 무엇을 테스트할지 알려줄 수 있지만, 팀의 실제 승인 기준을 대신하지는 못합니다.
주요 모델 비교
외부 자료에서 확인되는 운영 조건
두 모델의 차이는 단순한 성능 등급이 아니라 운영 계약의 차이이기도 합니다.
| 항목 | Claude Opus 5 | Claude Fable 5 | 운영에서 확인할 점 |
|---|---|---|---|
| 외부 보도에서 본 역할 | 일상적인 기업·개발 작업의 기본 후보 | 가장 복잡한 장기 자율 실행 작업의 상위 후보 | 기본 계층과 상향 계층을 분리합니다 |
| 컨텍스트 | 1M tokens | 1M tokens | 같은 크기가 같은 결과를 의미하지 않습니다 |
| 공개 입력 / 출력 가격 | $5 / $25 per MTok | $10 / $50 per MTok | 토큰 단가와 완료 작업 비용을 구분합니다 |
| 추론 제어 | 추론 강도(effort) 조절과 작업 중 모델 전환이 보도됨 | 장시간·고난도 작업 후보로 비교 | 비교 시 effort와 도구 조건을 고정합니다 |
| 데이터 보존 | 사용 환경별 정책 확인 필요 | 일반 접근에서 30일 보존 요구가 보도됨 | 민감한 작업은 성능 비교 전에 계약으로 제외될 수 있습니다 |
| 대체 라우팅 | 자동 fallback 옵션이 보도됨 | 공개 연구에서 요청 모델과 실행 모델이 달라진 사례가 관찰됨 | 실제 response_model을 확인합니다 |
대체 라우팅은 요청이 원래 지정한 모델이 아닌 다른 모델로 처리되는 상황을 뜻합니다. The Verge는 Opus 5에서 안전장치가 요청을 거부할 때 더 낮은 계층 모델로 자동 대체하는 옵션을 보도했습니다. 또한 RuBench 연구는 Claude Code와 Fable 5를 사용한 25개 과제 중 5개에서 실행 모델이 Opus 4.8로 바뀐 사례를 기록했습니다. 이 20%는 모든 환경의 일반 비율이 아니라 해당 실험의 관찰값이지만, 비교 로그에 requested_model과 response_model을 함께 기록해야 하는 이유를 보여줍니다.
토큰 가격이 절반이어도 작업 비용이 절반은 아닌 이유
Opus 5의 공식 입력·출력 토큰 단가는 Fable 5의 절반입니다. 하지만 하나의 결과가 팀의 검수를 통과할 때까지 발생하는 비용은 토큰 단가만으로 결정되지 않습니다.
채택된 작업 비용(Accepted-task Cost)은 다음처럼 계산할 수 있습니다.
채택된 작업 비용
= (모델 호출 비용 + 재시도 비용 + 도구 비용 + 사람의 수정 비용)
/ 채택된 결과 수
저렴한 모델이 반복 실행과 긴 수정을 요구한다면 실제 완료 비용은 높아질 수 있습니다. 반대로 비싼 모델이 한 번에 승인 기준을 통과한다면 고가치 작업에서는 비용을 정당화할 수 있습니다.
Artificial Analysis의 Intelligence Index 평가에서는 Opus 5 max effort의 평균 작업 비용이 $2.03, Fable 5가 $2.75로 보고됐습니다. 이 평가 환경에서는 Opus 5가 약 26% 낮았지만, 공식 토큰 가격 차이인 50%와는 다릅니다. 또한 두 값은 특정 평가 하네스(harness), effort, 평가 데이터와 fallback 조건에서 나온 결과이므로 일반적인 생산 비용으로 그대로 사용할 수 없습니다.
핵심은 숫자 자체보다 비교 방식입니다. 팀은 토큰, 캐시, 도구 호출, 재시도, 전체 시간, 사람의 수정 시간과 최종 승인 여부를 함께 기록해야 합니다.
시나리오 1: 저장소 규모 코드 리뷰
첫 번째 시나리오는 저장소 규모 코드 리뷰(repository-scale code review)입니다.
| 단계 | 확인할 내용 |
|---|---|
| 입력 | 고정된 commit 또는 PR, 저장소 규칙, 테스트 명령, 허용된 수정 범위 |
| 판단 조건 | blocker 누락, 과도한 오탐, 잘못된 근본 원인 분석, 높은 수동 수정 비용 |
| 라우팅 | Opus 5로 첫 검토를 실행하고, 승인 기준을 통과하지 못한 동일 작업만 Fable 5로 재실행 |
| 검수 | 진양성, 오탐, 놓친 blocker, 리뷰 시간, 사람의 수정량 |
먼저 Opus 5가 일반적인 리뷰 기준을 얼마나 안정적으로 통과하는지 확인합니다. blocker 누락이나 오탐 검토 비용이 커질 때만 같은 commit, 지침, 권한과 승인 기준으로 Fable 5를 비교합니다.
시나리오 2: 장시간 에이전트 작업
두 번째 시나리오는 장시간 에이전트(long-running agent)입니다.
| 단계 | 확인할 내용 |
|---|---|
| 입력 | 작업 목표, 도구 schema, 권한, 단계별 checkpoint, 중단 조건 |
| 판단 조건 | 지시 이탈, 도구 실패 복구 불가, checkpoint 연속 실패, 높은 사람 개입 비용 |
| 라우팅 | Opus 5가 기본 루프를 실행하고, 실패한 고비용 구간만 동일 조건으로 Fable 5와 비교 |
| 검수 | checkpoint 완료율, 지시 유지, 도구 복구, 전체 시간, 사람의 개입 횟수 |
장시간 작업은 계획, 구현, 테스트, 복구 checkpoint를 나눠 기록합니다. 판단 기준은 모델 이름이 아니라 완료율, 총 시간, 사람의 개입 횟수와 실패 복구 비용입니다.
시나리오 3: 민감한 코드와 데이터
세 번째 시나리오는 민감 작업(sensitive workload)입니다.
| 단계 | 확인할 내용 |
|---|---|
| 입력 | 민감 코드 또는 데이터, 보존 정책, 허용된 안전 경계, fallback 허용 여부 |
| 판단 조건 | 30일 데이터 보존 불가, 실제 응답 모델 변경 불가, 감사 로그 부족 |
| 라우팅 | 계약 조건을 통과한 모델만 성능·비용 비교에 포함 |
| 검수 | 보존 정책 충족, 요청·응답 모델 추적, 거부 또는 fallback 행동의 감사 가능성 |
민감 작업에서는 benchmark보다 계약이 먼저입니다. 30일 데이터 보존이나 응답 모델 변경을 허용할 수 없다면 해당 후보를 제외하고, 요청·응답 모델과 거부 또는 fallback 여부를 감사 로그에 남깁니다.
모델 라우팅에 필요한 로그 필드
최소한 다음 필드는 한 행으로 연결해서 저장하는 것이 좋습니다.
| 필드 | 기록 목적 |
|---|---|
task_id, task_type |
작업별·유형별 비교 |
requested_model |
요청한 모델 확인 |
response_model |
fallback 또는 라우팅 변경 확인 |
effort |
사고 수준을 같은 조건으로 비교 |
input_tokens, output_tokens |
기본 호출 비용 계산 |
cache_write, cache_read |
캐시 비용과 절감 효과 확인 |
tool_calls, retries |
실행 경로와 반복 비용 확인 |
latency_ms |
실제 전체 지연 시간 확인 |
human_minutes |
사람의 수정 비용 반영 |
accepted, failure_reason |
채택된 작업 비용과 실패 유형 계산 |
실제 필드 이름은 API마다 다를 수 있습니다. 위 표는 논리 구조이므로 구현 전 현재 API 문서에서 응답 필드를 확인해야 합니다.
7일 재실행 테스트(replay test)
전체 트래픽을 바꾸기보다 과거 작업을 사용하는 7일 재실행 테스트로 시작합니다.
- 최근 작업 중 실패 비용이 높고 승인 기준이 명확한 10~20개를 고릅니다.
- 각 작업의 prompt, context, 도구, 권한, effort, 중단 조건을 고정합니다.
- Opus 5를 기본 후보로 첫 번째 실행을 진행합니다.
- 실패했거나 사람의 수정 시간이 기준을 넘은 작업만 Fable 5로 다시 실행합니다.
- 요청 모델, 응답 모델, 토큰, 캐시, 도구 호출, 재시도, 지연 시간과 사람의 수정 시간을 기록합니다.
- 전체 평균만 보지 말고 코드 리뷰, 장시간 에이전트, 민감 작업처럼 유형별 채택된 작업 비용을 계산합니다.
- 일주일 뒤 특정 작업 유형의 라우팅만 수정하고, 하나의 모델을 영구적인 전체 승자로 선언하지 않습니다.
첫 주의 작은 표본은 영구 정책이 아니라 다음 테스트를 위한 가설로 취급합니다.
Claude API를 실제로 사용하려면 Anthropic 공식 채널에서 직접 결제해 사용하거나, 여러 모델을 하나의 API로 제공하는 제3자 통합 플랫폼을 선택할 수 있습니다. 예를 들어 Opus 5 모델 상세 페이지에서는 현재 모델 ID, EvoLink 가격, 컨텍스트와 API 문서 입구를 확인할 수 있습니다. 선택하기 전에는 각 플랫폼의 최신 가격, 데이터 보존 정책, 지원 범위와 실제 응답 모델을 다시 확인하는 것이 좋습니다.
요약 / Summary
| 상황 | 권장하는 첫 행동 |
|---|---|
| 복잡한 일상 코딩, 분석, 문서 및 에이전트 조정 | Opus 5를 기본 후보로 먼저 테스트합니다 |
| 매우 모호하거나 긴 작업, 반복 실패, 실패 비용이 매우 큰 작업 | Fable 5를 상향 후보로 같은 조건에서 비교합니다 |
| 30일 데이터 보존 또는 fallback을 허용할 수 없는 작업 | benchmark 전에 계약 조건으로 후보를 제외합니다 |
| 승인 기준과 로그가 없는 작업 | 모델 승패를 판단하지 말고 먼저 검수 기준을 만듭니다 |
Opus 5의 낮은 토큰 단가는 기본 후보로 시작할 이유가 되지만, 실제 라우팅은 채택률, 재시도, 지연 시간, 사람의 수정과 계약 조건으로 결정해야 합니다.
결론 / Conclusion
Claude Fable 5는 여전히 가장 높은 능력이 필요한 장시간·고난도 작업의 상향 계층으로 의미가 있습니다. Claude Opus 5가 바꾼 것은 Fable 5의 존재 가치가 아니라, 복잡한 일상 작업을 시작할 때의 기본 후보입니다.
Opus 5로 시작하고, 승인 기준을 통과하지 못했으며 실패 비용이 큰 작업만 Fable 5로 상향합니다. 데이터 보존과 fallback 조건은 성능보다 먼저 확인하고, 모든 실행에서 요청 모델과 실제 응답 모델을 기록합니다.
출처 / Sources
- Axios — Anthropic releases new model Opus 5
- The Verge — Claude Opus 5 is Anthropic’s everyday enterprise model
- Artificial Analysis — Opus 5: Fable 5 level intelligence at a lower cost per task
- TechRadar Pro — Microsoft limits employee use of Claude Fable 5 over data retention concerns
- RuBench — Detecting Silent Model Substitution in Agentic Coding Benchmarks