Anthropic, Fable 5급 성능을 절반 가격에 제공하는 Claude Opus 5 공개

Claude Opus 5 소개

Anthropic이 사려 깊고 주도적인(thoughtful and proactive) 새 프론티어급 코딩 및 에이전트 모델 Claude Opus 5를 공개했습니다. 오늘부터 API와 Claude.ai, Claude Code 등 모든 플랫폼에서 사용할 수 있는 이 모델은, Anthropic이 최근 공개한 최상위 모델 Claude Fable 5의 프론티어급 지능에 근접하면서도 가격은 절반에 불과합니다. Opus 계열은 그동안 Anthropic 라인업에서 합리적인 비용으로 실무에 바로 투입하는 모델의 자리를 맡아왔는데, Opus 5는 그 역할을 한 단계 끌어올렸다는 평가를 받고 있습니다.

코딩과 지식 노동 평가에서 Opus 5는 Frontier-BenchGDPval-AA 같은 벤치마크에서 새로운 최고 기록(state-of-the-art)을 세웠습니다. 다만 사이버보안 작업에서는 여전히 Claude Mythos 5에 못 미치는데, 이는 성능이 부족해서라기보다 Anthropic이 취약점 악용(exploit) 능력을 의도적으로 낮게 유지한 결과에 가깝습니다. 이 부분은 아래 안전성 섹션에서 더 자세히 다룹니다.

Anthropic은 Opus 5를 매일 쓰는 모델로 설계했다고 강조합니다. 다른 모델보다 더 효율적으로 동작하도록 튜닝되어 있어 Claude Max 구독의 새 기본 모델이 되었고, Claude Pro에서는 가장 강력한 모델로 자리잡았습니다. 비슷한 시기 올라온 Claude Opus 5와 Fable 5를 어떻게 나눠 써야 할까 글에서 다루듯, 두 모델은 비용과 성능 사이에서 서로 다른 지점을 겨냥합니다.

핵심 특징 요약

Anthropic이 이번 공개에서 강조한 Opus 5의 핵심 변화는 다음과 같습니다.

  • 비용 대비 최고 성능: Frontier-Bench v0.1에서 Opus 5는 모든 모델을 앞섰고, 전작 Opus 4.8 대비 더 낮은 작업당 비용으로 두 배 넘는 성능을 기록했습니다. CursorBench 3.2에서는 max 노력(effort) 설정 기준 Fable 5 최고 점수의 0.5% 이내까지 근접하면서도 비용은 절반입니다.

  • 새로운 문제를 푸는 힘: 모델이 한 번도 본 적 없는 문제를 푸는 ARC-AGI 3 평가에서 Opus 5는 차순위 모델보다 세 배 높은 점수를 기록했습니다. 비즈니스 업무 자동화 평가인 Zapier AutomationBench에서는 같은 비용 기준 차순위 모델의 약 1.5배 통과율을 보였는데, 가장 낮은 노력(effort) 설정에서도 다른 모든 모델보다 더 많은 과제를 통과했습니다. 컴퓨터 사용 평가 OSWorld 2.0에서는 어떤 비용 구간에서도 다른 모델을 앞서며 Fable 5의 최고 점수를 3분의 1 남짓한 비용으로 넘어섰습니다.

  • 과학 연구 능력의 향상: 구조 생물학, 유기화학, 생물정보학을 포함한 생명과학 평가 전 항목에서 Opus 4.8 대비 향상되었습니다. 특히 분광학 데이터로부터 분자 구조를 추론하는 유기화학 과제에서 10.2%p, 단백질 서열 변화가 기능에 미치는 영향을 예측하는 과제에서 7.7%p 점수가 올랐습니다.

  • 더 강력해진 시각적 결과물: 코드로 그려내는 그래픽, 다이어그램, 인터랙티브 결과물의 품질이 눈에 띄게 좋아졌습니다. 아래 "더 강력해진 결과물" 섹션에서 예시를 확인할 수 있습니다.

  • 가장 정렬된(aligned) 모델: 자동화된 행동 감사(behavioral audit)에서 Opus 5는 지금까지 공개된 Anthropic 모델 중 가장 낮은 비정렬(misalignment) 점수를 기록했습니다. 자세한 수치는 아래 안전성 섹션에서 다룹니다.

벤치마크로 확인한 이전 세대와의 성능 격차

Anthropic이 공개한 종합 벤치마크 표를 보면, Opus 5는 대부분의 평가 항목에서 Fable 5나 GPT-5.6 Sol과 견줄 만한 점수를 내면서도 Opus 4.8 대비 확실한 도약을 보여줍니다. 아래 차트들이 보여주는 여러 지점은 노력(effort) 설정별 결과인데, 이는 API를 쓰는 개발자가 지능을 최대로 끌어올릴지 토큰을 아껴 더 빠르고 저렴한 결과를 낼지 직접 선택할 수 있는 파라미터입니다.

벤치마크 (분류) Opus 5 Fable 5 Opus 4.8 GPT-5.6 Sol
Frontier-Bench v0.1 (에이전틱 터미널 코딩) 43.3% 33.7% 21.1% 34.4%
GDPval-AA v2 (지식 노동) 1861 1747 1593 1736
ARC-AGI-3 (신규 문제 해결) 30.2% - 1.5% 7.8%
OSWorld 2.0 (컴퓨터 사용) 70.6% 66.1% 55.7% 62.6%
AutomationBench (비즈니스 워크플로우) 26.0% 17.4% 17.0% 18.1%

아래 Frontier-Bench v0.1 차트에서 볼 수 있듯, Opus 5(주황색 선)는 가장 낮은 노력 설정에서도 이미 Opus 4.8의 최고 노력 설정보다 높은 점수를 기록하며, 비용을 늘려도 GPT-5.6 Sol이나 Fable 5보다 항상 왼쪽 위(더 낮은 비용, 더 높은 점수)에 위치합니다.

이 수치를 읽을 때는 측정 조건도 함께 봐야 합니다. Frontier-Bench v0.1 결과는 과제당 5회 시도의 평균 보상(mean reward) 기준이며, Opus 5나 Fable 5가 안전 분류기 때문에 응답을 거부한 경우에는 그 자리에 Opus 4.8의 결과가 대신 집계되었습니다.

한 번도 본 적 없는 문제를 푸는 ARC-AGI 3 평가에서도 비슷한 격차가 보입니다. 아래 차트에서 Opus 5(high 설정)는 30.2%를 기록해, 같은 high 설정의 Opus 4.8(1.5%)과 GPT-5.6 Sol의 최고 점수(7.8%)를 모두 크게 앞섰습니다.

에이전트로서의 주도성과 꼼꼼함

Anthropic은 Opus 5가 "자신의 작업을 검증하고 성공할 때까지 꼼꼼하게 반복하는" 능력에서 크게 개선되었다고 설명합니다. 평가와 얼리 액세스 테스트 과정에서 확인된 사례들이 이 특징을 잘 보여줍니다.

한 Frontier-Bench 과제에서는 기계 부품의 도면 이미지가 주어지고 이를 3D FreeCAD 모델로 재구성하는 코드를 작성하라는 요구가 주어졌는데, 모델에게는 그 도면을 직접 볼 수 있는 수단이 의도적으로 제공되지 않았습니다. Opus 5는 이 제약에 스스로 컴퓨터 비전 파이프라인을 작성해 원본 픽셀에서 기하 정보를 추출하는 방식으로 대응했고, 이 방법으로 전체 부품을 반복적으로 성공리에 재구성했습니다. 동일한 조건에서 경쟁 모델은 다섯 번을 시도해도 풀지 못했습니다.

또 다른 사례에서는 실제 존재하는 인기 오픈소스 패키지 매니저의 버그가 주어졌는데, Opus 5는 근본 원인을 찾아내 커뮤니티 패치조차 놓친 예외 케이스까지 고쳤습니다. 반면 경쟁 모델은 표면적인 증상만 고치고도 버그가 해결되었다고 보고했습니다. 한 트레이딩 회사의 엔지니어는 Opus 5를 활용해 신규 거래소용 시장 데이터 피드를 단 한 세션 만에 구축했는데, 이전 모델들은 엔지니어가 상세한 계획을 제공해도 이 작업을 아예 완료하지 못했습니다. 검증할 라이브 피드가 없는 상황에서 Opus 5는 자체 테스트 하네스까지 만들어 거래소 데이터가 올바르게 파싱되는지 스스로 확인했습니다.

이런 에이전틱 특성은 얼리 액세스 파트너들의 후기에서도 반복적으로 확인됩니다.

FrontierCode 1.1에서 Claude Opus 5는 절반의 비용으로 Fable 5급 성능에 근접합니다. Devin 내에서는 특히 어려운 디버깅과 근본 원인 분석 작업에서 강점을 보입니다.

Cognition (Devin)

Claude Opus 5는 Opus급 속도와 비용으로 Fable 5에 가까운 지능을 제공합니다. CursorBench에서는 Fable 5 바로 아래 점수를 기록했고 행동 양상도 상당 부분 비슷합니다. 개발자들이 Cursor에서 이 모델을 어떻게 활용할지 기대하고 있습니다.

Cursor

Claude Opus 5는 이전 Claude 모델보다 더 많은 토큰을 쓰지 않고도 Zapier의 AutomationBench 순위표 1위에 올랐습니다. 정리되지 않은 계정 상태 워크북 하나만으로 위험 계정 표시, 담당자 알림, 리텐션 운영팀을 위한 요약까지 이탈 방지 시퀀스 전체를 처음부터 끝까지 수행했습니다. 이전 모델들은 통과하지 못한 과제인데 Opus 5는 100%를 기록했습니다.

Zapier

이 차트에서 눈에 띄는 지점은 Opus 5의 가장 낮은 노력(effort) 설정(약 22%)조차 다른 모든 모델의 최고 노력 설정 점수보다 이미 높다는 것입니다.

Claude Opus 5는 내부 평가에서 자사 제품군의 모든 모델을 앞질렀습니다. 가장 어려운 에이전틱 코딩 과제에서 Opus 4.7 대비 22% 향상되었을 뿐 아니라, 실행할 때마다 편차가 훨씬 적어 더 안정적입니다. Lovable의 수많은 빌더들에게는 이 일관성이야말로 핵심입니다. 빌드를 거듭해도 신뢰할 수 있는 결과가 나옵니다.

Lovable

Claude Opus 5에서 두드러지는 것은 판단력입니다. 코드를 한 줄 쓰기 전에 더 깊이 고민하고, 논리적 오류를 사후가 아니라 계획 단계에서 스스로 잡아내며, 답이 그저 작동하는지가 아니라 왜 옳은지를 추론합니다. Claude 모델 세대 간 문제 해결 능력의 도약 중 가장 뚜렷한 사례이며, JetBrains IDE에도 도입될 것을 기대하고 있습니다.

JetBrains

Claude Opus 5는 오래 지속되는 다단계 작업을 위해 만들어진 강력한 에이전틱 코딩 모델입니다. 코드베이스를 깊이 이해하고 복잡한 작업 전반에 걸쳐 맥락을 유지하며, 기능 개발과 버그 수정 요구사항을 Opus 4.8보다 더 효과적으로 짚어냅니다. 이제 개발자들은 Kiro에서 Opus 5로 야심찬 프로젝트에 도전할 수 있습니다.

Kiro (AWS)

기업용 콘텐츠 분석 영역에서는 Box가 Opus 5는 Opus 4.8 대비 전반적으로 8%, 데이터 분석 작업에서 11%, 실사(due diligence) 작업에서 17% 향상되었다고 밝히기도 했습니다.

더 강력해진 결과물

Anthropic은 Opus 5가 훨씬 더 강력한 시각적 결과물을 만들어낼 수 있다고도 밝혔습니다. 코드로 생성하는 그래픽과 인터랙티브 아트워크의 완성도가 이전 모델 대비 눈에 띄게 좋아졌다는 것인데, 아래 예시 이미지에서 그 결과물의 질감과 구성력을 확인할 수 있습니다.

정렬과 안전성

정렬(Alignment). 배포 전 테스트 과정에서 Anthropic의 자동화된 행동 감사는 Opus 5를 지금까지 공개된 모델 중 가장 정렬된(aligned) 모델로 평가했습니다. Opus 4.8, Sonnet 5, Fable 5보다 Claude의 헌법(Constitution)을 더 잘 따르고, 기만적 행동 비율이 가장 낮으며, 악용을 유도하는 시도에 가장 잘 저항합니다. 되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동을 피한다는 측면에서도 지금까지 중 가장 안전한 모델입니다.

안전성(Safety). Opus 5는 위험한 이중 용도(dual-use) 능력의 최전선을 확장하지 않습니다. 민간, 정부 파트너와 함께 진행한 엄격한 평가에서 생물학 연구와 공격적 사이버보안 두 영역 모두 여전히 Mythos 5보다 뒤처져 있음을 확인했습니다. 자세한 내용은 System Card에서 확인할 수 있습니다.

Anthropic은 전작 Opus 4.8과 마찬가지로 Opus 5를 사이버 작업에 의도적으로 훈련하지 않았습니다. 그럼에도 전반적인 역량이 향상되면서 관련 과제 성능도 상당히 좋아졌는데, 취약점을 찾아내는 능력에서는 Mythos 5에 근접했지만 그 취약점을 실제 사이버 위협으로 바꾸는 악용(exploitation) 능력에서는 여전히 큰 격차가 있습니다. 아래 OSS-Fuzz 평가 결과가 이를 잘 보여줍니다. 취약점 식별 능력은 Mythos 5와 비슷한 수준(각각 79.4%, 80.0%)이지만, 실제로 악용까지 성공한 사례 수는 Opus 5가 4건, Mythos 5가 13건으로 격차가 뚜렷합니다.

이런 결과를 바탕으로 Opus 5의 안전장치도 조정되었습니다. 사이버보안 분류기는 Fable 5보다 비례적으로 덜 제한적으로 설계되어, 소스 코드에서 취약점을 찾는 작업은 허용하되 악의적 행위자와 자주 결부되는 바이너리 기반 취약점 스캐닝, 침투 테스트, 익스플로잇 생성은 차단합니다. Anthropic은 이 분류기가 Fable 5 대비 약 85% 더 적게 개입할 것으로 예상하며, Claude.ai, Claude Code, Claude Cowork에서 플래그가 걸린 요청은 기본적으로 Opus 4.8로 폴백됩니다. 이미 사이버 검증 프로그램(Cyber Verification Program, CVP)에 참여 중인 기업과 연구자는 제약이 적은 버전의 Opus 5에 곧바로 접근할 수 있습니다. 생물학 영역에서는 Opus 4.8과 비슷한 수준의 안전장치를 유지하면서도, 과학 연구용으로는 현재 일반 공개된 모델 중 가장 강력한 모델이 되었습니다. 다만 장시간 이어지는 자율적 연구 작업에서는 여전히 중요한 한계가 있는데, Anthropic은 바로 이 지점에서 AI 모델의 생물학 관련 위험이 가장 크게 나타날 것으로 보고 있으며 이런 유형의 생물학 작업에서는 Mythos 5가 더 강한 모델로 남아 있습니다. 이번 공개에 맞춰, Fable 5에서 차단되던 생물학 관련 요청은 이제 Opus 4.8이 아니라 Opus 5로 라우팅됩니다.

가격과 이용 방법

Claude Opus 5는 오늘부터 모든 플랫폼에서 이용할 수 있으며, 가격은 전작 Opus 4.8과 동일하게 유지되었습니다.

항목 가격
입력 토큰 100만 토큰당 $5
출력 토큰 100만 토큰당 $25
Fast 모드 기본가의 2배 (속도는 약 2.5배)

개발자는 Claude API에서 claude-opus-5로 바로 사용을 시작할 수 있습니다. 이번 공개와 함께 베타로 제공되는 두 기능도 눈여겨볼 만합니다.

  • 대화 중 도구 변경: Claude 플랫폼에서 대화 도중에도 프롬프트 캐시를 무효화하지 않고 Claude가 사용할 수 있는 도구를 바꿀 수 있습니다.
  • 자동 폴백: API에서 안전 분류기에 걸린 요청을 다른 모델로 자동 라우팅하도록 설정할 수 있습니다. 이 기능을 켜면 API 요청이 차단되는 대신 기본적으로 항상 사용 가능한 최선의 모델로 라우팅됩니다.

이전 Opus 모델들과 마찬가지로 Opus 5는 일반 이용에 별도의 데이터 보존 요구사항이 없습니다. Opus 5를 더 잘 활용하는 방법은 Anthropic의 프롬프팅 가이드에서 확인할 수 있습니다.

:scroll: Introducing Claude Opus 5 소개 블로그

:books: Claude Opus 5 System Card

https://www.anthropic.com/claude-opus-5-system-card

더 읽어보기




이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. :hugs:

:pytorch:파이토치 한국 사용자 모임:south_korea:이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일:love_letter:로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. :smiley:

:wrapped_gift: 아래:down_right_arrow:쪽에 좋아요:+1:를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ :star_struck: