Claude Fable 5 실전 사례 60선: 코딩부터 에이전트, 벤치마크, 통합까지 한곳에 정리한 큐레이션 저장소

안녕하세요, 파이토치 코리아 여러분!

새 모델이 나올 때마다 트위터와 데모 영상에는 "이거 됩니다" 하는 글이 쏟아집니다. 그런데 막상 내 작업에 적용하려고 하면 재현 가능한 프롬프트, 실제 토큰·비용, 어떤 작업에서 무너지는지를 한곳에서 찾기가 어렵습니다. 데모는 화려한데 그 대가가 얼마인지, 어디까지가 한계인지는 잘 안 보이죠.

그래서 Claude Fable 5의 공개 사례 60개를 출처·근거 유형·날짜와 함께 정리한 저장소를 소개합니다. 핵심 원칙은 하나입니다. 과장보다 구체적 근거를 우선합니다. 각 사례에는 재현 프롬프트, 데모 링크, 비용 데이터, 한계가 함께 기록돼 있습니다.

이 저장소가 푸는 문제

모델 평가 정보가 트위터, 블로그, 벤치마크 페이지에 흩어져 있어서 "내 작업에 맞는지" 판단하기 어렵습니다. 이 저장소는 흩어진 사례를 모아서, 각 항목마다 다음을 답하도록 구성했습니다.

  • 입력: 무엇을 넣었는가 (프롬프트, 스크린샷, 코드베이스, 로그 등)
  • 처리: 어떤 도구·모델로 어떻게 돌렸는가
  • 출력: 결과물과 걸린 시간·토큰·비용
  • 근거 유형: 데모 / 튜토리얼 / 평가 / 통합 중 무엇인가

총 60개 사례를 8개 카테고리로 분류했습니다.

  • :laptop: 코딩 및 코드 생성 (사례 1–6)
  • :robot: 에이전트 및 장시간 자동화 (사례 7–8)
  • :video_game: 게임 및 인터랙티브 데모 (사례 9–12)
  • :artist_palette: 비주얼, 디자인, 비디오 및 3D (사례 13–16)
  • :books: 문서, 지식 작업 및 리서치 (사례 17–19)
  • :compass: 튜토리얼, 강좌 및 프롬프트 리소스 (사례 20–28)
  • :electric_plug: 플랫폼, API 및 도구 통합 (사례 29–34)
  • :straight_ruler: 평가, 비교 및 한계 (사례 35–60)

아래에서 카테고리별로 대표 사례를 뽑아 소개합니다.

:laptop: 코딩: 스크린샷 한 장에서 작동하는 클론까지

사례 — 스크린샷에서 GitHub UI 재현 (데모)

  • 입력: GitHub 화면 스크린샷 한 장
  • 처리: 단일 프롬프트로 작동하는 클론 생성
  • 출력: 약 10분 코딩, 비용 약 $4.07

스크린샷 → 작동하는 프론트엔드 변환의 수준을 가늠하기 좋은 사례입니다. 이 카테고리에는 단일 파일 macOS 스타일 웹 OS, 대규모 PR 리뷰 등도 포함돼 있습니다.

:robot: 에이전트: 장시간 자동화와 실제 장애 진단

사례 — 인프라 장애 진단 후 수정 PR (데모)

  • 입력: 자체 호스팅 환경에서 발생한 장애
  • 처리: 파드 로그 읽기 → Cloud SQL 에러 로그 조회 → 이미지 다이제스트 비교
  • 출력: Kubernetes가 새로 마이그레이션된 DB에 3개월 된 캐시 이미지를 띄우고 있었다는 원인을 찾아내고, 몇 분 만에 수정 PR 생성 (웹 검색 없이)

사례 — Relay 워크플로우로 사이트 재구축 (데모)

GPT-5.5와 Claude 4.8이 Figma 레퍼런스로도 85~90%에서 멈춘 작업을, 원본 Webflow 소스까지 찾아가 에셋을 내려받아 거의 한 번에 재현했습니다. 이어서 주말 동안 80페이지 신규 사이트를 만들고(에이전시 환산 약 $50k), HeyGen·ElevenLabs·Cloudflare·VPS를 연결한 클립 자동 생성 파이프라인까지 구성했다는 사례입니다. 이 사례가 제안하는 핵심 패턴이 바로 뒤에서 설명할 "relay"입니다.

:artist_palette: 비주얼·3D: 물리까지 시뮬레이션하는 결과물

사례 — Three.js 스위스 레버 시계 무브먼트 (데모)

  • 입력: 실제 기어비를 반영한 시계 무브먼트 요청
  • 처리: 18,000 bph 기어비, 작동하는 이스케이프먼트, 실시간 표시
  • 출력: 비전 기능으로 스스로 결과를 검증하며 반복 개선

사례 — Friends의 모니카 아파트 1인칭 탐색 씬 (데모)

  • 입력: 평면도
  • 처리: 단일 HTML로 3D 탐색 씬 생성
  • 출력: 비용 약 $12

이 외에 평면도→3D, 물리 기반 태양계 시뮬레이션(일식 예측)까지 있습니다.

:books: 문서·리서치: 코드베이스 마이그레이션과 심층 리서치

사례 — 전사 규모 코드 마이그레이션 (평가/인용)

Stripe가 5,000만 줄 규모 Ruby 코드베이스 전체 마이그레이션을 하루 만에 처리했고, 풀타임 팀이라면 두 달 이상 걸렸을 작업이라고 인용된 사례입니다. (단백질 설계 전문가 약 10배 가속, 분자생물학 가설 약 80% 선호 등 인용 수치도 함께 기록)

사례 — 정책 메모 워크플로우 (튜토리얼)

전체 메모를 변경 추적(track changes)으로 읽고, Projects에서 코멘트 세트를 스크린샷으로 정리해 분류 추천을 받고, 회의록을 붙여넣으면 수정사항이 tracked changes로 반영되는 워크플로우입니다.

:compass: 튜토리얼: 복붙 가능한 완성형 프롬프트

이 카테고리의 강점은 그대로 가져다 쓸 수 있는 프롬프트가 통째로 들어 있다는 점입니다.

  • DEVICE HARDENING 보안 점검 프롬프트: STEP 0 모델 자가 점검 → 인벤토리 → 11개 카테고리 점검 → 리포트 → 재실행 안내 로직까지 포함
  • /goal 전체 사이트 디자인 감사 프롬프트: 수용 기준, P0–P3 태깅, 출력 경로(docs/design-audit/README.md), 스킬로 저장하는 지시까지. 실행 비용은 xhigh effort·30분·주간 쿼터의 2%로 기록
  • Repo Audit & Improvement Plan 프롬프트: Discovery·Audit·Strategy·Task Plan 4단계, 심각도 등급, 마일스톤, 산출물 포맷 포함

프롬프트 엔지니어링 관점에서 구조를 그대로 참고하기 좋습니다.

:electric_plug: 통합: Hermes, Swarms, Cursor

  • Hermes: /model anthropic/claude-fable-5 로 설정. 장시간 /goal 실행과 cron 작업에 권장 (SWE-Bench Pro 80.3% 인용)
  • Swarms: model_name = "anthropic/claude-fable-5" 한 줄로 활성화, 출시 당일 지원, 마이그레이션 불필요
  • Cursor: 계획 비평은 Fable 5, 구현은 더 저렴한/특화 모델로 나누는 5단계 하이브리드 워크플로우

핵심 패턴: "Relay" (생각은 비싼 모델, 구현은 싼 모델)

저장소 전반에서 반복적으로 권장되는 패턴입니다. 계획·아키텍처 설계·리뷰는 Fable 5로 하고, 양이 많고 반복적인 구현은 더 저렴한 모델(4.8, GPT-5.5, Sonnet 4.6)로 돌리는 방식입니다. 한 사례의 표현을 그대로 옮기면 "Fable 5로 생각하고, 더 저렴한 모델로 만들고, Fable 5로 리뷰하세요."

비용 효율을 따지는 분이라면 이 패턴 하나만 가져가도 충분히 가치가 있습니다.

안전 라우팅 메커니즘

흥미로운 설계 하나가 있습니다. 분류기가 사이버보안·생물/화학·디스틸레이션 관련 질의를 감지하면 거부하는 대신 Claude Opus 4.8로 라우팅하고 사용자에게 알립니다. 평균적으로 세션의 5% 미만에서 작동한다고 하며, 측정값은 작업에 따라 편차가 있었습니다(Intelligence Index 약 8%, AA-Omniscience 9%, GDPval-AA 2%). 거부가 아니라 Opus 4.8이 답하는 방식이라는 점이 특징입니다.

가격과 프롬프트 캐싱

  • 입력 100만 토큰당 $10, 출력 100만 토큰당 $50
  • 프롬프트 캐싱 시 입력 90% 할인 (캐시 쓰기/읽기 $12.50 / $1 per million)
  • 요금제에서는 Opus의 2배 사용량 소모
  • Pro/Max/Team/시트 기반 Enterprise는 2026년 6월 22일까지 무료 포함, 6월 23일부터 사용 크레딧 필요

빠른 API 테스트

사례를 읽고 바로 직접 돌려볼 수 있도록 claude-fable-5 호출 예시가 포함돼 있습니다.

curl --request POST \
  --url https://direct.evolink.ai/v1/messages \
  --header 'Authorization: Bearer <token>' \
  --header 'Content-Type: application/json' \
  --data '{
    "model": "claude-fable-5",
    "max_tokens": 1024,
    "messages": [{ "role": "user", "content": "Hello, world" }]
  }'

공식 벤치마크 점수도 출처와 함께 정리돼 있습니다. 예: SWE-Bench Pro 80.3%, Terminal-Bench 2.1 88.0%, OSWorld-Verified 85.0%, ExploitBench 78.0%, FrontierCode Diamond 29.3%.

누구에게 유용한가, 그리고 한계

작업별로 모델을 비교해 고르려는 분, 재현 가능한 프롬프트를 찾는 분, Hermes·Swarms·Cursor 멀티모델 통합 예시가 필요한 분에게 맞습니다.

다만 분명히 짚어둘 점이 있습니다. 각 사례의 시간·비용·벤치마크 수치는 대부분 크리에이터나 데모가 보고한 값으로, 저장소가 출처와 함께 모아둔 것이지 독립적으로 재검증된 공식 수치가 아닙니다. 비용 편차도 매우 큽니다. 한 비교 사례에서는 같은 Physarum 시뮬레이션을 GPT-5.5(Codex)는 17분·약 $6에, Fable 5(Cursor)는 40분 이상·$360.55에 처리해 수십 배 차이가 났습니다. 즉, 도구·설정·시점에 따라 결과가 크게 달라지므로 수치는 절대값이 아니라 참고 범위로 보시는 게 안전합니다.

정리하면서

저희 EvoLink가 정리한 자료이긴 하지만, 이 글에서는 서비스 소개보다는 실제 사례와 워크플로우를 공유하는 데 초점을 맞췄습니다. 모델 하나를 평가할 때 "데모가 멋진가"보다 "내 작업에서 얼마의 시간과 비용으로 재현되는가"가 더 중요하다고 보고, 그 관점에서 60개 사례를 모았습니다.

전체 사례는 출처·근거 유형과 함께 아래 저장소에 정리해두었습니다. 한국어 README도 포함돼 있습니다.

모델 API를 직접 테스트해보고 싶으시면 아래에서 확인하실 수 있습니다.

빠진 사례 제보나 정정 요청은 저장소 이슈로 남겨주시면 반영하겠습니다. 감사합니다!


tags: claude, claude-fable-5, llm, ai-coding, agents, benchmark, prompt-engineering, developer-tools

2개의 좋아요