Awesome Harness Engineering 소개
Awesome Harness Engineering는 하네스 엔지니어링(harness engineering)에 관한 글, 플레이북, 벤치마크, 명세, 오픈소스 프로젝트를 한데 모은 큐레이션 목록입니다. 프로젝트는 하네스 엔지니어링을 "the practice of shaping the environment around AI agents so they can work reliably" 라고 정의합니다. 모델 자체가 아니라 에이전트를 둘러싼 환경을 설계해 안정적으로 일하게 만드는 실천 이라는 관점입니다.
이 목록은 하네스 엔지니어링이 컨텍스트 엔지니어링, 평가, 관측성, 오케스트레이션, 안전한 자율성, 소프트웨어 아키텍처가 교차하는 지점에 있다고 봅니다. 그래서 일반적인 에이전트 도구가 아니라 오래 도는 코딩·연구 작업에서 에이전트를 더 신뢰할 수 있게 만드는 자료 에 초점을 둡니다. 저장소는 "Generic agent tooling is out of scope unless the page directly covers harness design, context management, evaluation, runtime control, or other reliability-critical harness primitives." 라며 수록 범위를 명시적으로 좁혀 두었습니다.
각 항목은 단순 링크 나열이 아니라 한두 문장의 설명이 붙어 있어, 자료를 클릭하기 전에 무엇을 다루는지 가늠할 수 있습니다. OpenAI, Anthropic, LangChain, Thoughtworks 같은 곳의 1차 자료성 글과 SWE-bench, Terminal-Bench 같은 벤치마크, SWE-agent, Harbor 같은 참조 구현이 함께 담겨 있습니다.
Awesome Harness Engineering의 분류 체계
이 목록은 100개가 넘는 자료를 여덟 개의 주요 카테고리로 나눕니다. 각 카테고리가 하네스를 설계할 때 마주치는 서로 다른 국면에 대응합니다.
| 카테고리 | 다루는 내용 |
|---|---|
| 학습 코스(Courses & Learning Resources) | Codex와 Claude Code를 더 신뢰할 수 있게 만드는 프로젝트 기반 학습 코스 저장소 |
| 기초(Foundations) | 하네스 엔지니어링의 정의와 핵심 개념을 다룬 OpenAI, Anthropic, LangChain, Thoughtworks 등의 글 |
| 컨텍스트·메모리·작업 상태(Context, Memory & Working State) | 컨텍스트 윈도우를 작업 메모리 예산으로 관리하는 방법, CLAUDE.md 작성법 |
| 제약·가드레일·안전한 자율성(Constraints, Guardrails & Safe Autonomy) | 승인 마찰을 줄이는 샌드박싱, 프롬프트 인젝션 완화, 도구 인터페이스 설계 |
| 명세·에이전트 파일·워크플로 설계(Specs, Agent Files & Workflow Design) | AGENTS.md, GitHub Spec Kit, 12-Factor Agents 같은 명세 주도 방법론 |
| 평가·관측성(Evals & Observability) | 에이전트 트레이스를 반복 가능한 평가로 바꾸는 방법, OpenTelemetry 기반 계측 |
| 벤치마크(Benchmarks) | SWE-bench, Terminal-Bench, OSWorld, WebArena 등 하네스 품질을 비교하는 벤치마크 |
| 런타임·하네스·참조 구현(Runtimes, Harnesses & Reference Implementations) | SWE-agent, deepagents, Harbor, AgentKit 같은 실제 하네스 구현 |
벤치마크 섹션은 "These benchmarks are especially useful when you want to compare harness quality, not just model quality." 라고 설명합니다. 같은 모델이라도 컨텍스트 처리, 도구 호출, 환경 제어, 검증 로직 같은 하네스 수준의 선택에 따라 결과가 달라지므로, 모델이 아니라 하네스를 비교하는 도구로 벤치마크를 활용하라는 관점입니다.
Awesome Harness Engineering의 카테고리별 주요 자료
학습 코스(Courses & Learning Resources)
목록을 만든 walkinglabs가 직접 운영하는 learn-harness-engineering 저장소가 있습니다. Electron 기반 개인 지식 베이스 앱을 소재로 Codex와 Claude Code를 더 신뢰할 수 있게 만드는 프로젝트 기반 코스로, 강의 자료와 예제 산출물, 실습용 하네스 프로젝트가 함께 제공됩니다.
기초(Foundations)
하네스 엔지니어링이라는 관점을 세운 1차 자료 11건이 모여 있습니다. OpenAI의 Harness engineering: leveraging Codex in an agent-first world는 아키텍처 제약, 저장소 로컬 지침, 브라우저 검증, 텔레메트리를 동원해 Codex로 대형 애플리케이션을 만든 현장 보고서이고, Anthropic의 Effective harnesses for long-running agents는 초기화 에이전트, 기능 목록, init.sh, 자가 검증, 여러 컨텍스트 윈도우를 넘나드는 인계 산출물 같은 구체적인 패턴을 다룹니다. LangChain의 The Anatomy of an Agent Harness는 에이전트를 모델과 하네스의 합으로 분해하고, Martin Fowler 사이트에 실린 Harness Engineering은 하네스 작업을 컨텍스트 엔지니어링, 아키텍처 제약, 엔트로피에 맞서는 가비지 컬렉션(garbage collection)으로 정리합니다.
실무 글만 있는 것은 아닙니다. 하네스 계층을 제어(control), 행위 주체성(agency), 런타임(runtime)으로 나누는 CAR 분해와 하네스 설계를 구조적으로 보고하기 위한 HarnessCard를 제안한 포지션 페이퍼, 그리고 여러 하네스 위의 계층(멀티 에이전트가 공유하는 공유지와 인간의 관리 주기)을 다루는 Many Hands Engineering 핸드북처럼 하네스를 연구 대상으로 다루는 자료도 포함되어 있습니다.
컨텍스트, 메모리, 작업 상태(Context, Memory & Working State)
컨텍스트 윈도우를 어떻게 관리할지에 대한 자료입니다. Anthropic의 Effective context engineering for AI agents는 컨텍스트 윈도우를 쏟아붓는 공간이 아니라 작업 메모리 예산으로 관리하라는 관점을 제시하고, Manus의 Context Engineering for AI Agents: Lessons from Building Manus는 KV 캐시 지역성, 도구 마스킹, 파일시스템을 메모리로 쓰는 법, 유용한 실패를 컨텍스트에 남겨두는 법까지 다루는 상세한 플레이북입니다. OpenHands의 컨텍스트 압축(context condensation) 설계 글은 목표, 진행 상황, 핵심 파일, 실패한 테스트를 보존하면서 대화 메모리를 한정된 크기로 유지하는 방법을 설명합니다. 에이전트가 반복해서 따를 수 있는 저장소 로컬 지침을 만드는 HumanLayer의 Writing a good CLAUDE.md도 이 섹션에 있습니다.
제약, 가드레일, 안전한 자율성(Constraints, Guardrails & Safe Autonomy)
에이전트에게 자율성을 주면서도 통제를 잃지 않는 방법을 다룹니다. Anthropic의 Claude Code 샌드박싱 글은 더 나은 샌드박싱과 정책 설계로 승인 마찰을 줄이는 방법을, Writing effective tools for agents는 모델이 올바르고 안전하게 호출하기 쉬운 도구 인터페이스 설계를 다룹니다. OpenHands의 프롬프트 인젝션 완화 가이드는 확인 모드, 분석기, 샌드박싱, 하드 정책 같은 실전 수단을 정리합니다. 글만 있는 것은 아니어서, 배포 전 CI 단계에서 섀도 캐퍼빌리티, LLM 컨텍스트로 흘러드는 자격 증명, 검증되지 않은 MCP 엔드포인트 같은 에이전트 위험을 잡아내는 정적 스캐너 Lurkr도 포함됩니다.
명세, 에이전트 파일, 워크플로 설계(Specs, Agent Files & Workflow Design)
저장소 로컬 지침 형식인 AGENTS.md와 agent.md, 명세 주도 개발을 위한 GitHub Spec Kit, 그리고 Kiro와 spec-kit, Tessl 세 도구를 비교한 Thoughtworks의 글이 있습니다. 프로덕션 에이전트의 운영 원칙(명시적 프롬프트, 상태 소유권, 깔끔한 일시정지와 재개)을 담은 HumanLayer의 12 Factor Agents와 그 운영 중심 자매편인 12-Factor AgentOps도 이 섹션에 있습니다.
평가와 관측성(Evals & Observability)
에이전트 트레이스를 반복 가능한 평가로 바꾸는 방법론이 중심입니다. OpenAI의 Testing Agent Skills Systematically with Evals는 JSONL 로그와 결정론적 검사로 평가를 만드는 구체적인 가이드이고, 영국 AISI의 Inspect AI는 solver, scorer, 샌드박싱, 도구 사용, 로그 뷰어 프리미티브를 갖춘 오픈소스 평가 프레임워크입니다. OpenTelemetry GenAI 시맨틱 컨벤션은 하네스 트레이스를 관측성 백엔드 간에 이식 가능하게 유지하는 표준입니다.
특히 눈에 띄는 자료는 Anthropic의 Quantifying infrastructure noise in agentic coding evals로, 런타임 설정만으로 코딩 벤치마크 점수가 리더보드 상의 격차보다 크게 움직일 수 있음을 보입니다. LangChain의 Improving Deep Agents with harness engineering은 모델을 바꾸지 않고 하네스 변경만으로 벤치마크 성능이 유의하게 개선된다는 증거를 제시합니다.
벤치마크(Benchmarks)
가장 큰 섹션으로, 40개의 벤치마크와 리더보드가 영역별로 망라되어 있습니다.
-
코딩: 실제 GitHub 이슈를 다루는 SWE-bench Verified, 터미널 네이티브 에이전트를 위한 Terminal-Bench, 실제 저장소 히스토리에서 추출한 연속된 마일스톤으로 장기 회귀 누적을 측정하는 EvoClaw, 취약점 재현과 패치를 다루는 보안 벤치마크 SEC-bench
-
컴퓨터 사용: Ubuntu, Windows, macOS에 걸친 369개 작업을 담은 OSWorld와 MCP 확장판 OSWorld-MCP
-
웹: 자체 호스팅 가능한 WebArena와 멀티모달 확장 VisualWebArena, 기업형 웹 워크플로를 다루는 WorkArena
-
MCP 통합: Notion, GitHub, Postgres 같은 실제 도구에서 MCP 통합을 스트레스 테스트하는 MCPMark, 도구 정확도와 지연 시간, 토큰 사용량을 재는 MCP Bench
-
도구 사용과 대화: 시뮬레이션된 사용자와의 동적 대화 속에서 도구 사용과 정책 준수를 평가하는 τ-Bench와 tau2-bench, 범용 어시스턴트 벤치마크 GAIA
-
이색 벤치마크: 44개 직군의 실무 과업을 수행하며 토큰 비용과 수익을 함께 관리하는 경제 벤치마크 ClawWork, 스트리트 파이터 III 대전으로 실시간 의사결정을 재는 LLM Colosseum
런타임, 하네스, 참조 구현(Runtimes, Harnesses & Reference Implementations)
실제로 들여다볼 수 있는 하네스 구현이 모여 있습니다. SWE-agent는 하네스, 프롬프트, 도구, 환경 설계를 직접 확인할 수 있는 성숙한 연구용 코딩 에이전트이고, 자매 프로젝트 SWE-ReX는 에이전트를 위한 샌드박스 코드 실행 인프라입니다. LangChain의 deepagents, Terminal-Bench 2.0과 함께 공개된 범용 평가 하네스 Harbor, Inngest의 TypeScript 툴킷 AgentKit도 있습니다.
색다른 항목으로는 while :; do cat PROMPT.md | claude-code; done 한 줄짜리 루프로 장시간 자율 코딩을 굴리는 미니멀리즘 패턴을 정리한 Geoffrey Huntley의 Ralph Wiggum as a Software Engineer, 멀티 에이전트 제안자와 평가, git worktree 격리를 이용해 하네스 자체를 자율적으로 진화시키는 Claude Code 플러그인 Harness Evolver가 있습니다. 프레임워크, 런타임, 하네스에 각각 무엇이 속하는지 경계를 정리한 LangChain의 Agent Frameworks, Runtimes, and Harnesses, Oh My!는 용어가 헷갈릴 때 먼저 읽기 좋은 글입니다.
Awesome Harness Engineering에 기여하기
이 목록은 기여를 받을 때 선호하는 자료의 조건을 분명히 밝혀 둡니다. 에이전트가 어떻게 제약되고, 평가되고, 재개되고, 관측되고, 오케스트레이션되는지를 구체적으로 다루는 자료, 그리고 원본 구현·1차 자료성 글·신호 대비 잡음이 낮은 기술 문서를 선호합니다. "If two links say the same thing, prefer the more primary, practical, and implementation-oriented one." 라는 기준도 함께 둡니다.
기여 형식과 항목 추가 가이드는 저장소의 CONTRIBUTING.md에 정리되어 있습니다.
Awesome Harness Engineering의 라이선스
Awesome Harness Engineering는 CC0 1.0로 공개되어 있습니다. CC0는 저작권을 포기해 퍼블릭 도메인에 가깝게 두는 라이선스로, 출처 표기 의무 없이 자유롭게 복제·수정·배포할 수 있습니다.
Awesome Harness Engineering GitHub 저장소
더 읽어보기
-
Agentic Harness Engineering(AHE): 관측 가능성 기반 코딩 에이전트 하네스의 자동 진화 프레임워크에 대한 연구
-
Artificial Analysis가 공개한 코딩 에이전트 벤치마크: 모델 + 하네스의 조합으로 평가한 벤치마크 결과
-
Awesome Open Source AI: 오픈소스 AI 프레임워크와 모델, 인프라를 14개 분야로 정리한 큐레이션 목록
-
Awesome AI Coding Tools: 개발자를 위한 100여가지 AI 코딩 도구 소개 목록 (feat. AI for Developers)
이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. ![]()
파이토치 한국 사용자 모임
이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일
로 보내드립니다!
텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. ![]()
아래
쪽에 좋아요
를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ ![]()
