AutoSci: 논문 수집부터 반박까지 연구 전 과정을 기억으로 자동화하는 AI 연구 에이전트

AutoSci 소개

과학 연구는 오랫동안 사람의 손이 많이 가는 일이었습니다. 연구자는 긴 프로젝트 주기 동안 문헌, 아이디어, 실험, 원고, 심사 대응을 직접 조율해야 합니다. AutoSci는 이 연구 전 과정을 논문 수집부터 반박(rebuttal)까지 자동화하면서, 프로젝트 사이를 가로질러 구조화된 지속 기억(persistent memory)을 유지하고 자신의 절차를 스스로 개선하는 것을 목표로 하는 메모리 중심(memory-centric) 에이전트 시스템입니다.

AutoSci의 특징은 기억을 시스템의 중심에 둔다는 점입니다. 대부분의 연구 보조 도구가 한 번의 작업이 끝나면 맥락을 잊는 것과 달리, AutoSci는 읽은 논문과 개념, 실험 기록, 심사 의견을 지식 그래프와 활성 메모리에 쌓아 이후 프로젝트에서 다시 활용합니다. 이 시스템은 코딩 에이전트 위에서 동작하며, 안정 버전은 Claude Code(main 브랜치)에서, 미리보기 버전은 Codex(autosci-codex)와 OpenCode(autosci-opencode)에서 각각 제공됩니다.

AutoSci는 연구 생애주기 전반을 다루는 30개 이상의 에이전트 스킬을 제공하며, Claude Code에서는 슬래시 명령(예: /init), Codex에서는 달러 명령(예: $init)으로 실행합니다. 프로젝트는 스스로를 Andrej Karpathy가 이야기한 "LLM 위키(LLM-Wiki)" 비전을 구현한 것으로 소개하며, 베이징대학교 DAIR Lab이 개발했습니다.

AutoSci의 네 가지 핵심 구성요소

논문에서 설명하는 전체 시스템(SciMem · SciFlow · SciDAG · SciEvolve)은 paper 브랜치에 정리되어 있으며, 위 개요도가 이들이 어떻게 맞물리는지 보여줍니다.

SciMem 은 AutoSci의 "진화하는 연구 두뇌"에 해당하는 기억 계층입니다. 개념·논문·주제·방법·인물 같은 지식을 담는 장기 기억(지식 그래프)과, 실험·원고·아이디어·심사처럼 수명 주기를 갖는 항목을 다루는 활성 기억으로 나뉘고, 기억에 반영하기 전에 형식과 내용을 점검하는 Trust Guard 를 둡니다.

SciFlow 는 이 기억에 근거해 연구를 진행하는 워크플로로, 문헌 조사에서 아이디어 도출, 실험, 집필, 반박에 이르는 다섯 단계로 이어집니다. SciDAG 는 선택적으로 쓰이는 확장으로, 입력에 맞는 템플릿을 불러와 연산자 DAG를 구성해 결과를 만드는 증강 단계입니다. SciEvolve 는 시스템이 자신의 동작을 감사 가능하게(auditable) 개선하는 부분으로, 신호를 감지해 새 버전으로 커밋하는 진화 절차를 담당합니다.

AutoSci가 지원하는 연구 워크플로

SciFlow의 다섯 단계는 실제 스킬로 이어집니다. 아이디어를 다듬는 /ideate, 실험을 설계하고 실행·수집·평가하는 /exp-design · /exp-run · /exp-status · /exp-eval, 특정 학회의 논문 목록에서 읽을 것을 추려 주는 /discover, 매일 새 arXiv 논문을 추천하는 /daily-arxiv, 완성된 초안을 인쇄용 학회 포스터로 바꾸는 /poster 등이 있습니다. 연구 그래프는 웹 UI(python3 tools/serve.py 실행 후 브라우저)나 Obsidian(/visualize)으로 탐색할 수 있습니다.

AutoSci는 아이디어·실험·논문 초안을 검토할 때 두 번째 LLM을 독립적인 리뷰어로 활용하는 교차 모델 검토(cross-model review)를 씁니다. 이 리뷰 LLM은 OpenAI 호환 API면 무엇이든 연결할 수 있고, 설정하지 않으면 스킬은 단일 에이전트 모드로 동작합니다.

AutoSci로 만들어진 연구 결과

저장소는 문헌 수집과 아이디어 생성부터 실험 실행과 원고 작성까지 AutoSci로 전 과정을 수행해 만든 논문 세 편을 예시로 제시합니다. GPU 커널 최적화 영역의 "Agent-driven iterative optimization of Triton GPU kernels", 신약 개발 영역의 "PTM-aware degrader target nomination via calibrated ternary-complex scoring", 그리고 LLM을 인지 모델로 다루는 "Forced Honesty Dissociates Polite Speech from Motivated Cognition in LLM Attitude Ratings" 입니다. 각 논문의 PDF는 저장소의 assets/papers 에 함께 공개되어 있습니다.

AutoSci 설치와 사용

안정 버전은 Claude Code에서 main 브랜치로 사용합니다.

git clone -b main https://github.com/skyllwt/AutoSci.git
cd AutoSci
npm install -g @anthropic-ai/claude-code
claude login
claude
# 이후 실행: /init [연구-주제]

Codex 미리보기는 autosci-codex 브랜치를 받아 setup.sh 로 준비한 뒤 $init 으로 시작합니다. 두 경우 모두 Python 3.9 이상과 Node.js 18 이상이 필요하며, Semantic Scholar나 리뷰용 LLM 같은 선택 API 키는 /setup 스킬로 구성할 수 있습니다. Claude Code는 Anthropic 프로토콜을 따르므로, Anthropic 키 대신 DeepSeek·Kimi·GLM 등 호환 엔드포인트로 연결할 수도 있습니다.

AutoSci의 라이선스

AutoSci는 MIT 라이선스로 공개되어 있어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다.

:scroll: AutoSci 논문 (arXiv)

:github: AutoSci 프로젝트 GitHub 저장소

더 읽어보기




이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. :hugs:

:pytorch:파이토치 한국 사용자 모임:south_korea:이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일:love_letter:로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. :smiley:

:wrapped_gift: 아래:down_right_arrow:쪽에 좋아요:+1:를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ :star_struck: