PIKE-RAG 소개
PIKE-RAG는 검색 증강 생성(RAG)이 전문 분야의 복잡한 질의에서 겪는 한계를 해결하기 위해 Microsoft가 제안한 RAG 프레임워크입니다. 이름은 sPecIalized KnowledgE and Rationale Augmented Generation의 약자로, 전문 지식(specialized knowledge)과 추론 근거(rationale)를 함께 강화한다는 접근을 담고 있습니다.
일반적인 RAG는 외부 문서를 검색해 대형 언어 모델(LLM)의 답변을 보강하지만, 단순 검색만으로는 전문 자료에서 깊은 도메인 지식을 끌어내거나 논리적 추론을 수행하기 어렵습니다. PIKE-RAG는 이 문제를 도메인 지식을 추출·이해·적용하는 과정과, 답에 이르는 일관된 추론 논리를 세우는 과정으로 나누어 접근합니다. 부적절한 청킹으로 의미 연결이 끊기는 문제나, 임베딩 모델이 전문 용어와 별칭을 정렬하지 못해 검색 정확도가 떨어지는 문제를 다루기 위해, 맥락을 고려한 분할과 자동 용어 라벨 정렬, 다중 granularity 지식 추출 기법을 사용합니다.
PIKE-RAG의 기술 보고서는 산업용 RAG 문제를 난이도에 따라 분류하고, 사실 검색이 중심인 과제(L1)부터 사실 기반의 창의적 생성이 필요한 과제(L4)까지 서로 다른 능력에 초점을 맞춘 파이프라인을 구성할 수 있음을 보입니다. 본 게시물에서는 PIKE-RAG의 프레임워크 구조와 벤치마크 성능, 설치 방법을 정리합니다.
PIKE-RAG의 프레임워크 구조
PIKE-RAG는 여러 개의 기본 모듈로 구성되며, 각 모듈의 하위 요소를 조정해 서로 다른 능력에 특화된 RAG 시스템을 만들 수 있습니다. 위 다이어그램에 나타난 주요 모듈은 다음과 같습니다.
- 문서 파싱(File Parsing): PDF 변환, 스캔 파일 OCR, 문서 레이아웃 분석으로 다양한 형식의 도메인 문서를 처리합니다.
- 지식 추출(Knowledge Extraction): 향상된 청킹, 태깅 식별, 정제된 지식 생성으로 문서에서 지식을 뽑아냅니다.
- 지식 저장(Knowledge Storage): 텍스트, 임베딩, 이미지/표, 지식 형태로 저장합니다.
- 지식 검색(Knowledge Retrieval): 텍스트 기반 검색, 임베딩 기반 검색, 정제된 지식 검색을 지원합니다.
- 지식 조직화(Knowledge Organization): 재순위화, 집계, 구조화, 귀납으로 검색된 지식을 정리합니다.
- 지식 중심 추론(Knowledge-centric Reasoning): 다중 홉 추론, 비교 추론, 요약, 예측을 수행합니다.
- 작업 분해 및 조정(Task Decomposition & Coordination): 규칙 기반 분해, 파운데이션 모델 기반 분해, 멀티 에이전트 계획으로 복잡한 질의를 나눕니다.
이 과정에서 문서와 코퍼스, 정제된 지식을 잇는 이종 그래프(Heterogeneous Graph)를 만들어, 정보 소스 계층과 코퍼스 계층, 정제된 지식 계층을 연결합니다. 저장소의 examples/ 디렉토리에서 실제 파이프라인 구성 예시를 확인할 수 있습니다.
PIKE-RAG의 벤치마크 성능
저자들은 여러 다중 홉(multi-hop) 질의응답 데이터셋에서 PIKE-RAG를 평가했으며, 정확도(accuracy)와 F1 점수 같은 지표에서 우수한 성능을 보였다고 보고합니다. 기술 보고서에 제시된 정확도는 다음과 같습니다.
| 데이터셋 | 정확도(Accuracy) |
|---|---|
| HotpotQA | 87.6% |
| 2WikiMultiHopQA | 82.0% |
| MuSiQue | 59.6% |
세 데이터셋은 모두 여러 문서에 흩어진 정보를 통합해 단계적으로 추론해야 답할 수 있는 과제로, MuSiQue는 그중에서도 난이도가 높은 편입니다. 저자들은 PIKE-RAG가 제조, 광업, 제약 같은 분야의 질의응답 정확도를 크게 개선했다고 밝히고 있습니다. 위 수치의 실험 설정과 비교 대상은 기술 보고서에서 확인할 수 있습니다.
PIKE-RAG 설치 및 사용법
PIKE-RAG는 저장소를 복제한 뒤 파이썬 환경을 구성하고, 엔드포인트 정보를 담은 .env 파일을 만든 다음 예제 스크립트를 실행하는 순서로 시작합니다.
# 1. 저장소 복제
git clone https://github.com/microsoft/PIKE-RAG && cd PIKE-RAG
# 2. 파이썬 환경 구성은 docs/guides/environment.md 참고
# 3. 엔드포인트 정보를 담은 .env 파일 생성 (docs/guides/env_file.md 참고)
# 4. examples/ 아래의 yaml 설정을 수정한 뒤 스크립트 실행 (docs/guides/examples.md 참고)
기술 보고서의 MuSiQue 실험을 재현하는 방법은 저장소의 재현 가이드 문서에 정리되어 있습니다. 기본 모듈을 조합해 자신만의 파이프라인을 구성하거나 직접 만든 컴포넌트를 추가할 수도 있습니다.
PIKE-RAG의 라이선스
PIKE-RAG는 MIT 라이선스로 공개되어 있어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다.
PIKE-RAG 기술 보고서
PIKE-RAG 프로젝트 GitHub 저장소
더 읽어보기
-
LightRAG: 지식 그래프 기반의 이중 검색 구조로 GraphRAG보다 빠른 RAG 프레임워크 (feat. EMNLP 2025)
-
Fast GraphRAG, 더 빠르고 해석 가능한 GraphRAG 구현을 위한 프레임워크 (feat. Circlemind)
이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. ![]()
파이토치 한국 사용자 모임
이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일
로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. ![]()
아래
쪽에 좋아요
를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ ![]()

