모든 문서를 하나의 AI 지식베이스로 PDF, Word, 프레젠테이션, 스프레드시트, 웹 문서 등을 한곳에 모아 AI가 내용을 분석하고 문서 간 연결까지 찾아주는 오픈소스 도구입니다. - 질문하면 필요한 정보 자동 검색 - 답변과 함께 출처 링크 제공 - 문서 간 정보 연결 및 분석 - 로컬 환경에서 실행해 데이터 외부 전송 없이 사용 - 완전 오픈소스 내 파일을 통째로 AI의 ‘두 번째 뇌’로 만드는 프로젝트입니다. 출처:

매번 RAG 시스템을 구축할 때마다 파편화된 문서 검색 정확도와 컨텍스트 유실로 고민하게 됩니다. OpenKB 는 로컬 문서들을 모아 서로 연결된 위키 형태로 정제해 주는 오픈소스 도구입니다. 데이터 외부 유출 걱정 없이 파일 전체를 AI 지식 구조로 변환합니다.

벡터 DB 없이 지식을 축적하는 위키 컴파일 방식

기존 RAG 구조는 질문이 올 때마다 개별 문서를 새로 검색하므로 지식이 쌓이지 않습니다. OpenKB 는 안드레이 카파시가 언급한 구조처럼 문서 간 교차 참조와 개념 페이지를 자동 생성하며 지식을 축적합니다. 검색할 때마다 파편을 조립하는 대신 지식베이스 자체를 지속해서 갱신합니다.

이 과정에서 PageIndex 의 트리 인덱싱 기법을 써서 Vector DB 없이 긴 문서의 맥락을 논리적으로 추론하며, 단순 텍스트뿐 아니라 도표나 이미지 같은 시각 자료도 다중 모달로 빠르게 이해합니다.

다중 포맷 지원과 지식 활용을 돕는 레이어 구조

이 도구는 현장에서 쓰이는 다양한 문서 포맷을 곧바로 수용합니다. PDF , Word , PowerPoint , Excel , Markdown , HTML 같은 파일들을 체계적인 위키 구조로 바꾸며, 추출된 엔티티와 개념은 Google OKF 규격을 따라 동기화됩니다.

내부는 지식을 구축하는 기틀 레이어와 이를 응용하는 생성기 레이어로 나뉩니다. 1회성 질의응답부터 연속 대화, 사용자 정의 Skill Factory 추출까지 지원합니다. CLI 환경에서 명령을 실행하며 세션을 보존할 수 있습니다.

데이터 보안과 체계적 지식 관리가 필요한 환경

사내 보안 규정 때문에 민감 데이터를 외부로 보내기 어려운 조직에 잘 어울립니다. 완전 오픈소스 프로젝트여서 로컬 인프라 안에서 전 과정을 격리한 채 운용할 수 있습니다. 문서 간 모순되는 내용을 식별하고 출처 링크까지 명확히 제시합니다.

개인 연구자의 두 번째 뇌로 쓰거나 조직의 지식 관리 시스템을 새로 설계할 때 적합합니다. 로컬 기반의 축적형 AI 지식 체계를 구축하고 싶을 때 적절한 대안이 됩니다. 일회성 검색으로 소비되고 끝나는 기존 방식과 달리 지식을 지속해서 축적할 수 있습니다.

요약

  • Vector DB 없이 PageIndex 트리 인덱싱 기반으로 긴 문서의 맥락을 인지하고 다중 모달 데이터를 처리하는 지식 축적 구조
  • 질문 시점마다 일회성으로 검색하는 기존 RAG와 달리 문서 간 교차 참조와 개념 페이지를 자동으로 생성·갱신하는 위키 컴파일 방식
  • 로컬 환경에서 외부 데이터 전송 없이 PDF, Word, Excel 등 다양한 포맷의 문서를 통합 관리할 수 있는 완전 오픈소스 도구