보안이 엄격한 환경에서 RAG나 LLM을 구축할 때 개인정보 전송은 큰 부담이 됩니다. 범용 PII 도구는 한국 문서 형식을 제대로 다루지 못하는 경우가 많습니다. ko-pii 는 외부 API 없이 로컬 환경에서 한국어 개인정보 33종을 탐지하고 가명화하는 Python 라이브러리입니다.

로컬 기반 동작 구조와 지원 기능

ko-pii 의 핵심 패키지는 외부 서버나 AI 모델 연동 없이 작동합니다. Python 표준 라이브러리와 정규식 규칙, 사전, 체크섬 검증 알고리즘을 활용하여 가볍게 동작하며, 주민등록번호, 여권번호, 사업자등록번호, 카드번호 등 33종의 개인정보를 정확히 식별합니다.

가명화 처리 방식도 상황에 맞게 설정할 수 있습니다. 비가역적 마스킹이나 카테고리명 치환 기능을 기본으로 제공합니다. 별도 Vault 에 원문과 토큰의 대응 관계를 보관하면 권한이 부여된 사용자만 원래 데이터를 복원할 수 있습니다.

동일한 값에 일관된 토큰을 부여하는 방식을 적용하면, RAG 벡터 인덱싱이나 LLM 프롬프트 호출 시 전체 문맥 흐름을 보존하기 유용합니다. HWP, HWPX, DOCX, PDF, CSV, XLSX 등 실무 문서 전처리를 돕는 확장 모듈도 제공합니다.

측정 성능과 데이터셋 검증 결과

형식이 규격화된 개인정보 항목에서 우수한 탐지 정확도를 나타냅니다. 대화체 KDPII 4,891건 평가에서 F1 0.66, 행정 서식형 평가셋 540건에서 F1 0.79를 기록했습니다. 주민등록번호, 전화번호, 이메일, 사업자등록번호처럼 검증 공식이 명확한 패턴 탐지에 강점이 있습니다.

다만 일반 문장 속 인명이나 비정형 주소는 도메인 특성에 따라 오탐이나 미탐이 일어날 수 있어 사전 검증이 필요합니다. 측정 수치는 참고 지표이므로 실제 운영 전 내부 문서 30-100건을 직접 검증해 보는 편이 안전합니다.

설치는 pip install ko-pii 명령어로 진행할 수 있습니다. 별도 환경 구축 없이 웹에서 직접 점검할 수 있는 Hugging Face Space 데모와 GitHub 리포지토리가 공개되어 있습니다.

폐쇄망이나 규제 산업군에서 안전한 데이터 전처리 파이프라인을 구축하는 엔지니어에게 실용적인 도구가 됩니다.

요약

  • 외부 ML 모델이나 원격 API 연결 없이 Python 표준 라이브러리와 규칙·체크섬 알고리즘만으로 로컬 환경에서 33종의 한국어 개인정보를 탐지합니다.
  • 마스킹, 카테고리 치환, Vault 기반 토큰 복원 기능을 지원하여 RAG 인덱싱 및 LLM 호출 시 데이터 문맥 유지를 돕습니다.
  • 주민등록번호 등 서식형 데이터 탐지 성능은 뛰어나나 비정형 주소 및 인명 오탐 방지를 위해 도입 전 내부 문서 30-100건 검증을 권장합니다.