트렌드검색 · 깃허브 · 쇼핑에서 지금 뜨는 것 — 검색어는 매시, 깃허브 · 쇼핑은 매일 아침 7시 30분 · English

깃허브 · 2026년 10월 8일 기준 · 깃허브에서 보기 →

data-privacy-stack/presidio

개인정보를 찾아 지우는 도구

텍스트와 이미지 속 개인 정보를 자동으로 찾아서 가리는 방법

고객 이름이나 카드 번호가 섞인 로그 파일이나 의료 이미지를 처리할 때, 사람이 하나씩 확인하지 않아도 자동으로 민감한 부분을 찾아서 가릴 수 있습니다. Presidio는 텍스트와 이미지에서 개인 식별 정보(PII)를 탐지하고 익명화하는 오픈소스 프레임워크입니다. 최근 프로젝트가 새로운 관리 체계로 이전했다는 안내가 README 상단에 올라와 있습니다.

텍스트와 이미지를 함께 다루는 구조

Presidio는 텍스트와 이미지 두 가지 형태의 데이터를 처리합니다. 텍스트에서는 이름, 위치, 사회보장번호, 비트코인 지갑 주소, 미국 전화번호, 금융 데이터 등 다양한 유형의 민감 정보를 식별합니다. 이미지에서는 표준 이미지 형식과 DICOM 의료 이미지를 지원하며, 이미지 안에 포함된 텍스트의 PII를 가리는 모듈을 제공합니다. 이러한 기능은 Python, PySpark 워크로드, Docker, Kubernetes 등 다양한 환경에서 사용할 수 있도록 설계되었습니다.

탐지 방식과 커스터마이징

이 도구는 사전 정의된 인식기나 사용자 정의 인식기를 통해 PII를 찾습니다. 명사 인명 인식(NER), 정규식, 규칙 기반 로직, 체크섬 검증 등 여러 방법을 조합하여 문맥에 맞는 정보를 식별합니다. 여러 언어를 지원하며, 외부 PII 탐지 모델에 연결하는 옵션도 제공합니다. 조직의 특정 비즈니스 요구사항에 맞춰 탐지와 익명화 과정을 자유롭게 조정할 수 있습니다.

설치와 실행 방법

Presidio는 pip을 통해 설치하거나 Docker 이미지를 사용하거나 소스에서 빌드하여 실행할 수 있습니다. V1에서 V2로 마이그레이션하는 가이드도 제공됩니다. 개발 환경 설정부터 텍스트 및 이미지 PII 익명화까지 단계별 사용 예제가 준비되어 있어 빠르게 시작할 수 있습니다.

자동화 한계와 보완책

따라서 이 도구만으로는 부족할 수 있으며, 추가적인 시스템과 보호 장치를 함께 사용해야 합니다. 조직의 프라이버시 정책을 준수하려면 Presidio의 결과를 최종 검증하는 프로세스를 마련하는 것이 좋습니다.

숫자로 본 저장소

언어
Python
주제 태그
anonymization · data-anonymization · data-masking · data-obfuscation · data-privacy · data-redaction · de-identification · guardrails
최근 릴리스
2.2.364 · 2026년 7월 22일
마지막 커밋
2026년 10월 4일

함께 보면 좋은 저장소

AI가 이 저장소의 README를 읽고 2026년 10월 7일에 쓴 글입니다. 사실관계는 깃허브 원문이 기준입니다.

깃허브에서 보기 → · 홈페이지