문서 자동화를 통한 개인 식별 정보(PII) 비식별화 자동화
현대 디지털 시대에 수많은 문서들이 디지털 형태로 관리되며, 이러한 문서들에는 종종 개인 식별 정보(PII)가 포함되어 있어 이를 적절히 관리하고 보호하는 것이 중요합니다. 특히, 의료 기록, 보험 청구서 등과 같은 문서들은 제3자와의 공유나 후속 처리 이전에 PII 비식별화가 필수적입니다. 이번 블로그 포스트에서는 아마존 AWS를 활용하여 PII 비식별화 과정을 자동화하고, 서버리스 아키텍처를 통해 이를 효율적으로 처리하는 방법을 소개합니다.
핵심 내용: AWS를 통한 PII 비식별화 자동화와 사례
전통적인 PII 비식별화 방법은 광학 문자 인식(OCR)과 패턴 매칭 또는 맞춤형 머신 러닝(ML) 모델에 의존합니다. 하지만 이러한 방법들은 문서의 품질 저하나 필드 수준의 비즈니스 로직을 쉽게 표현할 수 없고, ML 전문 지식이 필요하다는 단점이 있습니다. 이러한 한계를 극복하기 위해 AWS에서는 아마존 베드락 데이터 자동화(Amazon Bedrock Data Automation, BDA)를 활용한 완전한 서버리스 배치 아키텍처를 구축하고, 이를 통해 문서 및 이미지에서 대규모로 PII 탐지 및 비식별화를 수행할 수 있습니다.

BDA의 커스텀 블루프린트 기능을 활용하면 명명된 문서 필드를 선언하여 특정 추출을 수행할 수 있습니다. 설계된 블루프린트를 어떻게 활용하여 배치 PII 비식별화 요구 사항에 맞춘 맞춤형 PII 탐지 엔진으로 활용할 수 있는지를 보여줍니다.
실제 사례: 아마존 베드락 데이터 자동화 콘솔에서 PII 비식별화
핸드폰 콘텐츠나 손으로 작성된 의사 진술에서는 특정 PII 필드를 유지하면서, 환자의 이름과 같은 민감한 정보를 비식별화하는 것이 중요합니다. 이를 위해, BDA의 블루프린트 스키마를 활용하여 문서의 각 필드에 대한 데이터를 지정하고, 자연어 설명과 함께 변환을 적용할 수 있습니다. 결과적으로, 환자의 생년월일을 식별하고 날짜 유형 필드로 지정하여 비식별화의 정확도를 높일 수 있습니다.

결론
이번 블로그 포스트에서는 아마존 베드락 데이터 자동화와 AWS 서버리스 기술을 활용하여 PII 비식별화의 자동화를 구현하는 방법을 살펴보았습니다. 맞춤형 BDA 블루프린트를 통해 특정 필드를 자연어 명령으로 선언하고 비식별화 요구 사항에 맞춘 유연한 서버리스 파이프라인을 구축할 수 있습니다. 이를 통해 보건 기록, 금융 온보딩 양식 등 PII가 중요한 문서를 효과적으로 처리할 수 있습니다.
AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!
(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기
