1. 서론
최근 인공지능 및 데이터 기반 의사결정 기술의 확산에 따라 고품질 데이터에 대한 수요가 급격히 증가하고 있습니다.
특히, 머신 러닝·딥 러닝 모델의 성능은 학습 데이터의 양과 질에 크게 의존하기 때문에, 다양한 산업 분야에서 실제 데이터의 활용 요구가 지속적으로 확대되고 있습니다.
그러나 개인정보 보호 규제 강화, 데이터 보안 리스크, 기관 간 데이터 공유 제한 등으로 인해 실제 데이터를 직접 활용하는 데에는 구조적인 제약이 존재합니다.
[생성형 AI 개념도]
※ 출처: ‘https://news.skhynix.co.kr/all-around-ai-1/
이러한 한계를 보완하기 위한 대안으로 실제 데이터와 통계적·구조적 특성이 유사한 합성데이터(Synthetic Data)의 활용이 확대되고 있습니다.
합성데이터는 인공지능 기반 생성 모델을 통해 원본 데이터의 분포와 패턴을 학습하여 생성된 가상의 데이터로, 적절히 설계·관리될 경우 개인정보 노출 위험을 낮추면서도 실제 데이터 분석과 유사한 결과를 도출할 수 있다는 장점이 있습니다.
이에 따라 연구·개발, 테스트 환경 구축, 알고리즘 검증, 데이터 개방 및 공유 등 다양한 영역에서 활용 가능성이 높아지고 있습니다.
[GAN으로 생성한 합성데이터 예시]
그러나 합성데이터는 단순히 생성하는 것만으로 충분하지 않습니다.
생성된 데이터가 분석 목적에 부합하는 수준의 통계적 재현성을 확보하고 있는지에 대한 유용성(Utility) 검증과, 원본 데이터의 개인정보 또는 민감 정보가 재 식별 가능한 형태로 반영되지 않았는지에 대한 안전성(Safety/Privacy Protection) 검증이 반드시 병행되어야 합니다.
특히, 합성데이터의 품질이 적절히 관리되지 않을 경우, 분석 결과의 왜곡, 의사결정 오류, 잠재적 재식별 위험 증가 등 새로운 리스크가 발생할 수 있습니다.
따라서 합성데이터의 신뢰성과 활용 가능성을 확보하기 위해서는 생성 단계뿐만 아니라 검증, 심의, 승인, 활용 및 사후 관리에 이르는 전 주기적 품질 관리 체계를 수립하는 것이 중요합니다.
본 리포트는 합성데이터(비정형)의 구축부터 활용에 이르는 전 과정에서 적용 가능한 체계적인 품질 관리 방안을 제시하고, 유용성과 안전성을 동시에 확보하기 위한 검증 기준 및 관리 절차를 정립하는 데 목적이 있습니다.
2. 합성데이터의 특징
합성데이터는 실제 데이터(Real Data)의 통계적 분포, 변수 간 상관 구조, 패턴 특성을 학습하여 인공지능 기반 생성모델을 통해 새롭게 생성된 가상의 데이터로 정의할 수 있습니다.
이는 원본 데이터를 직접 복제하거나 변형한 데이터가 아니라, 원본의 통계적 특성을 모사하여 생성된 데이터라는 점에서 차별성을 가집니다.
따라서 적절한 생성 및 검증 절차를 거친 합성데이터는 실제 데이터 분석과 유사한 수준의 결과를 도출할 수 있으며, 동시에 개인정보 노출 위험을 완화할 수 있는 대안적 데이터 자원으로 활용됩니다.
합성데이터는 개인정보 보호, 보안 제한, 데이터 반출 통제, 데이터 수집 비용 등의 사유로 실제 데이터 활용이 제한되는 경우에 주로 활용됩니다.
또한 학습 데이터의 양이 부족하거나 특정 조건의 데이터가 희소한 경우에도 효과적인 보완 수단으로 사용됩니다.
일반적으로 실제 데이터의 통계적 특성을 얼마나 충실히 재현하는지에 따라 활용 가치가 평가되며, 동시에 재 식별 위험이 낮게 관리되는 수준에서 그 신뢰성이 확보됩니다.
합성데이터의 특성을 정리하면 아래와 같습니다.
[합성데이터의 특성]
[합성데이터 활용 시 이점]
3. 합성데이터의 생성 모델
합성데이터의 품질은 적용되는 생성 모델의 구조적 특성과 학습 성능에 크게 영향을 받습니다. 동일한 시드 데이터를 활용하더라도 어떤 생성 모델을 적용하느냐에 따라 통계적 재현성, 시각적 품질, 데이터 다양성, 재 식별 위험 수준 등이 달라질 수 있습니다.
따라서 합성데이터 구축 시에는 활용 목적, 데이터 유형(정형·비정형·이미지·시계열 등), 요구 정밀도 수준을 종합적으로 고려하여 적합한 생성 모델을 선정하는 것이 중요합니다.
대표적으로 활용되는 합성데이터 생성 모델은 다음과 같습니다.
1. GAN(Generative Adversarial Networks)
GAN은 생성자(Generator)와 판별자(Discriminator)로 구성된 적대적(Adversarial) 학습 기반 생성 모델입니다 생성자는 실제 데이터 분포를 모사하는 가짜 데이터를 생성하고, 판별자는 해당 데이터가 실제 데이터인지 합성 데이터인지 판별합니다.
두 모델은 경쟁적 구조 속에서 반복적으로 학습되며, 이 과정에서 생성자는 점차 실제 데이터와 구분하기 어려운 수준의 데이터를 생성하도록 고도화 됩니다.
[GAN 모델]※ 출처: ‘https://www.aitimes.kr/news/userArticlePhoto.html
2. Stable Diffusion
Stable Diffusion은 확산 모델(Diffusion Model) 계열의 대표적인 생성 모델로, 텍스트 기반 입력(Text-to-Image)을 통해 고품질 이미지를 생성하는 데 활용됩니다 확산 모델은 데이터에 점진적으로 노이즈를 추가하는 순방향 과정과, 노이즈를 제거하며 원본 분포를 복원하는 역방향 과정을 학습함으로써 데이터의 확률 분포를 정교하게 모델링합니다.
[Stable Diffusion 모델]
※ 출처: ‘https://www.databricks.com/blog/diffusion
3. SHI-GAN(Spectral Hint GAN)
SHI-GAN은 고해상도 이미지 생성을 목적으로 설계된 GAN 기반 모델로, 스펙트럼 정보(Spectral Hint)를 활용하여 세밀한 구조적 특징을 보다 정밀하게 복원하는 데 강점을 갖습니다.
고해상도 합성 이미지는 미세 구조와 세부 특징을 더욱 정밀하게 표현할 수 있어, 의료 영상 분석이나 정밀 진단 등 고정밀 분석이 요구되는 분야에서 활용 가치가 높습니다.
구조적 정보 보존 능력이 향상됨에 따라 이미지 기반 AI 모델의 성능 개선에도 기여할 수 있습니다.
종합적으로 볼 때, 합성데이터 생성 모델은 데이터 유형과 활용 목적에 따라 전략적으로 선택되어야 합니다.
GAN 계열 모델은 현실과 유사한 데이터 생성을 통해 시각적·통계적 재현성을 확보하는 데 효과적이며, Stable Diffusion과 같은 확산 모델은 조건 기반의 고품질 이미지 생성에 강점을 보입니다. SHI-GAN은 고해상도 및 정밀 이미지 생성에 특화되어 전문 분석 영역에 적합합니다.
따라서 합성데이터 품질 확보를 위해서는 단순히 최신 모델을 적용하는 것이 아니라, 구축 목적과 요구 성능 수준을 명확히 정의한 후 이에 부합하는 모델을 선정하고, 학습 안정성 관리, 과적합 방지, 결과 데이터에 대한 유용성 및 안전성 검증 절차를 병행하는 것이 필요합니다. 생성 모델 선택 단계부터 품질 관리 체계를 연계하는 것이 합성데이터 신뢰성 확보의 핵심 요소라 할 수 있습니다.
4. 합성데이터의 구축 과정
합성데이터의 구축 과정은 단순한 데이터 생성 행위에 국한되지 않으며, 기획 단계부터 생성, 검증, 활용 및 사후 관리에 이르는 전 주기적 관리 체계를 포함합니다.
일반적으로 합성데이터 구축 과정은 사전 준비 단계, 합성데이터 생성 단계, 품질 점검 단계, 활용 단계의 네 단계로 구분할 수 있습니다.
[합성데이터 생성 과정]
① 리얼데이터 (Real Data)
-합성데이터 생성을 위한 원본 데이터로, 전처리 없이 데이터 목적에 맞게 수집된 원초적인 데이터
② 시드데이터 (Seed Data)
리얼데이터에서 합성데이터를 생성하기 위해 양질의 데이터를 선별하고, 개인식별정보를 비식별화하며, 이미지 크기 조정 및 픽셀 정보를 보완하는 등 전처리를 거친 데이터
③ 합성데이터 (Synthetic Data)
시드데이터를 사용하여 비가역적 알고리즘을 적용한 모델을 통해 생성된 가상의 데이터
4-1. 사전 준비 단계
사전 준비 단계는 합성데이터 구축의 방향성과 통제 기준을 설정하는 기획·설계 단계로, 이후 생성 및 검증 단계의 품질 수준을 결정짓는 핵심 절차입니다. 이 단계에서는 기술적 실행 이전에 정책적·관리적 기준을 명확히 수립하는 것이 중요합니다.
우선 합성데이터의 구축 목적과 활용 범위를 명확히 정의합니다. 연구·개발 목적, AI 모델 학습용, 내부 테스트 환경 구축, 외부 제공 또는 데이터 개방 등 구체적 활용 시나리오를 설정하고, 해당 목적에 요구되는 품질 수준과 허용 가능한 위험 수준을 정의합니다.
다음으로 기술 설계 기준을 수립합니다.
활용 목적에 적합한 생성 모델 유형 선정, 학습 전략 수립, 검증 지표 정의(통계적 유사성 지표, 모델 성능 지표, 재식별 위험 지표 등), 품질 합격 기준 설정 등을 문서화합니다.
이 단계에서는 향후 품질 점검 단계에서 활용할 평가 기준을 사전에 정의함으로써
객관적 검증이 가능하도록 설계합니다.
사전 준비 단계의 결과는 계획서, 위험 평가서, 모델 선정 근거 문서 등의 형태로 기록·보관하여 감사 추적이 가능하도록 관리하는 것이 바람직합니다.
4-2. 합성데이터 생성 단계
합성데이터 생성 단계는 사전 준비 단계에서 수립된 기준에 따라 실제 데이터를 확보하고 전처리한 후, 생성 모델을 적용하여 합성데이터를 산출하는 기술적 실행 단계입니다.
해당 단계는 일반적으로 ① 데이터 획득·수집, ② 생성 준비, ③ 합성데이터 생성의 세 절차로 구성됩니다.
① 데이터 획득·수집
합성데이터 생성을 위한 리얼데이터를 확보하는 단계입니다.
이 과정에서는 수집 목적과 범위를 명확히 설정하고, 사전 준비 단계에서 정의한 활용 목적에 부합하는 데이터만을 선별합니다.
필요 시 내부 체크리스트를 활용하여 수집 절차의 적정성을 점검합니다.
다음으로 개인정보 보호 및 규제 준수 검토를 수행합니다.
데이터에 개인정보 또는 민감정보가 포함되어 있는지 여부를 확인하고, 관련 법령 및 내부 규정에 따른 처리 가능 범위를 검토합니다. 필요 시 법무·보안 부서와의 사전 협의를 통해 적법성 및 관리 기준을 확정합니다.
마지막으로 리얼 데이터 특성 분석 및 위험 식별을 수행합니다.
데이터 유형(정형·비정형·이미지·시계열 등), 변수 구조, 데이터 규모, 결측치 현황, 이상치 분포, 민감정보 포함 여부 등을 분석하고, 재식별 가능성 또는 과적합 위험 요인을 사전 식별합니다.
② 생성 준비 (데이터 전처리 및 시드데이터 구축)
고품질 합성데이터 생성을 위해 리얼 데이터를 정제하고 합성 생성 가능한 형태로 가공하는 단계입니다.
데이터의 다양성과 대표성을 고려하여 학습용 데이터를 선별하고, 개인정보 비식별화, 결측치 처리, 이상치 보정, 이미지 크기 표준화, 노이즈 제거, 메타데이터 정비, 합성에 불필요한 영역 제거 등의 전처리 작업을 수행합니다.
이 과정을 거쳐 생성 모델 학습에 활용될 시드 데이터(Seed Data)를 구축합니다
③ 합성데이터 생성
선정된 생성 모델과 학습 전략에 따라 합성데이터를 생성합니다.
이때 과적합 방지를 위해 학습 모니터링을 수행하고, 필요 시 조기 종료(Early Stopping) 또는 정규화 기법을 적용합니다.
생성 이후에는 특이값 존재 여부, 원본 데이터와의 과도한 유사성 여부, 개인 식별 가능성 등을 1차 점검합니다.
또한 메타데이터 복원, 형식 보정, 구조 정합성 확인 등 후처리를 수행하여 분석 가능한 형태로 정비합니다.
4-3. 합성 데이터 품질 점검
합성데이터의 품질 점검은 단순히 생성 여부를 확인하는 절차가 아니라, 해당 데이터가 사전 정의된 활용 목적에 부합하는 수준의 유용성(Utility)과 안전성(Safety)을 동시에 충족하는지 여부를 종합적으로 검증하는 단계입니다.
이를 위해 생성된 합성데이터에 대하여 통계적·기술적 검증을 수행하여 원본 데이터의 주요 분포 특성, 변수 간 상관관계, 패턴 구조 등이 적절히 재현되었는지를 평가합니다.
이 과정에서는 기초 통계량 비교, 분포 적합도 분석, 상관 구조 유지 여부 점검 등 정량적 방법을 활용하며, 실제 분석·모델링 과제에 적용하여 성능 차이를 비교함으로써 실질적 활용 가능성을 검증합니다.
또한 도메인 전문가의 정성적 검토를 병행하여 비현실적 값, 논리적 모순, 비정상적 패턴 존재 여부를 점검함으로써 데이터의 실무 적용 가능성을 확보합니다.
유용성 평가는 합성데이터가 실제 분석 또는 학습에 활용 가능한지를 판단하기 위한 절차입니다.
[유용성 평가]
① 생성 모델 비교 평가
합성데이터로 학습한 모델과 원본데이터로 학습한 모델의 성능을 비교합니다.
[검사 항목]
-정확도(Accuracy), 정밀도(Precision), 재현율(Recall), F1 Score 등 적절한 지표를 활용하여 성능 차이를 산출합니다.
성능 차이는 다음과 같이 계산합니다.
“[성능 차이 = 합성데이터 학습 모델 성능 − 원본데이터 학습 모델 성능]”
해당 성능 차이가 사전에 정의한 허용 임계값(Threshold) 이내일 경우, 합성데이터는 유용성 목표를 충족한 것으로 판단합니다. 임계값은 활용 목적과 허용 가능한 성능 저하 수준을 고려하여 사전 준비 단계에서 정의되어야 합니다.
[생성 모델 비교 평가 예시]
② VTT (Visual Turing Test)
VTT는 원본과 합성데이터를 무작위로 선별하여 합성을 구별하는 검사를 수행하여 합성을 구분하는 비율을 계산하여 검사합니다
합성 여부를 높은 정확도로 구분하지 못할 경우, 시각적 유사성이 충분히 확보된 것으로 판단할 수 있습니다. 다만, VTT는 주관적 요소가 포함될 수 있으므로 정량 지표와 병행하여 활용하는 것이 바람직합니다.
[검사 항목]
-전문가, 관계자를 대상으로 샘플 Pair* 중 합성데이터를 구분하는 테스트를 수행하여 정답 률** 측정하는 방법으로 진행 합니다
* 샘플 Pair = 원본과 합성 이미지를 동일한 수로 무작위 선별하여 원본-합성 Pair로 구성
** 정답 률 = 올바르게 예측한 샘플 수 / 전체 샘플 수
[VTT 평가 예시]
③ FID (Frechet Inception Distance)
FID는 이미지 합성 품질을 정량적으로 평가하기 위한 대표적인 지표로, 원본 이미지와 합성 이미지의 특징 분포 간 거리를 계산하여 두 데이터셋의 유사성을 측정합니다.
[검사 항목]
-원본이미지와 합성이미지의 데이터 셋의 특징을 추출 하여 수치화 한 뒤, 두 분포 간의 거리(Frechet Distance)를 계산하고 산출된 FID값이 임계 값보다 작으면 유용성 검증 만족입니다
-FID 값이 낮을수록 원본 데이터 분포와 유사함을 의미합니다.
다만, 단일 지표에 의존하기보다는 VTT, 모델 성능 비교 등과 함께 종합적으로 판단하는 것이 필요합니다.
[FID 평가 예시]
“유용성 평가”는 단일 지표로 판단하지 않으며,
통계적 재현성, 모델 성능 유지 수준, 시각적 품질 유사성을 종합적으로 고려하여 최종 판단합니다.
사전 정의된 임계 기준을 모두 충족하는 경우에만 유용성이 확보된 것으로 판단하며,
기준에 미달하는 경우에는 생성 조건을 조정하여 재생성을 수행합니다."
(2) 안정성 평가
안전성 평가는 합성데이터를 통해 원본 데이터에 포함된 특정 개인이 직접적으로 식별되거나, 간접적 추론을 통해 재 식별될 가능성이 존재하는지를 검증하는 절차입니다.
합성데이터는 원칙적으로 가상의 데이터이나, 생성 과정에서 과적합이 발생하거나 원본 데이터와 과도하게 유사한 결과가 생성될 경우 개인정보 침해 위험이 발생할 수 있습니다.
따라서 안전성 평가는 생성 단계 이후 필수적으로 수행되어야 하며, 정성적 검토와 정량적 유사도 분석을 병행하여 종합적으로 판단합니다.
안정성 평가
① 생성 과정 검증
원본 데이터 복원이 어려운 합성 생성 모델을 선택하고 적절한 데이터 전 처리 수행 여부에 대해 생성과정을 검토합니다.
[검사 항목]
-비가역적(Non-reversible) 알고리즘을 사용하였는지 여부
-완전 합성(Fully Synthetic) 방식으로 생성되었는지 여부
-원본 데이터 레코드를 직접 변형·복제하지 않았는지 여부
-개인 식별 가능 정보가 포함된 메타데이터를 제거 또는 비식별화 처리하였는지 여부
-학습 과정에서 과적합 방지 기법을 적용하였는지 여부
해당 항목은 정성 평가 항목으로 운영하며, 별도의 수치 임계 값은 적용하지 않되 점검 결과를 문서화하여 관리합니다.
생성과정 검증 예시
※ [참고] 합성데이터 생성 체크리스트 (개인정보보호위원회 제공)
② 구조적 유사성
원본- 합성 이미지 간 휘도, 대조, 구조 등을 기반으로 형태적 유사성을 측정합니다.
[검사 항목]
-원본과 과도하게 비슷하게 생성된 이미지를 탐지하는 것이 목표
-이미지의 구도, 휘도 대비를 하나의 품질 점수로 통합한 지표인 SSIM(Structural Similarity Index Measure) 지수 사용
SSIM 값이 사전에 설정한 위험 기준 이상으로 높게 측정되는 경우, 해당 이미지는 재 식별 위험 후보 군으로 분류하여 추가 검토 대상으로 지정합니다.
구조적 유사성 평가 예시
③ 지각적 유사성
지각적 유사성 평가는 LPIPS 지표를 활용하여 인간의 시각 인지 관점에서의 유사성을 측정합니다.
[검사 항목]
-원본과 과도하게 비슷하게 생성된 이미지를 탐지하는 것이 목표
-LPIPS(Learn perceptual image patch Similarity) 지수 값 사용
-지각적 유사도: 1-LPIPS (*유사할수록 1에 가까워 짐)
지각적 유사도가 일정 기준 이상으로 높게 측정되는 경우, 해당 데이터는 재 식별 위험 후보 군으로 관리합니다.
지각적 유사성 평가 예시
(3) 주관적 검증
정량적 지표만으로 판단이 어려운 경우에는 전문가의 육안 검토를 통해 재 식별 가능성 여부를 확인하며, 개인정보 식별 우려가 있다고 판단되는 데이터는 삭제 조치합니다.
[검사 내용]
-구조적 유사성, 지각적 유사성 지표가 비교적 높게 측정된 이미지 등에 대해서만 선별검사하고,
적절치 않은 이미지는 삭제
-정량 평가 부적합 데이터에 대해 사람의 주관적 검증을 통해 최종 확인
전문가 검토 결과 개인정보 식별 우려가 있다고 판단되는 합성데이터는 즉시 삭제하거나 재생성 대상으로 분류합니다.
또한 정량 평가에서 부적합 판정을 받은 데이터에 대해서는 주관적 검증을 통해 최종 판단을 내리며, 삭제·보완·재생성 여부를 결정합니다.
주관적 검증 예시
“안전성” 평가는 생성 과정의 적정성 검증, 구조적 유사성 분석, 지각적 유사성 분석, 전문가 주관적 검토를 종합적으로 고려하여 최종 판단합니다.
사전 정의된 위험 허용 기준을 초과하는 데이터는 활용 대상에서 제외하며, 필요 시 재생성 절차를 수행합니다."
※ [참고] 임계 값 선정
합성데이터의 유용성 및 안전성 평가는 사전에 정의된 임계 값을 기준으로 수행합니다.
임계 값은 사업 목적에 따라 유용성을 우선할지, 안전성을 우선할 지에 따라 설정 방식이 달라질 수 있습니다.
원본 데이터 분포를 기반으로 분위수를 활용하여 설정하거나, 식별 위험이 낮은 데이터 셋을 기준으로 반복 측정을 통해 도출하는 방법을 적용할 수 있습니다.
임계 값의 사전적의미는 어떤 현상이나 상태가 변화하는 기준점, 즉 특정 값을 넘어섰을 때 다른 상태로 바뀌는 그 경계선을 뜻합니다.
이렇게 기준이 되는 임계 값 산출 방법에는 구축 하시는 데이터 특성이 유용성이 우선인지, 안정성이 우선인지를 두고, 두가지 방법으로 나뉘게 됩니다.
① 원본의 식별 위험이 있는 것들은 유용성 일부 낮추더라도 안전성 우선으로,
② 원본 식별 위험이 적은 항목들은 유용성 우선으로 선정 합니다.
예를 들어 복부 X-Ray 합성이미지를 평가 할 경우, 유용성이 우선일 까요? 안정성이 우선일까요?
엑스레이에 만약 환자 정보가 포함되어 있다면, 안정성이 우선이 될 것입니다.
반대로, 식물 합성 이미지의 경우, 개인식별 위험이 없기 때문에 유용성이 우선이 될 것입니다.
임계값 도출 방법
유용성이 우선인 산출 방법 ①은
원본데이터를 50P% 나누어 A를 원본 B를 합성이라고 가정을 합니다 실제 B도 원본의 일부가 됩니다) 그리고 각 지표 별 측정을 100회이상 반복을 하여 측정값을 누적 한 다음, 누적 지표의 95분위수를 구해 임계 값을 도출 하게 됩니다
안정성이 우선인 산출 방법 ②는
원본을 3개로 분할하여 원본 / 합성/ 합성이라고 가정한 후에, 식별 위험도가 큰 데이터를 삭제하고 유용성이 높은 레코드를 우선 선택하여 원본A와 합성B'를 가정하고 동일하게 임계 값을 구하게 됩니다.
해당 지표 산출 방법의 원리는
완벽한 합성데이터로 실제 생성된 합성데이터 지표를 측정하는 방식이나, 완벽한 합성데이터 생성은 불가능함으로 원본의 일부를 합성으로 간주 하여 진행 하는 방식입니다.
4.4 활용 단계
모든 검증과 심의를 통과한 합성데이터만 활용 대상으로 확정하며, 승인 결과와 근거는 감사 추적이 가능하도록 기록·보관합니다.
활용 통제: 승인된 합성데이터는 사전 정의된 목적과 범위 내에서만 사용됩니다. 역할 기반 접근 통제, 사용 이력 기록, 외부 반출 시 추가 검토 절차를 적용하여 오남용을 방지합니다.
모니터링 및 재 검증: 활용 과정에서 위험 요인을 지속적으로 모니터링하고, 정책·환경 변화 발생 시 재 검증을 수행하여 데이터 안전성과 적정성을 유지합니다.
품질 및 안전성 유지: 필요 시 합성데이터를 보강하거나 재 생성하여 유용성과 안전성을 지속적으로 확보합니다.
이와 같이 전 주기적 관리 체계를 운영함으로써, 합성데이터는 분석, 연구, 모델 학습 등 다양한 목적에서 안전하고 신뢰성 있게 활용될 수 있으며, 데이터 활용과 개인정보 보호 간 균형을 안정적으로 달성할 수 있습니다.
합성데이터 생성 과정
5. 합성 데이터 품질 관리의 기본 방향
합성 데이터 품질 관리는 다음의 세 가지 방향을 중심으로 추진되어야 합니다.
첫째, 목적 적합성 확보입니다.
합성데이터는 활용 목적에 따라 요구되는 품질 수준이 상이하므로, 구축 초기 단계에서 활용 범위와 목표를 명확히 설정해야 합니다.
둘째, 유용성과 안전성의 균형 유지입니다.
데이터가 실제와 지나치게 유사할 경우 재 식별 위험이 증가할 수 있으며, 반대로 안전성만을 강조할 경우 성능이 저하될 수 있습니다.
따라서 두 요소 간의 균형을 고려한 관리가 필요합니다.
셋째, 전체 과정의 관리 체계 확립이 필요합니다.
합성데이터의 품질은 생성단계뿐만 아니라 사전준비, 생성, 품질 점검, 활용 단계에 이르기까지 전 과정에서 체계적으로 관리되어야 합니다.
6. 결론
합성데이터는 개인정보 보호와 데이터 활용을 동시에 달성할 수 있는 효과적인 수단으로, 단순한 데이터 생성에 그치지 않고 전 주기적 품질 관리가 필수적입니다.
본 리포트에서 제시한 사전 준비, 생성, 품질 점검, 활용 단계를 통해 합성데이터는 유용성과 안전성 측면에서 검증되며, 실무 분석 및 모델 학습 등 다양한 활용 목적에 적합하도록 관리될 수 있습니다.
특히, 유용성 평가는 데이터 분석·모델 학습에서 실질적 성능을 확보하는 관점에서, 안전성 평가는 원본 데이터 재 식별 위험을 최소화하는 관점에서 수행되어야 하며, 정량적 지표와 전문가 주관 평가가 함께 활용되어야 합니다.
승인된 합성데이터는 활용 범위 내에서 철저히 통제·모니터링 되며, 필요 시 재 검증과 재생성을 통해 지속적으로 품질과 안전성을 유지합니다.
이와 같은 체계적 품질 관리 절차는 합성데이터의 신뢰성을 확보하고, 데이터 활용과 개인정보 보호 간의 균형을 안정적으로 달성하는 핵심 기반이 됩니다
합성데이터의 안전하고 효과적인 활용을 위해서는 “사전준비, 생성, 품질 점검, 활용” 전 단계에 걸친 체계적인 품질관리 준수가 필수적입니다.
본 리포트에서 제시한 관리체계를 기반으로 고품질 합성데이터의 신뢰성과 활용 가치를 제고함으로써, 데이터 기반 혁신과 안전한 데이터 생태계 조성에 기여하기를 기대합니다.
[참고문헌]
https://news.skhynix.co.kr/all-around-ai-1/
https://www.aihub.or.kr/aihubnews/qlityguidance/view.do?currMenu=135&topMenu=103&nttSn=10404
https://www.aihub.or.kr/aihubnews/notice/view.do?pageIndex=6&nttSn=10386&currMenu=132&topMenu=103&searchCondition=&searchKeyword=
https://www.aitimes.kr/news/userArticlePhoto.html
https://www.databricks.com/blog/diffusion
https://www.themoonlight.io/ko/review/comparative-analysis-of-lightweight-deep-learning-models-for-memory-constrained-devices
https://www.pipc.go.kr/np/cop/bbs/selectBoardArticle.do?bbsId=BS217&mCode=D010030000&nttId=10201#LINK
https://www.pipc.go.kr/np/cop/bbs/selectBoardArticle.do?bbsId=BS074&mCode=C020010000&nttId=10871
https://www.kisa.or.kr/skin/doc.html?fn=20251015_135820_417.pdf&rs=/result/2025-10/