정형 데이터, 어떻게 준비하고 어떻게 심사할까?
지난 블로그에서 DQ인증에 대해서 전반적으로 알아봤습니다.
이번편에서는 DQ인증 데이터 내용(정형 데이터) 에 대해서 알아보고 정형 데이터로 DQ인증을 받을 시 어떤 준비를 해야 하고 어떤 심사항목으로 심사를 하는지 알아보겠습니다.
1. 정형데이터란?
○ 정형 데이터는 일정한 형식과 구조를 갖춘 데이터로, 행(Row)과 열(Column)로 구성된 테이블 형태로 저장됩니다.
주로 관계형 데이터베이스(RDBMS)나 스프레드시트(예: Excel, Google Sheets) 등에 저장되며, 명확한 스키마와 데이터 타입이 정의되어 있어 SQL 등 질의 언어를 통해 쉽게 조회, 분석, 관리할 수 있는 것이 특징입니다.
정형 데이터는 기업의 업무 시스템에서 생성되는 고객 정보, 거래 기록, 로그 데이터 등 대부분의 업무 기반 데이터를 포함하며,
데이터 품질 측정 및 인증에 있어서도 명확한 기준에 따라 심사와 평가가 가능합니다.
정의, 종류, 특성은 아래와 같습니다.
2. 정형 데이터 심사 항목
2.1 품질 기준 및 참고 표준
○ DQ인증 정형 데이터 심사 항목은 아무런 기준 없이 생성된 것이 아닙니다. 인증기관들은 과학기술정보통신부가 제시한 「데이터 품질인증기관 지정 및 운영에 관한 지침」에서 정의하고 있는 10가지 품질기준을 토대로 ISO/IEC 25024 (데이터 품질 측정 항목 및 방법)을 참고하여 정형 데이터에 대한 심사 항목들을 도출하였습니다.
○ 품질 기준
○ 참고 표준
- 번호 : ISO/IEC 25024§
- 표준명 : Software engineering – Software product Quality Requirements and Evaluation (SQuaRE) – Data quality measurement
- 설명 : 데이터 품질의 측정 항목과 방법을 정의한 표준
2.2 심사 항목
○ 정형 데이터의 심사 항목은 14개로 구성되어 있으며 기본적인 품질 특성 점검을 위한 필수 심사 항목 7개, 활용 목적에 따라 추가적인 점검을 하는 선택 심사 항목 7개로 구성되어 있습니다.
2.3 정형 데이터 명세서
○ 각각의 심사 항목에 대해서 자세히 살펴보기 전에 정형 데이터 명세서에 대해서 알아보겠습니다.
정형 데이터 명세서는 데이터의 구조, 속성, 업무규칙 등이 명확하게 정의된 문서입니다.
DQ인증 심사는 데이터 명세서를 토대로 심사를 진행하기에 명확하게 정의된 정형 데이터 명세서가 필요합니다.
○ 정형 데이터 명세서 항목
○ 데이터 명세서 예시
2.4 정형 샘플 데이터
○ 가상의 샘플 데이터를 생성하여 어떻게 구성되어 있는지 확인해보도록 하겠습니다.
※ 샘플 데이터 내 참고 표준이나 데이터 사전은 인증 대상이 아니며, 대상을 심사하기 위한 참고 테이블이라고 생각하시면 됩니다.
○ 데이터를 살펴보면 2개의 테이블과 17개의 컬럼으로 구성되어 있습니다.
인증 대상이 아닌 참고하는 테이블이 ISO 3166 alpha-3 표준 테이블이 있는 것으로 보아 해당 표준을 참고한 컬럼이 있고, 데이터 사전에 있는 용어들을 사용하는 컬럼도 있는 것으로 분석됩니다.
3. 필수 심사 항목
○ 샘플 데이터, 데이터 명세서를 이용하여 7개의 필수 심사 항목에 대해서 어떤 방식으로 심사 하는지 설명드리도록 하겠습니다.
3.1 데이터 값 완전성
○ 데이터 값 완전성은 데이터 명세서 내 필수(Not Null)로 선언된 컬럼들 중 Null 값이 있는지를 심사하는 항목입니다.
데이터 타입에 따라 빈공백도 Null 값으로 확인합니다.
○ 샘플 데이터와 데이터 명세서를 확인 시 고객ID, 고객명 등 Not Null 체크된 컬럼들이 보이고, 해당 컬럼들의 데이터 값들 중 Null 값이 있으므로 추정 오류로 확인되었습니다.
3.2 데이터 레코드 완전성
○ 데이터 레코드 완전성은 레코드가 누락 없이 필요한 데이터를 모두 포함하고 있는지를 심사하는 항목입니다.
○ 샘플 데이터 확인 시 특정 레코드의 값들이 모든 컬럼에서 Null 값을 가지고 있습니다. 해당 데이터는 추정 오류 데이터로 구분됩니다.
3.3 구문 유효성
○ 구문 유효성은 데이터 값이 컬럼에 정해진 구문 규칙을 따르고 있는지를 심사하는 항목입니다.
○ 데이터 명세서 확인 시 고객ID 컬럼에 대한 규칙(A숫자 4자리), 담당자ID 컬럼에 대한 규칙(B숫자4자리),
날짜 컬럼에 대한 규칙(YYYY-MM-DD) 이 확인되며, 규칙이 적용된 컬럼들의 샘플 데이터 확인 시 [A103](A숫자3자리) 데이터와 [YY/MM/DD]로 구성된 추정 오류 데이터들이 확인되었습니다.
3.4 의미 유효성
○ 의미 유효성은 데이터 값이 의미적으로 유효하고 설정된 기준에 부합하는지를 심사하는 항목입니다. 즉, 데이터 명세서에 특정 컬럼의 값은 기재된 값만이 유효하다는 의미입니다.
○ 데이터 명세서 확인 시 성별 컬럼(M/F), 회원등급 컬럼(A/B/C), 이용동의 컬럼(Y/N) 이 적용되며 샘플 데이터 확인 시 해당 규칙을 어긋나는 데이터는 없으므로 추정 오류 데이터는 확인되지 않았습니다.
3.5 범위 유효성
○ 범위 유효성은 데이터 값이 허용된 범위 내에 포함되는지를 심사하는 항목입니다.
○ 데이터 명세서 확인 시 나이 컬럼(20 ~ 65)이 적용되며, 샘플 데이터 확인 시 해당 규칙에 어긋나는 데이터 값들이 없으므로 추정 오류 데이터는 확인되지 않았습니다.
3.6 관계 유효성
○ 관계 유효성은 데이터 값이 컬럼 간 또는 테이블 간의 관계규칙을 준수하는지를 심사하는 항목입니다. 관계 유효성의 대표적인 예시는 시간관계와 논리관계가 있습니다.
논리관계는 성별 컬럼이 있고 주민등록번호 앞자리 컬럼이 있다고 가정할 때 [성별 컬럼의 값이 M일 경우 주민등록번호 앞자리 컬럼은 1이어야 한다] 라는 관계 규칙이 형성될 수 있으며,
시간관계는 시작일자 컬럼과 종료일자 컬럼이 있다고 가정 시 [종료일자 컬럼의 값은 시작일자 컬럼의 값보다 빠를 순 없다] 라는 관계 규칙이 형성될 수 있습니다.
○ 데이터 명세서 확인 시 [가입일자 컬럼의 값들이 생년월일 컬럼의 값보다 빠를 수 없다] 라는 관계 규칙이 기재되어 있고,
샘플 데이터 확인 시 해당 규칙에 어긋나는 데이터 값들이 없으므로 추정 오류 데이터는 없는 것으로 확인되었습니다.
3.7 참조 무결 일광성
○ 참조 무결 일관성은 데이터 값이 테이블 간의 참조 무결성을 유지하고 있는지 심사하는 항목입니다.
○ 데이터 명세서 확인 시 고객 정보 테이블의 담당자ID와 담당자 정보 테이블의 담당자ID 간의 참조 무결 일관성 규칙이 적용되어 있고,
샘플 데이터 확인 시 [B2007]의 추정 오류 데이터가 확인되었습니다.
4. 선택 심사 항목
○ 선택 심사 항목은 데이터의 특성에 따라 추가적인 점검이 필요할 경우 적용 가능 합니다.
해당 심사 항목들도 샘플 데이터, 데이터 명세서를 이용하여 7개의 선택 심사 항목에 대해서 어떤 방식으로 심사하는지 설명 드리도록 하겠습니다.
4.1 데이터 값 정밀성
○ 데이터 값 정밀성은 정밀도 요구사항을 충족하는지를 심사하는 항목입니다.
○ 데이터 명세서 확인 시 적립포인트, 사용포인트, 잔여포인트 컬럼들의 값들이 소수점 2자리로 정밀도 요구사항으로 기재되어 있습니다. 샘플 데이터 확인 시 [1800.1]의 값은 소수점 1자리로 추정 오류로 확인되었습니다.
4.2 데이터 포맷 일관성
○ 데이터 포맷 일관성은 동일 속성에 대해 데이터 형식이 일관되게 유지되고 있는지를 심사하는 항목입니다.
예를 들어 일자 컬럼은 YYYY-MM-DD 로 일관되게 유지하고 있는지, 시간 컬럼은 HH24:MI:SS 의 형식으로 일관되게 유지하고 있는지 심사합니다.
○ 데이터 명세서 확인 시 생년월일, 가입 일자 컬럼들이 날짜 타입으로 YYYY-MM-DD 형식으로 기재되어 있습니다. 샘플 데이터 확인 시 [95/12/31]의 데이터 값이 상이하여 추정 오류 데이터로 확인되었습니다.
4.3 공통 어휘 일관성
○ 공통 어휘 일관성은 데이터 사전에 정의된 공통 용어가 정확히 사용되고 있는지 심사하는 항목입니다.
○ 데이터 명세서 확인 시 담당자 정보 테이블의 직급 컬럼이 데이터 사전의 직급 컬럼의 값들로 사용되고 있는 것을 확인할 수 있고, 샘플 데이터 확인 시 [선임 연구원]의 값이 데이터 사전에 없으므로 추정 오류 데이터로 확인되었습니다.
4.4 메타 데이터 정확성
○ 메타 데이터 정확성은 메타 데이터가 데이터 값과 정확히 일치하며 설정된 요구 사항에 부합하는지 심사하는 항목입니다.
○ 메타 데이터 확인 시 고객 정보 테이블의 컬럼들이 샘플 데이터와 상이한 것을 확인 할 수 있으며, 해당 데이터가 추정 오류 데이터로 확인되었습니다.
4.5 데이터 값 정확성
○ 데이터 값 정확성은 컬럼 간의 규칙에 따라 데이터 값이 정확한지를 심사하는 항목입니다.
○ 데이터 명세서 확인 시 잔여 포인트 컬럼의 값은 [적립 포인트-사용 포인트]의 규칙이 기재되어 있고, 샘플 데이터 확인 시 해당 규칙에 어긋나는 값이 없으므로 추정 오류 데이터는 확인되지 않았습니다.
4.6 표준 기반 데이터 접근성
○ 표준 기반 데이터 접근성은 데이터가 요구되는 표준이나 협약을 준수하여 접근할 수 있는지 심사하는 항목입니다.
○ 데이터 명세서 확인 시 담당자정보 테이블의 국적 컬럼값들이 ISO 3166-1 alpha-3 표준을 준수하고 있다고 기재되어 있고, 샘플 데이터 확인 시 [US] 데이터 값이 해당 표준에 없는 값으로 추정 오류 데이터로 확인되었습니다.
※ 의미 유효성 / 공통 어휘 일관성 / 표준 기반 데이터 접근성 차이
3가지 심사 항목 모두 적용된 컬럼의 값이 특정 값들로만 이루어져야 한다는 공통점을 가지고 있습니다.
다만 차이점은 특정 값들이 어떤 방식으로 운영되고 있는지에 따라 달라집니다.
4.7 데이터 값 유일성
○ 데이터 값 유일성은 특정 컬럼의 데이터 값이 중복되지 않고, 유일한지를 심사하는 항목입니다.
해당 심사 항목은 단일 컬럼만 적용되기도 하지만 복합 컬럼 역시 적용 가능합니다.
(예 A컬럼만 적용 가능 / A,B,C 컬럼을 묶어서 적용 가능)
○ 데이터 명세서 확인 시 고객 정보 테이블의 고객ID 컬럼과 담당자 정보 테이블의 담당자ID 컬럼이 적용되는 것을 확인할 수 있으며, 샘플 데이터 확인 시 중복되는 값이 없으므로 추정 오류 데이터는 확인되지 않았습니다.
5. 오류 데이터 개선
○ 위 3,4번 단원에서 지속적으로 추정 오류 데이터라는 용어를 사용했습니다.
추정 오류 데이터는 1차 심사 종료 후 신청기관과 협의하여 오류 수정이 이루어집니다.
수정이 완료된 데이터를 대상으로 최종 심사를 진행하게 되며, 최종 심사 결과를 토대로 인증심의위원회를 개최하여 인증의 가부를 결정하게 됩니다.
이렇듯 1차 심사만으로 인증을 진행하지 않고, 개선의 기회를 주어 데이터의 품질을 향상 시키는 것이 DQ인증의 또 다른 목적입니다.
6. 정형 데이터 심사 사례
○ 저희 와이즈스톤은 23년 11월부터 현재까지 다양한 산업 분야의 대소규모의 데이터를 대상으로 심사하였고, 인증기관 중 최대 인증 실적을 보유하고 있습니다.
데이터 구조의 복잡도와 규모에 따라 심사 전략을 차별 적용하여 심사하였고, 이 중 대표적인 기관들의 데이터 대해서 간략하게 설명 드리겠습니다.
신청 기관의 익명성 보호를 위해 기관명은 기재하지 않도록 하겠습니다.
7. 정형 데이터로 DQ인증을 위한 준비사항
○ 지금까지 정형 데이터의 DQ인증 심사항목에 대해서 알아보았습니다.
그렇다면 정형 데이터로 DQ인증을 받기 위해서 준비해야 할 것들이 무엇인지 알아보도록 하겠습니다.
7.1 데이터 명세서
○ 우선적으로 데이터 명세서가 필요합니다.
DQ인증의 경우 데이터 명세서를 기준으로 심사를 진행하게 됩니다.
보유하고 계신 데이터들에 대해서 가장 명확하고 정확하게 설명할 수 있는 문서가 데이터 명세서입니다.
명세서에는 하기 항목들에 대해서는 필수로 포함되어야 합니다.
1) 테이블 목록 : 테이블 설명 / 크기 / 범위 등
2) 컬럼 목록 : 각 컬럼들의 타입 / 제약조건 / 유효값 / 도메인 규칙 등
7.2 진단 데이터
○ 데이터 명세서와 더불어 진단 데이터를 준비하셔야 합니다.
DQ인증의 경우 지속적으로 변경되는 데이터에 대해서는 심사가 불가합니다.
실시간으로 수집되는 데이터의 경우 특정 기간으로 구분하여 데이터를 준비하시고, 해당 데이터에 대해서 변경이 불가하도록 준비하셔야 합니다.
7.3 데이터 사전 점검
○ 진단 데이터와 데이터 명세서가 준비 되셨다면 데이터 관리 Tool을 이용하여 사전 점검을 진행하시는 것도 큰 도움이 됩니다.
사전에 오류 데이터를 발견하시어 수정하시고, 각 컬럼들간의 규칙도 체크해두신다면 큰 이슈 없이 DQ인증이 진행될 것입니다.
8. 마무리..
○ 이번 글에서는 정형 데이터란 무엇인지, 그리고 정형 데이터 DQ인증의 심사 항목과 사전 준비 사항에 대해 알아보았습니다.
AI 시대에 들어서면서 비정형 데이터의 비중이 점차 커지고 있지만, 여전히 산업 전반에서는 정형 데이터가 핵심 기반으로 널리 활용되고 있습니다.
특히 RDBMS 기반으로 잘 관리되고 있다고 생각되는 정형 데이터조차, 실제로 심사를 진행해 보면 다양한 오류와 품질 문제들이 발견되는 경우가 많습니다.
이러한 오류들은 데이터를 분석·활용하는 데 큰 제약이 될 뿐 아니라, 운영 효율성과 비용 측면에서도 부담이 커질 수 있습니다.
DQ인증은 이러한 오류들을 체계적으로 진단하고 개선할 수 있는 매우 유용한 수단입니다.
이를 통해 보다 신뢰할 수 있는 정형 데이터 관리 체계를 갖추고, 활용 가치를 높이는 데 도움이 되길 바랍니다.
다음 글에서는 AI 시대의 핵심 자산인 '비정형 데이터'와 비정형 데이터에 대한 DQ인증 심사 항목에 대해 살펴보겠습니다.