기술인사이트

기술리포트

RAG 기반 챗봇(AI Agent) 품질 검증

‘금융권에서 서비스하는 챗봇’과 같이 오류 비용이 큰 환경에서 AI Agent(특히 내부 문서 기반 RAG)의 품질을 어떻게 구조적으로 검증할 지에 대한 내용이다. 테스트케이스가 많다는 주장만으로는 누락을 설명하기 어렵다. 국제 표준의 품질특성으로 범위를 고정하고 측정 가능한 지표와 판정 방법으로 결과를 증빙하는 접근이 필요하다.




1. 왜 ‘테스트케이스 개수’가 아니라 ‘품질 특성·지표·판정’이 중요한가


금융권 챗봇은 단순 Q&A가 아니라 금융 안내의 채널이다. 사용자는 챗봇 답변을 ‘금융사가 공식적으로 안내한 내용’처럼 받아들이고, 그 안내를 근거로 행동한다. 따라서 결함은 UI 불편보다 ‘잘못된 안내, 환각(근거 없는 단정), 민감 정보 노출, 사기/피싱 대응 실패’처럼 사고로 확산될 수 있는 형태로 나타난다.


검증 프로젝트에서 ‘이미 테스트케이스 설계를 완료했다’는 말이 의미를 가지려면, ① 은행 서비스에 필수인 품질 특성이 빠짐없이 커버 되어야 하고, ② 각 특성은 지표로 측정 가능해야 하며, ③ 판정 기준이 재현 가능해야 한다. 표준 기반 매핑(커버리지 매트릭스)은 누락을 객관적으로 드러내는 가장 빠른 방법이다.




2. 표준 기반 프레임: ISO/IEC TS 25058 품질특성으로 설계를 고정한다


AI Agent 테스트는 무작위로 케이스를 쌓는 방식이 아니라, 국제 표준의 품질 특성(주 특성/부 특성) 위에서 설계되어야 누락을 방지할 수 있다. ISO/IEC TS 25058은 AI 시스템 품질평가 관점에서 SQuaRE 품질 모델(제품 품질 + 사용 중 품질)을 기반으로 정리한 기술 명세로, AI Agent에서 중요한 강건성, 투명성, 제어 가능성, 맥락 커버리지, 위험 회피 등을 자연스럽게 테스트 구조에 연결할 수 있다.




3. RAG가 붙으면 무엇이 달라지나 - ‘검색’과 ‘근거 사용’이 품질의 중심이 된다.


RAG는 ‘질문 → 검색(retrieval) → 컨텍스트 구성 → 답변 생성’의 파이프라인을 가진다.

따라서 답변 품질을 논하려면 ‘검색이 제대로 됐는가’와 ‘가져온 근거를 답에 제대로 반영했는가’를 분리해 봐야 한다. 근거가 맞지 않으면 답변이 그럴 듯해도 사고로 이어질 수 있고, 검색이 누락되면 답변은 빈약하거나 오답이 될 가능성이 높다.



4. RAGAS 기반 핵심 지표 4종과 해석


RAGAS에서 널리 쓰이는 네 가지 지표는 Faithfulness, Answer Relevancy, Context Recall, Context Precision이다. 이 지표들은 ‘전 세계 공통 목표치’를 제공하기보다는 서비스 데이터 분포와 리스크 허용도를 기반으로 목표 범위를 정하도록 돕는 진단 프레임에 가깝다.



5. 지표 조합 기반의 원인 진단


네가지 지표는 조합으로 해석할 때 가치가 커진다.

Answer Relevancy는 높지만 Faithfulness가 낮다면 질문에는 잘 답했으나 근거 밖 단정이 섞였을 가능성이 크다.

Context Recall이 낮고 Precision이 높다면 노이즈는 적지만 필요한 문서를 못 찾아 정보가 누락되었을 가능성이 높다.

Recall이 높고 Precision이 낮다면 필요한 근거는 포함되나 불필요한 문서가 섞여 혼재·상충 위험이 커진다.

Faithfulness가 높고 Relevancy가 낮다면 근거는 인용했지만 질문 조건을 반영하지 못해 ‘원하는 답’이 되지 못한다.



6. 블랙박스 RAG 검증


금융권 프로젝트에서는 보안·거버넌스 이유로 개발 로그에 접근하기 어려운 경우가 많다. 따라서 검증은 UI에서 관찰 가능한 증거만으로 판정할 수 있어야 한다. 출처 패널/근거 보기 기능이 있다면 가장 좋고, 없다면 정답 셋 기반 검증과 반복 안정성으로 보완한다.


7. 결과 판정은 ‘게이트 → 체크리스트 → 점수(선택)’ 순으로


실무에서 가장 안전한 판정 구조는 세 단계다. 먼저 Sev0 게이트로 치명적인 실패를 즉시 걸러낸다. 그 다음 케이스 별 PASS 기준을 체크리스트로 판정하고, 마지막으로 개선 추이를 보기 위한 점수형 루브릭을 선택적으로 적용한다.






8. 금융권 RAG 챗봇 샘플 시나리오(예시)


정답형(수치/조건), 리스크형(사기/피싱), 최신성/모순형(버전 충돌)은 프로젝트 초기 합의에 특히 도움이 되는 대표 시나리오다.




9. LLM-as-a-Judge와 앙상블: 목적이 다르다


LLM-as-a-Judge는 답변을 평가하는 심판 모델이고, 앙상블은 여러 후보 답/전략을 결합해 최종 답을 더 좋게 만드는 생성 단계 기법이다.



10. 마무리


금융권 RAG기반의 챗봇 검증의 핵심은 ‘품질 특성 기반 커버리지, 지표로 측정 가능, 블랙박스 판정 가능’이다. 보안/위험 회피는 Sev0 게이트로 0건 목표를 두고, 근거 일치와 검색 품질, 관련성을 함께 해석해 원인을 분리 진단해야 한다. 아직까지 관련 표준이나 통용되는 정량적 수치가 없는 만큼 개발되는 시스템의 목적과 현실과의 괴리를 좁히려는 노력이 필요하다. 무작정 높은 수치를 정하는 것은 마치 어린아이를 데리고 에베레스트에 오르겠다고 하는 것과 다를 바가 없다.