· AI Testing
LLM Testing Vision AI Testing AI agent Testing Physical AI Testing· Data Validation
AI Ready 데이터 검증· Software Testing
SW TestingAI 에이전트(AI Agent)
생성형AI

K사는 기업 고객이 업무 목적에 맞게 생성형 AI 기능을 구성·활용할 수 있는 플랫폼을 운영하고 있습니다. 문제는 생성형 AI의 결과가 하나의 정답으로 고정되지 않는다는 점이었습니다. 같은 질문을 입력해도 표현이 달라지고, 선택한 모델에 따라 답변 구성과 응답 속도도 바뀝니다. 몇 개의 결과만 보고 품질을 판단하면, 우연히 잘 나온 사례나 일부 실패 사례에 평가 전체가 흔들릴 수 있습니다.
특히 프롬프트 생성 기능은 입력 문장을 단순히 다듬는 수준을 넘어, 업무 분야에 맞는 역할과 맥락을 반영해야 했습니다. 챗봇 응답 역시 문장의 자연스러움이 아니라, 질문 의도에서 벗어나지 않고 업무에 바로 쓸 수 있는 형태인지가 핵심이었습니다. 여러 생성형 AI 모델을 선택해 쓸 수 있는 구조인 만큼, 특정 모델에서만 좋은 결과가 나온다면 전체 기능의 품질로 보기 어렵다는 점도 풀어야 할 과제였습니다.
와이즈스톤은 생성 결과를 인상이나 일부 예시로 판단하지 않도록, 업무 분야별 입력 데이터와 판정 기준을 먼저 정의한 뒤 검증에 들어갔습니다. 고객 응대, 마케팅, 기술 분석, 번역, 보고서 작성처럼 성격이 다른 업무 영역을 폭넓게 아우르도록 입력 데이터를 구성해, 특정 업무 유형에 결과가 치우치지 않도록 했습니다.
프롬프트 생성 품질은 생성된 문장에 업무 역할이 반영되어 있는지, 입력 의도와 맥락이 유지되는지, 실제 AI 입력값으로 바로 활용 가능한 문장 구조를 갖추었는지를 함께 확인했습니다. 챗봇 응답 품질은 질문과의 관련성뿐 아니라, 응답이 핵심 의도에서 벗어나지 않는지, 업무 활용에 필요한 내용을 담고 있는지를 기준으로 검토했습니다.
모델별 품질 비교에서는 복수의 생성형 AI 모델에 동일한 질의 데이터를 입력해, 특정 모델에만 유리한 평가가 되지 않도록 공정한 기준을 적용했습니다. 마지막으로 프롬프트 생성과 챗봇 응답 각각에 대해 반복 측정을 수행해, 단일 실행 결과에 좌우되지 않는 평균 응답 속도를 함께 확인했습니다.
৹ 다양한 업무 분야에 대한 프롬프트 생성 결과의 정상 동작 여부
৹ 입력 문장의 업무 역할·맥락 반영 여부
৹ 분야별 질의에 대한 챗봇 응답의 관련성
৹ 서로 다른 생성형 AI 모델 간 응답 품질 비교
৹ 프롬프트 생성 및 챗봇 응답의 평균 반환 시간
K사는 이 검증을 통해 생성형 AI 기능이 업무 맥락을 정확히 이해하고, 어떤 모델을 선택하더라도 일관되고 빠른 응답 품질을 제공한다는 것을 데이터로 확인했습니다. 와이즈스톤은 "자연스러움"이라는 인상이 아니라 문맥 반영도, 응답 관련성, 반환 속도라는 정량 기준으로 접근해, 개발자가 프로덕션에 그대로 가져다 쓸 수 있는 수준의 신뢰를 검증했습니다.