The standard in AI Quality

와이즈스톤은 다양한 산업의 AI를 검증하며 품질의 기준을 만들어갑니다.

WISESTONE

와이즈스톤은 1,352건의 AI 테스트를 수행하며 AI 검증 기준을 만들어가고 있습니다.

※ 본 통계는 최근 5개년 2021.01–2025.12 기간 테스트 수행 건을 기준으로 산출됨.

추론/수학 588
언어 320
이미지/비디오 137
특화도메인 3
로보틱스/물리 150
AI 에이전트 110
음성 44
추론/수학 (Reasoning)
수학 | 예측 | 코드 | 소프트웨어
주요지표 : RMSE, MAE, GPQA, SWE-bench, 정상동작률
언어 (Language)
언어이해 | 생성 | RAG | 검색증강 | 정보추출 | OCR
주요지표 : MMLU, Chatbot Arena, ROUGE, BLEU, 검색 정확도, Recall@K F1, CER, WER
이미지/비디오 (Vision)
이미지 분류 | 객체검출 | 이미지생성 | 품질 | 세그멘테이션
주요지표 : mAP, IoU, Accuracy, SSIM, PSNR, FID, CMMD, CLIP Score, Dice, IoU
특화도메인 (Specialized)
의료 · 금융 · 법률 · 제조 · 건설 · 보안
주요지표 : 도메인별 전문 벤치마크
로보틱스/물리 (Robotics)
3D | AR·VR·XR | 자율주행 | 측위
주요지표 : RMSE(위치), NeRF 품질, mAP, 충돌회피율
AI 에이전트 (Agents)
추천 시스템 | 이상 탐지 | 예측
주요지표 : NDCG, Precision@K, AUC, F1, Recall
음성 (Speech)
STT | TTS | 화자인식
주요지표 : WER, CER, MOS

※ 본 분류는 Stanford Institute for Human-Centered AI(HAI)의 AI Index Report 2026 Chapter 2 "Technical Performance"의 구성 체계(언어·이미지/비디오·추론·특화 도메인·AI 에이전트·로보틱스·음성)를 참고하여 재구성함.

the future.

AI가 세상에 나오기 전부터,
어떻게 믿을 수 있는지를 연구해왔습니다.

모두가 "AI를 어떻게 시험하는가"를 물을 때, 와이즈스톤은 이미 답을 만들고 있었습니다.
데이터에서 시작해, 모델을 거쳐, 신뢰의 기준을 세우기까지.
이것은 그 여정의 기록입니다.

바로가기

Case stories

실제 사례를 통해 와이즈스톤의 차별화된 가치를 확인해보세요.