요구사항부터 Release 판단까지 연결하는
QA 엔지니어, 최성우
IT 기획·PM 20년+의 요구사항 분석·리스크 관리 경험을 LLM 품질평가와 테스트 자동화에 연결합니다.
자체 설계 RaiT 8축 평가체계와 LLM-as-a-Judge로 AI 산출물을 반복 검증합니다.
20년+간 시스템을 기획하고 프로젝트를 이끌었습니다.
이제 AI 시스템이 제대로 작동하는지 검증합니다.
// pytest · Cypress · FastAPI · Jira · LLM Judge · k6
What I Can Do
실제 프로젝트에서 사용한 역량만AI Service QA
Automation
Project / QA Management
QA Workflow
Requirement → Re-test요구사항과 Acceptance Criteria를 분석합니다.
기능 및 AI 응답의 주요 Risk를 식별합니다.
테스트 범위와 우선순위를 정의합니다.
정상 / 예외 / Edge Case를 설계합니다.
API / E2E / AI 응답 테스트를 실행합니다.
Bug를 재현하고 원인을 분석합니다.
개선사항을 도출합니다.
수정사항을 검증하고 Regression Test를 수행합니다.
Projects
공개 QA 프로젝트 9개VOC 멀티에이전트 QA 파이프라인
팀이 구현한 멀티에이전트 VOC 처리 결과를 독립 Judge 5개 항목으로 검증하고, Release 기준 미달을 근거로 HOLD를 판단했습니다.
AI 품질 평가 플랫폼
LLM 산출물을 동일한 기준으로 평가하도록 루브릭·Judge 프롬프트·스코어링 보드를 통합했습니다.
RaiT 평가 시스템
본 프로젝트에서 정의한 8개 품질지표(RE·EX·UP·ST·TR·AT·CO·PR) 기반 평가체계. 루브릭과 JSON 스키마를 직접 설계했습니다.
QA WBS · 테스트 계획
Jira Epic → Story → Task 계층과 WBS·Gantt·Kanban을 활용해 테스트 일정과 리스크를 관리했습니다.
LMS 챗봇 QA
4인 팀 프로젝트를 확장해 테스트 케이스 7건(TC-001~007)과 pytest 53건을 설계하고, 규칙 기반 검증과 API 기반 LLM 판정을 비교했습니다.
RAG 챗봇
검색 증강 생성(RAG) 챗봇을 구축하고, 근거성(Truthfulness)과 관련성(Relevance)을 중심으로 응답 품질을 검증했습니다.
Mock 기반 AI 에이전트 대시보드
로컬 Mock Agent의 정상·오류·지연 응답을 대시보드에서 재현하고 기능·성능 결과를 확인했습니다.
풀스택 웹앱
Express 백엔드와 React 프런트엔드에 Cypress E2E, Jest 통합, node:test 단위 테스트를 적용했습니다.
LangGraph 챗봇
LangGraph 기반 Agent를 구현하고 개인정보 요구·프롬프트 인젝션·정보 부족 등 안전성 시나리오를 수동 기준으로 검토했습니다.