AI 에이전트 실전 설계 시리즈 (8) – LLM judge와 테스트셋으로 agent eval 만들기
agent eval을 LLM judge, 테스트셋, tool trajectory, grounding, 비용과 복구 기준으로 나눠 설계하는 방법을 설명합니다.
agent eval을 LLM judge, 테스트셋, tool trajectory, grounding, 비용과 복구 기준으로 나눠 설계하는 방법을 설명합니다.
LLM judge를 AI eval에 사용할 때의 장점과 한계를 설명합니다. 평가 자동화, 편향, 기준표 설계, 사람 평가와 함께 쓰는 방법, 회귀 테스트에서 조심할 점까지 실무 기준과 예시로 차분히 정리합니다. 핵심만 봅니다.