AI 에이전트 실전 설계 시리즈 (8) – LLM judge와 테스트셋으로 agent eval 만들기
agent eval을 LLM judge, 테스트셋, tool trajectory, grounding, 비용과 복구 기준으로 나눠 설계하는 방법을 설명합니다.
agent eval을 LLM judge, 테스트셋, tool trajectory, grounding, 비용과 복구 기준으로 나눠 설계하는 방법을 설명합니다.
AI 에이전트 실패를 재현하려면 최종 답변이 아니라 trace, span, retrieval, tool, memory, guardrail 로그를 나누어 남겨야 합니다.