LLM 평가셋은 어떻게 만들어야 할까: 좋아 보이는 질문만 모으면 왜 실패할까
LLM 평가셋은 예쁜 데모 질문 모음이 아니라 운영 실패를 빨리 드러내는 장치여야 합니다. positive set, negative set, boundary case, retrieval fail case, regression set 기준으로 실무형 평가셋 구조를 정리합니다.
LLM 평가셋은 예쁜 데모 질문 모음이 아니라 운영 실패를 빨리 드러내는 장치여야 합니다. positive set, negative set, boundary case, retrieval fail case, regression set 기준으로 실무형 평가셋 구조를 정리합니다.
RAG 평가셋 만드는 법을 설명합니다. positive/negative set, retrieval 실패 사례, regression set 관점에서 왜 좋은 질문만 모으면 운영에서 실패하는지 정리합니다.