LLM 회귀 테스트는 어떻게 해야 할까: 프롬프트를 고쳤는데 왜 다른 기능이 망가질까
LLM 회귀 테스트를 프롬프트 개선 흐름에 맞춰 설명합니다. golden set, baseline, 실패 유형, 변경 기록을 나눠 작은 수정이 다른 기능을 망가뜨리지 않게 관리하는 기준을 정리합니다.
LLM 회귀 테스트를 프롬프트 개선 흐름에 맞춰 설명합니다. golden set, baseline, 실패 유형, 변경 기록을 나눠 작은 수정이 다른 기능을 망가뜨리지 않게 관리하는 기준을 정리합니다.
AI context engineering을 비용 관점에서 설명합니다. 토큰 예산, context pruning, RAG 문서 선별, 프롬프트 캐싱을 운영 기준으로 묶어 정리합니다.
AI eval이 왜 필요한지, 프롬프트 변경을 감으로 판단하지 않고 테스트셋, 기준, 실패 사례, 반복 개선 흐름으로 검증하는 방법을 정리합니다.
RAG에서 context engineering이 왜 중요한지 정리합니다. 벡터DB, retrieval, reranking, provenance, eval을 운영 관점에서 쉽게 설명합니다.
AI 에이전트란 무엇인지 챗봇과의 차이, tool use, 상태 관리, 승인 흐름, eval과 보안 관점에서 쉽게 정리합니다.
LLM 평가셋은 예쁜 데모 질문 모음이 아니라 운영 실패를 빨리 드러내는 장치여야 합니다. positive set, negative set, boundary case, retrieval fail case, regression set 기준으로 실무형 평가셋 구조를 정리합니다.