LLM judge는 믿어도 될까: AI 평가를 자동화할 때 생기는 편향과 한계
LLM judge를 AI eval에 사용할 때의 장점과 한계를 설명합니다. 평가 자동화, 편향, 기준표 설계, 사람 평가와 함께 쓰는 방법, 회귀 테스트에서 조심할 점까지 실무 기준과 예시로 차분히 정리합니다. 핵심만 봅니다.
LLM judge를 AI eval에 사용할 때의 장점과 한계를 설명합니다. 평가 자동화, 편향, 기준표 설계, 사람 평가와 함께 쓰는 방법, 회귀 테스트에서 조심할 점까지 실무 기준과 예시로 차분히 정리합니다. 핵심만 봅니다.
RAG reranking이 왜 필요한지 설명합니다. vector search 결과를 그대로 context에 넣을 때 생기는 문제와 reranker, hybrid search, top-k 조정의 차이를 실무 기준으로 정리합니다.
AI 에이전트를 단순 챗봇이 아니라 목표, 도구, 맥락, 상태, 검증, 승인 흐름을 가진 실행 시스템으로 이해합니다. 시리즈 1편에서 전체 설계 지도를 잡습니다.
MCP tools, resources, prompts 차이를 AI 에이전트 서버 설계 관점에서 설명합니다. 모델이 호출하는 행동, 애플리케이션이 제공하는 맥락, 사용자가 선택하는 템플릿을 구분해 봅니다.
AI agent memory eval을 테스트셋, 회귀 테스트, 비용, 실패 사례 기준으로 정리합니다. 기억 기능이 실제로 좋아졌는지 확인하는 방법을 설명합니다.
MCP 보안이 중요한 이유를 AI 에이전트의 도구 호출 관점에서 설명합니다. 권한 범위, 사용자 승인, prompt injection, 감사 로그, OAuth 흐름까지 실무 기준으로 정리합니다.