RAG 평가셋 만드는 법: 좋은 질문만 모으면 왜 운영에서 실패할까
RAG 평가셋 만드는 법을 설명합니다. positive/negative set, retrieval 실패 사례, regression set 관점에서 왜 좋은 질문만 모으면 운영에서 실패하는지 정리합니다.
RAG 평가셋 만드는 법을 설명합니다. positive/negative set, retrieval 실패 사례, regression set 관점에서 왜 좋은 질문만 모으면 운영에서 실패하는지 정리합니다.
LLM 평가는 왜 데모에서는 좋아 보이는데 운영에서는 다르게 느껴지는지 설명합니다. single-example 착시, 테스트셋, 실패 패턴, human review 비용까지 실무 관점으로 정리합니다.
AI 에이전트와 워크플로 자동화는 이름은 비슷하지만 다루는 문제가 다릅니다. 미리 정한 흐름을 실행하는 자동화와, 모델이 도구 선택과 다음 행동을 동적으로 결정하는 에이전트의 차이를 쉽게 설명합니다.
OpenHands를 AI 코드 에디터가 아니라 에이전트 실행 환경 관점에서 설명합니다. Claude Code·Cursor와 비교해 자율 범위, 로컬 개발 흐름, review·handoff, 실제로 더 잘 맞는 작업을 과장 없이 정리했습니다.
Windsurf를 단순한 AI 코드 편집기가 아니라 흐름 추적형 작업 환경으로 이해해봅니다. Cursor와 무엇이 다르고, 어떤 개발자와 workflow에 더 잘 맞는지 차분하게 정리했습니다.
Cursor를 단순한 AI 코드 에디터가 아니라 실제 편집 흐름 중심 도구로 이해해봅니다. Claude Code와 무엇이 다르고, 어떤 개발자와 workflow에 더 잘 맞는지 차분하게 정리했습니다.