Rag3 LLM 환각 측정 (분류체계, 정량지표, 평가파이프라인, 모니터링) 프롬프트를 잘 다듬으면 LLM 환각이 줄어든다고 생각하시는 분들 많으시죠? 저도 처음엔 그렇게 믿었습니다. 그런데 실제로 금융 도메인 RAG 시스템을 운영해보니, 프롬프트 수정은 그냥 증상 완화에 불과했습니다. 환각(Hallucination)이 언제, 얼마나, 왜 발생하는지를 숫자로 파악하지 못하면 결국 같은 실수가 반복됩니다. 이 글은 환각을 측정 가능한 엔지니어링 문제로 바꾸는 방법을 다룹니다.환각 분류체계 — 유형을 모르면 측정도 못 합니다일반적으로 LLM 환각을 그냥 "틀린 답변"으로 뭉뚱그려 보는 시각도 있는데, 실제로 써보니 오류의 성격이 완전히 달라서 같은 잣대로 재면 곤란합니다. 유형을 구분해야 비로소 어떤 지표를 적용할지 결정할 수 있습니다.크게 두 갈래로 나뉩니다. 첫 번째는 사실적 환.. 2026. 8. 19. 임베딩 모델 비교 (MTEB 벤치마크, 모델 선택, 하이브리드 검색) MTEB 리더보드 1위 모델을 골랐는데도 실제 검색 품질이 기대에 한참 못 미친 경험, 혹시 있으신가요? 저도 처음 RAG 파이프라인을 구축할 때 같은 실수를 했습니다. 임베딩 모델은 벤치마크 순위가 전부가 아니라 서비스 데이터와 검색 패턴에 맞는 선택이 훨씬 중요합니다. 이 글에서는 MTEB 벤치마크를 어떻게 읽어야 하는지, 그리고 실제 모델들 사이에서 어떤 기준으로 골라야 하는지를 경험을 섞어 풀어드립니다. MTEB 벤치마크, 평균 점수만 보면 반드시 실패합니다임베딩 모델의 성능을 비교할 때 업계 표준으로 쓰이는 도구는 MTEB(Massive Text Embedding Benchmark)입니다. 여기서 MTEB란 분류, 군집화, 검색, 재순위화 등 56개 이상의 NLP 태스크를 한꺼번에 돌려서 모델의.. 2026. 8. 18. RAG 청킹 전략 (청크 크기, 검색 정확도, Parent-Child) RAG 시스템을 구축하고 나서 "왜 이렇게 엉뚱한 답이 나오지?" 싶었던 적 있으신가요. 저도 처음에는 모델 탓을 했습니다. 더 비싼 LLM으로 바꾸면 나아지겠거니 했는데, 실제로 성능을 결정하는 건 모델이 아니라 문서를 얼마나 잘게, 얼마나 똑똑하게 자르느냐였습니다. 청크 분할(Chunking) 하나가 검색 정확도를 완전히 뒤흔든다는 걸, 직접 손으로 수십 번 실험하고 나서야 체감했습니다. 청크 크기가 검색 정확도를 결정하는 이유RAG 파이프라인의 흐름은 크게 '문서 수집 → 청킹 → 임베딩 → 벡터 검색 → 답변 생성' 다섯 단계로 나뉩니다. 이 중에서 가장 먼저, 그리고 가장 많이 망가지는 지점이 바로 청킹 단계입니다. 저도 초기에는 "어차피 자동으로 나눠주는 거 아닌가" 싶어서 기본값 그대로 쓰다.. 2026. 8. 17. 이전 1 다음