개념 색인
RAG 검색 시스템을 이해하는 데 필요한 개념들. 각 노트는 정의 → 왜 쓰나 → 우리 프로젝트에서 순서. 실험 기록은 검색 실험 설계(무엇을 왜 어떻게 재나) · [검색 실험 결과] 참조. 전체 목차는 index.
검색 방식
| 개념 | 한 줄 |
|---|---|
| Dense 검색 | 뜻이 가까운 걸 찾는다. 현행 프로덕션 |
| BM25 | 글자가 겹치는 걸 찾는다. 고유명사·코드에 강함 |
| RRF | 두 검색기를 등수만으로 합치는 방법 |
| 크로스인코더 리랭커 | 앞단이 좁혀준 후보를 다시 정렬한다 |
| 하이브리드 검색 | Dense + BM25를 합쳐 쓰는 것 |
평가 지표
| 개념 | 한 줄 |
|---|---|
| MRR | 정답이 몇 등인가. 우리 주 지표 |
| nDCG | 정답이 여러 개일 때 위쪽에 몰려 있나 |
| Recall과 hit rate | 정답을 찾긴 했나 |
| 재현율과 정밀도 | 라벨 품질을 재는 두 축 |
| 지표 포화 | 만점이 나와서 변별력이 사라진 상태 |
데이터
| 개념 | 한 줄 |
|---|---|
| 청크와 chunk_id | 문서를 자른 조각. id가 위치 기반이라 함정이 있다 |
| 골든셋 | 정답지. 없으면 아무것도 측정 못 한다 |
| 임베딩 | 텍스트를 숫자 벡터로 바꾸는 것 |
실험 방법
| 개념 | 한 줄 |
|---|---|
| 후보 캐시 | 검색은 1회, 조합은 계산. 31분을 1초로 만든 방법 |
| 상·하한 채점 | 정답지에 없는 청크를 오답/정답 양쪽으로 세어 구간에 가둔다 |
| paired bootstrap | 평균이 오른 게 우연인지 신뢰구간으로 본다 |