KDI — 2026-07-31

✅ 한 것 (Done)

최근까지 끝낸 작업. 결과물(노트·커밋·파일) 링크가 있으면 같이.

  • 어제 템플릿 질의와 LLM 어려운 난이도의 질의의 비율을 2:1로 갯수를 조정하면 최적의 성능지표가 도출되는 것을 확인하였다. 따라서 LoRA를 이용한 모델 개선은 이것으로 확정한다.

🔄 하고 있는 것 (Doing)

지금 붙잡고 있는 작업과 현재 상태 한 줄.

  • 하이퍼파라미터 튜닝(PEFT, LoRA)을 적용한 E5-small 모델이 다른 사전학습 모델과 비교해 봤을 때 얼마나 좋은지 비교테스트를 수행해야한다.
  • 모델들을 GCP VM에 로드하며 테스트를 수행하던 중 GCP 용량이 가득차는 문제가 발생하였다. 팀을 위해서 나의 디스크를 모두 정리하고, 재빨리 Google Colab을 깃허브에 연동하여 클론하고 Colab Pro를 결제하여 A100 또는 G4 (제일 좋은 GPU)를 선택하여 사전학습 모델을 테스트하였다. 결과는 놀랍게도 LoRA로 PEFT 튜닝한 E5-small 모델의 승리다. 가중치가 115Million의 갯수로 다른 사전학습 모델보다 갯수가 적고 Qwen-Embedding 0.6B, 4B 모델에 비해 손색이 없는 성능지표를 가지고 있었다. 이것을 QLoRA로 프로젝트 실행 시 적용하면, Retrieval을 수행할 때 시간이 매우 단축되며 정확하게 청크 검색을 하는 결과를 이끌어낼 수 있을 것이라고 확신한다.

📋 해야 할 것 (To-Do)

다음에 할 일, 급한 순서대로.

  • 다음주 월요일에 발표, 이번주 일요일까지 보고서 작성
  • [ ]
  • [ ]

📍 어디까지 왔나 (진행 상황)

맡은 작업 기준으로 지금 위치. 퍼센트나 단계(설계/구현/검증)로.

작업진행률비고
E5-small 모델 LoRA 하이퍼파라미터 튜닝%100VeryGood
보고서 작성, 깃허브 프로젝트 마무리, 발표준비% 50QLoRA 적용은 범진님이 하시기로 했다.

🧱 막힌 것 / 메모 (선택)

블로커, 기다리는 것, 나중에 볼 링크 등.

  • 오늘까지 보고서를 작성하는 줄 알았지만 다행히 일요일까지 제출이었다. 한컴독스로 제출할 예정인데, 기간내에 꼭 작성한다.