Daily 협업일지 — 2026-07-30 / 김범진(데이터 처리)
[1] 오늘 날짜 / 이름 / 팀명
- 날짜: 2026-07-30
- 이름: 김범진(데이터 처리)
- 팀명: GPTPilots
[2] 오늘 맡은 역할 및 구체적인 작업 내용
오늘 당신이 맡았던 역할은 무엇이었고, 어떤 작업을 수행했나요?
예시) 데이터 전처리 파트 담당. 범주형 변수 인코딩 및 이상치 확인 코드 작성 후 팀에게 공유함.
✍️ 답변:
추출·전처리 쪽 실측 결함을 몰아서 고쳤다.
- hwp5 병합 셀(colspan/rowspan)을 보존하도록 바꿨다 — 병합이 있는 표는 HTML로 직렬화
- 중첩 표가 낱개 줄로 풀려버리던 추출 오류를 보정
- HTML 표 셀 PII 마스킹 — colspan/rowspan을 논리 그리드로 펼쳐서 담당자 성명을 치환
- 괄호 지역번호 전화 표기((0XX)XXX-XXXX)도 마스킹 — 심사 실측에서 남아 있던 5건 해소
- 생성 LLM을 Responses API로 전환하고 reasoning 요약을 /ask 응답에 노출
- CUDA 분기가 빠져서 VM에 GPU가 있는데도 조용히 CPU로 떨어지던 문제 수정
- _norm_doc_id가 확장자 앞 공백에서 매칭을 놓치던 버그 수정
- 사용자에게 보이는 출처 라벨을 data_list.csv → '공고 등록정보'로 교체
- v6 후보 풀 생성기(3모델 dense 합집합)와 로컬/GPU VM 작업 분리
[3] 오늘 작업 완료도 체크 (하나만 체크)
- 🔴 0% (시작 못함)
- 🟠 25% (시작은 했지만 진척 없음)
- 🟡 50% (진행 중, 절반 이하)
- 🔵 75% (거의 완료됨)
- 🟢 100% (완료 및 점검까지 완료)
예시) 75%: 주요 전처리 완료했지만 시각화 일부 남음
📌 간단한 근거:
추출·마스킹은 실측으로 잔존 건까지 확인해서 닫았는데, v6 풀은 단계만 나눠놓고 실제 라벨링은 아직이다.
[4] 오늘 협업 중 제안하거나 피드백한 내용이 있다면?
예시) 모델 학습 전에 EDA를 먼저 해야 한다는 의견 제안.
✍️ 답변:
사용자에게 'data_list.csv'라는 내부 파일명을 그대로 보여주면 안 된다고 지적하고 표시 문구를 바꿨다.
후보 풀 생성은 로컬에서 할 몫과 GPU VM에서 할 몫을 갈라서 돌리자고 제안했다.
[5] 오늘 분석/실험 중 얻은 인사이트나 발견한 문제점은?
예시) ‘duration’ 변수의 이상치가 모델 성능 저하에 영향을 주는 것으로 보임.
✍️ 답변:
병합 셀을 무시하고 표를 평문으로 풀면 어느 값이 어느 항목인지가 사라진다. 병합 표는 HTML로 두는 게 맞았다.
PII 마스킹이 통과한 줄 알았는데 괄호 지역번호 형식과 표 셀 안쪽에 실제로 5건이 남아 있었다 — 정규식만 믿지 말고 산출물을 직접 세어봐야 한다.
CUDA 분기 누락처럼 '느리기만 하고 에러는 안 나는' 문제가 제일 늦게 발견된다.
[6] 일정 지연이나 협업 중 어려웠던 점이 있다면?
예시) 발표자료 수정 중 겹치는 작업이 발생해 버전 충돌 있었음.
✍️ 답변:
맥 로컬은 메모리가 8GB라 큰 임베딩 모델이 안 돌아간다. 벤치마크로 한계를 재고 메모리 가드를 넣어서, 무거운 건 VM으로 넘기는 기준을 만들었다.
[7] 오늘 발표 준비나 커뮤니케이션에서 기여한 부분은?
예시) 발표용 그래프 수정 및 정렬. 질문 예상 리스트 작성해서 팀 공유.
✍️ 답변:
추출·마스킹 문제를 개별 이슈로 쪼개서 뭐가 왜 틀렸는지 커밋 메시지에 남겼다.
[8] 내일 목표 / 할 일
예시) 모델 성능 비교 실험 3개 수행 후 결과 요약, 발표자료 3p 정리
✍️ 답변:
v6 후보 풀 라벨링 진행, 임베딩 모델 승격 후 인덱스 재구축
[9] 팀장에게 한마디 (선택)
예시) 오늘 일정이 빡빡했는데 내일은 좀 여유있게 분배해주시면 좋겠어요. / 격렬한 비판 가능
✍️ 답변:
[10] 팀원 칭찬 (정말 선택)
예시) 오늘 눈에 띈 팀원의 기여, 태도, 아이디어 등
✍️ 답변: