RFP 데이터 진단 및 전처리 방향 보고

데이터 분석 및 전처리 관련하여 보고드립니다.

첨부 자료 안내

샘플 이미지 4장은 원본 RFP가 비밀유지 대상이라 볼트(공개 배포됨)에는 올리지 않고 Discord로 별도 공유합니다. 진단 노트북(RFP_데이터_진단_노트북.ipynb)과 결과 csv(hwp_진단결과.csv)도 동일하게 별도 공유합니다.

요약 결론

  • 전체 원본 데이터는 hwp 96개 + pdf 4개, 총 100개 문서.
  • 이미지 개수 상위 5개 ∪ 이미지 용량 비중 상위 5개에서 겹치는 2개를 제외해 샘플링 문서 8개를 특정, 육안 확인.
  • OCR은 사용하지 않는다. 통스캔 문서가 없고(전 문서 본문 텍스트 존재), PDF 4개도 모두 네이티브 텍스트 레이어 보유.
  • 이미지 중 2유형(구조도)·3유형(스캔 서식)만 구독 중인 클로드/코덱스로 텍스트를 추출하고, 1유형(이미지 정보 자체가 중요한 것)은 제외.

진단 노트북 주요 결과

① data_list: csv vs xlsx

  • 내용 사실상 동일 (줄바꿈 \r\n vs \n 차이, 정규화 후 97/100 문서 일치). 어느 쪽을 써도 무방.

② 제공된 ‘텍스트’ 컬럼은 심하게 잘려 있음

  • 추출 텍스트 길이: 최소 81자 ~ 최대 17,340자 (중앙값 2,536자). 수십~수백 페이지 RFP 대비 비정상적으로 짧음.
  • 문장 중간에서 끊긴 것으로 보이는 문서 95/100.
  • 본문 1KB당 추출 글자수 기준: 10자 미만 31개(32%), 20자 미만 62개(65%) → 제공된 텍스트 컬럼만으로는 부족, 원본에서 재추출 필요.
  • 최악 사례: 본문 163KB → 추출 81자 (한국발명진흥회), 162KB → 117자 (전북대 LRS).

③ HWP 내부 구조 전수 분석 (96개)

  • BodyText(실제 본문): 최소 85KB / 중앙값 168KB / 최대 555KB.
  • 본문 10KB 미만(통스캔 의심) 0개 → 전부 진짜 텍스트 문서, 문서 단위 OCR 불필요.
  • 이미지 포함 문서 95/96개, 파일 용량의 50% 이상이 이미지인 문서 73개.

④ 다이어그램 글상자 판별

  • 그림처럼 보여도 글상자로 그린 다이어그램은 문구가 BodyText에 텍스트로 존재.
  • 예: KOICA ‘목표체계’ 다이어그램의 문구(‘우즈베키스탄’, ‘목표체계’, ‘국회방송시스템’, ‘입법참여기회’) 전부 BodyText에서 검색됨 → 글상자, 별도 이미지 처리 불필요.

⑤ PDF 4개 텍스트 레이어

  • 고려대(297p/23.2만자), 서울시립대(149p/11.6만자), 서울시(75p/12.0만자), 기초과학연구원(49p/4.6만자) — 전부 네이티브 PDF, OCR 불필요. (역시 제공 텍스트 컬럼은 220~2,716자로 심하게 잘려 있음)

데이터 샘플링 과정 및 결과

(작은 로고 이미지는 제외 기준: 30KB 미만 또는 폭 300px 미만)

[A] 이미지 개수 상위 5

개수이미지 비중문서
85개96%KOICA 전자조달_[긴급] [지문] [국제] 우즈베키스탄 열린 의정활동 상하원
23개66%한국철도공사 (용역)_예약발매시스템 개량 ISMP 용역
17개39%(사)부산국제영화제_2024년 BIFF & ACFM 온라인서비스 재개발 및 행사지원
15개94%한국농어촌공사_네팔 수자원관리 정보화사업-Pilot 시스템 구축용역
14개91%한국연구재단_2024년 대학산학협력활동 실태조사 시스템(UICC) 기능개선

[B] 이미지 용량 비중 상위 5

비중개수본문문서
96%85개337KBKOICA 전자조달_[긴급] [지문] [국제] 우즈베키스탄 열린 의정활동 상하원
95%6개143KB국방과학연구소_기록관리시스템 통합 활용 및 보안 환경 구축
94%15개216KB한국농어촌공사_네팔 수자원관리 정보화사업-Pilot 시스템 구축용역
94%13개149KB한국수자원공사_수도사업장 통합 사고분석솔루션 시범구축 용역
94%5개139KB대검찰청_아태 사이버범죄 역량강화 허브(APC-HUB) 홈페이지 및 온라인 교육

육안 확인 대상 (A ∪ B, 중복 2개 제거): 8개

  1. KOICA 전자조달_[긴급] [지문] [국제] 우즈베키스탄 열린 의정활동 상하원
  2. 한국철도공사 (용역)_예약발매시스템 개량 ISMP 용역
  3. (사)부산국제영화제_2024년 BIFF & ACFM 온라인서비스 재개발 및 행사지원
  4. 한국농어촌공사_네팔 수자원관리 정보화사업-Pilot 시스템 구축용역
  5. 한국연구재단_2024년 대학산학협력활동 실태조사 시스템(UICC) 기능개선
  6. 국방과학연구소_기록관리시스템 통합 활용 및 보안 환경 구축
  7. 한국수자원공사_수도사업장 통합 사고분석솔루션 시범구축 용역
  8. 대검찰청_아태 사이버범죄 역량강화 허브(APC-HUB) 홈페이지 및 온라인 교육

이미지 유형 분류 (대형 문서 top4 육안 확인)

8개 중 파일 크기 상위 4개(KOICA 23.5MB, 농어촌공사 네팔 6.8MB, 한국수자원공사 5.3MB, 국방과학연구소 4.2MB)의 대형 이미지를 확인한 결과, 유형은 3가지:

유형설명샘플 (Discord 공유 이미지)처리 방침
1유형텍스트보다 이미지 정보 자체가 중요한 이미지네팔 댐 항공사진, 구글맵 스크린샷제외
2유형구조도 (시스템 구성도 등)KOICA 방송시스템 구성도클로드/코덱스로 텍스트 추출 → 키워드로 사용
3유형문서를 스캔화한 이미지 (행정 서식 등)국방과학연 영향평가 검토결과서 스캔클로드/코덱스로 텍스트 추출 → 본문 텍스트와 함께 임베딩

결론

  1. 1유형은 제외 — 이미지 정보 자체가 중요해 텍스트화 실익이 없음.
  2. 2유형(구조도)·3유형(스캔)은 구독 중인 클로드 또는 코덱스에 넘겨 이미지 내 텍스트만 추출. 2유형은 키워드로 사용, 3유형은 본문 텍스트와 같이 임베딩.
  3. OCR(별도 엔진)은 사용하지 않음.

앞으로 해야 할 것 (데이터 전처리 전체 맥락 제외)

  • 전체 데이터에서 2유형·3유형 이미지를 전부 따로 모아 클로드/코덱스로 텍스트화

고려사항

  • 스캔 서식에 필기체로 쓴 내용도 잘 텍스트화되는지 검증 필요 → 3유형 샘플 몇 장으로 선행 테스트 예정