RFP 데이터 진단 및 전처리 방향 보고
데이터 분석 및 전처리 관련하여 보고드립니다.
첨부 자료 안내
샘플 이미지 4장은 원본 RFP가 비밀유지 대상이라 볼트(공개 배포됨)에는 올리지 않고 Discord로 별도 공유합니다. 진단 노트북(
RFP_데이터_진단_노트북.ipynb)과 결과 csv(hwp_진단결과.csv)도 동일하게 별도 공유합니다.
요약 결론
- 전체 원본 데이터는 hwp 96개 + pdf 4개, 총 100개 문서.
- 이미지 개수 상위 5개 ∪ 이미지 용량 비중 상위 5개에서 겹치는 2개를 제외해 샘플링 문서 8개를 특정, 육안 확인.
- OCR은 사용하지 않는다. 통스캔 문서가 없고(전 문서 본문 텍스트 존재), PDF 4개도 모두 네이티브 텍스트 레이어 보유.
- 이미지 중 2유형(구조도)·3유형(스캔 서식)만 구독 중인 클로드/코덱스로 텍스트를 추출하고, 1유형(이미지 정보 자체가 중요한 것)은 제외.
진단 노트북 주요 결과
① data_list: csv vs xlsx
- 내용 사실상 동일 (줄바꿈
\r\nvs\n차이, 정규화 후 97/100 문서 일치). 어느 쪽을 써도 무방.
② 제공된 ‘텍스트’ 컬럼은 심하게 잘려 있음
- 추출 텍스트 길이: 최소 81자 ~ 최대 17,340자 (중앙값 2,536자). 수십~수백 페이지 RFP 대비 비정상적으로 짧음.
- 문장 중간에서 끊긴 것으로 보이는 문서 95/100.
- 본문 1KB당 추출 글자수 기준: 10자 미만 31개(32%), 20자 미만 62개(65%) → 제공된 텍스트 컬럼만으로는 부족, 원본에서 재추출 필요.
- 최악 사례: 본문 163KB → 추출 81자 (한국발명진흥회), 162KB → 117자 (전북대 LRS).
③ HWP 내부 구조 전수 분석 (96개)
- BodyText(실제 본문): 최소 85KB / 중앙값 168KB / 최대 555KB.
- 본문 10KB 미만(통스캔 의심) 0개 → 전부 진짜 텍스트 문서, 문서 단위 OCR 불필요.
- 이미지 포함 문서 95/96개, 파일 용량의 50% 이상이 이미지인 문서 73개.
④ 다이어그램 글상자 판별
- 그림처럼 보여도 글상자로 그린 다이어그램은 문구가 BodyText에 텍스트로 존재.
- 예: KOICA ‘목표체계’ 다이어그램의 문구(‘우즈베키스탄’, ‘목표체계’, ‘국회방송시스템’, ‘입법참여기회’) 전부 BodyText에서 검색됨 → 글상자, 별도 이미지 처리 불필요.
⑤ PDF 4개 텍스트 레이어
- 고려대(297p/23.2만자), 서울시립대(149p/11.6만자), 서울시(75p/12.0만자), 기초과학연구원(49p/4.6만자) — 전부 네이티브 PDF, OCR 불필요. (역시 제공 텍스트 컬럼은 220~2,716자로 심하게 잘려 있음)
데이터 샘플링 과정 및 결과
(작은 로고 이미지는 제외 기준: 30KB 미만 또는 폭 300px 미만)
[A] 이미지 개수 상위 5
| 개수 | 이미지 비중 | 문서 |
|---|---|---|
| 85개 | 96% | KOICA 전자조달_[긴급] [지문] [국제] 우즈베키스탄 열린 의정활동 상하원 |
| 23개 | 66% | 한국철도공사 (용역)_예약발매시스템 개량 ISMP 용역 |
| 17개 | 39% | (사)부산국제영화제_2024년 BIFF & ACFM 온라인서비스 재개발 및 행사지원 |
| 15개 | 94% | 한국농어촌공사_네팔 수자원관리 정보화사업-Pilot 시스템 구축용역 |
| 14개 | 91% | 한국연구재단_2024년 대학산학협력활동 실태조사 시스템(UICC) 기능개선 |
[B] 이미지 용량 비중 상위 5
| 비중 | 개수 | 본문 | 문서 |
|---|---|---|---|
| 96% | 85개 | 337KB | KOICA 전자조달_[긴급] [지문] [국제] 우즈베키스탄 열린 의정활동 상하원 |
| 95% | 6개 | 143KB | 국방과학연구소_기록관리시스템 통합 활용 및 보안 환경 구축 |
| 94% | 15개 | 216KB | 한국농어촌공사_네팔 수자원관리 정보화사업-Pilot 시스템 구축용역 |
| 94% | 13개 | 149KB | 한국수자원공사_수도사업장 통합 사고분석솔루션 시범구축 용역 |
| 94% | 5개 | 139KB | 대검찰청_아태 사이버범죄 역량강화 허브(APC-HUB) 홈페이지 및 온라인 교육 |
육안 확인 대상 (A ∪ B, 중복 2개 제거): 8개
- KOICA 전자조달_[긴급] [지문] [국제] 우즈베키스탄 열린 의정활동 상하원
- 한국철도공사 (용역)_예약발매시스템 개량 ISMP 용역
- (사)부산국제영화제_2024년 BIFF & ACFM 온라인서비스 재개발 및 행사지원
- 한국농어촌공사_네팔 수자원관리 정보화사업-Pilot 시스템 구축용역
- 한국연구재단_2024년 대학산학협력활동 실태조사 시스템(UICC) 기능개선
- 국방과학연구소_기록관리시스템 통합 활용 및 보안 환경 구축
- 한국수자원공사_수도사업장 통합 사고분석솔루션 시범구축 용역
- 대검찰청_아태 사이버범죄 역량강화 허브(APC-HUB) 홈페이지 및 온라인 교육
이미지 유형 분류 (대형 문서 top4 육안 확인)
8개 중 파일 크기 상위 4개(KOICA 23.5MB, 농어촌공사 네팔 6.8MB, 한국수자원공사 5.3MB, 국방과학연구소 4.2MB)의 대형 이미지를 확인한 결과, 유형은 3가지:
| 유형 | 설명 | 샘플 (Discord 공유 이미지) | 처리 방침 |
|---|---|---|---|
| 1유형 | 텍스트보다 이미지 정보 자체가 중요한 이미지 | 네팔 댐 항공사진, 구글맵 스크린샷 | 제외 |
| 2유형 | 구조도 (시스템 구성도 등) | KOICA 방송시스템 구성도 | 클로드/코덱스로 텍스트 추출 → 키워드로 사용 |
| 3유형 | 문서를 스캔화한 이미지 (행정 서식 등) | 국방과학연 영향평가 검토결과서 스캔 | 클로드/코덱스로 텍스트 추출 → 본문 텍스트와 함께 임베딩 |
결론
- 1유형은 제외 — 이미지 정보 자체가 중요해 텍스트화 실익이 없음.
- 2유형(구조도)·3유형(스캔)은 구독 중인 클로드 또는 코덱스에 넘겨 이미지 내 텍스트만 추출. 2유형은 키워드로 사용, 3유형은 본문 텍스트와 같이 임베딩.
- OCR(별도 엔진)은 사용하지 않음.
앞으로 해야 할 것 (데이터 전처리 전체 맥락 제외)
- 전체 데이터에서 2유형·3유형 이미지를 전부 따로 모아 클로드/코덱스로 텍스트화
고려사항
- 스캔 서식에 필기체로 쓴 내용도 잘 텍스트화되는지 검증 필요 → 3유형 샘플 몇 장으로 선행 테스트 예정