부재: CNIPA 크롤러 개발
📋 목차
- 프로젝트 배경
- 초기 접근과 문제점
- 문제 해결 과정
- 최종 솔루션
- 기술적 성과
프로젝트 배경
목표
중국 국가지식재산권국(CNIPA)의 상표 공고 데이터를 수집하여 무단 선점 상표를 탐지하는 시스템 구축
수집 대상
- 공고기호: 1966, 1967
- 예상 데이터량: 약 130,000건 (1966: 80,539건, 1967: 50,800건)
- 데이터 타입: 상표 메타데이터(JSON) + PDF 이미지
왜 어려웠나?
CNIPA는 강력한 봇 탐지 시스템을 운영:
- F12 개발자 도구 차단 (열면
about:blank로 리다이렉트)
- Selenium/Puppeteer 같은 자동화 도구 탐지
- 복잡한 인증 메커니즘 (Cookie + FECU + Token)
- API 호출마다 변경되는 보안 파라미터
초기 접근과 문제점
시도 1: Python Selenium 크롤러