각종 웹사이트의 데이터를 수집하기 위해 개인적으로 작성한 파이썬 소스코드들입니다.
.ipynb 파일로 간단한 설명과 함께 기재했으며 필요에 따라 변용할 수 있습니다.
Github blob 형태로는 안 보일 수도 있습니다. 다운로드 받아서 Jupyter notebook 상에서 보시는 게 좋습니다.
2019년 9월 14일 기준, 크롤러가 수집할 수 있는 데이터의 목록은 다음과 같습니다. 개별 사이트의 구조 변화나 업데이트, 혹은 크롤링 대상이나 활용목적에 따라 소스코드의 수정이 필요할 수 있습니다.
-
공공데이터포털
RESTful API로 제공되는 유기동물 현황을 수집합니다.
-
서울열린데이터광장
RESTful API로 제공되는 서울시내 동물병원, 동물약국, 치과(의원) 현황을 수집합니다.
-
네이버 카페 게시판
'고양이라서 다행이야' 자유게시판의 최근 게시물을 수집합니다.
-
다음 카페 게시판
'여성시대' 반려동물 게시판의 최근 게시물을 수집합니다.
-
커뮤니티 게시판
'인스티즈' 반려동물 카테고리의 최근 게시물을 수집합니다.
-
네이버 검색결과
네이버에서 '웹 크롤링'을 키워드로 검색했을 때 결과의 블로그 탭에 있는 게시물을 수집합니다.
-
청와대 홈페이지
국민청원 게시판 특정 청원의 댓글 리스트를 수집합니다.
-
언론사 웹사이트
수의학전문언론사 데일리벳의 특정 연월에 해당하는 모든 기사 URL 및 본문을 수집합니다.
-
학술지 웹사이트
수의내과학저널(JVIM, Open Access)에 특정 기간 등재된 모든 Article의 제목, 초록, 등재일 등을 수집합니다.
-
전자상거래 사이트
마이펫플러스에 입점한 동물병원, 상품, 지역 리스트를 수집합니다.
웹 크롤링 기술은 합법과 불법의 경계선상에 있습니다.
(특히 크롤링 대상 사이트의 소유자가 robot.txt 등을 통해 명시적으로 크롤링을 금지한 경우)
현행법상 웹 크롤링의 결과를 개인적으로만 활용하는 것은 문제가 없으나
저작권자의 명시적 허락 없이 타 사이트에 원 컨텐츠를 재업로드하거나
상업적 목적으로 악용하는 경우 법적인 문제가 발생할 수 있습니다.