Skip to content
 
 

Repository files navigation

개요

각종 웹사이트의 데이터를 수집하기 위해 개인적으로 작성한 파이썬 소스코드들입니다.
.ipynb 파일로 간단한 설명과 함께 기재했으며 필요에 따라 변용할 수 있습니다.
Github blob 형태로는 안 보일 수도 있습니다. 다운로드 받아서 Jupyter notebook 상에서 보시는 게 좋습니다.

대상 웹사이트 및 컨텐츠 목록

2019년 9월 14일 기준, 크롤러가 수집할 수 있는 데이터의 목록은 다음과 같습니다. 개별 사이트의 구조 변화나 업데이트, 혹은 크롤링 대상이나 활용목적에 따라 소스코드의 수정이 필요할 수 있습니다.

  • 공공데이터포털

    RESTful API로 제공되는 유기동물 현황을 수집합니다.

  • 서울열린데이터광장

    RESTful API로 제공되는 서울시내 동물병원, 동물약국, 치과(의원) 현황을 수집합니다.

  • 네이버 카페 게시판

    '고양이라서 다행이야' 자유게시판의 최근 게시물을 수집합니다.

  • 다음 카페 게시판

    '여성시대' 반려동물 게시판의 최근 게시물을 수집합니다.

  • 커뮤니티 게시판

    '인스티즈' 반려동물 카테고리의 최근 게시물을 수집합니다.

  • 네이버 검색결과

    네이버에서 '웹 크롤링'을 키워드로 검색했을 때 결과의 블로그 탭에 있는 게시물을 수집합니다.

  • 청와대 홈페이지

    국민청원 게시판 특정 청원의 댓글 리스트를 수집합니다.

  • 언론사 웹사이트

    수의학전문언론사 데일리벳의 특정 연월에 해당하는 모든 기사 URL 및 본문을 수집합니다.

  • 학술지 웹사이트

    수의내과학저널(JVIM, Open Access)에 특정 기간 등재된 모든 Article의 제목, 초록, 등재일 등을 수집합니다.

  • 전자상거래 사이트

    마이펫플러스에 입점한 동물병원, 상품, 지역 리스트를 수집합니다.

참고하세요

웹 크롤링 기술은 합법과 불법의 경계선상에 있습니다.
(특히 크롤링 대상 사이트의 소유자가 robot.txt 등을 통해 명시적으로 크롤링을 금지한 경우)

현행법상 웹 크롤링의 결과를 개인적으로만 활용하는 것은 문제가 없으나
저작권자의 명시적 허락 없이 타 사이트에 원 컨텐츠를 재업로드하거나
상업적 목적으로 악용하는 경우 법적인 문제가 발생할 수 있습니다.

About

OpenAPI, 포털사이트 카페, 커뮤니티 게시판 등 웹 크롤러

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages