웹 크롤링을 이용한 유해사이트 수집 방법
Methods for Collecting Harmful Websites Using Web Crawling
- 주제(키워드) 저작권 디지털 포렌식 , 웹 크롤링 , 유해사이트 , Copyright Digital Forensics , Web Crawling , Harmful Websites
- 발행기관 한국디지털포렌식학회
- 발행년도 2021
- 총서유형 Journal
- DOI http://dx.doi.org/10.22798/kdfs.2021.15.3.127
- KCI ID ART002765141
- 본문언어 한국어
초록/요약
최근 정부의 유해사이트 차단 노력에도 불구하고 이를 우회하는 방법이 계속 생겨나고 있어 유해사이트는 여전히 줄어들지 않고 있다. 지속적이고 적극적인 유해사이트의 차단을 위해서는 유해사이트의 정보를 다양하게 수집하고 관리하는 시스템이 필요하다. 본 논문에서는 유해사이트의 링크를 모아놓은 웹사이트를 이용하여 효과적으로 유해사이트 정보를 수집하는 웹 크롤러를 제안한다. 제안한 웹 크롤러는 유해사이트의 다양한 정보를 수집한다. 특히 유해사이트 홍보 수단인 SNS(Social Networking Service)를 추적하여 변경될 URL 정보를 수집하고, Cloudflare와 같은 CDN(Content Delivery Network) 서비스 사용 여부를 확인하여 유해사이트의 운영 형태를 파악할 수 있다. 제안한 웹 크롤러를 이용해 수집한 결과 약 95%의 유해사이트 판별율(456개 중 433개)을 보였다. 따라서 제안한 웹 크롤러가 앞으로의 유해사이트 차단을 위한 정책 수립에 도움을 줄 수 있을 것으로 기대한다.
more

