검색 상세

k-평균 군집화 기법을 활용한 SNS의 반복적으로 게재되는 부적절한 콘텐츠 탐지

Detection of inappropriate contents repeatedly posted on SNS using k-means clustering technique

초록/요약

오늘날 SNS를 사용하는 사람들이 증가함에 따라, 생성되는 데이터도 많아지고 종류도 매우 다양해졌다. 하지만 SNS에는 유익한 정보만 존재하는 것이 아니라, 부정적, 반사회적, 사행성 등의 부적절한 콘텐츠가 공존한다. 때문에 사용자에 따라 적절한 콘텐츠를 필터링할 필요성이 증가하고 있다. 따라서 본 연구에서는 SNS Instagram을 대상으로 콘텐츠의 해시태그를 수집하여 데이터화 하고, k-평균 군집화 기법을 적용하여 유사한 특성의 콘텐츠들을 군집화 하였다. 각 군집은 실루엣 계수(Silhouette Coefficient)와 키워드 다양성(Keyword Diversity)을 계산하여 부적절한 콘텐츠를 탐지할 수 있는 방안을 마련하였다. 군집화 결과로 도출된 군집의 적절성 평가는 서로 다른 분야에 종사하는 임의의 다수의 평가자가 군집의 콘텐츠들을 구성하는 키워드를 바탕으로 판단하였고, 사전에 콘텐츠에 따라 적절성 여부를 레이블링하여 군집화 결과로 도출된 콘텐츠들과 비교하였다. 또한 군집화 기법의 결과로 도출된 부적절한 콘텐츠 군집은 사회 연결망 분석(Social Netwrok Analysis)의 모듈성(Modularity)을 이용하여 군집의 속성을 정량적으로 수치화하고, 군집 간 키워드들의 상관관계를 시각화 하였다.

more

목차

1. 서론 1
1.1 연구 배경 1
1.2 관련 연구 2
2. 데이터 4
2.1 데이터 수집 4
2.2 데이터 전처리 6
3. 연구 방법 9
3.1 k-평균 군집화 9
3.2 실루엣 분석(Silhouette Analysis) 9
3.3 사회 연결망 분석(Social Network Analysis) 11
4. 연구 결과 13
4.1 실험 결과 13
4.2 실험 결과 평가 17
4.3 실험 결과 시각화 22
5. 결론 28

more