온페이지 & 콘텐츠 전략

Crawling

크롤링은 검색엔진 로봇이 이미 알고 있는 페이지의 링크를 따라 새로운 URL을 발견하고 그 내용을 가져오는 발견 단계로, 색인·랭킹보다 앞서 일어나는 첫 관문이다. robots.txt로 특정 경로가 차단되어 있거나, 사이트 내부에 해당 페이지로 향하는 링크가 하나도 없는 ‘고아 페이지’ 상태라면 아무리 좋은 콘텐츠라도 크롤러가 영영 발견하지 못할 수 있다. 서치 콘솔의 크롤링 통계 보고서로 구글봇의 일일 크롤링 요청 수와 응답 시간을 확인하면 크롤링 관련 병목을 조기에 진단할 수 있다.

실무 적용 및 비즈니스 영향#

크롤러가 접근하지 못하는 페이지는 검색엔진에 결코 반영될 수 없음

구현 가이드 및 주의사항#

robots.txt 차단 여부와 내부 링크 연결 상태를 철저히 검토

robots.txt

Robots Exclusion Standard

검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일

구글봇

Googlebot

구글이 웹문서를 발견하고 수집하기 위해 운영하는 자동화된 웹 크롤러 로봇

색인

Indexing

검색엔진이 수집한 웹페이지를 분석하여 검색 후보 데이터베이스에 체계적으로 저장하는 과정

고아 페이지

Orphan Page

사이트 내 다른 어떤 내부 페이지로부터도 링크를 받지 못해 고립된 웹페이지

내부 링크

Internal Link

같은 도메인 내의 한 웹페이지에서 다른 웹페이지로 연결되는 하이퍼링크

alt 태그

Alt Attribute

이미지를 표시할 수 없거나 스크린 리더 사용 시 이미지를 설명하는 HTML 대체 텍스트 속성