robots.txt
Robots Exclusion Standard
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일
검색엔진 로봇이 링크를 따라 웹을 탐색하며 새 페이지와 갱신된 정보를 수집하는 과정입니다. 정의와 상세 설명을 통해 기술적 원리를 이해하고, 비즈니스에 미치는 영향과 실무 적용 방법, 구현 시 고려할 주의사항을 관련 용어와 함께 확인하세요.
Crawling
크롤링은 검색엔진 로봇이 이미 알고 있는 페이지의 링크를 따라 새로운 URL을 발견하고 그 내용을 가져오는 발견 단계로, 색인·랭킹보다 앞서 일어나는 첫 관문이다. robots.txt로 특정 경로가 차단되어 있거나, 사이트 내부에 해당 페이지로 향하는 링크가 하나도 없는 ‘고아 페이지’ 상태라면 아무리 좋은 콘텐츠라도 크롤러가 영영 발견하지 못할 수 있다. 서치 콘솔의 크롤링 통계 보고서로 구글봇의 일일 크롤링 요청 수와 응답 시간을 확인하면 크롤링 관련 병목을 조기에 진단할 수 있다.
크롤러가 접근하지 못하는 페이지는 검색엔진에 결코 반영될 수 없음
robots.txt 차단 여부와 내부 링크 연결 상태를 철저히 검토
Robots Exclusion Standard
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일
Googlebot
구글이 웹문서를 발견하고 수집하기 위해 운영하는 자동화된 웹 크롤러 로봇
Indexing
검색엔진이 수집한 웹페이지를 분석하여 검색 후보 데이터베이스에 체계적으로 저장하는 과정
Orphan Page
사이트 내 다른 어떤 내부 페이지로부터도 링크를 받지 못해 고립된 웹페이지
Internal Link
같은 도메인 내의 한 웹페이지에서 다른 웹페이지로 연결되는 하이퍼링크
Alt Attribute
이미지를 표시할 수 없거나 스크린 리더 사용 시 이미지를 설명하는 HTML 대체 텍스트 속성