크롤 버짓
Crawl Budget
검색 로봇이 사이트 서버 성능을 고려해 일정 기간 동안 크롤링할 수 있는 페이지 수의 한도
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일입니다. 정의와 상세 설명을 통해 기술적 원리를 이해하고, 비즈니스에 미치는 영향과 실무 적용 방법, 구현 시 고려할 주의사항을 관련 용어와 함께 확인하세요.
Robots Exclusion Standard
robots.txt는 사이트 루트(domain.com/robots.txt)에 위치하는 평문 텍스트 파일로, User-agent별로 어떤 디렉터리를 크롤링해도 되는지 규칙을 선언한다. 로그인 페이지나 관리자 화면처럼 크롤러가 굳이 방문할 필요 없는 영역을 차단해 한정된 크롤 예산을 중요한 페이지에 집중시키는 데 효과적이다. 다만 robots.txt로 차단된 페이지도 다른 사이트가 링크를 걸면 URL 자체는 색인에 노출될 수 있어(스니펫 없이), 검색결과에서 완전히 빼려면 noindex 태그와 크롤링 허용을 함께 사용해야 한다.
관리자 페이지 등 민감 영역 차단 및 크롤 버짓 효율화 달성
검색결과 제외 목적으로 쓰면 안 되며 색인 차단은 noindex 태그를 사용해야 함
Crawl Budget
검색 로봇이 사이트 서버 성능을 고려해 일정 기간 동안 크롤링할 수 있는 페이지 수의 한도
Indexing
검색엔진이 수집한 웹페이지를 분석하여 검색 후보 데이터베이스에 체계적으로 저장하는 과정
Crawling
검색엔진 로봇이 링크를 따라 웹을 탐색하며 새 페이지와 갱신된 정보를 수집하는 과정
Snippet
검색결과 목록에서 제목과 URL 아래에 표시되는 2~3줄의 본문 미리보기 설명문
301 Redirect
페이지가 새 URL로 영구 이동했음을 알리고 링크 가치를 새 주소로 온전히 전달하는 HTTP 코드
302 Redirect
요청한 자원이 일시적으로 다른 URL에 있음을 알리는 HTTP 응답 코드