robots.txt
Robots Exclusion Standard
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일
검색 로봇이 사이트 서버 성능을 고려해 일정 기간 동안 크롤링할 수 있는 페이지 수의 한도입니다. 정의와 상세 설명을 통해 기술적 원리를 이해하고, 비즈니스에 미치는 영향과 실무 적용 방법, 구현 시 고려할 주의사항을 관련 용어와 함께 확인하세요.
Crawl Budget
크롤 예산은 서버가 감당할 수 있는 처리량과 사이트의 인기도(백링크 수 등)를 종합해 구글이 자동으로 배정하는, 정해진 기간 동안 크롤링할 페이지 수의 한도다. 수십만 페이지 규모의 대형 이커머스나 미디어 사이트에서는 예산이 부족해 일부 신규·수정 페이지가 몇 주씩 크롤링되지 않는 문제가 실제로 발생한다. 불필요한 파라미터 조합 URL을 robots.txt로 차단하고, 서버 응답 속도(TTFB)를 개선하면 같은 예산으로 더 많은 실제 페이지를 크롤링할 수 있게 된다.
신규 콘텐츠가 신속하게 수집되고 중요 페이지의 갱신이 누락되지 않도록 보장
불필요한 파라미터 URL 차단 및 서버 응답 속도(TTFB) 개선으로 버짓 최적화
Robots Exclusion Standard
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일
Crawling
검색엔진 로봇이 링크를 따라 웹을 탐색하며 새 페이지와 갱신된 정보를 수집하는 과정
Backlink
외부 웹사이트에서 내 웹사이트의 특정 페이지를 인용하여 연결해 준 인바운드 링크
301 Redirect
페이지가 새 URL로 영구 이동했음을 알리고 링크 가치를 새 주소로 온전히 전달하는 HTTP 코드
302 Redirect
요청한 자원이 일시적으로 다른 URL에 있음을 알리는 HTTP 응답 코드
404 Not Found
요청 URL에 해당하는 리소스가 서버에 없음을 알리는 클라이언트 HTTP 오류 코드