테크니컬 SEO & 웹 인프라

Robots Exclusion Standard

robots.txt는 사이트 루트(domain.com/robots.txt)에 위치하는 평문 텍스트 파일로, User-agent별로 어떤 디렉터리를 크롤링해도 되는지 규칙을 선언한다. 로그인 페이지나 관리자 화면처럼 크롤러가 굳이 방문할 필요 없는 영역을 차단해 한정된 크롤 예산을 중요한 페이지에 집중시키는 데 효과적이다. 다만 robots.txt로 차단된 페이지도 다른 사이트가 링크를 걸면 URL 자체는 색인에 노출될 수 있어(스니펫 없이), 검색결과에서 완전히 빼려면 noindex 태그와 크롤링 허용을 함께 사용해야 한다.

실무 적용 및 비즈니스 영향#

관리자 페이지 등 민감 영역 차단 및 크롤 버짓 효율화 달성

구현 가이드 및 주의사항#

검색결과 제외 목적으로 쓰면 안 되며 색인 차단은 noindex 태그를 사용해야 함

크롤 버짓

Crawl Budget

검색 로봇이 사이트 서버 성능을 고려해 일정 기간 동안 크롤링할 수 있는 페이지 수의 한도

색인

Indexing

검색엔진이 수집한 웹페이지를 분석하여 검색 후보 데이터베이스에 체계적으로 저장하는 과정

크롤링

Crawling

검색엔진 로봇이 링크를 따라 웹을 탐색하며 새 페이지와 갱신된 정보를 수집하는 과정

스니펫

Snippet

검색결과 목록에서 제목과 URL 아래에 표시되는 2~3줄의 본문 미리보기 설명문

301 리디렉션

301 Redirect

페이지가 새 URL로 영구 이동했음을 알리고 링크 가치를 새 주소로 온전히 전달하는 HTTP 코드

302 리다이렉트

302 Redirect

요청한 자원이 일시적으로 다른 URL에 있음을 알리는 HTTP 응답 코드