robots.txt
Robots Exclusion Standard
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일
해당 웹페이지를 검색결과 색인 목록에서 완전히 제외하도록 검색엔진에 내리는 지시입니다. 정의와 상세 설명을 통해 기술적 원리를 이해하고, 비즈니스에 미치는 영향과 실무 적용 방법, 구현 시 고려할 주의사항을 관련 용어와 함께 확인하세요.
noindex Directive
noindex는 페이지 자체는 존재하되 검색결과 목록에는 절대 나타나지 않도록 지시하는 방법으로, 감사 인사 페이지, 내부 검색 결과 페이지, 태그·필터 조합으로 무한히 생성되는 저품질 페이지를 정리할 때 자주 쓰인다. 페이지에 noindex를 걸어도 다른 페이지로의 내부 링크는 여전히 크롤러가 따라갈 수 있어(nofollow와 별개), 사이트 구조 자체를 해치지 않는다. 다만 noindex 페이지가 robots.txt로 크롤링까지 차단되어 있으면 구글이 애초에 그 태그를 읽을 방법이 없어 의도와 다르게 색인에 남아있을 수 있다는 점을 반드시 확인해야 한다.
중복 페이지 테스트 페이지 내부 검색결과 등 저품질 페이지의 색인 유입 차단
robots.txt로 크롤링을 차단하면 noindex 지시자를 읽지 못하므로 주의
Robots Exclusion Standard
검색 크롤러의 사이트 디렉터리 접근 권한을 규정하는 루트 디렉터리의 텍스트 파일
Indexing
검색엔진이 수집한 웹페이지를 분석하여 검색 후보 데이터베이스에 체계적으로 저장하는 과정
Crawling
검색엔진 로봇이 링크를 따라 웹을 탐색하며 새 페이지와 갱신된 정보를 수집하는 과정
Internal Link
같은 도메인 내의 한 웹페이지에서 다른 웹페이지로 연결되는 하이퍼링크
301 Redirect
페이지가 새 URL로 영구 이동했음을 알리고 링크 가치를 새 주소로 온전히 전달하는 HTTP 코드
302 Redirect
요청한 자원이 일시적으로 다른 URL에 있음을 알리는 HTTP 응답 코드