robots.txt는 색인 삭제 도구가 아닙니다
robots.txt의 Disallow는 크롤러가 해당 경로를 가져오지 않도록 요청합니다. 이미 외부 링크를 통해 알려진 URL은 본문을 읽지 못한 채 검색 결과에 나타날 수 있습니다. 검색 제외가 필요하면 페이지를 크롤링 가능하게 둔 상태에서 robots meta의 noindex를 사용해야 검색엔진이 지시를 읽을 수 있습니다.
로그인, 결제, 개인정보처럼 실제 보호가 필요한 영역은 robots.txt가 아니라 인증과 접근 제어로 막아야 합니다.
사이트맵에는 대표 URL만 넣으세요
사이트맵은 절대 URL로 작성하고, 정상 응답하며 색인되기를 원하는 canonical URL만 포함합니다. 리디렉션 URL, 404, noindex 페이지와 매개변수 중복 URL을 함께 넣으면 검색엔진에 상충 신호를 보냅니다.
사이트 루트의 robots.txt에 Sitemap 위치를 알리고 Search Console에서 처리 오류를 확인합니다. 제출 자체는 크롤링이나 검색 노출을 보장하지 않습니다.
배포 전 체크리스트
운영 배포 전과 도메인 이전 뒤에는 아래 항목을 다시 확인합니다.
- robots.txt가 CSS·JavaScript와 핵심 콘텐츠를 막지 않는가
- 사이트맵 URL이 200으로 열리고 UTF-8인가
- 사이트맵 URL과 canonical이 일치하는가
- 스테이징의 noindex가 운영에 남지 않았는가
- robots.txt에 사이트맵 절대 주소가 있는가