정책 목적부터 결정하세요
공개 콘텐츠의 검색 발견을 원하는지, 모델 학습용 수집을 허용할지, 로그인 뒤 자료는 완전히 막을지 먼저 정합니다. 같은 회사의 봇도 목적별 이름이 달라질 수 있으므로 오래된 블로그의 사용자 에이전트 목록을 그대로 복사하지 않습니다.
robots.txt와 보안을 구분하세요
robots.txt는 준수하는 크롤러에 대한 공개 지침입니다. 비공개 문서, 고객 데이터와 관리자 페이지를 보호하는 보안 장치가 아닙니다. 민감 정보는 인증, 권한, 네트워크 정책으로 보호해야 합니다.
Anthropic은 공식 안내에서 자사 봇이 robots.txt 지시를 따른다고 설명하며 ClaudeBot 차단 예시를 제공합니다. 정책과 사용자 에이전트는 바뀔 수 있으므로 배포 시점에 공식 문서를 재확인합니다.
운영 점검
허용 또는 차단 뒤 서버 로그로 실제 요청과 응답을 확인합니다. CDN이나 방화벽 규칙이 robots.txt보다 먼저 차단하면 봇이 정책 파일 자체를 읽지 못할 수 있습니다.
- 공식 봇 문서와 변경일 확인
- robots.txt 문법 테스트
- 민감 경로는 인증으로 보호
- 서버 로그에서 사용자 에이전트와 빈도 확인
- 검색 노출 변화는 다른 SEO 요인과 분리해 해석