AI 검색을 막았는데 링크는 남을 수 있습니다: robots.txt와 noindex 적용 순서
핵심만 먼저 `robots.txt`에서 OAI-SearchBot을 막았다고 URL의 흔적까지 반드시 사라지는 것은 아닙니다. OpenAI의 최근 퍼블리셔 FAQ는 차단된 페이지의 URL을 제3자 검색 제공자나 다른 페이지의 링크에서 얻고 관련성이 있다고 판단하면 ChatGPT Atlas에 링크와 제목만 표시할 수 있다고 설명합니다. 링크와 제목조차 보이지 않게 하려면 `no…

핵심만 먼저
`robots.txt`에서 OAI-SearchBot을 막았다고 URL의 흔적까지 반드시 사라지는 것은 아닙니다. OpenAI의 최근 퍼블리셔 FAQ는 차단된 페이지의 URL을 제3자 검색 제공자나 다른 페이지의 링크에서 얻고 관련성이 있다고 판단하면 ChatGPT Atlas에 링크와 제목만 표시할 수 있다고 설명합니다. 링크와 제목조차 보이지 않게 하려면 `noindex`를 사용하라고 안내합니다.
여기서 중요한 함정이 있습니다. 크롤러를 먼저 막으면 페이지 안의 noindex를 읽지 못할 수 있습니다. 따라서 제거 목적이라면 접근 허용 상태에서 noindex를 읽게 하고, 제거가 확인된 뒤 크롤링 정책을 다시 정하는 순서가 필요합니다.
robots.txt와 noindex는 무엇이 다른가요
robots.txt는 특정 크롤러가 어떤 URL을 가져갈 수 있는지 정하는 접근 규칙입니다. 서버 부담을 줄이거나 불필요한 경로의 수집을 제한하는 데 씁니다. noindex는 접근한 페이지를 검색 결과에 넣지 말라는 색인 규칙입니다. 하나는 문 앞 출입, 다른 하나는 목록 등록에 가깝습니다.
문을 잠근 뒤 방 안 책상에 “목록에서 빼 주세요”라는 메모를 두면 크롤러가 메모를 읽을 수 없습니다. 이 때문에 크롤링 차단과 URL 제거를 같은 작업으로 취급하면 링크·제목만 남는 결과가 생길 수 있습니다.
오늘 이슈와 공식 근거
OpenAI 퍼블리셔·개발자 FAQ는 ChatGPT 검색의 요약과 스니펫에 포함되려면 OAI-SearchBot을 차단하지 않아야 한다고 설명합니다. 반대로 차단해도 외부 제공자나 다른 페이지에서 URL을 발견하면 Atlas에서 링크와 제목만 표시할 수 있으며, 이를 원하지 않으면 noindex를 사용하라고 안내합니다. noindex를 읽으려면 크롤러가 페이지에 접근할 수 있어야 한다는 주의도 함께 적혀 있습니다.
Google의 noindex 공식 문서도 같은 기술 원리를 명확히 설명합니다. robots.txt에 막힌 페이지는 크롤러가 noindex 태그나 헤더를 보지 못하므로 다른 링크를 통해 URL이 검색 결과에 나타날 수 있습니다. Google은 noindex가 효과를 내려면 페이지가 크롤러에게 접근 가능해야 한다고 안내합니다. 서비스별 크롤러 정책은 다르지만 “차단하면 페이지 안 지시를 읽을 수 없다”는 구조는 공통으로 이해할 수 있습니다.
사장님 실무 적용 7단계
- 목표를 한 문장으로 정합니다. `요약에는 쓰지 말 것`, `훈련에는 쓰지 말 것`, `링크와 제목도 표시하지 말 것`, `로그인 사용자만 볼 것` 중 무엇인지 구분합니다.
- 대상 크롤러와 경로를 목록화합니다. OAI-SearchBot, GPTBot, Googlebot 등 서비스별 규칙과 민감한 URL을 분리합니다. 모든 봇을 한 줄로 묶지 않습니다.
- 현재 응답을 기록합니다. robots.txt, HTML meta robots, X-Robots-Tag, HTTP 상태, canonical을 같은 시각에 저장합니다.
- 제거 목적이면 접근을 허용하고 noindex를 제공합니다. 크롤러가 태그나 헤더를 실제로 읽을 수 있어야 합니다. 비밀 정보는 이 방식에 맡기지 말고 인증으로 보호합니다.
- 재수집과 제거를 확인합니다. 각 서비스가 제공하는 검사 도구·검색 결과·서버 로그에서 크롤링과 노출 변화를 확인합니다. 반영 시간은 즉시라고 가정하지 않습니다.
- 그 뒤 수집 정책을 정합니다. 목록 제거가 확인된 후에도 불필요한 크롤링을 막을지, 요약 노출만 허용할지 서비스별로 결정합니다.
- 변경 이력을 남깁니다. 날짜, 대상 봇, 경로, 목표, 설정, 확인 결과, 되돌릴 조건을 기록합니다.
권장 표는 `URL 패턴 / 공개 여부 / 요약 허용 / 훈련 허용 / 링크 표시 허용 / robots / noindex / 인증 / 확인일` 아홉 칸입니다. 한 칸에 “AI 차단”이라고만 쓰면 나중에 목적과 결과를 구분할 수 없습니다.
흔한 실수
- 모든 AI 서비스를 같은 크롤러 하나로 생각합니다.
- robots.txt 차단을 URL 제거 기능으로 사용합니다.
- 차단한 페이지 안에 noindex를 넣고 읽힐 것이라고 기대합니다.
- 고객정보나 계약서를 noindex만으로 보호합니다.
- canonical이 공개 페이지를 가리키는지 확인하지 않습니다.
- 변경 직후 결과가 남아 있다고 설정 실패로 단정합니다.
- 요약 차단, 훈련 차단, 링크 제거의 목적을 한 줄로 뭉갭니다.
제스토코스트의 판단
GEO 운영에서 가장 위험한 말은 “AI를 차단했다”입니다. 무엇을 차단했는지 말하지 않기 때문입니다. 요약 사용, 모델 훈련, 에이전트 접근, 링크 노출은 다른 경로와 다른 제어를 가질 수 있습니다. 목표를 기능 단위로 적어야 설정을 검증할 수 있습니다.
또한 공개하면 안 되는 정보는 크롤러 예절 규칙으로 보호해서는 안 됩니다. 인증·권한·네트워크 접근 제한이 먼저이고, robots와 noindex는 공개 웹에서 발견과 노출을 관리하는 보조 장치입니다. 이 경계를 지키면 “검색에는 안 보이지만 URL은 살아 있는” 위험을 줄일 수 있습니다.
자주 묻는 질문
OAI-SearchBot을 막으면 ChatGPT에 절대 안 나오나요?
공식 FAQ는 요약·스니펫 수집을 막을 수 있지만 외부 신호로 관련 URL을 알게 되면 Atlas에 링크와 제목만 표시될 수 있다고 설명합니다.
robots.txt와 noindex를 동시에 쓰면 더 강력한가요?
반드시 그렇지 않습니다. robots 차단 때문에 크롤러가 noindex를 읽지 못할 수 있습니다. URL 제거가 목표라면 접근 가능 상태에서 noindex가 읽히는 순서를 먼저 설계하세요.
비공개 문서에 noindex를 넣으면 안전한가요?
아닙니다. noindex는 검색 노출 지시일 뿐 접근 통제가 아닙니다. 민감한 문서는 로그인·권한·네트워크 제한으로 보호해야 합니다.
출처
- OpenAI Help Center: Publishers and Developers FAQ
- Google Search Central: noindex로 검색 색인 차단
- Google Search Central: robots.txt 소개
내부링크 제안
- llms.txt 하나로 GEO가 끝나지 않는 이유
- ChatGPT 유입을 utm_source=chatgpt.com으로 분리하는 법
CTA
robots.txt를 열어 “AI 차단”이라고 적힌 규칙마다 목표를 네 가지로 다시 분류하세요. 링크와 제목까지 제거하려는 URL이라면 noindex를 크롤러가 읽을 수 있는 순서인지 오늘 바로 확인하시기 바랍니다.
편집 고지: 이 글은 공식 자료 조사와 초안 정리에 자동화 도구를 활용했으며, 공개 전 출처·표현·실무 적합성을 검수합니다.



댓글 0
회원만 댓글을 남길 수 있어요.
작성된 댓글은 모두 공개됩니다. 비밀댓글은 지원하지 않습니다.
아직 댓글이 없어요. 첫 공개 댓글을 남겨보세요.