뉴욕타임스의 robots.txt 차단 목록에는 인터넷 아카이브 크롤러(archive.org_bot)가 명시되어 있습니다. 그러나 2026년 8월 27일 04시 32분(UTC), 웨이백머신은 nytimes.com 페이지를 제약 없이 수집해 저장했습니다. 반면, 같은 파일에서 똑같이 차단된 커먼 크롤(CCBot)은 이번 달 이 도메인에서 robots.txt 파일 외에 아무것도 수집해 공개하지 않았습니다.
두 크롤러의 동작이 왜 서로 달랐을까요? 뉴욕타임스의 서버 접속 로그만으로는 그 이유를 알 수 없습니다.
robots.txt가 실제로 누구에게 어떤 의무를 부여하는지, 그리고 우리가 설정한 차단 규칙을 어디까지 직접 검증할 수 있는지 정리했습니다.

robots.txt의 개념 — '부탁'을 적어두는 파일
1994년 마르테인 코스터(Martijn Koster)는 크롤러 운영자 간 자발적 약속으로 robots.txt를 처음 제안했습니다. 이후 2022년 9월, 코스터와 구글 엔지니어들이 이를 규격화하여 IETF 공식 표준 RFC 9309로 제정했습니다.
중요한 점은 RFC가 권장 문법만 정의할 뿐, 이를 강제로 집행하는 수단은 다루지 않는다는 사실입니다. 참고로 자주 쓰이는 Crawl-delay 설정은 표준 문서 어디에도 등장하지 않습니다.
RFC 9309 제1장 서론: "This document specifies the rules originally defined by the 'Robots Exclusion Protocol' that crawlers are requested to honor when accessing URIs. These rules are not a form of access authorization." (이 문서는 크롤러가 URI에 접근할 때 지켜주기를 요청하는 규칙을 정의한다. 이 규칙은 접근 권한 부여 수단이 아니다.)
'크롤링 불법'이라는 연관 검색어가 자주 따라붙지만, robots.txt는 외부 프로그램이 스스로 지키겠다고 선택할 때만 작동합니다.
robots.txt 차단 사례 — 뉴욕타임스
뉴욕타임스는 두 크롤러를 식별자(User-agent)로 지정해 차단하고 있습니다.
User-agent: archive.org_bot
Disallow: /
User-agent: CCBot
Disallow: /
ChatGPT (인터넷 아카이브 크롤러의
robots.txt준수 여부를 물었을 때, 2026년 8월 28일): "The relevant crawler user agent is typically associated withia_archiver." (관련 크롤러 User-Agent는 보통ia_archiver로 알려져 있다.)
인터넷 아카이브의 실제 크롤러 식별자는 archive.org_bot입니다. 여전히 많은 사이트가 ia_archiver를 차단 목록에 넣고 있지만, 이는 2022년 운영이 종료된 알렉사 인터넷(Alexa Internet)의 식별자입니다. 따라서 지금 ia_archiver를 막는 것은 아무런 효과가 없습니다.
실제로 웨이백머신에 nytimes.com 수집 여부를 조회해 보면 다음과 같은 결과가 반환됩니다.
curl 'http://archive.org/wayback/available?url=nytimes.com'
차단 설정에도 불구하고 20260827043230 타임스탬프가 찍힌 데이터가 그대로 조회됩니다.
반면, 커먼 크롤(Common Crawl)의 크롤러인 CCBot은 다르게 동작합니다. 커먼 크롤의 공개 색인을 조회해 보겠습니다.
IDX=https://index.commoncrawl.org/CC-MAIN-2026-34-index
curl "$IDX?url=nytimes.com%2F*&output=json"
2026년 8월 수집 색인에서 nytimes.com 관련 기록은 com,nytimes)/robots.txt 딱 하나뿐입니다(8월 18일, HTTP 200, 3,509바이트). CCBot은 robots.txt 파일만 확인한 뒤 지침에 따라 다른 페이지는 수집하지 않은 것입니다.
이 명령어들은 보유한 도메인에도 동일하게 적용해 확인할 수 있습니다. 네이버 서치어드바이저의 검증 > robots.txt 및 요청 > 웹 페이지 수집 메뉴를 활용하면 수집 허용 여부와 결과를 검증할 수 있습니다. 단, 이러한 웹마스터 도구는 자사 크롤러의 동작 방식만 검증해 준다는 점에 유의해야 합니다.

인터넷 아카이브와 robots.txt
알렉시스 로시, 인터넷 아카이브 (2016년 12월 17일): "Some have asked if we ignore URL exclusions expressed in robots.txt files. The answer is a bit complicated. Historically, sometimes yes and sometimes no; but going forward the answer is 'even less so.'" (robots.txt의 URL 수집 제외 지시를 무시하느냐는 질문의 답은 조금 복잡하다. 이전에도 무시한 적이 있고 안 한 적도 있지만, 앞으로는 '지금보다도 덜' 지키게 될 것이다.)
로시(Alexis Rossi)는 2008년, 2012년, 2016년 미국 정권 교체기에 .gov 및 .mil 사이트를 수집할 때 수집 제외 지침을 무시했다고 밝혔습니다. 넉 달 뒤 마크 그레이엄 역시 미국 정부 및 군 관련 사이트는 크롤링과 화면 표시 양쪽 모두에서 robots.txt를 참조하지 않는다고 썼으며, 삭제 요청은 info@archive.org로 받는다고 덧붙였습니다.
인터넷 아카이브에 이미 저장된 내용을 내리려면 이메일로 직접 요청해야 합니다. 하지만 도움말 페이지에는 "요청 결과를 사전에 보장하지 않는다(We do not make any guarantees beforehand about the outcome of a request)"라고 안내합니다. 외부 노출을 가려줄 수는 있어도, 이미 저장된 사본 자체를 삭제할 수는 없습니다. 이는 Git 저장소에 이미 커밋되어 버린 비밀번호를 지우기 어려운 것과 같습니다.
robots.txt 설정 — 올바른 활용법
그렇다면 robots.txt는 어떻게 활용해야 할까요?
기존 robots.txt 설정은 유지하는 것이 좋습니다. 비용이 거의 들지 않는 데다, 규칙을 준수하는 정직한 크롤러들은 이 지침을 존중하기 때문입니다. 다만 이는 어디까지나 권장 사항일 뿐 강제 수단이 아니라는 점을 명심해야 합니다. 단순히 'AI 크롤링 차단 문구' 몇 줄을 추가한다고 데이터가 보호되지는 않습니다.
외부 유출을 확실히 막아야 하는 정보라면 robots.txt에 의존하기보다 사용자 인증이나 네트워크 접근 제어 정책을 도입하거나, 애초에 웹에 공개하지 않아야 합니다.
대부분의 팀이 robots.txt를 한 번 작성해 두고 방치합니다. 여러분이 작성해 둔 Disallow 한 줄이 실제로 무엇을 차단하고 있는지 직접 확인해 본 적이 있으신가요?
참고 자료
- IETF — RFC 9309: Robots Exclusion Protocol. https://www.rfc-editor.org/rfc/rfc9309.html
- Common Crawl — Index Server. https://index.commoncrawl.org/
- Internet Archive — Wayback Machine APIs. https://archive.org/help/wayback_api.php
- Internet Archive Blogs — Robots.txt Files and Archiving .gov and .mil Websites (Alexis Rossi, 2016-12-17). https://blog.archive.org/2016/12/17/robots-txt-gov-mil-websites/
- Internet Archive Blogs — Robots.txt meant for search engines don't work well for web archives (Mark Graham, 2017-04-17). https://blog.archive.org/2017/04/17/robots-txt-meant-for-search-engines-dont-work-well-for-web-archives/
- Internet Archive Help — How do I request to remove something from archive.org? https://help.archive.org/help/how-do-i-request-to-remove-something-from-archive-org/
- 네이버 서치어드바이저 — robots.txt 설정하기. https://searchadvisor.naver.com/guide/seo-basic-robots
- 네이버 서치어드바이저 — 수집요청 및 검색제외. https://searchadvisor.naver.com/guide/request-crawl
