새 소식우리 회사에 어떤 규제가 적용되는지 알고 계신가요? 3분 안에 확인할 수 있습니다. Panke가 드리는 진심 어린 선물:EU 스코퍼한국 스코퍼
무엇을 도와드릴까요?

채널로 문의하기

KakaoTalkLINE

48시간 이내 답변

이메일 보내기 →
robots.txt 차단, 아무도 지킬 의무가 없습니다
네트워크보안

robots.txt 차단, 아무도 지킬 의무가 없습니다

2026년 8월 28일·Alex Holmquist, Panke IT Solutions LLC

뉴욕타임스의 robots.txt 차단 목록에는 인터넷 아카이브 크롤러(archive.org_bot)가 명시되어 있습니다. 그러나 2026년 8월 27일 04시 32분(UTC), 웨이백머신은 nytimes.com 페이지를 제약 없이 수집해 저장했습니다. 반면, 같은 파일에서 똑같이 차단된 커먼 크롤(CCBot)은 이번 달 이 도메인에서 robots.txt 파일 외에 아무것도 수집해 공개하지 않았습니다.

두 크롤러의 동작이 왜 서로 달랐을까요? 뉴욕타임스의 서버 접속 로그만으로는 그 이유를 알 수 없습니다.

robots.txt가 실제로 누구에게 어떤 의무를 부여하는지, 그리고 우리가 설정한 차단 규칙을 어디까지 직접 검증할 수 있는지 정리했습니다.

문이 달리지 않은 넓은 출입구가 뚫린 낡은 담장, 옆에 볼트로 고정된 큰 안내판에 User-agent 별표와 Disallow 슬래시가 적혀 있고, 수레바퀴 자국이 출입구를 그대로 통과해 나 있다

robots.txt의 개념 — '부탁'을 적어두는 파일

1994년 마르테인 코스터(Martijn Koster)는 크롤러 운영자 간 자발적 약속으로 robots.txt를 처음 제안했습니다. 이후 2022년 9월, 코스터와 구글 엔지니어들이 이를 규격화하여 IETF 공식 표준 RFC 9309로 제정했습니다.

중요한 점은 RFC가 권장 문법만 정의할 뿐, 이를 강제로 집행하는 수단은 다루지 않는다는 사실입니다. 참고로 자주 쓰이는 Crawl-delay 설정은 표준 문서 어디에도 등장하지 않습니다.

RFC 9309 제1장 서론: "This document specifies the rules originally defined by the 'Robots Exclusion Protocol' that crawlers are requested to honor when accessing URIs. These rules are not a form of access authorization." (이 문서는 크롤러가 URI에 접근할 때 지켜주기를 요청하는 규칙을 정의한다. 이 규칙은 접근 권한 부여 수단이 아니다.)

'크롤링 불법'이라는 연관 검색어가 자주 따라붙지만, robots.txt는 외부 프로그램이 스스로 지키겠다고 선택할 때만 작동합니다.

robots.txt 차단 사례 — 뉴욕타임스

뉴욕타임스는 두 크롤러를 식별자(User-agent)로 지정해 차단하고 있습니다.

User-agent: archive.org_bot
Disallow: /

User-agent: CCBot
Disallow: /

ChatGPT (인터넷 아카이브 크롤러의 robots.txt 준수 여부를 물었을 때, 2026년 8월 28일): "The relevant crawler user agent is typically associated with ia_archiver." (관련 크롤러 User-Agent는 보통 ia_archiver로 알려져 있다.)

인터넷 아카이브의 실제 크롤러 식별자는 archive.org_bot입니다. 여전히 많은 사이트가 ia_archiver를 차단 목록에 넣고 있지만, 이는 2022년 운영이 종료된 알렉사 인터넷(Alexa Internet)의 식별자입니다. 따라서 지금 ia_archiver를 막는 것은 아무런 효과가 없습니다.

실제로 웨이백머신에 nytimes.com 수집 여부를 조회해 보면 다음과 같은 결과가 반환됩니다.

curl 'http://archive.org/wayback/available?url=nytimes.com'

차단 설정에도 불구하고 20260827043230 타임스탬프가 찍힌 데이터가 그대로 조회됩니다.

반면, 커먼 크롤(Common Crawl)의 크롤러인 CCBot은 다르게 동작합니다. 커먼 크롤의 공개 색인을 조회해 보겠습니다.

IDX=https://index.commoncrawl.org/CC-MAIN-2026-34-index
curl "$IDX?url=nytimes.com%2F*&output=json"

2026년 8월 수집 색인에서 nytimes.com 관련 기록은 com,nytimes)/robots.txt 딱 하나뿐입니다(8월 18일, HTTP 200, 3,509바이트). CCBot은 robots.txt 파일만 확인한 뒤 지침에 따라 다른 페이지는 수집하지 않은 것입니다.

이 명령어들은 보유한 도메인에도 동일하게 적용해 확인할 수 있습니다. 네이버 서치어드바이저의 검증 > robots.txt요청 > 웹 페이지 수집 메뉴를 활용하면 수집 허용 여부와 결과를 검증할 수 있습니다. 단, 이러한 웹마스터 도구는 자사 크롤러의 동작 방식만 검증해 준다는 점에 유의해야 합니다.

nytimes.com/robots.txt라고 적힌 게시물 아래 두 개의 보관함: Internet Archive (Wayback Machine)라고 표시된 칸은 제본된 책들로 가득 차 있고 맨 앞 권에 2026-08-27 04:32이 찍혀 있으며, CCBot이라고 표시된 칸에는 robots.txt only라고 적힌 얇은 쪽지 한 장만 들어 있다

인터넷 아카이브와 robots.txt

알렉시스 로시, 인터넷 아카이브 (2016년 12월 17일): "Some have asked if we ignore URL exclusions expressed in robots.txt files. The answer is a bit complicated. Historically, sometimes yes and sometimes no; but going forward the answer is 'even less so.'" (robots.txt의 URL 수집 제외 지시를 무시하느냐는 질문의 답은 조금 복잡하다. 이전에도 무시한 적이 있고 안 한 적도 있지만, 앞으로는 '지금보다도 덜' 지키게 될 것이다.)

로시(Alexis Rossi)는 2008년, 2012년, 2016년 미국 정권 교체기에 .gov.mil 사이트를 수집할 때 수집 제외 지침을 무시했다고 밝혔습니다. 넉 달 뒤 마크 그레이엄 역시 미국 정부 및 군 관련 사이트는 크롤링과 화면 표시 양쪽 모두에서 robots.txt를 참조하지 않는다고 썼으며, 삭제 요청은 info@archive.org로 받는다고 덧붙였습니다.

인터넷 아카이브에 이미 저장된 내용을 내리려면 이메일로 직접 요청해야 합니다. 하지만 도움말 페이지에는 "요청 결과를 사전에 보장하지 않는다(We do not make any guarantees beforehand about the outcome of a request)"라고 안내합니다. 외부 노출을 가려줄 수는 있어도, 이미 저장된 사본 자체를 삭제할 수는 없습니다. 이는 Git 저장소에 이미 커밋되어 버린 비밀번호를 지우기 어려운 것과 같습니다.

robots.txt 설정 — 올바른 활용법

그렇다면 robots.txt는 어떻게 활용해야 할까요?

기존 robots.txt 설정은 유지하는 것이 좋습니다. 비용이 거의 들지 않는 데다, 규칙을 준수하는 정직한 크롤러들은 이 지침을 존중하기 때문입니다. 다만 이는 어디까지나 권장 사항일 뿐 강제 수단이 아니라는 점을 명심해야 합니다. 단순히 'AI 크롤링 차단 문구' 몇 줄을 추가한다고 데이터가 보호되지는 않습니다.

외부 유출을 확실히 막아야 하는 정보라면 robots.txt에 의존하기보다 사용자 인증이나 네트워크 접근 제어 정책을 도입하거나, 애초에 웹에 공개하지 않아야 합니다.

대부분의 팀이 robots.txt를 한 번 작성해 두고 방치합니다. 여러분이 작성해 둔 Disallow 한 줄이 실제로 무엇을 차단하고 있는지 직접 확인해 본 적이 있으신가요?

참고 자료

  1. IETF — RFC 9309: Robots Exclusion Protocol. https://www.rfc-editor.org/rfc/rfc9309.html
  2. Common Crawl — Index Server. https://index.commoncrawl.org/
  3. Internet Archive — Wayback Machine APIs. https://archive.org/help/wayback_api.php
  4. Internet Archive Blogs — Robots.txt Files and Archiving .gov and .mil Websites (Alexis Rossi, 2016-12-17). https://blog.archive.org/2016/12/17/robots-txt-gov-mil-websites/
  5. Internet Archive Blogs — Robots.txt meant for search engines don't work well for web archives (Mark Graham, 2017-04-17). https://blog.archive.org/2017/04/17/robots-txt-meant-for-search-engines-dont-work-well-for-web-archives/
  6. Internet Archive Help — How do I request to remove something from archive.org? https://help.archive.org/help/how-do-i-request-to-remove-something-from-archive-org/
  7. 네이버 서치어드바이저 — robots.txt 설정하기. https://searchadvisor.naver.com/guide/seo-basic-robots
  8. 네이버 서치어드바이저 — 수집요청 및 검색제외. https://searchadvisor.naver.com/guide/request-crawl
귀사의 공격 표면이 걱정되시나요?

귀사의 인프라가 공격자의 스코어링 모델에서 어떻게 평가되는지 알고 싶다면 contact@pankeit.com으로 문의해 주세요. 동일한 지문채취 및 스코어링 프로세스를 실행하고 우선순위가 매겨진 개선 목록을 제공합니다.

블로그 구독하기

최신 보안 동향을 가장 먼저 받아보세요

스팸 없음. 언제든 구독 취소.

©2026 Panke IT Solutions LLC

Austin, TX