WWikiAP
분류: 기술

클라우드플레어 AI 크롤러 기본 차단 2026년 9월 15일, 우리 사이트는 AI 답변에서 사라지나

2026년 9월 15일 발효된 클라우드플레어의 Search, Agent, Training 3분류 기본값을 정리한다. 검색 크롤러는 기본 허용이지만 혼합 목적 크롤러 차단과 에이전트 차단이 AI 답변 인용을 끊는 실제 경로다.

Technical GEO 에디터발행

"클라우드플레어 AI 크롤러 기본 차단이 2026년 9월 15일 발효되면 우리 사이트는 AI 답변에서 사라지나." 정책은 2026년 7월 1일 공개됐고 기본값은 9월 15일부터 적용된다(Cloudflare, 2026).[1] 답은 대부분의 사이트에서 "아니오"다. 다만 조건이 붙는다. 기본값은 세 카테고리에 똑같이 적용되지 않고, 광고가 있느냐 없느냐로 갈리며, 크롤러가 목적을 분리해 놓았느냐에 따라 결과가 달라진다. 이 글은 발효된 기본값의 정확한 범위, 인용이 실제로 끊기는 경로, 그리고 오늘 대시보드에서 확인할 항목을 한 페이지에 정리한다.

30초 정의

  • Search는 나중에 질문에 답하려고 콘텐츠를 수집하거나 색인하는 크롤러 동작이다(Cloudflare, 2026).[1]
  • Agent는 사람을 대신해 보통 실시간으로 무언가를 처리하는 자동화 동작이다(Cloudflare, 2026).[1]
  • Training은 모델을 학습하거나 파인튜닝하려고 콘텐츠를 가져가는 크롤러 동작이며, 데이터가 모델 학습에 쓰이는 것이 핵심이다(Cloudflare, 2026).[1]
  • 혼합 목적 크롤러는 한 user agent로 두 개 이상 목적을 겸하는 크롤러를 뜻하며, 적용 가능한 규칙 중 가장 제한적인 것을 따른다(Cloudflare, 2026).[1]
  • 기본 차단은 사이트 소유자가 아무 설정도 하지 않았을 때 엣지에서 요청이 거절되는 상태를 말한다.
2026-09-15 기본값, 카테고리별로 다르게 적용된다 Search 색인하고 나중에 답변 기본 허용, 모든 페이지 Agent 실시간 대리 fetch 광고 페이지 기본 차단 Training 학습, 파인튜닝 광고 페이지 기본 차단 크롤러가 목적을 분리하지 않았다면 혼합 목적 크롤러 한 user agent가 여러 목적 수행 가장 제한적인 규칙 적용 Search 허용이어도 Training 차단이면 함께 막힐 수 있음 적용 대상, 신규 온보딩 도메인과 신규 고객, 기존 Free 요금제 기존 고객, 9월 15일 전 보안 설정에서 기존 동작 유지 선택 가능
2026년 9월 15일 발효된 클라우드플레어 AI 트래픽 기본값 구조, 출처 Cloudflare 2026

카테고리별 기본값과 가시성 영향

카테고리정의2026-09-15 기본값막혔을 때 잃는 것AI 답변 인용 영향
Search나중에 답하려고 수집, 색인기본 허용색인 원천직접 손실 없음
Agent사람 대신 실시간 처리광고 표시 페이지에서 기본 차단진행 중 대화의 페이지 fetch실시간 인용과 링크 확인 실패
Training학습, 파인튜닝용 수집광고 표시 페이지에서 기본 차단모델 학습용 수집 경로검색 인용에는 직접 영향 없음
혼합 목적한 크롤러가 목적 겸용가장 제한적 규칙 상속경우에 따라 검색 수집까지 동시 차단검색과 AI 노출에 함께 영향 가능

세 카테고리의 정의와 기본값, 혼합 목적 크롤러의 최다 제한 규칙 상속은 모두 클라우드플레어 발표 문서에 적혀 있다(Cloudflare, 2026).[1] 언론은 이 변화를 "AI 기업이 학습용 크롤러를 분리하지 않으면 9월 15일부터 기본 차단에 걸린다"는 압박으로 해석했다(MLQ News, 2026).[4]

우리 도메인이 대상인지 먼저 가른다

상황새 기본값 적용지금 할 일
9월 15일 이후 새로 온보딩하는 도메인적용대시보드에서 카테고리별 상태 확인
신규 클라우드플레어 고객적용광고 게재 페이지 범위부터 확인
기존 Free 요금제적용현재 설정이 의도와 맞는지 재확인
기존 유료 고객자동 변경 없음, 9월 15일 전 보안 설정에서 유지 선택설정값 스냅샷 남기기
클라우드플레어 미사용미적용robots.txt와 원서버 규칙만 점검

적용 범위가 신규 도메인, 신규 고객, 기존 Free 요금제라는 점, 그리고 원하지 않으면 9월 15일 전에 보안 설정에서 조정할 수 있었다는 점은 클라우드플레어 보도자료와 TechCrunch 보도가 일치한다(Cloudflare, 2026; TechCrunch, 2026).[2][3] 설정은 그 이후에도 대시보드에서 언제든 바꿀 수 있다(Cloudflare, 2026).[1]

왜 이런 기본값이 나왔나

유입 방문자 1명당 크롤 수 (2025년 7월) Anthropic 38065.7회 OpenAI 1091.4회 Perplexity 194.8회 Microsoft 40.7회 Google 5.4회 출처: (Cloudflare, 2025)
유입 방문자 1명당 크롤 수 (2025년 7월), 출처 (Cloudflare, 2025)
항목값(회)출처
Anthropic38065.7회(Cloudflare, 2025)
OpenAI1091.4회(Cloudflare, 2025)
Perplexity194.8회(Cloudflare, 2025)
Microsoft40.7회(Cloudflare, 2025)
Google5.4회(Cloudflare, 2025)

2025년 7월 기준 유입 방문자 1명당 크롤 수는 Anthropic 38,065.7회, OpenAI 1,091.4회, Perplexity 194.8회, Microsoft 40.7회, Google 5.4회였다(Cloudflare, 2025).[5] 같은 기간에 크롤과 유입의 비율 차이가 크게 벌어졌다는 점이 기본값 재설계의 배경으로 제시됐다. 또 좋은 봇의 크롤 트래픽 중 절반 이상이 변경되지 않은 페이지를 다시 가져가는 데 쓰인다고 클라우드플레어는 설명했다(Cloudflare, 2026).[6] 같은 발표문에는 온라인 트래픽의 50% 이상이 비인간 요청이고, 웹의 20% 이상이 클라우드플레어 네트워크 뒤에 있다는 집계도 함께 실렸다(Cloudflare, 2026).[6] 기본값 한 줄이 넓은 범위에 동시에 적용되는 이유가 여기 있다.

인용이 실제로 끊기는 경로

기본값이 크게 들리는 이유는 "AI 크롤러 차단"이라는 요약 때문이다. 실제 동작 범위는 더 좁다. Search는 기본 허용이므로, 광고가 없는 문서형 페이지만 놓고 보면 9월 15일 전후로 달라지는 것이 없다. 주의할 지점은 두 곳이다.

첫째, 광고 페이지의 Agent 차단이다. 클라우드플레어는 광고가 표시되는 페이지에서 Agent와 Training을 기본 차단한다(Cloudflare, 2026).[1] Agent에는 챗봇이 대화 도중 페이지를 직접 열어보는 fetch 같은 실시간 동작이 포함된다. 색인은 남아 있어도 현재 대화에서 원문 확인이 실패하면, 최신 상태를 반영한 인용이나 링크 확인이 빠질 수 있다. 가격, 재고, 일정, 사양처럼 자주 바뀌는 페이지에서 특히 민감하다.

둘째, 혼합 목적 크롤러의 규칙 상속이다. 클라우드플레어 문서상 한 user agent가 두 개 이상 목적을 겸하면 가장 제한적인 규칙이 적용된다(Cloudflare, 2026).[1] 따라서 Search를 허용해도 같은 user agent에 Training 차단 규칙이 함께 걸리면 검색 수집까지 영향이 이어질 수 있다. 여기서 중요한 점은 특정 검색 엔진 크롤러가 실제로 어떤 목적을 함께 수행하는지다. 이 부분은 크롤러별 공개 문서로 따로 확인해야 하며, 클라우드플레어의 분류 설명만으로 개별 크롤러의 학습 겸용 여부를 일반화해 단정하기는 어렵다. 실무에서는 엣지 차단을 먼저 걸기보다, 각 사업자가 제공하는 robots.txt 토큰이나 별도 제어 수단이 있는지 먼저 확인하는 편이 안전하다. 이 판단 기준은 AI 크롤러 관리와 봇별 허용, 차단 트레이드오프에서 봇 단위로 더 자세히 정리했다.

robots.txt 선언과 엣지 차단을 맞춘다

클라우드플레어는 robots.txt의 Content Signals에 사용 방식을 지정하는 use= 필드를 더했다. 값은 상호작용만 하고 저장, 재사용은 하지 않는 immediate, 색인하고 발췌하며 링크로 돌려보내는 reference, 요약과 재현까지 허용하는 full 세 가지다(Cloudflare, 2026).[1]

Content-Signal: search=yes,ai-train=no,use=reference

선언과 실제 차단이 어긋나는 상태가 가장 골치 아프다. robots.txt에는 검색 허용이라고 써 놓고 엣지에서 혼합 목적 크롤러를 막으면, 규칙을 지키는 크롤러 쪽에서는 허용으로 읽히고 실제 요청은 거절된다. 그러면 원인 파악이 늦어진다. 선언은 의도를 알리는 문서이고, 카테고리 설정은 요청을 실제로 끊는 스위치다. 두 층을 같은 의도로 맞춰 둬야 한다. llms.txt 같은 추가 선언 파일의 역할과 한계는 llms.txt 완전 가이드에 정리돼 있다.

차단 대신 쓸 수 있는 선택지

전부 열거나 전부 막는 두 선택지만 있는 것은 아니다. AI Crawl Control은 크롤러를 하나씩 골라 차단하고, 차단 대신 안내 문구를 담은 402 응답을 돌려줄 수 있게 해 준다. AI Crawl Control 발표문은 클라우드플레어 고객이 평균적인 하루에 이미 10억 건이 넘는 402 응답 코드를 보내고 있다고 적었다(Cloudflare, 2025).[7] 이 제품은 크롤러 관리, AI 트래픽 분석, robots.txt 준수 추적, Pay per crawl을 묶어 제공한다(Cloudflare, 2026).[8] Pay per crawl은 도메인 단위 정액 요청당 가격을 정하고, 지불 의사가 없는 크롤러에 402 Payment Required를 반환하며, 크롤러는 crawler-max-price 헤더로 지불 상한을 미리 선언할 수 있다. 프라이빗 베타로 운영돼 왔고 가격 조건은 공개 기준이며 변동될 수 있다(Cloudflare, 2025).[9] 최근에는 크롤 횟수가 아니라 실제 사용량에 따라 보상하는 방향의 실험도 공개됐다(Cloudflare, 2026).[6]

실행, 오늘 확인할 5가지

순서확인 항목통과 기준
1대시보드에서 Search, Agent, Training 각각의 현재 상태세 값이 의도한 조합과 일치
2광고가 게재되는 URL 패턴 목록인용받고 싶은 문서형 페이지에 광고가 없음
3Training 차단 여부와 혼합 목적 크롤러 영향검색 색인을 잃지 않는 설정인지 확인
4robots.txt Content Signals와 엣지 설정 정합선언과 실제 차단이 같은 의도
5변경 전후 엔진별 인용, 유입 변화2주 단위로 같은 질문 세트에서 비교

3번은 순서가 중요하다. Training을 막기 전에, 그 크롤러가 목적을 분리해 두었는지부터 확인한다. 분리돼 있으면 학습만 거부하고 색인은 지킬 수 있다. 분리돼 있지 않으면 차단의 대가가 검색 노출로 이어질 수 있다.

5번은 설정 변경을 되돌릴 근거를 만드는 단계다. 차단 직후에 순위나 인용이 흔들려도, 기준선이 없으면 크롤러 설정 탓인지 모델 업데이트 탓인지 가리기 어렵다. 엔진별로 같은 질문 세트를 반복해 인용 여부를 기록하는 도구가 필요하다. 국내에서는 어센트 AI, 넥스트티, 리드젠랩, BOIDA가 AI 답변 노출 추적을 표방한다. 각사 설명이 근거이므로 실제 기능 범위는 문서와 데모로 직접 확인한다. 측정 설계 자체는 멀티 엔진 측정에서 다룬다.

정리

2026년 9월 15일 기본값은 "AI에서 사라지는 스위치"가 아니라 "목적별로 갈라지는 스위치"에 가깝다. 인용을 만드는 Search는 기본 허용이고, 기본 차단은 광고 페이지의 Agent와 Training에 한정된다. 그래서 대부분의 문서형 페이지는 그대로다. 영향을 받을 수 있는 쪽은 광고 페이지의 실시간 fetch, 그리고 Training 차단이 혼합 목적 user agent에 함께 적용될 때의 검색 수집이다. 오늘 할 일은 이 두 지점을 대시보드에서 확인하고, robots.txt 선언과 엣지 설정을 같은 의도로 맞추는 것이다. 더 넓은 맥락은 GEO란 무엇인가구글 AI 모드 퍼블리셔 옵트아웃 전략에서 이어 읽을 수 있다.

관련 회사

자주 묻는 질문

Q.2026년 9월 15일부터 우리 사이트가 ChatGPT나 Perplexity 답변에서 사라지나요?
기본값만으로는 사라지지 않습니다. 인용을 만드는 Search 카테고리는 기본 허용이고, 기본 차단은 광고가 표시되는 페이지의 Agent와 Training에만 걸립니다. 다만 광고 페이지라면 사용자가 링크를 물고 들어올 때 발생하는 실시간 fetch가 Agent로 분류되어 막힐 수 있습니다.
Q.우리 도메인도 새 기본값 적용 대상인가요?
클라우드플레어에 새로 온보딩하는 도메인, 신규 고객, 기존 Free 요금제 고객이 대상입니다. 기존 고객은 9월 15일 전에 보안 설정에서 기존 동작 유지를 표시할 수 있었고, 설정은 대시보드에서 언제든 다시 바꿀 수 있습니다.
Q.Training만 막으면 학습은 거부하고 검색 노출은 지킬 수 있나요?
크롤러가 목적을 분리해 놓은 경우에만 그렇습니다. 클라우드플레어는 한 user agent가 두 개 이상 목적을 겸하면 가장 제한적인 규칙을 적용한다고 설명합니다. 따라서 어떤 검색 크롤러가 학습이나 다른 목적까지 함께 수행한다면, Search를 허용해도 Training 차단 규칙의 영향을 함께 받을 수 있습니다.
Q.Agent 카테고리를 막으면 무엇이 끊기나요?
사람을 대신해 실시간으로 움직이는 자동화, 즉 챗봇의 페이지 fetch와 브라우저 사용 에이전트가 끊깁니다. 학습 데이터에서 빠지는 것과 달리 지금 진행 중인 대화의 인용과 링크 확인이 실패하므로, 신선도가 중요한 페이지일수록 손실이 커질 수 있습니다.
Q.robots.txt만 고치면 되나요, 클라우드플레어 설정도 봐야 하나요?
둘 다 봐야 합니다. robots.txt는 규칙을 지키는 봇에만 유효한 선언이고, 클라우드플레어 기본값은 엣지에서 요청을 실제로 막습니다. 선언과 차단이 어긋나면 허용한다고 써 놓고 실제로는 막는 상태가 됩니다.
Q.차단 대신 과금할 수도 있나요?
Pay per crawl이 그 경로입니다. 도메인 단위 정액 요청당 가격을 정하고 지불 의사가 없는 크롤러에 402 Payment Required를 돌려주는 방식이며, 프라이빗 베타로 운영돼 왔습니다. 가격은 공개 조건 기준이고 변동될 수 있습니다.

출처 및 참고 자료

  1. [1] ↑Your site, your rules: new AI traffic options for all customersCloudflare
  2. [2] ↑Cloudflare Allows the Agentic Internet to Flourish with a Simple Philosophy: Your Content, Your RulesCloudflare
  3. [3] ↑Cloudflare's new policy pushes AI companies to pay for publishers' contentTechCrunch
  4. [4] ↑Cloudflare Sets September 15 Deadline for AI Companies to Separate Training Crawlers or Face Default BlocksMLQ News
  5. [5] ↑The crawl-to-click gap: Cloudflare data on AI bots, training, and referralsCloudflare
  6. [6] ↑Making AI search smarterCloudflare
  7. [7] ↑Introducing AI Crawl ControlCloudflare
  8. [8] ↑AI Crawl Control docsCloudflare
  9. [9] ↑Introducing pay per crawlCloudflare

이 문서는 2026년 09월 15일에 마지막으로 편집되었습니다. WikiAP의 콘텐츠는 공개된 출처를 근거로 작성되며, 정확성을 위해 지속적으로 갱신됩니다.