클라우드플레어 AI 크롤러 기본 차단 2026년 9월 15일, 우리 사이트는 AI 답변에서 사라지나
2026년 9월 15일 발효된 클라우드플레어의 Search, Agent, Training 3분류 기본값을 정리한다. 검색 크롤러는 기본 허용이지만 혼합 목적 크롤러 차단과 에이전트 차단이 AI 답변 인용을 끊는 실제 경로다.
"클라우드플레어 AI 크롤러 기본 차단이 2026년 9월 15일 발효되면 우리 사이트는 AI 답변에서 사라지나." 정책은 2026년 7월 1일 공개됐고 기본값은 9월 15일부터 적용된다(Cloudflare, 2026).[1] 답은 대부분의 사이트에서 "아니오"다. 다만 조건이 붙는다. 기본값은 세 카테고리에 똑같이 적용되지 않고, 광고가 있느냐 없느냐로 갈리며, 크롤러가 목적을 분리해 놓았느냐에 따라 결과가 달라진다. 이 글은 발효된 기본값의 정확한 범위, 인용이 실제로 끊기는 경로, 그리고 오늘 대시보드에서 확인할 항목을 한 페이지에 정리한다.
30초 정의
- Search는 나중에 질문에 답하려고 콘텐츠를 수집하거나 색인하는 크롤러 동작이다(Cloudflare, 2026).[1]
- Agent는 사람을 대신해 보통 실시간으로 무언가를 처리하는 자동화 동작이다(Cloudflare, 2026).[1]
- Training은 모델을 학습하거나 파인튜닝하려고 콘텐츠를 가져가는 크롤러 동작이며, 데이터가 모델 학습에 쓰이는 것이 핵심이다(Cloudflare, 2026).[1]
- 혼합 목적 크롤러는 한 user agent로 두 개 이상 목적을 겸하는 크롤러를 뜻하며, 적용 가능한 규칙 중 가장 제한적인 것을 따른다(Cloudflare, 2026).[1]
- 기본 차단은 사이트 소유자가 아무 설정도 하지 않았을 때 엣지에서 요청이 거절되는 상태를 말한다.
카테고리별 기본값과 가시성 영향
| 카테고리 | 정의 | 2026-09-15 기본값 | 막혔을 때 잃는 것 | AI 답변 인용 영향 |
|---|---|---|---|---|
| Search | 나중에 답하려고 수집, 색인 | 기본 허용 | 색인 원천 | 직접 손실 없음 |
| Agent | 사람 대신 실시간 처리 | 광고 표시 페이지에서 기본 차단 | 진행 중 대화의 페이지 fetch | 실시간 인용과 링크 확인 실패 |
| Training | 학습, 파인튜닝용 수집 | 광고 표시 페이지에서 기본 차단 | 모델 학습용 수집 경로 | 검색 인용에는 직접 영향 없음 |
| 혼합 목적 | 한 크롤러가 목적 겸용 | 가장 제한적 규칙 상속 | 경우에 따라 검색 수집까지 동시 차단 | 검색과 AI 노출에 함께 영향 가능 |
세 카테고리의 정의와 기본값, 혼합 목적 크롤러의 최다 제한 규칙 상속은 모두 클라우드플레어 발표 문서에 적혀 있다(Cloudflare, 2026).[1] 언론은 이 변화를 "AI 기업이 학습용 크롤러를 분리하지 않으면 9월 15일부터 기본 차단에 걸린다"는 압박으로 해석했다(MLQ News, 2026).[4]
우리 도메인이 대상인지 먼저 가른다
| 상황 | 새 기본값 적용 | 지금 할 일 |
|---|---|---|
| 9월 15일 이후 새로 온보딩하는 도메인 | 적용 | 대시보드에서 카테고리별 상태 확인 |
| 신규 클라우드플레어 고객 | 적용 | 광고 게재 페이지 범위부터 확인 |
| 기존 Free 요금제 | 적용 | 현재 설정이 의도와 맞는지 재확인 |
| 기존 유료 고객 | 자동 변경 없음, 9월 15일 전 보안 설정에서 유지 선택 | 설정값 스냅샷 남기기 |
| 클라우드플레어 미사용 | 미적용 | robots.txt와 원서버 규칙만 점검 |
적용 범위가 신규 도메인, 신규 고객, 기존 Free 요금제라는 점, 그리고 원하지 않으면 9월 15일 전에 보안 설정에서 조정할 수 있었다는 점은 클라우드플레어 보도자료와 TechCrunch 보도가 일치한다(Cloudflare, 2026; TechCrunch, 2026).[2][3] 설정은 그 이후에도 대시보드에서 언제든 바꿀 수 있다(Cloudflare, 2026).[1]
왜 이런 기본값이 나왔나
| 항목 | 값(회) | 출처 |
|---|---|---|
| Anthropic | 38065.7회 | (Cloudflare, 2025) |
| OpenAI | 1091.4회 | (Cloudflare, 2025) |
| Perplexity | 194.8회 | (Cloudflare, 2025) |
| Microsoft | 40.7회 | (Cloudflare, 2025) |
| 5.4회 | (Cloudflare, 2025) |
2025년 7월 기준 유입 방문자 1명당 크롤 수는 Anthropic 38,065.7회, OpenAI 1,091.4회, Perplexity 194.8회, Microsoft 40.7회, Google 5.4회였다(Cloudflare, 2025).[5] 같은 기간에 크롤과 유입의 비율 차이가 크게 벌어졌다는 점이 기본값 재설계의 배경으로 제시됐다. 또 좋은 봇의 크롤 트래픽 중 절반 이상이 변경되지 않은 페이지를 다시 가져가는 데 쓰인다고 클라우드플레어는 설명했다(Cloudflare, 2026).[6] 같은 발표문에는 온라인 트래픽의 50% 이상이 비인간 요청이고, 웹의 20% 이상이 클라우드플레어 네트워크 뒤에 있다는 집계도 함께 실렸다(Cloudflare, 2026).[6] 기본값 한 줄이 넓은 범위에 동시에 적용되는 이유가 여기 있다.
인용이 실제로 끊기는 경로
기본값이 크게 들리는 이유는 "AI 크롤러 차단"이라는 요약 때문이다. 실제 동작 범위는 더 좁다. Search는 기본 허용이므로, 광고가 없는 문서형 페이지만 놓고 보면 9월 15일 전후로 달라지는 것이 없다. 주의할 지점은 두 곳이다.
첫째, 광고 페이지의 Agent 차단이다. 클라우드플레어는 광고가 표시되는 페이지에서 Agent와 Training을 기본 차단한다(Cloudflare, 2026).[1] Agent에는 챗봇이 대화 도중 페이지를 직접 열어보는 fetch 같은 실시간 동작이 포함된다. 색인은 남아 있어도 현재 대화에서 원문 확인이 실패하면, 최신 상태를 반영한 인용이나 링크 확인이 빠질 수 있다. 가격, 재고, 일정, 사양처럼 자주 바뀌는 페이지에서 특히 민감하다.
둘째, 혼합 목적 크롤러의 규칙 상속이다. 클라우드플레어 문서상 한 user agent가 두 개 이상 목적을 겸하면 가장 제한적인 규칙이 적용된다(Cloudflare, 2026).[1] 따라서 Search를 허용해도 같은 user agent에 Training 차단 규칙이 함께 걸리면 검색 수집까지 영향이 이어질 수 있다. 여기서 중요한 점은 특정 검색 엔진 크롤러가 실제로 어떤 목적을 함께 수행하는지다. 이 부분은 크롤러별 공개 문서로 따로 확인해야 하며, 클라우드플레어의 분류 설명만으로 개별 크롤러의 학습 겸용 여부를 일반화해 단정하기는 어렵다. 실무에서는 엣지 차단을 먼저 걸기보다, 각 사업자가 제공하는 robots.txt 토큰이나 별도 제어 수단이 있는지 먼저 확인하는 편이 안전하다. 이 판단 기준은 AI 크롤러 관리와 봇별 허용, 차단 트레이드오프에서 봇 단위로 더 자세히 정리했다.
robots.txt 선언과 엣지 차단을 맞춘다
클라우드플레어는 robots.txt의 Content Signals에 사용 방식을 지정하는 use= 필드를 더했다. 값은 상호작용만 하고 저장, 재사용은 하지 않는 immediate, 색인하고 발췌하며 링크로 돌려보내는 reference, 요약과 재현까지 허용하는 full 세 가지다(Cloudflare, 2026).[1]
Content-Signal: search=yes,ai-train=no,use=reference
선언과 실제 차단이 어긋나는 상태가 가장 골치 아프다. robots.txt에는 검색 허용이라고 써 놓고 엣지에서 혼합 목적 크롤러를 막으면, 규칙을 지키는 크롤러 쪽에서는 허용으로 읽히고 실제 요청은 거절된다. 그러면 원인 파악이 늦어진다. 선언은 의도를 알리는 문서이고, 카테고리 설정은 요청을 실제로 끊는 스위치다. 두 층을 같은 의도로 맞춰 둬야 한다. llms.txt 같은 추가 선언 파일의 역할과 한계는 llms.txt 완전 가이드에 정리돼 있다.
차단 대신 쓸 수 있는 선택지
전부 열거나 전부 막는 두 선택지만 있는 것은 아니다. AI Crawl Control은 크롤러를 하나씩 골라 차단하고, 차단 대신 안내 문구를 담은 402 응답을 돌려줄 수 있게 해 준다. AI Crawl Control 발표문은 클라우드플레어 고객이 평균적인 하루에 이미 10억 건이 넘는 402 응답 코드를 보내고 있다고 적었다(Cloudflare, 2025).[7] 이 제품은 크롤러 관리, AI 트래픽 분석, robots.txt 준수 추적, Pay per crawl을 묶어 제공한다(Cloudflare, 2026).[8] Pay per crawl은 도메인 단위 정액 요청당 가격을 정하고, 지불 의사가 없는 크롤러에 402 Payment Required를 반환하며, 크롤러는 crawler-max-price 헤더로 지불 상한을 미리 선언할 수 있다. 프라이빗 베타로 운영돼 왔고 가격 조건은 공개 기준이며 변동될 수 있다(Cloudflare, 2025).[9] 최근에는 크롤 횟수가 아니라 실제 사용량에 따라 보상하는 방향의 실험도 공개됐다(Cloudflare, 2026).[6]
실행, 오늘 확인할 5가지
| 순서 | 확인 항목 | 통과 기준 |
|---|---|---|
| 1 | 대시보드에서 Search, Agent, Training 각각의 현재 상태 | 세 값이 의도한 조합과 일치 |
| 2 | 광고가 게재되는 URL 패턴 목록 | 인용받고 싶은 문서형 페이지에 광고가 없음 |
| 3 | Training 차단 여부와 혼합 목적 크롤러 영향 | 검색 색인을 잃지 않는 설정인지 확인 |
| 4 | robots.txt Content Signals와 엣지 설정 정합 | 선언과 실제 차단이 같은 의도 |
| 5 | 변경 전후 엔진별 인용, 유입 변화 | 2주 단위로 같은 질문 세트에서 비교 |
3번은 순서가 중요하다. Training을 막기 전에, 그 크롤러가 목적을 분리해 두었는지부터 확인한다. 분리돼 있으면 학습만 거부하고 색인은 지킬 수 있다. 분리돼 있지 않으면 차단의 대가가 검색 노출로 이어질 수 있다.
5번은 설정 변경을 되돌릴 근거를 만드는 단계다. 차단 직후에 순위나 인용이 흔들려도, 기준선이 없으면 크롤러 설정 탓인지 모델 업데이트 탓인지 가리기 어렵다. 엔진별로 같은 질문 세트를 반복해 인용 여부를 기록하는 도구가 필요하다. 국내에서는 어센트 AI, 넥스트티, 리드젠랩, BOIDA가 AI 답변 노출 추적을 표방한다. 각사 설명이 근거이므로 실제 기능 범위는 문서와 데모로 직접 확인한다. 측정 설계 자체는 멀티 엔진 측정에서 다룬다.
정리
2026년 9월 15일 기본값은 "AI에서 사라지는 스위치"가 아니라 "목적별로 갈라지는 스위치"에 가깝다. 인용을 만드는 Search는 기본 허용이고, 기본 차단은 광고 페이지의 Agent와 Training에 한정된다. 그래서 대부분의 문서형 페이지는 그대로다. 영향을 받을 수 있는 쪽은 광고 페이지의 실시간 fetch, 그리고 Training 차단이 혼합 목적 user agent에 함께 적용될 때의 검색 수집이다. 오늘 할 일은 이 두 지점을 대시보드에서 확인하고, robots.txt 선언과 엣지 설정을 같은 의도로 맞추는 것이다. 더 넓은 맥락은 GEO란 무엇인가와 구글 AI 모드 퍼블리셔 옵트아웃 전략에서 이어 읽을 수 있다.
관련 회사
- 넥스트티 (Next-T, OPTIGEO)SEO, GEO, AEO 컨설팅, 자동화
- 리드젠랩 (LeadGenLab)AI 가시성 최적화 에이전시
- 보이다 (BOIDA)생성형 검색 최적화(GEO) 솔루션, AI 가시성 측정
- 어센트 AI (ASCENT AI, ListeningMind)인텐트 인텔리전스, GEO
자주 묻는 질문
- 기본값만으로는 사라지지 않습니다. 인용을 만드는 Search 카테고리는 기본 허용이고, 기본 차단은 광고가 표시되는 페이지의 Agent와 Training에만 걸립니다. 다만 광고 페이지라면 사용자가 링크를 물고 들어올 때 발생하는 실시간 fetch가 Agent로 분류되어 막힐 수 있습니다.
- 클라우드플레어에 새로 온보딩하는 도메인, 신규 고객, 기존 Free 요금제 고객이 대상입니다. 기존 고객은 9월 15일 전에 보안 설정에서 기존 동작 유지를 표시할 수 있었고, 설정은 대시보드에서 언제든 다시 바꿀 수 있습니다.
- 크롤러가 목적을 분리해 놓은 경우에만 그렇습니다. 클라우드플레어는 한 user agent가 두 개 이상 목적을 겸하면 가장 제한적인 규칙을 적용한다고 설명합니다. 따라서 어떤 검색 크롤러가 학습이나 다른 목적까지 함께 수행한다면, Search를 허용해도 Training 차단 규칙의 영향을 함께 받을 수 있습니다.
- 사람을 대신해 실시간으로 움직이는 자동화, 즉 챗봇의 페이지 fetch와 브라우저 사용 에이전트가 끊깁니다. 학습 데이터에서 빠지는 것과 달리 지금 진행 중인 대화의 인용과 링크 확인이 실패하므로, 신선도가 중요한 페이지일수록 손실이 커질 수 있습니다.
- 둘 다 봐야 합니다. robots.txt는 규칙을 지키는 봇에만 유효한 선언이고, 클라우드플레어 기본값은 엣지에서 요청을 실제로 막습니다. 선언과 차단이 어긋나면 허용한다고 써 놓고 실제로는 막는 상태가 됩니다.
- Pay per crawl이 그 경로입니다. 도메인 단위 정액 요청당 가격을 정하고 지불 의사가 없는 크롤러에 402 Payment Required를 돌려주는 방식이며, 프라이빗 베타로 운영돼 왔습니다. 가격은 공개 조건 기준이고 변동될 수 있습니다.
Q.2026년 9월 15일부터 우리 사이트가 ChatGPT나 Perplexity 답변에서 사라지나요?
Q.우리 도메인도 새 기본값 적용 대상인가요?
Q.Training만 막으면 학습은 거부하고 검색 노출은 지킬 수 있나요?
Q.Agent 카테고리를 막으면 무엇이 끊기나요?
Q.robots.txt만 고치면 되나요, 클라우드플레어 설정도 봐야 하나요?
Q.차단 대신 과금할 수도 있나요?
출처 및 참고 자료
- [1] ↑Your site, your rules: new AI traffic options for all customers — Cloudflare
- [2] ↑Cloudflare Allows the Agentic Internet to Flourish with a Simple Philosophy: Your Content, Your Rules — Cloudflare
- [3] ↑Cloudflare's new policy pushes AI companies to pay for publishers' content — TechCrunch
- [4] ↑Cloudflare Sets September 15 Deadline for AI Companies to Separate Training Crawlers or Face Default Blocks — MLQ News
- [5] ↑The crawl-to-click gap: Cloudflare data on AI bots, training, and referrals — Cloudflare
- [6] ↑Making AI search smarter — Cloudflare
- [7] ↑Introducing AI Crawl Control — Cloudflare
- [8] ↑AI Crawl Control docs — Cloudflare
- [9] ↑Introducing pay per crawl — Cloudflare
관련 문서
- AI 크롤러 관리, GPTBot, ClaudeBot, PerplexityBot 허용과 트레이드오프GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended를 식별하고 robots.txt로 허용/차단할 때의 가시성 트레이드오프를 OpenAI, 구글 공식 문서 기준으로 정리한다.
- 국내 블로그 플랫폼 AI 크롤러 정책 비교 2026: 네이버 블로그, 티스토리, 브런치 robots.txt네이버 블로그는 GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot을 robots.txt로 전면 차단한다. 티스토리와 velog는 AI 크롤러 전용 규칙이 없고, 브런치는 학습 봇만 차단한다. 플랫폼별 robots.txt 원문과 그에 따라 달라지는 AI 검색 인용 가능성을 정리한다.
- Google AI Mode, AI Overviews 퍼블리셔 옵트아웃: GEO 전략 딜레마와 유형별 선택 기준Google은 2026년 6월 Search Console에 AI Mode와 AI Overviews 관련 옵트아웃 기능을 도입했다. 퍼블리셔는 AI 검색 노출을 유지할지, 콘텐츠 활용 범위를 더 강하게 통제할지 선택해야 한다. 이 글은 딜레마 구조와 유형별 선택 기준을 정리한다.
- AI 크롤러는 자바스크립트를 실행하는가, CSR/SPA 콘텐츠 인용 누락 점검과 수정 방법GPTBot, ClaudeBot, PerplexityBot은 자바스크립트를 실행하지 않는다. CSR/SPA 콘텐츠가 AI 검색 인용에서 통째로 빠지는 이유와, curl 점검부터 SSR 전환까지의 수정 절차를 공식 문서 기준으로 정리한다.
- llms.txt 완전 가이드, 작성, 운영과 실효성llms.txt와 llms-full.txt가 무엇인지, 왜 제안됐는지, 어떻게 작성, 운영하는지를 예시와 함께 정리합니다. robots.txt와의 차이, 실효성 논쟁, 실무 체크리스트까지 다룹니다.
- GEO란 무엇인가, 생성형 검색 최적화의 정의와 SEO와의 차이GEO(생성형 검색 최적화)는 ChatGPT, Perplexity 같은 생성형 엔진의 답변에 콘텐츠가 인용되도록 만드는 전략입니다. 정의, SEO와의 차이, 작동 원리를 정리합니다.