AI 크롤러 정책 운영: Cloudflare·OpenAI 봇을 GEO 기준으로 나누는 법
AI 검색, 에이전트, 학습 크롤러가 분리되는 흐름 속에서 어떤 봇은 열고 어떤 봇은 제한해야 하는지 GEO 운영 관점으로 정리합니다.

AI 크롤러 정책은 이제 “허용 또는 차단”만으로 정리하기 어렵습니다. 검색 노출을 만드는 봇, 사용자를 대신해 행동하는 에이전트, 모델 학습용 크롤러를 구분하고, GEO 관점에서는 발견 가능성과 콘텐츠 보호를 동시에 관리해야 합니다.

- Cloudflare는 2026년 7월 Search, Agent, Training이라는 AI 트래픽 분류를 제시했고, 2026년 9월 15일부터 신규 도메인 일부 조건에서 Training과 Agent는 차단하고 Search는 허용하는 기본값을 예고했습니다.
- OpenAI는 OAI-SearchBot, OAI-AdsBot, GPTBot을 구분합니다. ChatGPT 검색 노출을 원하면 OAI-SearchBot은 허용하고, 학습 사용을 제한하려면 GPTBot 정책을 따로 관리해야 합니다.
- GEO 운영에서는 robots.txt만 보는 것이 아니라 CDN 차단 규칙, sitemap/RSS, 인용 후보 URL, 봇 로그, 글→요금제 이동까지 한 흐름으로 봐야 합니다.
Cloudflare는 AI 트래픽을 Search, Agent, Training으로 나누고, 다목적 크롤러도 여러 목적에 따라 추적되어야 한다고 설명합니다.
OpenAI 문서는 OAI-SearchBot을 ChatGPT 검색 기능의 웹사이트 노출에 쓰는 봇으로, GPTBot을 모델 학습에 쓰일 수 있는 콘텐츠 크롤러로 구분합니다.
Google은 AI Overviews와 AI Mode 지원 링크가 되려면 페이지가 색인되고 스니펫 표시 대상이어야 하며, robots.txt와 CDN 또는 호스팅 인프라에서 크롤링이 허용되어야 한다고 안내합니다.
1. AI 봇을 하나의 그룹으로 보면 GEO 기회를 막을 수 있습니다
예전에는 봇 정책을 검색엔진 봇과 악성 봇 정도로 나누면 충분했습니다. 지금은 다릅니다. Cloudflare는 2026년 7월 글에서 AI 트래픽을 Search, Agent, Training으로 나누는 분류를 제시했습니다. Search는 나중에 질문에 답하기 위해 콘텐츠를 수집하거나 색인하는 행동이고, Agent는 사용자의 실시간 작업을 대신 수행하는 행동이며, Training은 모델 학습이나 미세조정에 콘텐츠를 쓰는 행동입니다.
GEO 관점에서 가장 위험한 선택은 “AI 봇 전부 차단”입니다. 학습 사용을 막고 싶은 의도는 이해할 수 있지만, 검색형 봇까지 막으면 ChatGPT 검색, AI 답변형 검색, 새로운 답변 엔진에서 발견될 가능성도 함께 줄어들 수 있습니다. 반대로 모든 봇을 열면 경쟁사가 쉽게 가져갈 수 있는 고유 콘텐츠나 광고 랜딩 페이지가 과도하게 노출될 수 있습니다.
따라서 정책의 기본 단위는 봇 이름이 아니라 목적이어야 합니다. 같은 회사의 봇이라도 검색, 광고 검수, 사용자 요청, 학습 목적이 다를 수 있습니다. 목적별 허용 기준을 세우면 발견 가능성과 콘텐츠 보호를 동시에 조정할 수 있습니다.
- Search: 검색 노출과 AI 답변 인용 후보를 만들 수 있으므로 기본 허용 후보
- Agent: 사용자 요청 기반 작업은 허용 범위와 속도 제한을 별도로 검토
- Training: 학습 사용 제한이 필요하면 robots와 CDN 정책을 분리해 관리
- Ads verification: 광고 랜딩 검수 봇은 일반 검색 봇과 별도 로그로 관리
2. OpenAI 봇은 검색 노출과 학습 제한을 분리해서 봐야 합니다
OpenAI 문서는 OAI-SearchBot과 GPTBot의 목적을 분리해 설명합니다. OAI-SearchBot은 ChatGPT 검색 기능에서 웹사이트를 노출하는 데 쓰이는 검색용 봇입니다. GPTBot은 생성형 AI 기반 모델 학습에 사용될 수 있는 콘텐츠를 크롤링하는 봇입니다. 이 둘을 같은 규칙으로 묶으면 원하는 노출과 원치 않는 학습 제한을 동시에 관리하기 어렵습니다.
실무 정책은 단순합니다. ChatGPT 검색에서 사이트가 발견되기를 원한다면 OAI-SearchBot은 허용합니다. 반대로 모델 학습에 콘텐츠가 쓰이는 것을 제한하고 싶다면 GPTBot은 별도로 제한합니다. 광고를 운영한다면 OAI-AdsBot도 분리해서 봐야 합니다. OpenAI 문서는 OAI-AdsBot이 ChatGPT 광고로 제출된 랜딩 페이지의 안전성과 관련성을 확인하는 용도라고 설명합니다.
이 구분은 GEO 운영에서 중요합니다. 검색 봇을 막아 놓고 “AI 검색에 왜 안 뜨지?”라고 판단하면 원인 분석이 잘못됩니다. 반대로 학습 봇을 열어놓고 전체 AI 가시성이 좋아졌다고 말하는 것도 부정확합니다. 봇 목적, 허용 정책, 실제 로그, 인용 후보 상태를 함께 봐야 합니다.
- OAI-SearchBot: ChatGPT 검색 노출을 원하면 허용 후보로 분류
- GPTBot: 학습 사용 제한이 필요하면 별도 Disallow 정책 검토
- OAI-AdsBot: 광고 랜딩 검수 목적이므로 광고 운영 로그와 연결
- ChatGPT-User: 사용자 요청 기반 접근으로 Search opt-out 판단에 쓰지 않기
3. Cloudflare 정책은 robots.txt의 바깥까지 확장됩니다
robots.txt는 여전히 중요하지만 충분하지 않습니다. Google은 AI 기능 노출에서도 robots.txt, CDN, 호스팅 인프라에서 크롤링이 허용되어야 한다고 안내합니다. CDN 레벨에서 봇을 막아 놓으면 robots.txt가 허용하더라도 실제 요청은 막힐 수 있습니다.
Cloudflare는 2025년 Pay Per Crawl을 공개하면서 사이트 소유자가 크롤러별로 Allow, Charge, Block을 선택할 수 있는 방향을 제시했습니다. 2026년에는 이를 더 넓혀 Search, Agent, Training의 목적별 관리와 Crawler Hints, Pay Per Use 실험으로 확장하고 있습니다. 핵심은 봇을 단순히 막는 것이 아니라 어떤 목적의 접근이 가치 교환을 만드는지 구분하는 것입니다.
GEO Gateway를 Cloudflare 뒤에 둘 때는 최소한 세 층을 봐야 합니다. 첫째 robots.txt의 user-agent 정책, 둘째 Cloudflare의 AI Bot 또는 WAF 규칙, 셋째 앱이 실제로 반환하는 글별 HTML과 sitemap/RSS입니다. 세 층 중 하나만 어긋나도 검색 봇은 URL을 발견하지 못하거나, AI 답변 후보로 삼을 근거를 충분히 읽지 못할 수 있습니다.
- robots.txt와 Cloudflare AI 트래픽 설정을 같은 목적 분류로 정리
- 검색 노출이 필요한 블로그와 공개 랜딩은 Search 목적 봇 접근을 허용
- 광고 페이지, 결제, 내부 대시보드는 Agent와 Training 접근을 별도 제한
- 차단 규칙 변경 후 실제 로그에서 200, 403, 402 응답을 확인
4. GEO 대시보드에는 봇 정책과 전환 데이터를 같이 남깁니다
AI 크롤러 정책은 보안 설정으로 끝나면 안 됩니다. 어떤 봇이 어떤 URL에 접근했고, 그 URL이 검색이나 AI 답변 후보로 이어졌는지, 사용자가 그 글에서 대표 가이드나 요금제로 이동했는지를 연결해야 운영 판단이 가능합니다.
예를 들어 OAI-SearchBot을 허용한 뒤에도 블로그 URL 접근이 없다면 sitemap, RSS, 내부 링크, DNS 또는 CDN 캐시를 확인해야 합니다. 접근은 있는데 검색 유입이나 인용 후보가 없다면 글의 구조, 본문 근거, schema, title을 봐야 합니다. 검색 유입은 있는데 전환 이동이 없다면 CTA와 가격 설명을 봐야 합니다.
결론적으로 GEO의 목표는 모든 AI 접근을 늘리는 것이 아닙니다. 검색 가시성에 필요한 접근은 열고, 학습이나 자동화 리스크가 큰 접근은 제한하며, 그 결과가 실제 유입과 전환으로 이어지는지 측정하는 것입니다. 이 기준이 있어야 Cloudflare와 Railway 위에서도 블로그가 안정적인 마케팅 자산으로 작동합니다.
- URL별 봇 접근 로그와 robots/CDN 정책 변경 이력을 같이 기록
- 검색형 봇 접근 후 sitemap 반영, 인용 후보, 비브랜드 노출을 추적
- 글→대표 가이드, 글→요금제, 글→7일 무료 시작 이벤트를 분리
- 봇 허용 확대는 보안 예외가 아니라 측정 가능한 운영 실험으로 관리
이 글의 체크리스트를 첫 AI View로 바로 적용해보세요.
7일 동안 AI View 생성, AI 요청 모니터링, 유입·전환 추적 흐름을 직접 확인할 수 있습니다.
7일 무료로 시작