AI 답변의 기준 · 공식 문서
AI 기업 7개사 중 4개사는 사용자 트리거 에이전트에 robots.txt 가 적용되지 않을 수 있다고 명시했습니다
OpenAI 공식 문서에서 GPTBot 은 학습 여부를 제어하는 사용자 에이전트이고, 검색 답변 노출은 OAI-SearchBot 이 제어합니다. AI 기업 7개사의 크롤러 문서를 대조하니 5개사가 학습용 사용자 에이전트를 검색용과 분리했고, 사용자 트리거 에이전트를 둔 5개사 가운데 4개사는 robots.txt 가 적용되지 않을 수 있다고 명시했습니다.
AI 크롤러를 차단하거나 허용할 때 흔히 사용자 에이전트 이름 몇 개를 한꺼번에 적습니다. 같은 목록에 있는 이름이라도 기업 공식 문서가 명시한 역할은 서로 다릅니다.
OpenAI, Anthropic, Perplexity, Google, Microsoft, Apple, Meta의 크롤러 공식 문서를 확인해 사용자 에이전트별 역할과 robots.txt 적용 범위를 대조했습니다.
발견 01
5개사는 학습 제어용 사용자 에이전트를 검색용과 분리했습니다
- 사용자 에이전트를 별도 명시
- 사용자 에이전트 대신 다른 제어 방식 명시
- 공식 문서에 없음
칸마다 근거는 해당 기업의 크롤러 공식 문서입니다. 사용자 에이전트 이름은 아래 표에 있습니다.
| 기업 | 검색·답변 크롤러 | AI 학습 크롤러 | 사용자 트리거 에이전트 |
|---|---|---|---|
| OpenAI | OAI-SearchBot | GPTBot | ChatGPT-User |
| Anthropic | Claude-SearchBot | ClaudeBot | Claude-User |
| Perplexity | PerplexityBot | 검색 크롤러를 AI 학습에 사용하지 않는다고 명시 | Perplexity-User |
| Googlebot | Google-Extended | Google-Agent | |
| Microsoft | Bingbot | 사용자 에이전트 토큰 대신 NOARCHIVE 메타 태그로 제어한다고 명시 | 문서에 없음 |
| Apple | Applebot | Applebot-Extended | 문서에 없음 |
| Meta | Meta-WebIndexer | Meta-ExternalAgent | Meta-ExternalFetcher |
Each setting is independent of the others – for example, a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI’s generative AI foundation models.
학습용 사용자 에이전트가 없는 2개사도 이유를 명시했습니다. Perplexity 는 검색 크롤러를 AI 모델 학습에 사용하지 않는다고 명시했고, Microsoft 는 사용자 에이전트 대신 NOARCHIVE 메타 태그로 제어한다고 명시했습니다.
발견 02
사용자 트리거 에이전트는 5개사 중 4개사에서 robots.txt 적용 범위 밖일 수 있습니다
| 기업 | 사용자 트리거 에이전트 | 원문 문장 |
|---|---|---|
| OpenAI | ChatGPT-User | Because these actions are initiated by a user, robots.txt rules may not apply. |
| Anthropic | Claude-User | Disabling Claude-User on your site prevents our system from retrieving your content in response to a user query, which may reduce your site's visibility for user-directed web search. |
| Perplexity | Perplexity-User | Since a user requested the fetch, this fetcher generally ignores robots.txt rules. |
| Google-Agent | Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules. | |
| Meta | Meta-ExternalFetcher | Accordingly, this crawler may bypass robots.txt rules. |
Since a user requested the fetch, this fetcher generally ignores robots.txt rules.
검색 색인을 위해 크롤링하는 크롤러와 사용자 요청에 따라 페이지를 가져오는 에이전트는 작동 방식이 다릅니다. 색인용 크롤러는 robots.txt 로 제어하고, 사용자 트리거 에이전트는 그 파일이 적용되지 않을 수 있다고 명시한 기업이 많습니다.
Anthropic 은 Claude-User 를 차단하면 사용자 질문에 맞춰 콘텐츠를 가져오지 못한다고 명시했습니다. 같은 유형의 사용자 에이전트라도 기업마다 설명이 다릅니다.
발견 03
Google-Extended 와 Applebot-Extended 는 크롤러가 아니라 학습 사용 여부만 제어하는 토큰입니다
Google-Extended doesn't have a separate HTTP request user agent string.
Applebot-Extended does not crawl webpages.
이 두 토큰은 서버 로그에 사용자 에이전트로 기록되는 크롤러가 아닙니다. 페이지를 크롤링하는 크롤러는 Googlebot 과 Applebot 이고, 두 토큰은 그렇게 수집한 콘텐츠를 학습에 사용할지만 제어합니다.
발견 04
빙은 코파일럿 답변 노출을 사용자 에이전트가 아니라 메타 태그로 제어한다고 명시했습니다
NOARCHIVE prevents content from being used in Copilot responses and grounding results.
빙 웹마스터 가이드라인은 빙 검색과 코파일럿이 같은 크롤링·색인·순위 시스템 위에서 작동한다고 명시했습니다. 그래서 코파일럿만 따로 제어하는 사용자 에이전트가 문서에 없습니다.
그럼 robots.txt 에는 무엇을 설정하나요?
- 검색·답변 크롤러(OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot 등)와 AI 학습 크롤러(GPTBot, ClaudeBot, Google-Extended, Applebot-Extended 등)를 따로 지정합니다.
- 사용자 트리거 에이전트는 robots.txt 만으로 차단되지 않을 수 있다는 점을 고려합니다.
- 빙 코파일럿 답변 노출은 NOARCHIVE 메타 태그로 제어합니다.
조사 방법
- OpenAI 「Overview of OpenAI Crawlers」 · 최종 확인일 2026-09-14 · https://developers.openai.com/api/docs/bots
- Anthropic 「Does Anthropic crawl data from the web, and how can site owners block the crawler?」 (문서 수정일 2026-04-07) · 최종 확인일 2026-09-14 · https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Perplexity 「Perplexity Crawlers」 · 최종 확인일 2026-09-14 · https://docs.perplexity.ai/docs/resources/perplexity-crawlers
- Google Search Central 「Google's common crawlers」 (문서 수정일 2026-07-14) · 최종 확인일 2026-09-14 · https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- Google Search Central 「Google User-Triggered Fetchers」 (문서 수정일 2026-08-19) · 최종 확인일 2026-09-14 · https://developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
- Microsoft Bing 「Bing Webmaster Guidelines」 · 최종 확인일 2026-09-14 · https://www.bing.com/webmasters/help/webmaster-guidelines-30fba23a
- Apple 「About Applebot」 (문서 수정일 2026-09-04) · 최종 확인일 2026-09-14 · https://support.apple.com/en-us/119829
- Meta 「Meta Web Crawlers」 · 최종 확인일 2026-09-14 · https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers
- 원문 문장은 영어 그대로 옮겼습니다. 표의 항목명과 칸 판정만 한국어로 적었습니다.
- 기업 공식 문서가 명시한 범위까지입니다. 크롤러의 실제 동작은 서버 로그로 별도 확인합니다.
- 구글의 사용자 트리거 에이전트는 여러 개입니다. 표에는 Google-Agent 를 대표로 적었고, 원문 문장은 해당 문서 전체에 적용되는 문장입니다.