AI 답변의 기준 · 공식 문서

AI 기업 7개사 중 4개사는 사용자 트리거 에이전트에 robots.txt 가 적용되지 않을 수 있다고 명시했습니다

OpenAI 공식 문서에서 GPTBot 은 학습 여부를 제어하는 사용자 에이전트이고, 검색 답변 노출은 OAI-SearchBot 이 제어합니다. AI 기업 7개사의 크롤러 문서를 대조하니 5개사가 학습용 사용자 에이전트를 검색용과 분리했고, 사용자 트리거 에이전트를 둔 5개사 가운데 4개사는 robots.txt 가 적용되지 않을 수 있다고 명시했습니다.

AI 크롤러를 차단하거나 허용할 때 흔히 사용자 에이전트 이름 몇 개를 한꺼번에 적습니다. 같은 목록에 있는 이름이라도 기업 공식 문서가 명시한 역할은 서로 다릅니다.

OpenAI, Anthropic, Perplexity, Google, Microsoft, Apple, Meta의 크롤러 공식 문서를 확인해 사용자 에이전트별 역할과 robots.txt 적용 범위를 대조했습니다.

발견 01

5개사는 학습 제어용 사용자 에이전트를 검색용과 분리했습니다

기업마다 사용자 에이전트를 분리한 영역이 다릅니다
  • 사용자 에이전트를 별도 명시
  • 사용자 에이전트 대신 다른 제어 방식 명시
  • 공식 문서에 없음
검색·답변 크롤러AI 학습 크롤러사용자 트리거 에이전트OpenAIOpenAI · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시OpenAI · AI 학습 크롤러 · 사용자 에이전트를 별도 명시OpenAI · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시AnthropicAnthropic · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Anthropic · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Anthropic · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시PerplexityPerplexity · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Perplexity · AI 학습 크롤러 · 사용자 에이전트 대신 다른 제어 방식 명시Perplexity · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시GoogleGoogle · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Google · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Google · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시MicrosoftMicrosoft · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Microsoft · AI 학습 크롤러 · 사용자 에이전트 대신 다른 제어 방식 명시Microsoft · 사용자 트리거 에이전트 · 공식 문서에 없음AppleApple · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Apple · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Apple · 사용자 트리거 에이전트 · 공식 문서에 없음MetaMeta · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Meta · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Meta · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시검색·답변크롤러AI 학습크롤러사용자 트리거에이전트OpenAIOpenAI · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시OpenAI · AI 학습 크롤러 · 사용자 에이전트를 별도 명시OpenAI · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시AnthropicAnthropic · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Anthropic · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Anthropic · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시PerplexityPerplexity · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Perplexity · AI 학습 크롤러 · 사용자 에이전트 대신 다른 제어 방식 명시Perplexity · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시GoogleGoogle · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Google · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Google · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시MicrosoftMicrosoft · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Microsoft · AI 학습 크롤러 · 사용자 에이전트 대신 다른 제어 방식 명시Microsoft · 사용자 트리거 에이전트 · 공식 문서에 없음AppleApple · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Apple · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Apple · 사용자 트리거 에이전트 · 공식 문서에 없음MetaMeta · 검색·답변 크롤러 · 사용자 에이전트를 별도 명시Meta · AI 학습 크롤러 · 사용자 에이전트를 별도 명시Meta · 사용자 트리거 에이전트 · 사용자 에이전트를 별도 명시

칸마다 근거는 해당 기업의 크롤러 공식 문서입니다. 사용자 에이전트 이름은 아래 표에 있습니다.

기업검색·답변 크롤러AI 학습 크롤러사용자 트리거 에이전트
OpenAIOAI-SearchBotGPTBotChatGPT-User
AnthropicClaude-SearchBotClaudeBotClaude-User
PerplexityPerplexityBot검색 크롤러를 AI 학습에 사용하지 않는다고 명시Perplexity-User
GoogleGooglebotGoogle-ExtendedGoogle-Agent
MicrosoftBingbot사용자 에이전트 토큰 대신 NOARCHIVE 메타 태그로 제어한다고 명시문서에 없음
AppleApplebotApplebot-Extended문서에 없음
MetaMeta-WebIndexerMeta-ExternalAgentMeta-ExternalFetcher
Each setting is independent of the others – for example, a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI’s generative AI foundation models.
OpenAI 「Overview of OpenAI Crawlers」

학습용 사용자 에이전트가 없는 2개사도 이유를 명시했습니다. Perplexity 는 검색 크롤러를 AI 모델 학습에 사용하지 않는다고 명시했고, Microsoft 는 사용자 에이전트 대신 NOARCHIVE 메타 태그로 제어한다고 명시했습니다.

발견 02

사용자 트리거 에이전트는 5개사 중 4개사에서 robots.txt 적용 범위 밖일 수 있습니다

기업사용자 트리거 에이전트원문 문장
OpenAIChatGPT-UserBecause these actions are initiated by a user, robots.txt rules may not apply.
AnthropicClaude-UserDisabling Claude-User on your site prevents our system from retrieving your content in response to a user query, which may reduce your site's visibility for user-directed web search.
PerplexityPerplexity-UserSince a user requested the fetch, this fetcher generally ignores robots.txt rules.
GoogleGoogle-AgentBecause the fetch was requested by a user, these fetchers generally ignore robots.txt rules.
MetaMeta-ExternalFetcherAccordingly, this crawler may bypass robots.txt rules.
사용자가 채팅창에 URL 을 붙여 넣거나 질문할 때 그 요청에 따라 페이지를 가져오는 사용자 트리거 에이전트(user-triggered fetcher)입니다.
Since a user requested the fetch, this fetcher generally ignores robots.txt rules.
Perplexity 「Perplexity Crawlers」

검색 색인을 위해 크롤링하는 크롤러와 사용자 요청에 따라 페이지를 가져오는 에이전트는 작동 방식이 다릅니다. 색인용 크롤러는 robots.txt 로 제어하고, 사용자 트리거 에이전트는 그 파일이 적용되지 않을 수 있다고 명시한 기업이 많습니다.

Anthropic 은 Claude-User 를 차단하면 사용자 질문에 맞춰 콘텐츠를 가져오지 못한다고 명시했습니다. 같은 유형의 사용자 에이전트라도 기업마다 설명이 다릅니다.

발견 03

Google-Extended 와 Applebot-Extended 는 크롤러가 아니라 학습 사용 여부만 제어하는 토큰입니다

Google-Extended doesn't have a separate HTTP request user agent string.
Google Search Central 「Google's common crawlers」
Applebot-Extended does not crawl webpages.
Apple 「About Applebot」

이 두 토큰은 서버 로그에 사용자 에이전트로 기록되는 크롤러가 아닙니다. 페이지를 크롤링하는 크롤러는 Googlebot 과 Applebot 이고, 두 토큰은 그렇게 수집한 콘텐츠를 학습에 사용할지만 제어합니다.

발견 04

빙은 코파일럿 답변 노출을 사용자 에이전트가 아니라 메타 태그로 제어한다고 명시했습니다

NOARCHIVE prevents content from being used in Copilot responses and grounding results.
Microsoft Bing 「Bing Webmaster Guidelines」

빙 웹마스터 가이드라인은 빙 검색과 코파일럿이 같은 크롤링·색인·순위 시스템 위에서 작동한다고 명시했습니다. 그래서 코파일럿만 따로 제어하는 사용자 에이전트가 문서에 없습니다.

그럼 robots.txt 에는 무엇을 설정하나요?

  1. 검색·답변 크롤러(OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot 등)와 AI 학습 크롤러(GPTBot, ClaudeBot, Google-Extended, Applebot-Extended 등)를 따로 지정합니다.
  2. 사용자 트리거 에이전트는 robots.txt 만으로 차단되지 않을 수 있다는 점을 고려합니다.
  3. 빙 코파일럿 답변 노출은 NOARCHIVE 메타 태그로 제어합니다.

조사 방법

  • OpenAI 「Overview of OpenAI Crawlers」 · 최종 확인일 2026-09-14 · https://developers.openai.com/api/docs/bots
  • Anthropic 「Does Anthropic crawl data from the web, and how can site owners block the crawler?」 (문서 수정일 2026-04-07) · 최종 확인일 2026-09-14 · https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
  • Perplexity 「Perplexity Crawlers」 · 최종 확인일 2026-09-14 · https://docs.perplexity.ai/docs/resources/perplexity-crawlers
  • Google Search Central 「Google's common crawlers」 (문서 수정일 2026-07-14) · 최종 확인일 2026-09-14 · https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
  • Google Search Central 「Google User-Triggered Fetchers」 (문서 수정일 2026-08-19) · 최종 확인일 2026-09-14 · https://developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  • Microsoft Bing 「Bing Webmaster Guidelines」 · 최종 확인일 2026-09-14 · https://www.bing.com/webmasters/help/webmaster-guidelines-30fba23a
  • Apple 「About Applebot」 (문서 수정일 2026-09-04) · 최종 확인일 2026-09-14 · https://support.apple.com/en-us/119829
  • Meta 「Meta Web Crawlers」 · 최종 확인일 2026-09-14 · https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers
  • 원문 문장은 영어 그대로 옮겼습니다. 표의 항목명과 칸 판정만 한국어로 적었습니다.
  • 기업 공식 문서가 명시한 범위까지입니다. 크롤러의 실제 동작은 서버 로그로 별도 확인합니다.
  • 구글의 사용자 트리거 에이전트는 여러 개입니다. 표에는 Google-Agent 를 대표로 적었고, 원문 문장은 해당 문서 전체에 적용되는 문장입니다.