본문 바로가기
MAKESITE

점검 항목 · AI 인용

학습 크롤러 정책 — 관찰만 합니다

학습에 쓰이는 것을 막을지는 사업에 따라 답이 다릅니다. 그래서 점수를 매기지 않고 지금 설정이 어떤지만 알려 드립니다.

심각도 낮음 AI 인용 무료 스캔 판정 항목 /check/ai-training-policy

01DEFINITION

한 줄로 말하면

학습 데이터를 모으러 오는 크롤러는 답변에 인용하러 오는 것과 다릅니다. GPTBot 을 막아도 ChatGPT 가 웹을 뒤져 답할 때 쓰는 크롤러는 그대로 들어오고, Google-Extended 를 막아도 구글 검색과 AI 개요는 영향을 받지 않습니다. 그래서 이 항목은 점수를 매기지 않고 지금 설정이 어떤지만 알려 드립니다. 저작물이 곧 상품인 곳은 막는 쪽이 맞고, 알려지는 것이 곧 매출인 곳은 여는 쪽이 맞습니다 — 둘 중 어느 쪽인지는 우리가 정할 일이 아닙니다.

02RISK

없으면 무슨 일이 생기나

학습용 크롤러를 막는 것 자체는 결함이 아닙니다. 기사·사진·강의처럼 저작물이 곧 상품인 곳은 막는 쪽이 맞고, 알려지는 것이 곧 매출인 곳은 여는 쪽이 맞습니다. 답이 사업에 따라 갈리는 물음이라 저희는 이 항목을 점수에 넣지 않습니다. 대신 지금 무엇이 막혀 있는지를 그대로 보여 드립니다.

실제로 문제가 되는 것은 결정하지 않은 채로 굳는 경우입니다. 몇 년 전 보안 지침으로 사람이 아닌 것을 전부 막아 두었고, 그 뒤 새로 생긴 이름이 하나씩 추가돼 왔으며, 지금 누구도 그 목록을 설명하지 못합니다. 그 상태에서는 학습을 막고 싶었는지 답변 인용을 막고 싶었는지가 파일에 남아 있지 않습니다.

반대 방향의 오해도 흔합니다. 학습 크롤러를 막으면 AI 답변에서 사라진다고 알고 계신 경우인데, 그렇지 않습니다. 이용자가 질문한 그 순간 웹을 읽으러 오는 크롤러는 이름이 따로 있고, 구글 AI 개요는 일반 검색 크롤러가 읽은 내용을 씁니다. 두 가지를 같은 줄에서 정하면 원치 않던 쪽이 같이 닫힙니다.

03CHECK IT YOURSELF

직접 확인하는 방법

아래는 저희를 거치지 않고 지금 해 보실 수 있는 방법입니다. 결과를 저희에게 보내실 필요도 없습니다.

  1. 01
    학습용 이름이 어디에 적혀 있는지 본다

    이 이름들이 보이면 누군가 한 번은 결정했다는 뜻입니다. 하나도 안 보이는데 별표 그룹에 전체 차단이 있다면, 결정하지 않은 채로 전부 막혀 있는 상태입니다.

    $ curl -s https://example.com/robots.txt \
      | grep -inE "GPTBot|ClaudeBot|anthropic-ai|Google-Extended|CCBot|Bytespider"

나머지 확인 방법 2단계는 셀프수리 가이드에 있습니다.

04HOW TO FIX

고치는 방법

서버 환경에 따라 적을 자리가 다릅니다. 아래는 가장 흔한 구성 기준이고, 적용 전에 현재 설정을 백업하십시오.

학습을 막고 싶다면 학습용만 막는다

이 이름들은 사업자가 학습·데이터 수집용이라고 스스로 밝힌 쪽입니다. 여기만 막으면 답변 인용은 그대로 유지됩니다.

그러면서 답변용은 열어 둔다
학습에 개의치 않는다면 아무것도 적지 않아도 된다
조치 코드는 셀프수리 가이드에 있습니다. 서버 구성별 설정 원문 3단계와, 귀사 사이트에서 실제로 관찰된 값이 함께 실립니다 — 무엇을 어디에 적어야 하는지가 정해집니다.
가이드 안내 보기 · 먼저 무료로 진단받기
이미 열람권을 구매하셨다면 안내 메일의 가이드 링크로 바로 열립니다 — 링크를 잃으셨다면 문의 주시면 다시 보내 드립니다.
주의. 이 항목은 통과·실패를 매기지 않습니다. 어느 쪽이 옳은지는 저희가 정할 일이 아니기 때문입니다. 다만 결정하지 않은 상태와 결정한 상태는 구별할 수 있어야 해서, 지금 몇 종이 막혀 있는지를 그대로 적어 드립니다. 그리고 저희가 보는 것은 robots.txt 에 적힌 내용이지 실제로 학습에 쓰였는지가 아닙니다 — 그것은 밖에서 확인할 방법이 없습니다.

05FAQ

자주 묻는 질문

학습 크롤러를 막으면 AI 답변에서 사라지나요

아닙니다. 이용자가 질문한 그 순간 웹을 읽으러 오는 크롤러는 이름이 따로 있고, 구글 AI 개요는 일반 검색 크롤러가 읽은 내용을 씁니다. 학습용만 막는 설정은 답변 인용에 영향을 주지 않습니다. 답변에 인용되는 쪽이 막혀 있는지는 「답변형 AI 크롤러」 항목이 따로 봅니다.

왜 점수를 안 매기나요

답이 사업에 따라 갈리기 때문입니다. 저작물이 곧 상품인 곳은 막는 쪽이 맞고 알려지는 것이 곧 매출인 곳은 여는 쪽이 맞습니다. 어느 한쪽을 감점하면 그 판정은 절반의 고객에게 틀린 말이 됩니다. 대신 지금 상태를 그대로 보여 드려서 결정할 수 있게 합니다.

막으면 학습에 실제로 안 쓰이나요

robots.txt 는 규약이지 기술적 차단이 아닙니다. 주요 사업자들은 자기 크롤러 이름을 공개하고 이 파일을 따른다고 밝히고 있지만, 그것을 밖에서 검증할 방법은 없습니다. 확실히 막으려면 방화벽이나 앞단 보안 서비스에서 사용자 에이전트 기준으로 차단해야 합니다.

학습용과 답변용 구분이 계속 유지되나요

이 구분은 각 사업자가 스스로 밝힌 정책에 근거한 것이고 강제력이 있는 규약은 아닙니다. 이름이 새로 생기거나 역할이 바뀌는 일도 있습니다. 반년에 한 번쯤 접속 로그에서 낯선 이름을 확인하시고, 그때 이 목록도 같이 손보시는 편이 좋습니다.
여기까지는 항목 일반론입니다. 무엇이고 왜 문제이며 어떻게 고치는지는 감출 이유가 없어 그대로 적었습니다. 리포트에 들어가는 것은 귀사 사이트에서 실제로 어떤 값이 나왔는지 — 어느 주소의 어느 응답인지, 그 환경에서 어떤 순서로 적용해야 하는지, 예상 공수가 얼마인지입니다. 이 페이지만 보고 직접 고치셔도 되고, 실제로 그러시라고 적어 두었습니다.

GET STARTED

내 사이트는
이 항목을 통과할까요

주소만 넣으시면 이 항목을 포함해 46가지를 판정해 점수와 실패 개수를 보여 드립니다. 로그인도, 소유 확인도 필요 없습니다 — 전부 밖에서 관찰만 하는 항목이기 때문입니다.

무료 스캔 문의하기 로그인