Безкоштовний інструмент · без реєстрації · миттєво

AI Crawler Checker — які AI-боти мають доступ до твого сайту

Встав URL. Цей AI crawler checker читає robots.txt і показує, які AI-боти дозволені чи заблоковані — GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended та інші. Якщо заблоковані краулери, що цитують тебе — це знахідка номер один.

Читає лише /robots.txt через HTTPS. Нічого не зберігається. Результат — за правилами robots.txt, не за живим запитом бота.

Що перевіряє цей AI crawler checker

Інструмент інспектує єдиний файл, що керує доступом краулерів — твій robots.txt — і повідомляє його точно. Він не шле живий запит від імені кожного бота, тож результат каже «Дозволено robots.txt», а не «AI точно дістанеться сайту».

  • Доступність robots.txt і HTTP-статус
  • Специфічні User-agent групи
  • Найбільш специфічне правило на бота (Allow / Disallow, longest-match)
  • Суцільні User-agent: * правила, що ловлять AI-ботів без власного правила
  • Sitemap-декларації в robots.txt
  • Живий per-bot user-agent запит (планується)
  • Meta robots / X-Robots-Tag headers (планується)
  • Cloudflare / WAF bot-правила і 403 (планується)
  • Структура llms.txt (вже працює — Валідатор llms.txt)

Сайт може пройти цю robots.txt-перевірку і все одно блокувати AI-ботів на firewall. Якщо підозрюєш WAF-блок — перевір окремо.

Підтримувані AI-краулери і що блокує кожного з них

Це AI та AI-суміжні краулери, які тестує інструмент, згруповані за їхньою документованою задачею. User-agent токени — точні рядки, які публікує кожен вендор (перевірено березень 2026).

КраулерКомпаніяКатегоріяНа що впливає блок
AI-пошук / discovery
OAI-SearchBot OpenAI AI-пошук / discovery Придатність зʼявлятися лінкованим джерелом у ChatGPT Search.
PerplexityBot Perplexity AI-пошук / discovery Придатність бути джерелом відповіді Perplexity.
Claude-SearchBot Anthropic AI-пошук / discovery Придатність бути цитованим Claude web search.
DuckAssistBot DuckDuckGo AI-пошук / discovery Включення у відповіді DuckAssist.
YouBot You.com AI-пошук / discovery Включення в AI-відповіді You.com.
User-triggered fetch
ChatGPT-User OpenAI User-triggered fetch Здатність ChatGPT відкрити твою сторінку на запит користувача.
Claude-User Anthropic User-triggered fetch Здатність Claude відкрити твою сторінку на запит користувача.
Perplexity-User Perplexity User-triggered fetch Відкриття твоєї сторінки Perplexity на запит користувача.
Meta-ExternalFetcher Meta User-triggered fetch Відкриття Meta AI лінка, яким поділився користувач.
Тренування моделі
GPTBot OpenAI Тренування моделі Чи використовується твій контент для тренування моделей OpenAI.
Google-Extended Google Тренування моделі Чи тренує твій контент Gemini — не Google Search і не AI Overviews.
ClaudeBot Anthropic Тренування моделі Загальний краул Anthropic по твоєму сайту.
anthropic-ailegacy Anthropic Тренування моделі Legacy-краул Anthropic (переважно історичний).
CCBot Common Crawl Тренування моделі Включення в датасет Common Crawl, який використовують багато моделей.
Google-CloudVertexBot Google Тренування моделі Fetch агентів Vertex AI для клієнтів Google Cloud.
Applebot-Extended Apple Тренування моделі Чи тренує твій контент Apple Intelligence.
Meta-ExternalAgent Meta Тренування моделі Чи тренує твій контент моделі Meta.
Bytespider ByteDance Тренування моделі Тренування моделей ByteDance і crawl-навантаження.
cohere-ai Cohere Тренування моделі Чи тренує твій контент моделі Cohere.
Традиційний пошук
Googlebot Google Традиційний пошук Google Search І AI Overviews разом — рідко доцільно.
Bingbot Microsoft Традиційний пошук Bing, Copilot і опосередковано ChatGPT Search.
Applebot Apple Традиційний пошук Підказки Siri і Spotlight.
Amazonbot Amazon Традиційний пошук Відповіді Alexa і індексація Amazon.

AI-пошукові краулери vs AI training-краулери

Яка різниця між AI-пошуковим краулером і AI training-краулером? AI-пошуковий краулер — як OAI-SearchBot, PerplexityBot чи Claude-SearchBot — індексує твої сторінки, щоб AI-двигун міг їх знайти, процитувати й лінкувати при відповіді. Це боти, що роблять тебе придатним до цитування. AI training-краулер — як GPTBot, Google-Extended чи CCBot — збирає контент, щоб тренувати базові знання моделі, не щоб цитувати тебе в реальному часі. Блок training-краулера — рішення про content-rights, що тримає сторінки поза training-даними; він не прибирає тебе з AI-пошукових відповідей. Блок пошукового краулера, навпаки, прямо прибирає тебе з цитованих джерел двигуна.

Чому AI-боти можуть бути заблоковані — і як це виправити

Якщо потрібний краулер заблокований, пройдись імовірними причинами по порядку. Більшість тихих блоків — одна з цих.

  1. robots.txt Disallow. Правило типу Disallow: / під User-agent групою бота. Фікс: додай Allow: / або прибери Disallow для цього агента.
  2. Суцільний User-agent: * Disallow. Site-wide блок ловить кожен AI-бот без власного правила. Фікс: додай явні Allow-групи для потрібних AI-ботів.
  3. HTTP 401 / 403. Не robots-проблема — WAF, CDN чи auth-шар відхиляє бота. Фікс: дозволь user-agent або його верифіковані IP у firewall.
  4. Cloudflare / WAF «block AI bots». Кероване правило блокує AI-краулерів попри robots.txt. Фікс: винятки для потрібних AI-пошукових ботів у WAF, не лише в robots.txt.
  5. Rate limiting. Агресивні ліміти віддають 429, і бот відступає. Фікс: підніми ліміти для верифікованих IP краулерів.
  6. Серверні помилки (5xx). Бот не проіндексує сторінку, що постійно падає. Фікс: усунь помилки і підтверди стабільний 200.
  7. X-Robots-Tag / meta robots noindex. Сторінка crawlable, але позначена non-indexable. Фікс: прибери noindex, де хочеш придатність.
  8. Redirect-петлі або недоступний robots.txt. Якщо /robots.txt 5xx\'ить чи петлить, деякі боти трактують сайт як disallowed. Фікс: віддавай чистий 200 чи 404 для /robots.txt.

Як дозволити чи заблокувати AI-краулерів у robots.txt

Скопіюй рецепт і адаптуй. Дай кожному боту власну User-agent групу, щоб правила не колідували, і памʼятай: robots.txt — advisory. Compliant-краулери його поважають, але це не firewall-рівень enforcement, і він не прибирає URL з жодного індексу.

Дозволити всі AI-краулери (default-open)
User-agent: *
Allow: /
Блокувати training, дозволити AI-пошук і user-fetch
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /
Блокувати один training-краулер (GPTBot)
User-agent: GPTBot
Disallow: /
Явно дозволити ChatGPT Search і fetch
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

robots.txt vs llms.txt

robots.txtllms.txt
ПризначенняКаже краулерам, які шляхи можна запитуватиВказує AI-інструментам на ключовий контент у Markdown
EnforceabilityAdvisory — поважають compliant-боти, не firewallAdvisory guidance — не access-control
Хто читаєSearch і AI-краулери, що слідують стандартуAI-інструменти, що обрали підтримку (не універсально)
ОсновнеКонтроль доступу краулу per user-agentДопомогти AI зрозуміти й винести твої найкращі сторінки
ОбмеженняНе запобігає індексації; ігнорується non-compliant ботамиEmerging-конвенція; без гарантії ранкінгу чи доступу

Жоден файл не блокує non-compliant бота, і жоден не прибирає URL з індексу. Для контролю індексації використовуй noindex. Перевірити власний файл — у Валідаторі llms.txt; деталі — у гайді llms.txt і політиці доступу AI-краулерів.

Чи гарантує доступ краулерів AI-видимість?

Ні. Дозвіл AI-краулерам — технічна передумова, не гарантія. Чи цитуватиме тебе двигун реально, також залежить від індексованості, якості й глибини контенту, топікальної релевантності, авторитету й лінків, structured data, brand mentions і власного retrieval кожного двигуна. Доступ прибирає блокер, щоб сторінки могли розглядатись; бути обраним цитованим джерелом — окрема конкурентна задача. Саме цей розрив міряє AI Visibility Audit, і саме над ним працюють AEO і GEO.

AI crawler checker — FAQ

Що таке AI crawler checker?

AI crawler checker читає robots.txt сайту і показує, які AI-краулери — GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended та інші — дозволені чи заблоковані. Ти одразу бачиш, чи можуть AI-пошукові й training-боти запитувати сайт. Він перевіряє правила robots.txt, а не живу поведінку ботів.

Як перевірити, чи GPTBot має доступ до мого сайту?

Встав URL у чекер вище. Він фетчить /robots.txt і знаходить правило для GPTBot — його власну User-agent групу, якщо є, інакше wildcard-групу — і показує «Дозволено robots.txt» чи «Заблоковано robots.txt». GPTBot — training-краулер, тож його блок не прибирає тебе з ChatGPT Search.

Яка різниця між GPTBot і OAI-SearchBot?

Обидва — агенти OpenAI з різними задачами. GPTBot краулить, щоб тренувати моделі OpenAI. OAI-SearchBot індексує сторінки, щоб ChatGPT Search міг їх знайти й лінкувати. Блок GPTBot тримає контент поза тренуванням; блок OAI-SearchBot прибирає тебе з джерел ChatGPT Search. Керуються окремими правилами.

Чи може ChatGPT отримати доступ до сайту, що блокує GPTBot?

Так. GPTBot — лише training-краулер. ChatGPT Search спирається на OAI-SearchBot для індексації і ChatGPT-User для фетчу на запит. Сайт може блокувати GPTBot (opt-out з тренування), лишаючи OAI-SearchBot і ChatGPT-User дозволеними, і бути повністю доступним для ChatGPT Search.

Що таке ChatGPT-User?

ChatGPT-User — user-triggered фетчер OpenAI. Він завантажує конкретну сторінку, коли користувач ChatGPT питає про цей URL або модель браузить від його імені. Це не bulk-індексатор. Блок зупиняє ChatGPT від живого відкриття твоєї сторінки під час розмови.

Яка різниця між PerplexityBot і Perplexity-User?

PerplexityBot — індексаційний краулер Perplexity, що будує його answer-індекс. Perplexity-User — живий фетч, який спрацьовує, коли користувач посилається на твою сторінку. Блок PerplexityBot прибирає тебе з індексованих джерел; блок Perplexity-User лише зупиняє on-demand фетчі.

Google-Extended керує Google Search чи AI Overviews?

Жодним — щодо ранжування. Google-Extended — training-toggle: керує, чи використовується твій контент для тренування Gemini і Vertex AI. Він не впливає на краул Googlebot, твої позиції в Google Search чи придатність до AI Overviews — вони йдуть за стандартним доступом Googlebot.

Як дозволити ClaudeBot у robots.txt?

Додай групу з User-agent: ClaudeBot і або без відповідного Disallow, або з явним Allow: /. Зверни увагу: Anthropic тепер має три боти — ClaudeBot (краул), Claude-SearchBot (search-індекс) і Claude-User (живий фетч) — тож дозволяй кожен потрібний, не лише ClaudeBot.

Чи може Cloudflare блокувати AI-краулерів?

Так. Cloudflare та інші WAF/CDN-шари можуть блокувати чи challeng'ити AI-ботів за user-agent або керованими «block AI bots» правилами, незалежно від robots.txt. Цей чекер читає лише robots.txt, тож сайт може пройти тут і все одно бути заблокований на firewall із 403 — перевір це окремо.

Чому AI-бот отримує 403?

403 зазвичай іде від WAF, CDN bot-management правила, rate-limiting чи серверного правила, що відхиляє user-agent або IP бота — не від robots.txt. Robots-блок просто просить compliant-бота не запитувати сторінку; він не віддає 403. Якщо AI-боти отримують 403 — перевір Cloudflare/WAF, не лише robots.txt.

Яка різниця між robots.txt і llms.txt?

robots.txt — широко визнаний стандарт, що каже compliant-краулерам, які шляхи вони можуть запитувати. llms.txt — emerging добровільний Markdown-файл, що вказує AI-інструментам на твій ключовий контент; це guidance, не access-control чи ranking-механізм, і підтримка не універсальна. robots.txt контролює доступ; llms.txt пропонує, що читати.

Чи гарантує дозвіл AI-краулерам цитування?

Ні. Дозвіл краулеру — одна технічна передумова: він робить сторінки fetchable. Чи цитуватиме тебе AI-двигун реально, залежить від індексації, якості контенту, релевантності, авторитету, структури і власного retrieval кожного двигуна. Доступ прибирає блокер; він не гарантує AI-видимість.

Як заблокувати AI training-боти, але дозволити AI-пошукові?

Disallow training user-agents (GPTBot, Google-Extended, CCBot, Applebot-Extended, Meta-ExternalAgent), дозволяючи search і user-fetch (OAI-SearchBot, PerplexityBot, Claude-SearchBot, ChatGPT-User, Claude-User). Дай кожному власну User-agent групу, щоб правила не колідували. Дивись robots.txt-приклади вище.

Чи може robots.txt запобігти індексації?

Ні. robots.txt контролює краулінг, не індексацію. Заблокований URL усе одно може індексуватись без контенту, якщо на нього лінкують інші сторінки. Щоб тримати сторінку поза індексом, використовуй noindex meta robots чи X-Robots-Tag header на crawlable-сторінці — не robots.txt disallow.

Як часто перевіряти доступ AI-краулерів?

Перевіряй після будь-якої зміни robots.txt, CDN чи WAF, після міграції чи зміни платформи, і щоразу, коли вендори публікують нові user-agents — а це буває регулярно. Квартальна перевірка плюс event-based на кожен деплой ловить більшість тихих блоків, перш ніж вони коштуватимуть цитувань.

Доступ краулерів — одна з 47 перевірок.

Повний AI Visibility Audit також скорить твою schema, llms.txt, entity-сигнали і живі цитування — звіт 0–100 на пошту за хвилину.

Запустити безкоштовний AI Visibility Audit