Безкоштовний інструмент · без реєстрації · миттєво
AI Crawler Checker — які AI-боти мають доступ до твого сайту
Встав URL. Цей AI crawler checker читає robots.txt і показує, які AI-боти дозволені чи заблоковані — GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended та інші. Якщо заблоковані краулери, що цитують тебе — це знахідка номер один.
Читає лише /robots.txt через HTTPS. Нічого не зберігається. Результат — за правилами robots.txt, не за живим запитом бота.
Що перевіряє цей AI crawler checker
Інструмент інспектує єдиний файл, що керує доступом краулерів — твій robots.txt — і повідомляє його точно. Він не шле живий запит від імені кожного бота, тож результат каже «Дозволено robots.txt», а не «AI точно дістанеться сайту».
- Доступність robots.txt і HTTP-статус
- Специфічні
User-agentгрупи - Найбільш специфічне правило на бота (Allow / Disallow, longest-match)
- Суцільні
User-agent: *правила, що ловлять AI-ботів без власного правила - Sitemap-декларації в robots.txt
- Живий per-bot user-agent запит (планується)
- Meta robots / X-Robots-Tag headers (планується)
- Cloudflare / WAF bot-правила і 403 (планується)
- Структура llms.txt (вже працює — Валідатор llms.txt)
Сайт може пройти цю robots.txt-перевірку і все одно блокувати AI-ботів на firewall. Якщо підозрюєш WAF-блок — перевір окремо.
Підтримувані AI-краулери і що блокує кожного з них
Це AI та AI-суміжні краулери, які тестує інструмент, згруповані за їхньою документованою задачею. User-agent токени — точні рядки, які публікує кожен вендор (перевірено березень 2026).
| Краулер | Компанія | Категорія | На що впливає блок |
|---|---|---|---|
| AI-пошук / discovery | |||
| OAI-SearchBot | OpenAI | AI-пошук / discovery | Придатність зʼявлятися лінкованим джерелом у ChatGPT Search. |
| PerplexityBot | Perplexity | AI-пошук / discovery | Придатність бути джерелом відповіді Perplexity. |
| Claude-SearchBot | Anthropic | AI-пошук / discovery | Придатність бути цитованим Claude web search. |
| DuckAssistBot | DuckDuckGo | AI-пошук / discovery | Включення у відповіді DuckAssist. |
| YouBot | You.com | AI-пошук / discovery | Включення в AI-відповіді You.com. |
| User-triggered fetch | |||
| ChatGPT-User | OpenAI | User-triggered fetch | Здатність ChatGPT відкрити твою сторінку на запит користувача. |
| Claude-User | Anthropic | User-triggered fetch | Здатність Claude відкрити твою сторінку на запит користувача. |
| Perplexity-User | Perplexity | User-triggered fetch | Відкриття твоєї сторінки Perplexity на запит користувача. |
| Meta-ExternalFetcher | Meta | User-triggered fetch | Відкриття Meta AI лінка, яким поділився користувач. |
| Тренування моделі | |||
| GPTBot | OpenAI | Тренування моделі | Чи використовується твій контент для тренування моделей OpenAI. |
| Google-Extended | Тренування моделі | Чи тренує твій контент Gemini — не Google Search і не AI Overviews. | |
| ClaudeBot | Anthropic | Тренування моделі | Загальний краул Anthropic по твоєму сайту. |
| anthropic-ailegacy | Anthropic | Тренування моделі | Legacy-краул Anthropic (переважно історичний). |
| CCBot | Common Crawl | Тренування моделі | Включення в датасет Common Crawl, який використовують багато моделей. |
| Google-CloudVertexBot | Тренування моделі | Fetch агентів Vertex AI для клієнтів Google Cloud. | |
| Applebot-Extended | Apple | Тренування моделі | Чи тренує твій контент Apple Intelligence. |
| Meta-ExternalAgent | Meta | Тренування моделі | Чи тренує твій контент моделі Meta. |
| Bytespider | ByteDance | Тренування моделі | Тренування моделей ByteDance і crawl-навантаження. |
| cohere-ai | Cohere | Тренування моделі | Чи тренує твій контент моделі Cohere. |
| Традиційний пошук | |||
| Googlebot | Традиційний пошук | Google Search І AI Overviews разом — рідко доцільно. | |
| Bingbot | Microsoft | Традиційний пошук | Bing, Copilot і опосередковано ChatGPT Search. |
| Applebot | Apple | Традиційний пошук | Підказки Siri і Spotlight. |
| Amazonbot | Amazon | Традиційний пошук | Відповіді Alexa і індексація Amazon. |
AI-пошукові краулери vs AI training-краулери
Яка різниця між AI-пошуковим краулером і AI training-краулером? AI-пошуковий краулер — як OAI-SearchBot, PerplexityBot чи Claude-SearchBot — індексує твої сторінки, щоб AI-двигун міг їх знайти, процитувати й лінкувати при відповіді. Це боти, що роблять тебе придатним до цитування. AI training-краулер — як GPTBot, Google-Extended чи CCBot — збирає контент, щоб тренувати базові знання моделі, не щоб цитувати тебе в реальному часі. Блок training-краулера — рішення про content-rights, що тримає сторінки поза training-даними; він не прибирає тебе з AI-пошукових відповідей. Блок пошукового краулера, навпаки, прямо прибирає тебе з цитованих джерел двигуна.
Чому AI-боти можуть бути заблоковані — і як це виправити
Якщо потрібний краулер заблокований, пройдись імовірними причинами по порядку. Більшість тихих блоків — одна з цих.
- robots.txt Disallow. Правило типу
Disallow: /під User-agent групою бота. Фікс: додайAllow: /або прибери Disallow для цього агента. - Суцільний
User-agent: *Disallow. Site-wide блок ловить кожен AI-бот без власного правила. Фікс: додай явні Allow-групи для потрібних AI-ботів. - HTTP 401 / 403. Не robots-проблема — WAF, CDN чи auth-шар відхиляє бота. Фікс: дозволь user-agent або його верифіковані IP у firewall.
- Cloudflare / WAF «block AI bots». Кероване правило блокує AI-краулерів попри robots.txt. Фікс: винятки для потрібних AI-пошукових ботів у WAF, не лише в robots.txt.
- Rate limiting. Агресивні ліміти віддають 429, і бот відступає. Фікс: підніми ліміти для верифікованих IP краулерів.
- Серверні помилки (5xx). Бот не проіндексує сторінку, що постійно падає. Фікс: усунь помилки і підтверди стабільний 200.
- X-Robots-Tag / meta robots noindex. Сторінка crawlable, але позначена non-indexable. Фікс: прибери
noindex, де хочеш придатність. - Redirect-петлі або недоступний robots.txt. Якщо /robots.txt 5xx\'ить чи петлить, деякі боти трактують сайт як disallowed. Фікс: віддавай чистий 200 чи 404 для /robots.txt.
Як дозволити чи заблокувати AI-краулерів у robots.txt
Скопіюй рецепт і адаптуй. Дай кожному боту власну User-agent групу, щоб правила не колідували, і памʼятай: robots.txt — advisory. Compliant-краулери його поважають, але це не firewall-рівень enforcement, і він не прибирає URL з жодного індексу.
User-agent: *
Allow: / User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: / User-agent: GPTBot
Disallow: / User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: / robots.txt vs llms.txt
| robots.txt | llms.txt | |
|---|---|---|
| Призначення | Каже краулерам, які шляхи можна запитувати | Вказує AI-інструментам на ключовий контент у Markdown |
| Enforceability | Advisory — поважають compliant-боти, не firewall | Advisory guidance — не access-control |
| Хто читає | Search і AI-краулери, що слідують стандарту | AI-інструменти, що обрали підтримку (не універсально) |
| Основне | Контроль доступу краулу per user-agent | Допомогти AI зрозуміти й винести твої найкращі сторінки |
| Обмеження | Не запобігає індексації; ігнорується non-compliant ботами | Emerging-конвенція; без гарантії ранкінгу чи доступу |
Жоден файл не блокує non-compliant бота, і жоден не прибирає URL з індексу. Для контролю індексації використовуй noindex. Перевірити власний файл — у Валідаторі llms.txt; деталі — у гайді llms.txt і політиці доступу AI-краулерів.
Чи гарантує доступ краулерів AI-видимість?
Ні. Дозвіл AI-краулерам — технічна передумова, не гарантія. Чи цитуватиме тебе двигун реально, також залежить від індексованості, якості й глибини контенту, топікальної релевантності, авторитету й лінків, structured data, brand mentions і власного retrieval кожного двигуна. Доступ прибирає блокер, щоб сторінки могли розглядатись; бути обраним цитованим джерелом — окрема конкурентна задача. Саме цей розрив міряє AI Visibility Audit, і саме над ним працюють AEO і GEO.
AI crawler checker — FAQ
Що таке AI crawler checker?
AI crawler checker читає robots.txt сайту і показує, які AI-краулери — GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended та інші — дозволені чи заблоковані. Ти одразу бачиш, чи можуть AI-пошукові й training-боти запитувати сайт. Він перевіряє правила robots.txt, а не живу поведінку ботів.
Як перевірити, чи GPTBot має доступ до мого сайту?
Встав URL у чекер вище. Він фетчить /robots.txt і знаходить правило для GPTBot — його власну User-agent групу, якщо є, інакше wildcard-групу — і показує «Дозволено robots.txt» чи «Заблоковано robots.txt». GPTBot — training-краулер, тож його блок не прибирає тебе з ChatGPT Search.
Яка різниця між GPTBot і OAI-SearchBot?
Обидва — агенти OpenAI з різними задачами. GPTBot краулить, щоб тренувати моделі OpenAI. OAI-SearchBot індексує сторінки, щоб ChatGPT Search міг їх знайти й лінкувати. Блок GPTBot тримає контент поза тренуванням; блок OAI-SearchBot прибирає тебе з джерел ChatGPT Search. Керуються окремими правилами.
Чи може ChatGPT отримати доступ до сайту, що блокує GPTBot?
Так. GPTBot — лише training-краулер. ChatGPT Search спирається на OAI-SearchBot для індексації і ChatGPT-User для фетчу на запит. Сайт може блокувати GPTBot (opt-out з тренування), лишаючи OAI-SearchBot і ChatGPT-User дозволеними, і бути повністю доступним для ChatGPT Search.
Що таке ChatGPT-User?
ChatGPT-User — user-triggered фетчер OpenAI. Він завантажує конкретну сторінку, коли користувач ChatGPT питає про цей URL або модель браузить від його імені. Це не bulk-індексатор. Блок зупиняє ChatGPT від живого відкриття твоєї сторінки під час розмови.
Яка різниця між PerplexityBot і Perplexity-User?
PerplexityBot — індексаційний краулер Perplexity, що будує його answer-індекс. Perplexity-User — живий фетч, який спрацьовує, коли користувач посилається на твою сторінку. Блок PerplexityBot прибирає тебе з індексованих джерел; блок Perplexity-User лише зупиняє on-demand фетчі.
Google-Extended керує Google Search чи AI Overviews?
Жодним — щодо ранжування. Google-Extended — training-toggle: керує, чи використовується твій контент для тренування Gemini і Vertex AI. Він не впливає на краул Googlebot, твої позиції в Google Search чи придатність до AI Overviews — вони йдуть за стандартним доступом Googlebot.
Як дозволити ClaudeBot у robots.txt?
Додай групу з User-agent: ClaudeBot і або без відповідного Disallow, або з явним Allow: /. Зверни увагу: Anthropic тепер має три боти — ClaudeBot (краул), Claude-SearchBot (search-індекс) і Claude-User (живий фетч) — тож дозволяй кожен потрібний, не лише ClaudeBot.
Чи може Cloudflare блокувати AI-краулерів?
Так. Cloudflare та інші WAF/CDN-шари можуть блокувати чи challeng'ити AI-ботів за user-agent або керованими «block AI bots» правилами, незалежно від robots.txt. Цей чекер читає лише robots.txt, тож сайт може пройти тут і все одно бути заблокований на firewall із 403 — перевір це окремо.
Чому AI-бот отримує 403?
403 зазвичай іде від WAF, CDN bot-management правила, rate-limiting чи серверного правила, що відхиляє user-agent або IP бота — не від robots.txt. Robots-блок просто просить compliant-бота не запитувати сторінку; він не віддає 403. Якщо AI-боти отримують 403 — перевір Cloudflare/WAF, не лише robots.txt.
Яка різниця між robots.txt і llms.txt?
robots.txt — широко визнаний стандарт, що каже compliant-краулерам, які шляхи вони можуть запитувати. llms.txt — emerging добровільний Markdown-файл, що вказує AI-інструментам на твій ключовий контент; це guidance, не access-control чи ranking-механізм, і підтримка не універсальна. robots.txt контролює доступ; llms.txt пропонує, що читати.
Чи гарантує дозвіл AI-краулерам цитування?
Ні. Дозвіл краулеру — одна технічна передумова: він робить сторінки fetchable. Чи цитуватиме тебе AI-двигун реально, залежить від індексації, якості контенту, релевантності, авторитету, структури і власного retrieval кожного двигуна. Доступ прибирає блокер; він не гарантує AI-видимість.
Як заблокувати AI training-боти, але дозволити AI-пошукові?
Disallow training user-agents (GPTBot, Google-Extended, CCBot, Applebot-Extended, Meta-ExternalAgent), дозволяючи search і user-fetch (OAI-SearchBot, PerplexityBot, Claude-SearchBot, ChatGPT-User, Claude-User). Дай кожному власну User-agent групу, щоб правила не колідували. Дивись robots.txt-приклади вище.
Чи може robots.txt запобігти індексації?
Ні. robots.txt контролює краулінг, не індексацію. Заблокований URL усе одно може індексуватись без контенту, якщо на нього лінкують інші сторінки. Щоб тримати сторінку поза індексом, використовуй noindex meta robots чи X-Robots-Tag header на crawlable-сторінці — не robots.txt disallow.
Як часто перевіряти доступ AI-краулерів?
Перевіряй після будь-якої зміни robots.txt, CDN чи WAF, після міграції чи зміни платформи, і щоразу, коли вендори публікують нові user-agents — а це буває регулярно. Квартальна перевірка плюс event-based на кожен деплой ловить більшість тихих блоків, перш ніж вони коштуватимуть цитувань.
Доступ краулерів — одна з 47 перевірок.
Повний AI Visibility Audit також скорить твою schema, llms.txt, entity-сигнали і живі цитування — звіт 0–100 на пошту за хвилину.
Запустити безкоштовний AI Visibility Audit