Любопытный парадокс MyCentralAIScraperBot: почти ни один профильный каталог ботов не может назвать его реального оператора, но при этом бот попал в готовые блок-листы куда более крупных и осторожных игроков — например, именно этим токеном The New York Times явно закрывает доступ в своём публичном robots.txt, наряду с GPTBot, PerplexityBot и другими известными AI-краулерами. Иными словами: происхождение неизвестно, а репутация как у нежелательного AI-скрапера уже сложилась достаточно широко, чтобы попасть в список блокировки одного из самых консервативных к вопросам доступа издателей.
Что говорят профильные базы данных о происхождении бота
Крупнейший открытый реестр AI-краулеров ai.robots.txt, которым пользуются десятки сайтов для автоматической генерации своих правил доступа, честно фиксирует по этому боту: оператор неясен, соблюдение robots.txt неясно, частота обращений неясна — единственное, что классифицировано уверенно, это функция: AI data scraper, сборщик данных для AI-продукта неустановленной принадлежности. Такая же формулировка «оператор и использование данных неясны на данный момент» повторяется и в независимых зеркалах этой базы. При этом сам факт присутствия в реестре и включения в реальные боевые robots.txt крупных изданий говорит о том, что сообщество администраторов сайтов уже накопило достаточно наблюдений за поведением бота, чтобы массово счесть его нежелательным, — просто без раскрытия того, кто именно за ним стоит.
Параметры
| Параметр | Значение |
| User-Agent / паттерн | mycentralaiscraperbot |
| Оператор | Не установлен — не раскрывается ни в одном крупном профильном реестре AI-ботов |
| Функция по классификации ai.robots.txt | AI data scraper — сбор данных для AI-продукта |
| Соблюдение robots.txt | Не подтверждено ни в одну сторону; тем не менее это не мешает включать токен в правила блокировки — правило работает для добросовестных реализаций независимо от того, известен ли оператор |
| Присутствие в реальных robots.txt крупных сайтов | Да — например, зафиксировано в опубликованном файле The New York Times в общем списке блокируемых AI-краулеров |
| Список IP-адресов | ❌ Отсутствует |
Почему отсутствие имени оператора не мешает принимать решение
Этот случай хорошо иллюстрирует практический принцип: политика допуска не обязана дожидаться раскрытия личности оператора, чтобы быть обоснованной. Достаточно того, что независимое профессиональное сообщество — люди, поддерживающие открытый реестр, и администраторы крупных изданий вроде NYT — параллельно пришли к одному и тому же выводу на основе наблюдаемого поведения бота. Когда токен фигурирует одновременно в общественном реестре нежелательных AI-краулеров и в реальных боевых конфигурациях крупных издателей, это уже достаточное основание для блокировки по умолчанию, даже если формальная строка «оператор: неизвестен» так и останется незаполненной.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "mycentralaiscraperbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "mycentralaiscraperbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Поскольку официального списка IP нет, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Как заблокировать
Стандартный запрет через robots.txt — та же формулировка, что уже используют крупные издания:
User-agent: MyCentralAIScraperBot
Disallow: /
Поскольку соблюдение этим агентом robots.txt официально не подтверждено, для надёжности запрет стоит продублировать на уровне сервера:
if ($http_user_agent ~* "mycentralaiscraperbot") {
return 403;
}
На позиции в органической выдаче Google, Bing или Яндекса блокировка не влияет — этот бот не связан ни с одной поисковой системой, а собирает данные исключительно для неустановленного AI-продукта.
Частые вопросы
Кто владеет MyCentralAIScraperBot?
Если оператор неизвестен, зачем его вообще блокируют?
К какой функции его относят профильные базы?
Соблюдает ли бот правила robots.txt?
Стоит ли доверять строке User-Agent при принятии решения?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.