Боты4 мин чтения·11 августа 2026 г.

MyCentralAIScraperBot: неизвестный оператор, но уже в блок-листе New York Times

Ни один крупный профильный реестр AI-ботов не может назвать реального оператора MyCentralAIScraperBot — но это не помешало ему попасть в боевой robots.txt The New York Times рядом с GPTBot и PerplexityBot. Разбираем, почему коллективное наблюдение сообщества администраторов может быть достаточным основанием для блокировки даже без раскрытия личности оператора.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота MyCentralAIScraperBot: нежелательный ai и llm-краулеры

Любопытный парадокс MyCentralAIScraperBot: почти ни один профильный каталог ботов не может назвать его реального оператора, но при этом бот попал в готовые блок-листы куда более крупных и осторожных игроков — например, именно этим токеном The New York Times явно закрывает доступ в своём публичном robots.txt, наряду с GPTBot, PerplexityBot и другими известными AI-краулерами. Иными словами: происхождение неизвестно, а репутация как у нежелательного AI-скрапера уже сложилась достаточно широко, чтобы попасть в список блокировки одного из самых консервативных к вопросам доступа издателей.

Что говорят профильные базы данных о происхождении бота

Крупнейший открытый реестр AI-краулеров ai.robots.txt, которым пользуются десятки сайтов для автоматической генерации своих правил доступа, честно фиксирует по этому боту: оператор неясен, соблюдение robots.txt неясно, частота обращений неясна — единственное, что классифицировано уверенно, это функция: AI data scraper, сборщик данных для AI-продукта неустановленной принадлежности. Такая же формулировка «оператор и использование данных неясны на данный момент» повторяется и в независимых зеркалах этой базы. При этом сам факт присутствия в реестре и включения в реальные боевые robots.txt крупных изданий говорит о том, что сообщество администраторов сайтов уже накопило достаточно наблюдений за поведением бота, чтобы массово счесть его нежелательным, — просто без раскрытия того, кто именно за ним стоит.

Параметры

Параметр Значение
User-Agent / паттерн mycentralaiscraperbot
Оператор Не установлен — не раскрывается ни в одном крупном профильном реестре AI-ботов
Функция по классификации ai.robots.txt AI data scraper — сбор данных для AI-продукта
Соблюдение robots.txt Не подтверждено ни в одну сторону; тем не менее это не мешает включать токен в правила блокировки — правило работает для добросовестных реализаций независимо от того, известен ли оператор
Присутствие в реальных robots.txt крупных сайтов Да — например, зафиксировано в опубликованном файле The New York Times в общем списке блокируемых AI-краулеров
Список IP-адресов ❌ Отсутствует

Почему отсутствие имени оператора не мешает принимать решение

Этот случай хорошо иллюстрирует практический принцип: политика допуска не обязана дожидаться раскрытия личности оператора, чтобы быть обоснованной. Достаточно того, что независимое профессиональное сообщество — люди, поддерживающие открытый реестр, и администраторы крупных изданий вроде NYT — параллельно пришли к одному и тому же выводу на основе наблюдаемого поведения бота. Когда токен фигурирует одновременно в общественном реестре нежелательных AI-краулеров и в реальных боевых конфигурациях крупных издателей, это уже достаточное основание для блокировки по умолчанию, даже если формальная строка «оператор: неизвестен» так и останется незаполненной.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти бота в логах

# Базовый поиск
grep -i "mycentralaiscraperbot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "mycentralaiscraperbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Поскольку официального списка IP нет, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

Как заблокировать

Стандартный запрет через robots.txt — та же формулировка, что уже используют крупные издания:

User-agent: MyCentralAIScraperBot
Disallow: /

Поскольку соблюдение этим агентом robots.txt официально не подтверждено, для надёжности запрет стоит продублировать на уровне сервера:

if ($http_user_agent ~* "mycentralaiscraperbot") {
    return 403;
}

На позиции в органической выдаче Google, Bing или Яндекса блокировка не влияет — этот бот не связан ни с одной поисковой системой, а собирает данные исключительно для неустановленного AI-продукта.

Частые вопросы

Кто владеет MyCentralAIScraperBot?
Достоверно установить не удалось — крупнейший открытый реестр AI-краулеров ai.robots.txt честно указывает: оператор неясен.
Если оператор неизвестен, зачем его вообще блокируют?
Потому что независимое сообщество администраторов и крупные издатели вроде The New York Times на основе наблюдаемого поведения уже пришли к выводу о его нежелательности — этого достаточно для практического решения.
К какой функции его относят профильные базы?
К категории AI data scraper — сборщик данных для неустановленного AI-продукта.
Соблюдает ли бот правила robots.txt?
Официально не подтверждено ни в одну сторону, поэтому для надёжной блокировки правило стоит дублировать на уровне сервера.
Стоит ли доверять строке User-Agent при принятии решения?
Её может подделать любой скрипт — при аномальной активности стоит дополнительно сверяться с ASN IP через whois.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, этот бот не связан ни с одной поисковой системой.
#mycentralaiscraperbot#AI data scraper#необъяснённый краулер#бот-энциклопедия#robots.txt#ai.robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil