GenomeCrawlerd — часть инфраструктуры Nokia Deepfield Genome, технологии, которую сама Nokia описывает как «карту снабженческой цепочки интернета». Nokia приобрела стартап Deepfield в феврале 2017 года, получив вместе с ним систему, которая к тому моменту уже четыре года рассылала веб-пауков для картирования свыше 138 миллиардов IP-адресов — и с тех пор эта технология легла в основу целой линейки коммерческих продуктов для интернет-провайдеров и сетевых операторов.
Чем принципиально отличается этот краулер от индексатора поисковика
Genome не строит поисковый индекс страниц для людей — это картография инфраструктуры интернета для сетевых инженеров. Технология непрерывно сканирует адресное пространство IPv4/IPv6, CDN-домены и сетевые системы, чтобы построить в реальном времени карту того, кто и как доставляет сервисы в интернете: например, определить, какие IP-адреса и какие CDN использует конкретный сервис вроде Netflix, не заглядывая в зашифрованный трафик пользователей. Эта карта затем продаётся более чем 140 интернет-провайдерам и сетевым операторам по всему миру как часть продуктов Nokia Deepfield — для оптимизации пиринга, повышения качества доставки видео, обнаружения и автоматического противодействия DDoS-атакам.
У Genome есть версия, специально сфокусированная на безопасности, — Secure Genome: обновляемый ежечасно фид, который отслеживает контекст безопасности свыше 5 миллиардов IPv4/IPv6-адресов, применяя свыше 100 правил машинного обучения для классификации трафика — легитимный он или связан с ботнетами, заражёнными IoT-устройствами или уязвимыми серверами.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; GenomeCrawlerd/1.0; +https://www.nokia.com/genomecrawler) |
| Оператор | Nokia (подразделение Deepfield, приобретённое в феврале 2017 года) |
| Назначение | Картирование интернет-инфраструктуры и сервисов (internet/service intelligence) для DDoS-защиты, сетевой аналитики и оптимизации пиринга у интернет-провайдеров — не построение поискового индекса сайтов |
| Масштаб операции | Свыше 138 млрд просканированных IP-адресов исторически; свыше 5 млрд адресов в актуальном security-фиде, обновляемом ежечасно |
| Клиентская база | Свыше 140 интернет-провайдеров и сетевых операторов по всему миру |
| Отношение к поисковой индексации Google | Не связан — это отдельная от классического веб-поиска инфраструктурная задача |
| Список IP-адресов | ❌ Отдельного официального фида для верификации не найдено |
Почему это в принципе низкий SEO-риск
Поскольку Genome не строит потребительский поисковый индекс, а решает совершенно другую, инфраструктурную задачу — картирование того, какие сервисы и CDN стоят за конкретными IP-адресами и доменами, — присутствие этого бота не имеет отношения к тому, как сайт индексируется или ранжируется в Google, Bing, Яндексе или любой другой поисковой системе. Это делает решение о допуске значительно менее рискованным в любую сторону: блокировка не влияет на видимость сайта для аудитории, а разрешение не создаёт заметной пользы для владельца сайта напрямую — только для клиентов Nokia (интернет-провайдеров), использующих эту карту в собственных сетях.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Сколько трафика он создаёт
По сводке TrafficVeil, паттерн запросов genomecrawler на подключённых доменах составил порядка 5 тысяч. Учитывая масштаб операции Nokia — миллиарды адресов в непрерывном сканировании по всему интернету — это ожидаемо небольшой и рассредоточенный объём на уровне отдельного сайта.
Как найти бота в логах
grep -i "GenomeCrawler" /var/log/nginx/access.log
Поскольку официального списка IP нет, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois.
Стоит ли блокировать
- у большинства сайтов нет прямой заинтересованности ни в допуске, ни в блокировке этого бота — присутствие или отсутствие в карте инфраструктуры Nokia Deepfield не влияет на видимость сайта для конечных пользователей или в поисковых системах;
- если бот создаёт заметный фоновый шум в логах и аналитике или потребляет ресурсы сервера — обоснованно ограничить или заблокировать без последствий для SEO;
- особых причин активно разрешать этого бота у большинства обычных сайтов, как правило, нет — прямую выгоду от карты Genome извлекают клиенты Nokia (интернет-провайдеры), а не владельцы отдельных сайтов.
Как настроить доступ
Стандартный запрет через robots.txt:
User-agent: GenomeCrawlerd
Disallow: /
if ($http_user_agent ~* "GenomeCrawler") {
return 403;
}
Если бот не создаёт заметных проблем, а полный запрет кажется излишним, можно оставить его без специального внимания — это низкорисковый случай в обе стороны.
Частые вопросы
GenomeCrawlerd строит поисковый индекс для Google или другого поисковика?
Зачем Nokia вообще нужна такая карта?
Какой масштаб у этой операции?
Кто клиенты Nokia Deepfield?
Стоит ли обычному сайту специально разрешать этого бота?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.