Несмотря на то что имя бота начинается с «ai», к обучению языковых моделей или RAG-поиску для чат-бота aiHitBot не имеет отношения. Это давний, известный ещё с 2009 года краулер британской компании aiHit, которая занимается сбором и структурированием бизнес-информации о компаниях по всему миру — своего рода автоматизированный «Кто есть кто» корпоративного мира, а не сырьё для генеративного ИИ.
Что на самом деле собирает aiHit
По собственному описанию оператора, его краулеры ежедневно обрабатывают сотни тысяч доменов, чтобы находить сайты компаний и извлекать ключевую информацию о них — она хранится в структурированной базе данных, доступной как продукт. По актуальным цифрам компании, система находит порядка 24 миллионов сайтов в неделю, около 300 тысяч новых сайтов компаний еженедельно и отслеживает 155 полей и 957 характеристик в рамках 240 миллионов транзакций и предиктивных сигналов. Принципиальная особенность продукта aiHitdata — не просто фиксация текущего состояния сайта компании, а построение истории изменений во времени: например, база данных фиксирует не только текущего CEO компании, но и момент, когда произошла смена руководства, с датой и деталями. Для этого краулер периодически повторно обходит сайты компаний, отмечая изменения как отдельные записи временного ряда.
Собранные данные используются клиентами в сфере бизнес-исследований, конкурентной разведки, анализа рынка и генерации лидов — то есть это классический B2B data-продукт, а не что-либо связанное с обучением или дообучением AI-моделей, вопреки первому впечатлению от имени бота.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | aihitbot; исторически также встречался вариант aiHitBot-DM/2.0.2 +http://www.aihit.com |
| Оператор | aiHit — британская компания бизнес-данных, работает с рынком с 2009 года |
| Официальный сайт | aihit.com / aihitdata.com |
| Назначение | Сбор и структурирование публичной бизнес-информации о компаниях: контакты, руководство, продукты — для B2B-продуктов бизнес-разведки, конкурентного анализа и лидогенерации |
| Соблюдение robots.txt | По собственному заявлению компании, краулер добросовестно соблюдает правила robots.txt и контролирует скорость обхода |
| Что декларативно НЕ собирает | По официальному заявлению компании, краулер не собирает чувствительные данные, такие как информация о продуктах и ценах |
| Верификация подлинности | Официального метода верификации компания не публикует — по независимым источникам, любой клиент теоретически может представиться этим именем, поэтому совпадение UA в логах — лишь косвенная зацепка, а не доказательство |
| Список IP-адресов | ❌ Официального современного фида не найдено |
Почему исходная классификация «сырьё для AI-пайплайна» неточна
Ключевая ошибка в шаблонном описании — предположение, что раз в имени есть «ai», то цель бота — обучение генеративных моделей или питание RAG-поиска чат-бота. По факту это классический data-миннинговый краулер бизнес-аналитики, работающий на этом рынке более полутора десятилетий — задолго до массового распространения генеративного ИИ. Практический риск здесь остаётся того же типа, что у любого стороннего сборщика бизнес-данных: сайт компании становится источником для чужой коммерческой базы без прямой выгоды для владельца, — но природа этого риска не связана с AI-контуром или LLM-обучением.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "aihitbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "aihitbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Поскольку официального метода верификации компания не публикует, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois — обычное правило для ботов без опубликованного фида.
Стоит ли блокировать
Решение здесь — вопрос не безопасности, а бизнес-целесообразности присутствия в чужой базе бизнес-данных:
- если компания заинтересована в видимости для потенциальных партнёров, инвесторов или клиентов, которые пользуются подобными базами бизнес-разведки, — присутствие в индексе aiHit может быть нейтральным или даже слегка полезным дополнительным каналом обнаружения;
- если приоритет — контроль над тем, кто и как использует публичные корпоративные данные компании, — блокировка полностью оправдана, поскольку прямой договорной связи между владельцем сайта и aiHit по умолчанию нет;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это не поисковый краулер ни одной из систем.
Как заблокировать
Стандартный запрет через robots.txt — компания заявляет, что соблюдает эти правила:
User-agent: aihitbot
Disallow: /
Для надёжности, учитывая отсутствие официального метода верификации и теоретическую возможность спуфинга третьими лицами под этим именем, запрет стоит продублировать на уровне сервера:
if ($http_user_agent ~* "aihitbot") {
return 403;
}Частые вопросы
aiHitBot собирает данные для обучения AI-моделей?
Что именно собирает этот бот?
Собирает ли бот чувствительные данные вроде цен на продукты?
Соблюдает ли aiHitBot правила robots.txt?
Можно ли проверить подлинность запроса от настоящего aiHitBot?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.