Если фильтровать access.log по inferkit, часто всплывает целый пласт машинных хитов — это и есть Inferkit. Но прежде чем классифицировать его как обычного «AI-краулера, собирающего контент для чужого пайплайна», стоит понять: под этим именем есть известный продукт с совершенно другой функцией, и связь между ними не подтверждена.
Что мешает доверять очевидной версии
InferKit — реальный, известный AI-инструмент для генерации текста: пользователь задаёт тему, стиль, длину и требования, а сервис создаёт готовый текст — рассказы, эссе, статьи. Это input-based генератор: он работает с тем, что человек вводит сам, а не с содержимым чужих сайтов. Прямых подтверждений тому, что компания вообще управляет краулером, обходящим сторонние сайты для сбора контента, не нашлось — токен «Inferkit» не фигурирует как отдельный документированный AI-краулер ни в одном из специализированных каталогов ботов. Если строка с этим названием реально встречается в логах сайта, возможны разные объяснения — от случайного совпадения имени до маскировки постороннего скрипта под узнаваемый бренд. Само по себе название не доказывает происхождение или назначение трафика.
Что такое Inferkit (токен в логах)
| Параметр | Значение |
|---|---|
| Название | Inferkit |
| User-Agent / паттерн | inferkit |
| Оператор | Не указан публично; связь с известным продуктом InferKit (генератор текста) не подтверждена |
| Роль | Не установлена официально; относитесь как к сигналу автоматизации, а не как к подтверждённому AI-пайплайну |
| Документация / ориентир | ❌ Публичной документации именно по этому краулеру не найдено |
| Список IP | ❌ Отдельного полного списка нет; проверяйте ASN/поведение и не доверяйтесь только строке UA |
| robots.txt | Не гарантировано — для неподтверждённых токенов соблюдение директив нельзя считать данностью |
| Пометка TrafficVeil | Требует осторожной проверки / AI и LLM-краулеры (неподтверждённый оператор) |
Зачем Inferkit может приходить на сайт
- Какие зоны чаще трогает: обычно публичные URL — /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинация каталога
- Что ищет: точное назначение не подтверждено; типичный для этой категории интерес — текстовый контент, метаданные или ссылочный граф
- Чем отличается от браузерного пользователя: нет нормальной сессии, повторяемый path-паттерн, характерный для автоматизированного клиента
Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по inferkit показывает, что бот вычитывает разделы: /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинацию каталога — но без подтверждённого оператора нельзя сказать, кому конкретно и зачем нужны эти данные.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка и риски
Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на конкретных разделах сайта — эти признаки важнее, чем совпадение с узнаваемым названием.
Как найти Inferkit в логах
# Базовый поиск
grep -i "inferkit" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "inferkit" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "inferkit" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "inferkit" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Подделать User-Agent может любой скрипт, а официального способа верификации для этого токена не существует. Смотрите связку UA + ASN/IP + частоту + набор URL — при отсутствии подтверждённого оператора это единственный реальный ориентир.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для Inferkit
# Жёсткий запрет
User-agent: inferkit
Disallow: /
# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: inferkit
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: при отсутствии подтверждённого оператора не рассчитывайте, что Disallow сработает гарантированно. Если агент игнорирует robots.txt, переходите к nginx/Apache или запрету в TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "inferkit") {
return 403;
}
limit_req_zone $binary_remote_addr zone=inferkit:10m rate=10r/m;
location / {
if ($http_user_agent ~* "inferkit") {
limit_req zone=inferkit burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} inferkit [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите inferkit в ботах домена или в /system/bots
- При отсутствии подтверждённой пользы — категория «запретить»; для мягкого сценария — rate-limit
- После изменения сверьте логи: хиты Inferkit должны уйти в блок/лимит, а нужные поисковики остаться
Рекомендации: что делать с Inferkit
- Не считайте узнаваемое название доказательством легитимности или назначения — оценивайте по фактическому поведению
- Если пользы нет — Disallow/403, стандартный подход при отсутствии подтверждённого оператора
- Если нагрузка мешает — сначала rate-limit, затем полный запрет
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot
Частые вопросы
Управляет ли сервис InferKit каким-либо веб-краулером?
Почему тогда строка «inferkit» может встречаться в логах сайта?
Стоит ли доверять названию токена как признаку его назначения?
Как оценивать такой трафик при отсутствии подтверждённого оператора?
Гарантировано ли соблюдение robots.txt для этого токена?
Что делать с Inferkit при отсутствии доказанной пользы?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.