TavilyBot принадлежит Tavily — реальной и по-настоящему популярной компании (более 2 млн разработчиков, сертификация SOC 2), которая предоставляет API веб-доступа для AI-агентов: поиск в реальном времени, извлечение контента, краулинг и research для RAG-приложений. Загружает страницы для наполнения поискового индекса, на котором строятся ответы AI-агентов её клиентов-разработчиков. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое TavilyBot на самом деле
Tavily — «слой веб-доступа» для AI-агентов: единый API, через который разработчики встраивают в свои приложения поиск в реальном времени, извлечение контента, интеллектуальный краулинг сайтов и глубокие research-сценарии. TavilyBot — краулер, который индексирует и извлекает контент с миллиардов страниц, чтобы предоставлять данные для поиска, извлечения и research, обосновывающие ответы AI-агентов, интегрировавших Tavily Search.
Важная деталь, прямо указанная в официальной документации Tavily: robots.txt не используется компанией для того, чтобы исключить страницу из индекса. Вместо этого владелец сайта должен применить директиву noindex в meta-теге страницы, после чего Tavily должен заново обойти эту страницу, чтобы изменение вступило в силу. Это принципиально отличается от стандартной логики robots.txt, которую можно было бы ожидать для большинства других ботов.
| Параметр | Значение |
| Название | TavilyBot |
| User-Agent / паттерн | tavilybot |
| Оператор | Tavily — API веб-доступа для AI-агентов и RAG-приложений |
| Роль | Индексация и извлечение контента с веб-страниц для поиска в реальном времени, извлечения данных и research, используемых AI-агентами клиентов Tavily |
| Документация / ориентир | Официальная документация на docs.tavily.com/documentation/search-crawler |
| Список IP | ❌ Отдельного полного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA |
| robots.txt | Официально не используется для исключения из индекса — только meta-директива noindex, с обязательным повторным обходом для применения |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем TavilyBot приходит на сайт
Появление TavilyBot в access.log означает машинный доступ к сайту — не пользовательскую сессию. Визиты связаны с наполнением поискового индекса и research-данных: разработчики, интегрировавшие Tavily Search в свои AI-агенты, могут запрашивать актуальную информацию с любых общедоступных страниц, и краулер обходит их, чтобы держать индекс свежим. Какие зоны сайта чаще всего затрагивает такой обход: публичные URL, иногда открытый API и статику.
Отдельная функция — Tavily Crawl, которая позволяет разработчикам задать стартовый URL и параметры глубины/широты обхода, а также направлять краулер естественноязыковыми инструкциями («искать только страницы документации», а не весь сайт). Это означает, что интенсивность и охват обхода конкретного сайта могут сильно различаться в зависимости от того, что именно настроил разработчик-клиент.
Нагрузка и риски именно для TavilyBot
Отдельной строки в публичной сводке топ-ботов TrafficVeil у tavilybot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на качество хитов:
- глубина обхода — функция Tavily Crawl может как ограничиваться отдельным разделом, так и охватывать сайт целиком в зависимости от настроек клиента;
- повторы одних и тех же URL без видимой причины;
- отсутствие cookie и признаков сессии;
- концентрация на служебных или листовых страницах.
Как найти TavilyBot в логах
Не ищите «просто ботов» — ищите конкретный токен tavilybot и рядом смотрите соседей по семейству.
# Базовый поиск
grep -i "tavilybot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "tavilybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "tavilybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "tavilybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку UA + ASN/IP + частоту + набор URL, а не полагайтесь на одну строку заголовка:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt для TavilyBot — важная оговорка
# Жёсткий запрет User-agent: tavilybot Disallow: / # Разрешить всё User-agent: tavilybot Allow: / # Компромисс: закрыть деньги/кабинет, оставить публичную часть User-agent: tavilybot Disallow: /admin/ Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /api/ Allow: /
Критически важно понимать: по официальному заявлению Tavily, правила robots.txt не используются компанией для исключения страниц из индекса. Единственный признанный оператором способ — добавить директиву noindex в meta-тег конкретной страницы, а затем дождаться, пока TavilyBot заново её обойдёт и применит изменение. Если требуется удалить уже проиндексированную страницу, которой больше не существует, официальный путь — обратиться в поддержку Tavily напрямую. Файл robots.txt здесь стоит рассматривать как сигнал для добросовестных ботов в целом, но не как гарантированный технический механизм именно для TavilyBot.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "tavilybot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=tavilybot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "tavilybot") {
limit_req zone=tavilybot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} tavilybot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- найдите tavilybot / TavilyBot в ботах домена или в
/system/bots; - для нежелательного сценария — категория «запретить» на уровне сервера, а не только через robots.txt, учитывая позицию оператора;
- allow оставляйте, если присутствие в поиске и research-данных AI-агентов может приносить видимость или реферальный трафик;
- после изменения сверьте логи: хиты TavilyBot должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.
С кем не путать TavilyBot
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Стратегия allow/deny для TavilyBot
| Ситуация | Действие |
| Присутствие в поиске и research AI-агентов полезно для видимости | Allow + закрыть /admin /cart /api |
| Использование контента для сторонних AI-агентов нежелательно | Жёсткая блокировка на уровне сервера/TrafficVeil — robots.txt здесь не гарантия |
| Обход в целом приемлем, но нагрузка избыточна из-за широкой настройки Tavily Crawl клиентом | Rate-limit на nginx/TrafficVeil |
| Нужно убрать уже проиндексированную несуществующую страницу | Использовать noindex + дождаться повторного обхода, либо обратиться в поддержку Tavily |
| Подозрение на спуфинг UA | Не доверять строке UA; смотреть IP/ASN и поведение |
Главный вывод по TavilyBot: это легитимный, хорошо известный сервис с прозрачным назначением, но с нестандартным подходом к исключению из индекса. Решение allow/deny стоит принимать так же, как для других AI-краулеров, но контроль реализовывать на уровне сервера или TrafficVeil, а не полагаться на один только robots.txt.