TrafficVeil
Боты 6 мин25 августа 2026 г.

TavilyBot: robots.txt тут не работает как обычно

TavilyBot — краулер популярного API веб-доступа для AI-агентов Tavily, который официально не использует robots.txt для исключения страниц из индекса. Разбираем реальный механизм отказа (noindex + повторный обход) и настройку контроля через сервер и TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое TavilyBot на самом деле
  2. Зачем TavilyBot приходит на сайт
  3. Нагрузка и риски именно для TavilyBot
  4. Как найти TavilyBot в логах
  5. robots.txt для TavilyBot — важная оговорка
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать TavilyBot
  11. Стратегия allow/deny для TavilyBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

TavilyBot принадлежит Tavily — реальной и по-настоящему популярной компании (более 2 млн разработчиков, сертификация SOC 2), которая предоставляет API веб-доступа для AI-агентов: поиск в реальном времени, извлечение контента, краулинг и research для RAG-приложений. Загружает страницы для наполнения поискового индекса, на котором строятся ответы AI-агентов её клиентов-разработчиков. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».

Что такое TavilyBot на самом деле

Tavily — «слой веб-доступа» для AI-агентов: единый API, через который разработчики встраивают в свои приложения поиск в реальном времени, извлечение контента, интеллектуальный краулинг сайтов и глубокие research-сценарии. TavilyBot — краулер, который индексирует и извлекает контент с миллиардов страниц, чтобы предоставлять данные для поиска, извлечения и research, обосновывающие ответы AI-агентов, интегрировавших Tavily Search.

Важная деталь, прямо указанная в официальной документации Tavily: robots.txt не используется компанией для того, чтобы исключить страницу из индекса. Вместо этого владелец сайта должен применить директиву noindex в meta-теге страницы, после чего Tavily должен заново обойти эту страницу, чтобы изменение вступило в силу. Это принципиально отличается от стандартной логики robots.txt, которую можно было бы ожидать для большинства других ботов.

Параметр Значение
Название TavilyBot
User-Agent / паттерн tavilybot
Оператор Tavily — API веб-доступа для AI-агентов и RAG-приложений
Роль Индексация и извлечение контента с веб-страниц для поиска в реальном времени, извлечения данных и research, используемых AI-агентами клиентов Tavily
Документация / ориентир Официальная документация на docs.tavily.com/documentation/search-crawler
Список IP ❌ Отдельного полного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Официально не используется для исключения из индекса — только meta-директива noindex, с обязательным повторным обходом для применения
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Зачем TavilyBot приходит на сайт

Появление TavilyBot в access.log означает машинный доступ к сайту — не пользовательскую сессию. Визиты связаны с наполнением поискового индекса и research-данных: разработчики, интегрировавшие Tavily Search в свои AI-агенты, могут запрашивать актуальную информацию с любых общедоступных страниц, и краулер обходит их, чтобы держать индекс свежим. Какие зоны сайта чаще всего затрагивает такой обход: публичные URL, иногда открытый API и статику.

Отдельная функция — Tavily Crawl, которая позволяет разработчикам задать стартовый URL и параметры глубины/широты обхода, а также направлять краулер естественноязыковыми инструкциями («искать только страницы документации», а не весь сайт). Это означает, что интенсивность и охват обхода конкретного сайта могут сильно различаться в зависимости от того, что именно настроил разработчик-клиент.

Нагрузка и риски именно для TavilyBot

Отдельной строки в публичной сводке топ-ботов TrafficVeil у tavilybot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на качество хитов:

  • глубина обхода — функция Tavily Crawl может как ограничиваться отдельным разделом, так и охватывать сайт целиком в зависимости от настроек клиента;
  • повторы одних и тех же URL без видимой причины;
  • отсутствие cookie и признаков сессии;
  • концентрация на служебных или листовых страницах.

Как найти TavilyBot в логах

Не ищите «просто ботов» — ищите конкретный токен tavilybot и рядом смотрите соседей по семейству.

# Базовый поиск
grep -i "tavilybot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "tavilybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "tavilybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "tavilybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация: подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку UA + ASN/IP + частоту + набор URL, а не полагайтесь на одну строку заголовка:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для TavilyBot — важная оговорка

# Жёсткий запрет
User-agent: tavilybot
Disallow: /

# Разрешить всё
User-agent: tavilybot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: tavilybot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Критически важно понимать: по официальному заявлению Tavily, правила robots.txt не используются компанией для исключения страниц из индекса. Единственный признанный оператором способ — добавить директиву noindex в meta-тег конкретной страницы, а затем дождаться, пока TavilyBot заново её обойдёт и применит изменение. Если требуется удалить уже проиндексированную страницу, которой больше не существует, официальный путь — обратиться в поддержку Tavily напрямую. Файл robots.txt здесь стоит рассматривать как сигнал для добросовестных ботов в целом, но не как гарантированный технический механизм именно для TavilyBot.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "tavilybot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=tavilybot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "tavilybot") {
        limit_req zone=tavilybot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} tavilybot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите tavilybot / TavilyBot в ботах домена или в /system/bots;
  • для нежелательного сценария — категория «запретить» на уровне сервера, а не только через robots.txt, учитывая позицию оператора;
  • allow оставляйте, если присутствие в поиске и research-данных AI-агентов может приносить видимость или реферальный трафик;
  • после изменения сверьте логи: хиты TavilyBot должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать TavilyBot

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

Стратегия allow/deny для TavilyBot

Ситуация Действие
Присутствие в поиске и research AI-агентов полезно для видимости Allow + закрыть /admin /cart /api
Использование контента для сторонних AI-агентов нежелательно Жёсткая блокировка на уровне сервера/TrafficVeil — robots.txt здесь не гарантия
Обход в целом приемлем, но нагрузка избыточна из-за широкой настройки Tavily Crawl клиентом Rate-limit на nginx/TrafficVeil
Нужно убрать уже проиндексированную несуществующую страницу Использовать noindex + дождаться повторного обхода, либо обратиться в поддержку Tavily
Подозрение на спуфинг UA Не доверять строке UA; смотреть IP/ASN и поведение

Главный вывод по TavilyBot: это легитимный, хорошо известный сервис с прозрачным назначением, но с нестандартным подходом к исключению из индекса. Решение allow/deny стоит принимать так же, как для других AI-краулеров, но контроль реализовывать на уровне сервера или TrafficVeil, а не полагаться на один только robots.txt.

Частые вопросы

Работает ли стандартное правило Disallow в robots.txt для исключения страницы из индекса Tavily?

Нет — по официальному заявлению компании, robots.txt для этого не используется вообще.

Как правильно убрать страницу из индекса TavilyBot?

Добавить директиву noindex в meta-тег страницы и дождаться, пока TavilyBot заново её обойдёт, чтобы применить изменение.

Что делать, если проиндексированная страница уже не существует, а её нужно убрать из результатов?

Обратиться напрямую в поддержку Tavily — это официальный путь для делистинга такой страницы.

Насколько крупная и известная компания стоит за TavilyBot?

Tavily — реальный сервис с более чем 2 миллионами разработчиков и сертификацией SOC 2, а не анонимный стартап.

Почему интенсивность обхода TavilyBot может сильно различаться на разных сайтах?

Функция Tavily Crawl позволяет разработчикам-клиентам задавать глубину, широту и даже естественноязыковые инструкции для обхода конкретного сайта.

Как в таком случае надёжно заблокировать TavilyBot, если это необходимо?

На уровне сервера (nginx/Apache) или через TrafficVeil, а не полагаться на файл robots.txt, который бот официально не учитывает для исключения из индекса.

#TavilyBot#Tavily#AI-агенты#RAG#боты на сайте#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

TavilyBot: почему стандартный robots.txt не сработает