Боты6 мин чтения·9 августа 2026 г.

TimpiBot: краулер без единого IP, который читает только текст

TimpiBot собирает данные для децентрализованного поиска Timpi через сеть независимых нод без статических IP. Разбираем, почему это чисто текстовый краулер, какой контент он предпочитает и почему одного robots.txt недостаточно.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота TimpiBot: нежелательный прочие краулеры и сервисы

TimpiBot (часто Timpibot) — краулер проекта Timpi: децентрализованный поиск / DePIN-сеть коллекторов, которые обходят публичный веб и складывают данные в индекс экосистемы Timpi. Это не Googlebot и не Яндекс: блокировка не роняет классическую выдачу, но убирает сайт из покрытия Timpi (и связанных сценариев использования индекса, включая AI/LLM-контуры, о которых пишут сторонние каталоги). Главный операционный риск: краулинг идёт через распределённых независимых Collector-нод без единого статического IP-пула. Поэтому нет официального компактного IP-feed вроде Ahrefs/Apple, а соблюдение robots.txt может различаться между нодами. Для гарантии нужен deny на сервере/TrafficVeil, а не только Disallow.

Что такое TimpiBot

Параметр Значение
User-Agent (токен) Timpibot / TimpiBot
Типичные строки Timpibot/1.0 (+http://timpi.io/crawler), Timpibot/0.9 (+http://www.timpi.io), Mozilla/5.0 (compatible; Timpibot/0.9; +http://www.timpi.io)
Впервые замечен Декабрь 2023 года
Оператор Timpi (децентрализованная сеть коллекторов, работает на технологии блокчейна Neutaro)
Назначение Сбор данных о сайтах/страницах для индекса Timpi (Collectors → GeoCore и далее по архитектуре DePIN); тот же индекс может использоваться и для обучения LLM
Тип краулера Чисто текстовый — не исполняет JavaScript, не обрабатывает CSS и мультимедиа, извлекает только сырой текст
Документация Архитектура Collector описана в whitepaper/GitBook Timpi; URL timpi.io/crawler упоминается в UA (страница может отвечать нестабильно)
Соблюдение robots.txt Заявляется/ожидается, но на практике по распределённой сети — ненадёжно
Список IP ❌ Нет единого списка; коллекторы работают без требования статического IP
Недоступность сети Timpi официально не работает в ряде регионов: КНДР, Иран, Сирия, Судан, Куба, Крым, Россия, Беларусь, Афганистан, Йемен, Мьянма
Влияние на SEO Google/Yandex Нет прямой связи

Какой контент интересен TimpiBot

По наблюдениям независимых трекеров, краулер отдаёт предпочтение сайтам с ежедневными обновлениями контента, страницам с технической или отраслевой терминологией и материалам, которые работают как информационные хабы с высокой плотностью ссылок. Это не случайность: именно такие характеристики — разнообразие, актуальность и контекстная насыщенность — соответствуют требованиям к данным для обучения языковых моделей, что подтверждает связь индекса Timpi с AI/LLM-сценариями использования. Частота визитов сильно варьируется из-за децентрализованной природы сети: одни сайты могут получать несколько визитов в день, другие — заходы от случая к случаю, в зависимости от релевантности контента и частоты его обновления.

TimpiBot vs другие краулеры

Бот Модель IP verification robots.txt
TimpiBot DePIN / distributed collectors ❌ Нет единого feed Ненадёжно между нодами
CCBot (Common Crawl) Централизованный open crawl Документация Common Crawl Да (заявлено)
Bytespider AI crawl ByteDance Нет компактного opt-out IP Неоднозначно
Googlebot Поисковый индекс Официальная верификация Да
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка на сервер

По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) паттерн timpibot набрал порядка 422 тысяч запросов (март ~44 тыс., апрель ~113 тыс., май ~166 тыс., июнь ~99 тыс.). Распределённая модель даёт много разных IP — rate-limit по одному адресу слабее, чем deny по UA. Свежесть: сверьте июль–август в TrafficVeil.

Обнаружение в логах

grep -i "timpibot\|timpi\.io" /var/log/nginx/access.log

grep -i "timpibot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "timpibot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Официальной IP-верификации нет: разнообразие адресов ожидаемо для Collector-сети. Не стройте политику «только по ASN». Учитывая, что бот не тянет CSS/JS/медиа, аномально широкий обход статики под этим UA — повод заподозрить спуфинг, а не типичное поведение TimpiBot.

robots.txt

User-agent: Timpibot
Disallow: /

# На всякий случай тот же токен с другим регистром в правилах сервера

Disallow — первый шаг для вежливых нод. Для гарантии дублируйте на Nginx/Apache/TrafficVeil.

Управление на уровне сервера

Nginx

if ($http_user_agent ~* "Timpibot|TimpiBot") {
    return 403;
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Timpibot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите timpibot / TimpiBot
  • Если индекс Timpi / отдача контента в их сеть не нужны — запретить
  • На Google/Yandex не влияет
  • При смене UA нодами смотрите также поведенческие правила

Рекомендации

  • Не хотите отдавать контент в Timpi/связанный AI-индекс — Disallow + 403/deny
  • robots.txt недостаточно из-за распределённых коллекторов
  • Не путайте с Googlebot — блок безопасен для классического SEO
  • Много разных IP с одним UA — норма для DePIN; режьте по UA, не ждите одного диапазона
  • Если сайт ориентирован на аудиторию из регионов, где Timpi не работает (включая Россию) — вопрос индексации в этой сети для вас, скорее всего, неактуален в принципе

С кем не путать

Бот Почему путают Чем отличается
CCBot / Bytespider Сбор данных / AI Другие операторы и модель сети
WebScraperBot Generic crawl У Timpi есть проект/бренд и DePIN-архитектура
Googlebot «Поисковый краулер» Классический поиск; другая верификация

Сводная стратегия

Цель Действие
Убрать из Timpi Disallow + deny по UA в TrafficVeil
Оставить (редко нужно) Allow; мониторить нагрузку по сумме IP
Ноды игнорируют robots Серверный 403 / WAF по UA

Частые вопросы

Обрабатывает ли TimpiBot CSS, JavaScript или изображения на странице?
Нет, это чисто текстовый краулер, который извлекает только сырой текст без исполнения скриптов и обработки медиа.
Почему у TimpiBot нет единого списка IP для блокировки?
Потому что краулинг идёт через сеть независимых Collector-нод без требования статического адреса — это фундаментальное свойство DePIN-архитектуры Timpi, а не недостаток документации.
Какой контент чаще привлекает внимание TimpiBot?
Сайты с ежедневными обновлениями, технической терминологией и материалы с высокой плотностью ссылок — характеристики, важные для данных обучения языковых моделей.
Можно ли надёжно заблокировать TimpiBot только через robots.txt?
Нет, соблюдение директив различается между независимыми нодами сети, поэтому нужен дополнительный deny на уровне сервера или TrafficVeil.
В каких регионах сеть Timpi официально не работает?
В том числе в Северной Корее, Иране, Сирии, Судане, Кубе, Крыму, России, Беларуси, Афганистане, Йемене и Мьянме.
Стоит ли насторожиться, если под UA TimpiBot идёт активный обход статики и медиа?
Да, поскольку настоящий TimpiBot не тянет CSS/JS/изображения — такое поведение больше похоже на спуфинг UA, чем на типичную работу этого краулера.
#TimpiBot#Timpi#DePIN#децентрализованный поиск#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil