TimpiBot (часто Timpibot) — краулер проекта Timpi: децентрализованный поиск / DePIN-сеть коллекторов, которые обходят публичный веб и складывают данные в индекс экосистемы Timpi. Это не Googlebot и не Яндекс: блокировка не роняет классическую выдачу, но убирает сайт из покрытия Timpi (и связанных сценариев использования индекса, включая AI/LLM-контуры, о которых пишут сторонние каталоги). Главный операционный риск: краулинг идёт через распределённых независимых Collector-нод без единого статического IP-пула. Поэтому нет официального компактного IP-feed вроде Ahrefs/Apple, а соблюдение robots.txt может различаться между нодами. Для гарантии нужен deny на сервере/TrafficVeil, а не только Disallow.
Что такое TimpiBot
| Параметр | Значение |
|---|---|
| User-Agent (токен) | Timpibot / TimpiBot |
| Типичные строки | Timpibot/1.0 (+http://timpi.io/crawler), Timpibot/0.9 (+http://www.timpi.io), Mozilla/5.0 (compatible; Timpibot/0.9; +http://www.timpi.io) |
| Впервые замечен | Декабрь 2023 года |
| Оператор | Timpi (децентрализованная сеть коллекторов, работает на технологии блокчейна Neutaro) |
| Назначение | Сбор данных о сайтах/страницах для индекса Timpi (Collectors → GeoCore и далее по архитектуре DePIN); тот же индекс может использоваться и для обучения LLM |
| Тип краулера | Чисто текстовый — не исполняет JavaScript, не обрабатывает CSS и мультимедиа, извлекает только сырой текст |
| Документация | Архитектура Collector описана в whitepaper/GitBook Timpi; URL timpi.io/crawler упоминается в UA (страница может отвечать нестабильно) |
| Соблюдение robots.txt | Заявляется/ожидается, но на практике по распределённой сети — ненадёжно |
| Список IP | ❌ Нет единого списка; коллекторы работают без требования статического IP |
| Недоступность сети | Timpi официально не работает в ряде регионов: КНДР, Иран, Сирия, Судан, Куба, Крым, Россия, Беларусь, Афганистан, Йемен, Мьянма |
| Влияние на SEO Google/Yandex | Нет прямой связи |
Какой контент интересен TimpiBot
По наблюдениям независимых трекеров, краулер отдаёт предпочтение сайтам с ежедневными обновлениями контента, страницам с технической или отраслевой терминологией и материалам, которые работают как информационные хабы с высокой плотностью ссылок. Это не случайность: именно такие характеристики — разнообразие, актуальность и контекстная насыщенность — соответствуют требованиям к данным для обучения языковых моделей, что подтверждает связь индекса Timpi с AI/LLM-сценариями использования. Частота визитов сильно варьируется из-за децентрализованной природы сети: одни сайты могут получать несколько визитов в день, другие — заходы от случая к случаю, в зависимости от релевантности контента и частоты его обновления.
TimpiBot vs другие краулеры
| Бот | Модель | IP verification | robots.txt |
|---|---|---|---|
| TimpiBot | DePIN / distributed collectors | ❌ Нет единого feed | Ненадёжно между нодами |
| CCBot (Common Crawl) | Централизованный open crawl | Документация Common Crawl | Да (заявлено) |
| Bytespider | AI crawl ByteDance | Нет компактного opt-out IP | Неоднозначно |
| Googlebot | Поисковый индекс | Официальная верификация | Да |
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка на сервер
По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) паттерн timpibot набрал порядка 422 тысяч запросов (март ~44 тыс., апрель ~113 тыс., май ~166 тыс., июнь ~99 тыс.). Распределённая модель даёт много разных IP — rate-limit по одному адресу слабее, чем deny по UA. Свежесть: сверьте июль–август в TrafficVeil.
Обнаружение в логах
grep -i "timpibot\|timpi\.io" /var/log/nginx/access.log
grep -i "timpibot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "timpibot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Официальной IP-верификации нет: разнообразие адресов ожидаемо для Collector-сети. Не стройте политику «только по ASN». Учитывая, что бот не тянет CSS/JS/медиа, аномально широкий обход статики под этим UA — повод заподозрить спуфинг, а не типичное поведение TimpiBot.
robots.txt
User-agent: Timpibot
Disallow: /
# На всякий случай тот же токен с другим регистром в правилах сервера
Disallow — первый шаг для вежливых нод. Для гарантии дублируйте на Nginx/Apache/TrafficVeil.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "Timpibot|TimpiBot") {
return 403;
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Timpibot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите timpibot / TimpiBot
- Если индекс Timpi / отдача контента в их сеть не нужны — запретить
- На Google/Yandex не влияет
- При смене UA нодами смотрите также поведенческие правила
Рекомендации
- Не хотите отдавать контент в Timpi/связанный AI-индекс — Disallow + 403/deny
- robots.txt недостаточно из-за распределённых коллекторов
- Не путайте с Googlebot — блок безопасен для классического SEO
- Много разных IP с одним UA — норма для DePIN; режьте по UA, не ждите одного диапазона
- Если сайт ориентирован на аудиторию из регионов, где Timpi не работает (включая Россию) — вопрос индексации в этой сети для вас, скорее всего, неактуален в принципе
С кем не путать
| Бот | Почему путают | Чем отличается |
|---|---|---|
| CCBot / Bytespider | Сбор данных / AI | Другие операторы и модель сети |
| WebScraperBot | Generic crawl | У Timpi есть проект/бренд и DePIN-архитектура |
| Googlebot | «Поисковый краулер» | Классический поиск; другая верификация |
Сводная стратегия
| Цель | Действие |
|---|---|
| Убрать из Timpi | Disallow + deny по UA в TrafficVeil |
| Оставить (редко нужно) | Allow; мониторить нагрузку по сумме IP |
| Ноды игнорируют robots | Серверный 403 / WAF по UA |
Частые вопросы
Обрабатывает ли TimpiBot CSS, JavaScript или изображения на странице?
Почему у TimpiBot нет единого списка IP для блокировки?
Какой контент чаще привлекает внимание TimpiBot?
Можно ли надёжно заблокировать TimpiBot только через robots.txt?
В каких регионах сеть Timpi официально не работает?
Стоит ли насторожиться, если под UA TimpiBot идёт активный обход статики и медиа?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.