TrafficVeil
Боты 6 мин25 августа 2026 г.

TweetmemeBot: бот, переживший свой первоначальный сервис

TweetmemeBot начинал в 2009 году как краулер сервиса TweetMeme, но сегодня по данным современных каталогов ботов ассоциируется с Meltwater — платформой медиа-мониторинга для бизнеса. Разбираем историю смены владельцев, отсутствие механизма верификации и настройку allow, rate-limit или блокировки через TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое TweetmemeBot сегодня
  2. Как работает TweetmemeBot
  3. Нагрузка на сервер
  4. Обнаружение в логах
  5. robots.txt
  6. Управление на уровне сервера
  7. Nginx
  8. Apache (.htaccess)
  9. Через TrafficVeil
  10. Рекомендации по оптимизации
  11. Сравнение с похожими ботами
  12. Сводная таблица стратегии
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

TweetmemeBot — бот с необычно длинной историей смены владельцев под одним и тем же именем в UA. Начинал он в 2009 году как краулер сервиса TweetMeme, агрегировавшего ссылки из твитов, но бренд UA пережил самого TweetMeme: сегодня по данным современных каталогов ботов эта строка ассоциируется с Meltwater — крупным сервисом медиа-мониторинга и брендовой аналитики. В каталоге TrafficVeil бот тем не менее помечен как нежелательный.

Что такое TweetmemeBot сегодня

Изначально TweetmemeBot принадлежал сервису TweetMeme, который в 2009-2010 годах собирал содержимое сайтов по ссылкам, расшаренным в Twitter — тогда некоторые вебмастера описывали его как «твиттер-губку», не соблюдающую robots.txt. Однако имя пережило исходный сервис: более поздние версии строки UA (3.0, 4.0) указывают на оператора DataSift — компанию, занимавшуюся анализом социальных данных. По данным современных каталогов ботов, сейчас этот UA-токен связывают с Meltwater — платформой медиа-мониторинга, которая помогает корпоративным клиентам отслеживать упоминания бренда, анализировать тональность и следить за конкурентами в интернете.

Важная оговорка: сам бот не публикует официального механизма верификации своей подлинности. Это значит, что совпадение строки UA в логах — полезная подсказка, но не строгое доказательство, что запрос действительно от легитимного оператора, а не от кого-то, кто просто скопировал узнаваемое имя.

Параметр Значение
Название TweetmemeBot
User-Agent (токен/паттерн) tweetmemebot (исторические строки: Mozilla/5.0 (compatible; TweetmemeBot/3.0; +http://tweetmeme.com/) и Mozilla/5.0 (TweetmemeBot/4.0; +http://datasift.com/bot.html))
Оператор По данным современных каталогов ботов — Meltwater (медиа-мониторинг); исторически связан с TweetMeme и DataSift
Назначение Сбор веб-контента для отслеживания упоминаний бренда, анализа тональности и конкурентной разведки в интересах клиентов Meltwater
Список IP-адресов ❌ Официального списка нет; проверяйте ASN/поведение и не полагайтесь только на UA
Соблюдение robots.txt По современным данным — соблюдает; исторически (версия TweetMeme 2009-2010 годов) были свидетельства обратного
Используется для обучения моделей Не задокументировано явно
Категория TrafficVeil Нежелательный / Прочие краулеры и сервисы

Как работает TweetmemeBot

По современному описанию, бот целенаправленно возвращается к страницам, которые интересны конкретным клиентам Meltwater — прайсингу, карточкам продуктов, новостным разделам, — а не проходит по всему сайту без разбора. Частота визитов колеблется от почасовой до недельной и напрямую зависит от того, входит ли сайт в список отслеживания у какого-либо клиента. Сайты, не представляющие интереса ни для одного клиента Meltwater, этот бот может вообще не посещать.

Нагрузка на сервер

На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий, но, судя по описанию сфокусированных повторяющихся визитов на конкретные страницы, глубина обхода здесь обычно уже, чем у широких контентных краулеров. Признаки, на которые стоит смотреть:

  • концентрация на конкретных страницах (прайсинг, продукты, новости), а не системный обход каталога;
  • повторяемость визитов на одни и те же URL с интервалом от часов до недель;
  • рост RPS без роста конверсий — как и у любого fetch-бота без пользовательской сессии.

Обнаружение в логах

# Все запросы
grep -i "tweetmemebot" /var/log/nginx/access.log

# Количество запросов за сегодня
grep -i "tweetmemebot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l

# Уникальные IP
grep -i "tweetmemebot" /var/log/nginx/access.log | awk '{print $1}' | sort -u

# Частота по дням
grep -i "tweetmemebot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация: раз официального механизма подтверждения подлинности у бота нет, совпадение по UA само по себе ничего не гарантирует. Для критичных решений дополнительно проверяйте IP/ASN, частоту и то, действительно ли запросы концентрируются на «интересных для мониторинга» страницах, а не расползаются по всему сайту:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt

# Полная блокировка
User-agent: tweetmemebot
Disallow: /

# Точечное ограничение
User-agent: tweetmemebot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /

# Разрешить полностью
User-agent: tweetmemebot
Allow: /

По современным данным бот соблюдает стандартные директивы robots.txt, что делает этот файл рабочим инструментом контроля — в отличие от многих других записей в категории «Прочие краулеры и сервисы», где на файл лучше не полагаться.

Управление на уровне сервера

Nginx

if ($http_user_agent ~* "tweetmemebot") {
    return 403;
}

# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=tweetmemebot:10m rate=15r/m;

location / {
    if ($http_user_agent ~* "tweetmemebot") {
        limit_req zone=tweetmemebot burst=30 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} tweetmemebot [NC]
RewriteRule ^ - [F,L]

Через TrafficVeil

  • откройте список известных ботов в панели домена или /system/bots;
  • найдите tweetmemebot / TweetmemeBot;
  • блокировка исключит контент сайта из мониторинга Meltwater — решайте исходя из того, важно ли вам быть видимыми для этого канала бренд-мониторинга;
  • проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.

Рекомендации по оптимизации

  • В базе TrafficVeil бот помечен как нежелательный, но современное описание его роли (медиа-мониторинг Meltwater) ближе к «легитимный B2B-сервис с косвенной пользой», чем к вредоносному скрейперу — стоит пересмотреть решение с учётом этого контекста;
  • не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
  • сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
  • для всплесков чаще достаточно rate-limit вместо полного 403;
  • учитывая отсутствие верификации, при сомнениях в подлинности смотрите на поведение (фокус на конкретных страницах), а не только на строку UA.

Сравнение с похожими ботами

Бот Кластер User-Agent Метка
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

Сводная таблица стратегии

Цель сайта Рекомендация
Видимость в медиа-мониторинге Meltwater полезна Allow / разрешить в TrafficVeil
Мониторинг третьей стороной нежелателен Disallow + запрет в TrafficVeil или 403 на nginx/Apache
Нужен доступ, но беспокоит частота Rate-limit вместо полной блокировки
Сомнения в подлинности конкретного визита Проверять поведение (фокус на конкретных страницах), а не только совпадение UA

Частые вопросы

С каким сервисом изначально был связан TweetmemeBot?

С TweetMeme — агрегатором ссылок из твитов, который в 2009-2010 годах собирал контент сайтов по расшаренным в Twitter ссылкам.

Кто ассоциируется с этим UA-токеном сегодня, по данным современных каталогов ботов?

Meltwater — платформа медиа-мониторинга, которая отслеживает упоминания бренда, тональность и конкурентную активность для корпоративных клиентов.

Можно ли доверять совпадению строки UA как доказательству подлинности TweetmemeBot?

Нет — бот не публикует официального механизма верификации, поэтому совпадение по UA стоит воспринимать как подсказку, а не строгое доказательство.

Соблюдает ли TweetmemeBot директивы robots.txt?

По современным данным — да, что делает этот файл рабочим инструментом контроля, в отличие от многих других записей в этой категории.

Как часто TweetmemeBot посещает один и тот же сайт?

От почасовой до недельной частоты, в зависимости от того, входит ли сайт в список отслеживания у кого-то из клиентов Meltwater.

Стоит ли автоматически следовать пометке «нежелательный» из базы TrafficVeil для этого бота?

Не обязательно — современное описание его роли ближе к легитимному B2B-сервису с косвенной пользой, поэтому решение стоит пересмотреть с учётом этого контекста.

#TweetmemeBot#Meltwater#медиа-мониторинг#боты на сайте#robots.txt#брендовая аналитика#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Podimo: европейский бот, которому нужен подкаст-фид

Podimo — реальный сервис подписки на подкасты, чей бот узко специализирован на чтении RSS-фидов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

6 мин

PodchaserParser: бот, которому нужен именно подкаст-фид

PodchaserParser — реальный бот каталога подкастов Podchaser, узко специализированный на чтении RSS-фидов подкастов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

TweetmemeBot: от TweetMeme до Meltwater