TweetmemeBot — бот с необычно длинной историей смены владельцев под одним и тем же именем в UA. Начинал он в 2009 году как краулер сервиса TweetMeme, агрегировавшего ссылки из твитов, но бренд UA пережил самого TweetMeme: сегодня по данным современных каталогов ботов эта строка ассоциируется с Meltwater — крупным сервисом медиа-мониторинга и брендовой аналитики. В каталоге TrafficVeil бот тем не менее помечен как нежелательный.
Что такое TweetmemeBot сегодня
Изначально TweetmemeBot принадлежал сервису TweetMeme, который в 2009-2010 годах собирал содержимое сайтов по ссылкам, расшаренным в Twitter — тогда некоторые вебмастера описывали его как «твиттер-губку», не соблюдающую robots.txt. Однако имя пережило исходный сервис: более поздние версии строки UA (3.0, 4.0) указывают на оператора DataSift — компанию, занимавшуюся анализом социальных данных. По данным современных каталогов ботов, сейчас этот UA-токен связывают с Meltwater — платформой медиа-мониторинга, которая помогает корпоративным клиентам отслеживать упоминания бренда, анализировать тональность и следить за конкурентами в интернете.
Важная оговорка: сам бот не публикует официального механизма верификации своей подлинности. Это значит, что совпадение строки UA в логах — полезная подсказка, но не строгое доказательство, что запрос действительно от легитимного оператора, а не от кого-то, кто просто скопировал узнаваемое имя.
| Параметр | Значение |
| Название | TweetmemeBot |
| User-Agent (токен/паттерн) | tweetmemebot (исторические строки: Mozilla/5.0 (compatible; TweetmemeBot/3.0; +http://tweetmeme.com/) и Mozilla/5.0 (TweetmemeBot/4.0; +http://datasift.com/bot.html)) |
| Оператор | По данным современных каталогов ботов — Meltwater (медиа-мониторинг); исторически связан с TweetMeme и DataSift |
| Назначение | Сбор веб-контента для отслеживания упоминаний бренда, анализа тональности и конкурентной разведки в интересах клиентов Meltwater |
| Список IP-адресов | ❌ Официального списка нет; проверяйте ASN/поведение и не полагайтесь только на UA |
| Соблюдение robots.txt | По современным данным — соблюдает; исторически (версия TweetMeme 2009-2010 годов) были свидетельства обратного |
| Используется для обучения моделей | Не задокументировано явно |
| Категория TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Как работает TweetmemeBot
По современному описанию, бот целенаправленно возвращается к страницам, которые интересны конкретным клиентам Meltwater — прайсингу, карточкам продуктов, новостным разделам, — а не проходит по всему сайту без разбора. Частота визитов колеблется от почасовой до недельной и напрямую зависит от того, входит ли сайт в список отслеживания у какого-либо клиента. Сайты, не представляющие интереса ни для одного клиента Meltwater, этот бот может вообще не посещать.
Нагрузка на сервер
На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий, но, судя по описанию сфокусированных повторяющихся визитов на конкретные страницы, глубина обхода здесь обычно уже, чем у широких контентных краулеров. Признаки, на которые стоит смотреть:
- концентрация на конкретных страницах (прайсинг, продукты, новости), а не системный обход каталога;
- повторяемость визитов на одни и те же URL с интервалом от часов до недель;
- рост RPS без роста конверсий — как и у любого fetch-бота без пользовательской сессии.
Обнаружение в логах
# Все запросы
grep -i "tweetmemebot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "tweetmemebot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "tweetmemebot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "tweetmemebot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: раз официального механизма подтверждения подлинности у бота нет, совпадение по UA само по себе ничего не гарантирует. Для критичных решений дополнительно проверяйте IP/ASN, частоту и то, действительно ли запросы концентрируются на «интересных для мониторинга» страницах, а не расползаются по всему сайту:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt
# Полная блокировка User-agent: tweetmemebot Disallow: / # Точечное ограничение User-agent: tweetmemebot Disallow: /admin/ Disallow: /cart/ Disallow: /account/ Allow: / # Разрешить полностью User-agent: tweetmemebot Allow: /
По современным данным бот соблюдает стандартные директивы robots.txt, что делает этот файл рабочим инструментом контроля — в отличие от многих других записей в категории «Прочие краулеры и сервисы», где на файл лучше не полагаться.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "tweetmemebot") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=tweetmemebot:10m rate=15r/m;
location / {
if ($http_user_agent ~* "tweetmemebot") {
limit_req zone=tweetmemebot burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} tweetmemebot [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- откройте список известных ботов в панели домена или
/system/bots; - найдите tweetmemebot / TweetmemeBot;
- блокировка исключит контент сайта из мониторинга Meltwater — решайте исходя из того, важно ли вам быть видимыми для этого канала бренд-мониторинга;
- проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
Рекомендации по оптимизации
- В базе TrafficVeil бот помечен как нежелательный, но современное описание его роли (медиа-мониторинг Meltwater) ближе к «легитимный B2B-сервис с косвенной пользой», чем к вредоносному скрейперу — стоит пересмотреть решение с учётом этого контекста;
- не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- для всплесков чаще достаточно rate-limit вместо полного 403;
- учитывая отсутствие верификации, при сомнениях в подлинности смотрите на поведение (фокус на конкретных страницах), а не только на строку UA.
Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Сводная таблица стратегии
| Цель сайта | Рекомендация |
| Видимость в медиа-мониторинге Meltwater полезна | Allow / разрешить в TrafficVeil |
| Мониторинг третьей стороной нежелателен | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Нужен доступ, но беспокоит частота | Rate-limit вместо полной блокировки |
| Сомнения в подлинности конкретного визита | Проверять поведение (фокус на конкретных страницах), а не только совпадение UA |