Twingly Recon — краулер компании Twingly AB (Швеция): собирает обновления с новостей, блогов, форумов и смежных источников для их media/social data API. Это не поисковик Google или Yandex, а инфраструктура media intelligence — данные идут в аналитические продукты для мониторинга упоминаний, а не в поисковую выдачу.
Параметры
| Параметр | Значение |
|---|---|
| UA | Mozilla/5.0 (compatible; Twingly Recon; twingly.com) или Twingly Recon-<subsystem>/1.0 (+https://app.twingly.com/public-docs/crawler) |
| Токен robots | Twingly Recon |
| Docs | Twingly Recon Crawler (developer.twingly.com/resources/recon) |
| robots.txt | Да (по их публичной документации) |
| noindex | Поддерживают noindex именно в RSS/Atom-фидах (спецификация Yahoo / LiveJournal) — визит на сайт возможен, но запись не попадает в их индекс |
| IP-лист | ❌ Компактного публичного feed обычно нет |
Не путайте два разных «noindex»
В черновике упоминается noindex, и здесь легко перепутать понятия. Twingly поддерживает noindex именно на уровне RSS/Atom-фида по старой спецификации Yahoo/LiveJournal — это отдельная директива внутри самого фида, которая говорит: «можно зайти и прочитать, но не включай запись в свою базу». Это не то же самое, что классический мета-тег noindex или HTTP-заголовок X-Robots-Tag, которые управляют попаданием страницы в выдачу Google или Яндекса. Если сайт уже использует общий noindex для поисковиков, это никак не отменяет и не заменяет отдельную настройку внутри фида специально для Twingly.
Нагрузка
По сводке TrafficVeil — порядка 2,8 тысячи запросов. Небольшой объём согласуется с профилем сервиса: краулер работает с конкретными источниками обновлений (фиды, страницы блогов/форумов), а не ведёт массовый обход всего сайта.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Контроль
grep -i "Twingly" /var/log/nginx/access.log
User-agent: Twingly Recon
Disallow: /
if ($http_user_agent ~* "Twingly") {
return 403;
}
Рекомендации
- Хотите попадание в мониторинг Twingly / связанных партнёрских продуктов — Allow; при необходимости точечно настройте noindex именно в самом фиде, а не полагайтесь на общие поисковые директивы
- Не отдаёте контент в media-intelligence базы — Disallow + deny
- На Google не влияет — это отдельная от поисковой выдачи инфраструктура
- Строку UA легко подделать: если нужна повышенная уверенность в подлинности, сверяйте с поведением (концентрация на фидах/блог-разделах, а не широкий обход) — компактного официального IP-списка для дополнительной проверки нет
Частые вопросы
Для чего Twingly Recon собирает данные с блогов и форумов?
Чем noindex для Twingly отличается от обычного noindex для Google?
Если сайт уже использует общий noindex для поисковиков, закрывает ли это данные и от Twingly?
Влияет ли блокировка Twingly Recon на позиции сайта в Google?
Публикует ли Twingly официальный список IP для верификации краулера?
Какой типичный паттерн поведения у настоящего Twingly Recon?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.