Строка newslitbot в базах помечена «нежелательный» — но само название («news lit[eracy] bot») прямо намекает на конкретную и вполне понятную категорию: сервисы оценки достоверности и медиаграмотности, которые оценивают новостные и информационные сайты по прозрачным критериям. Разбираемся, что стоит за этим именем и почему автоматический запрет здесь не самый очевидный выбор.
Что известно о категории «news literacy» на самом деле
В сфере медиаграмотности и проверки достоверности источников работают реальные, известные организации: NewsGuard — компания, которая силами журналистов оценивает надёжность более 7500 новостных сайтов по девяти прозрачным критериям и распространяет рейтинги через браузерное расширение, API и партнёрства с библиотеками; News Literacy Project — некоммерческая организация (с 2008 года, Вашингтон), развивающая образовательные инструменты вроде RumorGuard и Checkology для распознавания дезинформации. Обе структуры по своей природе должны так или иначе обращаться к новостным сайтам, чтобы формировать свои оценки, — но ни одна из них напрямую не подтверждена как оператор бота именно с UA newslitbot.
| Параметр | Значение |
| Название | Newslitbot |
| User-Agent / паттерн | newslitbot |
| Оператор | Не подтверждён напрямую — по названию похоже на сервис оценки медиаграмотности/достоверности (например, категория NewsGuard/News Literacy Project), но точное совпадение не установлено |
| Категория TrafficVeil | Вероятная категория — рейтинг достоверности новостных источников (не подтверждена как единый оператор) |
| Что делает на сайте | Предположительно оценивает контент и признаки надёжности источника, если связь с категорией news-literacy подтвердится |
| Список IP | ❌ Публичного списка нет; проверяйте ASN и поведение |
| robots.txt | Официальной политики соблюдения нет — конкретный оператор не подтверждён |
| Пометка TrafficVeil | Требует индивидуальной проверки — правдоподобная категория не равна подтверждённой личности |
Почему это ни точно «легитимный», ни точно «нежелательный»
Если бот действительно относится к экосистеме проверки достоверности новостей — для издания это, скорее, позитивный сигнал: попадание в базу рейтингов доверия помогает читателям и AI-инструментам (например, NewsGuard AI прямо цитирует и оплачивает публикаторам за использование их журналистики) отличать сайт от недостоверных источников. Но раз конкретный оператор для строки newslitbot не подтверждён, категоричный вердикт — что «легитимный», что «нежелательный» — будет предположением, а не фактом.
Как оценивать визиты Newslitbot на практике
# Базовый поиск
grep -i "newslitbot" /var/log/nginx/access.log
# Какие страницы вычитывает
grep -i "newslitbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -i "newslitbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
Раз связь UA с подтверждённым оператором отсутствует, решение стоит принимать полностью по поведению:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
Точечные, регулярные визиты к материалам новостного/публицистического характера соответствуют гипотезе о медиа-оценке источника. Хаотичный обход множества несвязанных разделов — сигнал сверить IP отдельно.
robots.txt и блокировка через TrafficVeil
# Умеренный вариант при отсутствии подтверждённого негатива
User-agent: newslitbot
Allow: /
# Более осторожный вариант, если решено ограничивать неподтверждённые источники
User-agent: newslitbot
Disallow: /
TrafficVeil: для новостных и издательских доменов, где присутствие в базах доверия скорее полезно, разумно оставить allow при редких визитах. Для нейтральных или коммерческих сайтов, где такая оценка не имеет значения, можно ограничиться наблюдением, не блокируя превентивно, — совпадение с реальной, полезной категорией достаточно вероятно, чтобы не спешить с запретом «на всякий случай».
Что в итоге делать с Newslitbot
| Ситуация | Действие |
| Издание/новостной сайт, визиты редкие | Allow — вероятная польза от попадания в базы доверия |
| Коммерческий сайт вне новостной тематики | Наблюдать, не блокировать превентивно при малой нагрузке |
| Поведение похоже на системный обход множества разделов | Rate-limit, затем Disallow / запрет в TrafficVeil |
| Подозрение на спуфинг UA | Сверять по ASN и характеру запросов, а не по одной строке |