SpiderLing («SPIDER for LINGuistic research») — краулер для построения текстовых корпусов, связанный с NLP Centre, Faculty of Informatics, Masaryk University (Брно). Его цель — текстово богатые страницы, а не полный SEO-индекс и не превью для соцсетей.
Параметры
| Параметр | Значение |
|---|---|
| UA | Mozilla/5.0 (compatible; SpiderLing; +https://nlp.fi.muni.cz/projects/biwec/) |
| Вариант | SpiderLing (a SPIDER for LINGustic research) |
| Оператор | NLP Centre, Faculty of Informatics, Masaryk University (и другие инстансы того же открытого ПО у сторонних исследовательских групп) |
| Docs | corpus.tools/wiki/SpiderLing, проект biwec |
| IP-лист | ❌ Единого глобального feed нет — ПО открытое и запускается разными операторами независимо |
Почему «единого оператора» здесь в принципе не бывает
SpiderLing — не закрытый сервис одной организации, а публично доступное открытое ПО: любая исследовательская группа может скачать его и запустить собственный инстанс под своим доменом или инфраструктурой. Официальная страница проекта прямо указывает, что софт распространяется «как есть, без гарантированной поддержки» — то есть развитие и конкретные настройки конкретного запуска остаются на усмотрение того, кто его использует. Практическое следствие: если в логах виден SpiderLing, не стоит автоматически считать, что это обязательно именно группа из Брно — это может быть любая другая лаборатория компьютерной лингвистики, использующая тот же открытый инструмент. Верифицировать конкретный источник стоит по IP/ASN и поведению, а не по одному совпадению UA.
Зачем SpiderLing приходит на сайт
В отличие от универсальных краулеров, SpiderLing — фокусированный инструмент: он специально нацелен на «текстово богатые» части веба, чтобы максимизировать количество связного текста на каждый скачанный мегабайт данных. Это принципиально другая логика, чем у SEO-индексаторов или ботов, которые генерируют превью ссылок.
- Какие зоны чаще трогает: страницы с большим объёмом связного текста — статьи, длинные материалы, а не карточки товаров или служебные разделы
- Что ищет: полные предложения и связный текст для включения в лингвистический корпус, используемый в исследованиях NLP
- Чем отличается от массового краулера: может намеренно игнорировать домены с низким «выходом» текста относительно объёма скачанных данных, если не настроен иначе
На основе данных, собранных SpiderLing с 2017 по 2020 год, были построены корпуса общим объёмом около 200 миллиардов слов на разных языках — в основном на английском. Это давний, академически значимый проект, лежащий в основе таких инструментов, как Sketch Engine.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Соблюдение robots.txt
Программно SpiderLing реализует стандарт исключения роботов — в его коде используется отдельный Python-парсер robots.txt. Это заложено в само ПО, а не является внешним обещанием оператора. Тем не менее, поскольку разные группы запускают собственные инстансы с собственными настройками, стопроцентной гарантии единообразного поведения для всех возможных источников под этим UA нет.
Нагрузка
По сводке TrafficVeil паттерн spiderling — порядка 11 тысяч запросов (март–июнь 2026, июнь по 14.06). Учитывая фокусированную, а не тотальную природу обхода, такой объём — умеренный фон, типичный для исследовательского краулера, а не признак агрессивного скрапинга.
Контроль
grep -i "SpiderLing" /var/log/nginx/access.log
User-agent: SpiderLing
Disallow: /
if ($http_user_agent ~* "SpiderLing") {
return 403;
}
Верификация
UA легко копируется — смотрите ASN и поведение конкретного источника, а не только совпадение строки. Поскольку это открытое ПО без единого канонического оператора, встретить SpiderLing с IP, не связанным напрямую с Масариковым университетом, — не обязательно признак подделки, а может означать другой легитимный академический инстанс.
Рекомендации
- Нет интереса к участию в лингвистических корпусах для исследований — deny, прямой пользы для сайта это не несёт
- Академический или образовательный сайт, заинтересованный в том, чтобы попасть в исследовательские корпуса — можно оставить allow без риска для функциональности
- На позиции в Google/Yandex блокировка не влияет — это не поисковый краулер
С кем не путать SpiderLing
| Бот | Оператор | Отличие от SpiderLing |
|---|---|---|
| Corpus Crawler | Google (открытый проект) | Тоже строит лингвистические корпуса и уважает robots.txt, но намеренно медленный по конструкции и ориентирован на менее распространённые языки, а не на максимизацию текста с одного домена |
Частые вопросы
Кто управляет SpiderLing централизованно?
Почему совпадение UA не гарантирует, что это именно оригинальная группа из Брно?
Зачем SpiderLing вообще заходит на сайт?
Соблюдает ли SpiderLing правила robots.txt?
Насколько это давний и серьёзный проект?
Чем SpiderLing отличается от Corpus Crawler от Google?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.