TurnitinBot — краулер Turnitin: собирает публичный веб в сравнительную базу данных для проверки студенческих и научных работ на плагиат. Не поисковик.
Параметры
| Параметр | Значение |
|---|---|
| UA | TurnitinBot/ContentIngest (http://www.turnitin.com/robot/crawlerinfo.html); также встречается отдельный токен Turnitin (https://bit.ly/2UvnfoQ) — оба принадлежат одному оператору и оба стоит учитывать при настройке правил |
| Docs | turnitin.com/robot/crawlerinfo.html |
| robots.txt | Да; токены TurnitinBot и Turnitin — оба честно соблюдают Disallow, согласно официальной документации и независимым трекерам |
Технический профиль
TurnitinBot — узкоспециализированный текстовый краулер: он не исполняет JavaScript, не обрабатывает CSS и не поддерживает cookies, сосредотачиваясь исключительно на извлечении текстового содержимого страницы для последующего сравнения. Задача бота — не отрендерить страницу как браузер, а получить чистый текст для базы.
Масштаб практики блокировки
По данным на 2 июля 2026 года, около 5% топовых сайтов уже блокируют TurnitinBot в своём robots.txt — полезный ориентир, если сомневаетесь, насколько распространена такая практика среди других владельцев сайтов.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Что теряет сайт при блокировке
Стоит понимать конкретные последствия решения. Если заблокировать TurnitinBot, содержимое сайта просто не попадёт в сравнительную базу Turnitin — а значит, если кто-то впоследствии скопирует текст с вашего сайта в студенческую или научную работу, система проверки на плагиат Turnitin может не обнаружить совпадение, поскольку у неё не окажется вашего контента для сравнения. Это особенно значимо для образовательных, издательских и экспертных сайтов, где обнаружение плагиата их материалов — скорее желаемый результат, чем нежелательный.
Нагрузка
По сводке TrafficVeil — порядка 0,5 тысячи запросов.
Контроль
grep -i "Turnitin" /var/log/nginx/access.log
User-agent: TurnitinBot
Disallow: /
User-agent: Turnitin
Disallow: /
Верификация
Официального списка IP Turnitin не публикует. Для проверки подлинности запроса можно использовать двойной reverse-DNS lookup:
host
# посмотреть имя хоста, затем сделать обратный запрос по этому имени
host <имя_хоста_из_предыдущего_шага>
# если результат совпадает с исходным IP и домен связан с Turnitin — запрос, вероятно, подлинный
Рекомендации
- Хотите, чтобы ваш контент ловили как источник плагиата в академической среде, — Allow
- Не хотите попадать в сравнительную базу Turnitin — Disallow обоих токенов (TurnitinBot и Turnitin)
- На Google не влияет — это независимая от поисковой индексации инфраструктура
Частые вопросы
Сколько разных токенов использует Turnitin для своего краулера?
Исполняет ли TurnitinBot JavaScript при обходе страницы?
Что конкретно теряет сайт, если заблокировать TurnitinBot?
Какая доля топовых сайтов блокирует TurnitinBot?
Как проверить подлинность запроса, если официального списка IP нет?
Кому имеет смысл разрешать TurnitinBot в первую очередь?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.