Строка copyscape в логах сбивает с толку почти сразу: свежий IP, ни одной сессии в аналитике, обращения к текстовым страницам без единого клика по кнопкам. Первый инстинкт — записать бота в очередной AI-краулер и забыть. Это ошибка: за именем стоит не система сбора обучающих данных, а сервис проверки текста на плагиат, и логика допуска для него строится совсем иначе. Ниже — честный разбор того, что Copyscape делает на самом деле, чем его трафик отличается от AI-индексации и как настроить для него разумную политику через TrafficVeil.
Что такое Copyscape на самом деле
Copyscape — сервис проверки текста на уникальность и поиска скопированного контента в сети, которым управляет британская компания Indigo Stream Technologies (тот же владелец параллельно развивает Giga Alert и Siteliner). Сервис работает с 2004 года и по официальному описанию не строит собственный независимый поисковый индекс: он использует Google как поискового партнёра на договорных условиях, а затем дополнительно обрабатывает и ранжирует полученные результаты своими алгоритмами. Отдельные сторонние обзоры описывают это иначе — как «сканирование миллиардов страниц собственными краулерами», — и это расхождение стоит держать в уме: официальная версия и распространённое популярное описание не совпадают дословно.
| Параметр | Значение |
| Название | Copyscape |
| User-Agent / паттерн | copyscape |
| Оператор | Indigo Stream Technologies Ltd |
| Категория TrafficVeil | SEO- и антиплагиат-инструменты (не AI/LLM-краулер) |
| Что делает на сайте | Ищет текстовые совпадения между вашей страницей и чужим контентом — либо по разовому запросу пользователя, либо по расписанию Copysentry |
| Публикует ли список IP | Нет открытого официального списка; проверять стоит по ASN и поведению, не по одной строке UA |
| robots.txt | Публичной политики соблюдения нет; решение принимайте по совокупности сигналов |
| Пометка TrafficVeil | Легитимный / низкий риск при разумной частоте |
Зачем бот приходит на конкретные страницы
У визита обычно один из двух источников, и они по-разному выглядят в логах.
- Разовая ручная проверка. Кто-то — не обязательно владелец сайта, это может быть конкурент, покупатель контента или сам автор текста — вставил URL или фрагмент вашей страницы в Copyscape Premium, и сервис в моменте обратился к странице для сверки. Такой визит одиночный и не повторяется без нового запроса.
- Автоматический мониторинг Copysentry. Это отдельная платная подписка: тариф Standard ($4.95/мес) проверяет закреплённые за аккаунтом страницы раз в неделю, тариф Professional ($19.95/мес) — ежедневно. Если на вашем домене регулярно, с предсказуемым интервалом заходит одна и та же строка UA к одному и тому же набору URL — это, скорее всего, чей-то Copysentry следит за копиями его контента, и среди проверяемых страниц случайно оказалась ваша (совпадение текста, цитата, общий шаблон формулировок).
В обоих случаях цель одна — сравнение текста, а не пополнение какой-либо базы для генерации ответов или обучения моделей.
Почему это не AI- и не LLM-краулер
Смешивать Copyscape с GPTBot, ClaudeBot или CCBot — распространённая, но content-инженерная ошибка. У AI-краулеров цель — собрать текст в обучающую или retrieval-выборку впрок, поэтому они системно обходят весь сайт по ссылкам, страница за страницей, вне зависимости от чьих-либо запросов. У Copyscape задача точечная: подтвердить или опровергнуть совпадение конкретного фрагмента текста с конкретной страницей. Отсюда и разница в поведении: AI-краулер идёт по графу ссылок постоянно и предсказуемо; визит Copyscape случается тогда, когда кто-то — человек через Premium или автоматика Copysentry по расписанию — инициировал сверку. Если бот заходит без всякой системы, рывками, к разным разделам сайта без видимой логики обхода — это ближе к почерку Copyscape, чем к почерку обучающего краулера.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как выглядит нагрузка в логах
Поскольку принцип работы точечный, а не «прочитать весь сайт по порядку», трафик от Copyscape обычно низкий по объёму и неровный по времени — всплеск на несколько запросов, затем тишина на дни или недели. Устойчивый ежедневный или еженедельный паттерн к одному и тому же небольшому набору URL — признак работающего Copysentry, а не наращивания нагрузки. Настоящий риск для сервера тут почти нулевой; куда важнее не спутать этот бот с подделкой UA — под именем copyscape вполне может маскироваться агрессивный скрапер контента, который к настоящему сервису не имеет отношения.
Как найти Copyscape в логах
# Базовый поиск
grep -i "copyscape" /var/log/nginx/access.log
# Топ URL, которые проверяет бот
grep -i "copyscape" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "copyscape" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Распределение по датам — ищем регулярность Copysentry
grep -i "copyscape" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Для верификации подлинности смотрите не только UA, но и сеть, из которой пришёл запрос:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Совпадение UA ничего не доказывает само по себе — подделать строку может любой скрипт за пять минут. Решение allow/deny стоит принимать по связке UA + ASN/IP + частота + набор URL, а не по одному заголовку.
robots.txt и ограничение частоты
# Жёсткий запрет
User-agent: copyscape
Disallow: /
# Разрешить всё
User-agent: copyscape
Allow: /
# Компромисс: закрыть чувствительные разделы, оставить публичный контент
User-agent: copyscape
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Публичного заявления о безусловном соблюдении robots.txt у Copyscape нет, поэтому директива — это просьба, а не гарантия. Если бот игнорирует запрет и продолжает обращаться к закрытым разделам, переходите к жёсткой блокировке на уровне веб-сервера или TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "copyscape") {
return 403;
}
limit_req_zone $binary_remote_addr zone=copyscape:10m rate=10r/m;
location / {
if ($http_user_agent ~* "copyscape") {
limit_req zone=copyscape burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} copyscape [NC]
RewriteRule ^ - [F,L]
TrafficVeil: найдите copyscape в списке ботов домена или в разделе /system/bots. Если польза от бота вам не нужна — переключите категорию на «запретить»; если визиты редкие и не мешают — оставьте в «легитимных» без вмешательства; при регулярной, но небольшой нагрузке достаточно мягкого rate-limit вместо полной блокировки. После изменения правила сверьте логи за сутки: хиты copyscape должны уйти в лимит или блок, а трафик Googlebot и YandexBot остаться нетронутым.
С кем можно перепутать Copyscape
Ближе всего по назначению стоит TurnitinBot — официальный краулер академического сервиса Turnitin, тоже проверяющего тексты на совпадения, но с принципиально другой механикой.
| Бот | Назначение | Принцип работы |
| Copyscape | Проверка текста на плагиат для владельцев контента | Точечная сверка по запросу или расписанию Copysentry, поиск через Google |
| TurnitinBot | Проверка студенческих работ на совпадения с открытым вебом | Системный обход публичного контента для пополнения собственной сравнительной базы, официально соблюдает robots.txt |
| Спуфер под именем copyscape | Маскировка под легитимный сервис | Любой скрипт-скрапер с поддельным UA — отличить можно только по ASN/IP и поведению, не по заголовку |
Практический вывод: TurnitinBot системно обходит сайт по расписанию своей академической базы и не имеет отношения к Copyscape, а любая строка UA с текстом copyscape, идущая из подозрительного дата-центрового ASN с поведением агрессивного скрапера, — вероятный спуфинг, а не настоящий сервис.
Что в итоге делать с Copyscape
| Ситуация | Действие |
| Визиты редкие, объём небольшой, ASN совпадает с ожидаемым | Оставить allow, отдельно закрыть /admin /cart /checkout /account /api |
| Бот мешает нагрузкой или задевает служебные разделы | Rate-limit на nginx/TrafficVeil, затем полный запрет при повторении |
| Подозрение на подделку UA (нетипичный ASN, поведение скрапера) | Не доверять заголовку — проверять IP/ASN, при подтверждении спуфинга — блокировать как обычного вредоносного бота |
| Нежелателен в принципе (например, чтобы избежать лишнего внимания к контенту) | Disallow + запрет в TrafficVeil |
Не режьте широким правилом User-agent: * — так легко случайно закрыть доступ Googlebot и YandexBot вместе с copyscape. Блокировка самого Copyscape почти не влияет на классическое SEO в Google и Яндексе: она лишь ограничивает возможность стороннего сравнения вашего текста с чужим через этот конкретный сервис.
Правда ли, что Copyscape собирает тексты для обучения нейросетей?
Нет — по официальному описанию сервиса Copyscape ищет совпадения через Google на правах партнёра и не формирует обучающую выборку для языковых моделей.
Чем Copyscape отличается от классических SEO-краулеров вроде Screaming Frog или Ahrefs?
Screaming Frog и Ahrefs системно обходят весь сайт ради технического аудита и анализа ссылок, а визит Copyscape точечный и привязан к конкретной проверке текста на совпадения.
Стоит ли сразу блокировать Copyscape широким правилом User-agent: *?
Нет, широкое правило рискует случайно закрыть доступ и другим легитимным ботам, поэтому разумнее прописать точечную директиву именно для строки copyscape.
Как часто автоматический мониторинг Copysentry обходит сайт?
Тариф Standard проверяет закреплённые страницы раз в неделю, а Professional — ежедневно, и эта разница обычно объясняет разную частоту визитов бота в логах разных сайтов.
Может ли частый заход Copyscape означать, что сайт взломан или заражён?
Сам по себе визит этого бота не говорит о взломе — он лишь ищет текстовые совпадения, а поводом для тревоги должен быть не факт визита, а аномальный объём запросов или обращение к служебным разделам.
Что делать, если Copyscape нашёл копию контента на чужом сайте?
Инструмент только показывает совпадение и не определяет, кто автор оригинала, поэтому дальнейшие шаги — сравнение дат публикации и обращение к владельцу сайта или его хостингу — пользователь предпринимает самостоятельно.
Частые вопросы
Правда ли, что Copyscape собирает тексты для обучения нейросетей?
Чем Copyscape отличается от классических SEO-краулеров вроде Screaming Frog или Ahrefs?
Стоит ли сразу блокировать Copyscape широким правилом User-agent: *?
Как часто автоматический мониторинг Copysentry обходит сайт?
Может ли частый заход Copyscape означать, что сайт взломан или заражён?
Что делать, если Copyscape нашёл копию контента на чужом сайте?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.