Строка copyscape в логах сбивает с толку почти сразу: свежий IP, ни одной сессии в аналитике, обращения к текстовым страницам без единого клика по кнопкам. Первый инстинкт — записать бота в очередной AI-краулер и забыть. Это ошибка: за именем стоит не система сбора обучающих данных, а сервис проверки текста на плагиат, и логика допуска для него строится совсем иначе. Ниже — честный разбор того, что Copyscape делает на самом деле, чем его трафик отличается от AI-индексации и как настроить для него разумную политику через TrafficVeil.
Что такое Copyscape на самом деле
Copyscape — сервис проверки текста на уникальность и поиска скопированного контента в сети, которым управляет британская компания Indigo Stream Technologies (тот же владелец параллельно развивает Giga Alert и Siteliner). Сервис работает с 2004 года и по официальному описанию не строит собственный независимый поисковый индекс: он использует Google как поискового партнёра на договорных условиях, а затем дополнительно обрабатывает и ранжирует полученные результаты своими алгоритмами. Отдельные сторонние обзоры описывают это иначе — как «сканирование миллиардов страниц собственными краулерами», — и это расхождение стоит держать в уме: официальная версия и распространённое популярное описание не совпадают дословно.
| Параметр | Значение |
| Название | Copyscape |
| User-Agent / паттерн | copyscape |
| Оператор | Indigo Stream Technologies Ltd |
| Категория TrafficVeil | SEO- и антиплагиат-инструменты (не AI/LLM-краулер) |
| Что делает на сайте | Ищет текстовые совпадения между вашей страницей и чужим контентом — либо по разовому запросу пользователя, либо по расписанию Copysentry |
| Публикует ли список IP | Нет открытого официального списка; проверять стоит по ASN и поведению, не по одной строке UA |
| robots.txt | Публичной политики соблюдения нет; решение принимайте по совокупности сигналов |
| Пометка TrafficVeil | Легитимный / низкий риск при разумной частоте |
Зачем бот приходит на конкретные страницы
У визита обычно один из двух источников, и они по-разному выглядят в логах.
- Разовая ручная проверка. Кто-то — не обязательно владелец сайта, это может быть конкурент, покупатель контента или сам автор текста — вставил URL или фрагмент вашей страницы в Copyscape Premium, и сервис в моменте обратился к странице для сверки. Такой визит одиночный и не повторяется без нового запроса.
- Автоматический мониторинг Copysentry. Это отдельная платная подписка: тариф Standard ($4.95/мес) проверяет закреплённые за аккаунтом страницы раз в неделю, тариф Professional ($19.95/мес) — ежедневно. Если на вашем домене регулярно, с предсказуемым интервалом заходит одна и та же строка UA к одному и тому же набору URL — это, скорее всего, чей-то Copysentry следит за копиями его контента, и среди проверяемых страниц случайно оказалась ваша (совпадение текста, цитата, общий шаблон формулировок).
В обоих случаях цель одна — сравнение текста, а не пополнение какой-либо базы для генерации ответов или обучения моделей.
Почему это не AI- и не LLM-краулер
Смешивать Copyscape с GPTBot, ClaudeBot или CCBot — распространённая, но content-инженерная ошибка. У AI-краулеров цель — собрать текст в обучающую или retrieval-выборку впрок, поэтому они системно обходят весь сайт по ссылкам, страница за страницей, вне зависимости от чьих-либо запросов. У Copyscape задача точечная: подтвердить или опровергнуть совпадение конкретного фрагмента текста с конкретной страницей. Отсюда и разница в поведении: AI-краулер идёт по графу ссылок постоянно и предсказуемо; визит Copyscape случается тогда, когда кто-то — человек через Premium или автоматика Copysentry по расписанию — инициировал сверку. Если бот заходит без всякой системы, рывками, к разным разделам сайта без видимой логики обхода — это ближе к почерку Copyscape, чем к почерку обучающего краулера.
Как выглядит нагрузка в логах
Поскольку принцип работы точечный, а не «прочитать весь сайт по порядку», трафик от Copyscape обычно низкий по объёму и неровный по времени — всплеск на несколько запросов, затем тишина на дни или недели. Устойчивый ежедневный или еженедельный паттерн к одному и тому же небольшому набору URL — признак работающего Copysentry, а не наращивания нагрузки. Настоящий риск для сервера тут почти нулевой; куда важнее не спутать этот бот с подделкой UA — под именем copyscape вполне может маскироваться агрессивный скрапер контента, который к настоящему сервису не имеет отношения.
Как найти Copyscape в логах
# Базовый поиск
grep -i "copyscape" /var/log/nginx/access.log
# Топ URL, которые проверяет бот
grep -i "copyscape" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "copyscape" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Распределение по датам — ищем регулярность Copysentry
grep -i "copyscape" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Для верификации подлинности смотрите не только UA, но и сеть, из которой пришёл запрос:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Совпадение UA ничего не доказывает само по себе — подделать строку может любой скрипт за пять минут. Решение allow/deny стоит принимать по связке UA + ASN/IP + частота + набор URL, а не по одному заголовку.
robots.txt и ограничение частоты
# Жёсткий запрет
User-agent: copyscape
Disallow: /
# Разрешить всё
User-agent: copyscape
Allow: /
# Компромисс: закрыть чувствительные разделы, оставить публичный контент
User-agent: copyscape
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Публичного заявления о безусловном соблюдении robots.txt у Copyscape нет, поэтому директива — это просьба, а не гарантия. Если бот игнорирует запрет и продолжает обращаться к закрытым разделам, переходите к жёсткой блокировке на уровне веб-сервера или TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "copyscape") {
return 403;
}
limit_req_zone $binary_remote_addr zone=copyscape:10m rate=10r/m;
location / {
if ($http_user_agent ~* "copyscape") {
limit_req zone=copyscape burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} copyscape [NC]
RewriteRule ^ - [F,L]
TrafficVeil: найдите copyscape в списке ботов домена или в разделе /system/bots. Если польза от бота вам не нужна — переключите категорию на «запретить»; если визиты редкие и не мешают — оставьте в «легитимных» без вмешательства; при регулярной, но небольшой нагрузке достаточно мягкого rate-limit вместо полной блокировки. После изменения правила сверьте логи за сутки: хиты copyscape должны уйти в лимит или блок, а трафик Googlebot и YandexBot остаться нетронутым.
С кем можно перепутать Copyscape
Ближе всего по назначению стоит TurnitinBot — официальный краулер академического сервиса Turnitin, тоже проверяющего тексты на совпадения, но с принципиально другой механикой.
| Бот | Назначение | Принцип работы |
| Copyscape | Проверка текста на плагиат для владельцев контента | Точечная сверка по запросу или расписанию Copysentry, поиск через Google |
| TurnitinBot | Проверка студенческих работ на совпадения с открытым вебом | Системный обход публичного контента для пополнения собственной сравнительной базы, официально соблюдает robots.txt |
| Спуфер под именем copyscape | Маскировка под легитимный сервис | Любой скрипт-скрапер с поддельным UA — отличить можно только по ASN/IP и поведению, не по заголовку |
Практический вывод: TurnitinBot системно обходит сайт по расписанию своей академической базы и не имеет отношения к Copyscape, а любая строка UA с текстом copyscape, идущая из подозрительного дата-центрового ASN с поведением агрессивного скрапера, — вероятный спуфинг, а не настоящий сервис.
Что в итоге делать с Copyscape
| Ситуация | Действие |
| Визиты редкие, объём небольшой, ASN совпадает с ожидаемым | Оставить allow, отдельно закрыть /admin /cart /checkout /account /api |
| Бот мешает нагрузкой или задевает служебные разделы | Rate-limit на nginx/TrafficVeil, затем полный запрет при повторении |
| Подозрение на подделку UA (нетипичный ASN, поведение скрапера) | Не доверять заголовку — проверять IP/ASN, при подтверждении спуфинга — блокировать как обычного вредоносного бота |
| Нежелателен в принципе (например, чтобы избежать лишнего внимания к контенту) | Disallow + запрет в TrafficVeil |
Не режьте широким правилом User-agent: * — так легко случайно закрыть доступ Googlebot и YandexBot вместе с copyscape. Блокировка самого Copyscape почти не влияет на классическое SEO в Google и Яндексе: она лишь ограничивает возможность стороннего сравнения вашего текста с чужим через этот конкретный сервис.
Правда ли, что Copyscape собирает тексты для обучения нейросетей?
Нет — по официальному описанию сервиса Copyscape ищет совпадения через Google на правах партнёра и не формирует обучающую выборку для языковых моделей.
Чем Copyscape отличается от классических SEO-краулеров вроде Screaming Frog или Ahrefs?
Screaming Frog и Ahrefs системно обходят весь сайт ради технического аудита и анализа ссылок, а визит Copyscape точечный и привязан к конкретной проверке текста на совпадения.
Стоит ли сразу блокировать Copyscape широким правилом User-agent: *?
Нет, широкое правило рискует случайно закрыть доступ и другим легитимным ботам, поэтому разумнее прописать точечную директиву именно для строки copyscape.
Как часто автоматический мониторинг Copysentry обходит сайт?
Тариф Standard проверяет закреплённые страницы раз в неделю, а Professional — ежедневно, и эта разница обычно объясняет разную частоту визитов бота в логах разных сайтов.
Может ли частый заход Copyscape означать, что сайт взломан или заражён?
Сам по себе визит этого бота не говорит о взломе — он лишь ищет текстовые совпадения, а поводом для тревоги должен быть не факт визита, а аномальный объём запросов или обращение к служебным разделам.
Что делать, если Copyscape нашёл копию контента на чужом сайте?
Инструмент только показывает совпадение и не определяет, кто автор оригинала, поэтому дальнейшие шаги — сравнение дат публикации и обращение к владельцу сайта или его хостингу — пользователь предпринимает самостоятельно.