Боты4 мин чтения·11 августа 2026 г.

Outwrite: не AI-краулер для обучения моделей, а вероятная сверка на плагиат от сервиса проверки грамматики

Outwrite (ранее GradeProof) — известный сервис проверки грамматики, стиля и оригинальности текста с более чем миллионом пользователей. Разбираем, почему платная функция проверки на плагиат — самое правдоподобное объяснение присутствия бота в чужих логах, и чем это принципиально отличается от системного сбора данных для обучения AI-моделей.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Outwrite: легитимный ai и llm-краулеры

Outwrite — не безымянный «AI и LLM-краулер», а известный на рынке письменных инструментов сервис проверки грамматики и стиля, изначально запущенный под названием GradeProof. Продукт распространяется как расширение для браузера и веб-приложение, интегрируется с Gmail, Google Docs, Microsoft Word, Outlook и WordPress, и, по собственным данным компании, уже помог более чем миллиону студентов, писателей и команд по всему миру улучшить качество текста.

Что делает Outwrite и при чём тут краулер

Основная функциональность сервиса — проверка орфографии, грамматики, пунктуации и стиля, перефразирование предложений, расширение словарного запаса и выявление пассивного залога. Но у продукта есть отдельная, платная функция, которая правдоподобнее всего объясняет присутствие бота в чужих логах: проверка на плагиат. По описанию сервиса, эта функция проверяет оригинальность текста, сравнивая его со всеми доступными в интернете документами, — то есть механически ей необходимо иметь возможность сверяться с реальным содержимым веб-страниц в момент, когда пользователь Pro- или Teams-тарифа запускает такую проверку (в рамках лимита порядка 50 проверок в месяц на этих планах).

Параметры бота

Параметр Значение
User-Agent / паттерн outwrite
Оператор Outwrite (ранее — GradeProof) — сервис проверки грамматики, стиля и оригинальности текста
Продукт Расширение для браузера и веб-приложение с интеграциями в Gmail, Google Docs, MS Word, Outlook, WordPress, LinkedIn, Facebook
Вероятная причина обхода Функция проверки на плагиат — сравнение текста пользователя с содержимым открытого веба, доступна на платных тарифах с лимитом порядка 50 проверок в месяц
Тип запроса Скорее точечный, привязанный к моменту, когда конкретный пользователь платного тарифа запускает проверку оригинальности своего текста, — а не системный фоновый обход всего интернета для обучения модели
Официальная документация краулера ❌ Не найдена — компания публикует документацию по продукту для конечных пользователей, но не отдельную политику для веб-краулера
Список IP-адресов ❌ Отсутствует

Почему исходная классификация «AI и LLM-краулер» вводит в заблуждение

Шаблонное описание предполагает, что визит бота связан с наполнением обучающей выборки или retrieval-индекса для генеративной AI-модели. Но по факту функциональности продукта куда правдоподобнее другое объяснение: сервис проверки на плагиат структурно похож на Turnitin или Copyscape — ему нужно уметь на лету свериться с содержимым открытого веба, чтобы определить, не совпадает ли (полностью или частично) проверяемый пользователем текст с уже существующей публикацией. Это принципиально иной тип задачи, чем накопление обучающего корпуса: обращение к конкретной странице происходит по факту сверки, а не ради системного сбора контента впрок.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти бота в логах

# Базовый поиск
grep -i "outwrite" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "outwrite" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Если запросы выглядят как единичные обращения к конкретным страницам без системного прохода по всему каталогу — это соответствует гипотезе о проверке на плагиат по запросу пользователя; заметный, регулярный и широкий обход всего сайта был бы поводом пересмотреть эту версию.

Стоит ли блокировать

  • если гипотеза о плагиат-проверке верна, для владельца сайта присутствие бота — скорее нейтральный факт: чужой пользователь Outwrite сверяет свой текст с содержимым сайта, что не создаёт прямой выгоды, но и не является массовым сбором контента для конкурирующего продукта;
  • если объём запросов от бота на конкретном сайте заметен и нежелателен вне зависимости от причины — блокировка не несёт последствий для видимости в поисковых системах;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.

Как заблокировать

Стандартный запрет через robots.txt:

User-agent: outwrite
Disallow: /

Поскольку официального подтверждения соблюдения robots.txt для этого агента не найдено, для надёжности запрет стоит продублировать на уровне сервера:

if ($http_user_agent ~* "outwrite") {
    return 403;
}

Если полный запрет кажется избыточным при небольшом объёме точечных запросов, а беспокоит лишь потенциальный рост нагрузки, разумная альтернатива — ограничение частоты вместо жёсткой блокировки:

limit_req_zone $binary_remote_addr zone=outwrite:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "outwrite") {
        limit_req zone=outwrite burst=20 nodelay;
    }
}

Частые вопросы

Outwrite собирает данные для обучения AI-моделей?
Маловероятно — это известный сервис проверки грамматики и стиля с более чем миллионом пользователей, а не безымянный AI-скрапер.
Зачем тогда боту вообще заходить на сторонние сайты?
Наиболее вероятная причина — платная функция проверки на плагиат, которая сверяет текст пользователя с содержимым открытого веба.
Чем это отличается от типичного AI-краулера для обучающих датасетов?
Обращение к странице происходит по факту конкретной проверки пользователя, а не ради системного накопления контента впрок для обучения модели.
Как отличить это поведение в логах?
Единичные обращения к конкретным страницам без системного прохода по всему сайту соответствуют гипотезе о точечной проверке на плагиат.
Соблюдает ли Outwrite правила robots.txt?
Официального подтверждения не найдено, поэтому для надёжности запрет стоит дублировать на уровне сервера.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, этот бот не связан с индексацией Google, Bing или Яндекса.
#outwrite#GradeProof#проверка на плагиат#грамматика#бот-энциклопедия#robots.txt#verification#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil