Outwrite — не безымянный «AI и LLM-краулер», а известный на рынке письменных инструментов сервис проверки грамматики и стиля, изначально запущенный под названием GradeProof. Продукт распространяется как расширение для браузера и веб-приложение, интегрируется с Gmail, Google Docs, Microsoft Word, Outlook и WordPress, и, по собственным данным компании, уже помог более чем миллиону студентов, писателей и команд по всему миру улучшить качество текста.
Что делает Outwrite и при чём тут краулер
Основная функциональность сервиса — проверка орфографии, грамматики, пунктуации и стиля, перефразирование предложений, расширение словарного запаса и выявление пассивного залога. Но у продукта есть отдельная, платная функция, которая правдоподобнее всего объясняет присутствие бота в чужих логах: проверка на плагиат. По описанию сервиса, эта функция проверяет оригинальность текста, сравнивая его со всеми доступными в интернете документами, — то есть механически ей необходимо иметь возможность сверяться с реальным содержимым веб-страниц в момент, когда пользователь Pro- или Teams-тарифа запускает такую проверку (в рамках лимита порядка 50 проверок в месяц на этих планах).
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | outwrite |
| Оператор | Outwrite (ранее — GradeProof) — сервис проверки грамматики, стиля и оригинальности текста |
| Продукт | Расширение для браузера и веб-приложение с интеграциями в Gmail, Google Docs, MS Word, Outlook, WordPress, LinkedIn, Facebook |
| Вероятная причина обхода | Функция проверки на плагиат — сравнение текста пользователя с содержимым открытого веба, доступна на платных тарифах с лимитом порядка 50 проверок в месяц |
| Тип запроса | Скорее точечный, привязанный к моменту, когда конкретный пользователь платного тарифа запускает проверку оригинальности своего текста, — а не системный фоновый обход всего интернета для обучения модели |
| Официальная документация краулера | ❌ Не найдена — компания публикует документацию по продукту для конечных пользователей, но не отдельную политику для веб-краулера |
| Список IP-адресов | ❌ Отсутствует |
Почему исходная классификация «AI и LLM-краулер» вводит в заблуждение
Шаблонное описание предполагает, что визит бота связан с наполнением обучающей выборки или retrieval-индекса для генеративной AI-модели. Но по факту функциональности продукта куда правдоподобнее другое объяснение: сервис проверки на плагиат структурно похож на Turnitin или Copyscape — ему нужно уметь на лету свериться с содержимым открытого веба, чтобы определить, не совпадает ли (полностью или частично) проверяемый пользователем текст с уже существующей публикацией. Это принципиально иной тип задачи, чем накопление обучающего корпуса: обращение к конкретной странице происходит по факту сверки, а не ради системного сбора контента впрок.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "outwrite" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "outwrite" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Если запросы выглядят как единичные обращения к конкретным страницам без системного прохода по всему каталогу — это соответствует гипотезе о проверке на плагиат по запросу пользователя; заметный, регулярный и широкий обход всего сайта был бы поводом пересмотреть эту версию.
Стоит ли блокировать
- если гипотеза о плагиат-проверке верна, для владельца сайта присутствие бота — скорее нейтральный факт: чужой пользователь Outwrite сверяет свой текст с содержимым сайта, что не создаёт прямой выгоды, но и не является массовым сбором контента для конкурирующего продукта;
- если объём запросов от бота на конкретном сайте заметен и нежелателен вне зависимости от причины — блокировка не несёт последствий для видимости в поисковых системах;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.
Как заблокировать
Стандартный запрет через robots.txt:
User-agent: outwrite
Disallow: /
Поскольку официального подтверждения соблюдения robots.txt для этого агента не найдено, для надёжности запрет стоит продублировать на уровне сервера:
if ($http_user_agent ~* "outwrite") {
return 403;
}
Если полный запрет кажется избыточным при небольшом объёме точечных запросов, а беспокоит лишь потенциальный рост нагрузки, разумная альтернатива — ограничение частоты вместо жёсткой блокировки:
limit_req_zone $binary_remote_addr zone=outwrite:10m rate=10r/m;
location / {
if ($http_user_agent ~* "outwrite") {
limit_req zone=outwrite burst=20 nodelay;
}
}Частые вопросы
Outwrite собирает данные для обучения AI-моделей?
Зачем тогда боту вообще заходить на сторонние сайты?
Чем это отличается от типичного AI-краулера для обучающих датасетов?
Как отличить это поведение в логах?
Соблюдает ли Outwrite правила robots.txt?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.