Articoolo — не безымянный «AI и LLM-краулер», а сервис израильского стартапа Articoolo Research, работающего с 2014 года: небольшая команда (по открытым данным — порядка трёх человек в штате) развивает инструмент автоматической генерации статей, который по короткому набору из двух-пяти ключевых слов пишет готовый текст объёмом до 500 слов. Проект существует достаточно давно и пережил не одну волну более крупных конкурентов на рынке AI-копирайтинга — TechCrunch впервые написал о сервисе ещё в 2016 году, и сервис продолжает работать и обновляться.
Как устроен продукт и зачем ему боту заходить на сторонние сайты
В отличие от чат-ассистентов общего назначения, Articoolo — узкоспециализированный инструмент: пользователь вводит тему в несколько слов, выбирает желаемый объём текста и предпочтение между «лучшей читаемостью» и «повышенной уникальностью», а алгоритм сервиса подбирает релевантные материалы по теме, извлекает применимые ключевые слова и на их основе генерирует связный текст. Помимо создания статей с нуля, сервис умеет переписывать и суммировать уже существующие материалы, а также подбирать подходящие изображения к готовому тексту — и именно эти функции по поиску релевантных материалов и подходящих картинок правдоподобно объясняют, зачем краулеру Articoolo вообще может понадобиться заходить на сторонние сайты: не для построения универсального обучающего датасета, а для точечного исследования конкретной темы в момент, когда пользователь сервиса формирует запрос на статью по этой теме.
Параметры
| Параметр | Значение |
| User-Agent / паттерн | articoolo |
| Оператор | Articoolo Research — израильский стартап, основан в 2014 году |
| Продукт | Генератор статей по ключевым словам, переписывание и суммирование текста, подбор изображений, есть плагин для WordPress и собственный API |
| Модель работы | Пользователь платит за конкретную статью или оформляет подписку (pay-per-article / subscription) — не бесплатный массовый сервис |
| Вероятный триггер обхода | Исследование конкретной темы по запросу пользователя в момент генерации/переписывания статьи, а не системный фоновый обход всего интернета |
| Официальная документация краулера | ❌ Не найдена — компания небольшая, отдельной публичной политики по robots.txt или IP-диапазонам не публикует |
| Список IP-адресов | ❌ Отсутствует |
Стоит ли переносить на этот бот стандартную логику «AI-краулер = риск утечки контента»
Здесь стоит взвесить два обстоятельства одновременно. С одной стороны, конечный продукт Articoolo — платный коммерческий сервис генерации контента, и если бот действительно заимствует формулировки или структуру с чужих страниц при написании статьи для клиента, для владельца исходного сайта это тот же тип риска, что у любого стороннего сборщика контента: используется без клика, атрибуции и компенсации. С другой стороны, судя по описанию продукта, механика скорее ближе к точечному, привязанному к конкретному пользовательскому запросу исследованию темы, чем к систематическому массовому обходу целых разделов сайта ради накопления обучающего датасета — то есть в логах это скорее должно выглядеть как редкие, тематически сфокусированные обращения, а не постоянный фон вычитывания пагинации и карточек.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "articoolo" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "articoolo" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Если в выдаче видно, что бот сфокусирован на нескольких тематически смежных страницах, а не системно проходит весь каталог, — это соответствует модели точечного исследования темы, описанной выше; заметный широкий обход, наоборот, стоит расценивать как отклонение от типичного поведения и повод присмотреться к подлинности запроса.
Как заблокировать
Стандартный запрет через robots.txt:
User-agent: articoolo
Disallow: /
Поскольку официального подтверждения соблюдения robots.txt для этого агента нет, для надёжности запрет стоит продублировать на уровне сервера:
if ($http_user_agent ~* "articoolo") {
return 403;
}
Строку User-Agent в принципе может подделать любой скрипт, а официального списка IP у небольшого оператора нет, поэтому при аномальной активности стоит свериться с ASN конкретных IP через whois — как и с большинством ботов без опубликованного фида. На позиции в поисковой выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.
Частые вопросы
Кто владеет Articoolo?
Чем занимается сервис?
Зачем боту вообще заходить на сторонние сайты?
Чем это отличается от типичного AI-краулера для обучающих датасетов?
Соблюдает ли Articoolo правила robots.txt?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.