Instapaper — сервис «сохрани, чтобы прочитать позже», прямой аналог уже закрытого Pocket из этой серии, но, в отличие от него, по-прежнему действующий. Официальное имя краулера — Instaparser, и его задача узкая и понятная: когда пользователь Instapaper сохраняет статью в свой аккаунт, бот заходит на эту страницу, чтобы извлечь и очистить содержимое для комфортного офлайн-чтения — без рекламы, навигационных элементов и другого визуального шума исходного сайта.
Неожиданный поворот: технология извлечения контента стала отдельным коммерческим продуктом
Любопытная деталь, которая отличает эту историю от большинства других ботов этой серии: наработанная за более чем десятилетие технология парсинга и очистки контента, изначально созданная для внутренних нужд Instapaper, была выделена в отдельный публичный API-продукт — Instaparser (instaparser.com). Сегодня разработчики могут подключаться к этому API напрямую, чтобы получать чистый, структурированный текст статьи по ссылке для собственных задач: например, для предварительной очистки длинных материалов перед передачей их в LLM, для итогового суммирования через отдельный Summary API, или для интеграции через готовый узел n8n прямо в Notion, Airtable или векторную базу данных. То есть бот, который изначально работал только «внутри» сервиса чтения статей, теперь обслуживает две параллельные задачи — оригинальное приложение Instapaper и отдельный коммерческий API для разработчиков.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | instapaper; официальное имя технологии — Instaparser |
| Оператор | Instapaper — сервис чтения статей офлайн; технология также предлагается отдельно как API instaparser.com |
| Назначение | Извлечение и очистка содержимого статьи (текст без рекламы и навигации) — для приложения Instapaper по факту сохранения статьи пользователем, а также как отдельный сервис для сторонних разработчиков через API |
| Тип запроса в приложении | Точечный, привязанный к моменту, когда конкретный пользователь сохраняет конкретную страницу, — не системный обход сайта |
| Тип запроса через API | Может инициироваться любым сторонним разработчиком, подключившим instaparser.com для собственных задач извлечения контента — то есть не обязательно связан с самим приложением Instapaper |
| Официальная документация краулера | ❌ Отдельной публичной страницы про политику именно веб-краулера Instapaper (в отличие от документации самого API-продукта) не найдено |
| Список IP-адресов | ❌ Отсутствует |
Почему это меняет практическую оценку по сравнению с шаблоном «сервисный агент, польза не указана»
Двойное назначение технологии — важная деталь для оценки. Если запрос пришёл в рамках оригинального приложения Instapaper — это классический пользовательский fetch, аналогичный уже разобранным PocketParser (пока сервис ещё существовал) или redditbot: разовое, инициированное конкретным человеком действие. Но если тот же токен используется через API-продукт instaparser.com, обращение может быть частью совершенно постороннего, не связанного с сервисом чтения статей проекта — например, чьего-то конвейера подготовки данных для LLM. Оба сценария остаются легитимными по своей природе (сайт не подвергается скрытому массовому скрапингу), но стоит понимать, что за одним токеном сегодня могут стоять два разных класса задач.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
grep -i "instapaper" /var/log/nginx/access.log
# Точечные обращения к конкретным URL
grep -i "instapaper" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Стоит ли блокировать
- если сайт заинтересован в том, чтобы читатели могли сохранять его статьи для офлайн-чтения через Instapaper (что типично для качественного лонгрид-контента и блогов), — бота стоит оставить разрешённым;
- если сайт не заинтересован в участии ни в приложении Instapaper, ни в стороннем использовании через API instaparser.com — блокировка не несёт значимых последствий, кроме того что читатели, попытавшиеся сохранить страницу, получат неполный или пустой результат;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.
Как настроить доступ
Явное разрешение:
User-agent: instapaper
Allow: /
Стандартный запрет с дублированием на уровне сервера, если присутствие бота нежелательно:
User-agent: instapaper
Disallow: /
if ($http_user_agent ~* "instapaper") {
return 403;
}Частые вопросы
Instapaper всё ещё существует, в отличие от Pocket?
Как официально называется краулер этого сервиса?
Что за отдельный API-продукт связан с этим ботом?
Значит ли это, что запросы под этим токеном могут не иметь отношения к приложению Instapaper?
Стоит ли блокировать бота, если сайт публикует качественный лонгрид-контент?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.