Строка goodreads в логах чаще всего описывают как проверку виджета или webhook при интеграции. Формулировка не совсем точная: Goodreads — крупный, всем известный сервис каталогизации книг и рецензий (с 2013 года принадлежит Amazon), а не абстрактный «оператор не указан публично». Но при этом сама механика визита бота на посторонний сайт документирована слабо — разбираемся, что подтверждено, а что остаётся предположением.
Что такое Goodreads на самом деле
Goodreads — крупнейшая социальная платформа для читателей: каталог книг, рецензии, рейтинги, книжные клубы и профили авторов, принадлежит Amazon. У сервиса есть встраиваемые виджеты (например, виджет автора с его книгами и рейтингом), которые владельцы сайтов и блогов размещают у себя, а также поля в профилях авторов, где можно указать ссылку на личный сайт. Наиболее вероятное объяснение визита бота на посторонний сайт — Goodreads проверяет или подгружает данные по такой указанной ссылке (например, для превью или верификации официального сайта автора), а не системно индексирует контент.
| Параметр | Значение |
| Название | Goodreads |
| User-Agent / паттерн | goodreads |
| Оператор | Goodreads, Inc. — часть Amazon с 2013 года, крупнейшая платформа для читателей |
| Категория TrafficVeil | Вероятная проверка/подгрузка ссылки, указанной пользователем Goodreads (не системный индексирующий краулер) |
| Наиболее вероятная причина визита | Автор или пользователь указал ваш сайт как личную страницу/источник в профиле или рецензии на Goodreads |
| Список IP | ❌ Публичного списка нет; проверяйте ASN и поведение |
| robots.txt | Отдельной технической документации по краулеру, обращающемуся к внешним сайтам, компания не публикует |
| Пометка TrafficVeil | Легитимный, но с оговоркой — официального подтверждения именно этой механики визита от Goodreads нет |
Честная оговорка: у Goodreads нет публичной страницы, документирующей поведение краулера при обращении к внешним сайтам, — большая часть открытой информации о «Goodreads и боты» касается обратной ситуации (сторонние скраперы, забирающие данные с самого Goodreads), а не того, как ведёт себя официальный бот сервиса на чужих сайтах. «Наиболее вероятная причина» — обоснованное предположение, а не подтверждённый факт.
Почему это не проверка виджета в буквальном смысле
Формулировка «подтверждает корректность интеграции от имени пользователя сервиса» слишком узкая: встраиваемые виджеты Goodreads технически работают через JavaScript на стороне браузера читателя, а не через отдельный серверный запрос к вашему сайту. Более правдоподобным выглядит сценарий с проверкой внешней ссылки, указанной в профиле автора или в рецензии, — но и это предположение, а не подтверждённый факт.
Как найти Goodreads в логах
# Базовый поиск
grep -i "goodreads" /var/log/nginx/access.log
# Какие страницы запрашивались
grep -i "goodreads" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -i "goodreads" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
Официального списка IP нет, поэтому верификация особенно важна:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
Единичные, точечные визиты к главной странице или странице «о нас/об авторе» соответствуют гипотезе о проверке ссылки из профиля. Системный обход множества разделов сайта — сигнал сверить IP отдельно.
robots.txt и настройка через TrafficVeil
# Разрешить точечные обращения
User-agent: goodreads
Allow: /
# Закрыть чувствительные разделы
User-agent: goodreads
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Allow: /
TrafficVeil: при редких, точечных визитах — allow без rate-limit, заметной нагрузки такой трафик не создаёт. Для сайтов, связанных с книгами, авторами или издательствами, попадание в экосистему Goodreads обычно скорее полезно (видимость среди читателей), чем нежелательно.
Что в итоге делать с Goodreads
| Ситуация | Действие |
| Визиты редкие, точечные, к главной или авторской странице | Allow без rate-limit |
| Сайт связан с книгами/авторами, важна видимость на Goodreads | Allow — присутствие обычно полезно |
| Поведение похоже на массовый системный обход | Rate-limit, затем Disallow / запрет в TrafficVeil |
| Подозрение на спуфинг UA | Сверять по ASN и характеру запросов, а не по одной строке |