Embedly — редкий случай в этой энциклопедии, где черновик изначально указал верного оператора: это действительно сервис компании A Medium Corporation (владельца платформы Medium), приобретённый у стартапа Embed.ly в 2016 году. В отличие от многих похожих по функции сервисов вроде AddThis, Embedly не закрыт — он активен и обслуживается по сей день, а его клиентами в разное время были The New York Times, NPR, The Guardian, Reddit и Airbnb.
1. Что такое Embedly на самом деле
Embed.ly (компания, стоящая за сервисом) была основана в Бостоне в 2010 году Артом Гибсоном и Шоном Крили; в августе 2016 года её приобрела A Medium Corporation. Продукт превращает URL в готовый встраиваемый контент по спецификации oEmbed — то есть по ссылке на YouTube, Flickr, Twitter/X и десятки других источников формирует HTML-код для встраивания видео, изображения или поста прямо на странице издателя. Отдельный продукт Extract работает как более мощная версия Embed — извлекает более полные метаданные и контент со страницы.
Официальный User-Agent сервиса:
Mozilla/5.0 (compatible; Embedly/0.2; +http://support.embed.ly/)
По собственным данным компании на момент сделки с Medium, сервис обрабатывал порядка 500 миллионов API-запросов в месяц. Функционально Embedly работает как fetcher метаданных и превью — та же логика, что у Facebook External Hit или Twitterbot, только результат обычно используется не соцсетью напрямую, а сторонним издателем или приложением, которое подключило Embedly для отображения rich-контента у себя.
| Параметр | Значение |
| Название | Embedly |
| Оператор | A Medium Corporation (владелец платформы Medium) — приобрела Embed.ly, Inc. в августе 2016 года |
| Роль | Извлечение метаданных и построение embed-контента по спецификации oEmbed для сторонних издателей и приложений |
| User-Agent / паттерн | Embedly/0.2; +http://support.embed.ly/ |
| Актуальный статус | Активен — официальная документация и статус-страница сервиса обновляются по настоящее время |
| Известные клиенты (исторически) | The New York Times, NPR, The Guardian, Reddit, Airbnb, Disqus, Microsoft, MSNBC, AOL, The Atlantic |
| robots.txt | Прямых данных о гарантированном соблюдении не найдено |
| Пометка TrafficVeil | Легитимный / Прочие краулеры и сервисы — вероятно, точнее звучало бы «Превью ссылок в соцсетях», см. раздел 8 |
2. Зачем Embedly приходит на сайт
- пользователь стороннего приложения или сайта-издателя, интегрировавшего Embedly, вставил ссылку на вашу страницу — сервис забирает метаданные (заголовок, описание, изображение, при необходимости видео/аудио-встройку) для построения rich-превью;
- издатель, использующий Extract, может извлекать более полное содержимое страницы, а не только базовые OG-теги;
- как и у большинства unfurl-fetcher-ов, обращение обычно точечное и привязано к конкретному действию пользователя стороннего сервиса, а не к системному обходу сайта целиком.
Типичный кейс: разовый или редкий запрос к конкретному URL сразу после того, как на него кто-то сослался в приложении или на сайте, использующем Embedly для встраивания rich-контента — механика та же, что у Facebook External Hit, просто с другим конечным потребителем данных.
3. Нагрузка и риски
Нагрузка обычно минимальна и коррелирует с тем, насколько часто ваши ссылки встраиваются через сервисы-клиенты Embedly. Практический риск при блокировке стандартный для fetcher-ов такого типа: если сторонние сайты или приложения пытаются встроить контент с вашей страницы через Embedly, а доступ закрыт, у пользователей этих сервисов вместо rich-превью появится обычная голая ссылка или сообщение об ошибке встраивания.
Поскольку Embedly также предлагает продукт Extract с более глубоким извлечением контента, а не только метатегов для карточки, стоит учитывать чуть более широкий потенциальный охват данных по сравнению с классическими превью-ботами — если это принципиально важно, разумно periodически проверять, какие именно URL запрашиваются.
4. Как найти Embedly в логах
# Базовый поиск
grep -i "embedly" /var/log/nginx/access.log
# Топ URL, которые вычитывает сервис
grep -i "embedly" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "embedly" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность — ожидаемо эпизодическая, привязанная к встраиваниям, а не системный фон
grep -i "embedly" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов не найдено — для решения allow/deny смотрите связку UA + IP/ASN + характерный разовый паттерн запроса, типичный для fetcher-ов превью:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Embedly
# Жёсткий запрет
User-agent: Embedly
Disallow: /
# Разрешить всё — рекомендуемый вариант по умолчанию
User-agent: Embedly
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку доступной для встраивания
User-agent: Embedly
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "embedly") {
return 403;
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} embedly [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите embedly в разделе ботов домена или в /system/bots;
- для подавляющего большинства сайтов — allow обоснован по умолчанию: нагрузка минимальна, а блокировка мешает корректному отображению вашего контента при встраивании на сторонних платформах;
- причины для deny здесь скорее исключение — например, принципиальный отказ от встраивания контента на сторонних площадках;
- после изменения сверьте логи: хиты должны уйти в блок, а нужные поисковики остаться без изменений.
7. Что делать: короткий алгоритм
- Стандартная рекомендация — allow: нагрузка минимальна, а корректное встраивание контента на сторонних площадках может приносить дополнительную видимость и трафик;
- Специально блокировать имеет смысл только в редких сценариях — например, если сайт принципиально не хочет, чтобы его контент встраивался где-либо ещё;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. Открытый вопрос по категоризации
Стоит рассмотреть перенос Embedly из общей категории «Прочие краулеры и сервисы» в «Превью ссылок в соцсетях» — по функции это классический unfurl/oEmbed fetcher, той же природы, что Facebook External Hit, LMArenaUnfurlBot и BufferLinkPreviewBot, уже размеченные в этой категории.
| Бот / сосед | Кластер | Комментарий |
| Facebook External Hit | Превью ссылок в соцсетях | Та же механика unfurl, но для другой платформы |
| BufferLinkPreviewBot | Превью ссылок в соцсетях | Тот же тип fetcher-а для другого сервиса |
| AddThis.com | Прочие краулеры и сервисы (см. отдельную статью) | Похожая историческая функция (виджеты шеринга/встраивания), но сервис закрыт Oracle в 2023 году — в отличие от активного Embedly |
| LMArenaUnfurlBot | Превью ссылок в соцсетях | Тот же тип fetcher-а для другой платформы |
9. Стратегия allow/deny для Embedly
| Ситуация | Действие |
| Стандартный сайт без особых ограничений | Allow — минимальная нагрузка, потенциальная польза от видимости при встраивании |
| Принципиальный отказ от встраивания на сторонних площадках | Disallow — редкий осознанный сценарий |
| Важна разница между Embed и более глубоким Extract | Мониторить конкретные запрашиваемые URL и глубину извлекаемых данных |
| Подозрение на spoofing UA | Не доверять строке UA целиком; смотреть IP/ASN и разовый характер запроса |