TrafficVeil
Боты 6 мин13 августа 2026 г.

AI21 Labs в логах: реальная компания, неподтверждённый краулер

Разбираем токен AI21 Labs — принадлежит реальной и серьёзной израильской AI-компании, но без official-документации собственного краулера, в отличие от GPTBot или ClaudeBot. Показываем, почему репутация компании не заменяет верификацию, и как настроить allow/deny.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое AI21 Labs
  2. 2. Зачем AI21 Labs приходит на сайт
  3. 3. Нагрузка и риски именно для AI21 Labs
  4. 4. Как найти AI21 Labs в логах
  5. 5. robots.txt для AI21 Labs
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с AI21 Labs
  8. 8. С кем не путать AI21 Labs
  9. 9. Стратегия allow/deny для AI21 Labs
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Если фильтровать access.log по ai21 labs, часто всплывает целый пласт машинных хитов — это и есть AI21 Labs. В отличие от многих соседей по категории «AI и LLM-краулеры», здесь хотя бы название компании реальное и известное: AI21 Labs — израильская AI-компания (Тель-Авив, основана в 2017 году), стоящая за моделями Jurassic-1, Jurassic-2, инструментом Wordtune и открытой моделью Jamba (2024). Но реальность компании — это не то же самое, что подтверждённое существование краулера под этим именем.

1. Что такое AI21 Labs

AI21 Labs — серьёзный игрок в AI-индустрии: компанию основали Йоав Шохам, Ори Гошен и Амнон Шашуа (последний также известен как основатель Mobileye), в августе 2023 года AI21 закрыла раунд Series C на $155 млн с участием Nvidia среди инвесторов. В отличие от многих обобщённых токенов в этой энциклопедии, здесь есть настоящая компания с настоящими продуктами. Проблема в другом: в открытых, хорошо поддерживаемых реестрах AI-краулеров (например, GitHub-проект ai-robots-txt/ai.robots.txt, который специально собирает задокументированные AI-краулеры со ссылками на первоисточники) явного упоминания собственного краулера AI21 Labs с таким UA не встретилось — в отличие от, скажем, GPTBot, ClaudeBot или PerplexityBot, у которых есть официальные страницы именно про краулер.

Название AI21 Labs
User-Agent / паттерн ai21 labs
Оператор Компания реальная — AI21 Labs, Тель-Авив, с 2017 года; но подтверждения, что именно эта компания официально управляет краулером под таким UA, не найдено
Роль По шаблону категории — наполнение AI-индекса или обучающей/retrieval-выборки; но без first-party документации от AI21 Labs нельзя подтвердить, что это официальный краулер компании, а не что-то ещё, использующее её имя
Документация / ориентир ai21.com — сайт компании существует и это реальный бизнес, но отдельной страницы про краулер для вебмастеров, подобной документации OpenAI или Anthropic про их боты, не обнаружено
Список IP ❌ Официального списка нет
robots.txt Поведение не задокументировано официально — для сравнения, у крупных AI-компаний вроде OpenAI и Anthropic это прямо прописано, здесь такой страницы нет
Пометка TrafficVeil Легитимный / AI и LLM-краулеры — присвоено по шаблону категории; сама компания реальна, но её прямая связь именно с этим краулер-трафиком не подтверждена

2. Зачем AI21 Labs приходит на сайт

Шаблонное объяснение категории — визиты чаще связаны с наполнением AI-индекса или обучающей/retrieval-выборки. Это правдоподобно в общем смысле: AI21 Labs как серьёзная AI-компания вполне может собирать данные для своих моделей (Jurassic, Jamba). Но раз официальной документации именно про краулер нет, нельзя быть уверенным, что весь трафик с этим UA — действительно их официальная инфраструктура, а не имитация: реальное и хорошо узнаваемое имя компании — удобное прикрытие для маскировки менее благовидного трафика, как и в случае с другими узнаваемыми AI-брендами.

  • Какие зоны чаще трогает: /blog/, /product/, /category/, /news/, /api/ (если открыто), пагинация каталога;
  • Что ищет: контент, метаданные, availability или ссылочный граф — конкретная цель не подтверждена официальной документацией;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.

Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует ai21 labs на пагинации и карточках. Прежде чем расслабленно ставить allow «раз это известная и уважаемая AI-компания», стоит вспомнить: репутация компании не переносится автоматически на конкретный UA без first-party подтверждения, что именно этот трафик — их официальный краулер.

3. Нагрузка и риски именно для AI21 Labs

Отдельной строки в публичной сводке top-bot TrafficVeil у ai21 labs может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: риск отдать уникальные тексты, описания товаров и статьи в чужой AI-контур без кликов и атрибуции. Для этого токена стоит добавить конкретный практический риск: из-за отсутствия official-документации сложнее оценить, стоит ли за конкретным визитом настоящая инфраструктура AI21 Labs или кто-то, использующий её узнаваемое имя.

4. Как найти AI21 Labs в логах

Не ищите «просто ботов» — ищите конкретный токен ai21 labs и обязательно смотрите полную строку UA целиком.

# Базовый поиск
grep -i "ai21 labs" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "ai21 labs" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "ai21 labs" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ai21 labs" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить полную строку UA — есть ли ссылка на ai21.com
grep -io "ai21[^\"]*" /var/log/nginx/access.log | sort -u | head

# Сравнить с настоящими, официально документированными AI-краулерами
grep -iE "gptbot|claudebot|perplexitybot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт, и здесь это особенно вероятно: узнаваемое имя реальной, уважаемой компании снижает подозрительность у невнимательного наблюдателя. Официального списка IP нет. Обязательно смотрите полную строку UA целиком на предмет ссылки на ai21.com — у настоящих документированных AI-краулеров такая ссылка есть всегда.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для AI21 Labs

# Жёсткий запрет
User-agent: ai21 labs
Disallow: /

# Разрешить всё
User-agent: ai21 labs
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ai21 labs
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow или 403 для ai21 labs, если пользы нет. Поскольку официальной страницы про соблюдение robots.txt от AI21 Labs не найдено (в отличие, например, от OpenAI или Anthropic, у которых такая документация есть), не рассчитывайте на предсказуемое поведение — если агент игнорирует правило, переходите к nginx/Apache или запрету в TrafficVeil.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ai21 labs") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=ai21labs:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "ai21 labs") {
        limit_req zone=ai21labs burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ai21 labs [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите ai21 labs в ботах домена или в /system/bots;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
  • Allow только при явной, подтверждённой пользе — и не полагайтесь на репутацию компании как на автоматическую гарантию подлинности конкретного трафика;
  • После изменения сверьте логи: хиты ai21 labs должны уйти в блок или лимит, а нужные поисковики остаться.

7. Рекомендации: что делать с AI21 Labs

  • Если пользы нет — Disallow/403 для ai21 labs, если пользы нет;
  • Если польза есть — Allow только при явной пользе от AI21 Labs;
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: скорее всего потеряете цитирования/упоминания в AI-ответах этого оператора, но разгрузите origin и сохраните контент; при этом полной уверенности, что блокируемый трафик — действительно официальная инфраструктура AI21 Labs, а не имитация, у вас нет.

8. С кем не путать AI21 Labs

Бот / сосед Кластер UA Комментарий
GPTBot AI и LLM-краулеры gptbot официально документированный краулер OpenAI, есть first-party страница
ClaudeBot AI и LLM-краулеры claudebot официально документированный краулер Anthropic
PerplexityBot AI и LLM-краулеры perplexitybot официально документированный поисковый краулер Perplexity
AI Article Writer AI и LLM-краулеры ai article writer обобщённый токен без реальной компании за именем вообще
AI Dungeon AI и LLM-краулеры ai dungeon реальный продукт (Latitude), но тоже без подтверждённого краулера под этим именем

9. Стратегия allow/deny для AI21 Labs

Ситуация Действие
Нужна подтверждённая польза, полная строка UA ссылается на ai21.com Allow точечно, с дополнительной верификацией
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен доступ, но пики по ночам Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Повышенное — узнаваемое имя реальной компании без официальной документации краулера скорее повод для проверки, чем для доверия

Частые вопросы

AI21 Labs — реальная компания или выдуманное имя?

Реальная — израильский разработчик AI-моделей (Jurassic, Jamba), основан в 2017 году, привлёк $155 млн в раунде Series C с участием Nvidia.

Значит ли это, что боту можно доверять?

Не автоматически — реальность компании не то же самое, что подтверждённое существование именно её официального краулера под этим UA, а такой документации не нашлось.

Чем это отличается от GPTBot или ClaudeBot?

У GPTBot и ClaudeBot есть официальные first-party страницы конкретно про краулер и его поведение — у AI21 Labs такой публичной страницы для вебмастеров не найдено.

Как проверить, действительно ли это трафик AI21 Labs?

Смотреть полную строку User-Agent целиком — ссылка на официальный домен ai21.com станет куда более сильным сигналом, чем сам по себе узнаваемый бренд.

Стоит ли по умолчанию блокировать этот токен?

Да, при отсутствии дополнительной верификации это разумный default — как и для других AI-токенов без официальной документации краулера.

Что теряет сайт при блокировке?

Вероятно, потенциальные цитирования в продуктах AI21 Labs, если трафик действительно их — но без official-подтверждения оценить эту потерю сложно.

#AI21 Labs#Jurassic#Jamba#AI-краулеры#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.