Twitterbot — один из самых узнаваемых и однозначно легитимных ботов в этой энциклопедии, но у него есть актуальный на 2026 год нюанс, которого не было в черновике: с мая 2025 года X (бывший Twitter) официально стал дочерней компанией xAI Holdings — той же компании, что разрабатывает языковую модель Grok. Это создаёт новый вопрос, которого не существовало, пока Twitter был независимой платформой: не может ли под тем же UA или с тех же сетей X теперь идти ещё и сбор данных для обучения Grok.
1. Что такое Twitterbot на самом деле
Twitterbot — официальный краулер X для формирования Twitter/X Card: превью-карточки с заголовком, описанием и изображением, которая появляется при публикации ссылки в посте. Официальная строка UA включает версию: Twitterbot/1.0.
По официальной документации X for Developers, Twitterbot реализует спецификацию robots.txt Google — то есть, в отличие от многих других ботов в этой энциклопедии, здесь файл действительно работает штатно, и сама X прямо инструктирует владельцев сайтов добавлять исключение User-agent: Twitterbot при проблемах с отображением карточки. Отдельное техническое требование: краулер X использует TLS v1.1 или выше — устаревшая SSL-конфигурация сайта сама по себе может быть причиной, по которой карточка не формируется, даже без каких-либо блокировок.
| Параметр | Значение |
| Название | Twitterbot |
| Оператор | X (бывший Twitter); с мая 2025 года X формально входит в состав xAI Holdings |
| Роль | Формирование превью-карточки (Card) при публикации ссылки на платформе |
| User-Agent / паттерн | Twitterbot/1.0 |
| robots.txt | Официально реализует спецификацию Google — файл действительно работает, в отличие от многих других записей энциклопедии |
| Верификация по IP | Официального списка IP-адресов X не публикует — это прямо подтверждено в официальном форуме разработчиков X: «нет точной информации об IP краулера Twitterbot» |
| Требование к серверу | TLS v1.1 или выше — иначе краулер не сможет получить доступ к странице |
| Актуальный на 2026 год риск | С учётом вхождения X в xAI, сети X теоретически могут нести и трафик для обучения Grok — отдельного официально задокументированного UA для такого краулинга по состоянию на середину 2026 года нет |
| Пометка TrafficVeil | Легитимный / Превью ссылок в соцсетях |
2. Зачем Twitterbot приходит на сайт
- пользователь X опубликовал или собирается опубликовать ссылку на вашу страницу — краулер получает Open Graph/Twitter Card метатеги для формирования превью;
- Twitter Card Validator — официальный инструмент X для предпросмотра карточки — тоже использует Twitterbot-подобный UA при ручной проверке владельцем сайта;
- кэш карточки истекает примерно через 7 дней, после чего при новом упоминании ссылки бот запрашивает страницу заново.
Типичный кейс: разовый или редкий запрос к конкретному URL сразу после того, как на него кто-то сослался в посте на платформе — стандартное поведение fetcher-а превью, ничем не отличающееся по механике от Facebook External Hit.
3. Нагрузка и риски
Нагрузка минимальна и предсказуема — разовые точечные запросы, привязанные к реальным публикациям на платформе. Практический риск при блокировке стандартный для категории: пользователи, делящиеся вашей ссылкой на X, получат «голую» ссылку без изображения и описания, что снижает click-through по репостам.
Отдельный, более новый риск стоит обозначить явно: поскольку X с 2025 года принадлежит xAI, а официального отдельного UA для краулинга под нужды Grok не задокументировано, теоретически с тех же IP-диапазонов X может идти не только Card-фетчинг, но и сбор данных для обучения модели — под тем же Twitterbot или вовсе под обычным браузерным UA. Если сайт хочет сохранить превью-карточки в X, но обеспокоен потенциальным AI-обучением на своём контенте, блокировка по одному лишь UA Twitterbot эту вторую задачу не решит — потребуется блокировка по диапазонам ASN, принадлежащих X, что затронет и легитимный Card-трафик тоже.
4. Как найти Twitterbot в логах
# Базовый поиск
grep -i "twitterbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "twitterbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "twitterbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "twitterbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка TLS-совместимости (если карточки не формируются)
curl -sv --tlsv1.1 https://ваш-домен/страница 2>&1 | grep -i "SSL connection"
Верификация. Официального списка IP X не публикует — это прямо подтверждено на форуме разработчиков X. Единственный практический путь — сверять запросы с известными ASN, принадлежащими X/Twitter, учитывая, что этот же диапазон сетей мог начать нести дополнительный трафик после интеграции с xAI:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Twitterbot
# Жёсткий запрет — сломает формирование Card-превью
User-agent: Twitterbot
Disallow: /
# Разрешить всё — рекомендуемый вариант по умолчанию, официально задокументирован самой X
User-agent: Twitterbot
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку доступной для карточек
User-agent: Twitterbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "twitterbot") {
return 403;
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} twitterbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите twitterbot в разделе ботов домена или в /system/bots;
- для подавляющего большинства сайтов — allow обоснован по умолчанию: нагрузка минимальна, а блокировка портит отображение ссылок на платформе X;
- если цель — именно ограничить потенциальный AI-training трафик, а не сломать карточки, работайте на уровне ASN X, а не по UA Twitterbot;
- после изменения сверьте логи: хиты должны уйти в блок, а нужные поисковики остаться без изменений.
7. Что делать: короткий алгоритм
- Стандартная рекомендация — allow: нагрузка минимальна, а польза (корректное превью на X) реальна;
- Карточки не формируются, хотя бот не заблокирован — проверьте версию TLS на сервере и валидность og:image/twitter:image, прежде чем подозревать блокировку;
- Беспокоитесь именно об AI-обучении на контенте после интеграции X с xAI — учитывайте, что блокировка по UA не решает эту задачу, нужна работа с ASN;
- Специально блокировать Twitterbot целиком имеет смысл только в редких случаях, когда сайт принципиально не хочет формировать превью для этой платформы;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. С кем не путать Twitterbot
| Бот / сосед | Кластер | Комментарий |
| Facebook External Hit | Превью ссылок в соцсетях | легитимный, та же механика unfurl для другой платформы, но с публикуемым и регулярно обновляемым списком IP — в отличие от X |
| LMArenaUnfurlBot | Превью ссылок в соцсетях | легитимный, UA прямо содержит ссылку на документацию оператора |
| BufferLinkPreviewBot | Превью ссылок в соцсетях | легитимный |
| Grok (потенциальный AI-краулер xAI) | Не задокументирован официально по состоянию на 2026 год | Отдельного публичного UA нет — теоретический трафик может маскироваться под Twitterbot или обычный браузер в сетях X |
9. Стратегия allow/deny для Twitterbot
| Ситуация | Действие |
| Стандартный сайт, нужны корректные превью на X | Allow — минимальная нагрузка, реальная польза |
| Карточки не формируются | Проверить версию TLS и валидность мета-тегов, прежде чем подозревать блокировку |
| Беспокойство об AI-обучении Grok на контенте сайта | Блокировка по UA не решает задачу — рассматривать ограничение по ASN X, с пониманием, что это также затронет Card-фетчинг |
| Принципиальный отказ от присутствия на платформе X | Disallow — осознанный редкий сценарий |
| Подозрение на spoofing UA | Официального способа верификации по IP нет; полагаться на ASN и общий поведенческий паттерн |