TwinAgent — не безымянный «автоматизированный краулер», как описано в общем шаблоне, а официально задокументированный AI-агент компании Twin. В отличие от классических краулеров, которые просто скачивают HTML, TwinAgent использует настоящий браузер, чтобы автономно выполнять многошаговые задачи — по сути, действовать на сайте так, как действовал бы человек, только по инструкции, полученной от пользователя платформы Twin. В каталоге TrafficVeil бот помечен как нежелательный.
Что такое TwinAgent на самом деле
Twin — платформа, которая создаёт автоматизированных «работников» (agentic workers) для выполнения задач через интеграцию с API и управление веб-приложениями посредством браузерной автоматизации. TwinAgent — это и есть тот компонент, который непосредственно заходит на сайты: он визирует страницы как часть выполнения пользовательских workflow, взаимодействует с формами, переходит по многошаговым сценариям и адаптирует поведение в зависимости от содержимого страницы — то есть ведёт себя куда сложнее, чем обычный бот, который просто скачивает и парсит HTML.
Официальная строка UA задокументирована в Cloudflare Radar: TwinAgent/1.0, с признанным правилом robots.txt User-agent: TwinAgent / Disallow: /. Категория бота по классификации известных агентов — «AI Assistant» / AI-агент, а не безликий «сервисный краулер».
| Параметр | Значение |
| Название | TwinAgent |
| User-Agent (токен/паттерн) | twinagent (официальная строка: TwinAgent/1.0) |
| Оператор | Twin (twin.so) — платформа автономных AI-агентов |
| Назначение | Автономное выполнение многошаговых пользовательских задач через браузерную автоматизацию: заполнение форм, навигация, взаимодействие с сайтом |
| Список IP-адресов | ❌ Официального списка не публикуется; проверяйте ASN/поведение и не полагайтесь только на UA |
| Соблюдение robots.txt | Официально признанное правило существует (Cloudflare Radar); фактическое соблюдение стоит проверять по логам конкретного домена |
| Используется для обучения моделей | Не задокументировано явно — назначение агента про выполнение задач, а не сбор обучающих данных |
| Категория TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Как работает TwinAgent
Идентифицируется в access.log по паттерну User-Agent twinagent. В отличие от типовой формулировки «автоматический обход сайта в рамках сервисной/краулерной активности», реальное поведение сложнее: бот, скорее всего, оказался на сайте потому, что его прислал пользователь платформы Twin — либо через ссылку из результатов поиска, либо по прямой инструкции выполнить конкретную задачу, для которой требуется содержимое именно этой страницы. Раз агент использует настоящий браузер и умеет заполнять формы и переходить по многошаговым сценариям, его визит на сайт потенциально включает не только чтение, но и действия — например, попытку пройти регистрацию или заполнить форму, если это часть порученной задачи.
Нагрузка на сервер
На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий, но, учитывая природу агента, стоит проверять не только частоту, но и характер действий:
- рост RPS без роста конверсий;
- попытки взаимодействия с формами или интерактивными элементами — это не типично для обычных краулеров, но ожидаемо для агента с браузерной автоматизацией;
- многошаговые сценарии навигации по сайту, а не просто линейный обход страниц;
- давление на origin CPU и bandwidth при рендеринге полноценного браузера, а не лёгкого HTTP-клиента.
Обнаружение в логах
# Все запросы
grep -i "twinagent" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "twinagent" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "twinagent" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "twinagent" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: User-Agent легко подделать, а официального списка IP у Twin не публикуется. Для критичных решений дополнительно проверяйте IP/ASN, частоту, path-паттерны — и обращайте внимание, есть ли в логах попытки POST-запросов к формам, что нехарактерно для большинства обычных краулеров, но ожидаемо именно для агента с браузерной автоматизацией:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt
# Полная блокировка User-agent: twinagent Disallow: / # Точечное ограничение User-agent: twinagent Disallow: /admin/ Disallow: /cart/ Disallow: /account/ Allow: / # Разрешить полностью User-agent: twinagent Allow: /
Официально признанное правило для этого токена существует и подтверждено в Cloudflare Radar, что повышает шансы на его соблюдение по сравнению с анонимными ботами без документации. Тем не менее для гарантированного контроля — особенно учитывая, что агент способен взаимодействовать с формами, — стоит дополнительно использовать серверные правила или TrafficVeil.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "twinagent") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=twinagent:10m rate=15r/m;
location / {
if ($http_user_agent ~* "twinagent") {
limit_req zone=twinagent burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} twinagent [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- откройте список известных ботов в панели домена или
/system/bots; - найдите twinagent / TwinAgent;
- поставьте категорию «запретить» или оставьте разрешённым согласно политике — с учётом того, что агент способен не только читать, но и взаимодействовать со страницей;
- при необходимости используйте массовые операции allow/deny без правки origin;
- проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
Рекомендации по оптимизации
- В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit;
- учитывайте, что это AI-агент с браузерной автоматизацией, а не простой контентный краулер — при оценке риска смотрите не только на объём трафика, но и на попытки взаимодействия с формами;
- не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- для всплесков чаще достаточно rate-limit вместо полного 403.
Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Сводная таблица стратегии
| Цель сайта | Рекомендация |
| Видимость для AI-агентов, выполняющих задачи пользователей, полезна | Allow / разрешить в TrafficVeil |
| Автоматическое взаимодействие с формами и контентом нежелательно | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Доступ нужен, но беспокоит частота или попытки взаимодействия | Rate-limit вместо полной блокировки |
| Нежелательный бот по базе TrafficVeil | Запретить в /system/bots и контролировать по логам, обращая внимание на POST-запросы к формам |