Строка deepai в логах легко принять за очередного «сборщика сырья для обучения нейросети» — тем более что категория AI-краулеров у всех на слуху. Но DeepAI — это не безымянный оператор обучающего корпуса, а конкретная, довольно давно существующая компания с собственным продуктом. Разбираемся, что стоит за этим именем и почему причина визита, скорее всего, совсем не та, что предполагает шаблон «AI и LLM-краулеры».
Что такое DeepAI на самом деле
DeepAI.org — сервис, запущенный в 2016 году основателем Кевином Барагоной в Сан-Франциско: одним из первых предложил онлайн-генерацию изображений по тексту, а сейчас предлагает целый набор AI-инструментов — генерацию и редактирование изображений, апскейл, колоризацию, а также текстовый генератор с доступом по REST API. У текстового генератора DeepAI есть режим «Online Mode», который умеет обращаться к живому интернету за актуальными данными для ответа пользователю — это ключевая деталь для понимания, зачем бот вообще может заходить на посторонние сайты.
| Параметр | Значение |
| Название | DeepAI |
| User-Agent / паттерн | deepai |
| Оператор | DeepAI.org — сервис AI-инструментов (генерация изображений и текста), с 2016 года |
| Категория TrafficVeil | Вероятный пользовательский AI-фетчер (не подтверждённый массовый обучающий краулер) |
| Наиболее вероятная причина визита | Запрос пользователя DeepAI в режиме «Online Mode», которому нужны актуальные данные с конкретной страницы для ответа |
| Список IP | ❌ Публичного списка нет; проверяйте ASN и поведение |
| robots.txt | Отдельной технической документации по краулеру компания не публикует |
| Пометка TrafficVeil | Легитимный, но с оговоркой — официального подтверждения механики визита от DeepAI нет |
Честная оговорка: в отличие от GPTBot или ClaudeBot, у DeepAI нет публичной страницы, документирующей собственного краулера. Поэтому «наиболее вероятная причина» — обоснованный вывод из устройства продукта (текстовый генератор с функцией живого веб-поиска), а не подтверждённый факт.
Почему тревога «контент утечёт в чужой AI-контур» здесь, скорее всего, преувеличена
DeepAI не заявляет себя оператором масштабного обучающего краулера вроде GPTBot или CCBot, которые системно проходят интернет ради корпуса для тренировки модели. Единственная задокументированная функция, которая объясняет обращение к внешним сайтам, — режим реального времени в текстовом генераторе: пользователь задаёт вопрос, требующий актуальных данных, и сервис точечно подгружает конкретную страницу для ответа, — тот же принцип, что у ChatGPT-User или Perplexity-User, а не у бота, методично собирающего весь сайт про запас.
Как найти DeepAI в логах
# Базовый поиск
grep -i "deepai" /var/log/nginx/access.log
# Какие страницы запрашивались
grep -i "deepai" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -i "deepai" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
Официального списка IP нет, поэтому верификация особенно важна:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
Точечные, разрозненные по времени запросы к отдельным страницам соответствуют гипотезе о пользовательском триггере через Online Mode. Плотный, регулярный обход множества URL подряд — сигнал сверить IP отдельно, прежде чем считать источник тем самым DeepAI.
robots.txt и настройка через TrafficVeil
# Разрешить точечные обращения
User-agent: deepai
Allow: /
# Закрыть чувствительные разделы
User-agent: deepai
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Allow: /
TrafficVeil: при точечном, редком паттерне запросов — allow без rate-limit, поскольку заметной нагрузки такой трафик не создаёт. Переключать на «запретить» стоит, если реальное поведение не соответствует гипотезе про единичный пользовательский запрос — то есть бот обходит сайт системно, а не забирает отдельные страницы по требованию.
С кем можно перепутать DeepAI
| Бот | Тип | Отличие |
| ChatGPT-User, Perplexity-User | Пользовательские AI-фетчеры | Та же механика — обращение к одной странице по запросу живого человека, которому нужен актуальный ответ |
| GPTBot, CCBot, Bytespider | Обучающие краулеры | Системно и массово собирают контент для тренировочного корпуса — DeepAI себя таким оператором не заявляет |
Что в итоге делать с DeepAI
| Ситуация | Действие |
| Визиты редкие, точечные, к отдельным страницам | Allow без rate-limit |
| Поведение похоже на массовый обход, а не единичные запросы | Rate-limit, затем Disallow / запрет в TrafficVeil |
| Принципиально не хочется даже точечного доступа AI-инструментов к сайту | Disallow сразу, без промежуточных шагов |
| Подозрение на спуфинг UA | Сверять по ASN и характеру запросов, а не по одной строке |