Боты4 мин чтения·12 августа 2026 г.

TextCortex: enterprise AI-платформа, которая не тренирует свою модель — значит, вряд ли собирает сырьё для обучения

TextCortex — известная B2B-платформа для интеграции AI-агентов в рабочие процессы компаний с оценкой 4,9/5 и GDPR-инфраструктурой в ЕС, которая подключает чужие модели (Claude, GPT, Gemini), а не тренирует собственную. Разбираем, почему это делает версию о системном сборе обучающего сырья маловероятной с самого начала, и что более правдоподобно объясняет обращения бота к сторонним сайтам.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота TextCortex: легитимный ai и llm-краулеры

TextCortex — не безымянный «AI и LLM-краулер», а известная на рынке enterprise-платформа для интеграции ИИ в рабочие процессы компаний: сервис с оценкой 4,9 из 5 при более чем 1500 отзывах, GDPR-совместимой инфраструктурой в ЕС и визуальным конструктором AI-агентов без необходимости писать код. Платформа явно не строит собственную базовую языковую модель — она подключает целый набор сторонних LLM (Claude, GPT, Gemini и другие) от Anthropic, OpenAI, Mistral и Google, позволяя клиентам работать с их же данными и базой знаний через единый интерфейс.

Что вероятнее всего объясняет обход сторонних сайтов

Ключевая функциональность TextCortex, судя по описанию продукта, — не генерация текста «из ниоткуда», а работа поверх собственных данных и знаний конкретного клиента: интеграция с корпоративной базой знаний, автоматизация workflow, создание, например, RFP-агента, который составляет коммерческие предложения на основе документов компании. Логичное продолжение такой модели — возможность подключить внешний источник (конкретный URL или веб-страницу) как часть базы знаний конкретного пользователя или агента, чтобы AI-модель могла ссылаться на актуальную информацию оттуда при генерации ответа. Это тот же паттерн, что уже разбирался для нескольких инструментов в этой серии (Rytr, Outwrite, Klaviyo-подобные сценарии): обращение к конкретной странице происходит по факту действия конкретного пользователя, подключающего источник к своему рабочему процессу, а не ради системного накопления обучающего корпуса для базовой модели, которую компания сама и не разрабатывает.

Параметры бота

Параметр Значение
User-Agent / паттерн textcortex
Оператор TextCortex — enterprise-платформа для интеграции AI-агентов в рабочие процессы компаний
Продукт AI-ассистент для письма (Zeno), конструктор AI-агентов без кода, интеграция с корпоративной базой знаний, браузерное расширение
Используемые модели Сторонние LLM от Anthropic, OpenAI, Mistral и Google — компания не разрабатывает и не тренирует собственную базовую модель
Вероятная причина обхода сторонних сайтов Подключение внешнего URL как источника знаний для конкретного пользователя или AI-агента — по запросу, а не системным сбором впрок
Официальная документация краулера ❌ Отдельной публичной страницы с политикой именно веб-краулера не найдено
Список IP-адресов ❌ Отсутствует

Почему исходная классификация «сырьё для AI-пайплайна» неточна

Поскольку TextCortex сама не тренирует базовую языковую модель, а лишь подключает чужие модели поверх данных клиента, версия о системном накоплении контента как обучающего сырья для собственной LLM здесь маловероятна с самого начала — компании попросту незачем строить такой корпус для модели, которую она не разрабатывает. Куда правдоподобнее, что обращения к сайтам — результат того, что кто-то из пользователей платформы указал конкретный URL как источник данных для своего AI-агента или ассистента.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как проверить эту гипотезу по своим логам

# Базовый поиск
grep -i "textcortex" /var/log/nginx/access.log

# Точечные обращения или системный обход?
grep -i "textcortex" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Единичные, разрозненные обращения к конкретным страницам без глубокого прохода по всему каталогу соответствуют гипотезе о точечном подключении источника пользователем; заметный, регулярный и широкий обход — повод пересмотреть эту версию.

Стоит ли блокировать

  • если гипотеза о точечном подключении верна, присутствие бота — нейтральный факт: кто-то из корпоративных пользователей платформы сослался на страницу сайта как на источник данных для своего рабочего процесса;
  • если объём запросов заметен и нежелателен независимо от причины — блокировка не несёт последствий для видимости в поисковых системах;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.

Как заблокировать

Стандартный запрет через robots.txt:

User-agent: textcortex
Disallow: /

Поскольку официального подтверждения соблюдения robots.txt для этого агента не найдено, для надёжности запрет стоит продублировать на уровне сервера:

if ($http_user_agent ~* "textcortex") {
    return 403;
}

Если полный запрет избыточен при небольшом точечном объёме, разумная альтернатива — ограничение частоты:

limit_req_zone $binary_remote_addr zone=textcortex:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "textcortex") {
        limit_req zone=textcortex burst=20 nodelay;
    }
}

Частые вопросы

Чем это отличается от типичного обучающего AI-краулера?
Обращение к странице происходит по факту действия конкретного пользователя, подключающего источник, а не ради системного накопления обучающего корпуса.
TextCortex собирает данные для обучения собственной AI-модели?
Маловероятно — компания не разрабатывает свою базовую модель, а подключает сторонние LLM от Anthropic, OpenAI, Mistral и Google поверх данных клиента.
Зачем тогда боту вообще заходить на сторонние сайты?
Вероятнее всего, кто-то из корпоративных пользователей платформы указал конкретный URL как источник знаний для своего AI-агента или ассистента.
Как проверить эту гипотезу по своим логам?
Единичные обращения к разным страницам без глубокого прохода по каталогу соответствуют версии о точечном подключении; широкий регулярный обход — повод для большей осторожности.
Соблюдает ли TextCortex правила robots.txt?
Официального подтверждения не найдено, поэтому для надёжности запрет стоит дублировать на уровне сервера.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, этот бот не связан с индексацией Google, Bing или Яндекса.
#textcortex#enterprise AI#AI-агенты#Zeno#бот-энциклопедия#robots.txt#verification#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil