TrafficVeil
Боты 5 мин24 августа 2026 г.

MistralAI-User: живой запрос из Le Chat, не краулер

mistralai-user маркируют как нежелательный AI-краулер, хотя это официальный агент Mistral AI, который забирает страницу по запросу реального пользователя Le Chat. Разбираемся, почему блокировка режет только реферальный трафик.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое MistralAI-User на самом деле
  2. Зачем MistralAI-User приходит на сайт
  3. Почему пометка «нежелательный» здесь ошибочна
  4. Как найти MistralAI-User в логах
  5. robots.txt и блокировка через TrafficVeil
  6. Что в итоге делать с MistralAI-User
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Строка mistralai-user в базах помечена «нежелательный» с рекомендацией сразу блокировать или жёстко резать rate-limit — это прямая ошибка. Официальная документация Mistral AI (docs.mistral.ai) прямо описывает этот агент как разовый пользовательский фетчер, который явно не используется для обучения моделей, — по назначению он ближе к ChatGPT-User или Claude-User, чем к обучающим краулерам вроде GPTBot или CCBot.

Что такое MistralAI-User на самом деле

MistralAI-User — официальный агент ассистента Le Chat от французской компании Mistral AI: он забирает конкретную страницу в реальном времени, когда пользователь Le Chat задаёт вопрос, требующий актуальной информации из интернета, и может включить кликабельную ссылку-цитату на источник прямо в ответ. У самой Mistral AI нет отдельного крупного обучающего краулера под собственным именем — компания в основном опирается на открытые корпусы вроде Common Crawl (CCBot) и лицензированные данные, а не на масштабный веб-краулинг под собственным брендом.

Параметр Значение
Название MistralAI-User
User-Agent / паттерн Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-User/1.0; +https://docs.mistral.ai/robots)
Оператор Mistral AI — официально задокументировано на docs.mistral.ai
Категория TrafficVeil Пользовательский AI-фетчер ассистента Le Chat (не обучающий краулер и не «сырьё для AI-продукта»)
Что делает на сайте Забирает одну конкретную страницу в ответ на реальный запрос пользователя Le Chat, которому нужны актуальные данные
Использование для обучения AI По официальному описанию — не используется; обучающие данные Mistral идут в основном через Common Crawl (CCBot) и лицензированные источники
Список IP ✅ Официально публикуется по адресу mistral.ai/mistralai-user-ips.json
robots.txt Официально задокументировано соблюдение директив под именем MistralAI-User; поддержка Crawl-delay не документирована
Пометка TrafficVeil Легитимный — блокировка не влияет на SEO, но лишает сайт шанса на цитирование и переходы из Le Chat

Зачем MistralAI-User приходит на сайт

Визит происходит не по расписанию системного обхода, а в момент реального пользовательского запроса: человек спрашивает у Le Chat что-то, требующее свежих данных с конкретного сайта, и агент точечно забирает нужную страницу, чтобы дать актуальный ответ — часто со ссылкой-цитатой обратно на источник, что создаёт прямой канал реферального трафика.

Почему пометка «нежелательный» здесь ошибочна

MistralAI-User — не источник фонового шума и не сборщик данных «про запас»: каждый визит — это, по сути, прямой запрос конкретного пользователя, которому ваш сайт мог дать полезный ответ через Le Chat. Блокировка не защищает контент от обучающего использования (эта роль у Mistral в основном лежит на CCBot), а лишает бизнес шанса быть процитированным и получить переход по ссылке в момент реального интереса пользователя.

Как найти MistralAI-User в логах

# Базовый поиск
grep -i "mistralai-user" /var/log/nginx/access.log

# Какие страницы запрашивались (обычно единичные, по конкретному запросу)
grep -i "mistralai-user" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP — сверяем с официальным списком Mistral
grep -i "mistralai-user" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

Для верификации сравните IP с официальным JSON-списком (mistral.ai/mistralai-user-ips.json), а не только с UA — заголовок легко подделать:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"

robots.txt и блокировка через TrafficVeil

# Разрешить (рекомендуется, если важна видимость и цитирования в Le Chat)
User-agent: MistralAI-User
Allow: /

# Точечно закрыть чувствительные разделы
User-agent: MistralAI-User
Disallow: /admin/
Disallow: /account/
Allow: /

TrafficVeil: для большинства сайтов разумный вариант — allow без rate-limit: нагрузка от точечных пользовательских запросов минимальна, а потенциальная выгода (цитирование и переход по ссылке из Le Chat) реальна. Учтите также отдельно CCBot (Common Crawl) — именно он, а не MistralAI-User, определяет присутствие сайта в обучающих данных, которые может использовать Mistral.

Что в итоге делать с MistralAI-User

Ситуация Действие
Стандартный случай — важна видимость и цитирования в Le Chat Allow, без rate-limit
Важно контролировать именно обучающее использование контента Mistral Настраивать политику для CCBot, а не для MistralAI-User
Принципиально не нужно никакое участие в экосистеме Mistral Точечный Disallow под именем MistralAI-User
Подозрение на спуфинг UA Сверять IP с официальным JSON-списком Mistral, а не доверять строке UA

Частые вопросы

Правда ли, что MistralAI-User собирает контент для обучения моделей Mistral?

Нет, по официальной документации Mistral AI этот агент не используется для обучения — за обучающие данные в основном отвечает Common Crawl (CCBot), а не MistralAI-User.

Что произойдёт, если заблокировать MistralAI-User?

Сайт перестанет попадать в ответы Le Chat со ссылками-цитатами на источник — это режет реферальный трафик, а не защищает контент от обучающего использования.

Какой бот тогда реально важен, если беспокоит именно обучение моделей Mistral?

CCBot — краулер Common Crawl, чей корпус используется как одна из основ обучающих данных Mistral, в отличие от MistralAI-User.

Публикует ли Mistral AI официальный список IP для этого агента?

Да, список доступен в формате JSON по адресу mistral.ai/mistralai-user-ips.json — редкость среди подобных ботов.

Соблюдает ли MistralAI-User правила robots.txt?

Да, это официально задокументировано, хотя поддержка директивы Crawl-delay отдельно не подтверждена.

Чем MistralAI-User похож на ChatGPT-User или Claude-User?

Все три — пользовательские AI-фетчеры: забирают одну страницу по запросу живого человека в диалоге, а не ведут системный сбор данных для обучения.

#MistralAI-User#боты#краулеры#антибот#Mistral AI#Le Chat#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

MistralAI-User в логах: что это и как настроить