К основному содержимому

Как Perplexity следует robots.txt

Автор: Perplexity Support

Perplexity соблюдает директивы robots.txt. Наш краулер, PerplexityBot, не будет индексировать полный или частичный текст любого сайта, который запрещает это через robots.txt. Однако если страница заблокирована, мы все равно можем индексировать домен, заголовок и краткое фактическое резюме.

 

Будет ли мой контент использоваться для обучения ИИ, если я разрешу его отображение в Perplexity?

Нет, PerplexityBot индексирует страницы так же, как и другие поисковые системы. Perplexity не создает базовые модели, поэтому ваш контент не будет использоваться для предобучения ИИ-моделей.

 

Почему я читал, что краулеры Perplexity не соблюдают robots.txt?

Раньше пользователи могли попросить Perplexity кратко изложить определенный URL, даже если он был заблокирован robots.txt. Это позволяло пользователям получить доступ к контенту так, как если бы они сами скопировали и вставили его. Однако эта функция была отключена, чтобы предотвратить злоупотребления.

 

Теперь PerplexityBot сканирует только тот контент, который соответствует robots.txt.

Кроме того, Perplexity сотрудничает со сторонними краулерами, чтобы помогать строить наш поисковый индекс. Мы обновили наши соглашения, чтобы обеспечить соблюдение robots.txt и этими поставщиками, особенно для сайтов новостных издателей.