Saltar al contenido principal

¿Cómo sigue Perplexity robots.txt?

Escrito por Perplexity Support

Perplexity respeta las directivas de robots.txt. Nuestro rastreador, PerplexityBot, no indexará el contenido textual completo ni parcial de ningún sitio que lo desautorice mediante robots.txt. Sin embargo, si una página está bloqueada, aún podemos indexar el dominio, el título y un breve resumen factual.

 

¿Se usará mi contenido para entrenar IA si permito que aparezca en Perplexity?

No, PerplexityBot indexa las páginas de forma similar a otros motores de búsqueda. Perplexity no desarrolla modelos fundacionales, por lo que tu contenido no se utilizará para el preentrenamiento de modelos de IA.

 

¿Por qué he leído que los rastreadores de Perplexity no respetan robots.txt?

Anteriormente, los usuarios podían pedir a Perplexity que resumiera una URL específica, incluso si estaba bloqueada por robots.txt. Esto permitía a los usuarios acceder al contenido como si lo hubieran copiado y pegado ellos mismos. Sin embargo, esta función se ha deshabilitado para evitar un uso indebido.

 

Ahora, PerplexityBot solo rastrea contenido en cumplimiento con robots.txt.

Además, Perplexity colabora con rastreadores de terceros para ayudar a crear nuestro índice de búsqueda. Hemos actualizado nuestros acuerdos para garantizar que estos proveedores también respeten robots.txt, en particular en los sitios de editores de noticias.