Que es eso del robots.txt

ROBOTS TXT

No es el de la guerra de las galaxias, ese era C3PO.

¿Que es?

Imaginate que internet es un campo de cultivo y todas las webs son lechugas.
Los buscadores(google, Lycos, yahoo, msn etc) son los recolectores que tienen herramientas (programas robots) y de vez en cuando se dan una vueltecita por el huerto y recolectan....¿Que recolectan? las lechugas (los ficheros robots .txt) .que tu previamente has instalado en tu web

Esta breve introduccion es para los de mi pueblo, para vosotros que estais mas espabilaos (en temas de cultivo a lo mejor no) os dire que de la informacion que he ido recopilando he sacado en conclusion lo siguiente:

Son archivos de texto con la extension .txt.
Los buscadores se sirven de programas robots que le permiten leer, recuperar y guardar el contenido de una pagina. Estos robots estan continuamente rastreando webs y saltando de enlace en enlace. Su labor es muy util pero tambien puede perjudicarnos al indexar algunas paginas de contenido temporal o que no deseamos que indexen.

Podemos dar instrucciones a estos robots para que hagan una cosa u otra utilizando este tipo de archivos que incluiremos en el directorio raiz de nuestra web.

¿Como?

Mediante el archivo que vamos a crear "robots.txt".

Cuando un robot llega a tu pagina, lo primero que hace es dirigirse al archivo http://www.tudominio/robots.txt. y comprobar si existe algun tipo de restriccion o no.

Si no tienes este archivo creado, entiende que puede indexar todo el contenido de tu web y asi lo hace.

¿Como se crea y que reglas utiliza?

Abres el bloc de notas y escribes en el documento lo que te indico en los siguientes casos, despues los guardas como robots.txt

Varios casos que se pueden dar:

- Primero un caso en el que se prohiben a todos los buscadores indexar tu pagina y su contenido:

(esto es lo que va dentro del archivo de texto que debes crear)

User-agent: *.....(aqui se indica el robot al que se hace referencia)(el * incluye a todos los buscadores)

Disallow: /....... (aqui el directorio o subdirectorio que quieres bloquear)(la / indica que se refiere a todo el directorio de la pagina)

- Segundo caso, en el que prohibimos que google indexe nuestro sitio pero el resto de buscadores no:

(esto es lo que va dentro del archivo de texto que debes crear)
User-agent: Googlebot
Disallow : /

- Tercer caso, se prohibe el acceso al robot de google y se permite a todos los demas el acceso excepto al directorio señalado

(esto es lo que va dentro del archivo de texto que debes crear)
User-agent: Googlebot
Disallow : /
User-agent: *
Disallow: /mipaginawuay/ejercicios.html

- Cuarto caso, todos los robots tienen prohibido el acceso a los directorios reseñados:

(esto es lo que va dentro del archivo de texto que debes crear)
User-agent: *
Disallow: /cgi-bin/
Disallow: /tmp/
Disallow: /borrador/

Quinto caso, no existe ninguna restricción, asi que todos los robots indexaran tu sitio:

(esto es lo que va dentro del archivo de texto que debes crear)
User-agent: *
Disallow :

(este es el caso que normalmente se va a utizar)


¿Puedo ponerle la extension que quiera?

NO.Su extension debe de ser robots.txt y asi debes de guardarlo

¿Cuantos archivos robots se pueden poner?

Solo uno por sitio.

¿Porque es importante y en que te va a ayudar?

Porque facilita la busqueda a los buscadores, lo recomiendan y ademas sirve para mejorar posicionamiento.

Esto lo he comprobado en una de mis web que por poner un sitemap, un archivo robots.txt y modificar algunas etiquetas como el titulo repetido en varias paginas, me subio de una puntuacion 4 a 7.(esta puntuacion la podeis obtener introduciendo vuestro dominio en la siguiente pagina: http://www.cuwhois.com/index.php )

Ademas otra ventaja es indicar a los buscadores que paginas no deseas que indexen y que por consiguiente no salgan en los resultados de las busquedas que se realizan.

¿En que parte de la web se incrustan?

Pues en el directorio raiz principal de la web, no sirve de nada instalarlos en subdirectorios. Si se tiene que referir a una pagina de un subdirectorio, pues se pone la ruta del mismo ycon eso basta.

Debes subirlo al servidor igual que subes los demas archivos.


¿Existen otros metodos?

Si. Usando las etiquetas metas que conocemos

<META name="ROBOTS" content="NOINDEX">
Con las siguientes posibilidades: ALL, INDEX, NOFOLLOW, NOINDEX

(Estas etiquetas debes ponerlas en todas tus paginas).

¿Te tocara la loteria en Navidad?

Pues eso ya no lo se, ojala nos toque a todos, por lo menos en salud.

Consejos:
No abusar de las restricciones, cuantas mas paginas de indexen mejor
Recordar respetar mayusculas, minusculas
Utilizar el bloc de notas para generarlo


Sigo con la mia de estar abierto a cualquier tipo de sugerencia o modificacion de la informacion que facilito porque no soy ningun experto y seguro que en algo me equivoco (esto seguro que lo lee Foley que sabe mas que yo de posicionamiento).

---.Saludos.---
Vaya, exelente tutorial, lo entendi perfectamente a pesar de que es algo que nunca vi ni lo utilice. Ahora ya se un poco mas sobre los bot, muchas gracias por este aporte :D
Me resulto muy util. Saludos.
KenLego escribió:Vaya, exelente tutorial, lo entendi perfectamente a pesar de que es algo que nunca vi ni lo utilice. Ahora ya se un poco mas sobre los bot, muchas gracias por este aporte :D
Me resulto muy util. Saludos.

Si ayuda y amplia conocimientos, me doy por satisfecho y me pongo con otro tutorial para generar una pagina que sustituya la 404 de error y evitar penalizaciones de los buscadores. Ya sufri un penalizacion en una subpagina y duele.

---.Saludos.---
Hola kike,
hola a tod@s.


Kike,inportante ésta información. Comentas, si no existe robots.txt google entenderá que no hay restricciónes, é indexará todo el contenido.
Que cambia, si tienes, y con
User-Agent: *
Allow: /

, o no lo tienes???
En los dos casos indexará todo el contenido, no..???
Aconsejas generar un archivo robots.txt, si ya dispongo de (un ejemlo) <meta name="robots" content="index,follow" />.???

kimapa escribió:Consejos:
No abusar de las restricciones, cuantas mas paginas de indexen mejor
Recordar respetar mayusculas, minusculas
Utilizar el bloc de notas para generarlo

<meta name="keywords" content=""> aquí colocaremos palabras clave.
Hay algo que me llama la atención, en algunos sitios las palabras clave las comienzan con la mayúscula, y en otros no, ejemplo;

<meta name="keywords" content="Información, Actualidad, Noticias">
Otros sitios;
<meta name="keywords" content="información, áctualidad, noticias">

Que opinais de éste ejemplo, tiene alguna importancia???
Es a esto a lo que haces referencia Kike????

Bueno, son mis unas de mis dudas.


saludos manmanu
Hola Manu:

Mi opinion (muy discutible).

Tando el archivo de robots txt como el sitemap xml, lo que hacen es facilitar el acceso de los robots a tu web, vamos darle el trabajo mascado y rapido.

Imaginate que tu eres un buscador de nueva creacion que se llama goomanu y que una de las web que vas a ojear es un centro comercial y cada subpagina una tienda distinta.

Bien, pues goomanu, llega a la puerta de la web (centro comercial) y en vez de tener que ir pagina por pagina (tiendas) lo que se va a encontrar va a ser un directorio que le va a decir la disponibilidad de cada pagina (tienda), si esta cerrada o abierta de un solo vistazo, con lo cual ira al grano directamente, a las paginas y tipos de archivo que va a poder indexar.

Bueno, volviendo a la realidad, estos archivos de todas maneras no ordenan, solo recomiendan, los robots haran lo que quieran de todas maneras. Lo cierto es que son practicas muy recomendas y poco usadas.

Con los metas vas indicando pagina por pagina lo que puede hacer el buscador, con el robots indicas directamente que paginas o archivos estan restringidos de golpe.


Cambiando de tema, en cuanto a la inclusion de letras mayusculas en las keys, no creo que tenga mayor importancia. Ademas ten en cuenta que debido al mal uso que se les dio en su dia por parte de los webmaster, estas etiquetas quedaron casi obsoletas o casi ignoradas al menos por google. En los tiempos actuales se les da mas importancia a la etiqueta <title> <h1> (para titulos) y <h2> (para subtitulos).

Lo de respetar mayuscula y minusculas me referia a la hora de escribir estas instrucciones:
User-agent: *
Disallow: /cgi-bin/
Disallow: /tmp/
Disallow: /borrador/

Un secreto: yo utilizo metas y robots a la vez para los buscadores y hasta ahora no me dieron conflicto.

Como siempre, estoy abierto a todo tipo de correccion.


---.Saludos.---
gracias el tutorial muy util
una duda fui a unas de las paginas yenre mi robot pero luego me dic en una pagianque tengo pa er como esta mi web que no tiene robot se u se tiene que hacer un archivo txt perocomo sy muy novata es pagi que debe star talmente vacia solo conel robot o debe tener las etiquetas <head head> y demas
y ota cota en las etiquetas meta ue signifca ALL e INDEX
sugarchic escribió:gracias el tutorial muy util
una duda fui a unas de las paginas yenre mi robot pero luego me dic en una pagianque tengo pa er como esta mi web que no tiene robot se u se tiene que hacer un archivo txt perocomo sy muy novata es pagi que debe star talmente vacia solo conel robot o debe tener las etiquetas <head head> y demas
y ota cota en las etiquetas meta ue signifca ALL e INDEX

El archivo robots.txt lo tienes que hacer tu a menos que sea un blog.

El archivo es individual y tienes que subirlo a la raiz del sitio. No es una pagina html.

Lo que se coloca entre el <head> y </head> son las meta que en el caso que preguntas sobre ALL y INDEX son instrucciones para el robot:

<META name="robots" content="aqui pondríamos la instrucción para el robots que puede ser INDEX,NOINDEX,ALL,FOLLOW,NOFOLLOW,ODP, NOODP,YDIR,NOYDIR,SNIPPET,NOSNIPPET,ARCHIVE,NOARCHIVE ">

---.Saludos.---
Astonmartin escribió:Yo tenía ese archivo, pero en singular (robot.txt) y vacío.

Muy agradecido.

Hola amigo:
Me alegro que te haya servido para rectificar el pequeño error que tenias, por otra parte muy común.

---.Saludos.---
Me ha parecido una iformacion muy bien explicada y facil de entender, ademas de util.

Yo tengo una pregunta, nunca hehecho un archivo de sitemap ni robot.txt. al archivo sitemap no se ni como se hace, ya que mis webs son de las que voy aumentado las paginas y nunca termino de hacer el site map. mirare por ahi como hacer uno.

el robot.txt... no lo hehecho por que no se me ocurre ninguna razon por la que no querria que me indexaran.

Podrias darme razones por las que no interesa que nos indexen? gracias.


PD: eres scout? yo tb jeje
Mikel L escribió:Me ha parecido una iformacion muy bien explicada y facil de entender, ademas de util.

Yo tengo una pregunta, nunca hehecho un archivo de sitemap ni robot.txt. al archivo sitemap no se ni como se hace, ya que mis webs son de las que voy aumentado las paginas y nunca termino de hacer el site map. mirare por ahi como hacer uno.

el robot.txt... no lo hehecho por que no se me ocurre ninguna razon por la que no querria que me indexaran.

Podrías darme razones por las que no interesa que nos indexen? gracias.


PD: eres scout? yo tb jeje

Hola:

Tanto el sitemap como el robots son archivos que facilitan el trabajo a los buscadores y puntuan mejor el tenerlo que el no tenerlos.

La idea es hacer un sitemap y subirlo a la raiz principal y si actualizas constantemente la web, modificarlo cada cierto tiempo.

No quiere decir que no vas a ser indexado pero digamos que tendran menos dificultad a la hora de hacer su trabajo.

El archivo robots si no excluye nada puedes hacer uno basico:
User-Agent: *
Allow: /

Con el dices que todos los robots tienen permitido el acceso a toda tu web

De como hacer esto tienes informacion en el foro o en la pagina de mi firma.

Pd. La flor de lis la use por su significado, digamos que siempre me he sentido un poco scout.

Saludos
entonces, aunque no tengamos "nada que esconder" a los buscadores, es mejor ponerlo para confirmarles que todo es rastreable. oki!

Kimapa te mande un MP
Yo no he añadido ningún archivo robot a mi página y, sin embargo, google la indexa muy a menudo, yo diria que casi todos los dias, porque cambia de posición. Puede ser porque renuevo el contenido constantemente y añado contenido??
Pues después de ver tu pagina, esa no es la razón, lo que pasa es que tu pagina esta recibiendo visitas constante mente, además que la pagina principal que es un sub dominio, recibe muchas visitas de google debido a que hay paginas grandes alojadas en ese servidor y pues así lo hace, además como tienes google maps google analiza tu web mas rápido,

Ahora con esto no me refiero a que el echo de que la actualices constante no ayude, solo que no es la única razón, recuerda que el robot de Google para posicionar paginas webs utiliza una ecuación demasiado larga y complicada, debido a que calcula muchos factores.

PD: ley en otro post tuyo que pagando te posicionan mejor, pues lamento decirte que esto es una fantasía, ninguna compañía de seó (posicionamiento) puede asegurarte las primeras posiciones en Google debido a que el robot de Google es el que decide nadie mas, asi que ellos solo pueden arreglar la pagina para optimizar el seo pero no te garantizan nada.

Además si buscas anime o manga en Google las primeras serian anime id y animextremist, estas dos por experiencia se que jama san pagado seo (anime id si pago una compañía de seo pero es fue reciente), la razón que estén de primeras, no es mas que por el contenido es extremadamente grande. Las cantidad de visitas, y el echo de que Meiji (el eb master) a configurado el seo el solo

Así que en resumen el posicionamiento prácticamente es un juego de poker, en el cual nunca sabes que va a pasar.
Aunque no corresponde a este post, pero no veo donde consultarlo, os agradeceria me aconsejarais que es lo que hago mal, para que, consultando mi web, quede constancia de que esta escrita en dos idiomas, castellano=español y valenciano y ya lo he intentado varias veces, pero sigue apareciendo que no se indica el idioma......(Tengo algunas sospechas....pero necesito confirmarlo....)

WWW.NELOCACTUS.ORG
Y aprovechando...no tengo ninguna prohibicion de indexacion, pero ¿creeis que es mejor explicitamente ponerlo?
No se olviden de que en el robots.txt se puede indicar también la dirección XML del sitemap, yo por ejemplo en el sitio de mi firma fiuxy.com lo tengo así:

Sitemap: http://www.fiuxy.com/sitemap_index.xml.gz

User-agent: *
Disallow: /ajax.php
Disallow: /cron.php
Disallow: /editpost.php
Disallow: /global.php
Disallow: /inlinemod.php
Disallow: /joinrequests.php
Disallow: /login.php
Disallow: /mobilelogin.php
Disallow: /misc.php
Disallow: /calendar.php
Disallow: /faq.php
Disallow: /moderator.php
Disallow: /newattachment.php
Disallow: /newreply.php
Disallow: /newthread.php
Disallow: /online.php
Disallow: /postings.php
Disallow: /private.php
Disallow: /register.php
Disallow: /registrarse.php
Disallow: /report.php
Disallow: /reputation.php
Disallow: /search.php
Disallow: /showgroups.php
Disallow: /showpost.php
Disallow: /subscription.php
Disallow: /threadrate.php
Disallow: /usercp.php
Disallow: /usernote.php
Disallow: /vbseocp.php
Disallow: /ayuda/
Disallow: /calendar/
Disallow: /contactenos/

Google interpreta perfectamente la URL del sitemap al igual que Bing y ayuda mucho a su posicionamiento.

Cualquier duda me comentan.