@"gongo" said:
allora se metto la stringa sopra google mi indicizza lo stesso il sito ?
Road Back. Non mi sono spiegato (colpa mia).
L'istruzione DISALLOW che metti nel robots.txt, che può riguardare l'intera root del sito, una o più directory e/o uno o più file, dà l'istruzione allo Spider (che di default controlla l'esistenza di questo file) di NON scaricare il contenuto, ossia non indicizzare, del file, o delle directory.
Lo spider tuttavia non "evita" il sito perchè ci arriva tramite link. Ti sarà già capitato di vedere nelle pagine dei risultati di Google dei link formati semplicemente da URL, senza snippet e senza ulteriori riferimenti (senza il link "Copia Cache").
Ecco, quelli sono Url di file o directory protetti da robots.txt, ma di cui il motore è a conoscenza. Lo standard è perfettamente rispettato: non ha scaricato il contenuto di file e directory.
@"gongo" said:
e directory sono invisibili all'utente normale e inacessibili se non tramite password, ma se io le metto nel file robots.txt e un utente qualsiasi lo apre scopre le dir che io voglio nascondere.
E che ti importa?
Se è un utente "normale" non gli cambia la vita sapere che hai una directory che si chiama "/film_divx_backup/" (nome a caso), tanto non ci può entrare.
Se l'utente è un hacker, o un serio malintenzionato, stai pur certo che utilizzerà mezzi più sofisticati della semplice lettura del robots.txt, per bucarti il server ed entrare dove vuole.
Cosa che, ovviamente, non ti auguro
.Stuart