---
title: "Crea tu propio rastreador de sitios web, tu copia de Google"
date: "2011-05-24T08:53:07+02:00"
modified: "2019-05-10T18:27:58+02:00"
author: "David Carrero Fdez-Baillo"
section: "Internet y sociedad"
canonical: "https://carrero.es/crea-tu-propio-rastreador-de-sitios-web-tu-copia-de-google/"
site: "Carrero"
---

# Crea tu propio rastreador de sitios web, tu copia de Google

**¿Qué pasará cuando Microsoft Bing se coma definitivamente a Yahoo**? Seguro que herramientas como Site Explorer serán historia y cada se complicará más el uso de herramientas como Advanced Link Manager, en definitiva nos tocará crear nuestra propia araña para indexar y recorrer páginas web sin depender de los grandes buscadores.

Existen hoy muchas opciones para crear nuestro propio *spider*, soluciones de código abierto que son realmente potentes.

**[Nutch](http://lucene.apache.org/nutch/)** es posiblemente la mejor opción para crear tu propia araña o rastreador de páginas web. Este fue construido sobre el concepto de [Lucene](http://lucene.apache.org/java/docs/) (tiene una opción comercial) y soportado por Hadoop usando MapReduce (similar a Google) para grandes volúmenes y consultas de datos. Todos estos están basados en Java, pero existen versiones basadas en .net como [Lucene.NET](http://incubator.apache.org/lucene.net/), [Nutch.NET](http://sourceforge.net/projects/dotnutch) y [Hadoop.NET](http://code.google.com/p/hadoopdotnet/) que han sido portados a C#.

Pero la cosa no queda aquí y aunque Nutch es posiblemente la mejor opción para crear un rastreador y tener tu propio Google o Bing, hay otras opciones que os detallamos en esta pequeña lista:

- [Arachnode](http://arachnode.net/). Basado en C# y .net
- [Scrapy](http://scrapy.org/) es una herramienta rápida para el rastreo de sitio web y extraer datos de la estructura de sus páginas.
- [Heritrix](http://crawler.archive.org/) es un proyecto de rastreo de Internet Archive.
- [ASPseek](http://www.aspseek.org/) es una araña desarrollada por Plesk en C++ aunque abandonado en su desarrollo.
- [Crawler4j](http://code.google.com/p/crawler4j/) es un rastreador de código abierto que proporciona una sencilla interfaz para el rastreo de sitios web.
- [HTTrack](http://www.httrack.com/) es una aplicación gratis y de código abierto para rastrear sitios webs desde tu escritorio y poder navegar offline por las webs.
- [Open Search Server](http://www.open-search-server.com/) es una solución para crear un buscador de código abierto.
- [YaYy](http://yacy.net/es/) otra opción para rastrear y crear un buscador de código abierto y en castellano.
- [Sphider.eu](http://www.sphider.eu/). Un rastreador hecho en PHP.
- ¿Qué es un rastreador web? según [Wikipedia en inglés](http://en.wikipedia.org/wiki/Web_crawler)
- [Más buscadores](http://www.searchtools.com/tools/tools-opensource.html) de código abierto (algunos con rastreadores).

 

---

Fuente: https://carrero.es/crea-tu-propio-rastreador-de-sitios-web-tu-copia-de-google/
