Релиз поискового движка Apache Nutch 2.0

Организация Apache Software Foundation представила релиз Apache Nutch 2.0 - модульного фреймворка для построения поисковых систем, написанного на языке Java и основанного на технологиях Lucene, Solr, Tika, Hadoop и Gora, адаптированных для специфики поиска в Web (например, поддерживается crawler, база ссылочной связи, парсинг HTML и других форматов). Архитектура Nutch позволяет разработчикам легко создавать плагины для обработки нового медиа-контента, получения данных через нестандартные каналы, для формирования типовых запросов или организации поискового кластера.

В новой версии представлен ряд новых средств для построения высокосасштабируемых систем индексации, абстрагированных от типа хранилища, что позволяет использовать как хранилища для больших объемов данных, такие как Apache Accumulo, Apache Avro, Apache Cassandra, Apache HBase и HDFS, так и SQL-базы и размещаемые в памяти NoSQL БД. На базе Nutch 2.0, запущенного поверх 34-узлового Hadoop-кластера, построен поисковый сервис компании Kalooga, в индексе которого находится более миллиарда страниц.

Источник:
http://www.opennet.ru/opennews/art.shtml?num=34303

<= Назад
Комментарии
]]> ipv6 ready Kiev LUGLinux4MeНостальгияЛичный сайт skeletora ]]>