XQEngine

开源吧 > JAVA开源项目 > 组件类库 > 搜索引擎

XQEngine用于XML文档的全文本搜索引擎.利用XQuery做为它的前端查询语言.它能够让你查询XML文档集合通过使用关键字的逻辑组合.有点类似于Google与其它搜索引擎搜索HTML文档一样.XQEngine只是一个用Java开发的很紧凑的可嵌入的组件.

【官方主页】

【下载地址】

网友留言/评论

我要留言/评论

相关开源项目

Paoding:Paoding中文分词是一个使用Java开发的，可结合到Lucene应用中的，为互联网、企业内部网使用的中文搜索引擎分词组件。Paoding填补了国内中文分词方面开源组件的空白，致力于此并希翼成为互联网网站首选的中文分词开源组件。Paoding中文分词追求分词的高效率和用户良好体验。

BDDBot:BDDBot是一个简单的易于理解和使用的搜索引擎。它目前在一个文本文件(urls.txt)列出的URL中爬行，将结果保存在一个数据库中。它也支持一个简单的Web服务器，这个服务器接受来自浏览器的查询并返回响应结果。它可以方便地集成到你的Web站点中。

Solandra: Solandra是一个实时分布式搜索引擎，基于Apache Solr和Apache Cassandra构建。其核心，Solandra是Solr与Cassandra的一个紧密集成。这意味着Solr与Cassandra将在单个JVM中同时运行，文档（Documents）采用Cassandra的数据模型进行存储和分发。 1、提供开箱即用的Solr功能包括：搜索、faceting、高亮等。 2、通过Cassandra管理复制，分片，缓存和压缩。 3、Multi-master (可以读写到任何节点)。 4、能够很方便添加新的SolrCores并且不需要重新启动整个集群。

ictclas4j:ictclas4j中文分词系统是sinboy在中科院张华平和刘群老师的研制的FreeICTCLAS的基础上完成的一个java开源分词项目，简化了原分词程序的复杂度，旨在为广大的中文分词爱好者一个更好的学习机会。

Carrot2:Carrot2是一个开源搜索结果分类引擎。它能够自动把搜索结果组织成一些专题分类。Carrot2提供的一个架构能够从各种搜索引擎（YahooAPI、GoogleAPI、MSN Search API、eTools Meta Search、Alexa Web Search、PubMed、OpenSearch、Lucene index、SOLR）获取搜索结果。

imdict-chinese-analyzer:imdict-chinese-analyzer是imdict智能词典的智能中文分词模块，算法基于隐马尔科夫模型(Hidden Markov Model，HMM)，是中国科学院计算技术研究所的ictclas中文分词程序的重新实现（基于Java），可以直接为lucene搜索引擎提供简体中文分词支持。

LIUS:LIUS是一个基于Jakarta Lucene项目的索引框架。LIUS为Lucene添加了对许多文件格式的进行索引功能如：
Ms Word,Ms Excel,Ms PowerPoint,RTF,PDF,XML,HTML,TXT,Open Office序列和JavaBeans。针对JavaBeans的索引特别有用当我们要对数据库进行索引或刚好用户使用持久层ORM技术如：Hibernate,JDO,Torque,TopLink进行开发时。

MG4J:MG4J可以让你为大量的文档集合构建一个被压缩的全文本索引,通过使内插编码(interpolative coding)技术.

起点R3企业级搜索引擎: 起点R3企业级搜索引擎是起点软件提供的企业搜索解决方案，支持企业环境下的数据访问控制（ACL），能够通过定义用户数据访问权限来控制检索数据的安全。
R3是一个强大的,高性能的JAVA企业级搜索引擎产品，R3构建于Solr和Lucene之上，集成了POI、PDFBox和Apache Tika等第三方开源项目，在R3企业级搜索平台上，你可以搜索出你企业所有相关的内容包括网站、邮箱、ECM, CRM。R3使用一中新的集群模式来实现分布式和集群功能，通过扩展计算能力，R3能够支持上千G文档，完成复杂的并行运算；R3能够以集群模式运行来提高系统的可用性。它支持超过15种语言的多语言搜索，能够集成文档自动分类和聚类功能，能够为文档自动、智能的添加标签和关键字。可以通过采集器为索引库定制数据来源，采集器通过插件的方式扩展。默认提供数据库、邮件、本地文件系统、网络文件系统、FTP、Domino、CSV、Access的采集器。R3基于Solr之上，所以在Solr中的层面搜索、同义词等都被完整的保留了下来。R3通过作业调度系统实现了任务的自动化采集、能够增量索引，支持数据更新，能够通过可视化的方式对索引字段进行管理。R3具备用户和用户组管理，R3可以对数据类型定制，支持分词器、过滤器、缓存管理。R3能够很容易的集成Hadoop和HBase。此外它还开发多种编程语言的API包括：Ruby、PHP、Java、Python、JSon、C#、ColdFusion。

mmseg4j:mmseg4j用Chih-Hao Tsai 的MMSeg算法实现的中文分词器，并实现lucene的analyzer和solr的TokenizerFactory以方便在Lucene和Solr中使用。