文档章节

使用lucene来遍历ES中的文档数据

parker
 parker
发布于 2016/12/08 11:36
字数 454
阅读 120
收藏 0

es 1.7.5 中使用的是lucene 4.10, 通过研究其数据结构, 明确其嵌套格式(nested)文档结构.  对于一个分片(目录)中的数据,是一个lucene索引结构,因此可以通过使用lucene api来读取这一个目录中的数据.实际上,在一个lucene索引结构中,不仅有倒排表还有顺序结构.因此我们可以通过某种方式来获取这个目录下面的所有文档完成遍历操作.

顺序结构的文档在lucene4.10中的组织是有规律的,文档id从0开始递增,前排文档的子文档,然后排其子文档对应的主文档. 如果索引子文档的field字段设置store为true.则在子文档所对应的doc id上可以相关值,否则需要在source字段中获取,至于如何解析source字段,本篇文章不做解释.

首先获取fields,然后针对某一个term(_uid)来获取所有文档(每个主文档都有一个唯一的uid).然后根据上面表述的特性就可以获取所有文档相关信息,进行相关处理.如果文档中涉及到删除的操作,需要加载删除数据的集合,然后将文档id进行过滤,剔除掉删除的记录.

        Directory directory = FSDirectory.open(new File(path));
        Lucene40LiveDocsFormat lldf = new Lucene40LiveDocsFormat();
        IOContext context = IOContext.READ;
        SegmentInfos sifs = new SegmentInfos();
        sifs.read(directory);
        Iterator<SegmentCommitInfo> its = sifs.iterator();
        List<Bits> bitss = new ArrayList<Bits>();
        while (its.hasNext()) {
            SegmentCommitInfo info = its.next();
            if (info.hasDeletions())
                bitss.add(lldf.readLiveDocs(directory, info, context));
        }
        // directory.
        IndexReader r = IndexReader.open(directory);
        IndexSearcher is = new IndexSearcher(r);
        Fields fields = MultiFields.getFields(r);
        System.out.println(fields.size());
        Iterator<String> it=fields.iterator();
        while(it.hasNext()){
            System.out.println(it.next());
        }
        System.out.println(fields.terms("commus.interactionIdx").getDocCount());
       
        int count = fields.terms("_uid").getDocCount();
        System.out.println(count);
        for (int i = 0; i < count; i++) {
            Document doc = is.doc(i);
            System.out.println(doc.getFields());
            System.out.println(doc.getField("callId"));
        }
        r.close();

 

© 著作权归作者所有

共有 人打赏支持
parker
粉丝 1
博文 13
码字总数 6310
作品 0
长春
私信 提问
ElasticSearch学习笔记1

es 的来源 问题拆解 如果用数据库来实现会怎么样? 什么是全文检索? 什么是 Lucene? 数据库实现 先看第一个问题,如果我们用数据来实现搜索功能,可能的语句就是对 string 建立索引,或者直...

超级个体颛顼
2017/09/06
0
0
ES内部分片处理机制——Segment

前阵子看了一下es文档中关于shards原理的介绍,于是按照自己的理解总结了一下,基本上是照着原文翻译的,个别部分是按照自己的理解写的。 逆向索引/倒排索引: 与传统的数据库不同,在es中,...

键走偏锋
2017/09/25
0
0
Elasticsearch优化方案

关于Lucene: ApacheLucene将写入索引的所有信息组织成一种倒排索引(Inverted Index)的结构之中,该结构是种将词项映射到文档的数据结构。其工作方式与传统的关系数据库不同,大致来说倒排...

莫问viva
2016/07/05
144
0
Elasticsearch简介

ES是一个高扩展的、开源的、全文检索的搜索引擎,它提供了近实时的索引、搜索、分析功能。Shay Banon是ES奠基者,系统是在Apache Lucene的基础上采用Java实现的。Lucene非常复杂,而ES通过R...

Mr_YangFei
2016/03/17
256
0
Elasticsearch实践指南

http://nginxs.blog.51cto.com/ 从2014年到现在接触ES(Elasticsearch)已经两年多了,感触良多尤其ES的开盒即用特性完全区别于之前接触复杂的hadoop和solor。ES不需要你对它了解就能很快入门...

qq850900633
2017/05/18
0
0

没有更多内容

加载失败,请刷新页面

加载更多

开源软件会被云杀死吗 ?

本文转载云头条,原作者:Michael Stiefel是Reliable Software公司的负责人,是一名软件架构和开发顾问。 文章要点 虽然开源开发不会消失,但商业开源厂商的未来不是很有希望。随着全面管理的...

linuxCool
30分钟前
1
0
OSChina 周三乱弹 —— 谈什么对象?睡什么觉?

Osc乱弹歌单(2018)请戳(这里) 【今日歌曲】 @胖达panda :最肯忘却古人诗,最不屑一顾是相思。分享童丽的单曲《红豆生南国》: 《红豆生南国》- 童丽 手机党少年们想听歌,请使劲儿戳(这...

小小编辑
35分钟前
128
5
stylus

stylus基础教程,stylus实例教程,stylus语法总结

miaojiangmin
今天
3
0
PHP生成CSV之内部换行

当我们使用PHP将采集到的文件内容保存到csv文件时,往往需要将采集内容进行二次过滤处理才能得到需要的内容。比如网页中的换行符,空格符等等。 对于空格等处理起来都比较简单,这里我们单独...

豆花饭烧土豆
今天
2
0
使用 mjml 生成 thymeleaf 邮件框架模板

发邮件算是系统开发的一个基本需求了,不过搞邮件模板实在是件恶心事,估计搞过的同仁都有体会。 得支持多种客户端 支持响应式 疼彻心扉的 outlook 多数客户端只支持 inline 形式的 css 布局...

郁也风
今天
8
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部