文档章节

lucene学习2--document和field的作用

明舞
 明舞
发布于 2014/11/14 21:29
字数 479
阅读 26
收藏 0
点赞 0
评论 0
代码主体:
package com.test;

import java.io.File;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.io.IOException;

import org.apache.lucene.analysis.standard.StandardAnalyzer;
import org.apache.lucene.document.Document;
import org.apache.lucene.document.Field;
import org.apache.lucene.index.IndexReader;
import org.apache.lucene.index.IndexWriter;
import org.apache.lucene.index.IndexWriterConfig;
import org.apache.lucene.queryparser.classic.QueryParser;
import org.apache.lucene.search.IndexSearcher;
import org.apache.lucene.search.Query;
import org.apache.lucene.search.ScoreDoc;
import org.apache.lucene.search.TopDocs;
import org.apache.lucene.store.Directory;
import org.apache.lucene.store.FSDirectory;
import org.apache.lucene.util.Version;
import org.apache.lucene.util.packed.PackedInts.Writer;

public class IndexUtil {
	private String[] ids = {"1","2","3","4","5","6"};
    private String[] emails = {"aa@tom.com","bb@edu.com","cc@sina.com","dd@yaho.com","ee@qq.com","ff@163.com"};
    private String[] content = {"welcome to 1 room","welcome to 2 room","welcome to 3 room","welcome to 4 room","welcome to 5 room","welcome to 6 room",};
    private int[]    attachs = {1,4,3,2,5,1}; //模拟附件数量
    private String[] names = {"张三","李四","王五","马六","赵七","刘八"};
    private Directory directory =null;
    public IndexUtil () throws Exception{
    	directory = FSDirectory.open(new File(
				"D:/lucene-file/index02"));
    }
    public void index() throws Exception {
    	IndexWriter writer = null;
    	writer = new IndexWriter(directory, new IndexWriterConfig(Version.LATEST, new StandardAnalyzer(Version.LATEST)));
		Document doc = null;
    	for (int i = 0; i < ids.length; i++) {
    		doc = new Document();
			doc.add(new Field("id", ids[i],Field.Store.YES,Field.Index.NOT_ANALYZED));
			//field.Store.YES的意思是,是不是把该域中的内容完全存储到索引文件当中,方便进行文本的还原。
			//field.Store.NO的意思是,把这个域的内容不存储到索引文件中,但是呢,可以被索引。此时内容无法完全还原。就是无法使用doc.get来还原。一般的搜索引擎也是只显示简介,不会显示所有内容
		    //---------------------------------
			//Field.Index叫做索引选项。  
			//Index.ANALYZED  进行分词和索引,适用于标题和内容
			//Index.NOT_ANALYZED 进行索引,但是不尽兴分词,如身份证号,姓名,ID等,适用于精确搜索
			//Index.ANALYZED_NOT_NORMS 进行分词,但是不存储norms信息,这个norms中包括了创建索引的时间和权值等信息。
			//Index.NOT_ANALYZED_NOT_NORMS 既不进行分词也不存储norms。
			//Index.NO 不进行索引
			doc.add(new Field("email", emails[i],Field.Store.YES,Field.Index.NOT_ANALYZED));
			doc.add(new Field("content", content[i],Field.Store.NO,Field.Index.ANALYZED));
    	    doc.add(new Field("name", names[i],Field.Store.YES,Field.Index.NOT_ANALYZED_NO_NORMS));
    	    writer.addDocument(doc);
    	}
    	if (writer!=null) {
			writer.close();
		}
	}
    public void query() throws Exception{
    	IndexReader indexReader = IndexReader.open(directory);
    	System.out.println("文档数量是-----"+indexReader.numDocs());
    }
}
测试类
package com.junittest;

import static org.junit.Assert.*;

import org.junit.Test;

import com.test.IndexUtil;

public class testIndex {

	@Test
	public void test() throws Exception {
		IndexUtil iUtil = new IndexUtil();
		iUtil.index();
	}
	
	@Test
	public void testquery() throws Exception{
		IndexUtil iUtil = new IndexUtil();
		iUtil.query();
	}

}


© 著作权归作者所有

共有 人打赏支持
明舞
粉丝 227
博文 424
码字总数 516555
作品 0
程序员
Lucene学习笔记

luncene对Document和Field提供了一个可以设置的Boosting参数, 这个参数的用处是告诉lucene, 某些记录更重要,在搜索的时候优先考虑他们 比如在搜索的时候你可能觉得几个门户的网页要比垃圾...

红薯
2008/11/30
1K
3
Lucene学习笔记(二)

import java.io.IOException; import org.apache.lucene.analysis.Analyzer; import org.apache.lucene.analysis.SimpleAnalyzer; import org.apache.lucene.document.Document; import org.......

嗯哼9925
2017/12/26
0
0
Lucene.Net Research

Lucene.Net Research The history of Lucene. 1 What is the Lucene. 1 Lucene.net basic objects. 2 Behind the scenes of indexing. 8 Concurrency rules of Lucene. 10 The history of Lu......

长平狐
2012/08/28
969
1
lucene基础(1)

lucene使用步骤分为两步,一是建立索引,二是搜索索引文档; 一、建立索引 先了解必须的五个基础类; 1、Document:由过个Field组成。相当于数据库的一条记录,Field对象相当于记录的字段; ...

110hxl
2016/10/11
9
1
Lucene学习笔记(一)

建立索引: import java.io.File; import java.io.FileReader; import java.io.IOException; import java.util.Date; import org.apache.lucene.analysis.standard.StandardAnalyzer; import ......

嗯哼9925
2017/12/17
0
0
Lucene教程详解

注明:本文是由本人在开发有关基于lucene资源检索系统时的一点总结,其中一部分是自己根据开发过程自己总结的,也有部分是摘自网络,因无法获取当时摘文的地址,所以在此没有写源地址。 转载...

长平狐
2012/11/12
1K
2
实战 Lucene,第 1 部分: 初识 Lucene

本文首先介绍了 Lucene 的一些基本概念,然后开发了一个应用程序演示了利用 Lucene 建立索引并在该索引上进行搜索的过程。 朋 周登 (zhoudengpeng@yahoo.com.cn), 软件工程师 2006 年 4 月 ...

凡16
2013/09/27
0
0
lucene学习笔记一之初识lucene

承接第一篇的博文所述,建一个lucene的小例子: 开发环境:本人用的IDE是myeclipse10,jdk1.7(开发环境不是硬性要求,只要能运行程序就行) 1.首先我们新建java项目luce_01,在项目目录上点击新建文...

程开华
2014/01/08
0
0
简单的lucene实例

package TestLucene; import java.io.File; import java.io.FileReader; import java.io.Reader; import java.util.Date; import org.apache.lucene.analysis.Analyzer; import org.apache.l......

村长大神
2014/03/27
182
0
Apache Lucene与Lucene.Net——全文检索服务器

lucene学习教程 1.1 什么是lucene Lucene是一个全文搜索框架,而不是应用产品。因此它并不像www.baidu.com 或者google Desktop那么拿来就能用,它只是提供了一种工具让你能实现这些产品。 2 ...

长平狐
2013/01/06
831
1

没有更多内容

加载失败,请刷新页面

加载更多

下一页

shell及python脚本方式登录服务器

一、问题 在工作过程中,经常会遇见需要登录服务器,并且因为安全的原因,需要使用交互的方式登录,而且shell、python在工作中也经常用到,并且可以提供交互的功能。都是利用了expect、spawn...

yangjianzhou
9分钟前
0
0
upstream sent too big header while reading...

nginx 报错:1736 upstream sent too big header while reading response header from upstream 1. 一般处理 location ~ \.php$ { #增加下面两句 fastcgi_buffer_size 128k; ......

dubox
20分钟前
0
0
Python解析配置文件模块:ConfigPhaser

import configparser as pa# [SectionA]# a = aa# b = bb# c = cc# [SectionB]# optionint = 1# optionfloat = 1.1# optionstring = string#https://www.cnblogs.com/a......

易野
26分钟前
0
0
Java基础——面向对象

声明:本栏目所使用的素材都是凯哥学堂VIP学员所写,学员有权匿名,对文章有最终解释权;凯哥学堂旨在促进VIP学员互相学习的基础上公开笔记。 Object的方法: clone() Object 克隆 to Strin...

凯哥学堂
28分钟前
0
0
rabbitmq学习记录(八)消息发布确认机制

RabbitMQ服务器崩了导致的消息数据丢失,已经持久化的消息数据我们可以通过消息持久化来预防。但是,如果消息从生产者发送到vhosts过程中出现了问题,持久化消息数据的方案就无效了。 Rabbit...

人觉非常君
32分钟前
0
0
毕业5年,我是怎么成为年薪30W的运维工程师

#转载# 我在大学读的是计算机专业,但大学毕业之后,进入到一家私企进行工作,工作的内容类似于网管,会经常的去修电脑,去做水晶头等内容。刚开始工作,也没想太多,最想的是丰富自己的工作...

Py爱好
39分钟前
1
0
大数据基础知识,大数据学习,涉及的知识点

一、什么是大数据 一种规模大到在获取、存储、管理、分析方面大大超出了传统数据库软件工具能力范围的数据集合,具有海量的数据规模、快速的数据流 转、多样的数据类型和价值密度低四大特征。...

董黎明
55分钟前
0
0
Linux CentOS 7上安装极点五笔

话说几天前在新买的惠普笔记本上成功地安装了Linux CentOS 7操作系统、Nvidia Quandro P600驱动程序及X Window,并在VMware下安装Red Hat教学环境,彻底跳出Windows的苦海,但仍然有一件事不...

大别阿郎
今天
17
0
2018年7月20日集群课程

一、集群介绍 集群,简单地说是指一组(若干个)相互独立的计算机,利用高速通信网络组成一个较大的计算机服务系统,每个集群节点(即集群中的每台计算机)都是运行各自服务的独立服务器。 ...

人在艹木中
今天
0
0
spark开发机中调试snappy

目的 在Idea中的点击运行,使spark可以直接读取snappy 自己编译hadoop,以支持snappy的压缩。 自己编译的目的就是要得到支持snappy文件读写的动态链接库。如果可以在网上下载,可以跳过自行编...

benny周
今天
0
0

没有更多内容

加载失败,请刷新页面

加载更多

下一页

返回顶部
顶部