文档章节

手把手,教你用MaxCompute+OpenSearch搭建分布式搜索引擎

阿里云云栖社区
 阿里云云栖社区
发布于 2018/04/13 14:44
字数 1843
阅读 23
收藏 1

摘要: 最近,经常有客户咨询如何低成本搭建高性能的海量数据搜索引擎,比如实现公众号检索、影讯检索等等。由于客户的数据在阿里云上,所以希望找到云上解决方案。笔者开始调研一些云上产品,很多人向我推荐了OpenSearch,所以花了点时间好好研究了下,用过之后发现效果不错,自带分词、云数据库同步功能,在研究过程中也发现了一些问题,分享给大家。

背景

最近,经常有客户咨询如何低成本搭建高性能的海量数据搜索引擎,比如实现公众号检索、影讯检索等等。由于客户的数据在阿里云上,所以希望找到云上解决方案。笔者开始调研一些云上产品,很多人向我推荐了OpenSearch,所以花了点时间好好研究了下,用过之后发现效果不错,自带分词、云数据库同步功能,在研究过程中也发现了一些问题,分享给大家。

接下来,我们开始用阿里云MaxCompute(原名ODPS)和OpenSearch来搭建一个影讯检索的搜索引擎Demo,我有大约10GB数据,服务搭建只用了15分钟,数据同步建索引大概用1个小时。因为选择弹性计费,实验费用大概花了几十元。

先晒一下搜索效果,支持一些常用分词语法,而且OpenSearch自带了丰富的SDK和API,可以很方便的集成到线上业务。

ae51f3deb48f8c54addca03a30292df5e0fe7f93

bb702f23b5eba1fd3bb44ea42328fc68ff1c5312

2a6ed916a2aa672201da5c887051cedd14518278

实验架构图

fb25e292a5a441fbd6cc45d0a668776d4dbaec71

搜索引擎架构在OpenSearch之上,是一个典型的分布式在线实时交互查询架构,无单点故障,高伸缩、高可用,免运维,低成本。对大量信息的索引与搜索都可以在近乎实时的情况下完成,能够快速实时搜索数十亿的文件以及PB级的数据。

分布式数据库架构在MaxCompute之上,是一种快速、完全托管的TB/PB级数据仓库解决方案。MaxCompute向用户提供了完善的数据导入方案以及多种经典的分布式计算模型,能够更快速的解决用户海量数据计算问题,有效降低企业成本,并保障数据安全。

 实验准备工作

1、注册阿里云用户,实名认证并绑定支付宝;
2、开通数加服务;
3、开通MaxCompute、OpenSearch 后付费服务。
 

实验任务

1、用MaxCompute导入公开数据集;

2、用OpenSearch 创建应用,配置数据/索引结构、分词;

3、全量导入数据,构建索引;

4、搜索效果测试。

 

第一步:购买并开通OpenSearch、MaxCompute、大数据开发套件服务

1.1 开通Opensearch服务

访问https://www.aliyun.com/product/opensearch,点击立即开通,选择后付费(按量付费)。

 

9e4c7e6eebeb08e22cb70fdf24277eaabbfbf045

02c55092bc06305ba2c2cdd976799177e7e491c7

1.2 开通MaxCompute&大数据开发套件服务

1.2.1 开通 MaxCompute

阿里云实名认证账号访问https://www.aliyun.com/product/odps ,开通 MaxCompute,选择按量付费进行购买。

e7dedd1539ad9a0ff3d57c9b85cf22644db7f804

787d04aeb0202236f52773b0179613972546c5fd

8030cd2fe902b6f6f463a71e8447d82b664c30a5

1.2.2 创建 MaxCompute project

 进入数加管理控制台,前面开通 MaxCompute 成功页面,点击管理控制台,或者导航产品->大数据(数加)->MaxCompute 点击管理控制台。

80c969013ce3a705f65ab7592e2bb760ff37ce91

创建项目

进入控制台页面后导航至“大数据开发套件->项目列表“,点击”创建项目”,如图所示:

3ff6f030db17264cbcc53dd0457e43c616bed664

在弹出框中选择 I/O 后付费的付费方式,输入项目名称:

e2b9399c6e6f88dd193560c48df57714bafb2661

创建 MaxCompute 表

进入大数据开发套件的数据开发页面,以开发者身份进入阿里云数加平台>大数据开发套件>管理控制台,点击项目列表下对应项目操作栏中的进入工作区。

注意:如果首次使用数加平台,需要先注册数加开通AK。

第二步:通过大数据开发套件导入数据集到MaxCompute

进入大数据开发套件工作区后,我们先导入一份测试数据。

数据说明:笔者这里引用了一份MaxCompute公开数据集(正在公测),地址:https://yq.aliyun.com/articles/89763,目前MaxCompute开放的数据类别包括:股票价格数据,房产信息,影视及其票房数据。所有的数据均被存储在 MaxCompute 产品中的 public_data 项目中。

 

接下来,我们引用一份影视票房数据。

58760e7d99418104208c15552bead5b7d6f0663d

使用非常简单,前提条件是开通MaxCompute&大数据开发套件;

在大数据开发套件中,新建脚本,命名opensearch_demo,在窗口执行如下语句。

add user ALIYUN$everyone;

 

执行完成后用户项目空间下的所有成员均可读取各公开数据集合。

验证一下:

select * from public_data.dwd_product_movie_basic_info  where movie_name like '%生化危机%' limit 10; 

 

6138fe0b265f06125bf01af94d5fa06140ac890e

 

拷贝一份数据到自己的Project项目下,注意:OpenSearch里有主键概念,所以我们需要在MaxCompute中建主键,这里通过UUID函数实现。

在窗口执行如下语句:

 

create table alian.demo_opensearch_case2 as
 
select uuid() as id,* from public_data.dwd_product_movie_basic_info ;

 

95ce1e0266db13d0c11ef13611b6d55d37e2e102

执行成功后,验证一下数据;

select count(1) from alian.demo_opensearch_case2;

 

可以看到数据集已经创建好;

8a81744359c2053c3dd8c6140c9343b7af466bc4

第三步:创建开放搜索应用

3.1 进入OpenSearch控制台,点击“创建应用”

33d64339894598bba2078d5ff48dac051217e413

3.2 选择产品版本,笔者开通的是标准版。如果需要多表关联搜索,请开通高级版,如果是单表查询,标准版就可以。

e57056c89b081df6ae6c2645446dd35334a67e23

3.3 输入应用名称MaxCompute_OpenSearch_Demo,地域选华东1(杭州),因为MaxCompute目前只有华东,否则数据链路不通,点击下一步。

 

624d17c872f0e3aedc25dc79b893d02d5b51ced2

 

3.4 选择“通过数据源方式创建应用结构”。可以快速由源表结构创建出初始的应用结构,节省手动构造的工作量,降低出错概率。

f3c6c889935395d3c0295a3aa0c7f482a34fba76

3.5 选择ODPS,刚才创建的表。

6984ea63794ce034288b222b4e5d8fe0833783c8

 

选择刚才创建的ODPS项目及表demo_opensearch_case2

7fe142bd152dd697e38d6b9e22557bbfd2609b88

【注意】对于ODPS表中的STRING类型需要转换为LITERAL后建主键。

 

470c8839f496bc28d25cb08dae59073e87a40615

 

3.6 配置索引、分词及搜索展示内容

选择movie_name、 director、scriptwriter、area、actors、type、movile_date、movie_language字段做索引,设置默认中文分词方式。

90da8b5ce35b69a020cb7bcc5bbea094e16308ba

添加展示字段,设置搜索结果内容。

dd2ff4fc4d155993dcfde77b6f4fe1eb5add7464

 

3.7 创建完成

 

b06e99cb1f37c3db47f8564e7749279123bfd4c6

fca04a3716533ef6646d0c85468d71313cde16f1

 

第四步:同步数据并创建索引

4.1 激活应用

选择配额及QPS,我们用的数据集大概8G,所以开通的是10G配额,QPS采用默认项。

注意:MaxCompute(原ODPS)的数据是压缩过的,我们用的数据SIZE压缩后2GB,但实际是8GB,笔者之前购买了3GB的OpenSearch配额,结果导入失败。

976f35e7d4da10200b193e8dae901a5cb27abe8e

 

 4.2开始构建索引

这里主要就是等等,笔者等了一个小时。

579ecc5ad30fd129f296847b1eeaff90daa1549f

 

 可以查看索引构建进度550fb684535a837d0604e9a326dbfdf32534951a

第五步:搜索测试

打开应用管理->搜索测试,输入任意影片,比如最近刚上映的摔跤 爸爸,然后自动匹配出相应的影讯信息,完成实验。

MaxCompute提供的数据集很赞,数据量多、新鲜度很高。

bb702f23b5eba1fd3bb44ea42328fc68ff1c5312

总结:到这里,我们就完成了整个实验,OpenSearch+MaxCompute笔者认为还是很方便,非常适合数据规模在100GB以上并且不希望高昂的运维成本和IT成本的企业;

原文链接

© 著作权归作者所有

阿里云云栖社区
粉丝 449
博文 1558
码字总数 3823668
作品 0
朝阳
私信 提问
OceanBase技术直播间开播啦!蚂蚁金服技术专家手把手教你搭建OB数据库~

OceanBase技术直播间是OceanBase为用户和技术爱好者带来的系列技术直播课程,由蚂蚁金服一线技术专家分享最全面的理论知识和最实用的技术实践,内容包含数据库内核系列、手把手实操系列和最佳...

荔子liqi
04/19
0
0
appium 相关内容

appium简明教程(转):http://www.yangyanxing.com/?p=1266 appium使用入门:http://wenku.baidu.com/link?url=J9fpuKe0NPfgtaL4Pgsxog9FhunEYfbq7swk4GvS578f3Outy-19mtLVokVKQ1aKfi2ymrkAZ......

智能小松鼠
2015/10/02
360
0
我想用OSQA搭建一个问答网站,求帮助

我想用OSQA搭建一个问答网站,现在已经有了买了主机和域名,可是下一步不知道怎么办了,谁能够帮帮我?把那个程序汉化一下。?另外就是手把手的教一下我怎么安装程序吧。谢谢各位了。

koyboby
2011/06/17
2.5K
2
ZigBEE

手把手教你学Zigbee第一讲:http://www.tudou.com/programs/view/fQattIYSwBo/ 手把手教你学Zigbee第二讲:http://www.tudou.com/programs/view/7-dIvUgk2kg/ 手把手教你学Zigbee第三讲:htt...

GIFCOOL
2016/09/02
86
0
jenkins 学习资料汇总

1.使用Jenkins配置自动化构建(http://blog.csdn.net/littlechang/article/details/8642149) 2.MAC上搭建Jenkins + Android + IOS自动开发部署环境(http://www.cnblogs.com/edward2013/p/5448......

IT追寻者
2016/10/08
33
0

没有更多内容

加载失败,请刷新页面

加载更多

Replugin借助“UI进程”来快速释放Dex

public static boolean preload(PluginInfo pi) { if (pi == null) { return false; } // 借助“UI进程”来快速释放Dex(见PluginFastInstallProviderProxy的说明) return PluginFastInsta......

Gemini-Lin
47分钟前
4
0
Hibernate 5 的模块/包(modules/artifacts)

Hibernate 的功能被拆分成一系列的模块/包(modules/artifacts),其目的是为了对依赖进行独立(模块化)。 模块名称 说明 hibernate-core 这个是 Hibernate 的主要(main (core))模块。定义...

honeymoose
今天
4
0
CSS--属性

一、溢出 当内容多,元素区域小的时候,就会产生溢出效果,默认是纵向溢出 横向溢出:在内容和容器之间再套一层容器,并且内部容器要比外部容器宽 属性:overflow/overflow-x/overflow-y 取值...

wytao1995
今天
4
0
精华帖

第一章 jQuery简介 jQuery是一个JavaScript库 jQuery具备简洁的语法和跨平台的兼容性 简化了JavaScript的操作。 在页面中引入jQuery jQuery是一个JavaScript脚本库,不需要特别的安装,只需要...

流川偑
今天
7
0
语音对话英语翻译在线翻译成中文哪个方法好用

想要进行将中文翻译成英文,或者将英文翻译成中文的操作,其实有一个非常简单的工具就能够帮助完成将语音进行翻译转换的软件。 在应用市场或者百度手机助手等各大应用渠道里面就能够找到一款...

401恶户
今天
3
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部