企业网站建设 南通,高定网站,江苏省建设局官方网站查询,如何弄死一个网站京东到家订单中心系统业务中#xff0c;无论是外部商家的订单生产#xff0c;或是内部上下游系统的依赖#xff0c;订单查询的调用量都非常大#xff0c;造成了订单数据读多写少的情况。我们把订单数据存储在MySQL中#xff0c;但显然只通过DB来支撑大量的查询是不可取的。…京东到家订单中心系统业务中无论是外部商家的订单生产或是内部上下游系统的依赖订单查询的调用量都非常大造成了订单数据读多写少的情况。我们把订单数据存储在MySQL中但显然只通过DB来支撑大量的查询是不可取的。同时对于一些复杂的查询MySQL支持得不够友好所以订单中心系统使用了Elasticsearch来承载订单查询的主要压力。Elasticsearch作为一款功能强大的分布式搜索引擎支持近实时的存储、搜索数据在京东到家订单系统中发挥着巨大作用目前订单中心ES集群存储数据量达到10亿个文档日均查询量达到5亿。随着京东到家近几年业务的快速发展订单中心ES架设方案也不断演进发展至今ES集群架设是一套实时互备方案很好地保障了ES集群读写的稳定性下面就给大家介绍一下这个历程以及过程中遇到的一些坑。ES 集群架构演进之路1、初始阶段订单中心ES初始阶段如一张白纸架设方案基本没有很多配置都是保持集群默认配置。整个集群部署在集团的弹性云上ES集群的节点以及机器部署都比较混乱。同时按照集群维度来看一个ES集群会有单点问题显然对于订单中心业务来说也是不被允许的。2、集群隔离阶段和很多业务一样ES集群采用的混布的方式。但由于订单中心ES存储的是线上订单数据偶尔会发生混布集群抢占系统大量资源导致整个订单中心ES服务异常。显然任何影响到订单查询稳定性的情况都是无法容忍的所以针对于这个情况先是对订单中心ES所在的弹性云迁出那些系统资源抢占很高的集群节点ES集群状况稍有好转。但随着集群数据不断增加弹性云配置已经不太能满足ES集群且为了完全的物理隔离最终干脆将订单中心ES集群部署到高配置的物理机上ES集群性能又得到提升。3、节点副本调优阶段ES的性能跟硬件资源有很大关系当ES集群单独部署到物理机器上时集群内部的节点并不是独占整台物理机资源在集群运行的时候同一物理机上的节点仍会出现资源抢占的问题。所以在这种情况下为了让ES单个节点能够使用最大程度的机器资源采用每个ES节点部署在单独一台物理机上方式。但紧接着问题又来了如果单个节点出现瓶颈了呢我们应该怎么再优化呢ES查询的原理当请求打到某号分片的时候如果没有指定分片类型Preference参数查询请求会负载到对应分片号的各个节点上。而集群默认副本配置是一主一副针对此情况我们想到了扩容副本的方式由默认的一主一副变为一主二副同时增加相应物理机。订单中心ES集群架设示意图如图整个架设方式通过VIP来负载均衡外部请求整个集群有一套主分片二套副分片一主二副从网关节点转发过来的请求会在打到数据节点之前通过轮询的方式进行均衡。集群增加一套副本并扩容机器的方式增加了集群吞吐量从而提升了整个集群查询性能。下图为订单中心ES集群各阶段性能示意图直观地展示了各阶段优化后ES集群性能的显著提升当然分片数量和分片副本数量并不是越多越好在此阶段我们对选择适当的分片数量做了进一步探索。分片数可以理解为MySQL中的分库分表而当前订单中心ES查询主要分为两类单ID查询以及分页查询。分片数越大集群横向扩容规模也更大根据分片路由的单ID查询吞吐量也能大大提升但聚合的分页查询性能则将降低分片数越小集群横向扩容规模也更小单ID的查询性能也会下降但分页查询的性能将会提升。所以如何均衡分片数量和现有查询业务我们做了很多次调整压测最终选择了集群性能较好的分片数。4、主从集群调整阶段到此订单中心的ES集群已经初具规模但由于订单中心业务时效性要求高对ES查询稳定性要求也高如果集群中有节点发生异常查询服务会受到影响从而影响到整个订单生产流程。很明显这种异常情况是致命的所以为了应对这种情况我们初步设想是增加一个备用集群当主集群发生异常时可以实时的将查询流量降级到备用集群。那备用集群应该怎么来搭主备之间数据如何同步备用集群应该存储什么样的数据考虑到ES集群暂时没有很好的主备方案同时为了更好地控制ES数据写入我们采用业务双写的方式来搭设主备集群。每次业务操作需要写入ES数据时同步写入主集群数据然后异步写入备集群数据。同时由于大部分ES查询的流量都来源于近几天的订单且订单中心数据库数据已有一套归档机制将指定天数之前已经关闭的订单转移到历史订单库。所以归档机制中增加删除备集群文档的逻辑让新搭建的备集群存储的订单数据与订单中心线上数据库中的数据量保持一致。同时使用ZK在查询服务中做了流量控制开关保证查询流量能够实时降级到备集群。在此订单中心主从集群完成ES查询服务稳定性大大提升。5、现今实时互备双集群阶段期间由于主集群ES版本是较低的1.7而现今ES稳定版本都已经迭代到6.x新版本的ES不仅性能方面优化很大更提供了一些新的好用的功能所以我们对主集群进行了一次版本升级直接从原来的1.7升级到6.x版本。集群升级的过程繁琐而漫长不但需要保证线上业务无任何影响平滑无感知升级同时由于ES集群暂不支持从1.7到6.x跨越多个版本的数据迁移所以需要通过重建索引的方式来升级主集群具体升级过程就不在此赘述了。主集群升级的时候必不可免地会发生不可用的情况但对于订单中心ES查询服务这种情况是不允许的。所以在升级的阶段中备集群暂时顶上充当主集群来支撑所有的线上ES查询保证升级过程不影响正常线上服务。同时针对于线上业务我们对两个集群做了重新的规划定义承担的线上查询流量也做了重新的划分。备集群存储的是线上近几天的热点数据数据规模远小于主集群大约是主集群文档数的十分之一。集群数据量小在相同的集群部署规模下备集群的性能要优于主集群。然而在线上真实场景中线上大部分查询流量也来源于热点数据所以用备集群来承载这些热点数据的查询而备集群也慢慢演变成一个热数据集群。之前的主集群存储的是全量数据用该集群来支撑剩余较小部分的查询流量这部分查询主要是需要搜索全量订单的特殊场景查询以及订单中心系统内部查询等而主集群也慢慢演变成一个冷数据集群。同时备集群增加一键降级到主集群的功能两个集群地位同等重要但都可以各自降级到另一个集群。双写策略也优化为假设有AB集群正常同步方式写主A集群异步方式写备B集群。A集群发生异常时同步写B集群主异步写A集群备。ES 订单数据的同步方案MySQL数据同步到ES中大致总结可以分为两种方案方案1监听MySQL的Binlog分析Binlog将数据同步到ES集群中。方案2直接通过ES API将数据写入到ES集群中。考虑到订单系统ES服务的业务特殊性对于订单数据的实时性较高显然监听Binlog的方式相当于异步同步有可能会产生较大的延时性。且方案1实质上跟方案2类似但又引入了新的系统维护成本也增高。所以订单中心ES采用了直接通过ES API写入订单数据的方式该方式简洁灵活能够很好的满足订单中心数据同步到ES的需求。由于ES订单数据的同步采用的是在业务中写入的方式当新建或更新文档发生异常时如果重试势必会影响业务正常操作的响应时间。所以每次业务操作只更新一次ES如果发生错误或者异常在数据库中插入一条补救任务有Worker任务会实时地扫这些数据以数据库订单数据为基准来再次更新ES数据。通过此种补偿机制来保证ES数据与数据库订单数据的最终一致性。遇到的一些坑1、实时性要求高的查询走DB对于ES写入机制的有了解的同学可能会知道新增的文档会被收集到Indexing Buffer然后写入到文件系统缓存中到了文件系统缓存中就可以像其他的文件一样被索引到。然而默认情况文档从Indexing Buffer到文件系统缓存即Refresh操作是每秒分片自动刷新所以这就是我们说ES是近实时搜索而非实时的原因文档的变化并不是立即对搜索可见但会在一秒之内变为可见。当前订单系统ES采用的是默认Refresh配置故对于那些订单数据实时性比较高的业务直接走数据库查询保证数据的准确性。2、避免深分页查询ES集群的分页查询支持from和size参数查询的时候每个分片必须构造一个长度为fromsize的优先队列然后回传到网关节点网关节点再对这些优先队列进行排序找到正确的size个文档。假设在一个有6个主分片的索引中from为10000size为10每个分片必须产生10010个结果在网关节点中汇聚合并60060个结果最终找到符合要求的10个文档。由此可见当from足够大的时候就算不发生OOM也会影响到CPU和带宽等从而影响到整个集群的性能。所以应该避免深分页查询尽量不去使用。3、FieldData与Doc ValuesFieldData线上查询出现偶尔超时的情况通过调试查询语句定位到是跟排序有关系。排序在es1.x版本使用的是FieldData结构FieldData占用的是JVM Heap内存JVM内存是有限对于FieldData Cache会设定一个阈值。如果空间不足时使用最久未使用LRU算法移除FieldData同时加载新的FieldData Cache加载的过程需要消耗系统资源且耗时很大。所以导致这个查询的响应时间暴涨甚至影响整个集群的性能。针对这种问题解决方式是采用Doc Values。Doc ValuesDoc Values是一种列式的数据存储结构跟FieldData很类似但其存储位置是在Lucene文件中即不会占用JVM Heap。随着ES版本的迭代Doc Values比FieldData更加稳定Doc Values在2.x起为默认设置。总结架构的快速迭代源于业务的快速发展正是由于近几年到家业务的高速发展订单中心的架构也不断优化升级。而架构方案没有最好的只有最合适的相信再过几年订单中心的架构又将是另一个面貌但吞吐量更大性能更好稳定性更强将是订单中心系统永远的追求。