怎么应对Spark-Redis行海量数据插入、查询作业时碰到的问题

今天就跟大家聊聊有关怎么应对Spark-Redis行海量数据插入、查询作业时碰到的问题，可能很多人都不太了解，为了让大家更加了解，小编给大家总结了以下内容，希望大家根据这香港云主机篇文章可以有所收获。由于redis是基于内存的数据库，稳定性并不是很高，尤其是standalone模式下的redis。于是工作中在使用Spark-Redis时也会碰到很多问题，尤其是执行海量数据插入与查询的场景中。Redis是基于内存读取的数据库，相比其它的数据库，Redis的读取速度会更快。但是当我们要查询上千万条的海量数据时，即使是Redis也需要花费较长时间。这时候如果我们想要终止select作业的执行，我们希望的是所有的running task立即killed。Spark是有作业调度机制的。SparkContext是Spark的入口，相当于应用程序的main函数。SparkContext中的cancelJobGroup函数可以取消正在运行的job。按理说取消job之后，job下的所有task应该也终止。而且当我们取消select作业时，executor会throw TaskKilledException，而这个时候负责task作业的TaskContext在捕获到该异常之后，会执行killTaskIfInterrupted。但是Spark-Redis中还是会出现终止作业但是task仍然running。因为task的计算逻辑最终是在RedisRDD中实现的，RedisRDD的compute会从Jedis中取获取keys。所以说要解决这个问题，应该在RedisRDD中取消正在running的task。这里有两种方法：我们可以异步线程来执行compute，然后在另外的线程中判断是否task isInterrupted，如果是的话就执行TaskContext的killTaskIfInterrupted。防止killTaskIfInterrupted无法杀掉task，再结合InterruptibleIterator：一种迭代器，以提供任务终止功能。通过检查[TaskContext]中的中断标志来工作。我们都已经redis的数据是保存在内存中的。当然Redis也支持持久化，可以将数据备份到硬盘中。当插入海量数据时，如果Redis的内存不够的话，很显然会丢失部分数据。这里让使用者困惑的点在于：当Redis已使用内存大于最大可用内存时，Redis会报错：command not allowed when used memory > ‘maxmemory’。但是当insert job的数据大于Redis的可用内存时，部分数据丢失了，并且还没有任何报错。因为不管是Jedis客户端还是Redis服务器，当插入数据时内存不够，不会插入成功，但也不会返回任何response。所以目前能想到的解决办法就是当insert数据丢失时，扩大Redis内存。Spark-Redis是一个应用还不是很广泛的开源项目，不像Spark JDBC那样已经商业化。所以Spark-Redis还是存在很多问题。相信随着commiter的努力，Spark-Redis也会越来越强大。看完上述内容，你们对怎么应对Spark-Redis行海量数据插入、查询作业时碰到的问题有进一步的了解吗？如果还想了解更多知识或者相关内容，请关注开发云行业资讯频道，感谢大家的支持。

相关推荐: 如何使用redis解决负载均衡定时任务重复执行问题

本篇文章为大家展示了如何使用redis解决负载均衡定时任务重复执行问题，内容简明扼要并且容易理解，绝对能使你眼前一亮，通过这篇文章的详细介绍希望你能有所收获。原理：redis里边 setnx方法进行设置时，如果key已存在，则不添加，key不存在，则进行添加；…