亚洲激情专区-91九色丨porny丨老师-久久久久久久女国产乱让韩-国产精品午夜小视频观看

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

Redis 中布隆過濾器的實現

發布時間:2021-06-03 17:20:18 來源:億速云 閱讀:311 作者:Leah 欄目:數據庫

Redis 中布隆過濾器的實現?相信很多沒有經驗的人對此束手無策,為此本文總結了問題出現的原因和解決方法,通過這篇文章希望你能解決這個問題。

什么是『布隆過濾器』

布隆過濾器是一個神奇的數據結構,可以用來判斷一個元素是否在一個集合中。很常用的一個功能是用來去重。在爬蟲中常見的一個需求:目標網站 URL 千千萬,怎么判斷某個 URL 爬蟲是否寵幸過?簡單點可以爬蟲每采集過一個 URL,就把這個 URL 存入數據庫中,每次一個新的 URL 過來就到數據庫查詢下是否訪問過。

select id from table where url = 'https://jaychen.cc'

但是隨著爬蟲爬過的 URL 越來越多,每次請求前都要訪問數據庫一次,并且對于這種字符串的 SQL 查詢效率并不高。除了數據庫之外,使用 Redis 的 set 結構也可以滿足這個需求,并且性能優于數據庫。但是 Redis 也存在一個問題:耗費過多的內存。這個時候布隆過濾器就很橫的出場了:這個問題讓我來。

相比于數據庫和 Redis,使用布隆過濾器可以很好的避免性能和內存占用的問題。

布隆過濾器本質是一個位數組,位數組就是數組的每個元素都只占用 1 bit 。每個元素只能是 0 或者 1。這樣申請一個 10000 個元素的位數組只占用 10000 / 8 = 1250 B 的空間。布隆過濾器除了一個位數組,還有 K 個哈希函數。當一個元素加入布隆過濾器中的時候,會進行如下操作:

  • 使用 K 個哈希函數對元素值進行 K 次計算,得到 K 個哈希值。

  • 根據得到的哈希值,在位數組中把對應下標的值置為 1。

舉個?,假設布隆過濾器有 3 個哈希函數:f1, f2, f3 和一個位數組 arr。現在要把 https://jaychen.cc 插入布隆過濾器中:

  • 對值進行三次哈希計算,得到三個值 n1, n2, n3。

  • 把位數組中三個元素 arr[n1], arr[n2], arr[3] 置為 1。

當要判斷一個值是否在布隆過濾器中,對元素再次進行哈希計算,得到值之后判斷位數組中的每個元素是否都為 1,如果值都為 1,那么說明這個值在布隆過濾器中,如果存在一個值不為 1,說明該元素不在布隆過濾器中。

看不懂文字看下面的靈魂畫手的圖解釋???

Redis 中布隆過濾器的實現

看了上面的說明,必然會提出一個問題:當插入的元素原來越多,位數組中被置為 1 的位置就越多,當一個不在布隆過濾器中的元素,經過哈希計算之后,得到的值在位數組中查詢,有可能這些位置也都被置為 1。這樣一個不存在布隆過濾器中的也有可能被誤判成在布隆過濾器中。但是如果布隆過濾器判斷說一個元素不在布隆過濾器中,那么這個值就一定不在布隆過濾器中。簡單來說:

  • 布隆過濾器說某個元素在,可能會被誤判。

  • 布隆過濾器說某個元素不在,那么一定不在。

這個布隆過濾器的缺陷放到上面爬蟲的需求中,可能存在某些沒有訪問過的 URL 可能會被誤判為訪問過,但是如果是訪問過的 URL 一定不會被誤判為沒訪問過。

Redis 中的布隆過濾器

redis 在 4.0 的版本中加入了 module 功能,布隆過濾器可以通過 module 的形式添加到 redis 中,所以使用 redis 4.0 以上的版本可以通過加載 module 來使用 redis 中的布隆過濾器。但是這不是最簡單的方式,使用 docker 可以直接在 redis 中體驗布隆過濾器。

> docker run -d -p 6379:6379 --name bloomfilter redislabs/rebloom
> docker exec -it bloomfilter redis-cli

redis 布隆過濾器主要就兩個命令:

  • bf.add 添加元素到布隆過濾器中:bf.add urls https://jaychen.cc

  • bf.exists 判斷某個元素是否在過濾器中:bf.exists urls https://jaychen.cc

上面說過布隆過濾器存在誤判的情況,在 redis 中有兩個值決定布隆過濾器的準確率:

  • error_rate :允許布隆過濾器的錯誤率,這個值越低過濾器的位數組的大小越大,占用空間也就越大。

  • initial_size :布隆過濾器可以儲存的元素個數,當實際存儲的元素個數超過這個值之后,過濾器的準確率會下降。

redis 中有一個命令可以來設置這兩個值:

bf.reserve urls 0.01 100

三個參數的含義:

  • 第一個值是過濾器的名字。

  • 第二個值為 error_rate 的值。

  • 第三個值為 initial_size 的值。

使用這個命令要注意一點:執行這個命令之前過濾器的名字應該不存在,如果執行之前就存在會報錯:(error) ERR item exists

看完上述內容,你們掌握Redis 中布隆過濾器的實現的方法了嗎?如果還想學到更多技能或想了解更多相關內容,歡迎關注億速云行業資訊頻道,感謝各位的閱讀!

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

广宗县| 奎屯市| 施秉县| 吉首市| 武定县| 富民县| 唐河县| 三河市| 泽库县| 永州市| 平乡县| 鹤峰县| 土默特左旗| 柞水县| 沂南县| 九龙城区| 钟祥市| 青河县| 万安县| 鄂温| 台湾省| 乐平市| 姚安县| 乐都县| 满洲里市| 宜春市| 明溪县| 兰西县| 和龙市| 万载县| 大庆市| 灵丘县| 富锦市| 乌拉特中旗| 寻甸| 吉安市| 文登市| 大丰市| 汉中市| 崇仁县| 静乐县|