B(B-)树和B+树

B树

B树（balance tree）和B+树应用在数据库索引，可以认为是m叉的多路平衡查找树，但是从理论上讲，二叉树查找速度和比较次数都是最小的，为什么不用二叉树呢？
因为我们要考虑磁盘IO的影响，它相对于内存来说是很慢的。数据库索引是存储在磁盘上的，当数据量大时，就不能把整个索引全部加载到内存了，只能逐一加载每一个磁盘页（对应索引树的节点）。所以我们要减少IO次数，对于树来说，IO次数就是树的高度，而“矮胖”就是B树的特征之一，它的每个节点最多包含m个孩子，m称为b树的阶，m的大小取决于磁盘页的大小。
M阶的b树具有如下几个特征：
1.定义任意非叶子结点最多只有M个儿子，且M>2；
2.根结点的儿子数为[2, M]；
3.除根结点以外的非叶子结点的儿子数为[M/2, M]，向上取整；
4.非叶子结点的关键字个数=儿子数-1；
5.所有叶子结点位于同一层；
6.k个关键字把节点拆成k+1段，分别指向k+1个儿子，同时满足查找树的大小关系。

有关B树的一些特性，注意与后面的B+树区分：
(1)关键字集合分布在整颗树中；
(2)任何一个关键字出现且只出现在一个结点中；
(3)搜索有可能在非叶子结点结束；
(4)其搜索性能等价于在关键字全集内做一次二分查找；
(5)B树的每一个节点都包含key和value，因此经常访问的元素可能离根节点更近，因此访问也更迅速。
3阶B树，顺便讲一下查询元素5的过程：

1.第一次磁盘IO，把9所在节点读到内存，把目标数5和9比较，小，找小于9对应的节点；
第二次磁盘IO

2.第二次磁盘IO，还是读节点到内存，在内存中把5依次和2、6比较，定位到2、6中间区域对应的节点；
3.第三次磁盘IO，还是读节点到内存，然后就找到了目标5。
总结：可以看到，b树在查询时的比较次数并不比二叉树少，尤其是节点中的数非常多时，但是内存的比较速度非常快，耗时可以忽略，所以只要树的高度低，IO少，就可以提高查询性能，这是b树的优势之一。

B+树

B+树，是B树的一种变体，查询性能更好。m阶的B+树的特征：
1.有n棵子树的非叶子结点中含有n个关键字（B树是n-1个），这些关键字不保存数据，只用来索引，所有数据都保存在叶子节点（B树是每个关键字都保存数据）。
2.所有的叶子结点中包含了全部关键字的信息，及指向含这些关键字记录的指针，且叶子结点本身依关键字的大小自小而大顺序链接。
3.所有的非叶子结点可以看成是索引部分，结点中仅含其子树中的最大（或最小）关键字。
4.通常在B+树上有两个头指针，一个指向根结点，一个指向关键字最小的叶子结点。
5.同一个数字会在不同节点中重复出现，根节点的最大元素就是B+树的最大元素。

B+树

B+树相比于B树的查询优势：
(1)B+树的中间节点不保存数据，所以磁盘页能容纳更多节点元素，更“矮胖”；
(2)B+树查询必须查找到叶子节点，B树只要匹配到即可不用管元素位置，因此B+树查找更稳定（并不慢）；
(3)对于范围查找来说，B+树只需遍历叶子节点链表即可，便于区间查找和遍历,B树却需要重复地中序遍历，相邻的元素可能在内存中不相邻，所以缓存命中性没有B+树好。如下两图：
B+树1
B+树2
B树和B+树的区别：
1.磁盘读写代价更低
一般来说B+Tree比BTree更适合实现外存的索引结构，因为存储引擎的设计专家巧妙的利用了外存(磁盘)的存储结构，即磁盘的最小存储单位是扇区(sector)，而操作系统的块(block)通常是整数倍的sector，操作系统以页(page)为单位管理内存，一页(page)通常默认为4K，数据库的页通常设置为操作系统页的整数倍，因此索引结构的节点被设计为一个页的大小，然后利用外存的“预读取”原则，每次读取的时候，把整个节点的数据读取到内存中，然后在内存中查找，已知内存的读取速度是外存读取I/O速度的几百倍，那么提升查找速度的关键就在于尽可能少的磁盘I/O，那么可以知道，每个节点中的key个数越多，那么树的高度越小，需要I/O的次数越少，因此一般来说B+Tree比BTree更快，因为B+Tree的非叶节点中不存储data，就可以存储更多的key。
2.查询速度更稳定
由于B+Tree非叶子节点不存储数据（data），因此所有的数据都要查询至叶子节点，而叶子节点的高度都是相同的，因此所有数据的查询速度都是一样的。
3.B树每个节点都存储数据，所有节点组成这棵树。B+树只有叶子节点存储数据（B+数中有两个头指针：一个指向根节点，另一个指向关键字最小的叶节点），叶子节点包含了这棵树的所有数据，所有的叶子结点使用链表相连，便于区间查找和遍历，所有非叶节点起到索引作用。
4.B树中叶节点包含的关键字和其他节点包含的关键字是不重复的，B+树的索引项只包含对应子树的最大关键字和指向该子树的指针，不含有该关键字对应记录的存储地址。
5.B+树中查找，无论查找是否成功，每次都是一条从根节点到叶节点的路径。
6.B树中每个节点（非根节点）关键字个数的范围为m/2(向上取整)-1,m-1，并且具有n个关键字的节点包含（n+1）棵子树。B+树中每个节点（非根节点）关键字个数的范围为m/2(向上取整),m，具有n个关键字的节点包含（n）棵子树。
B树和B+树的共同优点:
考虑磁盘IO的影响，它相对于内存来说是很慢的。数据库索引是存储在磁盘上的，当数据量大时，就不能把整个索引全部加载到内存了，只能逐一加载每一个磁盘页（对应索引树的节点）。所以我们要减少IO次数，对于树来说，IO次数就是树的高度，而“矮胖”就是b树的特征之一，m的大小取决于磁盘页的大小。

B(B-)树和B+树

B(B-)树和B+树

B树

B+树

猜你喜欢