{
    "componentChunkName": "component---src-templates-post-js",
    "path": "/detabesu/",
    "result": {"data":{"ghostPost":{"id":"Ghost__Post__6a5b7851781e37000184eb64","title":"データベースストレージエンジン B+treeとLSM treeについて","slug":"detabesu","featured":false,"feature_image":"https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-1-1.png","excerpt":"こんにちは、アンチパターンの山本です。\n\n現在「Build Your Own Database From Scratch in Go\n[https://build-your-own.org/database/#table-of-contents]\n」という記事を読んで、原子性（全部成功するか何もしなかった状態にする）と耐久性（電源落ちても消えない）を持ったデータベースをGo言語で実装するというのを勉強中です。\n\nその中でMySQL にも使われているB+treeと、もう一つのデータ構造であるLSM treeがとても面白かったためブログにまとめました！\n\nまず、そもそもデータベースの用途は、大きく分けてこの2つに分類されます。\n\n * OLTP（オンライン・トランザクション処理）\n   スマホアプリやECサイトのように、「1件の登録」　「1件の更新」など細かい大量の読み書きを捌くシステム。MySQLやPostgreSQLがそうです。\n * OLAP（分析処理）\n   大量のデータから「過去1年間の顧客単価」などを計算するシステム。こちらでは「列指向（カラムナー）ストレージ」という全く別のデ","custom_excerpt":null,"visibility":"public","created_at_pretty":"18 July, 2026","published_at_pretty":"23 July, 2026","updated_at_pretty":"23 July, 2026","created_at":"2026-07-18T21:57:53.000+09:00","published_at":"2026-07-23T17:13:05.000+09:00","updated_at":"2026-07-23T17:13:05.000+09:00","meta_title":null,"meta_description":null,"og_description":null,"og_image":null,"og_title":null,"twitter_description":null,"twitter_image":null,"twitter_title":null,"authors":[{"name":"Ami Yamamoto","slug":"ami","bio":null,"profile_image":null,"twitter":null,"facebook":null,"website":null}],"primary_author":{"name":"Ami Yamamoto","slug":"ami","bio":null,"profile_image":null,"twitter":null,"facebook":null,"website":null},"primary_tag":null,"tags":[],"plaintext":"こんにちは、アンチパターンの山本です。\n\n現在「Build Your Own Database From Scratch in Go\n[https://build-your-own.org/database/#table-of-contents]\n」という記事を読んで、原子性（全部成功するか何もしなかった状態にする）と耐久性（電源落ちても消えない）を持ったデータベースをGo言語で実装するというのを勉強中です。\n\nその中でMySQL にも使われているB+treeと、もう一つのデータ構造であるLSM treeがとても面白かったためブログにまとめました！\n\nまず、そもそもデータベースの用途は、大きく分けてこの2つに分類されます。\n\n * OLTP（オンライン・トランザクション処理）\n   スマホアプリやECサイトのように、「1件の登録」　「1件の更新」など細かい大量の読み書きを捌くシステム。MySQLやPostgreSQLがそうです。\n * OLAP（分析処理）\n   大量のデータから「過去1年間の顧客単価」などを計算するシステム。こちらでは「列指向（カラムナー）ストレージ」という全く別のデータ構造が使われる。Amazon\n   Redshiftなどがこれにあたります。\n\n今回はOLTPのお話になります。\nOLTPのような大量の読み書きを捌くことが出来る仕組みは多くなく、この2つに二分されます。\n\n * B+tree　:検索が最適化されている\n * LSM tree（Log-Structured Merge-tree）: 書き込みが最適化されている\n\nB+tree\nB+treeは素早く検索するために、ディスク上に完璧に整頓されたツリーを維持し続けるデータ構造です。\nB-treeは途中のノードにも実際のデータを置きますが、B+treeはノードにはキーしか置かず、実際のデータはすべて一番下のリーフに置きます。\n\nノードに実データを置かないことで、1つの箱に大量の分岐を詰め込めるようになり、木の高さを低く抑えることができます。実際にMySQLでデータが1億個ある場合でも、たった4層で実データまでたどりつくことができます！\n\nノードを4KBで統一することで効率化\nB+treeは、1つのノードのサイズを4KB（もしくはその倍数）に固定します。\nSSDがデータを読み書きする最小ブロックが4KB、OSがメモリとディスクの間でデータを読み書きする最小単位（ページ）も4KBであるためです。\n（４KBは原稿用紙4枚分くらい）\n\nもしノードを5KBなどにすると、SSDは8KBの容量を確保する必要があり、OSは1つのノードを確認するのに2度データを読み取りしなければならず、効率が落ちてしまうのです。\n\nLSM tree\nLSM\ntreeは新しく来たデータをメモリ上にある小さな箱（MemTable）に一旦溜めます。MemTableがいっぱいになったらディスクの空いている場所に「新しいファイル」として書き出す。そして（バックグラウンド）で大きな箱（SSTable）へと綺麗にマージ（合体・整理）していく。\n\n * B+木のようなその都度直接上書きする処理が発生しないため、書き込みが圧倒的に速く、ディスクへの書き込み回数を削減出来る\n\nFacebookとRocksDB\nFacebookは、B+木による容量の増大と書き込み量が問題になっていました。\nそこで、圧縮率が高くディスクにも優しいLSM treeベースのエンジンMyRocksを開発します。\n2017年に移行した結果、データサイズを62.3%も削減し、DBサーバー台数を半分に減らすコスト削減を実現しました。\n\n参考記事：\nhttps://enterprisezine.jp/article/detail/9450?p=2\nhttps://www.vldb.org/pvldb/vol13/p3217-matsunobu.pdf\n\nなぜそんなに圧縮できるのか\nB+treeはノードからデータが溢れたとき、ノードを2つに分割してデータを半分に分けます。\nその時できた2つのノードはデータがスカスカな状態で保存されることになります。このように、ほとんどのノードはデータがびっちり入っているわけではなく、容量に余白がある状態なのです。\n\n一方でLSM\ntreeはデータを一つ大きいレイヤーに保存する時、きれいに並び替えてマージしたデータを新しい領域に保存していきます。そのためぎちぎちにデータを詰めて保存することが出来るのです。\n\nB+treeがどうして書き込みが多いのか\nB+treeは書き込みに対して、ツリーの整合性とノードのサイズを保つためにその都度SSDへの書き込みが発生します。\nさらに書き込みの途中で中途半端なデータが保存されるようなことがないようにデータを追記したノードを1回仮にストレージに書き込んで、その後清書するというようなダブルライトという仕組みもあり、書き込みが多くなりやすい仕組みになっています。\n\n余談：なぜSSDは劣化するのか\nSSDは、データを保存するために電子を酸化皮膜（酸化シリコンのガラス状の壁）でできた箱に閉じ込めています。\n電子が入っている状態を0、入っていない状態を1として扱いデータを保存しています。\nデータ書き込む際、高電圧をかけることで通常では通り抜けられない酸化皮膜の壁をトンネル効果によって通過させ、電子を閉じ込めます。トンネル効果によって何度も電子が通過すると酸化皮膜がにぶつかり、物理的に壁がボロボロになり、電子を閉じ込められなくなって寿命を迎えるのです。\n\n余談：トンネル効果とは\n通常電子は電圧をかけたところで酸化皮膜を通り抜けるほどのエネルギーを持てない。でも電子は波の性質も持っているため、電子の波（存在する確率）は酸化皮膜の向こう側にも漏れ出すため、一定確率でFloating\ngateまでたどり着くことが出来る！\n\n電子の波\n~~~~~~~＼\n        ███████  壁\n        ~~＼\n            ~＼~~~ 反対側にも少し残る\n\nまとめ\nB+treeとLSM tree、どちらか一方が最強で優れているという話ではなく、事業のフェーズやボトルネックは何かによって何を選ぶのがいいんだなと感じました。\n\nまた、複雑そうに見えるデータベースやコンピュータも突き詰めると原子や電子の動きによってできていると思うと、みなさんも胸がときめく思いですよね！\n\nおわり","html":"<p>こんにちは、アンチパターンの山本です。</p><p>現在「<a href=\"https://build-your-own.org/database/#table-of-contents\">Build Your Own Database From Scratch in Go</a>」という記事を読んで、原子性（全部成功するか何もしなかった状態にする）と耐久性（電源落ちても消えない）を持ったデータベースをGo言語で実装するというのを勉強中です。</p><p>その中でMySQL にも使われているB+treeと、もう一つのデータ構造であるLSM treeがとても面白かったためブログにまとめました！</p><p>まず、そもそもデータベースの用途は、大きく分けてこの2つに分類されます。</p><ul><li><strong>OLTP（オンライン・トランザクション処理）</strong><br>スマホアプリやECサイトのように、「1件の登録」　「1件の更新」など細かい大量の読み書きを捌くシステム。MySQLやPostgreSQLがそうです。</li><li><strong>OLAP（分析処理）</strong><br> 大量のデータから「過去1年間の顧客単価」などを計算するシステム。こちらでは「列指向（カラムナー）ストレージ」という全く別のデータ構造が使われる。Amazon Redshiftなどがこれにあたります。</li></ul><p>今回はOLTPのお話になります。<br>OLTPのような大量の読み書きを捌くことが出来る仕組みは多くなく、この2つに二分されます。</p><ul><li><strong>B+tree　:</strong>検索が最適化されている</li><li><strong>LSM tree（Log-Structured Merge-tree）:</strong> 書き込みが最適化されている</li></ul><h2 id=\"btree\">B+tree</h2><p>B+treeは素早く検索するために、ディスク上に完璧に整頓されたツリーを維持し続けるデータ構造です。<br>B-treeは途中のノードにも実際のデータを置きますが、B+treeはノードにはキーしか置かず、実際のデータはすべて一番下のリーフに置きます。</p><p>ノードに実データを置かないことで、1つの箱に大量の分岐を詰め込めるようになり、木の高さを低く抑えることができます。実際にMySQLでデータが1億個ある場合でも、たった4層で実データまでたどりつくことができます！</p><figure class=\"kg-card kg-image-card\"><img src=\"https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-1.png\" class=\"kg-image\" alt loading=\"lazy\" width=\"928\" height=\"365\" srcset=\"https://ghost.tech.anti-pattern.co.jp/content/images/size/w600/2026/07/image-1.png 600w, https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-1.png 928w\" sizes=\"(min-width: 720px) 720px\"></figure><h3 id=\"%E3%83%8E%E3%83%BC%E3%83%89%E3%82%924kb%E3%81%A7%E7%B5%B1%E4%B8%80%E3%81%99%E3%82%8B%E3%81%93%E3%81%A8%E3%81%A7%E5%8A%B9%E7%8E%87%E5%8C%96\"><strong>ノードを4KBで統一することで効率化</strong></h3><p>B+treeは、1つのノードのサイズを4KB（もしくはその倍数）に固定します。<br>SSDがデータを読み書きする最小ブロックが4KB、OSがメモリとディスクの間でデータを読み書きする最小単位（ページ）も4KBであるためです。<br>（４KBは原稿用紙4枚分くらい）</p><p>もしノードを5KBなどにすると、SSDは8KBの容量を確保する必要があり、OSは1つのノードを確認するのに2度データを読み取りしなければならず、効率が落ちてしまうのです。</p><figure class=\"kg-card kg-image-card\"><img src=\"https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-2.png\" class=\"kg-image\" alt loading=\"lazy\" width=\"1546\" height=\"611\" srcset=\"https://ghost.tech.anti-pattern.co.jp/content/images/size/w600/2026/07/image-2.png 600w, https://ghost.tech.anti-pattern.co.jp/content/images/size/w1000/2026/07/image-2.png 1000w, https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-2.png 1546w\" sizes=\"(min-width: 720px) 720px\"></figure><h2 id=\"lsm-tree\">LSM tree</h2><p>LSM treeは新しく来たデータをメモリ上にある小さな箱（MemTable）に一旦溜めます。MemTableがいっぱいになったらディスクの空いている場所に「新しいファイル」として書き出す。そして（バックグラウンド）で大きな箱（SSTable）へと綺麗にマージ（合体・整理）していく。</p><ul><li>B+木のようなその都度直接上書きする処理が発生しないため、書き込みが圧倒的に速く、ディスクへの書き込み回数を削減出来る</li></ul><figure class=\"kg-card kg-image-card\"><img src=\"https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-3.png\" class=\"kg-image\" alt loading=\"lazy\" width=\"1019\" height=\"464\" srcset=\"https://ghost.tech.anti-pattern.co.jp/content/images/size/w600/2026/07/image-3.png 600w, https://ghost.tech.anti-pattern.co.jp/content/images/size/w1000/2026/07/image-3.png 1000w, https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-3.png 1019w\" sizes=\"(min-width: 720px) 720px\"></figure><h3 id=\"facebook%E3%81%A8rocksdb\"><strong>FacebookとRocksDB</strong></h3><p>Facebookは、B+木による容量の増大と書き込み量が問題になっていました。<br>そこで、圧縮率が高くディスクにも優しいLSM treeベースのエンジンMyRocksを開発します。<br>2017年に移行した結果、データサイズを62.3%も削減し、DBサーバー台数を半分に減らすコスト削減を実現しました。</p><p>参考記事：<br><a href=\"https://enterprisezine.jp/article/detail/9450?p=2\">https://enterprisezine.jp/article/detail/9450?p=2</a><br><a href=\"https://www.vldb.org/pvldb/vol13/p3217-matsunobu.pdf\">https://www.vldb.org/pvldb/vol13/p3217-matsunobu.pdf</a></p><h3 id=\"%E3%81%AA%E3%81%9C%E3%81%9D%E3%82%93%E3%81%AA%E3%81%AB%E5%9C%A7%E7%B8%AE%E3%81%A7%E3%81%8D%E3%82%8B%E3%81%AE%E3%81%8B\"><strong>なぜそんなに圧縮できるのか</strong></h3><p>B+treeはノードからデータが溢れたとき、ノードを2つに分割してデータを半分に分けます。<br>その時できた2つのノードはデータがスカスカな状態で保存されることになります。このように、ほとんどのノードはデータがびっちり入っているわけではなく、容量に余白がある状態なのです。</p><figure class=\"kg-card kg-image-card kg-width-wide\"><img src=\"https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-5.png\" class=\"kg-image\" alt loading=\"lazy\" width=\"1174\" height=\"290\" srcset=\"https://ghost.tech.anti-pattern.co.jp/content/images/size/w600/2026/07/image-5.png 600w, https://ghost.tech.anti-pattern.co.jp/content/images/size/w1000/2026/07/image-5.png 1000w, https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-5.png 1174w\"></figure><p>一方でLSM treeはデータを一つ大きいレイヤーに保存する時、きれいに並び替えてマージしたデータを新しい領域に保存していきます。そのためぎちぎちにデータを詰めて保存することが出来るのです。</p><h3 id=\"btree%E3%81%8C%E3%81%A9%E3%81%86%E3%81%97%E3%81%A6%E6%9B%B8%E3%81%8D%E8%BE%BC%E3%81%BF%E3%81%8C%E5%A4%9A%E3%81%84%E3%81%AE%E3%81%8B\"><strong>B+treeがどうして書き込みが多いのか</strong></h3><p>B+treeは書き込みに対して、ツリーの整合性とノードのサイズを保つためにその都度SSDへの書き込みが発生します。<br>さらに書き込みの途中で中途半端なデータが保存されるようなことがないようにデータを追記したノードを1回仮にストレージに書き込んで、その後清書するというようなダブルライトという仕組みもあり、書き込みが多くなりやすい仕組みになっています。</p><h3 id=\"%E4%BD%99%E8%AB%87%EF%BC%9A%E3%81%AA%E3%81%9Cssd%E3%81%AF%E5%8A%A3%E5%8C%96%E3%81%99%E3%82%8B%E3%81%AE%E3%81%8B\"><strong>余談：なぜSSDは劣化するのか</strong></h3><p>SSDは、データを保存するために電子を酸化皮膜（酸化シリコンのガラス状の壁）でできた箱に閉じ込めています。<br>電子が入っている状態を0、入っていない状態を1として扱いデータを保存しています。<br> データ書き込む際、高電圧をかけることで通常では通り抜けられない酸化皮膜の壁をトンネル効果によって通過させ、電子を閉じ込めます。トンネル効果によって何度も電子が通過すると酸化皮膜がにぶつかり、物理的に壁がボロボロになり、電子を閉じ込められなくなって寿命を迎えるのです。</p><figure class=\"kg-card kg-image-card\"><img src=\"https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-6.png\" class=\"kg-image\" alt loading=\"lazy\" width=\"856\" height=\"466\" srcset=\"https://ghost.tech.anti-pattern.co.jp/content/images/size/w600/2026/07/image-6.png 600w, https://ghost.tech.anti-pattern.co.jp/content/images/2026/07/image-6.png 856w\" sizes=\"(min-width: 720px) 720px\"></figure><h3 id=\"%E4%BD%99%E8%AB%87%EF%BC%9A%E3%83%88%E3%83%B3%E3%83%8D%E3%83%AB%E5%8A%B9%E6%9E%9C%E3%81%A8%E3%81%AF\"><strong>余談：トンネル効果とは</strong></h3><p>通常電子は電圧をかけたところで酸化皮膜を通り抜けるほどのエネルギーを持てない。でも電子は波の性質も持っているため、電子の波（存在する確率）は酸化皮膜の向こう側にも漏れ出すため、一定確率でFloating gateまでたどり着くことが出来る！</p><pre><code>電子の波\n~~~~~~~＼\n        ███████  壁\n        ~~＼\n            ~＼~~~ 反対側にも少し残る</code></pre><h2 id=\"%E3%81%BE%E3%81%A8%E3%82%81\">まとめ</h2><p>B+treeとLSM tree、どちらか一方が最強で優れているという話ではなく、事業のフェーズやボトルネックは何かによって何を選ぶのがいいんだなと感じました。</p><p>また、複雑そうに見えるデータベースやコンピュータも突き詰めると原子や電子の動きによってできていると思うと、みなさんも胸がときめく思いですよね！</p><p>おわり</p>","url":"https://ghost.tech.anti-pattern.co.jp/detabesu/","canonical_url":null,"uuid":"8830897e-0c82-4ab4-952c-9f8e2b4cf95a","page":null,"codeinjection_foot":null,"codeinjection_head":null,"codeinjection_styles":null,"comment_id":"6a5b7851781e37000184eb64","reading_time":4}},"pageContext":{"slug":"detabesu"}},
    "staticQueryHashes": ["176528973","2358152166","2561578252","2731221146","4145280475"]}