Fusion tree — различия между версиями

Версия 16:47, 5 июня 2015

Fusion tree — дерево поиска, позволяющее хранить [math]n[/math] [math]w[/math]-битных чисел, используя [math]O(n)[/math] памяти, и выполнять операции поиска за время [math]O(\log_{w} n)[/math]. Эта структура данных была впервые предложена в 1990 году М. Фредманом (M. Fredman) и Д. Уиллардом (D. Willard).

Содержание

1 Структура
2 Поиск вершины
- 2.1 Параллельное сравнение
- 2.2 succ(q) и pred(q)
3 Вычисление sketch(x)
4 Индекс наиболее значащего бита
5 Циклы де Брёйна
6 См. Также
7 Источники информации

Структура

Fusion tree — это B-дерево, такое что:

у всех вершин, кроме листьев, [math]B = w^{1/5}[/math] детей,
время, за которое определяется, в каком поддереве находится вершина, равно [math]O(1)[/math].

Такое время работы достигается за счет хранения дополнительной информации в вершинах. Построим цифровой бор из ключей узла дерева. Всего [math]B - 1[/math] ветвящихся вершин. Биты, соответствующие уровням дерева, в которых происходит ветвление, назовем существенными и обозначим их номера [math]b_0, b_1\ldots b_{r-1}[/math]. Количество существенных битов [math]r[/math] равно [math]B - 1[/math] (все ребра на уровне детей ветвящейся вершины являются существенными битами).

В Fusion tree вместе с ключом [math]x[/math] хранится [math]sketch(x)[/math] — последовательность битов [math]x_{b_{r-1}}\ldots x_{b_0}[/math].

Утверждение:

сохраняет порядок, то есть , если .

Рассмотрим наибольший общий префикс и . Тогда следующий бит определяет их порядок и одновременно является существенным битом. Поэтому, если , то и .

Поиск вершины

пример случая, когда , но

Пусть — множество ключей узла, отсортированных по возрастанию, [math]q[/math] — ключ искомой вершины, [math]l[/math] — количество бит в [math]sketch(q)[/math]. Сначала найдем такой ключ [math]a_i[/math], что . Но положение [math]sketch(q)[/math] среди [math]sketch(a_j)[/math] не всегда эквивалентно положению [math]q[/math] среди [math]a_j[/math], поэтому, зная соседние элементы [math]sketch(q)[/math], найдем [math]succ(q)[/math] и [math]pred(q)[/math].

Параллельное сравнение

Найдем [math]succ(sketch(q))[/math] и [math]pred(sketch(q))[/math]. Определим [math]sketch(node)[/math] как число, составленное из единиц и [math]sketch(a_i)[/math], то есть . Вычтем из [math]sketch(node)[/math] число . В начале каждого блока, где , сохранятся единицы. Применим к получившемуся побитовое & c , чтобы убрать лишние биты.

&

Если [math]sketch(a_i)\lt sketch(q)[/math], то [math]c_i = 0[/math], в противном случае [math]c_i = 1[/math]. Теперь надо найти количество единиц в L. Умножим L на , тогда все единицы сложатся в первом блоке результата, и, чтобы получить количество единиц, сдвинем его вправо.

succ(q) и pred(q)

Пусть .

Утверждение:

Среди всех ключей наибольший общий префикс с будет иметь или или .

Предположим, что имеет наибольший общий префикс с . Тогда будет иметь больше общих битов со . Значит, ближе по значению к , чем или , что приводит к противоречию.

Сравнивая [math]a \oplus q[/math] и [math]b \oplus q[/math], найдем какой из ключей имеет наибольший общий префикс с [math]q[/math] (наименьшее значение соответствует наибольшей длине).

Предположим, что [math]p[/math] — наибольший общий префикс, а [math]y[/math] его длина, [math]a_j[/math] — ключ, имеющий наибольший общий префикс с [math]q[/math] ([math]j = i[/math] или [math]i+1[/math]).

если [math]q\gt a_j[/math], то [math]y + 1[/math] бит [math]q[/math] равен единице, а [math]y + 1[/math] бит [math]a_j[/math] равен нулю. Так как общий префикс [math]a_j[/math] и [math]q[/math] является наибольшим, то не существует ключа с префиксом [math]p1[/math]. Значит, [math]q[/math] больше всех ключей с префиксом меньшим либо равным [math]p[/math]. Найдем [math]pred(e)[/math], [math]e = p01\ldots 11[/math], который одновременно будет [math]равен pred(q)[/math],
если [math]q\lt a_j[/math] — найдем [math]succ(e)[/math], [math]e = p10\ldots 00[/math]. Это будет [math]succ(q)[/math].

Длина наибольшего общего префикса двух w-битных чисел [math]a[/math] и [math]b[/math] может быть вычислена с помощью нахождения индекса наиболее значащего бита в побитовом [math]\oplus a[/math] и [math]b[/math].

Вычисление sketch(x)

Чтобы найти sketch за константное время, будем вычислять [math]sketch(x)[/math], имеющий все существенные биты в нужном порядке, но содержащий лишние нули.

1) уберем все несущественные биты [math]x' = x [/math]&,

2) умножением на некоторое заранее вычисленное число сместим все существенные биты в блок меньшего размера.

,

3) применив побитовое &, уберем лишние биты, появившиеся в результате умножения,

&,

4) сделаем сдвиг вправо на [math]m_0 + b_0[/math] бит.

Утверждение:

Дана последовательность из чисел . Тогда существует последовательность , такая что:

все [math]b_i + m_j[/math] различны, для
.

Выберем некоторые [math]m_i'[/math], таким образом, чтобы . Предположим, что мы выбрали [math]m_1' \ldots m_{t-1}'[/math]. Тогда . Всего недопустимых значений для [math]m_t'[/math], поэтому всегда можно найти хотя бы одно значение.

Чтобы получить , выбираем каждый раз наименьшее и прибавляем подходящее число кратное , такое что .

Первые два условия необходимы для того, чтобы сохранить все существенные биты в нужном порядке. Третье условие позволит поместить sketch узла в w-битный тип. Так как [math]r \leqslant B-1[/math], то [math]sketch(node)[/math] будет занимать бит.

Индекс наиболее значащего бита

Чтобы найти в w-битном числе [math]x[/math] индекс самого старшего бита, содержащего единицу, разделим [math]x[/math] на [math]\sqrt{w}[/math] блоков по [math]\sqrt{w}[/math] бит. . Далее найдем первый непустой блок и индекс первого единичного бита в нем.

1) Поиск непустых блоков.

a. Определим, какие блоки имеют единицу в первом бите. Применим побитовое & к [math]x[/math] и константе [math]F[/math].

b. Определим, содержат ли остальные биты единицы.

Вычислим [math]x \oplus t_1[/math].

Вычтем из [math]F\; t_2[/math]. Если какой-нибудь бит [math]F[/math] обнулится, значит, соответствующий блок содержит единицы.

Чтобы найти блоки, содержащие единицы, вычислим [math]t_3 \oplus F[/math].

c. Первый бит в каждом блоке [math]y = t_1 \lor t_4[/math] содержит единицу, если соответствующий блок [math]x[/math] ненулевой.

2) Найдем [math]sketch(y)[/math], чтобы сместить все нужные биты в один блок. Существенными битами в данном случае будут первые биты каждого блока, поэтому .

Будем использовать . Тогда . Все суммы различны при . Все [math]b_i + m_i = w + i[/math] возрастают, и .

Чтобы найти [math]sketch(y)[/math], умножим [math]y[/math] на [math]m[/math] и сдвинем вправо на [math]w[/math] бит.

3) Найдем первый ненулевой блок. Для этого надо найти первую единицу в [math]sketch(y)[/math]. Как и при поиске [math]succ(sketch(q))[/math] и [math]pred(sketch(q))[/math] используем параллельное сравнение [math]sketch(y)[/math] с . В результате сравнения получим номер первого ненулевого блока [math]c[/math].

4) Найдем номер [math]d[/math] первого единичного бита в найденном блоке так же как и в предыдущем пункте.

5) Индекс наиболее значащего бита будет равен [math]c\sqrt{w}+d[/math].

Каждый шаг выполняется за [math]O(1)[/math], поэтому всего потребуется [math]O(1)[/math] времени, чтобы найти индекс.

Циклы де Брёйна

Последовательность де Брёйна — последовательность [math]a_1,\;\ldots,\;a_t[/math], элементы которой принадлежат заданному конечному множеству (обычно рассматривают множество [math]\{0,\;1,\;\ldots,\;k-1\}[/math]), и все подпоследовательности [math]a_{i+1},\;\ldots,\;a_{i+n}[/math] заданной длины [math]n[/math] различны.

Часто рассматриваются периодические последовательности с периодом [math]T[/math], содержащие [math]T[/math] различных подпоследовательностей [math]a_{i+1},\;\ldots,\;a_{i+n}[/math], — то есть такие периодические последовательности, в которых любой отрезок длины [math]T+n-1[/math] является последовательностью де Брёйна с теми же параметрами [math]n[/math] и [math]k[/math].

Свойства

Очевидно, что длина (период) такого цикла не может превосходить [math]k^n[/math] — числа́ всех различных векторов длины [math]n[/math] с элементами из [math]\{0,\;1,\;\ldots,\;k-1\}[/math]; несложно доказать, что эта оценка достигается. Циклы этой максимально возможной длины обычно называют циклами де Брёйна (впрочем, иногда этот термин применяют и к циклам меньшей длины).

При [math]k=2[/math] существуют такие циклы де Брёйна с длиной, на единицу меньшей максимума, которые выражаются линейными рекуррентными соотношениями порядка [math]n[/math]: так, при [math]n=3[/math] соотношение [math]x_n=x_{n-2}+x_{n-3}\pmod 2[/math] порождает последовательности с периодом 7, например 0010111001011100… (цикл де Брёйна 0010111). На основе таких последовательностей построен, в частности, циклический избыточный код.

Примеры

Примеры циклов де Брёйна для [math]k=2[/math] с периодом 2, 4, 8, 16:

01 (содержит подпоследовательности 0 и 1)
0011 (содержит подпоследовательности 00, 01, 11, 10)
00010111 (000, 001, 010, 101, 011, 111, 110, 100)
0000100110101111

Граф де Брёйна

Существует удобная интерпретация последовательностей и циклов де Брёйна, основанная на так называемом графе де Брёйна — ориентированном графе с [math]k^n[/math] вершинами, соответствующими [math]k^n[/math] различных наборов длины [math]n[/math] с элементами из [math]\{0,\;1,\;\ldots,\;k-1\}[/math], в котором из вершины [math](x_1,\;\ldots,\;x_n)[/math] в вершину [math](y_1,\;\ldots,\;y_n)[/math] ребро ведёт в том и только том случае, когда [math]x_i=y_{i-1}[/math] ([math]i=2,\;\ldots,\;n[/math]); при этом самому ребру можно сопоставить набор длины [math]n+1[/math]: . Для такого графа не проходящие дважды через одно и то же ребро эйлеровы пути (эйлеровы циклы) соответствуют последовательности (циклу) де Брёйна с параметрами [math]n+1[/math] и [math]k[/math], а не проходящие дважды через одну и ту же вершину гамильтоновы пути (гамильтоновы циклы) — последовательности (циклу) де Брёйна с параметрами [math]n[/math] и [math]k[/math].

Граф де Брёйна широко применяется в биоинформатике в задачах сборки генома.

См. Также

Сверхбыстрый цифровой бор

2-3 дерево

Источники информации

M. L. Fredman and D. E. Willard. Surpassing the information theoretic barrier with fusion trees. Journal of Computer and System Sciences, 1993

MIT CS 6.897: Advanced Data Structures: Lecture 4, Fusion Trees, Prof. Erik Demaine (Spring 2003)

MIT CS 6.851: Advanced Data Structures: Lecture 12, Fusion Tree notes, Prof. Erik Demaine (Spring 2012)

А.С. Станкевич. Дополнительные главы алгоритмов, лекция 6

Wikipedia — Fusion tree

Wikipedia — De Bruijn sequence

@@ Строка 4: / Строка 4: @@
 * у всех вершин, кроме листьев, <tex>B = w^{1/5}</tex> детей,
 * время, за которое определяется, в каком поддереве находится вершина, равно <tex>O(1)</tex>.
-Такое время работы достигается за счет хранения дополнительной информации в вершинах. Построим цифровой бор из ключей узла дерева. Всего <tex>B - 1</tex> ветвящихся вершин. Биты, соответствующие уровням дерева,  в которых происходит ветвление, назовем существенными и обозначим их номера <tex>b_0, b_1\ldots b_{r-1}</tex>. Количество существенных битов <tex>r</tex> равно <tex>B - 1</tex> (все ребра на уровне детей ветвящейся вершины являются существенными битами).
+Такое время работы достигается за счет хранения дополнительной информации в вершинах. Построим [[:Сверхбыстрый_цифровой_бор|цифровой бор]] из ключей узла дерева. Всего <tex>B - 1</tex> ветвящихся вершин. Биты, соответствующие уровням дерева,  в которых происходит ветвление, назовем существенными и обозначим их номера <tex>b_0, b_1\ldots b_{r-1}</tex>. Количество существенных битов <tex>r</tex> равно <tex>B - 1</tex> (все ребра на уровне детей ветвящейся вершины являются существенными битами).
 [[Файл:Fusion.png||500x400px|center|визуализация функции sketch]]
@@ Строка 22: / Строка 22: @@
 Пусть <tex>\left \{ a_1,a_2\ldots a_k\right \}</tex> {{---}} множество ключей узла, отсортированных по возрастанию, <tex>q</tex> {{---}} ключ искомой вершины, <tex>l</tex> {{---}} количество бит в <tex>sketch(q)</tex>. Сначала найдем такой ключ <tex>a_i</tex>, что <tex>sketch(a_i) \leqslant sketch(q) \leqslant sketch(a_{i+1})</tex>. Но положение <tex>sketch(q)</tex> среди <tex>sketch(a_j)</tex> не всегда эквивалентно положению <tex>q</tex> среди <tex>a_j</tex>, поэтому, зная соседние элементы <tex>sketch(q)</tex>, найдем <tex>succ(q)</tex> и <tex>pred(q)</tex>.
 ===Параллельное сравнение===
-Найдем <tex>succ(sketch(q))</tex> и <tex>pred(sketch(q))</tex>. Определим <tex>sketch(node)</tex> как число, составленное из единиц и <tex>sketch(a_i)</tex>, то есть <tex>sketch(node) = 1sketch(a_1)1sketch(a_2)\ldots 1sketch(a_k)</tex>. Вычтем из <tex>sketch(node)</tex> число <tex>sketch(q) \times \underbrace{\overbrace{00\ldots 1}^{l + 1 bits}\overbrace{00\ldots 1}^{l + 1 bits}\ldots \overbrace{00\ldots 1}^{l + 1 bits}}_{k(l + 1)  bits} = 0sketch(q)\ldots 0sketch(q)</tex>. В начале каждого блока, где <tex>sketch(a_i) \geqslant sketch(q)</tex>, сохранятся единицы. Применим к получившемуся побитовое <tex>\land</tex> c <tex>\displaystyle \sum_{i=0}^{k-1}2^{i(l+1)+l}</tex>, чтобы убрать лишние биты.
+Найдем <tex>succ(sketch(q))</tex> и <tex>pred(sketch(q))</tex>. Определим <tex>sketch(node)</tex> как число, составленное из единиц и <tex>sketch(a_i)</tex>, то есть <tex>sketch(node) = 1sketch(a_1)1sketch(a_2)\ldots 1sketch(a_k)</tex>. Вычтем из <tex>sketch(node)</tex> число <tex>sketch(q) \times \underbrace{\overbrace{00\ldots 1}^{l + 1 bits}\overbrace{00\ldots 1}^{l + 1 bits}\ldots \overbrace{00\ldots 1}^{l + 1 bits}}_{k(l + 1)  bits} = 0sketch(q)\ldots 0sketch(q)</tex>. В начале каждого блока, где <tex>sketch(a_i) \geqslant sketch(q)</tex>, сохранятся единицы. Применим к получившемуся побитовое & c <tex>\displaystyle \sum_{i=0}^{k-1}2^{i(l+1)+l}</tex>, чтобы убрать лишние биты.
-<tex>L = (1sketch(a_1)\ldots 1sketch(a_k) - 0sketch(q)\ldots 0sketch(q))\land \displaystyle \sum_{i=0}^{k-1}2^{i(l+1)+l}=\overbrace{c_10\ldots0}^{l+1 bits} \ldots \overbrace{c_k0\ldots0}^{l+1 bits}</tex>
+<tex>L = (1sketch(a_1)\ldots 1sketch(a_k) - 0sketch(q)\ldots 0sketch(q))</tex>&<tex> \displaystyle \sum_{i=0}^{k-1}2^{i(l+1)+l}=\overbrace{c_10\ldots0}^{l+1 bits} \ldots \overbrace{c_k0\ldots0}^{l+1 bits}</tex>
 Если <tex>sketch(a_i)< sketch(q)</tex>, то <tex>c_i = 0</tex>, в противном случае <tex>c_i = 1</tex>.
@@ Строка 45: / Строка 45: @@
 * если <tex>q<a_j</tex> {{---}} найдем <tex>succ(e)</tex>, <tex>e = p10\ldots 00</tex>. Это будет <tex>succ(q)</tex>.
-Длина наибольшего общего префикса двух ''w''-битных чисел <tex>a</tex> и <tex>b</tex> может быть вычислена с помощью нахождения индекса наиболее значащего бита в побитовом \oplus <tex>a</tex> и <tex>b</tex>.
+Длина наибольшего общего префикса двух ''w''-битных чисел <tex>a</tex> и <tex>b</tex> может быть вычислена с помощью нахождения индекса наиболее значащего бита в побитовом <tex>\oplus a</tex> и <tex>b</tex>.
 ==Вычисление sketch(x)==
 Чтобы найти sketch за константное время, будем вычислять <tex>sketch(x)</tex>, имеющий все существенные биты в нужном порядке, но содержащий лишние нули.
-) уберем все несущественные биты <tex>x' = x \land \displaystyle \sum_{i=0}^{r-1}2^{b_i}</tex>,
+) уберем все несущественные биты <tex>x' = x </tex>&<tex> \displaystyle \sum_{i=0}^{r-1}2^{b_i}</tex>,
 ) умножением на некоторое заранее вычисленное число <tex>M = \displaystyle\sum_{i=0}^{r-1}2^{m_i}</tex> сместим все существенные биты в блок меньшего размера.
@@ Строка 56: / Строка 56: @@
 <tex>x'\times M = \displaystyle(\sum_{i=0}^{r-1}x_{b_i}2^{b_i})(\sum_{i=0}^{r-1}2^{m_i}) = \sum_{i=0}^{r-1}\sum_{j=0}^{r-1}x_{b_i}2^{b_i+m_j}</tex>,
-) применив побитовое <tex>\land</tex>, уберем лишние биты, появившиеся в результате умножения,
+) применив побитовое &, уберем лишние биты, появившиеся в результате умножения,
-<tex>\displaystyle\sum_{i=0}^{r-1}\sum_{j=0}^{r-1}x_{b_i}2^{b_i+m_j} \land \displaystyle\sum_{i=0}^{r-1}2^{b_i+m_i} = \sum_{i=0}^{r-1}x_{b_i}2^{b_i+m_i}</tex>,
+<tex>\displaystyle\sum_{i=0}^{r-1}\sum_{j=0}^{r-1}x_{b_i}2^{b_i+m_j} </tex>&<tex> \displaystyle\sum_{i=0}^{r-1}2^{b_i+m_i} = \sum_{i=0}^{r-1}x_{b_i}2^{b_i+m_i}</tex>,
 ) сделаем сдвиг вправо на <tex>m_0 + b_0</tex> бит.
@@ Строка 81: / Строка 81: @@
 '''1)''' Поиск непустых блоков.
-'''a.''' Определим, какие блоки имеют единицу в первом бите. Применим побитовое <tex>\land</tex> к <tex>x</tex> и константе <tex>F</tex>.
+'''a.''' Определим, какие блоки имеют единицу в первом бите. Применим побитовое & к <tex>x</tex> и константе <tex>F</tex>.
 <tex>$$
 \begin{array}{r}
-\land
+AND
 \begin{array}{r}
 x = 0101\; 0000\; 1000\; 1101\\
@@ Строка 213: / Строка 213: @@
 Граф де Брёйна широко применяется в биоинформатике в задачах сборки генома.
+==См. Также==
+*[[:Сверхбыстрый_цифровой_бор|Сверхбыстрый цифровой бор]]
+*[[:2-3_дерево|2-3 дерево]]
 == Источники информации ==

Fusion tree — различия между версиями

Версия 16:47, 5 июня 2015

Содержание

Структура

Поиск вершины

Параллельное сравнение

succ(q) и pred(q)

Вычисление sketch(x)

Индекс наиболее значащего бита

Циклы де Брёйна

Свойства

Примеры

Граф де Брёйна

См. Также

Источники информации

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты