Идеальное хеширование

Определение:

Идеальная хеш-функция — хеш-функция, которая без коллизий отображает различные элементы из множества объектов на множество ключей за времени в худшем случае.

Постановка задачи

Необходимо проверять наличие элемента (скажем, слова из словаря) за гарантировано константное время. При этом подразумевается, что набор данных в таблице статичен либо изменяется очень редко.

Основная идея

Будем использовать двухуровневую схему хеширования с универсальным хешированием на каждом уровне.

Первый уровень

Используется тот же принцип, что и в случае хеширования с цепочками: [math]n[/math] ключей хешируются в [math]m[/math] ячеек с использованием хеш-функции [math]h[/math], выбранной из семейства универсальных хеш-функций. Сама хеш-функция будет иметь вид .

Второй уровень

На данном уровне будем использовать вторичную хеш-таблицу [math]S_j[/math] со своей функций [math]h_j[/math]. [math]S_j[/math] будет хранить все ключи, хешированные в ячейку [math]j[/math]. Соответственно, хеш-функция будет вида .

При корректном выборе хеш-функции первого уровня ожидаемое количество требуемой для хеш-таблицы памяти будет [math]O(n)[/math].

Необходимые условия

Для того, чтобы гарантировать отсутствие коллизий на втором уровне, требуется, чтобы размер [math]m_j[/math] хеш-таблицы [math]S_j[/math] был равен квадрату числа [math]n_j[/math] ключей, хешированных функцией [math]h[/math] в ячейку [math]j[/math]. Благодаря такому подходу, так как ни в одной из вторичных таблиц нет ни одной коллизии, время поиска в худшем случае будет равно константе.

Хеш-функция первого уровня выбирается из множества [math]H_{p,m}[/math], где [math]p[/math] - простое число, превышающее значение любого из ключей. Ключи, хешированные функцией [math]h[/math] в ячейку [math]j[/math], затем повторно хешируются во вторичную хеш-таблицу [math]S_j[/math] размером [math]m_j[/math] с использованием хеш-функции [math]h_j[/math] , выбранной из множества [math]H_{p,m_j}[/math].

Теоретическое обоснование

Теорема:

Если ключей сохраняются в хеш-таблице размером c использованием хеш-функции , случайно выбранный из универсального множества хеш-функций, то вероятность возникновения коллизий не превышает .

Доказательство:

Всего имеется [math]\dbinom{n}{2}[/math] пар ключей, которые могут вызвать коллизию. Если хеш-функция выбрана случайным образом из универсального семейства хеш-функций [math]H[/math], то для каждой пары вероятность возникновения коллизии равна [math]{1 \over m}[/math]. Пусть [math]X[/math] — случайная величина, которая подсчитывает количество коллизий. Если [math]m = n^2[/math], то математическое ожидание числа коллизий равно

Это является очень хорошим результатом, если хотя бы вспомнить на примере парадокса дней рождения о том, что вероятность коллизий растет крайне быстро по сравнению с размером хеш-таблицы.

Теорема:

Если мы сохраняем ключей в хеш-таблице в хеш-таблице размеров c использованием хеш-функции , выбираемой случайным образом из универсального множества хеш-функций, то , где — количество ключей, хешированных в ячейку .

Доказательство:

Первый переход в равенстве мы совершили благодаря формуле . Далее мы воспользовались свойствами математического ожидания, в частности - линейности.

Очевидно, что - просто общее количество коллизий, поэтому по свойству универсального хеширования математическое ожидание значения этой суммы не превышает А так как [math]m = n[/math], то

, ч.т.д.

Теперь выведем 2 следствия из этой теоремы.

Теорема:

Если мы сохраняем ключей в хеш-таблице размером с использованием хеш-функции , выбираемой случайным образом из универсального множества хеш-функций, и устанавливаем размер каждой вторичной хеш-таблицы равным , то математическое ожидание количества необходимой для вторичных хеш-таблиц в схеме идеального хеширования памяти не превышает .

Доказательство:

Поскольку [math]m_j=n_j^2[/math] для [math]j=0,1,...,m-1[/math], согласно предыдущей теореме:

, ч.т.д.

Теорема:

Если мы сохраняем ключей в хеш-таблице размером с использованием хеш-функции , выбираемой случайным образом из универсального множества хеш-функций, и устанавливаем размер каждой вторичной хеш-таблицы равным , то вероятность того, что общее количество необходимой для вторичных хеш-таблиц памяти не менее , меньше чем .

Доказательство:

Применим неравенство Маркова

Пусть и [math]t=4n[/math].

Тогда , ч.т.д.

См. также

Ссылки

Т. Кормен. «Алгоритмы. Построение и анализ» второе издание, Глава 11.5, стр. 308
Д.Э. Кнут. «Искусство программирования: Сортировка и поиск" Том 3, Глава 6.4, стр. 563
Perfect hash function — Wikipedia
Universal and Perfect Hashing
Универсальное хэширование. Идеальное хэширование

Идеальное хеширование

Постановка задачи

Основная идея

Первый уровень

Второй уровень

Необходимые условия

Теоретическое обоснование

См. также

Ссылки

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты