Изменения

Поиск k-ой порядковой статистики за линейное время

1312 байт добавлено, 18:52, 5 июня 2015

Нет описания правки

~~{{Определение~~Алгоритм был разработан Мануэлем Блюмом (Manuel Blum), Робертом Флойдом (Robert Floyd), Воганом Рональдом Праттом (Vaughan Ronald Pratt), Роном Ривестом (Ron Rivest), Робертом Тарьяном (Robert Tarjan).~~|definition~~==Идея алгоритма==~~'''~~Этот алгоритм является модификацией алгоритма [[Поиск k-ой порядковой статистики|поиска k-ой порядковой статистики]]. Важное отличие заключается в том, что время работы алгоритма в наихудшем случае — <tex>O(n)</tex>, где <tex>kn</tex>~~-ой порядковой статистикой~~— количество элементов в множестве. Главная идея алгоритма заключается в том, чтобы ''гарантировать'' ~~набора элементов линейно упорядоченного множества называется~~ хорошее разбиение массива. Алгоритм выбирает такой ~~его~~ рассекающий элемент, ~~который является~~ что количество чисел, которые меньше рассекающего элемента, не менее <tex>k\dfrac{3n}{10}</tex>~~-ым элементом набора в порядке сортировки~~. Элементов же больших опорного элемента, также не менее <tex>\dfrac{3n}{10}~~== Историческая справка ==~~</tex>. Благодаря этому алгоритм работает за линейное время в любом случае.

'''Алгоритм Блюма-Флойда-Пратта-Ривеста-Тарьяна''' (BFPRT-алгоритм) создан Мануэлем Блюмом (Manuel Blum), Робертом Флойдом (Robert Floyd), Воганом Рональдом Праттом (Vaughan Ronald Pratt), Роном Ривестом (Ron Rivest) и Робертом Тарьяном (Robert Tarjan) в 1973 году.

~~==Особенность алгоритма==~~

Этот алгоритм почти ни чем не отличается от алгоритма [[Поиск k-ой порядковой статистики|поиска k-ой порядковой статистики]], но имеет важное отличие в том, что время работы алгоритма в наихудшем случае равно <tex>O(n)</tex> (это будет доказано ниже). Главная идея алгоритма заключается в том, чтобы ''гарантировать'' хорошее разбиение массива. Алгоритм выбирает такой рассекающий элемент, что количество чисел, которые меньше рассекающего элемента, не менее <tex>\frac{3n}{10}</tex>, где <tex>n</tex> количество элементов в массиве, благодаря этому алгоритм работает за линейной время в любом случае.

== Описание алгоритма ==

#Все <tex>n</tex> элементов входного массива разбиваются на группы по пять элементов, в последней группе будет <tex>n\bmod 5</tex> элементов. Эта группа может оказаться пустой при <tex> ~~mod~~n</tex> кратным <tex> 5</tex> ~~элементов~~.#Сначала сортируется каждая группа, затем ~~выбираем медиану в~~ из каждой ~~из этих групп~~группы выбирается медиана.#Путем рекурсивного вызова шага 1 определяется медиана <tex>x</tex> из множества медиан(верхняя медиана в случае чётного количества), найденных на втором шаге. Найденный элемент массива <tex>x</tex> - используется как рассекающий ~~элемент,~~ (за <tex>i</tex> - обозначим его индекс рассекающего элемента.(Если медиан окажется четное количество, то переменной <tex>x</tex> будет присвоено значение верхней медианы).)#~~Делим массив~~ Массив делится относительно рассекающего элемента <tex>x</tex>. Все элементы меньшие <tex>x</tex> будут находиться левее <tex>x</tex> в массиве и будут иметь меньший индекс и наоборот,если элементы больше <tex>x</tex>.#Если <tex>i~~</tex> <tex>~~=~~</tex> <tex>~~k</tex>, то возвращается значение <tex>x</tex>. Иначе ~~вызывается~~ запускается рекурсивно ~~шаг 1, и выполняется~~ поиск элемента в одной из частей массива: <tex>k</tex>-~~го в порядке возрастания элемента~~ ой статистики в левой части ~~массива,если~~ при <tex>i~~</tex> <tex~~><k</tex> или <tex>(k- i - 1)</tex>~~, или~~ -ой статистики в правой части~~, если~~ при <tex>i<~~/tex> <tex>></tex> <tex>~~k</tex>. ===~~Псевдокод~~Пример работы алгоритма === ~~select(L,k)~~ { ~~if (length(L) <= 10)~~ { ~~sort L~~ ~~return the element in the kth position // вернем элемент, находящийся~~ Рассмотрим работу алгоритма на ~~k-ой позиции;~~ } ~~partition L into subsets S[i] of five elements each // разобьем L на подмножества S[i] размером 5 по 5 элементов;~~ ~~(there will be n/5 subsets total).~~ ~~for (i = 1 to n/5) do~~ ~~x[i] = select(S[i],3) //найдем медианы S[i];~~ ~~M = select({x[i]}, n/10) // M - рассекающий элемент;~~ ~~partition L into L1~~массиве из <~~M, L2=M, L3~~tex>~~M // разобьем L на подмножества L1, где все элементы меньше M;~~ ~~if (k~~ 25 <~~= length(L1))~~ /~~/ L3, где все элементы больше M и L2 равное M;~~ ~~return select(L1,k)~~ ~~else if (k~~ tex> ~~length(L1)+length(L2))~~ ~~return select(L3~~элементов,~~k-length(L1)-length(L2))~~обозначенных кружками. ~~else return M // элемент на k-ой позиции в исходном массиве;~~ }~~===Пример===~~

На вход подается массив, разобьем элементы на группы по 5 элементов.

Отсортируем элементы каждой группы и выберем медианы. ~~Вызовемся рекурсивно~~ Полученные медианы групп отмечены белыми кружками. [[Файл:поиск.png| 300px]] Рекурсивно вызовемся от медиангрупп и получим рассекающий элемент. На рисунке он обозначен белым кружком, внутри которого изображен символ <tex> x </tex>.

~~[[Файл:BFPRT2.png| 300px]]~~

~~Разобьем на группы по 5 медианы~~[[Файл:поиск2.~~Отсортируем элементы каждой группы и выберем медианы~~png| 300px]]

~~[[Файл:BFPRT~~На рисунке обозначены закрашенные области, в левом верхнем и в правом нижнем углах. В эти области попали все элементы, которые точно меньше или больше рассекающего элемента, соответственно. В каждой области по <tex> 8 </tex> элементов, всего же в массиве <tex> 25 </tex>, то есть мы получили хорошее (то есть соответствующее нашему утверждению) разбиение массива относительно опорного элемента, так как <tex> 8 > </tex> <tex>\dfrac{3 \cdot 25}{10}</tex>. Теперь докажем, что алгоритм также хорошо выбирает опорный элемент и в общем случае.~~png| 80px]]~~

~~Выберем~~ Cначала определим нижнюю границу для количества элементов, превышающих по величине рассекающий элемент <tex>x</tex>. В общем случае как минимум половина медиан, найденных на втором шаге, больше или равны медианы медиан<tex>x</tex>. ~~В итоге мы получили один~~ Таким образом, как минимум <tex>\dfrac{n}{10}</tex> групп содержат по <tex>3</tex> превышающих величину <tex>x</tex>, за исключение группы, в которой меньше <tex>5</tex> элементов и ещё одной группы, содержащей сам элемент ~~равный~~ <tex>40x</tex>. ~~Это и есть рассекающий элемент~~Таким образом получаем, что количество элементов больших <tex>x</tex>, не менее <tex>\dfrac{3n}{10}</tex>.

Проведя аналогичные рассуждения для элементов, которые меньше по величине, чем рассекающий элемент <tex>x</tex>, мы получим, что как минимум <tex>\dfrac{3n}{10}</tex> меньше, чем элемент <tex>x</tex>. Теперь проведем анализ времени работы алгоритма.

[[Файл:поиск5.png| 300px]]

== Анализ времени работы алгоритма ==

Пусть <tex>T(n)</tex> - — время работы алгоритма для <tex>n</tex> элементов, тогда оно не больше, чем сумма:

# времени работы на сортировку групп и разбиение по рассекающему элементу, то есть <tex>Cn</tex>;

# времени работы для поиска медианы медиан, то есть <tex>T</tex><tex>\left(\~~frac~~dfrac{n}{5}\right)</tex>;# времени работы для поиска <tex>k</tex>-го элемента в одной из двух частей массива, то есть <tex>T(s)</tex>, где <tex>s</tex>- — количество элементов в этой части. Но <tex>s</tex> не превосходит <tex>\~~frac~~dfrac{7n}{10}</tex>, так как чисел, меньших рассекающего элемента, не менее <tex>\~~frac~~dfrac{3n}{10}</tex> - — это <tex>\~~frac~~dfrac{n}{10}</tex> медиан, меньших медианы медиан, плюс не менее <tex>\~~frac~~dfrac{2n}{10}</tex> элементов, меньших этих медиан. С другой стороны, чисел, больших рассекающего элемента, так же не менее <tex>\~~frac~~dfrac{3n}{10}</tex>, следовательно <tex> s \le leqslant </tex> <tex>\~~frac~~dfrac{7n}{10}</tex>, то есть в худшем случае <tex> s = </tex> <tex>\~~frac~~dfrac{7n}{10}</tex>.

Тогда получаем, что

<tex>T(n) \le leqslant T</tex><tex>\left(\~~frac~~dfrac{n}{5}\right) </tex><tex> + T</tex><tex>\left(\~~frac~~dfrac{7n}{10}\right) </tex><tex> + Cn </tex>

Покажем, что для всех <tex> n </tex> выполняется неравенство <tex>T(n) \le leqslant 10Cn </tex>.

Докажем по индукции:

# ~~Очевидно~~Предположим, что ~~для малых~~ наше неравенство <tex> T(n ) \leqslant 10Cn </tex> выполняется ~~неравенство~~ при малых <tex>T(n~~) \le 10Cn~~ </tex> , для некоторой достаточно большой константы <tex> C </tex>. # Тогда, по предположению индукции, <tex>T</tex><tex>\left(\~~frac~~dfrac{n}{5}\right) </tex> <tex> \le leqslant 10C(</tex><tex>\~~frac~~dfrac{n}{5}) </tex> <tex> = 2Cn</tex> и <tex> T</tex><tex>\left(\~~frac~~dfrac{7n}{10}\right) </tex> <tex> \le leqslant 10C(</tex><tex>\~~frac~~dfrac{7n}{10}) </tex> <tex> = 7Cn</tex>, тогда<tex>T(n) \le leqslant T</tex><tex>\left(\~~frac~~dfrac{n}{5}\right) </tex> <tex> + T</tex><tex>\left(\~~frac~~dfrac{7n}{10}\right) </tex> <tex> + Cn = 2Cn + 7Cn + Cn = 10Cn \Rightarrow T(n) \le leqslant 10Cn</tex>

Так как <tex>T(n) \le leqslant 10Cn </tex>, то время работы алгоритма <tex>O(n)</tex>

== ~~Ссылки~~ Источники инфомации==* Кормен, Т., Лейзерсон, Ч., Ривест, Р., Штайн, К. '''Алгоритмы: построение и анализ''' {{---}} Вильямс, 2013. {{---}} 1328 с. {{---}} ISBN 978-5-8459-1794-2* [http://en.wikipedia.org/wiki/BFPRT#Linear_general_selection_algorithm_-_Median_of_Medians_algorithm Wikipedia — Selection algorithm ~~— Wikipedia~~]

[[Категория: Дискретная математика и алгоритмы]]

[[Категория: Сортировки]]

[[Категория: Другие сортировки]]

Анонимный участник

194.85.161.2

Изменения

Поиск k-ой порядковой статистики за линейное время

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты