Алгоритм МакКрейта — различия между версиями

Версия 20:59, 2 мая 2014

Эта статья находится в разработке!

Алгоритм МакКрейта — алгоритм построения суффиксного дерева для заданной строки [math]s[/math] за линейное время. Отличается от алгоритма Укконена тем, что добавляет суффиксы в порядке убывания длины.

Теоретическое обоснование

Заметим, что если два суффикса имеют [math]lcp[/math] (largest common prefix) общих символов, то в построенном суффиксном дереве они будут иметь наименьшего общего предка на этой глубине. Будем рассматривать суффиксы в порядке убывания длины, тогда имеет смысл узнавать наибольшее [math]lcp[/math] с новым суффиксом среди всех суффиксов, добавленных раньше.

Определение:

— максимальный префикс и среди всех .

Пусть мы знаем [math]head_i[/math] и место в дереве, которое ему соответствует. Если позиция находится на ребре, разрежем его, а потом добавим новую вершину.

Считать [math]head_i[/math] по определению было бы очень затруднительно, но существует способ значительно сократить вычисления.

Лемма:

Пусть , тогда — префикс .

Доказательство:

При [math]h=0[/math], очевидно, пустая строка является префиксом любой другой.
Пусть [math]h \gt 0[/math]. Из определения [math]head_i[/math] существует суффикс , имеющий [math]h[/math] общих символов с . Тогда будет иметь с общий префикс длины [math]h-1[/math]. Поскольку любой общий префикс будет по определению также являться и префиксом [math]head_{i+1}[/math], получаем искомое утверждение.

Если нам известны суффиксные ссылки [math]u.suf[/math] для каждой вершины [math]u[/math], мы можем быстро перейти от позиции [math]head_i[/math] к ее суффиксу и продолжить сравнение символов оттуда. Если бы новая позиция [math]head_i[/math] всегда оказывалась существующей вершиной построенного дерева, этот алгоритм бы уже работал, но в реальности можно оказаться на середине ребра, для которой суффиксная ссылка неизвестна. Для нахождения ее суффиксной ссылки на следующей итерации мы сначала перейдем к предку, пройдем по суффиксной ссылке, а уже затем будем продолжать сравнение.

Алгоритм

Для удобства реализации вместе с корнем [math]root[/math] создадим вспомогательную вершину [math]superRoot[/math], обладающую свойствами:

[math]root.suf = superRoot[/math]
Для любого символа [math]c[/math] из вершины [math]superRoot[/math] есть ребро в корень.

Будем поддерживать инвариант:

Для всех вершин, кроме, возможно, последней добавленной [math]head_i[/math], известны суффиксные ссылки.
Суффиксная ссылка всегда ведет в вершину, а не в середину ребра.

При добавлении каждого следующего суффикса будем выполнять следующие шаги:

Если суффиксная ссылка [math]head_{i-1}[/math] не определена:
1. Поднимемся вверх к ее предку;
2. Пройдем по суффиксной ссылке;
3. Спустимся вниз на столько символов, сколько мы прошли вверх к предку (fast scanning).
4. Если мы оказались посередине ребра, разрежем его и добавим вершину.
5. Установим суффиксную ссылку для [math]head_{i-1}[/math]
Иначе просто пройдем по суффиксной ссылке.
Будем идти по дереву вниз, пока либо не будет перехода по символу, либо очередной символ на ребре не совпадет с символом нового суффикса (slow scanning)
Добавим ребро/разрежем существующее, запомним новую позицию [math]head_i[/math] и добавим оставшуюся часть суффикса в качестве листа.

Утверждение:

Инвариант алгоритма сохраняется

Инвариант мог бы нарушиться только в случае, если бы не существовало вершины в суффиксной ссылке для [math]head_{i-1}[/math], но мы продолжили бы сканирование по ребру дальше и получили две вершины [math]head_{i-1}.suf, head_i[/math] с неопределенными суффиксными ссылками.

Покажем, что это невозможно. Рассмотрим, что значит, что остановилась посередине ребра. Это означает, что все суффиксы , которые дошли до этого места, имеют совпадающие символы, по определению отличающиеся от символа суффикса . Тогда и должен отличаться в этом символе, значит .

Асимптотическая оценка

В приведенном алгоритме используется константное число операций на добавление одного суффикса, не считая slow scanning и fast scanning.

Slow scanning делает операций, что суммарно дает операций.

Fast scanning работает с целыми ребрами, поэтому будем использовать в качестве потенциала глубину в вершинах. Из структуры суффиксного дерева мы знаем, что суффиксная ссылка может уменьшить глубину вершины не более, чем на [math]1[/math], так что мы на каждой итерации поднимаемся не более, чем на [math]2[/math] — один раз к предку, а потом по суффиксной ссылке, что составляет [math]O(n)[/math] за весь алгоритм. Соответственно, спустимся мы тоже суммарно [math]O(n)[/math] раз, так как и максимальная глубина составляет [math]O(n)[/math].

Итоговая асимптотика алгоритма — [math]O(n)[/math].

Сравнение с другими алгоритмами

Является первым асимптотически оптимальным алгоритмом. В сравнении с алгоритмом Укконена:

Преимущества: мы строим суффиксное дерево в явной форме, что может облегчить понимание алгоритма.
Недостатки: является offline алгоритмом, то есть требует для начала работы всю строку целиком.

Источники

См. также

Алгоритм МакКрейта — различия между версиями

Версия 20:59, 2 мая 2014

Содержание

Теоретическое обоснование

Алгоритм

Асимптотическая оценка

Сравнение с другими алгоритмами

Источники

См. также

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты