Суффиксный массив — различия между версиями

Текущая версия на 19:43, 4 сентября 2022

Определение:

Cуффиксным массивом (англ. suffix array) строки называется массив целых чисел от до , такой, что суффикс — -й в лексикографическом порядке среди всех непустых суффиксов строки .

Содержание

1 Пример
2 Восстановление строки по суффиксному массиву
- 2.1 Вариант для бесконечного алфавита
  - 2.1.1 Доказательство корректности
  - 2.1.2 Псевдокод
- 2.2 Вариант для минимально возможного
3 Применения
4 См. также
5 Примечания
6 Источники

Пример

[math]s = abacaba[/math]

Значит, суффиксный массив для строки [math]s[/math] равен [math][7, 5, 1, 3, 6, 2, 4][/math].

Восстановление строки по суффиксному массиву

Задача:

Дан суффиксный массив некоторой строки , необходимо восстановить строку за время .

Вариант для бесконечного алфавита

Так как наш алфавит не ограничен, можно [math]i[/math]-й в лексикографическом порядке суффикс сопоставить с [math]i[/math]-й буквой в алфавите.

Доказательство корректности

Если отсортировать суффиксы, то первые буквы будут расположены в том же порядке, как и в алфавите.

Псевдокод

string fromSuffixArrayToString(int[] sa):
  for i = 1 to n
       s[sa[i]] = alphabet[i] 
  return s

Вариант для минимально возможного

Для начала вместо каждого символа строки поставим символ из бесконечного алфавита в промежуточную строку [math]tmp[/math], как в решении выше. Пусть, мы рассматриваем [math]i[/math]-й в лексикографическом порядке суффикс (т.е. и [math]i[/math]-й символ строки). Его первый символ будет равен первому символу предущего в лексикографическом порядке суффикса, если , т.е. и их строки без первого символа так же в лексикографическом порядке. Иначе он должен быть больше, т.к. рассматриваемый суффикс следующий в лексикографическом порядке.

Пример

Дан суффиксный массив [math][7, 5, 1, 3, 6, 2, 4][/math]. Цветами показаны места, после которых добавляются новые символы.

Псевдокод

string fromSuffixArrayToString(int[] sa):
  for i = 1 to n
       tmp[sa[i]] = alphabet[i]
  cur = 1
  s[sa[1]] = alphabet[1]
  for i = 2 to n
       j = sa[i - 1]
       k = sa[i]
       if tmp[j + 1] > tmp[k + 1] 
           cur++
       s[sa[i]] = alphabet[cur]       
  return s

Доказательство минимальности

Докажем от противного. Пусть, есть решение в котором использовано меньше букв. Тогда найдется позиция в которой, наше решение отличается от минимального, причем в минимальном остается та же буква, как в предыдущем суффиксе, а в нашем появляется новая. Рассмотрим эти два подряд идущих суффикса. В решении выше добавится новая буква, только если продолжение первого суффикса лексикографически больше, чем продолжение второго. Получается, что в минимальном решении первый суффикс лексикографически больше, чем второй, что неверно. Пришли к противоречию.

Применения

Поиск подстроки в строке

Основная статья: Алгоритм поиска подстроки в строке с помощью суффиксного массива

Подсчёт LCP для лексикографически соседних суффиксов

Основная статья: Алгоритм Касаи и др.

Число различных подстрок в строке

Вычисление числа различных подстрок в строке за время [math]O(|s| \log(|s|))[/math] и [math]O(|s|)[/math] дополнительной памяти с использованием LCP^[1].

Максимальная по длине ветвящаяся влево и вправо строка

Данная задача также может быть решена при помощи суффиксного дерева.

Самая длинная строка p, входящая в t дважды и не пересекаясь

Задача:

Поиск самой длинной строки , входящей в строку дважды и не пересекаясь.

Основные положения

Построим суффиксный массив строки [math]t[/math] и посчитаем на нем LCP. Для суффикса [math]s[/math] символом [math]s'[/math] будем обозначать индекс этого суффикса в суффиксном массиве.

Рассмотрим какие-нибудь суффиксы [math]i[/math] и [math]j[/math] строки [math]t[/math] такие, что [math]i' \leqslant j'[/math]. Будем говорить, что строка [math]s[/math] соответствует каким-нибудь суффиксам [math]i[/math] и [math]j[/math], если она равна максимальному префиксу этих суффиксов. Будем говорить, что суффиксы [math]i[/math] и [math]j[/math] соответствуют строке [math]s[/math], если [math]s[/math] входит в [math]t[/math] дважды и не пересекаясь, а суффиксы [math]i[/math] и [math]j[/math] соответствуют позициям этих вхождений.

Для произвольной строки [math]s[/math] и двух суффиксов, соответствующих ей, введем два условия:

Утверждение:

Строка входит в дважды и не пересекаясь тогда и только тогда, когда она удовлетворяет условию 1.

Необходимое условие:

Если строка [math]s[/math] входит в [math]t[/math] дважды и не пересекаясь, то один из суффиксов [math]i[/math] и [math]j[/math] хотя бы на [math]|s|[/math] длиннее другого. Т.е. условие 1 выполнено.

Достаточное условие:

Из того, что выполняется условие 1 следует, что один из суффиксов хотя бы на длиннее другого. При этом они оба начинаются со строки . Поэтому строка входит в дважды и не пересекаясь.

Утверждение:

Если строка является максимальной входящей в дважды, то она удовлетворяет условию 2.

Пусть это не так и (больше она быть не может). Тогда получим, что меньше, чем длина наибольшего общего префикса суффиксов и , чего быть не может по построению и .

Наивный алгоритм

Построим суффиксный массив, посчитаем на нём LCP.
Переберем все пары [math]i[/math] и [math]j[/math] такие, что они удовлетворяют условиям 1 и 2 и возьмем среди них максимум по длине строки.

Этот алгоритм можно реализовать за [math]O(n^3 + \mathrm{SA})[/math] или за [math]O(n^2 + \mathrm{SA})[/math], где [math]\mathrm{SA}[/math] — время построения суффиксного массива.

Оптимальное решение

Идея

Будем перебирать всевозможные подстроки [math]s[/math] строки [math]t[/math] такие, что они входят в [math]t[/math] дважды и удовлетворяют условию 2 при любых [math]i[/math] и [math]j[/math], где [math]i[/math] и [math]j[/math] — суффиксы, соответствующие двум любым вхождениям [math]s[/math] в [math]t[/math] (т.е. не обязательно непересекающимся). Для каждой такой строки [math]s[/math] попробуем найти [math]i[/math] и [math]j[/math], удовлетворяющие условию 1. Таким образом, мы рассмотрим все строки, соответствующие условиям 1 и 2, и, следовательно, найдем ответ. Алгоритм корректный.

Заметим теперь, что искомые строки [math]s[/math] — это префиксы суффиксов [math]k[/math] длины [math]lcp[k][/math]. Для того, чтобы найти для каждой такой строки [math]s[/math] суффиксы [math]i[/math] и [math]j[/math], удовлетворяющие условию 1, воспользуемся стеком.

Алгоритм

Будем идти по суффиксному массиву в порядке лексикографической сортировки суффиксов. В стеке будем хранить префиксы уже рассмотренных суффиксов [math]k[/math] длины [math]lcp[k'][/math] (т.е. строки [math]s[/math]) в порядке увеличения длины. Для каждой строки из стека также будем хранить минимальный по длине суффикс [math]i[/math] и максимальный по длине [math]j[/math]. Обозначим за [math]st[/math] вершину стека, а за [math]s[/math] — текущий рассматриваемый суффикс.
Возможны три случая:
- [math]|st| = lcp[s'][/math]
  Тогда просто обновляем [math]i[/math] и [math]j[/math] для вершины стека.
- [math]|st| \geqslant lcp[s'][/math]
  В этом случае добавляем новую вершину в стек и обновляем для неё [math]i[/math] и [math]j[/math].
- [math]|st| \leqslant lcp[s'][/math]
  Достаем вершину из стека и пробрасываем значения [math]i[/math] и [math]j[/math] из неё в новую вершину стека. Это нужно для того, чтобы не потерять значения [math]i[/math] и [math]j[/math], которые были посчитаны для строк большей длины, но так же актуальны для строк меньшей длины.
Если в какой-то момент [math]i[/math] и [math]j[/math] станут удовлетворять условию 1, обновляем ответ.

Оценка времени работы

Т.к. подсчёт [math]lcp[/math] выполняется за [math]O(n)[/math], и для каждого суффикса мы выполняем [math]O(1)[/math] операций, то итоговое время работы [math]O(n + \mathrm{SA})[/math], где [math]\mathrm{SA}[/math] — время построения суффиксного массива.

См. также

Примечания

↑ MAXimal :: algo :: Суффиксный массив :: Количество различных подстрок

Источники

Дэн Гасфилд — Строки, деревья и последовательности в алгоритмах: Информатика и вычислительная биология — СПб.: Невский Диалект; БХВ-Петербург, 2003. — 654 с: ил.
MAXimal :: algo :: Суффиксный массив
Википедия — Суффиксный массив
Wikipedia — Suffix array
Habrahabr — Суффиксный массив — удобная замена суффиксного дерева

[ref1-1] MAXimal :: algo :: Суффиксный массив :: Количество различных подстрок

[1]

@@ Строка 1: / Строка 1: @@
 {{Определение
 |definition=
-'''Cуффиксным массивом''' (англ. ''suffix array'') строки <tex>s[1 .. n]</tex> называется массив <tex>suf</tex> целых чисел от <tex>1</tex> до <tex>n</tex>, такой, что суффикс <tex>s[suf[i]..n]</tex> — <tex>i</tex>-й в лексикографическом порядке среди всех непустых суффиксов строки <tex>s</tex>.}}
+'''Cуффиксным массивом''' (англ. ''suffix array'') строки <tex>s[1 .. n]</tex> называется массив <tex>suf</tex> целых чисел от <tex>1</tex> до <tex>n</tex>, такой, что суффикс <tex>s[suf[i]..n]</tex> — <tex>i</tex>-й в [[Лексикографический_порядок|лексикографическом]] порядке среди всех непустых суффиксов строки <tex>s</tex>.}}
 == Пример ==
@@ Строка 41: / Строка 41: @@
          tmp[sa[i]] = alphabet[i]
     cur = 1
-    s[1] = alphabet[1]
+    s[sa[1]] = alphabet[1]
     '''for''' i = 2 '''to''' n
          j = sa[i - 1]
@@ Строка 47: / Строка 47: @@
          '''if''' tmp[j + 1] > tmp[k + 1]
              cur++
-         s[i] = alphabet[cur]
+         s[sa[i]] = alphabet[cur]
     '''return''' s
@@ Строка 54: / Строка 54: @@
 == Применения ==
-Здесь и далее <tex>\mathrm{SA}</tex> {{---}} время построения суффиксного массива.
 === Поиск подстроки в строке ===
@@ Строка 61: / Строка 59: @@
 {{main|Алгоритм поиска подстроки в строке с помощью суффиксного массива}}
-=== Подсчет LCP для лексикографически соседних суффиксов ===
+=== Подсчёт LCP для лексикографически соседних суффиксов ===
 {{main|Алгоритм Касаи и др.}}
@@ Строка 115: / Строка 113: @@
 # Переберем все пары <tex>i</tex> и <tex>j</tex> такие, что они удовлетворяют условиям 1 и 2 и возьмем среди них максимум по длине строки.
-Этот алгоритм можно реализовать за <tex>O(n^3)</tex> или за <tex>O(n^2)</tex>.
+Этот алгоритм можно реализовать за <tex>O(n^3 + \mathrm{SA})</tex> или за <tex>O(n^2 + \mathrm{SA})</tex>, где <tex>\mathrm{SA}</tex> {{---}} время построения суффиксного массива.
 ==== Оптимальное решение ====
 ===== Идея =====
-Будем перебирать всевозможные подстроки <tex>s</tex> строки <tex>t</tex> такие, что они входят в <tex>t</tex> дважды и удовлетворяют условию 2 при любых <tex>i</tex> и <tex>j</tex>, где <tex>i</tex> и <tex>j</tex> {{---}} суффиксы, соответствующие двум любым вхождениям <tex>s</tex> в <tex>t</tex> (т.е. не обязательно непересекающимся).Для каждой такой строки <tex>s</tex> попробуем найти <tex>i</tex> и <tex>j</tex>, удовлетворяющие условию 1.
+Будем перебирать всевозможные подстроки <tex>s</tex> строки <tex>t</tex> такие, что они входят в <tex>t</tex> дважды и удовлетворяют условию 2 при любых <tex>i</tex> и <tex>j</tex>, где <tex>i</tex> и <tex>j</tex> {{---}} суффиксы, соответствующие двум любым вхождениям <tex>s</tex> в <tex>t</tex> (т.е. не обязательно непересекающимся). Для каждой такой строки <tex>s</tex> попробуем найти <tex>i</tex> и <tex>j</tex>, удовлетворяющие условию 1.
 Таким образом, мы рассмотрим все строки, соответствующие условиям 1 и 2, и, следовательно, найдем ответ. Алгоритм корректный.
@@ Строка 129: / Строка 127: @@
 # Возможны три случая:
 #* <tex>|st| = lcp[s']</tex><br>Тогда просто обновляем <tex>i</tex> и <tex>j</tex> для вершины стека.
-#* <tex>|st| \geqslant lcp[s']</tex><br>В этом случае добавляем новую вершину в стек и обновляем для нее <tex>i</tex> и <tex>j</tex>.
+#* <tex>|st| \geqslant lcp[s']</tex><br>В этом случае добавляем новую вершину в стек и обновляем для неё <tex>i</tex> и <tex>j</tex>.
-#* <tex>|st| \leqslant lcp[s']</tex><br>Достаем вершину из стека и ''пробрасываем'' значения <tex>i</tex> и <tex>j</tex> из нее в новую вершину стека. Это нужно для того, чтобы не потерять значения <tex>i</tex> и <tex>j</tex>, которые были посчитаны для строк большей длины, но так же актуальны для строк меньшей длины.
+#* <tex>|st| \leqslant lcp[s']</tex><br>Достаем вершину из стека и ''пробрасываем'' значения <tex>i</tex> и <tex>j</tex> из неё в новую вершину стека. Это нужно для того, чтобы не потерять значения <tex>i</tex> и <tex>j</tex>, которые были посчитаны для строк большей длины, но так же актуальны для строк меньшей длины.
 # Если в какой-то момент <tex>i</tex> и <tex>j</tex> станут удовлетворять условию 1, обновляем ответ.
 ===== Оценка времени работы =====
-Т.к. построение суффиксного массива и подсчет <tex>lcp</tex> выполняется за <tex>O(n)</tex> и для каждого суффикса мы выполняем <tex>O(1)</tex> операций, то итоговое время работы <tex>O(n)</tex>.
+Т.к. подсчёт <tex>lcp</tex> выполняется за <tex>O(n)</tex>, и для каждого суффикса мы выполняем <tex>O(1)</tex> операций, то итоговое время работы <tex>O(n + \mathrm{SA})</tex>, где <tex>\mathrm{SA}</tex> {{---}} время построения суффиксного массива.
 ==См. также==

Суффиксный массив — различия между версиями

Текущая версия на 19:43, 4 сентября 2022

Содержание

Пример

Восстановление строки по суффиксному массиву

Вариант для бесконечного алфавита

Доказательство корректности

Псевдокод

Вариант для минимально возможного

Пример

Псевдокод

Доказательство минимальности

Применения

Поиск подстроки в строке

Подсчёт LCP для лексикографически соседних суффиксов

Число различных подстрок в строке

Максимальная по длине ветвящаяся влево и вправо строка

Самая длинная строка p, входящая в t дважды и не пересекаясь

Основные положения

Наивный алгоритм

Оптимальное решение

Идея

Алгоритм

Оценка времени работы

См. также

Примечания

Источники

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты