Версия 21:02, 29 июня 2022

Набор данных содержит в себе единицы измерения, которые отбрасываются, чтобы набор данных был просто числами. Но чтобы далее работать, нам нужно, чтобы все объекты были приведены к единому формату. С этим и помогает нормализация.

Нормализация применяется независимо к столбцу X.

Важно в sklearn.preprocessing есть метод normalize, но это не то, что нам нужно, он рассматривает нормализацию с геометрической точки зрения (представляет объект в виде вектора), а не по столбцам.

Минмакс, [0;1] масштабирование

После нормализации: [math]\min[X_{new}] = 0[/math] и [math]\max[X_{new}] = 1[/math]

Стандартизация, Z-масштабирование

После нормализации: [math]\mathbb{E}[X_{new}] = 0[/math] и [math]\mathbb{D}[X_{new}] = 1[/math]

Декорреляция

Процесс, который используется для уменьшения корреляции.

рис.1 Декорреляция

1. Есть матрица X.

2. Матрицу центрировали ([math]\mathbb{E}[X_j] = 0[/math]).

3. Ковариация вычисляется по следующей формуле:

4. Если же матрица нормализована так, что [math]\mathbb{D}[X_j] = 1[/math], то из произведения мы получим не ковариационную, а корреляционную матрицу

5. Декорреляция вычисляется по формуле:

где [math]\Sigma^{1/2}[/math] находится из разложения Холецкого

Утверждение:

После декорреляции:

[math]\Sigma = \dfrac{X^TX}{n}[/math]

.

@@ Строка 1: / Строка 1: @@
-Применяются независимо к столбцу X
+Набор данных содержит в себе единицы измерения, которые отбрасываются, чтобы набор данных был просто числами. Но чтобы далее работать, нам нужно, чтобы все объекты были приведены к единому формату. С этим и помогает '''нормализация'''.
+Нормализация применяется независимо к столбцу X.
 Важно в sklearn.preprocessing есть метод normalize, но это не то, что нам нужно, он рассматривает нормализацию с геометрической точки зрения
-(представляет объект в виде вектора), а не по столбцам
+(представляет объект в виде вектора), а не по столбцам.
@@ Строка 17: / Строка 19: @@
 = Декорреляция =
+Процесс, который используется для уменьшения корреляции.
 [[File:Декорреляция.png|300px|thumb|рис.1 Декорреляция]]

Нормализация набора данных — различия между версиями

Версия 21:02, 29 июня 2022

Декорреляция

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты