Изменения

Предварительная обработка данных

2085 байт добавлено, 18:49, 29 июня 2022

Нет описания правки

= Преобразование числа =

Обычно с числами довольно удобно работать и преобразовывают их достаточно редко.

'''Дискретизация'''

* Преобразование в порядковый признак. (берём в числах диапазоны и диапазонам сопоставляем категории)

* Преобразование в категориальный признак. ('''НО''' теряется информация о порядке)

= Преобразование порядкового типа =

[[File:Преобразование_порядкового_типа_в_k_категорий.png|250px|thumb|рис1. (A<B<C)]]

* Преобразование в число(берём его порядковый номер)

* Преобразование в k бинарных категорий(если число значений конечно и равно k):

<tex>c_i(ord) := (ord < ord_i), где </tex>{<tex>ord_1, ..., ord_k</tex>} - множество значений порядкового признака.(см. рис1)

= Преобразование категории =

[[File:Преобразование_небинарной_категории_в_бинарную.png|250px|thumb|рис2. (A<B<C)]]

* Бинарную категорию можно преобразовать в число: <tex>c_1 \Rightarrow 0, c_2 \Rightarrow 1</tex> или <tex>c_1 \Rightarrow -1, c_2 \Rightarrow +1</tex>

* Категорию из k значений {<tex>c_1, ..., c_k</tex>} можно '''бинаризовать''' получив k бинарных категорий:<tex>b_i(c) := (c = c_i)</tex>(см. рис2)('''НО''' обратное преобразование иногда невозможно(получим много true и не понятно, к какой категории относить))

* One-hot encoding - преобразование категорий в числа (0, 1): one-hot<tex>_i(c) = [c = c_i]</tex>

= Базовые методы нормализации данных =

Применяются независимо к столбцу X

= Декорреляция =

[[File:Декорреляция.png|300px|thumb|~~рис1~~рис3]]

1. Есть матрица X.

Kirill112002

42

правки

Изменения

Предварительная обработка данных

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты