Изменения

← Предыдущая правка

Примеры кода на R

11 928 байт добавлено, 19:17, 4 сентября 2022

м

rollbackEdits.php mass rollback

Язык постоянно расширяется за счёт новых библиотек (пакетов). Для импорта одного пакета необходимо прописать в файле следующие строки:

~~<pre>~~ install.packages("packageName") require("packageName")</~~pre~~font>)

Для того чтобы импортировать пакет с его зависимостями в код следует включить следующие строки:

~~<pre>~~ library("packageName")</~~pre~~font>)

== Описание известных пакетов ==

===Пакеты для обработки данных===

==== Pipelearner ====

Пакет <code>Pipelearner</code><ref>[https://github.com/drsimonj/pipelearner Pipelearner github repository]</ref> предоставляет базовые возможности для разбиения набора данных на блоки для обучения моделей. В основе пакета лежит концепция работы конвейера. Принцип работы очень прост и описывается 3 шагами: # '''Инициализация'''#: Функция <code>pipelearner()</code> инициализирует новый объект, который используется в следующих функциях обработки. На этом этапе необходимо указать датасет, с которым производится работа. Также можно указать набор обучающих моделей и предсказываемую модель данных.# '''Настройка'''#: Для настройки есть 3 основных функции:#* <code>learn_cvpairs()</code> отвечает за [[Кросс-валидация|кросс-валидацию]]. Функция генерирует набор пар из тестовой и обучающей выборки на основе входного датасета. #: В качестве ядра разделения можно использовать <code>crossv_mc</code> ([[Кросс-валидация#Случайные разбиения (Random subsampling)|случайные разбиения]]), <code>crossv_kfold</code> ([[Кросс-валидация#k-fold кросс-валидация|k-fold кросс-валидация]]) или <code>crossv_loo</code> ([[Кросс-валидация#Кросс-валидация по отдельным объектам (Leave-One-Out)|leave-one-out разбиения]]) из пакета <code>modelr</code><ref>[https://github.com/tidyverse/modelr Modelr github repository]</ref>. Но если данных способов недостаточно, можно написать свою функцию разбиения.#* <code>learn_curves()</code> служит для настройки [[Переобучение#Кривые обучения|кривых обучения]]. Используется метод увеличивающихся пропорций относительно начала датасета.#: Например, вызов <code>learn_curves(.5, .75, 1)</code> создаст <tex>3</tex> сценария работы: в первом будет взята первая половина выбоки, во втором {{---}} первые <tex>\frac{3}{4}</tex> объектов, и в третьем {{---}} вся выборка. Авторы пакета утверждают, что брать случайные объекты выборки не имеет смысла, потому что выборка уже случайно разбита с помощью <code>learn_cvpairs()</code>.#* <code>learn_models()</code> предназначен для добавления новых обучающих моделей. # '''Обучение'''#: С помощью функции <code>learn()</code> все сконструированные ранее модели обучаются и выдается таблица результатов работы В итоге работа с пакетом выглядит приблизительно следующим образом: # Load the dependencies library(pipelearner) library(dplyr) iris %>% # Use iris dataset pipelearner() %>% # Initialize a blank pipelearner object learn_cvpairs(crossv_mc, n = 50) %>% # Creating 50 random cross-validation pairs learn_curves(seq(.5, 1, by = .1)) %>% # Copy each cv-pair to be fitted in sample size proportions of .5 to 1 in increments of .1. learn_models(lm, Sepal.Width ~ .*.) %>% # Use regression modell learn_models(rpart::rpart, Sepal.Width ~ .) %>% # Use decision tree modell learn() # Fit all models on all partitions and return the results Пакет хорошо документирован, все непонятные моменты можно прояснить, просто изучив структуру объекта на каждом этапе работы алгоритма.

==== MICE ====

Пакет <code>MICE</code><ref>[https://cran.r-project.org/web/packages/mice/mice.pdf MICE package documentation]</ref> используется для заполнения пропущенных значений в данных. При этом нет необходимости думать о типах значений: для каждого из них в пакете предусмотрено заполнение по умолчанию. Принцип работы основан на методе множественного восстановления<ref>[https://en.wikipedia.org/wiki/Imputation_(statistics)#Multiple_imputation Multiple Imputation]</ref>. Пропущенные данные заполняются не один, а несколько раз. После этого, каждый из полученных наборов обучается на определенной модели. Затем, результаты агрегируются и выдаются итоговые параметры модели. Стандартный процесс работы выглядит так: # Load the dependencies library(mice) # Impute the missing data m times imp <- mice(nhanes, m = 5) # Analize completed datasets using linear model fit <- with(imp, lm(chl ~ bmi + age)) # Combine parameter estimates est <- pool(fit) # Print summary of estimation summary(est)

==== Ggplot2 ====

Данный пакет<ref>[https://cran.r-project.org/web/packages/ggplot2/index.html Ggplot2 main info page]</ref> используется для отрисовки данных и графиков.

=== Пакеты с реализованными алгоритмами машинного обучения ===

==== Caret ====

==== RandomForest ====

<code>RandomForest</code> <ref>[https://cran.r-project.org/web/packages/randomForest/index.html RandomForest package main info]</ref> — пакет с реализацией алгоритма ''[[Дерево решений и случайный лес | ~~randomForest~~случайного леса]]''. Используется для решения задач регрессии и классификации, а также для поиска аномалий и отбора предикторов.

==== ClusterR ====

Пакет <code>ClusterR</code> <ref>[https://cran.r-project.org/web/packages/ClusterR/vignettes/the_clusterR_package.html ClusterR documentation]</ref> состоит из алгоритмов кластеризации на основе центроидов (''[[Кластеризация#Метод K-средних (Алгоритм Ллойда) |метод K-средних]]'' (k-means''), ''mini-batch-kmeans'', ''k-medoids'') и распределений (''GMM''). Кроме того, пакет предлагает функции для:

* проверки результатов,

* построения графика результатов, используя ''[[Оценка качества в задаче кластеризации |метрики]]''

==== E1071 ====

Пакет <ref>[https://www.rdocumentation.org/packages/e1071/versions/1.7-3 1071 package documentation]</ref> содержит в себя функции для анализа классов, ''кратковременного преобразование Фурье'', ''нечеткой кластеризации'', реализации ''[[Метод опорных векторов (SVM) | ~~SVM~~метода опорных векторов]]'', ''вычисления кратчайшего пути'', а также реализации ''[[Байесовская_классификация#Наивный байесовский классификатор | наивного байесовского классификатора]]''.

==== Mlr ====

==== H2O ====

В пакете <code>H20</code> <ref>[https://cran.r-project.org/web/packages/h2o/index.html H20 main info page]</ref> представлены линейные модели, такие как ''[[Бустинг, AdaBoost |градиентный бустинг]]'', ''[[Метод главных компонент (PCA)|~~PCA~~метод главных компонент]]''(PCA), ''GLRM'', ''~~KNN~~[[Метрический классификатор и метод ближайших соседей|метод k ближайших соседей]]'', ''[[Дерево решений и случайный лес|~~RadomForest~~случайный лес]]'', ''[[Байесовская_классификация#Наивный байесовский классификатор | наивный ~~Байесовский~~ байесовский классификатор]]''. Сильная сторона этой библиотеки – {{---}} работа с большими объемами данных и поддержка многопоточных вычислений. Однако в ней нет возможности задавать параметры используемых алгоритмов

== Примеры алгоритмов ==

==== Линейная регрессия ====

~~<pre>~~

~~#$$reading data~~

~~data <- read.csv("input.csv", sep = ',', header = FALSE)~~

~~#evaluating linear regression model~~

~~model <- lm(data$x ~ data$y)~~

~~#getting summary~~

~~print(summary(model))~~

# reading data data <- read.csv("input.csv", sep = ',', header = FALSE) # evaluating linear regression model model <- lm(data$x ~ data$y) # getting summary print(summary(model)) #visualizing data plot(data$y, data$x) lines(data$y, predict(fit), col = 'red')</~~pre~~font>)

==== Множественная регрессия ====

~~<pre>~~

~~#$$reading data~~

~~rdata <- read.csv("input.csv", sep = ',', header = FALSE)~~

# reading data rdata <- read.csv("input.csv", sep = ',', header = FALSE) #evaluating regression model model <- lm(target ~ x + y + z, data = rdata) #getting summary print(summary(model))~~</pre>~~

==== Логистическая регрессия ====

Логистическая регрессия – это модель регрессии, в которой переменная ответа принимает значения 0 или 1 (True или False). Реализация на языке <code>R</code> представлена в следующем фрагменте:

<~~pre~~font color="gray">#$$reading data rdata <- read.csv("input.csv", sep = ',', header = FALSE) #evaluating model model = glm(formula = target ~ x + y + z, data = rdata, family = binomial) #printing summary print(summary(model))~~</pre>~~ ~~=== PCA ==={{Main||Метод главных компонент (PCA)||ll:PCA}}<pre>#importing library and its' dependencieslibrary(h2o)h2o.init(~~)

~~path <- system.file("extdata", "data.csv", package~~ = ~~"h2o")~~== Метод главных компонент ===~~data <- h2o.uploadFile~~{{Main|Метод главных компонент (~~path~~ PCA)|ll= ~~data)~~PCA}}

# importing library and its' dependencies library(h2o) h2o.init() path <- system.file("extdata", "data.csv", package = "h2o") data <- h2o.uploadFile(path = data) #evaluating h2o.prcomp(training_frame = data, k = 8, transform = "STANDARDIZE")</~~pre~~font>)

=== Деревья решений, случайный лес ===

==== Деревья решений ====

Для создания ''[[Дерево решений и случайный лес |деревьев решений]]'' в <code>R</code> используется функция <code>ctree()</code> из пакета <code>party</code>.

<~~pre~~font color="gray">#importing package install.packages("party") #reading data rdata <- read.csv("input.csv", sep = ',', header = FALSE) #evaluating model output.tree <- ctree(target ~ x + y + z, data = rdata) #plotting results plot(output.tree)~~</pre>~~

==== Случайный лес ====

Для создания ''[[Дерево решений и случайный лес|случайного леса]]'' необходимо импортировать пакет <code>randomForest</code>

<~~pre~~font color="gray">#importing packages install.packages("party") install.packages("randomForest") #reading data rdata <- read.csv("input.csv", sep = ',', header = FALSE) #creating the forest output.forest <- randomForest(target ~ x + y + z, data = rdata) #getting results print(output.forest) ~~</pre>~~

=== Наивный Бейесовский классификатор ===

<~~pre~~font color="gray">#$$importing package and it's dependencies library(e1071) #reading data data <- read.csv("input.csv", sep = ',', header = FALSE) #splitting data into training and test data sets index <- createDataPartition(y = data$target, p = 0.8,list = FALSE) training <- data[index,] testing <- data[-index,] #create objects x and y for predictor and response variables x = <- training[,-9] y = <- training$target #training model model = <- train(x,y,'nb',trControl =trainControl(method ='cv',number = 10)) #predicting results predictions <- predict(model, newdata = testing)~~</pre>~~

=== ~~SVM~~ Метод опорных векторов ===~~<pre>#$$ importing package and its' dependencieslibrary~~{{Main|Метод опорных векторов (~~caret~~SVM)|ll=SVM}}

# importing package and its' dependencies library(caret) #reading data data <- read.csv("input.csv", sep = ',', header = FALSE) # splitting data into train and test sets index <- createDataPartition(y = data$target, p = 0.8, list = FALSE) training <- data[index,] testing <- data[-index,] # evaluating model fit <- train(target ~ x + y + z, data = train_flats, method = "svmRadial", trControl = trainControl(method = "repeatedcv", number = 10, repeats = 3)) # printing parameters print(fit)

~~#splitting data into train and test setsindex <- createDataPartition(y~~ = ~~data$target, p~~=~~0.8, list~~ = ~~FALSE)~~Бустинг ===~~training <- data[index~~{{Main|Бустинг,]~~testing <- data[-index,]~~AdaBoost|ll=Бустинг}}

~~#evaluating model~~ ~~fit~~ <~~- train(target ~ x + y + z,~~ ~~data = train_flats,~~ ~~method~~ font color= "~~svmRadial~~gray", ~~trControl = trainControl(method = "repeatedcv", number = 10, repeats = 3))~~ >#~~printing parametersprint(fit)~~loading libraries</~~pre>~~ ~~=== GBM ===<pre~~font>~~#loading libraries~~ install.packages("mlr") library(mlr) #loading data train <- read.csv("input.csv") test <- read.csv("testInput.csv") #loading GBM getParamSet("classif.gbm") baseLearner <- makeLearner("classif.gbm", predict.type = "response") #specifying parameters controlFunction <- makeTuneControlRandom(maxit = 50000)#specifying tuning method cvFunction <- makeResampleDesc("CV",iters = 100000) #definig cross-validation function gbmParameters<- makeParamSet( makeDiscreteParam("distribution", values = "bernoulli"), makeIntegerParam("n.trees", lower = 100, upper = 1000), #number of trees makeIntegerParam("interaction.depth", lower = 2, upper = 10), #depth of tree makeIntegerParam("n.minobsinnode", lower = 10, upper = 80), makeNumericParam("shrinkage",lower = 0.01, upper = 1) ) #tunning parameters gbmTuningParameters <- tuneParams(learner = baseLearner, task = trainTask, resampling = cvFunction, measures = acc, par.set = gbmParameters, control = controlFunction) #creating model parameters model <- setHyperPars(learner = baseLearner, par.vals = gbmTuningParameters) #evaluating model fit <- train(model, train) predictions <- predict(fit, test)~~</pre>~~

=== Кластеризация ===

Для реализации алгоритма кластеризации ''k-средних'' используется пакет <code>ClusterR</code>. В нем реализовано 2 функции: <code>KMeans_arma()</code> и <code>KMeans_rcpp()</code>. В примере далее рассмотрена реализация с использованием функции <code>KMeans_arma()</code>.

<~~pre~~font color="gray">#$$ importing package and its' dependencies library(ClusterR) #reading data data <- read.csv("data.csv") #evaluating model model = <- KMeans_arma(data, clusters = 2, n_iter = 10, seed_mode = "random_subset", verbose = T, CENTROIDS = NULL) #predicting results predictions = <- predict_KMeans(test_data, model) ~~</pre>~~

==См. также==

*[[:Примеры кода на Scala|Примеры кода на Scala]]

*[[:Примеры кода на Java|Примеры кода на Java]]

*[[:Примеры кода на Kotlin|Примеры кода на Kotlin]]

*[[:Обзор библиотек для машинного обучения на Python|Обзор библиотек для машинного обучения на Python]]

Maintenance script

1632

правки

Изменения

Примеры кода на R

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты