Рубрика «R» - 4

Несколько соображений по поводу параллельных вычислений в R применительно к «enterprise» задачам

2019-08-04 в 19:47, admin, рубрики: big data, data mining, data science, R, параллельное программирование

Параллельные или распределенные вычисления — вещь сама по себе весьма нетривиальная. И среда разработки должна поддерживать, и DS специалист должен обладать навыками проведения параллельных вычислений, да и задача должна быть приведена к разделяемому на части виду, если таковой существует. Но при грамотном подходе можно весьма ускорить решение задачи однопоточным R, если у вас под руками есть хотя бы многоядерный процессор (а он есть сейчас почти у всех), с поправкой на теоретическую границу ускорения, определяемую законом Амдала. Однако, в ряде случаев даже его можно обойти.

Является продолжением предыдущих публикаций.Читать полностью »

Иерархическая кластеризация категориальных данных в R

2019-07-29 в 13:35, admin, рубрики: big data, clustering, data science, R, segmentation, visualization, Блог компании OTUS. Онлайн-образование

Перевод подготовлен для студентов курса «Прикладная аналитика на R».

Иерархическая кластеризация категориальных данных в R - 1

Это была моя первая попытка выполнить кластеризацию клиентов на основе реальных данных, и она дала мне ценный опыт. В Интернете есть множество статей о кластеризации с использованием численных переменных, однако найти решения для категориальных данных, работа с которыми несколько сложнее, оказалось не так просто. Методы кластеризации категориальных данных еще только разрабатываются, и в другом посте я собираюсь попробовать еще один.
Читать полностью »

Отчёты по состоянию СХД с помощью R. Параллельные вычисления, графики, xlsx, email и всё вот это

2019-07-29 в 9:18, admin, рубрики: EMC, powershell, R, отчеты, параллельное программирование, СХД

В статье приведён код по формированию регулярных отчётов по состоянию дисков СХД EMC VNX с альтернативными подходами и историей создания.

Старался писать код с максимально подробными комментариями и одним файлом. Только пароли свои подставить. Формат исходных данных также указан, так что буду рад, если кто-то попробует применить у себя.

Внешний вид графика

Читать полностью »

Как выбрать случайное число от 1 до 10

2019-07-10 в 19:53, admin, рубрики: R, Алгоритмы, ГСЧ, лайфхак, математика

Представьте, что вам нужно сгенерировать равномерно распределённое случайное число от 1 до 10. То есть целое число от 1 до 10 включительно, с равной вероятностью (10%) появления каждого. Но, скажем, без доступа к монетам, компьютерам, радиоактивному материалу или другим подобным источникам (псевдо) случайных чисел. У вас есть только комната с людьми.

Предположим, что в этой комнате чуть более 8500 студентов.

Самое простое — попросить кого-нибудь: «Эй, выбери случайное число от одного до десяти!». Человек отвечает: «Семь!». Отлично! Теперь у вас есть число. Однако вы начинаете задаваться вопросом, является ли оно равномерно распределённым?
Читать полностью »

В чем разница между исследователем данных и статистиком?

2019-07-09 в 13:11, admin, рубрики: big data, data scientist, R, аналитик, Блог компании OTUS. Онлайн-образование

Всем привет. Открыт набор на новый курс от Otus — "Прикладная аналитика на R", который стартует уже в конце этого месяца. В связи с этим хочу поделиться переводом публикации о разнице между аналитиком по данным и статистиком, который в свою очередь использует R на практике.

Введение

За последние десять лет объемы данных и скорость их появления росли по экспоненте. Если верить отчетам, каждый день появляется более 3 квинтиллионов байтов данных! Неудивительно, что для работы с ними появилась новая профессия исследователя данных (data scientist) — разностороннего специалиста по анализу и обработке данных. Однако люди занимались статистикой и до появления цифровых средств обработки данных. В чем же различия этих двух профессий: исследователь данных и статистик?

Давайте разберемся.

Читать полностью »

Визуализация количества побед у команд НБА с помощью анимационных столбиковых диаграмм в R

2019-07-05 в 9:23, admin, рубрики: big data, data science, R, визуализация данных

Для начала небольшая вводная информация. Меня зовут Владислав и моё знакомство с R состоялось в августе прошлого года. Изучать язык программирования я решил по причине прикладного характера. Мне с детства нравилось вести спортивную статистику. С возрастом это увлечение трансформировалось в желание как-то анализировать эти цифры и на основе анализа данных выдавать, по возможности, умные мысли. Проблема в том, что спорт в последние годы захлестнула волна данных, десятки компаний соревнуются между собой, пытаясь посчитать, описать и запихнуть в нейронку любое действие футболиста, баскетболиста, бейсболиста на площадке. И Excel для анализа не подходит категорически. Так что я решил изучать R, чтобы простейший анализ не занимал полдня. Уже в ходе изучения добавился интерес к программированию как таковому, но это уже лирика.

Читать полностью »

Data Science Digest (July 2019)

2019-07-02 в 10:19, admin, рубрики: AI, big data, BigData, data science, machine learning, python, R, Алгоритмы, анализ данных, Большие данные, видео, дайджест, искусственный интеллект, машинное обучение, Мероприятия, Новости, статьи

Data Science Digest (July 2019) - 1

Приветствую всех!

Лето в полном разгаре, и если вы планируете быть в Одессе 5-го июля, приглашаю вас на ODS митап и дата-бар, который организовывает одесская ODS.ai команда. Напоминаю, что у дайджеста есть свой Telegram-канал и страницы в соцсетях (Facebook, Twitter, LinkedIn, Medium), где я ежедневно публикую ссылки на полезные материалы. Присоединяйтесь!

А пока предлагаю свежую подборку материалов под катом.
Читать полностью »

Парсим 25Tb с помощью AWK и R

2019-06-17 в 12:09, admin, рубрики: awk, big data, R, spark, Блог компании Mail.Ru Group, высокая производительность, никто не читает теги, Облачные вычисления, обработка данных

Как читать эту статью: прошу прощения за то, что текст получился таким длинным и хаотичным. Чтобы сэкономить ваше время, я каждую главу начинаю со вступления «Чему я научился», в котором одним-двумя предложениями излагаю суть главы.

«Просто покажи решение!» Если вы хотите всего лишь увидеть, к чему я пришёл, то переходите к главе «Становлюсь изобретательнее», но я считаю, что интереснее и полезнее почитать про неудачи.

Недавно мне поручили настроить процесс обработки большого объёма исходных последовательностей ДНК (технически это SNP-чип). Нужно было быстро получать данные о заданном генетическом местоположении (которое называется SNP) для последующего моделирования и прочих задач. С помощью R и AWK мне удалось очистить и организовать данные естественным образом, сильно ускорив обработку запросов. Далось мне это нелегко и потребовало многочисленных итераций. Эта статья поможет вам избежать некоторых моих ошибок и продемонстрирует, что же у меня в конце концов получилось.
Читать полностью »

Занимательная археология: стилевое руководство R под лупой

2019-06-01 в 16:55, admin, рубрики: R, история R, история языков программирования, стилевые гиды, стиль кода, фичи

Как известно, код читают намного чаще, чем пишут. Чтобы его мог читать хоть кто-то, кроме автора, и существуют стилевые гиды. Для R таковым может быть, например, руководство Хэдли.

Стилевой гид это не просто негласный договор разработчиков – за многими из правил стоит любопытная предыстория. Почему стрелка <- лучше знака равенства =, почему старожилы R не любят нижнее подчеркивание, как рекомендуемая длина строки связана с перфокартой, и о многом другом – далее.
Читать полностью »

Ежедневные отчёты по состоянию виртуальных машин с помощью R и PowerShell

2019-06-01 в 10:46, admin, рубрики: powershell, R, vSphere, виртуализация, отчеты

Вступление

День добрый. Уже пол года у нас работает скрипт (точнее набор скриптов), генерирующий отчёты по состоянию виртуальных машин (и не только). Решил поделиться опытом создания и самим кодом. Рассчитываю на критику и на то, что данный материал может быть кому-то полезным.

Читать полностью »

Информация

Обсуждаемое

Рекомендуем

Рубрика «R» - 4

Несколько соображений по поводу параллельных вычислений в R применительно к «enterprise» задачам

Иерархическая кластеризация категориальных данных в R

Отчёты по состоянию СХД с помощью R. Параллельные вычисления, графики, xlsx, email и всё вот это

Как выбрать случайное число от 1 до 10

В чем разница между исследователем данных и статистиком?

Введение

Визуализация количества побед у команд НБА с помощью анимационных столбиковых диаграмм в R

Data Science Digest (July 2019)

Парсим 25Tb с помощью AWK и R

Занимательная археология: стилевое руководство R под лупой

Ежедневные отчёты по состоянию виртуальных машин с помощью R и PowerShell

Вступление

Архив

Информация

Обсуждаемое

Рекомендуем

Рубрика «R» - 4

Введение

Вступление

Новости

Актуальные темы

Архив