Без этих 9 Python-библиотек мой анализ данных невозможен: всё, что ставлю в первую очередь!

Иллюстрация: логотип Python в окружении элементов анализа данных — столбчатые графики, круговая диаграмма, увеличительное стекло, едва заметные иконки NumPy, pandas, SciPy, Jupyter на фоне.

У каждого есть свой личный список программ, которые он первым делом ставит на свежий компьютер. Я не исключение: за годы работы с Python у меня появился свой «джентльменский набор» для анализа данных. Рассказываю о тех библиотеках и инструментах, с которых всегда начинаю подготовку нового ноутбука или ПК для своих проектов.

Jupyter/IPython

Jupyter notebook с анализом цен.

Jupyter — находка для всех, кто любит совмещать код, заметки и графику в одном живом «блокноте». Именно так сегодня работают почти все исследователи и дата-сайентисты: запускаешь кусочек кода, сразу видишь результат, можешь вернуться, поправить анализ прямо на лету.

Jupyter поддерживает десятки языков, но я чаще всего использую Python для анализа данных и статистики. А вообще, Jupyter вырос из IPython — оболочки, которая делает работу с питоном еще приятнее и интерактивнее. Мой обычный сценарий: быстрые опыты — в IPython, для сохранения и публикации результатов — Jupyter notebooks.

Mamba

Установка IPython в окружение Mamba для статистики.

Хотя это не совсем Python-инструмент, Mamba здорово выручает при первой настройке окружения. На Linux системный Python обычно предназначен для служебных задач — если поставить что-то поверх, легко угробить ОС. С Mamba можно создавать отдельные «песочницы» с нужными пакетами и без труда переключаться между разными проектами — больше не боюсь поломать систему.

NumPy

Генерация случайного числа с помощью NumPy.

NumPy — основа всех научных вычислений в Python. Это своего рода «Matlab на минималках», который уже давно стал стандартом в инженерии и науке. Здесь удобно работать с массивами, создавать матрицы и вектора, решать системы уравнений, вычислять средние, медианы и любую базовую статистику — буквально за пару строк.

Самое главное — NumPy плотно интегрирован с другими инструментами для анализа данных, о которых дальше и пойдет речь.

SciPy

Главная страница SciPy.

SciPy — это почти универсальный «швейцарский нож» для научной работы на Python. Чаще всего я использую его для более сложной статистики: например, чтобы найти моду (самое часто встречающееся значение) или применить функции, которых в NumPy нет.

У меня есть массив «a»? С помощью SciPy получить моду — вопрос одной строки. Удобно, что тут уже есть все популярные распределения: нормальное, биномиальное, распределение Стьюдента и другие. Забудьте о бумажных таблицах статистик — всё считается прямо тут.

SymPy

Разложение биномиального выражения с помощью SymPy — создание треугольника Паскаля.

NumPy и SciPy — мастера численных расчетов, а вот SymPy превращает Python в полноценный инструмент для символьной математики. Аналог дорогих пакетов вроде Wolfram Mathematica, только бесплатно и прямо в вашем коде! Можно упрощать формулы, решать уравнения, брать производные и интегралы, работать с выражениями как с математическими объектами — все прямо в Python.

Такая мощь нужна не каждый день, но если хочется глубже понять математику или статистику, SymPy просто незаменим. Например, я иногда выводил формулы для линейной регрессии вручную — прямо здесь, прежде чем запускать итоговые вычисления. Отличный инструмент для самостоятельного обучения!

pandas

Набор данных по авокадо с добавленным столбцом месяца.

Для меня pandas зачастую важнее, чем даже легендарный NumPy. Эта библиотека делает работу с табличными (прямоугольными) данными такой же легкой, как в Excel или базах данных. Загрузить CSV или Excel — дело пары секунд, и вот уже данные у вас в DataFrame.

Внутри есть куча встроенных функций для первой статистики (оценка средних, медиан и др.), а для простых графиков можно обойтись даже без отдельных библиотек.

seaborn

Линия регрессии и диаграмма рассеяния чаевых в ресторанах через Seaborn.

Про Seaborn я уже как-то рассказывал, но не могу не повторить: если нужно быстро и красиво визуализировать статистику — это лучший друг аналитика. По сути, это надстройка над известной Matplotlib, только пользоваться гораздо проще. Выбрали тип графика, задали данные — и всё готово.

Например, чтобы построить диаграмму рассеяния с линией регрессии для анализа чаевых — буквально одна команда.

Pingouin

Результаты регрессии чаевых и счета через Pingouin.

Pingouin — незаменим, когда надо провести статистический тест и сразу получить понятный отчет. Например, интересуют коэффициенты линейной регрессии — просто вызываю функцию linear_regression из Pingouin, и все наглядно.

Кроме регрессии, здесь легко запускать популярные тесты — t-критерий Стьюдента, критерий хи-квадрат и другие.

statsmodels

Результаты регрессии между чаем и счетом в Jupyter notebook через statsmodels.

statsmodels — настоящий ветеран среди Python-библиотек для статистики. Его главное достоинство — мощные методы моделирования и анализ (например, многообразная линейная регрессия). Результаты можно сразу сверять с R — расхождений минимум, а для многих будет удобен похожий синтаксис формул.

Эти библиотеки сделали мой анализ данных значительно проще и интереснее. Уверен, этот список не изменится и на моем следующем компьютере!

Если вам понравилась эта статья, подпишитесь, чтобы не пропустить еще много полезных статей!

Премиум подписка — это доступ к эксклюзивным материалам, чтение канала без рекламы, возможность предлагать темы для статей и даже заказывать индивидуальные обзоры/исследования по своим запросам!

Подробнее о том, какие преимущества вы получите с премиум подпиской, можно узнать здесь

Также подписывайтесь на нас в:

Алекс Бежбакин
Оцените автора
Добавить комментарий