
У каждого есть свой личный список программ, которые он первым делом ставит на свежий компьютер. Я не исключение: за годы работы с Python у меня появился свой «джентльменский набор» для анализа данных. Рассказываю о тех библиотеках и инструментах, с которых всегда начинаю подготовку нового ноутбука или ПК для своих проектов.
Jupyter/IPython
Jupyter — находка для всех, кто любит совмещать код, заметки и графику в одном живом «блокноте». Именно так сегодня работают почти все исследователи и дата-сайентисты: запускаешь кусочек кода, сразу видишь результат, можешь вернуться, поправить анализ прямо на лету.
Jupyter поддерживает десятки языков, но я чаще всего использую Python для анализа данных и статистики. А вообще, Jupyter вырос из IPython — оболочки, которая делает работу с питоном еще приятнее и интерактивнее. Мой обычный сценарий: быстрые опыты — в IPython, для сохранения и публикации результатов — Jupyter notebooks.
Mamba
Хотя это не совсем Python-инструмент, Mamba здорово выручает при первой настройке окружения. На Linux системный Python обычно предназначен для служебных задач — если поставить что-то поверх, легко угробить ОС. С Mamba можно создавать отдельные «песочницы» с нужными пакетами и без труда переключаться между разными проектами — больше не боюсь поломать систему.
NumPy
NumPy — основа всех научных вычислений в Python. Это своего рода «Matlab на минималках», который уже давно стал стандартом в инженерии и науке. Здесь удобно работать с массивами, создавать матрицы и вектора, решать системы уравнений, вычислять средние, медианы и любую базовую статистику — буквально за пару строк.
Самое главное — NumPy плотно интегрирован с другими инструментами для анализа данных, о которых дальше и пойдет речь.
SciPy
SciPy — это почти универсальный «швейцарский нож» для научной работы на Python. Чаще всего я использую его для более сложной статистики: например, чтобы найти моду (самое часто встречающееся значение) или применить функции, которых в NumPy нет.
У меня есть массив «a»? С помощью SciPy получить моду — вопрос одной строки. Удобно, что тут уже есть все популярные распределения: нормальное, биномиальное, распределение Стьюдента и другие. Забудьте о бумажных таблицах статистик — всё считается прямо тут.
SymPy
NumPy и SciPy — мастера численных расчетов, а вот SymPy превращает Python в полноценный инструмент для символьной математики. Аналог дорогих пакетов вроде Wolfram Mathematica, только бесплатно и прямо в вашем коде! Можно упрощать формулы, решать уравнения, брать производные и интегралы, работать с выражениями как с математическими объектами — все прямо в Python.
Такая мощь нужна не каждый день, но если хочется глубже понять математику или статистику, SymPy просто незаменим. Например, я иногда выводил формулы для линейной регрессии вручную — прямо здесь, прежде чем запускать итоговые вычисления. Отличный инструмент для самостоятельного обучения!
pandas
Для меня pandas зачастую важнее, чем даже легендарный NumPy. Эта библиотека делает работу с табличными (прямоугольными) данными такой же легкой, как в Excel или базах данных. Загрузить CSV или Excel — дело пары секунд, и вот уже данные у вас в DataFrame.
Внутри есть куча встроенных функций для первой статистики (оценка средних, медиан и др.), а для простых графиков можно обойтись даже без отдельных библиотек.
seaborn
Про Seaborn я уже как-то рассказывал, но не могу не повторить: если нужно быстро и красиво визуализировать статистику — это лучший друг аналитика. По сути, это надстройка над известной Matplotlib, только пользоваться гораздо проще. Выбрали тип графика, задали данные — и всё готово.
Например, чтобы построить диаграмму рассеяния с линией регрессии для анализа чаевых — буквально одна команда.
Pingouin
Pingouin — незаменим, когда надо провести статистический тест и сразу получить понятный отчет. Например, интересуют коэффициенты линейной регрессии — просто вызываю функцию linear_regression из Pingouin, и все наглядно.
Кроме регрессии, здесь легко запускать популярные тесты — t-критерий Стьюдента, критерий хи-квадрат и другие.
statsmodels
statsmodels — настоящий ветеран среди Python-библиотек для статистики. Его главное достоинство — мощные методы моделирования и анализ (например, многообразная линейная регрессия). Результаты можно сразу сверять с R — расхождений минимум, а для многих будет удобен похожий синтаксис формул.
Эти библиотеки сделали мой анализ данных значительно проще и интереснее. Уверен, этот список не изменится и на моем следующем компьютере!
Если вам понравилась эта статья, подпишитесь, чтобы не пропустить еще много полезных статей!
Премиум подписка — это доступ к эксклюзивным материалам, чтение канала без рекламы, возможность предлагать темы для статей и даже заказывать индивидуальные обзоры/исследования по своим запросам!
Подробнее о том, какие преимущества вы получите с премиум подпиской, можно узнать здесь
Также подписывайтесь на нас в:
- Telegram: https://t.me/gergenshin
- Youtube: https://www.youtube.com/@gergenshin
- Яндекс Дзен: https://dzen.ru/gergen
- Официальный сайт: https://www-genshin.ru







