Python. Библиотека Pandas, часть 1
Первое знакомство c анализом данных в библиотеке Pandas
Мы начинаем знакомиться с Pandas — главной библиотекой Python для анализа данных.
Это очень удобный и не самый сложный в освоении инструмент дата-журналиста. Он позволяет работать с данными в привычном для нас табличном виде. В Pandas можно изучить набор данных, почистить его, внести изменения, проанализировать и сделать выводы, построить графики и многое другое.
В отличие от Excel, где тоже широкие возможности для работы с данными, Pandas справится даже с очень большими файлами, в которых сотни тысяч и миллионы строк. Стандартному Excel такое не под силу, как и работа с файлами в формате json — именно в таком формате часто хранятся открытые данные. Например, на сайте ГосРасходы данные о государственных контрактах и субсидиях можно выгрузить только в json.
Мы посвятим библиотеке Pandas несколько уроков. Сегодня будет первое знакомство: мы научимся делать самые базовые вещи в Pandas, с которыми уже можно анализировать реальные данные.
1. Создаём датафреймы с нуля
Для начала загрузим библиотеку pandas, сокращенно будем обращаться к ней pd.
Если вы работаете не через Анаконду, загружайте Pandas командой pip3 install pandas.
В Pandas данные представлены в виде датафрейма, или таблицы с данными. Её можно создать с нуля, например, из словарей, списков или кортежей.
Создадим свой первый датафрейм для трех крупнейших городов России. Перед нами словарь, в котором ключами являются city и population, а значениями — списки с названиями этих городов и численностью населения, которая им соответствует.
В первом столбце указан индекс (порядковый номер), а остальное выглядит, как привычная таблица.
Также можно создать датафрейм из списка списков.
На этот раз значения записались построчно, и удобнее будет поменять местами строки и столбцы, то есть транспонировать.
Теперь мы знаем, как создать датафрейм с нуля. Но на практике его обычно приходится загружать из файла в форматах excel, csv или json.
2. Создаем датафрейм из файла
Сегодня мы будем работать с данными по смертности людей от разных причин. Перейдем на сайт Института оценки показателей здоровья США и выберем нужные показатели смертности по странам.
Выберем такие показатели:
- Location: Countries and territories (Страны и территории)
- Year: 2000-2019
- Content: Cause (причина смерти)
- Age: All ages
- Metric: Rate (число смертей от определенной причины на 100 тысяч жителей)
- Measure: Deaths (смерти)
- Sex: Male, Female, Both
- Cause: level 2 causes (2 уровень детализации причин смерти)
Дальше кликнем Download csv (скачать в формате csv).
Нужно поставить галочки, соглашаясь не использовать данные в коммерческих целях, выбрать Names и ввести почту.
Данные могут прийти не сразу, поэтому тот же самый датасет можно скачать по ссылке. Это большой датасет на 260 тысяч строк, с которым было бы непросто работать в Excel.
Скопируем путь к файлу на компьютере и загрузим его сразу в датафрейм с помощью метода pd.read_csv().
Выведем первые 5 строк датафрейма методом .head().
Чтобы вывести произвольное число строк, укажем нужное число в скобках.