В этой главе каждая новая команда появлялась как ответ на конкретную проблему.
- Не со всеми столбцами можно делать одинаковые вычисления → различаем числовые, номинальные, порядковые признаки и идентификаторы.
- Категория может быть записана числом → отличаем тип хранения от смысла признака, при необходимости используем
map().
- Категории не обязаны быть числами → строки нормально работают с
value_counts(), группировками и фильтрами.
- Нужной группы нет в исходной таблице → создаём её с помощью
pd.cut().
- Границы не очевидны → смотрим на предметное правило, цель анализа и распределение.
- Нужны равные части распределения → используем
pd.qcut().
- Категория скрывает точное значение → сохраняем исходный числовой столбец.
- Вывод зависит от границ → проверяем чувствительность результата.
Решите настоящую задачу
В теории таблицы были маленькими специально: каждое преобразование можно было проверить глазами. Попробутей применить эти шаги к реальному датасету и самостоятельно принять несколько решений.
Закрепить материал на практических задачах →