Модуль: Предобработка II. Категориальные признаки и категоризация


Итог: от проблемы к инструменту


В этой главе каждая новая команда появлялась как ответ на конкретную проблему.

  • Не со всеми столбцами можно делать одинаковые вычисления → различаем числовые, номинальные, порядковые признаки и идентификаторы.
  • Категория может быть записана числом → отличаем тип хранения от смысла признака, при необходимости используем map().
  • Категории не обязаны быть числами → строки нормально работают с value_counts(), группировками и фильтрами.
  • Нужной группы нет в исходной таблице → создаём её с помощью pd.cut().
  • Границы не очевидны → смотрим на предметное правило, цель анализа и распределение.
  • Нужны равные части распределения → используем pd.qcut().
  • Категория скрывает точное значение → сохраняем исходный числовой столбец.
  • Вывод зависит от границ → проверяем чувствительность результата.
 
Решите настоящую задачу

В теории таблицы были маленькими специально: каждое преобразование можно было проверить глазами. Попробутей применить эти шаги к реальному датасету и самостоятельно принять несколько решений.

Закрепить материал на практических задачах →