Модуль: Предобработка II. Категориальные признаки и категоризация


Код работает. Но правильные ли границы?


Два аналитика смотрят на одни и те же доставки:

  A
1 delivery_min
2 18
3 27
4 31
5 44
6 55
7 84

Аналитик A: до 30, 31–60, больше 60 минут.

Аналитик B: до 20, 21–45, больше 45 минут.

Оба могут написать совершенно корректный pd.cut(). Но результаты будут разными.
 

Что делать?

Границы должны иметь основание. Им может быть:

  • правило бизнеса или предметной области;
  • распределение значений;
  • цель анализа.
 
Инструменты 

Перед выбором границ полезно посмотреть распределение:



Но даже статистика не выдаёт единственную «правильную» категоризацию. Нужно объяснять, зачем выбраны именно такие интервалы.