Модуль: Предобработка II. Категоризация


4. CityBike Operations: задача аналитика

☰ Теория

pd.cut() используйте для категорий с собственными границами, а describe() и quantile() — чтобы выбрать эти границы осознанно.

После этого value_counts(), groupby().agg(), qcut() и нормализованный crosstab() помогут проверить группы и ответить на бизнес-вопрос.

Вы — младший аналитик сервиса городского велопроката CityBike. Операционная команда хочет заранее перебрасывать резервные велосипеды в те точки, где ожидается всплеск спроса.

Для этого вам дали почасовую выгрузку за 60 дней. Нужно ответить на главный вопрос:

В какие часы суток чаще всего возникает высокий спрос — и насколько этот вывод зависит от того, где аналитик поставил границы между «низким», «средним» и «высоким» спросом?

Файлы

  • citybike_hourly.csv — почасовая выгрузка данных;
  • CityBike_analyst.ipynb — рабочая тетрадь с готовой последовательностью анализа.

План работы

  1. Создать категорию «время суток» (утро, день, вечер, ночь).
  2. Изучить распределение числа аренд.
  3. Самостоятельно выбрать две границы спроса и объяснить свой выбор.
  4. Проверить, что получилось в каждой группе.
  5. Сравнить своё разбиение с pd.qcut().
  6. Определить часть суток с наибольшей долей высокого спроса.
  7. Изменить границы и убедиться, устойчив ли вывод.
  8. Написать короткую рекомендацию операционной команде.

Что сдавать

Последняя ячейка ноутбука формирует файл citybike_report.json — именно его нужно загрузить в SilverTests для проверки.

⏱️ Расчётное время работы: 25–28 минут.


Ваш ответ

Для проверки решения задачи необходимо зарегистрироваться или авторизоваться!


Последний прикрепленный файл:

Выберите правильный ответ, либо введите его в поле ввода

Комментарий учителя