Ravindra Bagale · Data Scienceसर्व coursesया course चे lessonsशोधाEnglish

Data Science · मराठी आवृत्ती

12.2 पहिल्या तपासणीची checklist

रवींद्र बागले यांच्या course वर आधारित · सहज मराठीत explanation

Jupyter मध्ये EDA steps

  1. df.shape, df.head(), df.tail().
  2. df.info() आणि df.isna().sum().
  3. df["order_id"].duplicated().sum().
  4. df.describe(include="all"); किंवा numeric/text वेगळं तपासा.
  5. df["city"].value_counts(); वाटा पाहण्यासाठी normalize=True वापरा.
  6. df["status"].value_counts().
  7. pd.crosstab(df["city"], df["status"], margins=True).
  8. df.groupby("festival")["amount"].agg(["sum", "mean", "count"]).
  9. Markdown cell मध्ये तीन findings लिहा.

या काल्पनिक sample मध्ये Pune सर्वाधिक वेळा दिसतं. Diwali rows च्या amounts जास्त आहेत. Kolhapur मध्ये एक Cancelled आणि Pune मध्ये एक Returned row आहे.