Data Science · मराठी आवृत्ती
9.3 Types, missing values आणि duplicates
Amount मधले commas काढू, N/A ला missing मानू आणि numeric conversion करू. Convert न होणारी value errors="coerce" मुळे NaN होते. पुढे missing city साठी Unknown वापरतो.
df["amount"] = (
df["amount"].astype(str)
.str.replace(",", "", regex=False)
.replace({"N/A": np.nan, "nan": np.nan})
)
df["amount"] = pd.to_numeric(df["amount"], errors="coerce")
print(df.isna().sum())
df["city"] = df["city"].fillna("Unknown")
# duplicate order lines
print(df["order_id"].duplicated().sum())
df = df.drop_duplicates(subset=["order_id"], keep="first")
या sample ची मर्यादा: इथे BLK-2 ही पुनरावृत्ती झालेली नोंद आहे, म्हणून order_id वर duplicate काढतो. वास्तविक order-line table मध्ये एका order_id च्या अनेक वैध products असू शकतात. अशा वेळी फक्त order_id वर deduplicate करू नका; खरी line key वापरा.