Ravindra BagaleCourses & study guides

9. Data Cleaning A–Z in pandas

9.3 Types, Missing, Duplicates

df["amount"] = (
    df["amount"].astype(str)
      .str.replace(",", "", regex=False)
      .replace({"N/A": np.nan, "nan": np.nan})
)
df["amount"] = pd.to_numeric(df["amount"], errors="coerce")

print(df.isna().sum())
df["city"] = df["city"].fillna("Unknown")

# duplicate order lines
print(df["order_id"].duplicated().sum())
df = df.drop_duplicates(subset=["order_id"], keep="first")