Na czym to polega w sklepie
Metoda df.drop_duplicates usuwa powtórzone wiersze i zwraca oczyszczony DataFrame. Parametr subset wskazuje klucz biznesowy (np. transaction_id), keep decyduje który wiersz zostaje.
Przykład ze sklepu internetowego
Po wykryciu duplikatów transakcji zostawiasz najnowszy rekord według updated_at:
import pandas as pd
orders = pd.read_csv("orders_sync.csv")
orders["updated_at"] = pd.to_datetime(orders["updated_at"])
clean = (
orders.sort_values("updated_at")
.drop_duplicates(subset=["transaction_id"], keep="last")
)
total_revenue = clean["revenue"].sum()
# Przychód bez podwójnego liczenia transakcji
Co zrobić po stronie biznesu
- Deduplikacja sesji GA4 po
session_idprzed liczeniem unikalnych użytkowników. - Jeden wiersz per ad_id przy scala niu raportów z nakładających się okien dat.
- Czyszczenie listy produktów po błędnym append z dwóch źródeł.
W skrócie
sort_values + drop_duplicates(keep="last") to standardowy wzorzec „zostaw najświeższy rekord”. Bez tego KPI revenue kłamie.