Na czym to polega w sklepie
Metoda df.duplicated zwraca maskę bool wskazującą zduplikowane wiersze (domyślnie wszystkie kolumny lub wybrane subset). W danych e-commerce wykrywa podwójne eventy zakupu i powtórzone rekordy z błędnego merge API.
Przykład ze sklepu internetowego
Po synchronizacji zamówień z API widzisz podejrzanie wysoki przychód - sprawdzasz duplikaty po transaction_id:
import pandas as pd
orders = pd.read_csv("orders_sync.csv")
dup_mask = orders.duplicated(subset=["transaction_id"], keep=False)
duplicates = orders[dup_mask].sort_values("transaction_id")
# keep=False oznacza wszystkie wystąpienia duplikatu, nie tylko drugieWynik: lista transakcji występujących więcej niż raz - punkt wyjścia do deduplikacji przed sumowaniem revenue.
Co zrobić po stronie biznesu
- QA eventów purchase w eksporcie GA4 (ten sam transaction_id dwa razy).
- Wykrywanie podwójnych wierszy po concat wielu plików dziennych.
- Audyt sesji zduplikowanych po błędnym eksporcie BigQuery.
W skrócie
Zawsze uruchom duplicated przed agregacją przychodu. Parametr keep=False pokazuje całą grupę duplikatów - nie tylko „nadmiarowy” wiersz.