Przejdź do treści

Pandas. Metoda df.duplicated(). Wykrywanie podwójnych transakcji w eksporcie sklepu.

Na czym to polega w sklepie

Metoda df.duplicated zwraca maskę bool wskazującą zduplikowane wiersze (domyślnie wszystkie kolumny lub wybrane subset). W danych e-commerce wykrywa podwójne eventy zakupu i powtórzone rekordy z błędnego merge API.

Przykład ze sklepu internetowego

Po synchronizacji zamówień z API widzisz podejrzanie wysoki przychód - sprawdzasz duplikaty po transaction_id:

import pandas as pd

orders = pd.read_csv("orders_sync.csv")
dup_mask = orders.duplicated(subset=["transaction_id"], keep=False)
duplicates = orders[dup_mask].sort_values("transaction_id")
# keep=False oznacza wszystkie wystąpienia duplikatu, nie tylko drugie

Wynik: lista transakcji występujących więcej niż raz - punkt wyjścia do deduplikacji przed sumowaniem revenue.

Co zrobić po stronie biznesu

  • QA eventów purchase w eksporcie GA4 (ten sam transaction_id dwa razy).
  • Wykrywanie podwójnych wierszy po concat wielu plików dziennych.
  • Audyt sesji zduplikowanych po błędnym eksporcie BigQuery.

W skrócie

Zawsze uruchom duplicated przed agregacją przychodu. Parametr keep=False pokazuje całą grupę duplikatów - nie tylko „nadmiarowy” wiersz.