Przejdź do treści

Pandas. Metoda df.drop_duplicates(). Usuwanie powtórzonych zakupów przed sumą revenue.

Na czym to polega w sklepie

Metoda df.drop_duplicates usuwa powtórzone wiersze i zwraca oczyszczony DataFrame. Parametr subset wskazuje klucz biznesowy (np. transaction_id), keep decyduje który wiersz zostaje.

Przykład ze sklepu internetowego

Po wykryciu duplikatów transakcji zostawiasz najnowszy rekord według updated_at:

import pandas as pd

orders = pd.read_csv("orders_sync.csv")
orders["updated_at"] = pd.to_datetime(orders["updated_at"])

clean = (
    orders.sort_values("updated_at")
    .drop_duplicates(subset=["transaction_id"], keep="last")
)
total_revenue = clean["revenue"].sum()
# Przychód bez podwójnego liczenia transakcji

Co zrobić po stronie biznesu

  • Deduplikacja sesji GA4 po session_id przed liczeniem unikalnych użytkowników.
  • Jeden wiersz per ad_id przy scala niu raportów z nakładających się okien dat.
  • Czyszczenie listy produktów po błędnym append z dwóch źródeł.

W skrócie

sort_values + drop_duplicates(keep="last") to standardowy wzorzec „zostaw najświeższy rekord”. Bez tego KPI revenue kłamie.