Na czym to polega w sklepie
Funkcja np.unique wyciąga unikalne elementy z tablicy, opcjonalnie z liczbą wystąpień (return_counts=True). Szybsza niż pandas na czystych tablicach stringów i intów - pierwszy sanity check po wczytaniu kolumny z CSV.
Przykład ze sklepu internetowego
Kolumna utm_campaign z 50 000 sesji GA4. Zanim zrobisz groupby, sprawdzasz ile jest unikalnych kampanii i czy nie ma duplikatów z literówką:
import numpy as np
campaigns = np.array([
"spring_sale", "spring_sale", "brand_pl", "spring_sale",
"spring_sale ", "black_friday", "brand_pl",
])
unique, counts = np.unique(campaigns, return_counts=True)
n_campaigns = len(unique)
# "spring_sale " ≠ "spring_sale" - unique wychwytuje brud w UTM
Co zrobić po stronie biznesu
- Unikalne transaction_id vs liczba wierszy - wykrycie duplikatów purchase w eksporcie.
return_counts=Truedla rozkładu device_category bez groupby.- Pułapka: spacje i wielkość liter w UTM tworzą „nowe” kampanie - unique pokaże problem, ale nie naprawi.
W skrócie
np.unique to najszybszy licznik kardynalności na ndarray. Porównaj len(unique) z liczbą kampanii w panelu Ads - rozjazd = sygnał do czyszczenia UTM.