Przejdź do treści

Numpy. Funkcja np.unique(). Liczba unikalnych kampanii UTM w eksporcie GA4.

Na czym to polega w sklepie

Funkcja np.unique wyciąga unikalne elementy z tablicy, opcjonalnie z liczbą wystąpień (return_counts=True). Szybsza niż pandas na czystych tablicach stringów i intów - pierwszy sanity check po wczytaniu kolumny z CSV.

Przykład ze sklepu internetowego

Kolumna utm_campaign z 50 000 sesji GA4. Zanim zrobisz groupby, sprawdzasz ile jest unikalnych kampanii i czy nie ma duplikatów z literówką:

import numpy as np

campaigns = np.array([
    "spring_sale", "spring_sale", "brand_pl", "spring_sale",
    "spring_sale ", "black_friday", "brand_pl",
])
unique, counts = np.unique(campaigns, return_counts=True)
n_campaigns = len(unique)
# "spring_sale " ≠ "spring_sale" - unique wychwytuje brud w UTM

Co zrobić po stronie biznesu

  • Unikalne transaction_id vs liczba wierszy - wykrycie duplikatów purchase w eksporcie.
  • return_counts=True dla rozkładu device_category bez groupby.
  • Pułapka: spacje i wielkość liter w UTM tworzą „nowe” kampanie - unique pokaże problem, ale nie naprawi.

W skrócie

np.unique to najszybszy licznik kardynalności na ndarray. Porównaj len(unique) z liczbą kampanii w panelu Ads - rozjazd = sygnał do czyszczenia UTM.