Przejdź do treści

Pandas. Metoda Series.str.contains(). Wykrywanie ruchu brandowego w źródle sesji GA4.

Na czym to polega w sklepie

Metoda Series.str.contains zwraca maskę bool dla wierszy, gdzie string zawiera wzorzec (regex lub literal). Podstawa czyszczenia danych marketingowych: filtrowanie ruchu brandowego, identyfikacja kampanii testowych i audyt parametrów UTM.

Przykład ze sklepu internetowego

Chcesz oddzielić sesje brandowe (zawierające nazwę sklepu w source) od non-brand w eksporcie GA4:

import pandas as pd

sessions = pd.read_csv("ga4_sessions.csv")
brand_pattern = r"myshop|my-shop|myshop\.pl"
sessions["is_brand"] = sessions["session_source"].str.contains(
    brand_pattern,
    case=False,
    na=False,
    regex=True,
)
non_brand = sessions[~sessions["is_brand"]]

Co zrobić po stronie biznesu

  • Wykrywanie test w nazwie kampanii przed raportem ROAS produkcyjnego.
  • Filtr email w medium (email|newsletter) dla CRM attribution.
  • Audyt błędnych UTM: utm_campaign.str.contains(r"\s") - spacje w nazwie.

W skrócie

str.contains z case=False i na=False to bezpieczny domyślny zestaw dla danych GA4. Regex pozwala łapać warianty pisowni brandu w jednym wzorcu.