Na czym to polega w sklepie
Metoda Series.str.contains zwraca maskę bool dla wierszy, gdzie string zawiera wzorzec (regex lub literal). Podstawa czyszczenia danych marketingowych: filtrowanie ruchu brandowego, identyfikacja kampanii testowych i audyt parametrów UTM.
Przykład ze sklepu internetowego
Chcesz oddzielić sesje brandowe (zawierające nazwę sklepu w source) od non-brand w eksporcie GA4:
import pandas as pd
sessions = pd.read_csv("ga4_sessions.csv")
brand_pattern = r"myshop|my-shop|myshop\.pl"
sessions["is_brand"] = sessions["session_source"].str.contains(
brand_pattern,
case=False,
na=False,
regex=True,
)
non_brand = sessions[~sessions["is_brand"]]
Co zrobić po stronie biznesu
- Wykrywanie
testw nazwie kampanii przed raportem ROAS produkcyjnego. - Filtr email w medium (
email|newsletter) dla CRM attribution. - Audyt błędnych UTM:
utm_campaign.str.contains(r"\s")- spacje w nazwie.
W skrócie
str.contains z case=False i na=False to bezpieczny domyślny zestaw dla danych GA4. Regex pozwala łapać warianty pisowni brandu w jednym wzorcu.