Llama (Meta)
Llama 4 Scout/Maverick (04.2025) bez następcy; frontier Meta to Muse Spark 1.3, Llama API zamknięte
Llama 4 Scout (17B aktywnych, 16 ekspertów, 109B, kontekst 10M) i Maverick (17B/128E, 400B, 1M) z 05.04.2025 pozostają ostatnią generacją Llama. Wagi nadal są do pobrania na Llama 4 Community License (klauzula >700M MAU, atrybucja Built with Llama).
Od 2026 frontier Meta to zamknięta linia Muse Spark z Meta Superintelligence Labs (1.0 08.04, 1.1 09.07, 1.2 05.08, 1.3 02.09.2026). Muse Spark 1.3 to aktualny frontier: agentic coding, 1M kontekstu, tekst+obraz+wideo; wariant xhigh w GA, max reasoning po dodatkowych testach bezpieczeństwa. Cennik API bez zmian ($1.25/$4.25). Llama API zamknięto 06.07.2026; następcą jest Meta Model API, które nie serwuje Llamy.
10.08.2026 Meta wróciła do open weights: Muse Glimmer 30B na Apache 2.0, a wagi Muse Spark 1.2 zapowiedziano bez daty. Meta nie podpisała unijnego kodeksu GPAI.
- Zweryfikowano2026-09-04
- Modele w profilu6
- Źródła7
- Kanały wdrożenia4
Decyzja zakupowa (kiedy wybrać / kiedy uważać)
Wybierz, jeśli…
- Chcesz open‑weight i kontrolę (self‑host) + szeroki ekosystem narzędzi na dojrzałej linii modeli.
- Masz duży wolumen i chcesz optymalizować koszt inferencji (kwantyzacje, vLLM, itp.).
- Budujesz rozwiązania on‑prem / edge i masz kompetencje do utrzymania modeli; Muse Glimmer 30B daje Apache 2.0 na jednym GPU.
Unikaj, jeśli…
- Nie akceptujesz ograniczeń licencji Community License / AUP - sprawdź szczegóły przed wdrożeniem.
- Chcesz „najprostsze możliwe” wdrożenie bez MLOps - API SaaS będzie szybsze (Llama API Meta nie istnieje od 06.07.2026).
- Potrzebujesz modelu frontier od Meta - Muse Spark jest zamknięty i dostępny tylko przez Meta Model API.
Koszt w praktyce (scenariusze)
Hostowany u providera jest najszybszy (Together: Scout $0.18/$0.59, Maverick $0.27/$0.85 za 1M tok.); self‑host wymaga przygotowania.
- mały zespół
- testy jakości
Self‑host często wygrywa kosztowo przy stałym wolumenie, ale dochodzi utrzymanie; Muse Glimmer 30B działa na jednym GPU 24 GB.
- GPU, monitoring, guardrails
Wdrożenie / dane / enterprise
Kanały wdrożenia
- Self‑host (vLLM/llama.cpp/Ollama)
- Providerzy hostingu (Together, Bedrock; Groq tylko w tierze Enterprise)
- Integracje w aplikacjach własnych
- Meta Model API serwuje wyłącznie Muse (nie Llamę); Llama API zamknięte 06.07.2026
Polityka danych
- Trening na danych
- Self‑host: po Twojej stronie; Meta Model API tier Contributor używa promptów i odpowiedzi do treningu (dotyczy Muse).
- Retencja
- Self‑host: po Twojej stronie; hostowany: zależnie od providera.
- Data residency
- Zależnie od miejsca hostingu.