Open source / self‑host / multimodal

Llama (Meta)

Llama 4 Scout/Maverick (04.2025) bez następcy; frontier Meta to Muse Spark 1.3, Llama API zamknięte

Llama 4 Scout (17B aktywnych, 16 ekspertów, 109B, kontekst 10M) i Maverick (17B/128E, 400B, 1M) z 05.04.2025 pozostają ostatnią generacją Llama. Wagi nadal są do pobrania na Llama 4 Community License (klauzula >700M MAU, atrybucja Built with Llama).

Od 2026 frontier Meta to zamknięta linia Muse Spark z Meta Superintelligence Labs (1.0 08.04, 1.1 09.07, 1.2 05.08, 1.3 02.09.2026). Muse Spark 1.3 to aktualny frontier: agentic coding, 1M kontekstu, tekst+obraz+wideo; wariant xhigh w GA, max reasoning po dodatkowych testach bezpieczeństwa. Cennik API bez zmian ($1.25/$4.25). Llama API zamknięto 06.07.2026; następcą jest Meta Model API, które nie serwuje Llamy.

10.08.2026 Meta wróciła do open weights: Muse Glimmer 30B na Apache 2.0, a wagi Muse Spark 1.2 zapowiedziano bez daty. Meta nie podpisała unijnego kodeksu GPAI.

  • Zweryfikowano2026-09-04
  • Modele w profilu6
  • Źródła7
  • Kanały wdrożenia4

Decyzja zakupowa (kiedy wybrać / kiedy uważać)

Wybierz, jeśli…

  • Chcesz open‑weight i kontrolę (self‑host) + szeroki ekosystem narzędzi na dojrzałej linii modeli.
  • Masz duży wolumen i chcesz optymalizować koszt inferencji (kwantyzacje, vLLM, itp.).
  • Budujesz rozwiązania on‑prem / edge i masz kompetencje do utrzymania modeli; Muse Glimmer 30B daje Apache 2.0 na jednym GPU.

Unikaj, jeśli…

  • Nie akceptujesz ograniczeń licencji Community License / AUP - sprawdź szczegóły przed wdrożeniem.
  • Chcesz „najprostsze możliwe” wdrożenie bez MLOps - API SaaS będzie szybsze (Llama API Meta nie istnieje od 06.07.2026).
  • Potrzebujesz modelu frontier od Meta - Muse Spark jest zamknięty i dostępny tylko przez Meta Model API.

Koszt w praktyce (scenariusze)

Pilotaż

Hostowany u providera jest najszybszy (Together: Scout $0.18/$0.59, Maverick $0.27/$0.85 za 1M tok.); self‑host wymaga przygotowania.

  • mały zespół
  • testy jakości
Skala

Self‑host często wygrywa kosztowo przy stałym wolumenie, ale dochodzi utrzymanie; Muse Glimmer 30B działa na jednym GPU 24 GB.

  • GPU, monitoring, guardrails
To są widełki/scenariusze (nie faktura). Dokładny koszt zależy od długości kontekstu, liczby użytkowników, limitów i polityk retencji.

Wdrożenie / dane / enterprise

Kanały wdrożenia

  • Self‑host (vLLM/llama.cpp/Ollama)
  • Providerzy hostingu (Together, Bedrock; Groq tylko w tierze Enterprise)
  • Integracje w aplikacjach własnych
  • Meta Model API serwuje wyłącznie Muse (nie Llamę); Llama API zamknięte 06.07.2026

Polityka danych

Trening na danych
Self‑host: po Twojej stronie; Meta Model API tier Contributor używa promptów i odpowiedzi do treningu (dotyczy Muse).
Retencja
Self‑host: po Twojej stronie; hostowany: zależnie od providera.
Data residency
Zależnie od miejsca hostingu.
Kluczowe są warunki licencji (Community License) i AUP.

Najlepsze zastosowania

  • firmy chcące hostować model on‑prem/cloud/edge (prywatność, koszty długoterminowe) na linii z największym ekosystemem narzędzi
  • fine‑tuning i aplikacje z niskimi opóźnieniami; bardzo długi kontekst (Scout 10M w specyfikacji, 1M u hostujących)
  • wdrożenia, gdzie compliance licencji i AUP są akceptowalne (wymóg atrybucji „Built with Llama”), albo Muse Glimmer 30B na Apache 2.0.

Mocne strony

  • Ogromny ekosystem (HF, llama.cpp, vLLM, Ollama, kwantyzacje) i szeroka dostępność u hostujących (Together, Bedrock).
  • Llama 4 MoE: Scout (10M ctx, 17B/16E), Maverick (1M ctx, 17B/128E), natywnie multimodal; Llama 3.3 70B nadal najczęściej hostowany.
  • Muse Glimmer 30B (Apache 2.0, 10.08.2026): nowy open‑weight Meta, multimodalny, mieści się na jednym GPU 24 GB w 4‑bit.
  • Muse Spark 1.3 (02.09.2026): mniej wywołań narzędzi i tokenów niż 1.2 w zadaniach agentic (Meta); ten sam cennik API.

Słabe strony / ryzyka

  • Linia bez następcy: Behemoth nigdy nie wyszedł, Meta nie zapowiada Llamy 5, a frontier (Muse Spark) ma zamknięte wagi.
  • Community License nie jest open‑source w sensie OSI; compliance licencji i AUP po stronie wdrożenia.
  • Llama API Meta zamknięte 06.07.2026 - dostęp tylko przez self‑host lub dostawców trzecich; odmowa GPAI Code - ryzyko interpretacyjne w UE.

Aktualne modele (przykłady)

  • Llama 4 Scout: MoE 17B aktywnych / 16 ekspertów (109B), kontekst 10M, tekst+obraz; Llama 4 Maverick: 17B / 128 ekspertów (400B), kontekst 1M. Oba 05.04.2025, Llama 4 Community License.
  • Llama 3.3 70B (128K) oraz Llama 3.1 8B/70B/405B: modele gęste, nadal najczęściej hostowane (Together, Groq, Bedrock).
  • Muse Glimmer 30B (10.08.2026): gęsty model multimodalny Meta Superintelligence Labs, Apache 2.0, kontekst 131K, jeden GPU 24 GB w 4-bit; nowy open-weight Meta poza marką Llama.
  • Muse Spark 1.3 (02.09.2026): frontier agentic coding, 1M ctx, tekst+obraz+wideo; xhigh w GA, max reasoning wkrótce; Meta Model API i Muse Code; wagi zamknięte.
  • Muse Spark 1.2/1.1/1.0: poprzednie wersje frontier; wagi 1.2 zapowiedziane bez daty.
  • Llama 4 Behemoth (2T, 288B aktywnych) nigdy nie wyszedł.

Alternatywy (jeśli ten model nie pasuje)