Aigest.
Newsy

OpenBMB prezentuje MiniCPM5-2B: kompaktowy model językowy o wysokiej wydajności

OpenBMB wprowadziło MiniCPM5-2B, gęsty model językowy z 2,52 miliarda parametrów, który osiąga średni wynik 53,9 w 34 testach porównawczych, przewyższając konkurencję.

RA

Udostępnij
OpenBMB prezentuje MiniCPM5-2B: kompaktowy model językowy o wysokiej wydajności
Ilustracja poglądowa

OpenBMB ogłosiło premierę MiniCPM5-2B, gęstego przyczynowego modelu językowego, który wyróżnia się 2 516 756 480 parametrami i natywnym kontekstem 131 072 tokenów. Model ten osiągnął średni wynik 53,9 w 34 testach porównawczych, co plasuje go przed modelem Qwen3.5-4B, który uzyskał 51,1 punktu.

Wydajność i kluczowe przewagi

MiniCPM5-2B wykazuje wyraźną przewagę w kilku kluczowych obszarach, w tym w użyciu narzędzi, agentach kodujących oraz w odzyskiwaniu informacji z długiego kontekstu. Jego wysoka wydajność w tych specyficznych zastosowaniach sugeruje potencjał do efektywnego wykorzystania w złożonych scenariuszach wymagających precyzyjnego rozumienia i generowania języka.

Proces szkolenia i architektura

Proces szkolenia MiniCPM5-2B obejmował zaawansowane techniki. Po wstępnym treningu model został poddany post-treningowi z wykorzystaniem 400 miliardów tokenów danych SFT (Supervised Fine-Tuning) typu „deep-thinking” w połączeniu z nauczycielami RL (Reinforcement Learning) oraz destylacją on-policy. Ten etap pozwolił na połączenie wiedzy z 16 modeli eksperckich w jeden spójny punkt kontrolny. Model jest dostępny na licencji Apache 2.0, a wraz z nim udostępniono również:

  • Zbiory danych do wstępnego treningu
  • Zbiory danych SFT
  • Zbiory danych RL
  • Pośrednie punkty kontrolne: Base, Midtrain i SFT-only

Kompatybilność i dostępność

MiniCPM5-2B został zaprojektowany z myślą o łatwej integracji i uruchamianiu na różnych platformach. Wersje GGUF modelu zaczynają się od 1,56 GB, co ułatwia jego wdrożenie na urządzeniach z ograniczonymi zasobami. Standardowa architektura LlamaForCausalLM umożliwia ładowanie modelu w popularnych środowiskach, takich jak:

  • vLLM
  • SGLang
  • llama.cpp
  • Ollama
  • MLX

Co istotne, nie wymaga to modyfikacji kodu modelu, co znacznie upraszcza jego implementację i użycie w istniejących systemach.

Premiera MiniCPM5-2B przez OpenBMB stanowi ważny krok w rozwoju kompaktowych, ale jednocześnie potężnych modeli językowych. Jego zdolność do efektywnego działania na urządzeniach, połączona z wysoką wydajnością w kluczowych benchmarkach, otwiera nowe możliwości dla aplikacji AI, które wymagają zarówno zaawansowanych zdolności językowych, jak i optymalizacji pod kątem zasobów sprzętowych. Dostępność modelu na otwartej licencji oraz pełnego zestawu danych i punktów kontrolnych sprzyja dalszym innowacjom i badaniom w społeczności AI.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

CEO Pangram: Jesteśmy "niebezpiecznie blisko" teorii martwego internetu
Anthropic inwestuje pół biliona dolarów w moc obliczeniową, mimo wcześniejszych ostrzeżeń CEO
GPT-6 Astra samodzielnie ukończyła grę Portal w mniej niż 24 godziny
Sztuczna inteligencja zlikwidowała branżę pisania prac akademickich w Kenii
UBS wymaga od kandydatów znajomości AI. Umiejętności sztucznej inteligencji kluczowe dla przyszłych bankowców
Pożar w centrum danych AI Lake Mariner ujawnia złożoną sieć odpowiedzialności

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.