Aigest.
Newsy

Transformers integruje kwantyzację llama.cpp, przyspieszając wnioskowanie LLM

Hugging Face ogłosiło integrację kwantyzacji llama.cpp z biblioteką Transformers, co znacząco przyspiesza wnioskowanie dużych modeli językowych (LLM) na procesorach CPU. Umożliwia to efektywne uruchamianie skwantyzowanyc

RA

Udostępnij
Transformers integruje kwantyzację llama.cpp, przyspieszając wnioskowanie LLM
Fot. Hugging Face

Hugging Face ogłosiło znaczące usprawnienie dla użytkowników dużych modeli językowych (LLM), integrując kwantyzację llama.cpp bezpośrednio z popularną biblioteką Transformers. Ta nowa funkcjonalność pozwala na efektywne uruchamianie skwantyzowanych modeli, takich jak Llama 2 i Mistral, bezpośrednio na procesorach CPU, co znacząco przyspiesza proces wnioskowania.

Uruchamianie skwantyzowanych modeli na CPU

Integracja llama.cpp z Transformers upraszcza proces wykorzystania skwantyzowanych modeli. Użytkownicy mogą teraz ładować modele w formatach GGUF (GGML zaktualizowany do GGUF) za pomocą klasy QuantizedModel w Transformers. Wcześniej, aby skorzystać z kwantyzacji llama.cpp, konieczne było użycie osobnej biblioteki llama-cpp-python i ręczne zarządzanie procesem ładowania modelu. Nowe rozwiązanie eliminuje tę złożoność, oferując spójny interfejs w ramach ekosystemu Hugging Face.

Kwantyzacja to technika kompresji modeli, która zmniejsza ich rozmiar i wymagania obliczeniowe, jednocześnie minimalnie wpływając na ich wydajność. Dzięki temu, nawet duże LLM mogą być uruchamiane na mniej zasobnych urządzeniach, takich jak laptopy czy komputery stacjonarne, bez konieczności posiadania zaawansowanych kart graficznych. Integracja z llama.cpp, znanym z wysokiej wydajności na CPU, otwiera drzwi do szerszego zastosowania LLM w lokalnych środowiskach.

Korzyści z integracji

Główne korzyści płynące z tej integracji to:

  • Uproszczone API: Użytkownicy mogą ładować skwantyzowane modele GGUF za pomocą zaledwie kilku linii kodu, wykorzystując standardowe metody biblioteki Transformers.
  • Wysoka wydajność na CPU: llama.cpp jest zoptymalizowane pod kątem procesorów, co pozwala na szybkie wnioskowanie nawet dużych modeli bez potrzeby posiadania drogich GPU.
  • Dostępność modeli: Integracja umożliwia łatwe wykorzystanie popularnych modeli, takich jak Llama 2 i Mistral, w ich skwantyzowanych wersjach, które są dostępne na platformie Hugging Face.
  • Rozszerzone możliwości: Oprócz podstawowego wnioskowania, integracja wspiera również zaawansowane funkcje, takie jak generowanie strumieniowe (streaming generation), co jest kluczowe dla interaktywnych aplikacji.

Jak to działa w praktyce?

Aby skorzystać z nowej funkcjonalności, użytkownicy muszą zainstalować bibliotekę llama-cpp-python oraz zaktualizować Transformers do najnowszej wersji. Następnie, za pomocą klasy QuantizedModel, można załadować dowolny model w formacie GGUF hostowany na Hugging Face Hub. Przykładowo, aby załadować model Mistral, wystarczy wskazać jego identyfikator z Hub, a biblioteka automatycznie zajmie się pobraniem i konfiguracją. Proces ten jest analogiczny do ładowania standardowych modeli Transformers, co minimalizuje krzywą uczenia dla deweloperów.

Ta integracja stanowi ważny krok w demokratyzacji dostępu do zaawansowanych modeli językowych. Umożliwia ona deweloperom i badaczom eksperymentowanie z LLM na lokalnych maszynach, bez ponoszenia wysokich kosztów związanych z infrastrukturą chmurową czy specjalistycznym sprzętem. W efekcie, przyspiesza to innowacje i rozwój nowych zastosowań sztucznej inteligencji, czyniąc ją bardziej dostępną i praktyczną dla szerszego grona odbiorców.

Źródło: huggingface.co

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Baseten dołącza do dostawców inferencji na platformie Hugging Face
Hugging Face wprowadza Async GRPO dla efektywniejszego treningu LoRA
Hugging Face wprowadza ML Intern: eksperymenty ML dostępne dla każdego przez czat
Słownik AI: Kluczowe terminy, które musisz znać, od AGI po halucynacje
NeoMME: Nowy, wydajny enkoder multimodalny i wielojęzyczny
BenchMIRT: Nowe spojrzenie na to, co mierzą benchmarki LLM

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.