Liquid AI udostępnia Pipette: otwartą platformę do benchmarkingu modeli AI na urządzeniach mobilnych
Liquid AI we współpracy z Artificial Analysis udostępniło Pipette, otwartą platformę do kompleksowego testowania modeli sztucznej inteligencji na urządzeniach brzegowych, uwzględniającą pełną konfigurację systemu, a nie

Liquid AI wprowadziło na rynek Pipette, otwartą platformę do kompleksowego testowania modeli sztucznej inteligencji na urządzeniach brzegowych. Rozwiązanie to, opracowane we współpracy z Artificial Analysis, niezależnym walidatorem metodologii, ma na celu dostarczenie bardziej realistycznych danych o wydajności modeli AI działających bezpośrednio na urządzeniach takich jak smartfony czy laptopy. W przeciwieństwie do tradycyjnych kart modeli, które często podają wyniki uzyskane w warunkach serwerowych i pełnej precyzji, Pipette koncentruje się na zachowaniu modelu w rzeczywistym środowisku urządzenia, traktując je jako właściwość całego wdrożonego systemu, a nie tylko izolowanego modelu.
Kompleksowe podejście do benchmarkingu
Kluczową innowacją Pipette jest jednostka miary, która obejmuje pełną konfigurację: model, kwantyzację, środowisko uruchomieniowe oraz samo urządzenie. Takie podejście pozwala na uzyskanie znacznie dokładniejszych i bardziej praktycznych wyników, które odzwierciedlają rzeczywistą wydajność. Początkowy zestaw danych obejmuje ponad 1000 konfiguracji (model × kwantyzacja × środowisko uruchomieniowe × urządzenie × kontekst), obejmujących ponad 30 modeli, kompilacje llama.cpp dla systemów macOS, iOS, Windows i Android, a także długości kontekstu od 256 do 8192 tokenów. Wstępne zweryfikowane wyniki pochodzą z urządzeń takich jak MacBook Pro z M5 Max, iPhone 17 Pro oraz Galaxy S26 Ultra. Wkrótce mają zostać dodane wyniki dla procesorów AMD Ryzen AI Max+ 395 i Radeon 8060S.
Platforma Pipette jest dostępna jako infrastruktura Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), publiczny zestaw danych wyników, hostowany pulpit nawigacyjny oraz natywne aplikacje benchmarkowe dla iOS i Android. Publikacja wyników przesyłanych przez społeczność jest obecnie w fazie beta.
Metodologia i mierniki wydajności
Zestaw danych startowych Pipette obejmuje pięć metryk wydajności na urządzeniu. Warto zaznaczyć, że jakość modeli jest śledzona oddzielnie na platformach IFBench, GPQA Diamond i MATH-500. Te wyniki jakościowe pochodzą z uruchomień ewaluacyjnych llama.cpp na referencyjnych systemach NVIDIA H100 80GB i są następnie dopasowywane do uruchomień na urządzeniach, które wykorzystują ten sam model i kwantyzację. Oznacza to, że wynik jakości wyświetlany obok przepustowości telefonu nie został wygenerowany na samym telefonie.
Procesy testowania wydajności w Pipette opierają się na opublikowanej metodologii, która obejmuje:
- Stałe kształty tokenów.
- Zachłanne dekodowanie (greedy decoding).
- Odrzucenie rozgrzewkowej serii testów.
- Pięć mierzonych powtórzeń.
- Kontrolę gotowości.
Przed każdym mierzonym powtórzeniem, specyficzne dla platformy sprawdzenie weryfikuje warunki termiczne i obciążeniowe; nieudane uruchomienia nie są publikowane. Ocena wykorzystuje oddzielny protokół z deterministycznym, niezależnym od modelu punktowaniem, a pipette-scores nigdy nie widzi pochodzenia generacji. Każde zgłoszenie rejestruje wersję benchmarku, kształt tokena, artefakt modelu, kwantyzację, wersję i ustawienia środowiska uruchomieniowego oraz sprzęt i system operacyjny urządzenia.
Znaczenie dla rozwoju AI na urządzeniach brzegowych
Udostępnienie Pipette przez Liquid AI stanowi istotny krok w kierunku standaryzacji i poprawy wiarygodności benchmarkingu modeli AI na urządzeniach brzegowych. Dzięki otwartemu charakterowi platformy i kompleksowemu podejściu, deweloperzy i badacze zyskują narzędzie, które pozwala na bardziej precyzyjną ocenę, jak modele AI będą działać w rzeczywistych warunkach użytkowania. To z kolei może przyspieszyć rozwój i optymalizację aplikacji AI działających lokalnie, otwierając nowe możliwości dla innowacji w dziedzinie sztucznej inteligencji na urządzeniach mobilnych i IoT.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

IBM prezentuje Granite 4.2: Nowe modele językowe z zaawansowanym rozumowaniem i uczeniem agentowym
IBM wprowadza na rynek Granite 4.2 – rodzinę otwartych modeli językowych o rozmiarach 3B, 8B i 30B parametrów, skupionych na zdolnościach rozumowania i uczeniu agentowym.
Redakcja Aigest3 godz. temu

LFM2.5-DSpark: Nowa Era Szybszego Wnioskowania w Modelach Językowych
Liquid AI wprowadza LFM2.5-DSpark, model językowy, który znacząco przyspiesza proces wnioskowania, oferując do 3,2 razy większą prędkość w porównaniu do poprzednich wersji.
Redakcja Aigest5 dni temu

Liquid AI wprowadza LFM2.5 Q4_0: Nowy standard kwantyzacji modeli językowych
Liquid AI ogłosiło wydanie LFM2.5 Q4_0, przełomowego rozwiązania w dziedzinie kwantyzacji modeli językowych, które ma na celu zwiększenie efektywności i dostępności AI.
Redakcja Aigest6 dni temu

Google przedstawia SAM (Sovereign Agent Mesh): bezpieczną sieć P2P dla autonomicznych agentów AI
Google wprowadza Sovereign Agent Mesh (SAM), projekt sieciowy typu open-source, który ma na celu bezpieczne łączenie autonomicznych agentów AI działających na różnych platformach, eliminując potrzebę wystawiania wewnętrz
Redakcja Aigest18 sie 2026

Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
Deepseek ogłosił znaczące zmiany, wprowadzając ulepszoną wersję swojego flagowego modelu V4 Pro, udostępniając autorskie oprogramowanie agentowe jako open source oraz podnosząc ceny dostępu do API.
Redakcja Aigest13 sie 2026

Meta AI prezentuje Muse Glimmer: model agentowy 30B działający na pojedynczej karcie GPU
Meta AI wprowadza Muse Glimmer, 30-miliardowy multimodalny model agentowy, który dzięki optymalizacji może działać na pojedynczej konsumenckiej karcie graficznej lub Macu, bez potrzeby połączenia sieciowego.
Redakcja Aigest10 sie 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.