Aigest.
Narzędzia AI

Liquid AI udostępnia Pipette: otwartą platformę do benchmarkingu modeli AI na urządzeniach mobilnych

Liquid AI we współpracy z Artificial Analysis udostępniło Pipette, otwartą platformę do kompleksowego testowania modeli sztucznej inteligencji na urządzeniach brzegowych, uwzględniającą pełną konfigurację systemu, a nie

RA

Udostępnij
Liquid AI udostępnia Pipette: otwartą platformę do benchmarkingu modeli AI na urządzeniach mobilnych
Fot. MarkTechPost

Liquid AI wprowadziło na rynek Pipette, otwartą platformę do kompleksowego testowania modeli sztucznej inteligencji na urządzeniach brzegowych. Rozwiązanie to, opracowane we współpracy z Artificial Analysis, niezależnym walidatorem metodologii, ma na celu dostarczenie bardziej realistycznych danych o wydajności modeli AI działających bezpośrednio na urządzeniach takich jak smartfony czy laptopy. W przeciwieństwie do tradycyjnych kart modeli, które często podają wyniki uzyskane w warunkach serwerowych i pełnej precyzji, Pipette koncentruje się na zachowaniu modelu w rzeczywistym środowisku urządzenia, traktując je jako właściwość całego wdrożonego systemu, a nie tylko izolowanego modelu.

Kompleksowe podejście do benchmarkingu

Kluczową innowacją Pipette jest jednostka miary, która obejmuje pełną konfigurację: model, kwantyzację, środowisko uruchomieniowe oraz samo urządzenie. Takie podejście pozwala na uzyskanie znacznie dokładniejszych i bardziej praktycznych wyników, które odzwierciedlają rzeczywistą wydajność. Początkowy zestaw danych obejmuje ponad 1000 konfiguracji (model × kwantyzacja × środowisko uruchomieniowe × urządzenie × kontekst), obejmujących ponad 30 modeli, kompilacje llama.cpp dla systemów macOS, iOS, Windows i Android, a także długości kontekstu od 256 do 8192 tokenów. Wstępne zweryfikowane wyniki pochodzą z urządzeń takich jak MacBook Pro z M5 Max, iPhone 17 Pro oraz Galaxy S26 Ultra. Wkrótce mają zostać dodane wyniki dla procesorów AMD Ryzen AI Max+ 395 i Radeon 8060S.

Platforma Pipette jest dostępna jako infrastruktura Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), publiczny zestaw danych wyników, hostowany pulpit nawigacyjny oraz natywne aplikacje benchmarkowe dla iOS i Android. Publikacja wyników przesyłanych przez społeczność jest obecnie w fazie beta.

Metodologia i mierniki wydajności

Zestaw danych startowych Pipette obejmuje pięć metryk wydajności na urządzeniu. Warto zaznaczyć, że jakość modeli jest śledzona oddzielnie na platformach IFBench, GPQA Diamond i MATH-500. Te wyniki jakościowe pochodzą z uruchomień ewaluacyjnych llama.cpp na referencyjnych systemach NVIDIA H100 80GB i są następnie dopasowywane do uruchomień na urządzeniach, które wykorzystują ten sam model i kwantyzację. Oznacza to, że wynik jakości wyświetlany obok przepustowości telefonu nie został wygenerowany na samym telefonie.

Procesy testowania wydajności w Pipette opierają się na opublikowanej metodologii, która obejmuje:

  • Stałe kształty tokenów.
  • Zachłanne dekodowanie (greedy decoding).
  • Odrzucenie rozgrzewkowej serii testów.
  • Pięć mierzonych powtórzeń.
  • Kontrolę gotowości.

Przed każdym mierzonym powtórzeniem, specyficzne dla platformy sprawdzenie weryfikuje warunki termiczne i obciążeniowe; nieudane uruchomienia nie są publikowane. Ocena wykorzystuje oddzielny protokół z deterministycznym, niezależnym od modelu punktowaniem, a pipette-scores nigdy nie widzi pochodzenia generacji. Każde zgłoszenie rejestruje wersję benchmarku, kształt tokena, artefakt modelu, kwantyzację, wersję i ustawienia środowiska uruchomieniowego oraz sprzęt i system operacyjny urządzenia.

Znaczenie dla rozwoju AI na urządzeniach brzegowych

Udostępnienie Pipette przez Liquid AI stanowi istotny krok w kierunku standaryzacji i poprawy wiarygodności benchmarkingu modeli AI na urządzeniach brzegowych. Dzięki otwartemu charakterowi platformy i kompleksowemu podejściu, deweloperzy i badacze zyskują narzędzie, które pozwala na bardziej precyzyjną ocenę, jak modele AI będą działać w rzeczywistych warunkach użytkowania. To z kolei może przyspieszyć rozwój i optymalizację aplikacji AI działających lokalnie, otwierając nowe możliwości dla innowacji w dziedzinie sztucznej inteligencji na urządzeniach mobilnych i IoT.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

IBM prezentuje Granite 4.2: Nowe modele językowe z zaawansowanym rozumowaniem i uczeniem agentowym
LFM2.5-DSpark: Nowa Era Szybszego Wnioskowania w Modelach Językowych
Liquid AI wprowadza LFM2.5 Q4_0: Nowy standard kwantyzacji modeli językowych
Google przedstawia SAM (Sovereign Agent Mesh): bezpieczną sieć P2P dla autonomicznych agentów AI
Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
Meta AI prezentuje Muse Glimmer: model agentowy 30B działający na pojedynczej karcie GPU

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.