Aigest.
Narzędzia AI

Needle 2: Nowy model AI od Cactus Compute do wywoływania narzędzi, działający na urządzeniach mobilnych

Cactus Compute zaprezentował Needle 2, otwarty model AI z 45 milionami parametrów, przeznaczony do wywoływania narzędzi i ekstrakcji danych. Model wyróżnia się niezwykle niskim zapotrzebowaniem na zasoby, działając efekt

RA

Udostępnij
Needle 2: Nowy model AI od Cactus Compute do wywoływania narzędzi, działający na urządzeniach mobilnych
Fot. MarkTechPost

Firma Cactus Compute zaprezentowała Needle 2, otwarty model sztucznej inteligencji, który waży zaledwie 14 MB i jest przeznaczony do wywoływania narzędzi, obsługi urządzeń oraz ekstrakcji ustrukturyzowanych danych. Model ten, posiadający 45 milionów parametrów, wyróżnia się niezwykle niskim zapotrzebowaniem na zasoby, zużywając około 28 MB pamięci RAM podczas pełnej sesji. Jego unikalna architektura pozwala na działanie bez konieczności instalowania środowiska uruchomieniowego czy pobierania danych podczas wnioskowania, ponieważ jest on zamknięty w autorskim silniku C++ firmy.

Architektura i wydajność

Kluczową cechą Needle 2 jest jego zdolność do efektywnego działania na sprzęcie o ograniczonych zasobach, w tym na urządzeniach bez procesorów graficznych (GPU) czy jednostek przetwarzania neuronowego (NPU). Zespół Cactus Compute jasno określił cel projektu: mapowanie nieuporządkowanych zdań na typowane sygnatury funkcji nie wymaga obszernej wiedzy o świecie ani generowania otwartej prozy. To właśnie to założenie sprawia, że 45 milionów parametrów jest wystarczające dla tego modelu.

Model osiąga imponującą przepustowość dekodowania: 500 tokenów/sekundę na Raspberry Pi 5, od 400 do 1500 tokenów/sekundę na Meta Quest 3S i Apple Vision Pro, oraz od 300 do 700 tokenów/sekundę na smartfonach kosztujących poniżej 200 dolarów. Needle 2 jest dostarczany jako wstępnie skompilowane binaria i statyczna biblioteka dla szerokiej gamy systemów operacyjnych, w tym macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS oraz WebAssembly. Firma Cactus podaje, że ich aplikacja Index 01 już wykorzystuje Needle do lokalnych akcji głosowych offline.

Innowacje techniczne

Needle 2 wykorzystuje autorską technologię nazwaną Simple Attention Network. W jej ramach tradycyjna sieć FFN została zastąpiona przez Hadamard MLP, zachowano uwagę GQA, dodano pamięć klucz-wartość engramów z haszowanych tabel n-gramów oraz zastosowano wielopasmowe hiperpołączenia. Sieć składa się z 27 warstw i ma szerokość 512. Badania leżące u podstaw tej architektury zostały opublikowane na arXiv pod tytułem „A Controlled Study of Attention-Only Transformers”.

Model został wstępnie przeszkolony na zastrzeżonym korpusie 115 miliardów tokenów, a następnie poddany post-treningowi na 38 miliardach tokenów. Dla porównania, zespół badawczy zauważa, że model LFM2.5-230M był wstępnie szkolony na 19 bilionach tokenów. Needle 2 zużywa 70 MFLOPs na token, z czego 35 milionów z 45 milionów parametrów jest aktywnych w operacjach macierzowych. Dla porównania, LFM2.5 230M zużywa 460 MFLOPs, FunctionGemma 270M zużywa 540 MFLOPs, a Apple FM około 6000 MFLOPs.

Istotnym aspektem jest sposób obsługi wag: nigdy nie są one dekompresowane do pamięci RAM. 2-bitowe kody rozszerzają się w rejestrach wektorowych i łączą w iloczyny skalarne liczb całkowitych, co oznacza, że ścieżka arytmetyczna pozostaje w formacie int8. Binarny plik podczas uruchamiania sondyje procesor i wybiera odpowiednią warstwę jądra, taką jak SDOT, NEON, AVX2, wektory RISC-V, wasm SIMD lub skalarną.

Kontrola i niezawodność

Każdy generowany token jest ograniczony przez gramatykę na poziomie bajtów, skompilowaną ze schematów JSON użytkownika. Dzięki temu, że mechanizm dopasowujący wie, które tokeny są legalne, zanim jeszcze powstaną logity, silnik może pominąć do 98% projekcji słownictwa dla tokenów strukturalnych.

Mechanizm uwagi wykorzystuje okno przesuwne o długości 256 tokenów, a systemowa tura oraz deklaracje narzędzi są przypięte jako „KV sinks”. Pamięć pozostaje blisko 28 MB, niezależnie od długości konwersacji.

Jeśli zadeklarowanych jest pięć lub mniej narzędzi, są one renderowane bezpośrednio. Powyżej pięciu, kontrastowa głowica wyszukiwania osadza każdy schemat jednorazowo, ocenia zapytanie w każdej turze i dopuszcza tylko pięć najlepszych. Narzędzia niewybrane są niedostępne, a nie tylko mało prawdopodobne.

Każda odpowiedź zawiera wartość ufności, będącą minimum skalibrowanej głowicy post-hoc i prawdopodobieństwa dekodowania tokenów wywołania. Żądania niezwiązane z tematem zwracają puste wywołanie []. Umowa zakłada próg: działaj powyżej niego, a poniżej progu ponownie zapytaj lub eskaluj.

Ocena i zastosowania

Zespół Cactus Compute ocenia Needle 2 na pięciu publicznych benchmarkach wywoływania funkcji, używając ścisłego dopasowania, gdzie nazwy, kolejność wywołań i każdy argument muszą się zgadzać. Needle 2 działa kompleksowo poprzez dostarczony silnik w CQ2-bit z włączonym wyszukiwaniem; modele bazowe działają w f16 pod vLLM.

Needle 2 prowadzi w obu podziałach Seal-Tools i osiąga 98,3% dokładności nazw funkcji na Mobile Actions. Ustępuje w BFCL v4, co Cactus przypisuje dystrybucji: jego korpus to akcje urządzeń konsumenckich, a nie ogólne lub korporacyjne API. Wskaźnik poprawnie sformułowanych wyników w 3641 wierszach BFCL wynosi 93,4%. Zespół podkreśla dwie asymetrie: bazowe modele f16 faworyzują je, a specjalizacja zadań faworyzuje Needle.

Premiera Needle 2 stanowi znaczący krok w kierunku demokratyzacji dostępu do zaawansowanych funkcji AI na urządzeniach o ograniczonych zasobach. Jego niska waga, minimalne zapotrzebowanie na pamięć i wysoka wydajność otwierają nowe możliwości dla aplikacji mobilnych, urządzeń IoT i systemów wbudowanych, gdzie tradycyjne, większe modele AI są niepraktyczne. Zdolność do lokalnego przetwarzania danych bez potrzeby połączenia z chmurą zwiększa prywatność i niezawodność, co jest kluczowe w wielu zastosowaniach konsumenckich i przemysłowych. Warto obserwować, jak ta technologia wpłynie na rozwój inteligentnych urządzeń codziennego użytku.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Databricks pozyskało 5 miliardów dolarów przy wycenie 190 miliardów, pomimo początkowych planów na mniejszą kwotę
Google Gemini 3.7 Flash: Nowy model AI z lepszym kodowaniem i obniżoną ceną
Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
Cognition, twórca agenta AI Devin, dąży do wyceny 40 mld dolarów w nowej rundzie finansowania
Trzech pionierów AI dyskutuje o otwartości modeli w obliczu obaw o bezpieczeństwo
Google prezentuje serię Pixel 11, Pixel Watch 5 i lokalizator Pixel Tag z nowościami Gemini

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.