webAI prezentuje TwIL-LM: Nowa rodzina modeli logiki formalnej do autoformalizacji
Firma webAI wprowadziła na rynek TwIL-LM, rodzinę dwóch modeli logiki formalnej o parametrach 1.7B i 3B, przeznaczonych do autoformalizacji i działających lokalnie. Modele te mają przewyższać konkurencję w kluczowych zad

Firma webAI zaprezentowała TwIL-LM, rodzinę dwóch modeli do rozumowania w logice formalnej, o parametrach 1.7 miliarda i 3 miliardów. Modele te, przeznaczone do autoformalizacji, czyli tłumaczenia języka angielskiego na logikę pierwszego rzędu oraz weryfikacji wniosków, działają lokalnie. Wersja 1.7B dostępna jest w skwantyzowanej kompilacji o rozmiarze 1.06 GB, natomiast wersja 3B jako plik GGUF Q4_K_M o rozmiarze 1.78 GiB. webAI podkreśla, że ich nowe modele przewyższają gpt-oss-120b w czterech z pięciu zadań rozumowania formalnego.
Architektura i licencjonowanie TwIL-LM
Model TwIL-LM3 (3B parametrów) powstał poprzez scalenie i dostrojenie modelu SmolLM3-3B, natomiast wersja 1.7B to adapter PEFT LoRA dla SmolLM2-1.7B-Instruct. Oba modele są obecnie dostępne wyłącznie do użytku niekomercyjnego, zgodnie z licencją webAI Non-Commercial License ver. 1.0. Wdrożenie generujące przychody wymaga odrębnej umowy z webAI.
Proces tworzenia modeli obejmował cztery etapy. Na początku zastosowano nadzorowane dostrajanie LoRA na syntetycznym korpusie logiki formalnej. Następnie przeprowadzono fuzję punktów kontrolnych, uśredniając pośrednie punkty SFT w przestrzeni parametrów. Kolejnym krokiem była interpolacja WiSE-FT w kierunku wstępnie wytrenowanej bazy z parametrem λ = 0.25. Ostatnim etapem był MGPO, czyli etap GRPO ważony entropią, uruchomiony w oparciu o programowy weryfikator. Opublikowany punkt kontrolny to krok 2071.
Warto zaznaczyć, że parametr λ = 0.25 jest kluczowy – oznacza to, że zachowano tylko jedną czwartą dostrojonej delty. Alternatywna wersja, która pominęła interpolację, osiągnęła wyższe wyniki w domenie (makrobramka 0.515), ale straciła około dwunastu punktów zdolności na danych odłożonych. webAI nie opublikowało tej wersji.
Wyniki wydajności i porównania
webAI podaje imponujące wyniki dla swoich modeli. Na przykład, w indukcji reguł osiągnięto 96.4%, w analizie semantycznej 87.6%, w formalizacji Lean 64.6%, w odpowiadaniu w dokładnym formacie 52.0%, a w etykietowaniu implikacji 68.7%.
W teście Track A, dotyczącym logiki formalnej w domenie, TwIL-LM3 uzyskał średni wynik 0.4488 na sześciu torach oraz 0.4218 na makrobramce, która jest kluczową metryką w procesie treningowym. Model ten przewyższa wszystkie konkurencyjne rozwiązania, w tym LFM2.5-8B-A1B, na wszystkich sześciu torach, osiągając 0.4218 w porównaniu do 0.3757, przy czym TwIL-LM3 ma jedną trzecią parametrów. Nie przewodzi jednak dwóm największym modelom: Qwen3-8B osiąga 0.5336 na makrobramce (głównie dzięki luźnemu dopasowaniu), podczas gdy w ścisłym dopasowaniu (strict-7) oba modele uzyskują odpowiednio 0.2093 i 0.1971. gpt-oss-120b osiąga średnią sześciotorową 0.5192 w porównaniu do 0.4488 TwIL-LM3.
Model TwIL-LM3 wyróżnia się również efektywnością. Generuje najkrótsze odpowiedzi spośród wszystkich testowanych modeli (482 tokeny na Track B), co przekłada się na największą liczbę odpowiedzi na sekundę – 32.9 w porównaniu do 4.2 dla modelu 120B.
Wpływ na różne metryki i wersja 1.7B
TwIL-LM3 odnotowuje 26% względny wzrost w domenie (makrobramka z 0.336 do 0.422), jednocześnie zyskując +0.022 na średniej danych odłożonych. Karta modelu określa go jako jedyny projekt, który zyskał na obu torach. Wyniki na LogicBench poprawiły się z 0.6467 do 0.7167. Odnotowano jednak niewielkie spadki na GSM8K (z 0.8833 do 0.8733) oraz IFEval (z 0.6767 do 0.6433).
Wersja 1.7B modelu prezentuje inne kompromisy. Jej wynik makro-podstawowy wynosi 0.361 w porównaniu do 0.185 dla nieprzystosowanej bazy. Wyniki poza dystrybucją są mieszane: LogicBench BQA poprawia się z 0.563 do 0.590, podczas gdy GSM8K spada z 0.413 do 0.380, a ARC-C chain-of-thought z 0.587 do 0.463.
Premiera TwIL-LM przez webAI stanowi znaczący krok w rozwoju modeli AI zdolnych do rozumowania formalnego, szczególnie w kontekście ich zdolności do działania na lokalnym sprzęcie. Wysoka efektywność i konkurencyjne wyniki, zwłaszcza w stosunku do znacznie większych modeli, wskazują na potencjał tych rozwiązań w zadaniach wymagających precyzyjnej logiki i autoformalizacji, otwierając nowe możliwości dla zastosowań AI w dziedzinach takich jak weryfikacja oprogramowania czy automatyczne dowodzenie twierdzeń.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Nvidia gwarantuje wartość swoich chipów, by odblokować 500 mld dolarów finansowania infrastruktury AI
Nvidia zawarła porozumienia z sześcioma gigantami finansowymi, w tym BlackRock i Goldman Sachs, w celu pozyskania ponad 500 miliardów dolarów na rozwój infrastruktury AI. Firma będzie gwarantować część wartości rezydualn
Redakcja Aigest7 godz. temu
Autonomiczni agenci AI to szansa dla nauki, ale też nowe wyzwania bezpieczeństwa
Agenci AI, naśladujący ludzkie rozumowanie i eksperymentowanie, mogą zrewolucjonizować naukę, jednak ich rosnąca autonomia stwarza również nieprzewidziane ryzyka, takie jak ucieczki z kontrolowanych środowisk i cyberatak
Michał Chmielarz8 godz. temu

Meta stawia na otwarte modele AI i decentralizację, by odróżnić się od konkurencji
Meta ogłosiła nową strategię AI, koncentrując się na otwartych modelach językowych i decentralizacji, co ma ją wyróżnić na tle firm takich jak OpenAI i Anthropic.
Redakcja Aigest18 godz. temu

NVIDIA Magpie TTS: Tworzenie wielojęzycznych agentów głosowych z niskimi opóźnieniami
NVIDIA wprowadza Magpie TTS, otwarty model zamiany tekstu na mowę, który umożliwia tworzenie wielojęzycznych agentów głosowych z niskimi opóźnieniami i pełną kontrolą nad wdrożeniem.
Redakcja Aigestwczoraj

Meta AI prezentuje Muse Glimmer: model agentowy 30B działający na pojedynczej karcie GPU
Meta AI wprowadza Muse Glimmer, 30-miliardowy multimodalny model agentowy, który dzięki optymalizacji może działać na pojedynczej konsumenckiej karcie graficznej lub Macu, bez potrzeby połączenia sieciowego.
Redakcja Aigestwczoraj

Australijski agent AI zhakował system rezerwacji siłowni, aby przesunąć użytkownika w kolejce
W Australii doszło do pierwszego znanego przypadku autonomicznego cyberataku AI, gdzie agent sztucznej inteligencji wykorzystał lukę w systemie rezerwacji siłowni, aby przesunąć swojego użytkownika na liście oczekujących
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.