Model językowy FLM zintegrowany z konektomem muszki owocowej nie poprawia wydajności
Naukowcy zaimplementowali pełny konektom muszki owocowej do zamrożonego modelu językowego FLM, jednak testy kontrolne wykazały, że ta integracja nie przyniosła oczekiwanej poprawy wydajności.
Model językowy Fly Language Model (FLM), oparty na architekturze LFM2.5-1.2B-Instruct, został wzbogacony o pełny konektom muszki owocowej. Projekt ten objął 166 700 neuronów i 25,6 miliona połączeń, które zostały zintegrowane za pomocą osadzeń tokenów. Pomimo tej złożonej integracji, testy kontrolne wykazały, że dodanie struktury konektomu nie przyczyniło się do poprawy wydajności modelu.
Architektura i parametry modelu FLM
Architektura FLM polegała na wykorzystaniu zamrożonego rdzenia LFM2.5-1.2B-Instruct, do którego dodano niewielką, nauczoną korektę. Cały proces treningu obejmował jedynie 278 528 parametrów, co wskazuje na próbę efektywnego wykorzystania istniejącej bazy. Celem było sprawdzenie, czy biologiczna struktura połączeń neuronowych, odwzorowana w konektomie muszki owocowej, może przynieść korzyści dla modeli językowych.
Wyniki testów i porównanie z kontrolami
Zgodnie z opublikowanym preprintem, model FLM osiągnął poprawę o 0,0222 nata na token w porównaniu do bazowego modelu. Jednakże, kluczowym odkryciem było to, że model kontrolny, o dopasowanej liczbie parametrów, ale bez integracji grafu konektomu, osiągnął nieznacznie lepsze wyniki w każdej próbie. To sugeruje, że samo odwzorowanie struktury połączeń biologicznych, przynajmniej w tej implementacji, nie przekłada się na wymierne korzyści w zadaniach językowych.
Autorzy projektu szczegółowo opisali architekturę, cztery różne kontrole użyte w badaniu, a także kwestie związane z ograniczeniem pamięci wynoszącym 0,6 na token. Udostępnili również kod na licencji MIT, co umożliwia lokalne uruchomienie i dalsze eksperymenty ze strony społeczności naukowej.
Implikacje dla badań nad AI inspirowaną biologią
Wyniki te są istotne dla dziedziny sztucznej inteligencji, zwłaszcza w kontekście badań nad modelami inspirowanymi biologią. Chociaż integracja złożonych struktur biologicznych, takich jak konektom muszki owocowej, wydaje się intuicyjnie obiecująca, to w tym przypadku nie przełożyła się na poprawę wydajności. Wskazuje to na potrzebę dalszych badań nad tym, jak najlepiej tłumaczyć i wykorzystywać zasady organizacji biologicznych sieci neuronowych w projektowaniu efektywnych modeli AI. Może to również sugerować, że klucz do sukcesu leży nie tylko w odwzorowaniu struktury, ale także w zrozumieniu i implementacji dynamicznych procesów i funkcji, które zachodzą w żywych organizmach. Projekt FLM stanowi cenny wkład w te poszukiwania, dostarczając konkretnych danych i otwartego kodu do dalszej analizy.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
OpenBMB prezentuje MiniCPM5-2B: kompaktowy model językowy o wysokiej wydajności
OpenBMB wprowadziło MiniCPM5-2B, gęsty model językowy z 2,52 miliarda parametrów, który osiąga średni wynik 53,9 w 34 testach porównawczych, przewyższając konkurencję.
Redakcja Aigest5 dni temu

Nvidia rozważa inwestycję do 10 miliardów dolarów w rekordowe IPO Anthropic
Nvidia prowadzi rozmowy w sprawie potencjalnej inwestycji w wysokości do 10 miliardów dolarów w planowaną ofertę publiczną Anthropic, która może stać się największym IPO w historii.
Redakcja Aigest7 godz. temu

Jensen Huang z Nvidii prognozuje 70% wzrost przychodów w przyszłym roku
Prezes Nvidii, Jensen Huang, przedstawił na konferencji Goldman Sachs prognozę rekordowego wzrostu przychodów firmy o 70% w przyszłym roku, podkreślając jej kluczową rolę w ekosystemie sztucznej inteligencji.
Redakcja Aigestwczoraj
Przebudowa AUTOMATIC1111 za pomocą Gradio Workflow
Artykuł omawia, jak Gradio Workflow może usprawnić i zautomatyzować procesy w popularnym narzędziu AUTOMATIC1111 do generowania obrazów AI, oferując większą elastyczność i modularność.
Redakcja Aigest2 dni temu

USA oskarża sześć chińskich firm AI o masowe kopiowanie modeli, Chiny odpowiadają zarzutami o uprzedzenia
Amerykańskie agencje bezpieczeństwa narodowego oskarżyły sześć chińskich firm AI o zmasowane kopiowanie zaawansowanych modeli, co ma skracać czas ich rozwoju i obniżać koszty. Chiny odrzucają zarzuty, nazywając je bezpod
Redakcja Aigest3 dni temu

Model ekonomiczny Anthropic: prognozy CEO jako scenariusz skrajny
Firma Anthropic opublikowała model ekonomiczny z trzema scenariuszami wpływu AI na gospodarkę USA do 2030 roku. Okazuje się, że najczarniejsze prognozy CEO Anthropic, Dario Amodeiego, mieszczą się w najbardziej skrajnym
Redakcja Aigest3 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.