Dostrojony model AI Bridgewater przewyższa GPT i Claude w analizie finansowej, obniżając koszty
Hedge fund Bridgewater we współpracy z Thinking Machines Lab opracował dostrojony model AI, który znacznie lepiej radzi sobie z oceną dokumentów finansowych niż czołowe modele, takie jak GPT czy Claude, przy ułamku koszt

Hedge fund Bridgewater oraz Thinking Machines Lab ogłosiły, że ich dostrojony model sztucznej inteligencji, oparty na otwartym kodzie, przewyższa najsilniejsze modele AI w ocenie dokumentów finansowych, oferując jednocześnie znacznie niższe koszty. Wyniki te pochodzą z wewnętrznej ewaluacji przeprowadzonej przez oba podmioty.
Inwestorzy codziennie mierzą się z ogromną ilością informacji – wiadomości, analiz, sprawozdań korporacyjnych i e-maili. Według raportu AIA Labs Bridgewater i Thinking Machines Lab, startupu założonego przez byłą CTO OpenAI, Mirę Murati, prawdziwym wyzwaniem nie jest samo czytanie, lecz ciągłe podejmowanie drobnych, powtarzalnych decyzji o tym, co jest naprawdę istotne. To właśnie ten proces selekcji i oceny badacze chcieli zautomatyzować.
Wyzwania w analizie finansowej dla AI
Zdefiniowano sześć zadań odzwierciedlających codzienną rutynę inwestora. Przykładem może być ocena, czy artykuł finansowy jest istotny dla dyrektora, lub czy dokument banku centralnego sygnalizuje kierunek przyszłych zmian stóp procentowych. Dla doświadczonych inwestorów te decyzje są trywialne, choć często trudno im ubrać swoje rozumowanie w słowa. Raport podaje wymowny przykład: nagłówek o roszczeniach Trumpa do Grenlandii jest oznaczany jako nieistotny, podczas gdy groźba Trumpa dotycząca nowych taryf celnych na Chiny jest wysoce istotna, mimo że oba tematy dotyczą geopolityki i finansów.
Modele frontierowe, takie jak warianty Gemini, Claude i GPT, początkowo osiągały jedynie około 50 procent dokładności przy użyciu podstawowych promptów. Nawet po zastosowaniu instrukcji napisanych przez ekspertów i trójpoziomowego systemu ocen (relevantne i interesujące, relevantne, ale nieinteresujące, nieistotne), dokładność wzrosła do około 70-75 procent. To wciąż było poniżej progu 80 procent, który autorzy ustalili jako niezbędny do wiarygodnego wdrożenia.
Co więcej, nowsze modele oferowały marginalną poprawę w stosunku do kosztów. Na przykład, GPT 5.4 był o 43 procent droższy niż GPT 5.2, ale tylko nieznacznie dokładniejszy.
Klucz do sukcesu: dostrojenie i prywatne dane
Rozwiązaniem okazało się dostrojenie (fine-tuning) – ponowne szkolenie modelu o otwartej wadze na zastrzeżonych przykładach. Kluczowym elementem była ocena inwestorów Bridgewater. Początkowo do etykietowania dokumentów zatrudniono zewnętrznych wykonawców, ale wiele z ich etykiet okazało się błędnych. Aby uniknąć angażowania drogich profesjonalistów do przeglądania wszystkiego, badacze zastosowali sprytne obejście: pierwszy model uczył się na podstawie tych niedoskonałych etykiet i ponownie oceniał te same dokumenty. Wszędzie tam, gdzie model i oryginalna etykieta się nie zgadzały, prawdopodobnie występował błąd. Tylko te sporne przypadki trafiały do inwestorów w celu korekty.
Szkolenie odbyło się na platformie Tinker firmy Thinking Machines Lab, zbudowanej na bazie otwartego modelu Qwen3-235B. W wewnętrznej ocenie zespołu, dostrojony model osiągnął 84,7 procent dokładności, w porównaniu do 78,2 procent dla najlepszego testowanego modelu frontierowego. Co więcej, jego uruchomienie kosztowało blisko 14 razy mniej. Należy jednak zaznaczyć, że nie jest to niezależne porównanie, a obie firmy mają interes w promowaniu swojego produktu.
Znaczenie dla przyszłości AI w biznesie
Odkrycie to, wykraczające poza same liczby, jest niezwykle istotne. Pokazuje ono, że duże laboratoria, takie jak OpenAI, nie wchłonęły jeszcze wszystkich dostępnych danych. Ogromne zasoby prywatnych danych korporacyjnych i niewykorzystanej ludzkiej ekspertyzy nadal istnieją i stanowią realne pole do znaczącej poprawy. Jest to szczególnie prawdziwe w przypadku firm, które celowo utrzymują swoje najcenniejsze dane w tajemnicy. Przekazanie tych danych zewnętrznym laboratoriom wiąże się z ryzykiem konkurowania z produktem zbudowanym na ich podstawie.
Dostrojenie otwartych modeli za pomocą narzędzi takich jak Tinker oferuje firmom alternatywę. Pozwala im zachować kontrolę nad wagami modeli, danymi, a w zależności od konfiguracji, nawet nad samymi jednostkami GPU. To podejście podkreśla rosnące znaczenie personalizacji i wykorzystania unikalnych, wewnętrznych zasobów wiedzy w rozwoju sztucznej inteligencji, co może zrewolucjonizować sposób, w jaki przedsiębiorstwa wykorzystują AI do przewagi konkurencyjnej, jednocześnie chroniąc swoje najcenniejsze aktywa informacyjne.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Kompleksowy przewodnik po dostrajaniu modeli LLM do wywoływania narzędzi z XYZ-Aquila-SFT i Qwen3
Artykuł przedstawia szczegółowy przewodnik po dostrajaniu dużych modeli językowych (LLM) do efektywnego wykorzystywania narzędzi, bazując na zbiorze danych XYZ-Aquila-SFT i modelu Qwen3-0.6B.
Redakcja Aigest2 dni temu

OpenAI i Anthropic obniżają ceny modeli AI w obliczu rosnącej konkurencji z Chin
Wiodące amerykańskie firmy AI, OpenAI i Anthropic, obniżają ceny swoich modeli, aby zatrzymać klientów, którzy coraz częściej wybierają tańsze alternatywy od chińskich rywali, takich jak Moonshot i DeepSeek.
Redakcja Aigest3 dni temu

Deepseek ulepsza model V4 Pro, udostępnia oprogramowanie agentowe jako open source i podnosi ceny API
Deepseek ogłosił znaczące zmiany, wprowadzając ulepszoną wersję swojego flagowego modelu V4 Pro, udostępniając autorskie oprogramowanie agentowe jako open source oraz podnosząc ceny dostępu do API.
Redakcja Aigest4 dni temu

SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
SpaceXAI udostępniło Grok 4.6, ulepszoną wersję swojego modelu AI, która oferuje znacznie większy kontekst i lepszą wydajność w zadaniach wymagających długotrwałego działania agentów oraz w pracy z kodem.
Redakcja Aigest4 dni temu

Agenty AI zużywają 600 razy więcej energii niż proste zapytanie na czacie
Nowe badanie naukowca klimatycznego Zeke'a Hausfathera ujawnia, że agenty AI, takie jak Claude Code, zużywają znacznie więcej energii niż dotychczas szacowano dla pojedynczych zapytań tekstowych, podważając optymistyczne
Redakcja Aigest8 sie 2026

ChatGPT udostępnia nielimitowane czaty tekstowe dla darmowych użytkowników
OpenAI znosi limity na czaty tekstowe dla wszystkich użytkowników ChatGPT, co zbiega się z przekroczeniem miliarda użytkowników tygodniowo. Wprowadzono także nowe modele GPT-5.6 Luna i Sol.
Redakcja Aigest6 sie 2026
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.