Aigest.
Biznes AI

Thomson Reuters inwestuje 40 milionów dolarów w rozwój własnego modelu AI „Thomson”

Thomson Reuters wprowadza na rynek swój pierwszy wewnętrzny model językowy, „Thomson”, oparty na technologii Alibaba Qwen. Firma zainwestowała 40 milionów dolarów, stawiając na własność intelektualną zamiast polegać na z

RA

Udostępnij
Thomson Reuters inwestuje 40 milionów dolarów w rozwój własnego modelu AI „Thomson”
Fot. The Decoder

Thomson Reuters, globalna firma dostarczająca profesjonalne informacje, wprowadza na rynek swój pierwszy wewnętrzny model językowy o nazwie „Thomson”. Model ten, zbudowany na bazie technologii Alibaba Qwen, osiąga najlepsze wyniki, gdy ma dostęp do wewnętrznych treści i narzędzi firmy. Jest to strategiczny krok, który podkreśla dążenie Thomson Reuters do posiadania własnej technologii AI zamiast wynajmowania rozwiązań od zewnętrznych dostawców, takich jak OpenAI czy Anthropic.

Inwestycja i rozwój modelu „Thomson”

Firma Thomson Reuters przeznaczyła około 40 milionów dolarów na rozwój modelu „Thomson” w ciągu ponad dwóch lat, pokrywając koszty personelu i mocy obliczeniowej. Kwota ta nie obejmuje jednak prawdziwego kapitału, jakim są dziesięciolecia zgromadzonych treści z platform takich jak Westlaw, Practical Law, Checkpoint i Reuters, a także czas pracy setek ekspertów dziedzinowych. Wspomniana w mediach kwota 450 000 dolarów dotyczy jedynie końcowego etapu szkolenia obecnej wersji modelu.

Podstawą „Thomsona” jest otwarta wersja modelu Alibaba Qwen, a konkretnie Qwen3.5-397B. We współpracy z Imperial College, Thomson Reuters najpierw przeszkolił chiński model pod kątem bezpieczeństwa, etyki i neutralności politycznej. Ta pośrednia wersja otrzymała nazwę „Snowdon”, nawiązującą do góry w Walii. Następnie model został wstępnie przeszkolony na własnych treściach firmy, a później doskonalony przez ekspertów dziedzinowych. Wykorzystano również wzmacniane uczenie agentowe w środowiskach narzędziowych firmy. Do tej pory wykorzystano mniej niż 10 procent dostępnych treści do szkolenia modelu.

Joel Hron, CTO firmy, podkreśla, że firma „zmieniała otwarty punkt początkowy prawdopodobnie blisko pół tuzina razy”. Jonathan Schwartz, szef badań, dodaje, że ważniejszym odkryciem jest „mniej sam indywidualny model, a bardziej fabryka modeli, którą zbudowaliśmy”.

Wyniki i porównania z konkurencją

Thomson Reuters twierdzi, że „Thomson” plasuje się wśród najlepszych modeli na świecie. Jednak wewnętrzne dane firmy przedstawiają bardziej stonowany obraz. Na platformie Stanford LegalBench model „Thomson” (0.823) ustępuje Gemini 3.1 Pro i GPT-5.5. W teście Harvey Legal Agent Benchmark plasuje się tuż za Opus 4.8. Model wyróżnia się w zakresie przestrzegania instrukcji i w trudnym teście PrBench Legal, ale wyraźnie słabiej wypada w rozumowaniu, a zwłaszcza w kodowaniu. Porównania są również skomplikowane ze względu na różnice metodologiczne, ponieważ „Thomson” konkuruje ze skalowaniem w czasie testu, podczas gdy GPT-5.5 działa bez trybu rozumowania.

W wewnętrznym benchmarku Deep Research z samym dostępem do sieci, „Thomson” osiąga wynik 0.53 w dokładności faktograficznej, podczas gdy GPT 5.4 uzyskuje 0.65. Dopiero z dostępem do własnych treści firmy, „Thomson” nieznacznie przewyższa GPT 5.4, osiągając 0.83 wobec 0.82. Andrew Bean, szef działu ewaluacji, przyznaje, że z dostępem do sieci „Thomson” mieści się w zakresie innych modeli, ale „z pewnością nie jest jeszcze liderem”.

Bean zauważa, że „duży wzrost wydajności wynika z możliwości szkolenia i praktykowania z własnymi narzędziami”, czego zewnętrzni dostawcy nie mogą zaoferować. Co ciekawe, GPT 5.4 również wykazuje podobnie ostry wzrost wydajności z dostępem do tych samych treści, co sugeruje, że dostęp do danych jest równie istotny, co specjalistyczne szkolenie. Firma nie testowała nowszych modeli. Niewielka przewaga wewnętrznego modelu może jednak wzrosnąć, jeśli firma zdecyduje się na silniejszy wariant, taki jak Qwen3.8, i przekroczy znacznie próg 10 procent wykorzystanych treści.

Dlaczego własny model zamiast wynajmu?

Thomson Reuters podaje trzy główne powody, dla których zdecydował się na budowę własnego modelu zamiast dostrajania istniejących modeli od OpenAI czy Anthropic:

  1. Ekonomia: Standardowe techniki dostrajania „mają silną tendencję do obniżania ogólnych możliwości” – mówi Schwartz. Ponadto, firma pozostaje uzależniona od dostawcy pod względem kosztów inferencji i planów rozwoju. Mniejszy, wewnętrzny model opłaca się szczególnie w przypadku prac o dużej objętości, takich jak przegląd dokumentów.
  2. Dane: Skok wydajności wynika ze szkolenia w ramach własnych narzędzi, takich jak Westlaw. Benchmarking to potwierdza, a firma nie zamierza udostępniać tego dostępu nikomu innemu.
  3. Efekt kumulacji: Hron opisuje to jako „wynajmowanie domu kontra kupowanie domu”. Każda recenzja ekspercka podczas aktualizacji produktu staje się danymi szkoleniowymi. Z wewnętrznym modelem „buduje się kapitał w czymś, co jest własnością na dłuższą metę i kumuluje się w czasie”. W przypadku modeli stron trzecich, ta wartość zanika u dostawcy.

To podejście sprawdza się dla Thomson Reuters, ponieważ firma łączy trzy rzadkie składniki: ekskluzywne zasoby danych, setki pełnoetatowych ekspertów dziedzinowych oraz procesy pracy, w których jakość można obiektywnie mierzyć. Dla firm o podobnym profilu, ten przypadek pokazuje, że społeczność open-source ustępuje wiodącym laboratoriom tylko o miesiące, a 40 milionów dolarów może wystarczyć na konkurencyjny, wyspecjalizowany model. Firmy, które nie posiadają ani własnych danych, ani sposobu na ocenę wyników na dużą skalę, najczęściej ponoszą stałe koszty utrzymania, gdy budują własny model.

Według Hrona, następna przewaga konkurencyjna w AI „będzie pochodzić z umiejętności orkiestracji i wiedzy, która inteligencja jest na tyle ważna, aby ją posiadać”.

Przyszłość i dostępność

„Thomson” przejmie funkcję Tabular Analysis w produkcie CoCounsel Legal, gdzie mniejszy i tańszy model ma sens ekonomiczny. Produkt pozostaje wielomodelowy, a administratorzy mogą przełączać się między modelami. „Thomson” nie ma działać jako orkiestrator, lecz obsługiwać podzadania, takie jak sprawdzanie cytatów. Firma zapewnia, że dane klientów nie są wykorzystywane do szkolenia modelu.

Mała wersja modelu zostanie udostępniona na platformie Hugging Face jako model o otwartej wadze, objęty licencją niekomercyjną, wraz z raportem technicznym i portalem dla deweloperów. Hron informuje, że trwają wstępne, niewiążące rozmowy z kancelariami prawnymi dotyczące bezpośredniego licencjonowania.

Decyzja Thomson Reuters o inwestowaniu w rozwój własnego modelu AI, zamiast polegania na zewnętrznych dostawcach, stanowi wyraźny sygnał na rynku technologicznym. Podkreśla ona rosnące znaczenie posiadania kontroli nad kluczowymi zasobami cyfrowymi i danymi, co w dłuższej perspektywie może zapewnić firmom unikalną przewagę konkurencyjną i niezależność w dynamicznie rozwijającym się świecie sztucznej inteligencji. To podejście może stać się wzorem dla innych przedsiębiorstw dysponujących bogatymi, specjalistycznymi zbiorami danych i ekspertyzą dziedzinową.

Źródło: the-decoder.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

LFM2.5-DSpark: Nowa Era Szybszego Wnioskowania w Modelach Językowych
Chiny doganiają Zachód w AI: Co pozostało z przewagi technologicznej?
SpaceXAI prezentuje Grok 4.6: model z kontekstem 500 tys. tokenów dla agentów AI i programistów
Fastino wprowadza GLiNER2.5: Nowa architektura ekstrakcji informacji oparta na przewidywaniu granic
Jak Cheshire Academy uczy mądrego korzystania z AI w klasie
AI Luna po raz pierwszy zwolniła pracownika, ale dopiero po interwencji ludzi

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.