GPT-5.6 Sol Ultra rozwiązał 50-letni problem matematyczny w mniej niż godzinę
Nowy model AI OpenAI, GPT-5.6 Sol Ultra, rzekomo opracował dowód na hipotezę Cycle Double Cover, wykorzystując 64 równolegle działające subagenty. Rozwiązanie problemu, który pozostawał nierozwiązany przez około 50 lat,

Nowy model sztucznej inteligencji OpenAI, GPT-5.6 Sol Ultra, rzekomo opracował dowód na hipotezę Cycle Double Cover, wykorzystując 64 równolegle działające subagenty. Matematyk Thomas Bloom pochwalił dowód, ale skrytykował brak cytowań w pracy. Hipoteza, która pozostawała nierozwiązana przez około 50 lat, została udowodniona przez model AI w mniej niż godzinę.
Przełom w teorii grafów
Hipoteza Cycle Double Cover dotyczy fundamentalnego pytania w teorii grafów: czy w dowolnej sieci wierzchołków i krawędzi możliwe jest znalezienie zbioru cykli, które przechodzą przez każdą krawędź dokładnie dwa razy? Problem ten został sformułowany niezależnie przez kilku matematyków w latach 70. XX wieku. Od tego czasu pojawiło się wiele częściowych rozwiązań dla szczególnych przypadków, ale brakowało ogólnie akceptowanego dowodu.
Według OpenAI, dowód został w całości wygenerowany przez GPT-5.6 Sol Ultra, a sama praca została napisana przez model GPT-5.6 Sol. Thomas Bloom z University of Manchester określił go jako „bardzo ładny dowód”, zauważając, że rozwiązanie jest „krótkie, elementarne i mogło zostać odkryte w latach 80.”. Nie wymaga ono żadnych nowych teorii matematycznych, lecz sprytnie łączy znane narzędzia.
Dlaczego ludzie nie znaleźli rozwiązania wcześniej?
Bloom podejrzewa, że kluczowym krokiem było małe, kontrintuicyjne odchylenie w rozumowaniu. Ludzki matematyk prawdopodobnie próbowałby oczywistego podejścia, widząc jego niepowodzenie, zrezygnowałby. Sztuczna inteligencja natomiast nie zniechęca się; po prostu kontynuuje próbowanie małych wariacji, aż jedna zadziała. Bloom uważa, że człowiek mógłby pomyśleć: „spodziewałem się porażki, chyba nie da się tego zrobić tak łatwo” – podczas gdy AI nie zniechęca się i próbuje małych wariacji.
Ocena Blooma jest jak dotąd najbardziej szczegółową publiczną analizą; pełna weryfikacja matematyczna przez społeczność naukową jest wciąż w toku.
Kontrowersje wokół cytowań i kreatywności AI
Bloom zauważa, że podstawowe idee matematyczne stojące za dowodem sięgają co najmniej pracy Bermonda, Jacksona i Jaegera z 1983 roku. Krytykuje fakt, że praca OpenAI w ogóle nie wspomina o tych wcześniejszych dokonaniach, co może sugerować, że AI samodzielnie wynalazła leżącą u podstaw strategię. Matematyk wątpi, czy AI samodzielnie wymyśliła rozwiązanie, „biorąc pod uwagę, że jej pierwszym instynktem rozwiązywania problemów jest zazwyczaj przeszukiwanie wszystkich powiązanych prac na dany temat i ich czytanie”.
Jest to powracająca debata dotycząca modeli rozumowania: czy „jedynie” odnajdują istniejącą wiedzę i ją rekombinują, czy też faktycznie tworzą coś nowego poprzez twórczą pracę? W przypadku tego dowodu Bloom skłania się ku pierwszej opcji. Porównuje ten wynik do hipotezy odległości jednostkowej, którą OpenAI również niedawno rozwiązało. Obie były ważnymi otwartymi problemami, które „okazały się znacznie łatwiejsze niż oczekiwano – nie wymagały żadnych wielkich nowych teorii”.
Bloom przewiduje, że systemy AI rozwiążą więcej takich hipotez, „których rozwiązania wymagają jedynie istniejącej, dobrze rozwiniętej teorii, plus dużo cierpliwości i wiary”. Jednakże, według Blooma, „jest to prawdopodobnie tylko niewielka część otwartych problemów i nie wiemy z góry, które to są”.
Rola inżynierii promptów w sukcesie AI
Częścią rozwiązania jest prompt napisany przez ludzi. To on w zasadzie inżynieruje dokładnie ten rodzaj wytrwałości, który Bloom opisuje jako klucz do znalezienia dowodu. Prompt nakazuje modelowi założyć, że istnieje kompletny dowód, odcinając jego najbardziej prawdopodobną, szczerą odpowiedź: że hipoteza jest otwarta. Następnie zabrania modelowi przeszukiwania internetu w celu sprawdzenia, czy hipoteza została już rozwiązana, oraz odpowiadania, że jest nierozwiązana. Model nie ma więc dokąd pójść, poza rozwiązaniem problemu.
Weryfikacja jest równie rygorystyczna. Częściowe wyniki, redukcje do innych nieudowodnionych hipotez, streszczenia obecnego stanu badań, wyjaśnienia, dlaczego problem jest trudny – wszystko to zostało odrzucone jako niewystarczające. Model nie może odpowiedzieć, dopóki nie będzie gotowy kompletny dowód, który przejdzie testy weryfikacyjne. Większość z 64 agentów celowo jest utrzymywana w niewiedzy co do najbardziej obiecującego podejścia, aby zachęcić do niezależnego „myślenia”. Agenci weryfikujący sprawdzają następnie każdego kandydata na dowód pod kątem szczegółowej listy typowych błędów. Modelowi nakazano obliczać przez co najmniej osiem godzin, zanim mógłby w ogóle rozważyć rezygnację. Zakończył pracę w ciągu jednej godziny.
Sukces GPT-5.6 Sol Ultra w rozwiązaniu długoletniego problemu matematycznego podkreśla rosnące możliwości zaawansowanych modeli AI w dziedzinach wymagających złożonego rozumowania. Chociaż pojawiają się pytania dotyczące oryginalności i cytowania, zdolność AI do systematycznego eksplorowania przestrzeni rozwiązań, gdzie ludzcy badacze mogliby się zniechęcić, otwiera nowe perspektywy dla przyspieszenia odkryć naukowych. Wskazuje to również na kluczową rolę precyzyjnego projektowania promptów i architektury agentów w kierowaniu AI do osiągania przełomowych wyników.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

OpenAI prezentuje Jalapeño: nowy chip AI przewyższa konkurencję w testach wydajności
OpenAI ujawniło szczegóły dotyczące swojego nowego chipa Jalapeño, który w testach benchmarkowych SemiAnalysis InferenceX znacząco przewyższył obecne rozwiązania pod względem wydajności i efektywności energetycznej.
Redakcja Aigest8 godz. temu

OpenAI rozwiązuje zespół ds. katastrofalnych zagrożeń AI, zadania przejmują inne działy
OpenAI rozwiązało swój zespół „Preparedness”, odpowiedzialny za ocenę poważnych zagrożeń związanych z modelami AI. Jego zadania zostały rozdzielone między inne grupy w firmie.
Redakcja Aigest16 sie 2026

Fastino wprowadza GLiNER2.5: Nowa architektura ekstrakcji informacji oparta na przewidywaniu granic
Fastino zaprezentowało GLiNER2.5, nową architekturę do ekstrakcji informacji, która zastępuje enumerację zakresów przewidywaniem granic, znacząco poprawiając wydajność i elastyczność modeli.
Redakcja Aigestwczoraj

Jak Cheshire Academy uczy mądrego korzystania z AI w klasie
Szkoła Cheshire Academy w Connecticut wdraża innowacyjne metody nauczania, wykorzystując sztuczną inteligencję w procesie edukacyjnym. Uczy uczniów i nauczycieli, jak efektywnie i etycznie korzystać z narzędzi AI, stosuj
Redakcja Aigestwczoraj

Thomson Reuters inwestuje 40 milionów dolarów w rozwój własnego modelu AI „Thomson”
Thomson Reuters wprowadza na rynek swój pierwszy wewnętrzny model językowy, „Thomson”, oparty na technologii Alibaba Qwen. Firma zainwestowała 40 milionów dolarów, stawiając na własność intelektualną zamiast polegać na z
Redakcja Aigestwczoraj

AI Luna po raz pierwszy zwolniła pracownika, ale dopiero po interwencji ludzi
Agent AI Luna, zarządzająca sklepem w San Francisco, po raz pierwszy podjęła decyzję o zwolnieniu pracownika. Okazało się, że sztuczna inteligencja potrzebowała ludzkiej interwencji, aby przypomnieć sobie własne zasady.
Redakcja Aigest2 dni temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.