OlmoEarth Platform: Innowacyjna platforma AI dla analizy danych geoprzestrzennych na skalę planetarną
Allen Institute for AI (Ai2) uruchomił platformę OlmoEarth, która umożliwia przetwarzanie satelitarnych danych geoprzestrzennych na ogromną skalę, wspierając monitorowanie środowiska i bezpieczeństwo żywnościowe.

Allen Institute for AI (Ai2) uruchomił OlmoEarth Platform, infrastrukturę zaprojektowaną do przeprowadzania wnioskowania geoprzestrzennego na skalę planetarną. Platforma ta ma na celu wspieranie organizacji rządowych, pozarządowych i misyjnych w zastosowaniach takich jak monitorowanie wylesiania, bezpieczeństwo żywnościowe oraz ocena ryzyka pożarów, wykorzystując modele fundacyjne Ai2 oparte na danych satelitarnych.
Modele OlmoEarth zostały wstępnie przeszkolone na około 10 terabajtach multimodalnych danych satelitarnych. Ai2, znane z tworzenia i udostępniania potężnych otwartych modeli, dostrzegło potrzebę stworzenia kompleksowej platformy dla organizacji środowiskowych, które często nie dysponują odpowiednią infrastrukturą ani zespołami inżynierskimi do zarządzania pełnym cyklem życia modeli – od etykietowania danych, przez dostrajanie, po przeprowadzanie wnioskowania na dużą skalę. Doświadczenie Ai2 w obsłudze platform takich jak Skylight i EarthRanger, które muszą działać niezawodnie każdego dnia, pokazało, że kluczem do skuteczności jest efektywne kosztowo uruchamianie modeli we właściwym czasie i miejscu, monitorowanie ich wydajności oraz przekształcanie surowych wyników w praktyczne wnioski.
Wyzwania wnioskowania satelitarnego na dużą skalę
Wnioskowanie na taką skalę wiąże się z unikalnymi wyzwaniami. Obrazy satelitarne muszą być pozyskiwane z wielu źródeł, wyrównywane pod względem projekcji i rozdzielczości, a następnie efektywnie przetwarzane. Wyniki muszą być spójnie łączone w geograficznie jednolite mapy, a infrastruktura musi być odporna na rutynowe awarie typowe dla systemów rozproszonych. Platforma OlmoEarth jest w stanie przeprowadzić wnioskowanie na obszarach kontynentalnych w ciągu około jednego dnia, przetwarzając dziesiątki terabajtów obrazów za ułamek centa za kilometr kwadratowy.
Tradycyjne modele uczenia maszynowego często przetwarzają kilka megabajtów danych w ciągu sekundy. Wnioskowanie w obserwacji Ziemi działa na zupełnie innej skali – pojedyncze zadanie dostrajania modelu fundacyjnego może przenosić terabajty danych i trwać godzinami. Dane wejściowe mogą obejmować wiele pasm spektralnych, typów czujników i kroków czasowych na dużym obszarze geograficznym. Mogą pochodzić od różnych dostawców, każdy z własnymi projekcjami i rozdzielczościami, a także zawierać obserwacje brakujące lub zasłonięte przez chmury. Wynikiem jest sama mapa, więc każda prognoza musi pozostać precyzyjnie wyrównana z tą samą projekcją i siatką współrzędnych, co otaczające ją obszary.
Optymalizacja sprzętu i procesów
Pozyskiwanie i przygotowanie danych często dominuje czas działania zadania wnioskowania. Aby uniknąć wykorzystywania drogiego sprzętu, takiego jak GPU, do zadań lepiej przystosowanych dla CPU, platforma dzieli każde zadanie na trzy etapy, z których każdy jest dopasowany do odrębnego profilu sprzętowego. Platforma OlmoEarth rozdziela te etapy na wiele maszyn, jednocześnie w pełni wykorzystując procesory graficzne. Wieloprocesowe ładowarki danych stale zasilają każdy GPU, a ukończone wyniki są przesyłane bezpośrednio do pamięci masowej typu blob.
Warstwa wykonawcza platformy, OlmoEarth Run, dzieli region geograficzny objęty każdym zadaniem na partycje dostosowane do pojedynczych instancji obliczeniowych (workerów), a następnie dzieli te partycje na mniejsze okna, które są przetwarzane przez modele OlmoEarth. Ponieważ każde okno może być obsługiwane niezależnie, praca nad jedną częścią mapy nie musi czekać na inną. Obszar wielkości stanu może zostać podzielony na około sto partycji, natomiast uruchomienie na skalę kontynentalną może obejmować tysiące. Sąsiadujące partycje lekko się pokrywają, a to pokrycie jest uzgadniane podczas składania wyników, aby uniknąć widocznych szwów w końcowej mapie rastrowej.
Niezależność partycji pozwala na jednoczesne uruchamianie tego samego etapu na tysiącach instancji obliczeniowych. Niedawno wykorzystano to podejście do wygenerowania mapy ryzyka pożarów dla całej Ameryki Północnej. W szczytowym momencie operacja wykorzystała około 19 600 CPU i 994 GPU równolegle, z przepustowością sieci przekraczającą 168 GB/s. Ten poziom równoległości skrócił szacowany czas obliczeń szeregowych z 4737 godzin do około 30,5 godzin czasu rzeczywistego, co oznacza 155-krotne przyspieszenie.
Zarządzanie danymi i odporność na awarie
Platforma OlmoEarth musi określić, które sceny satelitarne powinny zasilać model, biorąc pod uwagę region geograficzny i zakres czasowy. Oznacza to identyfikację tego, co zostało zarejestrowane, gdzie i kiedy, u dostawców z różnymi katalogami, formatami i opóźnieniami publikacji. Kryteria wyboru zależą również od źródła – dla obrazów optycznych, takich jak Sentinel-2, zazwyczaj poszukuje się scen z najmniejszym zachmurzeniem, natomiast dla radaru z syntetyczną aperturą (SAR) ważniejsze mogą być dostępne kanały polaryzacyjne.
Platforma opiera się na publicznych katalogach STAC i otwartych standardach, ale duże zadanie wnioskowania może generować tysiące zapytań o metadane jednocześnie, co znacznie przekracza możliwości zewnętrznych usług, takich jak API STAC ESA czy Microsoft Planetary Computer. Aby uniknąć przeciążenia tych usług, OlmoEarth Platform utrzymuje własny indeks metadanych, aktualizowany w miarę publikowania nowych obrazów. Dla zbiorów danych hostowanych przez AWS Open Data platforma otrzymuje powiadomienia SNS o każdej nowej scenie. Jeśli dostawca nie oferuje strumienia zmian, indeks jest odpytywany co kilka minut. Dzięki temu zapytania do usług zewnętrznych są zgodne ze stałym tempem nowych publikacji, a nie nagłym wzrostem generowanym przez duże zadanie wnioskowania.
Każdy wpis w indeksie przechowuje metadane sceny wraz ze wskaźnikami do każdej lokalizacji, w której dostępne są podstawowe piksele. W czasie działania platforma wybiera najlepsze źródło i wykonuje odczyty okienkowe z formatów zoptymalizowanych pod kątem chmury, takich jak COG lub Zarr, pobierając tylko bajty potrzebne dla danej partycji, zamiast pobierać całe sceny. Indeks wspiera również narzędzia do adnotacji, utrzymując wskaźniki do obrazów Sentinel-1, Sentinel-2, Landsat i NISAR w formatach zoptymalizowanych pod kątem chmury.
Platforma OlmoEarth jest zaprojektowana tak, aby automatycznie odzyskiwać się po awariach. Dla każdego zadania w ramach etapu i partycji geograficznej dynamicznie udostępnia maszynę wirtualną z kontenerem Docker. Ponieważ każde zadanie jest reentrantne i idempotentne, sporadyczne awarie mogą być bezpiecznie obsługiwane poprzez ponowne uruchomienie. W tej skali awarie są spodziewane: dostawca może być wolny lub chwilowo niedostępny; metadane mogą wskazywać, że obraz istnieje, nawet jeśli brakuje wymaganego pasma lub okna; zachmurzenie może pozostawić zbyt mało użytecznych obserwacji; lub zadanie może się całkowicie zawiesić. Platforma reaguje śledzeniem zadań, automatycznymi ponownymi próbami, awaryjnym przełączaniem na alternatywnych dostawców, gdy są dostępni, oraz wyraźnym rozróżnieniem między błędami możliwymi do ponownej próby a błędami krytycznymi.
Rozwój platformy OlmoEarth ma kluczowe znaczenie dla organizacji działających w obszarach ochrony środowiska, bezpieczeństwa żywnościowego, reagowania na katastrofy i zmian klimatycznych. Umożliwia im dostęp do zaawansowanej infrastruktury, która wcześniej była poza ich zasięgiem, co pozwala na lepsze zrozumienie planety i podejmowanie bardziej świadomych decyzji. W miarę jak modele fundacyjne geoprzestrzenne stają się coraz bardziej dojrzałe, platformy takie jak OlmoEarth będą odgrywać coraz większą rolę w przekształcaniu surowych danych satelitarnych w praktyczne narzędzia do rozwiązywania globalnych wyzwań.
Źródło: huggingface.co
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

LFM2.5-Encoders: Nowa era szybkiego przetwarzania długich kontekstów AI na CPU
LiquidAI wprowadza LFM2.5-Encoders, innowacyjne modele zdolne do przetwarzania wyjątkowo długich sekwencji danych na standardowych procesorach, otwierając nowe możliwości dla aplikacji AI.
Redakcja Aigest5 godz. temu

Inwestycje w centra danych rosną szybciej niż przychody z AI — i to jest policzalne ryzyko
Miliardowa umowa Verizona z Google i przekształcanie central w mini centra danych to symptom szerszego zjawiska: infrastruktura AI pochłania ogromne środki, które nie zawsze przekładają się na natychmiastowe zyski.
Michał Chmielarz12 godz. temu

Verizon inwestuje w AI: miliardowa umowa z Google i mini centra danych
Verizon ogłosił strategiczne partnerstwo z Google o wartości ponad miliarda dolarów, wykorzystując swoją infrastrukturę światłowodową. Firma przekształca również swoje centrale w małe centra danych, aby sprostać rosnącem
Redakcja Aigestwczoraj

Anthropic prezentuje agentów AI do analiz finansowych, wykorzystujących Claude i Pythona
Anthropic opracował zaawansowany przepływ pracy dla agentów AI w sektorze finansowym, integrując model Claude z Pythonem i specjalistycznymi narzędziami do analizy. Rozwiązanie umożliwia automatyzację złożonych zadań fin
Redakcja Aigestwczoraj


ChatGPT blokuje bezpośrednie żądania kopiowania stylu autorów, powołując się na „szerokie cechy”
ChatGPT firmy OpenAI zaczął odmawiać bezpośredniego naśladowania stylu znanych autorów, oferując zamiast tego teksty inspirowane ich „szerokimi cechami”. Zmiana ta może mieć istotne konsekwencje prawne w kontekście toczą
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.