Google Research wprowadza ME-POIs: ramy uwzględniające mobilność w osadzaniu punktów POI
Google Research i USC zaprezentowały ME-POIs, nowy framework, który integruje dane o ruchu ludzi z tekstowymi osadzeniami punktów POI, wzbogacając ich opis o informacje o sposobie użytkowania.

Zespół badawczy z Google Research oraz USC zaprezentował Mobility-Embedded POIs (ME-POIs) – innowacyjny framework, który integruje zagregowane dane dotyczące ruchu ludzi z tekstowymi osadzeniami punktów użyteczności publicznej (POI). Głównym założeniem jest uzupełnienie tradycyjnych modeli językowych, które opisują „czym jest miejsce”, o kluczową informację „jak jest ono wykorzystywane”. Przykładowo, dwie kawiarnie mogą należeć do tej samej kategorii i mieć podobny adres, jednak jedna może obsługiwać szybki ruch dojeżdżających do pracy, podczas gdy druga gości klientów przez dłuższy czas.
Jak działa ME-POIs?
Framework ME-POIs koduje każdą wizytę w danym miejscu jako kontekstualizowany wektor. Następnie, wykorzystując uczenie kontrastywne, dopasowuje te wizyty do jednego uczącego się prototypu dla każdego POI. Każda wizyta jest definiowana przez trzy kluczowe elementy: współrzędne geograficzne, czas przybycia i czas opuszczenia miejsca. Do ich przetworzenia służą trzy wyspecjalizowane kodery: Space2Vec dla lokalizacji w wielu skalach oraz dwa kodery Time2Vec – oddzielnie dla czasu przybycia i odjazdu, co pozwala rozróżnić czas rozpoczęcia wizyty od jej długości. Skonkatynowane wektory są następnie poddawane sinusoidalnemu kodowaniu pozycyjnemu i przechodzą przez 4-warstwowy, 8-głowicowy transformator (d_h = 512), co generuje kontekstualizowane osadzenia wizyt.
Centralnym elementem jest cel kontrastywny. Każdy POI posiada uczący się prototyp, a funkcja straty InfoNCE przyciąga osadzenie każdej wizyty do prototypu jej własnego POI, jednocześnie odpychając je od prototypów innych POI w mini-partii. W ten sposób prototyp staje się funkcjonalnym centroidem, uśredniającym indywidualne harmonogramy użytkowników.
Wyzwaniem w implementacji jest rzadkość danych. Tylko 9,07% POI w Los Angeles i 7,04% w Houston przekroczyło próg kotwicy (odpowiednio 100 i 50 wizyt). Dla pozostałych, rzadziej odwiedzanych miejsc, ME-POIs oblicza znormalizowane jądra Gaussa na trzech szerokościach pasma (0,3 km, 1,0 km, 3,0 km) i przenosi histogramy wizyt z POI kotwicowych do rzadkich POI. Dodatkowo, wprowadzono termin KL, który wymusza na rzadkim osadzeniu przewidywanie tego priora, oraz drugi termin KL nadzorujący kotwice względem ich własnych empirycznych rozkładów. Czwarta funkcja straty maksymalizuje podobieństwo cosinusowe z projektowanymi osadzeniami tekstowymi, których podpowiedzi są zgodne z recepturą GeoLLM: współrzędne, kategoria, adres i dziesięć najbliższych POI wraz z odległością i kierunkiem.
Wyniki i wydajność
Framework ME-POIs został oceniony na dwóch anonimowych zbiorach danych mobilności: Los Angeles (39 557 POI, 6,9 mln wizyt, cały rok 2019) i Houston (28 419 POI, 715 604 wizyt, 20 dni w marcu 2020). Testy obejmowały pięć zadań wzbogacania map z wykorzystaniem sondowania zamrożonych osadzeń. Etykiety pochodziły z SafeGraph (godziny otwarcia i zamknięcia) oraz Google Maps (intencja wizyty, ruchliwość i poziom cen).
Dodanie ME-POIs poprawiło wyniki w 34 z 35 par zadań modelowych w Los Angeles. Odnotowano znaczące względne zyski, takie jak 81,9% wzrost F1 w zakresie intencji wizyty (dla modelu Gemini) oraz 24,7% redukcja MAE w ocenie ruchliwości (również dla Gemini). W Houston, wskaźnik F1 dla poziomu cen wzrósł o 75,1% dla modelu GTR-T5. Jedynym odnotowanym spadkiem była klasyfikacja stałego zamknięcia dla Gemini, gdzie wynik obniżył się o 0,4%.
Co ciekawe, wariant trenowany wyłącznie na danych o mobilności, bez żadnego wyrównania tekstowego, osiągnął 0,600 dokładności w klasyfikacji poziomu cen w Los Angeles, przewyższając wynik Gemini (0,559). To wskazuje, że zbiorowe zachowania mogą być bardziej precyzyjne w opisywaniu miejsca niż słowa użyte do jego etykietowania. Model ten również przewyższył wszystkie bazowe modele oparte na trajektoriach we wszystkich zadaniach.
Model ME-POIs charakteryzuje się niskimi wymaganiami obliczeniowymi: ma około 53,7 miliona parametrów i był wstępnie trenowany na pojedynczej karcie NVIDIA Tesla V100 16GB. Główną barierą jest dostęp do danych – wymagane są licencjonowane dane o ruchu pieszych lub własne logi wizyt, a także poligony POI. W momencie publikacji Google Research udostępniło jedynie artykuł naukowy, bez publicznego kodu czy wag modelu.
Szersze konsekwencje dla zrozumienia przestrzeni miejskiej
Wprowadzenie ME-POIs przez Google Research stanowi znaczący krok w kierunku głębszego zrozumienia interakcji ludzi z przestrzenią miejską. Uzupełnienie tradycyjnych opisów tekstowych o dynamiczne dane dotyczące mobilności pozwala na tworzenie bardziej precyzyjnych i funkcjonalnych map cyfrowych. Zdolność do rozróżniania, jak miejsca są faktycznie wykorzystywane, otwiera nowe możliwości dla planowania urbanistycznego, personalizacji usług lokalizacyjnych oraz optymalizacji logistyki, oferując bogatszy kontekst niż same kategorie czy adresy. To podkreśla rosnące znaczenie integracji różnorodnych źródeł danych w rozwoju sztucznej inteligencji, zwłaszcza w kontekście modelowania złożonych zachowań społecznych i przestrzennych.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej

Roboty humanoidalne podbijają Chiny: Relacja z karnawału robotów w Szanghaju
W Szanghaju odbył się karnawał robotów, prezentujący rosnącą popularność maszyn humanoidalnych w Chinach. Wydarzenie to podkreśla strategię kraju, by włączyć sztuczną inteligencję w codzienne życie.
Redakcja Aigest4 godz. temu
Thomson Reuters buduje własne AI, bo wiedza to dziś najcenniejsza waluta
Inwestycja Thomson Reuters w autorski model AI "Thomson" to strategiczny ruch, który pokazuje, że w erze sztucznej inteligencji, dane i własność intelektualna stają się kluczowym aktywem, wartym 40 milionów dolarów.
Michał Chmielarz5 godz. temu

Fastino wprowadza GLiNER2.5: Nowa architektura ekstrakcji informacji oparta na przewidywaniu granic
Fastino zaprezentowało GLiNER2.5, nową architekturę do ekstrakcji informacji, która zastępuje enumerację zakresów przewidywaniem granic, znacząco poprawiając wydajność i elastyczność modeli.
Redakcja Aigest15 godz. temu

Instinct: Potężny asystent AI budzi obawy o prywatność i bezpieczeństwo
Nowy asystent AI Instinct, choć chwalony za swoje możliwości, wywołuje poważne obawy dotyczące prywatności danych i modelu bezpieczeństwa wśród pierwszych testerów.
Redakcja Aigest19 godz. temu

Jak Cheshire Academy uczy mądrego korzystania z AI w klasie
Szkoła Cheshire Academy w Connecticut wdraża innowacyjne metody nauczania, wykorzystując sztuczną inteligencję w procesie edukacyjnym. Uczy uczniów i nauczycieli, jak efektywnie i etycznie korzystać z narzędzi AI, stosuj
Redakcja Aigest23 godz. temu

Generalist AI prezentuje GEN-1.5: Model fundamentowy dla robotów uczący się zadań z jednej demonstracji
Generalist AI wprowadziło GEN-1.5, model fundamentowy dla robotów, który potrafi nauczyć się nowego zadania fizycznego na podstawie pojedynczej, krótkiej demonstracji.
Redakcja Aigest23 godz. temu
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.