Aigest.
Narzędzia AI

Kimi AI i kvcache-ai udostępniają AgentENV – platformę do rozproszonego uczenia agentowego RL

Moonshot AI i kvcache-ai udostępniły AgentENV, rozproszoną platformę do skalowalnego uruchamiania środowisk agentowych, kluczową dla trenowania modelu Kimi K3.

RA

Udostępnij
Kimi AI i kvcache-ai udostępniają AgentENV – platformę do rozproszonego uczenia agentowego RL
Fot. MarkTechPost

Zespoły Kimi AI (Moonshot AI) oraz kvcache-ai udostępniły AgentENV (AENV), rozproszoną platformę zaprojektowaną do skalowalnego uruchamiania środowisk agentowych. System ten stanowi fundament dla trenowania agentowego uczenia ze wzmocnieniem (RL) dla modelu Kimi K3 – 2,8-bilionowego modelu Mixture-of-Experts firmy Moonshot. Kod źródłowy projektu został opublikowany na licencji MIT.

Wyzwania agentowego uczenia ze wzmocnieniem

Agentowe uczenie ze wzmocnieniem (RL) wykracza poza samo próbkowanie tekstu, wymagając od modelu działania w realistycznym środowisku komputerowym. Każda symulacja wymaga izolowanego środowiska Linux z własnym systemem plików, stosem sieciowym i aktywnymi procesami. To stwarza dylemat: kontenery uruchamiają się szybko, ale współdzielą jądro hosta, co osłabia izolację kodu generowanego przez model. Z kolei pełne maszyny wirtualne zapewniają odpowiednią izolację, lecz uruchamiają się wolno i zajmują pamięć w stanie bezczynności.

AgentENV rozwiązuje ten problem, wykorzystując mikrowirtualne maszyny Firecracker. Dzięki temu system umożliwia szybkie uruchamianie, wznawianie i rozgałęzianie środowisk, co jest kluczowe dla skalowalnego trenowania.

Architektura i kluczowe funkcje AgentENV

Każda piaskownica w AgentENV to mikrowirtualna maszyna Firecracker z własnym jądrem Linux, systemem plików i przestrzenią nazw sieciowych. Żądania są obsługiwane przez API HTTP Axum, które przekazuje je do orkiestratora zarządzającego cyklem życia piaskownicy.

Interesującym aspektem jest zarządzanie pamięcią masową. Główny system plików (rootfs) jest udostępniany poprzez blokowe urządzenie użytkownika ublk, wspierane przez warstwowe obrazy overlaybd. Warstwy bazowe tylko do odczytu są współdzielone między piaskownicami, a każda piaskownica zapisuje dane do własnej warstwy górnej. Wewnątrz każdej maszyny wirtualnej działa demon envd, który odpowiada za wykonywanie poleceń, operacje na plikach i raportowanie stanu zdrowia na porcie 49983. Odwrotny serwer proxy kieruje ruch HTTP i WebSocket od klientów do usług działających wewnątrz maszyny wirtualnej.

Projekt oferuje również mechanizmy zwiększające gęstość zasobów:

  • Współdzielona pamięć podręczna hosta: Używana zarówno dla pamięci masowej, jak i danych migawek pamięci.
  • Balonowanie pamięci: Zwraca hostowi odzyskiwalną pamięć gościa, co pozwala na utrzymanie nadmiernego przydziału zasobów w miarę rozbieżności środowisk.

Cztery kluczowe cechy wyróżniają AgentENV:

  1. Szybkie uruchamianie i wznawianie: Środowiska oparte na migawkach uruchamiają się lub wznawiają w czasie poniżej 50 ms, a pauzują w czasie poniżej 100 ms.
  2. Przyrostowe migawki: Przechwytywanie przyrostowych migawek trwa poniżej 100 ms, nawet przy intensywnych modyfikacjach dysku.
  3. Funkcja Fork: Umożliwia klonowanie działającej piaskownicy do 16 niezależnych piaskownic potomnych na tym samym węźle. Proces źródłowy jest krótko pauzowany podczas przechwytywania, a następnie wznawiany. Każde środowisko potomne dziedziczy system plików, pamięć i konfigurację zasobów ze źródła. Dzięki temu kosztowne konfiguracje są wykonywane tylko raz, a następnie rozgałęziane do równoległych symulacji. Migawki są przechowywane w pamięci obiektowej zgodnej z S3 lub w rozproszonym systemie plików.
  4. TTL dla piaskownic: Każda piaskownica ma określony czas życia (TTL), po którym następuje pauza, a nie usunięcie. Usunięcie wymaga jawnego ustawienia autoPause: false w API tworzenia.

Obrazy są ładowane na żądanie za pośrednictwem overlaybd. Lokalny dysk działa jako ograniczona pamięć podręczna, która przechowuje często używane dane i usuwa te rzadziej używane. Pozwala to na przekroczenie lokalnej pojemności dysku przez zestaw dostępnych obrazów, jednocześnie utrzymując szybkie uruchamianie w całym klastrze.

Stan migawki jest zorganizowany w trzech warstwach: obszar roboczy builder staging (przechowuje artefakty podczas budowania), committed snapshot repository (trwałe źródło prawdy) oraz node-local runtime cache (przechowuje konfiguracje pochodne w czasie uruchamiania).

Obsługiwane są dwa backendy repozytoriów: posix_fs (domyślny) i oss. Ścieżka oss działa przez wspólnego klienta zgodnego z S3, co wymaga podania jawnego regionu. Opcjonalny transport peer-to-peer oparty na iroh może ogłaszać zatwierdzone artefakty węzłom partnerskim, choć jest domyślnie wyłączony. Dokumentacja zaleca łącze o przepustowości co najmniej 1 Gbps, a najlepiej 10 Gbps lub szybsze dla współdzielonej pamięci masowej.

Integracja i wymagania systemowe

AgentENV udostępnia API HTTP zgodne z E2B. Dzięki temu zespoły korzystające już z agentów E2B mogą hostować środowisko wykonawcze bez przepisywania kodu. Dostępne jest również natywne narzędzie aenv CLI, zalecane do specyficznych zadań AgentENV.

Projekt wymaga jądra Linux w wersji 6.8+ oraz dostępu do /dev/kvm. Skrypt instalacyjny dodatkowo wymaga Ubuntu 24.04. Narzędzie aenv CLI obsługuje systemy Linux i macOS na architekturach x86_64 i arm64. Sam serwer jest wyłącznie dla systemu Linux, ze względu na zależność od KVM. Wdrożenia wielowęzłowe wymagają bramy na porcie 8080 i harmonogramu na porcie 9090.

Znaczenie dla rozwoju AI

Udostępnienie AgentENV przez Moonshot AI i kvcache-ai stanowi istotny krok w rozwoju agentowego uczenia ze wzmocnieniem. Rozwiązanie to adresuje kluczowe wyzwania związane z izolacją i skalowalnością środowisk treningowych, co jest niezbędne dla efektywnego rozwoju zaawansowanych modeli AI, takich jak Kimi K3. Możliwość szybkiego klonowania i zarządzania środowiskami treningowymi otwiera nowe perspektywy dla badań i komercyjnych zastosowań agentów AI, umożliwiając bardziej złożone i realistyczne scenariusze uczenia.

Źródło: marktechpost.com

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Kimi K3 Moonshot AI daleko za czołowymi modelami USA w cyberbezpieczeństwie, destylacja może być przyczyną
Chiński model Kimi AI wywołuje debatę i niepokój na Wall Street
Ewolucja otwartych modeli ASR w 2026 roku: Poza WER – liczy się licencja i wydajność
Alibaba prezentuje Qwen 3.8: nowy model AI z 2,4 biliona parametrów, konkurencja dla Kimi K3
Niemieckie konsorcjum AI prezentuje Soofi S: otwarty model 30B dominujący w benchmarkach angielskich i niemieckich
Chiński MiniMax planuje udostępnić model AI z 2,7 biliona parametrów jako open source

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.