Aigest.
Newsy

NVIDIA udostępnia TensorRT Model Connect w publicznej wersji zapoznawczej

NVIDIA wprowadziła TensorRT Model Connect (TRTMC), narzędzie open-source, które umożliwia konwersję modeli z Hugging Face do wnioskowania w C++ za pomocą zaledwie dwóch komend, eliminując pośrednie kroki.

RA

Udostępnij
NVIDIA udostępnia TensorRT Model Connect w publicznej wersji zapoznawczej
Fot. MarkTechPost

NVIDIA udostępniła TensorRT Model Connect (TRTMC) w publicznej wersji zapoznawczej. Jest to projekt typu open-source, który pozwala na przekształcenie obsługiwanego punktu kontrolnego z Hugging Face lub lokalnego do wnioskowania w TensorRT w zaledwie dwóch komendach. Co istotne, narzędzie to eliminuje pośredni krok eksportu do formatu ONNX.

Wynikiem procesu budowania jest wersjonowany artefakt w postaci pliku .bundle, który może być uruchamiany za pośrednictwem natywnych interfejsów API zadań w C++. Dzięki temu wnioskowanie może odbywać się w usługach C++, aplikacjach wbudowanych lub stosach robotycznych, bez konieczności posiadania PyTorcha w ścieżce wykonawczej. Projekt jest licencjonowany na zasadach Apache-2.0 i dostarczany jako zbiór referencyjnych implementacji, a nie jako pojedynczy, generyczny konwerter. NVIDIA podkreśla, że cały projekt – w tym implementacje modeli, optymalizacja wydajności, testy, integracje i dokumentacja – został stworzony przy użyciu agentów OpenAI Codex pod nadzorem i z recenzją ludzi.

Dostępność i wymagania techniczne

Narzędzie TRTMC jest dostępne do oceny i natywnej integracji w rzeczywistych warunkach. Kod jest otwarty i możliwy do zainstalowania. Obecne pakiety instalacyjne (wheels) są przeznaczone wyłącznie dla Linuksa aarch64, wymagają Pythona 3.10 lub 3.12, biblioteki glibc 2.39 lub nowszej oraz TensorRT w wersji 11.1.0.106. Pakiety dla architektury x86_64 nie są publikowane; użytkownicy tej architektury muszą skorzystać ze ścieżki budowania ze źródła za pomocą Docker'a.

Przykładowe szybkie uruchomienie demonstruje budowanie i uruchamianie modelu Qwen3-0.6B za pomocą następujących komend:

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking

Ten sam plik .bundle można załadować z poziomu C++ za pomocą trtmc::load("./qwen3-0.6b.bundle").

Architektura i korzyści TRTMC

TRTMC rozdziela proces budowania i uruchamiania na wersjonowany artefakt. Python odpowiada za rozwiązywanie punktów kontrolnych i konstrukcję silnika TensorRT. Następnie natywne profile wykonują wnioskowanie w C++ bez PyTorcha. Niewielka liczba profili hybrydowych może wywoływać pomocniczy plik wykonywalny Pythona, a ich manifesty jawnie deklarują tę zależność.

Aplikacje wywołują interfejsy API zadań, takie jak generate(), transcribe(), generate_image(), embed() czy solve(), zamiast utrzymywać etapy konwersji i specyficzne dla każdego modelu połączenia. Funkcja trtmc inspect ujawnia typ pakietu, rodzinę modelu, precyzję, tożsamość środowiska wykonawczego i silniki, co sprawia, że artefakt jest audytowalny, a nie nieprzejrzysty.

NVIDIA przedstawia konwencjonalną ścieżkę jako PyTorch → ONNX lub TorchScript → TensorRT → integracja C++ specyficzna dla modelu, wskazując jednocześnie na problemy, które TRTMC eliminuje. Należą do nich luki w eksporcie, powtarzająca się integracja dla każdego modelu oraz walidacja rozłożona na kilka artefaktów konwersji.

Znaczenie dla ekosystemu AI

Udostępnienie TensorRT Model Connect przez NVIDIĘ stanowi istotny krok w kierunku uproszczenia i optymalizacji procesów wdrażania modeli AI. Eliminacja pośrednich kroków konwersji oraz możliwość natywnego wnioskowania w C++ bez zależności od PyTorcha w środowisku wykonawczym może znacząco przyspieszyć rozwój i skalowanie aplikacji opartych na sztucznej inteligencji, szczególnie w obszarach wymagających wysokiej wydajności i niskiego zużycia zasobów, takich jak robotyka czy systemy wbudowane. To posunięcie podkreśla dążenie NVIDII do stworzenia bardziej zintegrowanego i efektywnego ekosystemu dla deweloperów AI, umożliwiając im skupienie się na innowacjach, a nie na złożonościach technicznych.

Źródło: marktechpost.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Bezpieczeństwo AI to nie hamulec, lecz fundament dalszego rozwoju
OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa
Newsy

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa

OpenAI ogłosiło spowolnienie rozwoju swoich modeli AI, w tym nadchodzącego modelu Astra, powołując się na rosnące ryzyko cyberbezpieczeństwa i potrzebę wzmocnienia zabezpieczeń.

Redakcja Aigest14 godz. temu

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI
Newsy

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI

Firma Artificial Analysis wprowadziła nowy benchmark "Search Index", który ocenia dostawców API wyszukiwania pod kątem jakości, kosztów i szybkości działania dla agentów AI.

Redakcja Aigest15 godz. temu

Microsoft Copilot ujawnił lukę pozwalającą na kradzież danych
Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli
Samodoskonalenie AI: Badanie podważa szybkie prognozy postępu
Newsy

Samodoskonalenie AI: Badanie podważa szybkie prognozy postępu

Nowe badanie sugeruje, że agentom AI brakuje kreatywności i oceny, by prowadzić innowacyjne badania naukowe, co może opóźnić ich samodoskonalenie.

Redakcja Aigestwczoraj

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.