NVIDIA udostępnia TensorRT Model Connect w publicznej wersji zapoznawczej
NVIDIA wprowadziła TensorRT Model Connect (TRTMC), narzędzie open-source, które umożliwia konwersję modeli z Hugging Face do wnioskowania w C++ za pomocą zaledwie dwóch komend, eliminując pośrednie kroki.

NVIDIA udostępniła TensorRT Model Connect (TRTMC) w publicznej wersji zapoznawczej. Jest to projekt typu open-source, który pozwala na przekształcenie obsługiwanego punktu kontrolnego z Hugging Face lub lokalnego do wnioskowania w TensorRT w zaledwie dwóch komendach. Co istotne, narzędzie to eliminuje pośredni krok eksportu do formatu ONNX.
Wynikiem procesu budowania jest wersjonowany artefakt w postaci pliku .bundle, który może być uruchamiany za pośrednictwem natywnych interfejsów API zadań w C++. Dzięki temu wnioskowanie może odbywać się w usługach C++, aplikacjach wbudowanych lub stosach robotycznych, bez konieczności posiadania PyTorcha w ścieżce wykonawczej. Projekt jest licencjonowany na zasadach Apache-2.0 i dostarczany jako zbiór referencyjnych implementacji, a nie jako pojedynczy, generyczny konwerter. NVIDIA podkreśla, że cały projekt – w tym implementacje modeli, optymalizacja wydajności, testy, integracje i dokumentacja – został stworzony przy użyciu agentów OpenAI Codex pod nadzorem i z recenzją ludzi.
Dostępność i wymagania techniczne
Narzędzie TRTMC jest dostępne do oceny i natywnej integracji w rzeczywistych warunkach. Kod jest otwarty i możliwy do zainstalowania. Obecne pakiety instalacyjne (wheels) są przeznaczone wyłącznie dla Linuksa aarch64, wymagają Pythona 3.10 lub 3.12, biblioteki glibc 2.39 lub nowszej oraz TensorRT w wersji 11.1.0.106. Pakiety dla architektury x86_64 nie są publikowane; użytkownicy tej architektury muszą skorzystać ze ścieżki budowania ze źródła za pomocą Docker'a.
Przykładowe szybkie uruchomienie demonstruje budowanie i uruchamianie modelu Qwen3-0.6B za pomocą następujących komend:
trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking
Ten sam plik .bundle można załadować z poziomu C++ za pomocą trtmc::load("./qwen3-0.6b.bundle").
Architektura i korzyści TRTMC
TRTMC rozdziela proces budowania i uruchamiania na wersjonowany artefakt. Python odpowiada za rozwiązywanie punktów kontrolnych i konstrukcję silnika TensorRT. Następnie natywne profile wykonują wnioskowanie w C++ bez PyTorcha. Niewielka liczba profili hybrydowych może wywoływać pomocniczy plik wykonywalny Pythona, a ich manifesty jawnie deklarują tę zależność.
Aplikacje wywołują interfejsy API zadań, takie jak generate(), transcribe(), generate_image(), embed() czy solve(), zamiast utrzymywać etapy konwersji i specyficzne dla każdego modelu połączenia. Funkcja trtmc inspect ujawnia typ pakietu, rodzinę modelu, precyzję, tożsamość środowiska wykonawczego i silniki, co sprawia, że artefakt jest audytowalny, a nie nieprzejrzysty.
NVIDIA przedstawia konwencjonalną ścieżkę jako PyTorch → ONNX lub TorchScript → TensorRT → integracja C++ specyficzna dla modelu, wskazując jednocześnie na problemy, które TRTMC eliminuje. Należą do nich luki w eksporcie, powtarzająca się integracja dla każdego modelu oraz walidacja rozłożona na kilka artefaktów konwersji.
Znaczenie dla ekosystemu AI
Udostępnienie TensorRT Model Connect przez NVIDIĘ stanowi istotny krok w kierunku uproszczenia i optymalizacji procesów wdrażania modeli AI. Eliminacja pośrednich kroków konwersji oraz możliwość natywnego wnioskowania w C++ bez zależności od PyTorcha w środowisku wykonawczym może znacząco przyspieszyć rozwój i skalowanie aplikacji opartych na sztucznej inteligencji, szczególnie w obszarach wymagających wysokiej wydajności i niskiego zużycia zasobów, takich jak robotyka czy systemy wbudowane. To posunięcie podkreśla dążenie NVIDII do stworzenia bardziej zintegrowanego i efektywnego ekosystemu dla deweloperów AI, umożliwiając im skupienie się na innowacjach, a nie na złożonościach technicznych.
Źródło: marktechpost.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Bezpieczeństwo AI to nie hamulec, lecz fundament dalszego rozwoju
Decyzja OpenAI o spowolnieniu rozwoju modeli AI, w tym Astry, z powodu zagrożeń cyberbezpieczeństwa, to sygnał, że branża dojrzewa. To nie jest krok wstecz, lecz niezbędny element budowania zaufania i stabilności.
Michał Chmielarz1 godz. temu

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa
OpenAI ogłosiło spowolnienie rozwoju swoich modeli AI, w tym nadchodzącego modelu Astra, powołując się na rosnące ryzyko cyberbezpieczeństwa i potrzebę wzmocnienia zabezpieczeń.
Redakcja Aigest14 godz. temu

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI
Firma Artificial Analysis wprowadziła nowy benchmark "Search Index", który ocenia dostawców API wyszukiwania pod kątem jakości, kosztów i szybkości działania dla agentów AI.
Redakcja Aigest15 godz. temu

Microsoft Copilot ujawnił lukę pozwalającą na kradzież danych
Badacze z firmy Varonis odkryli krytyczną lukę w zabezpieczeniach Microsoft 365 Copilot, która umożliwiała kradzież haseł i innych wrażliwych danych użytkowników poprzez kliknięcie w złośliwy link.
Redakcja Aigest20 godz. temu

Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli
Niezależny projekt AI Observatory odkrywa, że firmy AI pomijają w swoich raportach znaczną część prywatnego i wrażliwego użytkowania modeli, koncentrując się na zastosowaniach biznesowych.
Redakcja Aigest23 godz. temu

Samodoskonalenie AI: Badanie podważa szybkie prognozy postępu
Nowe badanie sugeruje, że agentom AI brakuje kreatywności i oceny, by prowadzić innowacyjne badania naukowe, co może opóźnić ich samodoskonalenie.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.