Aigest.
Newsy

pxpipe: Narzędzie open-source obniża koszty tokenów Claude Code i Fable 5 nawet o 70% poprzez ukrywanie tekstu w obrazac

Nowe narzędzie pxpipe konwertuje długie teksty na obrazy PNG, aby znacząco zredukować koszty tokenów w modelach AI, wykorzystując różnice w cennikach przetwarzania tekstu i grafik.

RA

Udostępnij
pxpipe: Narzędzie open-source obniża koszty tokenów Claude Code i Fable 5 nawet o 70% poprzez ukrywanie tekstu w obrazac
Fot. The Decoder

Narzędzie pxpipe, dostępne jako oprogramowanie open-source, umożliwia znaczące obniżenie kosztów tokenów dla modeli AI, takich jak Claude Code i Fable 5. Działa ono poprzez konwersję długich danych tekstowych na skompresowane obrazy PNG, wykorzystując różnice w sposobie naliczania opłat za przetwarzanie tekstu i grafik przez Anthropic.

Jak pxpipe oszczędza tokeny?

Kluczem do działania pxpipe jest specyfika cennika Anthropic. Tekst jest zazwyczaj wyceniany na około jeden token za znak, natomiast obrazy mają stałą cenę tokenów, zależną od ich wymiarów w pikselach, niezależnie od ilości zawartego w nich tekstu. Dzięki temu, gęsta treść, taka jak kod programistyczny czy dane w formacie JSON, może być skompresowana do około 3,1 znaku na każdy token obrazu.

pxpipe działa jako lokalne proxy, przechwytując żądania wysyłane do Claude Code. Następnie renderuje obszerne, statyczne elementy, takie jak monity systemowe, dokumentacja narzędzi oraz starsza historia czatów, jako obrazy. Najnowsze wiadomości i odpowiedzi modelu są przesyłane jako zwykły tekst. Przykład działania pokazuje, że około 48 000 znaków monitu systemowego i dokumentacji narzędziowej, które jako tekst kosztowałyby około 25 000 tokenów, po konwersji na obraz PNG kosztują zaledwie 2 700 tokenów.

Według dewelopera Stevena Chonga, średnie oszczędności wynoszą od 59 do 70 procent. W jednym z testów przeprowadzonych z modelem Fable 5, koszty sesji spadły z 42,21 USD do 6,06 USD. Chong zaznacza, że jeśli ta metoda zyska na popularności, firmy AI mogą zareagować podniesieniem cen za przetwarzanie obrazów.

Ograniczenia i kompatybilność

Metoda ta ma jednak swoje wady. Jest to proces stratny, co oznacza, że dokładne ciągi znaków, takie jak hasze, mogą zostać zniekształcone podczas odczytu z obrazów. Przetwarzanie jest również wolniejsze, ponieważ model musi przetwarzać renderowane obrazy za pomocą enkodera wizyjnego, zamiast bezpośrednio czytać tekst.

pxpipe domyślnie obsługuje modele Claude Fable 5 i GPT 5.6. Benchmarking i oceny są szczegółowo udokumentowane w repozytorium projektu. Fable 5 osiąga 100-procentową dokładność w testach problemów matematycznych z losowymi liczbami, których model nie mógł zapamiętać. Modele Opus 4.7 i 4.8 błędnie odczytują około 7 procent renderowanych obrazów, a GPT 5.5 również radzi sobie gorzej z kontekstem obrazu. Oba te modele są domyślnie wyłączone i mogą być aktywowane ręcznie.

Idea przesyłania tekstu do modeli AI w postaci skompresowanych obrazów nie jest nowa. Firma Deepseek opracowała system OCR, który przetwarza dokumenty tekstowe jako obrazy, osiągając kompresję do dziesięciokrotności przy zachowaniu 97 procent informacji, co zostało opisane w ich publikacji technicznej.

Rozwiązanie pxpipe stanowi innowacyjne podejście do optymalizacji kosztów w obliczu rosnącego zapotrzebowania na przetwarzanie dużych ilości danych przez modele AI. Pokazuje ono, jak kreatywne wykorzystanie istniejących mechanizmów cenowych może przynieść wymierne korzyści finansowe, jednocześnie podkreślając potrzebę dalszych badań nad efektywnością i dokładnością przetwarzania danych wizualnych w kontekście tekstowym.

Źródło: the-decoder.com

Udostępnij

Komentarze

Zaloguj się, aby dołączyć do dyskusji.

Nikt jeszcze nie skomentował. Bądź pierwszy!

Czytaj dalej

Bezpieczeństwo AI to nie hamulec, lecz fundament dalszego rozwoju
NVIDIA udostępnia TensorRT Model Connect w publicznej wersji zapoznawczej
Newsy

NVIDIA udostępnia TensorRT Model Connect w publicznej wersji zapoznawczej

NVIDIA wprowadziła TensorRT Model Connect (TRTMC), narzędzie open-source, które umożliwia konwersję modeli z Hugging Face do wnioskowania w C++ za pomocą zaledwie dwóch komend, eliminując pośrednie kroki.

Redakcja Aigest14 godz. temu

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa
Newsy

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa

OpenAI ogłosiło spowolnienie rozwoju swoich modeli AI, w tym nadchodzącego modelu Astra, powołując się na rosnące ryzyko cyberbezpieczeństwa i potrzebę wzmocnienia zabezpieczeń.

Redakcja Aigest17 godz. temu

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI
Newsy

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI

Firma Artificial Analysis wprowadziła nowy benchmark "Search Index", który ocenia dostawców API wyszukiwania pod kątem jakości, kosztów i szybkości działania dla agentów AI.

Redakcja Aigest18 godz. temu

Microsoft Copilot ujawnił lukę pozwalającą na kradzież danych
Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli

Bądź na bieżąco ze światem AI

Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.