pxpipe: Narzędzie open-source obniża koszty tokenów Claude Code i Fable 5 nawet o 70% poprzez ukrywanie tekstu w obrazac
Nowe narzędzie pxpipe konwertuje długie teksty na obrazy PNG, aby znacząco zredukować koszty tokenów w modelach AI, wykorzystując różnice w cennikach przetwarzania tekstu i grafik.

Narzędzie pxpipe, dostępne jako oprogramowanie open-source, umożliwia znaczące obniżenie kosztów tokenów dla modeli AI, takich jak Claude Code i Fable 5. Działa ono poprzez konwersję długich danych tekstowych na skompresowane obrazy PNG, wykorzystując różnice w sposobie naliczania opłat za przetwarzanie tekstu i grafik przez Anthropic.
Jak pxpipe oszczędza tokeny?
Kluczem do działania pxpipe jest specyfika cennika Anthropic. Tekst jest zazwyczaj wyceniany na około jeden token za znak, natomiast obrazy mają stałą cenę tokenów, zależną od ich wymiarów w pikselach, niezależnie od ilości zawartego w nich tekstu. Dzięki temu, gęsta treść, taka jak kod programistyczny czy dane w formacie JSON, może być skompresowana do około 3,1 znaku na każdy token obrazu.
pxpipe działa jako lokalne proxy, przechwytując żądania wysyłane do Claude Code. Następnie renderuje obszerne, statyczne elementy, takie jak monity systemowe, dokumentacja narzędzi oraz starsza historia czatów, jako obrazy. Najnowsze wiadomości i odpowiedzi modelu są przesyłane jako zwykły tekst. Przykład działania pokazuje, że około 48 000 znaków monitu systemowego i dokumentacji narzędziowej, które jako tekst kosztowałyby około 25 000 tokenów, po konwersji na obraz PNG kosztują zaledwie 2 700 tokenów.
Według dewelopera Stevena Chonga, średnie oszczędności wynoszą od 59 do 70 procent. W jednym z testów przeprowadzonych z modelem Fable 5, koszty sesji spadły z 42,21 USD do 6,06 USD. Chong zaznacza, że jeśli ta metoda zyska na popularności, firmy AI mogą zareagować podniesieniem cen za przetwarzanie obrazów.
Ograniczenia i kompatybilność
Metoda ta ma jednak swoje wady. Jest to proces stratny, co oznacza, że dokładne ciągi znaków, takie jak hasze, mogą zostać zniekształcone podczas odczytu z obrazów. Przetwarzanie jest również wolniejsze, ponieważ model musi przetwarzać renderowane obrazy za pomocą enkodera wizyjnego, zamiast bezpośrednio czytać tekst.
pxpipe domyślnie obsługuje modele Claude Fable 5 i GPT 5.6. Benchmarking i oceny są szczegółowo udokumentowane w repozytorium projektu. Fable 5 osiąga 100-procentową dokładność w testach problemów matematycznych z losowymi liczbami, których model nie mógł zapamiętać. Modele Opus 4.7 i 4.8 błędnie odczytują około 7 procent renderowanych obrazów, a GPT 5.5 również radzi sobie gorzej z kontekstem obrazu. Oba te modele są domyślnie wyłączone i mogą być aktywowane ręcznie.
Idea przesyłania tekstu do modeli AI w postaci skompresowanych obrazów nie jest nowa. Firma Deepseek opracowała system OCR, który przetwarza dokumenty tekstowe jako obrazy, osiągając kompresję do dziesięciokrotności przy zachowaniu 97 procent informacji, co zostało opisane w ich publikacji technicznej.
Rozwiązanie pxpipe stanowi innowacyjne podejście do optymalizacji kosztów w obliczu rosnącego zapotrzebowania na przetwarzanie dużych ilości danych przez modele AI. Pokazuje ono, jak kreatywne wykorzystanie istniejących mechanizmów cenowych może przynieść wymierne korzyści finansowe, jednocześnie podkreślając potrzebę dalszych badań nad efektywnością i dokładnością przetwarzania danych wizualnych w kontekście tekstowym.
Źródło: the-decoder.com
Komentarze
Zaloguj się, aby dołączyć do dyskusji.
Nikt jeszcze nie skomentował. Bądź pierwszy!
Czytaj dalej
Bezpieczeństwo AI to nie hamulec, lecz fundament dalszego rozwoju
Decyzja OpenAI o spowolnieniu rozwoju modeli AI, w tym Astry, z powodu zagrożeń cyberbezpieczeństwa, to sygnał, że branża dojrzewa. To nie jest krok wstecz, lecz niezbędny element budowania zaufania i stabilności.
Michał Chmielarz4 godz. temu

NVIDIA udostępnia TensorRT Model Connect w publicznej wersji zapoznawczej
NVIDIA wprowadziła TensorRT Model Connect (TRTMC), narzędzie open-source, które umożliwia konwersję modeli z Hugging Face do wnioskowania w C++ za pomocą zaledwie dwóch komend, eliminując pośrednie kroki.
Redakcja Aigest14 godz. temu

OpenAI spowalnia rozwój modeli AI z powodu rosnących zagrożeń cyberbezpieczeństwa
OpenAI ogłosiło spowolnienie rozwoju swoich modeli AI, w tym nadchodzącego modelu Astra, powołując się na rosnące ryzyko cyberbezpieczeństwa i potrzebę wzmocnienia zabezpieczeń.
Redakcja Aigest17 godz. temu

Artificial Analysis publikuje "Search Index" – ranking API wyszukiwania dla agentów AI
Firma Artificial Analysis wprowadziła nowy benchmark "Search Index", który ocenia dostawców API wyszukiwania pod kątem jakości, kosztów i szybkości działania dla agentów AI.
Redakcja Aigest18 godz. temu

Microsoft Copilot ujawnił lukę pozwalającą na kradzież danych
Badacze z firmy Varonis odkryli krytyczną lukę w zabezpieczeniach Microsoft 365 Copilot, która umożliwiała kradzież haseł i innych wrażliwych danych użytkowników poprzez kliknięcie w złośliwy link.
Redakcja Aigest23 godz. temu

Nowe badanie podważa narrację firm AI o sposobach użytkowania ich modeli
Niezależny projekt AI Observatory odkrywa, że firmy AI pomijają w swoich raportach znaczną część prywatnego i wrażliwego użytkowania modeli, koncentrując się na zastosowaniach biznesowych.
Redakcja Aigestwczoraj
Bądź na bieżąco ze światem AI
Najważniejsze newsy, recenzje i poradniki — raz w tygodniu, prosto na maila. Bez spamu.