o200k_base · 27 języków

Tokenowy Mundial AI

Ten sam neutralny zestaw faktów zapisany naturalnie w każdym języku, bez dosłownego tłumaczenia zdanie po zdaniu. Im mniej tokenów, tym mniej miejsca w kontekście i niższy koszt inputu. Polski: +29% względem angielskiego. 🇵🇱💸

🥈
English
95
tokeny: 95 · indeks: 100
🥇
Chinese
89
−6% vs EN
🥉
Dutch
99
+4% vs EN
Łacina · #16118+24%
Polski · #19123+29%
Praktyczna konkluzja
Ave GPT, refactorium meum perfice.
Łacina nadal bardziej tokeno-oszczędna od polskiego. Imperium zatwierdza.

Ranking

Kliknij język, żeby zobaczyć dokładnie tę naturalną wersję, z której policzono wynik.
Tekst referencyjny

Pełna tabela

Wartości zaokrąglone do pełnych punktów procentowych.
# Język Tokeny vs EN Indeks EN=100

Mapa rozjazdu tokenizerów

Ten sam korpus. Oś X to o200k_base, a oś Y pokazuje aktywnego rywala. Im dalej od przekątnej, tym większy rozjazd.

Jak to czytać

Jeden sens

Każda wersja przekazuje ten sam neutralny zestaw faktów o kulkach, liczbach, porównaniu i równym podziale.

Naturalny język

To nie tłumaczenie zdanie po zdaniu. Każdy wariant jest zapisany tak, jak naturalnie można przekazać te informacje w danym języku; cyfry pozostają identyczne.

Tokenizer

Główne porównanie to GPT-5 i Claude Opus 5; dodatkowo można podejrzeć r50k_base, cl100k_base i o200k_harmony. Ranking, podium, tabela i narzut względem EN zmieniają się razem.

GPT-5 i dodatkowe kodowania GPT przelicza lokalnie gpt-tokenizer; recount-openai-tokens.mjs odświeża wartości, a CI pilnuje zgodności. o200k_harmony współdzieli z o200k_base BPE zwykłego tekstu, więc w tym korpusie remisuje 1:1; różni się tokenami specjalnymi. Pomiar Claude w claude-token-counts.json pochodzi z natywnego licznika wejścia przez OpenRouter /v1/messages; stały framing 6 tokenów jest odejmowany.