Gemeten op 2026-08-13 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 22,05 tokens/s per gebruiker, met gemiddeld 1,2 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 20,28 seconden. Deze runs meten snelheid en wachttijd, niet de kwaliteit van de antwoorden.
—
Bruikbaarheidsscore (indicatief)
144
Throughput tok/s
21 GB
VRAM
11/11
Betrouwbare benches
Hugging Face →·vLLM v0.26.0·DGX Spark, NVIDIA GB10, 128 GB unified memory·Gemeten met context 128K·Laatst gemeten 13 augustus 2026
02Vendor quality · alleen ter referentie
Kennis: MMLU-Pro; redeneren: GPQA-Diamond; code: LiveCodeBench v6. De exacte test staat bij elk cijfer. Andere testnamen en ontbrekende metingen tellen niet mee in de totaalscore. Externe cijfers zijn geen eigen evaluatie van deze precisie. Bron: vendor model card ↗
3/3
Dekking
77,3
MMLU-Pro
72,2
GPQA-Diamond
63,2
LiveCodeBench v5
03Performance · NVFP4 vs BF16
Decode throughput · totaal t/s · c=10
■ NVFP4 · ■ BF16
1k ctx NVFP4206 t/s
1k ctx BF1672 t/s
8k ctx NVFP4151 t/s
8k ctx BF1668 t/s
4k+turn NVFP4196 t/s
4k+turn BF1674 t/s
25k ctx NVFP459 t/s
25k ctx BF1641 t/s
04Test suite · 11 benchmarks
6 closed-loop tests met llama-benchy en 5 open-loop tests met vllm bench serve. Alleen complete runs zonder mislukte sanity-check tellen mee; open-looptests vereisen minimaal 99% geslaagde verzoeken. Ruwe resultaten blijven zichtbaar. Klap “view command” uit voor het gereconstrueerde commando. Methodologie →
01 · llama-benchyclosed-loop
Chat
Korte prompt met een lang antwoord. Toont de uitvoersnelheid en de wachttijd voor het eerste token.
pp (prompt)
1024
tg (gen)
1024
depth
0
concurrency
1 · 5 · 10
repeats
3
Tokens/sec · per gebruiker
22,1t/s
TTFT · mean
1,2s
3 repeats · mean ± stddevview command →hide command ↑
Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 22,05 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 1,2 seconden.
Lange context
Wachttijd bij 25k context
Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 20,28 seconden. Daarna genereert het model gemiddeld 11,2 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.
Piekbelasting
Verzoeken en wachttijd bij piekbelasting
De run verwerkt 0,52 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 2,12 seconden.
Meetdekking
Welke metingen meetellen
11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. De sanity-check is geslaagd. Dit is een controle op een kort gegenereerd antwoord, geen inhoudelijke evaluatie van de benchmarktaken.