Gemeten op 2026-08-09 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 42,31 tokens/s per gebruiker, met gemiddeld 0,86 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 15,14 seconden. Deze runs meten snelheid en wachttijd, niet de kwaliteit van de antwoorden.
—
Bruikbaarheidsscore (indicatief)
—
Throughput tok/s
8 GB
VRAM
0/11
Betrouwbare benches
Hugging Face →·vLLM v0.26.0·DGX Spark, NVIDIA GB10, 128 GB unified memory·Gemeten met context 128K·Laatst gemeten 9 augustus 2026
02Vendor quality · alleen ter referentie
Kennis: MMLU-Pro; redeneren: GPQA-Diamond; code: LiveCodeBench v6. De exacte test staat bij elk cijfer. Andere testnamen en ontbrekende metingen tellen niet mee in de totaalscore. Externe cijfers zijn geen eigen evaluatie van deze precisie. Bron: vendor model card ↗
3/3
Dekking
70,7
MMLU
53,4
GPQA-Diamond
54,8
LiveCodeBench
03Performance · BF16
Decode throughput · totaal t/s · c=10
■ BF16
1k ctx BF16—
8k ctx BF16—
4k+turn BF16—
25k ctx BF16—
04Test suite · 11 benchmarks
6 closed-loop tests met llama-benchy en 5 open-loop tests met vllm bench serve. Alleen complete runs zonder mislukte sanity-check tellen mee; open-looptests vereisen minimaal 99% geslaagde verzoeken. Ruwe resultaten blijven zichtbaar. Klap “view command” uit voor het gereconstrueerde commando. Methodologie →
01 · llama-benchyclosed-loop
Chat
Korte prompt met een lang antwoord. Toont de uitvoersnelheid en de wachttijd voor het eerste token.
pp (prompt)
1024
tg (gen)
1024
depth
0
concurrency
1 · 5 · 10
repeats
3
Tokens/sec · per gebruiker
42,3t/s
TTFT · mean
864ms
Sanity-check mislukt
3 repeats · mean ± stddevview command →hide command ↑
De chatmeting is uitgesloten omdat de sanity-check is mislukt. De aanwezige tokens/s bewijzen daardoor geen bruikbare modeluitvoer.
Lange context
Wachttijd bij 25k context
Ook de test met 25k inputtokens is uitgesloten. De ruwe resultaten staan bij de test, maar vormen geen geldige basis voor een prestatieadvies.
Piekbelasting
Verzoeken en wachttijd bij piekbelasting
De piekmeting is uitgesloten door de mislukte sanity-check. Een geslaagde HTTP-aanvraag is niet hetzelfde als een bruikbaar antwoord.
Meetdekking
Welke metingen meetellen
0 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. De sanity-check is mislukt. Deze run wordt daarom uitgesloten van de rangschikking; de ruwe cijfers blijven alleen ter inspectie zichtbaar. Afgebroken: 11-rate-sweep.