---
title: "Gemma-4-26B-A4B-it (NVFP4) · DGX Spark Arena"
canonical: "https://djangodevreng.nl/arena/gemma-4-26b-a4b-it-nvfp4/"
license: "CC-BY-4.0"
source: "https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/nvfp4/"
source_revision: "a948cec23b054c62fef595bad3cdb284066922ac"
contract_version: 1
suite_version: "2026-08"
minimum_request_success_rate: 0.99
sanity_status: "passed"
attribution: "Django de Vreng, https://djangodevreng.nl"
---

# Gemma-4-26B-A4B-it (NVFP4)

Gemeten op 2026-08-16 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 21,18 tokens/s per gebruiker, met gemiddeld 1,35 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 39,43 seconden. Deze runs meten snelheid en wachttijd, niet de kwaliteit van de antwoorden.

## Specificaties

- Vendor: Google
- Architectuur: MoE
- Parameters: 26B-A4B
- Precisie: NVFP4
- Context: 256K
- Gemeten op: 128K
- VRAM: 24 GB
- Engine: vLLM v0.26.0
- Hardware: DGX Spark, NVIDIA GB10, 128 GB unified memory
- Model card: https://huggingface.co/google/gemma-4-26B-A4B-it

## Quality (model-cards)

Alleen ter referentie. De harnesses en dekking verschillen per model; deze cijfers tellen niet mee in de hardware-score.

Bron: https://huggingface.co/google/gemma-4-26B-A4B-it

| Benchmark | Score |
| --- | --- |
| MMLU-Pro | 82.6 |
| GPQA-Diamond | 82.3 |
| LiveCodeBench v6 | 77.1 |

## Benchmarks op de DGX Spark

Alleen complete runs zonder mislukte sanity-check tellen mee. Open-looptests vereisen minimaal 99% request success. Ruwe resultaten blijven zichtbaar.

| Test | tokens/s p/user | tokens/s totaal | TTFT (ms) | Request success | Ranking |
| --- | --- | --- | --- | --- | --- |
| 01 Chat | 21 | 135 | 1347 | n/a | telt mee |
| 02 RAG · 8k context | 16 | 122 | 8118 | n/a | telt mee |
| 03 Lange output en agents | 23 | 169 | 353 | n/a | telt mee |
| 04 Multi-turn kantoorwerk | 20 | 175 | 2077 | n/a | telt mee |
| 05 Grote context · 25k | 7 | 33 | 39434 | n/a | telt mee |
| 06 Gelijktijdigheid onder druk | 4 | 33 | 74374 | n/a | telt mee |
| 07 Realistische kantoor-baseline | 82 | 1305.66 | 1096 | 100% | telt mee |
| 08 Echte gesprekken · ShareGPT | 13 | 133.35 | 148 | 100% | telt mee |
| 09 Reasoning-workload | 9 | 391.77 | 343 | 100% | telt mee |
| 10 Maandagochtendpiek | 69 | 1926.44 | 969 | 100% | telt mee |
| 11 Capaciteit · rate sweep | n/a | n/a | n/a | 100% | telt mee |

## Toelichting op deze run

**Chat: Chat bij tien gelijktijdige verzoeken**

Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 21,18 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 1,35 seconden.

**Lange context: Wachttijd bij 25k context**

Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 39,43 seconden. Daarna genereert het model gemiddeld 7,28 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.

**Piekbelasting: Verzoeken en wachttijd bij piekbelasting**

De run verwerkt 0,43 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 2,48 seconden.

**Meetdekking: Welke metingen meetellen**

11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. De sanity-check is geslaagd. Dit is een controle op een kort gegenereerd antwoord, geen inhoudelijke evaluatie van de benchmarktaken.

## Noten

Model-ID: nvidia/Gemma-4-26B-A4B-NVFP4. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-16T15:38:08+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --quantization modelopt --moe-backend marlin --max-num-batched-tokens 8192 --linear-backend marlin. Profielvariabelen: VLLM_USE_FLASHINFER_MOE_FP4=0. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. De sanity-check is geslaagd. Dit is een controle op een kort gegenereerd antwoord, geen inhoudelijke evaluatie van de benchmarktaken.

---

Licentie: CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/). Django de Vreng, https://djangodevreng.nl.
Volledige arena: https://djangodevreng.nl/arena/ · Ruwe runs (GitHub): https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/nvfp4/
