{"name":"Gemma-4-31B-it","arena":{"id":"gemma-4-31b-it-nvfp4","name":"Gemma-4 31B","vram":22,"params":31,"vendor":"google","quality":{"coding":{"bench":"LiveCodeBench v6","value":80},"science":{"bench":"GPQA-Diamond","value":84.3},"knowledge":{"bench":"MMLU-Pro","value":85.2}},"contextK":256,"baseModelId":"gemma-4-31b-it"},"notes":"Model-ID: nvidia/Gemma-4-31B-IT-NVFP4. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-16T18:20:47+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --quantization modelopt --max-num-batched-tokens 8192 --moe-backend marlin --linear-backend marlin. Profielvariabelen: VLLM_USE_FLASHINFER_MOE_FP4=0. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. De sanity-check is geslaagd. Dit is een controle op een kort gegenereerd antwoord, geen inhoudelijke evaluatie van de benchmarktaken.","order":60,"engine":"vLLM v0.26.0","verdict":"Gemeten op 2026-08-16 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 6,03 tokens/s per gebruiker, met gemiddeld 8,4 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 224,21 seconden. Deze runs meten snelheid en wachttijd, niet de kwaliteit van de antwoorden.","hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/google/gemma-4-31B-it","provider":"Google","precision":"NVFP4","parameters":"31B","provenance":{"modelId":"nvidia/Gemma-4-31B-IT-NVFP4","runPath":"results/gemma-4/gemma-4-31b-it/nvfp4","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"passed"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","servedName":"gemma-4-31b-nvfp4","generatedAt":"2026-08-16T18:20:47+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"Dense","measuredContextK":128,"benchmarkResults":[{"id":"gemma-4-31b-it-nvfp4-chat-1k","date":"2026-08-16","runs":3,"metrics":{"ttfrSec":{"mean":8.404,"stddev":2.255},"decodeTokensPerSecondTotal":{"mean":36.95,"stddev":4.62},"prefillTokensPerSecondTotal":{"mean":885.95,"stddev":33.74},"decodeTokensPerSecondPerUser":{"mean":6.03,"stddev":0.26}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","workloadId":"chat-1k","sourceLabel":"nvidia/Gemma-4-31B-IT-NVFP4 nvfp4 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"gemma-4-31b-it-nvfp4-rag-8k","date":"2026-08-16","runs":3,"metrics":{"ttfrSec":{"mean":57.922,"stddev":27.474},"decodeTokensPerSecondTotal":{"mean":25.65,"stddev":1.68},"prefillTokensPerSecondTotal":{"mean":787.08,"stddev":0.71},"decodeTokensPerSecondPerUser":{"mean":4.12,"stddev":1.09}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","workloadId":"rag-8k","sourceLabel":"nvidia/Gemma-4-31B-IT-NVFP4 nvfp4 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"gemma-4-31b-it-nvfp4-long-output-agents","date":"2026-08-16","runs":3,"metrics":{"ttfrSec":{"mean":2.707,"stddev":0.026},"decodeTokensPerSecondTotal":{"mean":36.22,"stddev":7.89},"prefillTokensPerSecondTotal":{"mean":874.04,"stddev":2.31},"decodeTokensPerSecondPerUser":{"mean":6.76,"stddev":0.06}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","workloadId":"long-output-agents","sourceLabel":"nvidia/Gemma-4-31B-IT-NVFP4 nvfp4 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"gemma-4-31b-it-nvfp4-multi-turn-office","date":"2026-08-16","runs":3,"metrics":{"ttfrSec":{"mean":16.586,"stddev":4.279},"decodeTokensPerSecondTotal":{"mean":43.41,"stddev":3.27},"prefillTokensPerSecondTotal":{"mean":889.71,"stddev":1.81},"decodeTokensPerSecondPerUser":{"mean":5.71,"stddev":0.69}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","workloadId":"multi-turn-office","sourceLabel":"nvidia/Gemma-4-31B-IT-NVFP4 nvfp4 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"gemma-4-31b-it-nvfp4-large-context-25k","date":"2026-08-16","runs":3,"metrics":{"ttfrSec":{"mean":224.208,"stddev":111.55},"decodeTokensPerSecondTotal":{"mean":6.2,"stddev":0.24},"prefillTokensPerSecondTotal":{"mean":575.51,"stddev":0.69},"decodeTokensPerSecondPerUser":{"mean":1.66,"stddev":1.25}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","workloadId":"large-context-25k","sourceLabel":"nvidia/Gemma-4-31B-IT-NVFP4 nvfp4 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"gemma-4-31b-it-nvfp4-concurrency-stress-25k","date":"2026-08-16","runs":3,"metrics":{"ttfrSec":{"mean":419.863,"stddev":225.668},"decodeTokensPerSecondTotal":{"mean":6.25,"stddev":0},"prefillTokensPerSecondTotal":{"mean":575.37,"stddev":0.06},"decodeTokensPerSecondPerUser":{"mean":0.9,"stddev":0.76}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","workloadId":"concurrency-stress-25k","sourceLabel":"nvidia/Gemma-4-31B-IT-NVFP4 nvfp4 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"gemma-4-31b-it-nvfp4-office-random-4k","date":"2026-08-16","metrics":{"e2eMs":{"p50":1131752.65,"p90":1477916.92,"p95":1584330.95,"p99":1645460.27,"mean":1113171.81},"tpotMs":{"p50":1931.21,"p90":3528.66,"p95":3873.11,"p99":5794.69,"mean":2080.29},"ttftMs":{"p50":219173.9,"p90":617600.74,"p95":660124.65,"p99":737940.86,"mean":268939.22}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","scenarioId":"office-random-4k","achievedRps":0.113,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":513.72,"peakConcurrentRequests":200},{"id":"gemma-4-31b-it-nvfp4-sharegpt-replay","date":"2026-08-16","metrics":{"e2eMs":{"p50":21096.83,"p90":84480.04,"p95":106629.07,"p99":143139.75,"mean":34258.78},"tpotMs":{"p50":164.25,"p90":179.96,"p95":186.04,"p99":213.4,"mean":165.68},"ttftMs":{"p50":670.85,"p90":1300.96,"p95":1548.31,"p99":2076.29,"mean":789.65}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","scenarioId":"sharegpt-replay","achievedRps":0.275,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":122.13,"peakConcurrentRequests":20},{"id":"gemma-4-31b-it-nvfp4-reasoning","date":"2026-08-16","metrics":{"e2eMs":{"p50":1125250.5,"p90":1683312.16,"p95":1806150.04,"p99":1851452.32,"mean":1141878.23},"tpotMs":{"p50":285.71,"p90":301.76,"p95":306.94,"p99":312.09,"mean":280.2},"ttftMs":{"p50":2147.32,"p90":3174.23,"p95":3880.67,"p99":4730.41,"mean":2207.02}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","scenarioId":"reasoning","achievedRps":0.025,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":134.76,"peakConcurrentRequests":49},{"id":"gemma-4-31b-it-nvfp4-monday-peak-random-4k","date":"2026-08-16","metrics":{"e2eMs":{"p50":226702.29,"p90":426169.47,"p95":443575.26,"p99":495132.2,"mean":239787.67},"tpotMs":{"p50":465.01,"p90":524.55,"p95":581.57,"p99":751.75,"mean":466.68},"ttftMs":{"p50":5964.17,"p90":11574.73,"p95":47260.45,"p99":109729.61,"mean":10903.12}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","scenarioId":"monday-peak-random-4k","achievedRps":0.102,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":458.22,"peakConcurrentRequests":27}],"rateSweep":{"date":"2026-08-16","capacity":{"slo2000":null,"slo5000":null,"slo10000":null},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-31b-it/nvfp4/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}