{"name":"Gemma-4-26B-A4B-it","aaUrl":"https://artificialanalysis.ai/models/gemma-4-26b-a4b","arena":{"id":"gemma-4-bf16","name":"Gemma-4 26B-A4B","vram":52,"params":26,"vendor":"google","quality":{"coding":{"bench":"LiveCodeBench v6","value":77.1},"science":{"bench":"GPQA-Diamond","value":82.3},"knowledge":{"bench":"MMLU-Pro","value":82.6}},"contextK":256,"baseModelId":"gemma-4-26b-a4b-it"},"notes":{"en":"Google BF16 model on vLLM v0.23.0, KV-cache fp8, prefix caching off, gpu-memory-utilization 0.85. New suite run on 2026-06-22 and 2026-06-23.","fr":"Modèle Google BF16 sur vLLM v0.23.0, KV-cache fp8, prefix caching désactivé, gpu-memory-utilization 0.85. Nouvelle suite exécutée les 2026-06-22 et 2026-06-23.","nl":"Model-ID: google/gemma-4-26B-A4B-it. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-06T08:12:07+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,85. Prefix caching uit; async scheduling aan. Extra serverflags: --max-num-batched-tokens 8192. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt."},"order":15,"engine":"vLLM v0.26.0","vramGb":52,"verdict":{"en":"Control line for vLLM v0.23.0. Chat reaches 11.47 t/s/user at c=10, multi-turn 10.69 t/s/user and the office baseline stays 200/200 green. Useful as reference, but MTP and NVFP4 show how much decode is left on the table.","fr":"Ligne de contrôle pour vLLM v0.23.0. Le chat atteint 11.47 t/s/user à c=10, le multi-turn 10.69 t/s/user et la baseline bureau reste 200/200 verte. Utile comme référence, mais MTP et NVFP4 montrent combien de decode reste disponible.","nl":"Gemeten op 2026-08-06 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 10,55 tokens/s per gebruiker, met gemiddeld 1,55 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 40,9 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt. De URL bevat nog v23, maar de huidige bronrun is uitgevoerd met vLLM v0.26.0."},"findings":{"broke":{"body":{"en":"Even NVFP4 sits at 38.58s average TTFT for 25k and c=10. Serving profile helps decode, not the wait before large prompts.","fr":"Même NVFP4 est à 38.58s de TTFT moyen en 25k et c=10. Le profil de serving aide le decode, pas l’attente avant les grands prompts.","nl":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 40,9 seconden. Daarna genereert het model gemiddeld 5,01 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is."},"title":{"en":"25k context is still prefill pain","fr":"Le contexte 25k reste douloureux en prefill","nl":"Wachttijd bij 25k context"}},"costly":{"body":{"en":"MTP beats BF16 on decode, but under Monday peak load its p95 TTFT and p95 TPOT are worse than BF16. Percentiles still matter.","fr":"MTP bat BF16 en decode, mais sous le pic du lundi son p95 TTFT et son p95 TPOT sont pires que BF16. Les percentiles restent nécessaires.","nl":"De run verwerkt 0,25 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 3,32 seconden."},"title":{"en":"MTP buys decode, not perfect tail","fr":"MTP achète du decode, pas une tail parfaite","nl":"Verzoeken en wachttijd bij piekbelasting"}},"worked":{"body":{"en":"Chat at 21.59 t/s/user and multi-turn at 20.01 t/s/user at c=10. For local office chat this does not feel like a compromise.","fr":"Chat à 21.59 t/s/user et multi-turn à 20.01 t/s/user à c=10. Pour du chat local de bureau, cela ne ressemble pas à un compromis.","nl":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 10,55 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 1,55 seconden."},"title":{"en":"NVFP4 is the practical default","fr":"NVFP4 est le choix pratique","nl":"Chat bij tien gelijktijdige verzoeken"}},"surprised":{"body":{"en":"NVFP4 completes 250/250 requests with p95 TTFT 225.09 ms and p95 TPOT 45.30 ms. Real short conversations are much lighter than random 4k.","fr":"NVFP4 termine 250/250 requêtes avec p95 TTFT 225.09 ms et p95 TPOT 45.30 ms. Les vraies conversations courtes sont bien plus légères que random 4k.","nl":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt."},"title":{"en":"ShareGPT replay is extremely friendly","fr":"Le replay ShareGPT est très favorable","nl":"Welke metingen meetellen"}}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/google/gemma-4-26B-A4B-it","provider":"Google","precision":"BF16","parameters":"26B-A4B","provenance":{"modelId":"google/gemma-4-26B-A4B-it","runPath":"results/gemma-4/gemma-4-26b-a4b-it/bf16-v23","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"not_recorded"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","servedName":"gemma-4-26b-a4b","generatedAt":"2026-08-06T08:12:07+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"MoE","measuredContextK":128,"benchmarkResults":[{"id":"gemma-4-26b-a4b-it-bf16-v23-chat-1k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":1.555,"stddev":0.533},"decodeTokensPerSecondTotal":{"mean":90.81,"stddev":1.12},"prefillTokensPerSecondTotal":{"mean":5079.67,"stddev":16.78},"decodeTokensPerSecondPerUser":{"mean":10.55,"stddev":0.35}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","workloadId":"chat-1k","sourceLabel":"google/gemma-4-26B-A4B-it bf16-v23 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"gemma-4-26b-a4b-it-bf16-v23-rag-8k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":8.795,"stddev":4.565},"decodeTokensPerSecondTotal":{"mean":75.79,"stddev":0.37},"prefillTokensPerSecondTotal":{"mean":4869.04,"stddev":6.01},"decodeTokensPerSecondPerUser":{"mean":8.74,"stddev":0.68}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","workloadId":"rag-8k","sourceLabel":"google/gemma-4-26B-A4B-it bf16-v23 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"gemma-4-26b-a4b-it-bf16-v23-long-output-agents","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":0.511,"stddev":0.05},"decodeTokensPerSecondTotal":{"mean":81.43,"stddev":0.94},"prefillTokensPerSecondTotal":{"mean":4175.46,"stddev":481.04},"decodeTokensPerSecondPerUser":{"mean":11.36,"stddev":0.86}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","workloadId":"long-output-agents","sourceLabel":"google/gemma-4-26B-A4B-it bf16-v23 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"gemma-4-26b-a4b-it-bf16-v23-multi-turn-office","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":2.316,"stddev":0.942},"decodeTokensPerSecondTotal":{"mean":88.68,"stddev":0.92},"prefillTokensPerSecondTotal":{"mean":5497.43,"stddev":40.55},"decodeTokensPerSecondPerUser":{"mean":10.18,"stddev":0.42}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","workloadId":"multi-turn-office","sourceLabel":"google/gemma-4-26B-A4B-it bf16-v23 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"gemma-4-26b-a4b-it-bf16-v23-large-context-25k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":40.901,"stddev":20.839},"decodeTokensPerSecondTotal":{"mean":27.52,"stddev":0.05},"prefillTokensPerSecondTotal":{"mean":3100.51,"stddev":3.59},"decodeTokensPerSecondPerUser":{"mean":5.01,"stddev":2.01}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","workloadId":"large-context-25k","sourceLabel":"google/gemma-4-26B-A4B-it bf16-v23 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"gemma-4-26b-a4b-it-bf16-v23-concurrency-stress-25k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":76.76,"stddev":41.792},"decodeTokensPerSecondTotal":{"mean":28.54,"stddev":0.35},"prefillTokensPerSecondTotal":{"mean":3110.01,"stddev":5.33},"decodeTokensPerSecondPerUser":{"mean":2.88,"stddev":1.35}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","workloadId":"concurrency-stress-25k","sourceLabel":"google/gemma-4-26B-A4B-it bf16-v23 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"gemma-4-26b-a4b-it-bf16-v23-office-random-4k","date":"2026-08-06","metrics":{"e2eMs":{"p50":93428.09,"p90":163271.54,"p95":177380.18,"p99":188588.97,"mean":94243.38},"tpotMs":{"p50":198.27,"p90":217.01,"p95":219.89,"p99":228.71,"mean":194.13},"ttftMs":{"p50":1433.25,"p90":2582.18,"p95":3112.24,"p99":3812.14,"mean":1584.94}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","scenarioId":"office-random-4k","achievedRps":0.267,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1219.78,"peakConcurrentRequests":40},{"id":"gemma-4-26b-a4b-it-bf16-v23-sharegpt-replay","date":"2026-08-06","metrics":{"e2eMs":{"p50":10923.95,"p90":50990.11,"p95":68698.03,"p99":89016.55,"mean":20258.37},"tpotMs":{"p50":98.6,"p90":122.64,"p95":128.81,"p99":139.42,"mean":95.8},"ttftMs":{"p50":353.52,"p90":474.39,"p95":510.01,"p99":563.97,"mean":359.77}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","scenarioId":"sharegpt-replay","achievedRps":0.298,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":133.04,"peakConcurrentRequests":17},{"id":"gemma-4-26b-a4b-it-bf16-v23-reasoning","date":"2026-08-06","metrics":{"e2eMs":{"p50":590365.02,"p90":851658.7,"p95":919430.93,"p99":952588.62,"mean":585089.92},"tpotMs":{"p50":145.13,"p90":160.86,"p95":164.35,"p99":167.58,"mean":143.96},"ttftMs":{"p50":569.98,"p90":738.33,"p95":752.35,"p99":930.24,"mean":579.96}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","scenarioId":"reasoning","achievedRps":0.047,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":247.68,"peakConcurrentRequests":49},{"id":"gemma-4-26b-a4b-it-bf16-v23-monday-peak-random-4k","date":"2026-08-06","metrics":{"e2eMs":{"p50":96321.59,"p90":173951.5,"p95":181262.44,"p99":188766.43,"mean":97912.72},"tpotMs":{"p50":196.58,"p90":205.71,"p95":210.13,"p99":238.23,"mean":194.94},"ttftMs":{"p50":1234.78,"p90":2128.1,"p95":3321.4,"p99":7596.54,"mean":1508.18}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","scenarioId":"monday-peak-random-4k","achievedRps":0.246,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":1110.68,"peakConcurrentRequests":27}],"rateSweep":{"date":"2026-08-06","capacity":{"slo2000":null,"slo5000":{"outputTps":213.3,"ttftP95Ms":4577.5,"achievedRps":0.437,"configuredRps":0.7,"peakConcurrent":129},"slo10000":{"outputTps":259.1,"ttftP95Ms":7628.2,"achievedRps":0.527,"configuredRps":1,"peakConcurrent":221}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gemma-4/gemma-4-26b-a4b-it/bf16-v23/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}