{"name":"Nemotron-3 Nano Omni 30B-A3B","arena":{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16","name":"Nemotron-3 Nano Omni 30B-A3B","vram":60,"params":30,"vendor":"nvidia","quality":{"coding":null,"science":null,"knowledge":null},"contextK":256,"baseModelId":"nemotron-3-nano-omni-30b-a3b-reasoning"},"notes":"Model-ID: nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-05T23:54:47+02:00. KV-cache auto; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling uit. Extra serverflags: --trust-remote-code --max-num-seqs 256 --max-num-batched-tokens 8192 --video-pruning-rate 0.5 --reasoning-parser nemotron_v3 --enable-auto-tool-choice --tool-call-parser qwen3_coder. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","order":230,"engine":"vLLM v0.26.0","verdict":"Gemeten op 2026-08-05 tot 2026-08-06 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 8,75 tokens/s per gebruiker, met gemiddeld 1,48 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 19,19 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16","provider":"nvidia","precision":"BF16","parameters":"30B-A3B","provenance":{"modelId":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16","runPath":"results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"not_recorded"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","servedName":"nemotron-3-nano-omni-30b-bf16","generatedAt":"2026-08-05T23:54:47+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"MoE","measuredContextK":128,"benchmarkResults":[{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-chat-1k","date":"2026-08-05","runs":3,"metrics":{"ttfrSec":{"mean":1.477,"stddev":0.49},"decodeTokensPerSecondTotal":{"mean":73.44,"stddev":2.5},"prefillTokensPerSecondTotal":{"mean":5098.81,"stddev":56.98},"decodeTokensPerSecondPerUser":{"mean":8.75,"stddev":0.87}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","workloadId":"chat-1k","sourceLabel":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-rag-8k","date":"2026-08-05","runs":3,"metrics":{"ttfrSec":{"mean":6.258,"stddev":3.201},"decodeTokensPerSecondTotal":{"mean":67.37,"stddev":0.36},"prefillTokensPerSecondTotal":{"mean":6883.76,"stddev":9.78},"decodeTokensPerSecondPerUser":{"mean":7.53,"stddev":0.46}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","workloadId":"rag-8k","sourceLabel":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-long-output-agents","date":"2026-08-05","runs":3,"metrics":{"ttfrSec":{"mean":0.688,"stddev":0.167},"decodeTokensPerSecondTotal":{"mean":63.28,"stddev":5.06},"prefillTokensPerSecondTotal":{"mean":2934.24,"stddev":103.4},"decodeTokensPerSecondPerUser":{"mean":10.24,"stddev":2.44}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","workloadId":"long-output-agents","sourceLabel":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-multi-turn-office","date":"2026-08-05","runs":3,"metrics":{"ttfrSec":{"mean":2.13,"stddev":0.781},"decodeTokensPerSecondTotal":{"mean":74.15,"stddev":0.27},"prefillTokensPerSecondTotal":{"mean":6169.6,"stddev":21.49},"decodeTokensPerSecondPerUser":{"mean":8.3,"stddev":0.4}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","workloadId":"multi-turn-office","sourceLabel":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-large-context-25k","date":"2026-08-05","runs":3,"metrics":{"ttfrSec":{"mean":19.189,"stddev":9.704},"decodeTokensPerSecondTotal":{"mean":39.27,"stddev":0.13},"prefillTokensPerSecondTotal":{"mean":6556.62,"stddev":2.16},"decodeTokensPerSecondPerUser":{"mean":5.61,"stddev":1.22}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","workloadId":"large-context-25k","sourceLabel":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-concurrency-stress-25k","date":"2026-08-05","runs":3,"metrics":{"ttfrSec":{"mean":36.919,"stddev":20.261},"decodeTokensPerSecondTotal":{"mean":45.43,"stddev":0.89},"prefillTokensPerSecondTotal":{"mean":6370.44,"stddev":17.78},"decodeTokensPerSecondPerUser":{"mean":3.7,"stddev":1.11}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-office-random-4k","date":"2026-08-05","metrics":{"e2eMs":{"p50":98035.84,"p90":167784.39,"p95":184093.22,"p99":195039.76,"mean":97225.95},"tpotMs":{"p50":204.14,"p90":222.07,"p95":227.98,"p99":237.33,"mean":200.68},"ttftMs":{"p50":1214.06,"p90":2040.25,"p95":2333.62,"p99":2927.31,"mean":1342.58}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","scenarioId":"office-random-4k","achievedRps":0.264,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1204.94,"peakConcurrentRequests":41},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-sharegpt-replay","date":"2026-08-06","metrics":{"e2eMs":{"p50":13000.71,"p90":57978.88,"p95":71769,"p99":97520.58,"mean":23244.27},"tpotMs":{"p50":114.95,"p90":148.33,"p95":154.55,"p99":164.39,"mean":110.76},"ttftMs":{"p50":432.84,"p90":588.46,"p95":635.37,"p99":765.83,"mean":442.25}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.297,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":130.17,"peakConcurrentRequests":17},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-reasoning","date":"2026-08-06","metrics":{"e2eMs":{"p50":590266.99,"p90":835922.34,"p95":903200.08,"p99":939497.39,"mean":582602.37},"tpotMs":{"p50":146.35,"p90":167.67,"p95":170.72,"p99":175.09,"mean":145.08},"ttftMs":{"p50":650.31,"p90":803.44,"p95":835.59,"p99":907.54,"mean":651.77}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","scenarioId":"reasoning","achievedRps":0.048,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":253.87,"peakConcurrentRequests":49},{"id":"nemotron-3-nano-omni-30b-a3b-reasoning-bf16-monday-peak-random-4k","date":"2026-08-06","metrics":{"e2eMs":{"p50":94181.57,"p90":169791.04,"p95":177020.52,"p99":182774.05,"mean":95750.44},"tpotMs":{"p50":193.02,"p90":200.59,"p95":204.06,"p99":230.4,"mean":191.02},"ttftMs":{"p50":1111.01,"p90":1656.93,"p95":2043.36,"p99":5170.83,"mean":1254.74}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":0.253,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":1139.08,"peakConcurrentRequests":28}],"rateSweep":{"date":"2026-08-05","capacity":{"slo2000":{"outputTps":47.2,"ttftP95Ms":1759.5,"achievedRps":0.096,"configuredRps":0.1,"peakConcurrent":14},"slo5000":{"outputTps":215.8,"ttftP95Ms":3647,"achievedRps":0.442,"configuredRps":0.7,"peakConcurrent":125},"slo10000":{"outputTps":273.2,"ttftP95Ms":5907.8,"achievedRps":0.555,"configuredRps":1,"peakConcurrent":209}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}