{"name":"Nemotron-3-Nano-Omni-30B-A3B-Reasoning","aaUrl":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b","arena":{"id":"nemotron-3-bf16","name":"Nemotron-3-Nano 30B-A3B","vram":62,"params":30,"vendor":"nvidia","quality":{"coding":{"bench":"LiveCodeBench v5","value":63.2},"science":{"bench":"GPQA-Diamond","value":72.2},"knowledge":{"bench":"MMLU-Pro","value":77.3}},"contextK":256,"baseModelId":"nemotron-3-nano-30b-a3b"},"notes":"Model-ID: nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-09T02:33:29+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --trust-remote-code --max-num-batched-tokens 8192. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","order":2,"engine":"vLLM v0.26.0","vramGb":62,"verdict":"Gemeten op 2026-08-09 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 7,64 tokens/s per gebruiker, met gemiddeld 1,51 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 19,4 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","findings":{"broke":{"body":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 19,4 seconden. Daarna genereert het model gemiddeld 5,74 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.","title":"Wachttijd bij 25k context"},"costly":{"body":"De run verwerkt 0,24 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 2,15 seconden.","title":"Verzoeken en wachttijd bij piekbelasting"},"worked":{"body":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 7,64 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 1,51 seconden.","title":"Chat bij tien gelijktijdige verzoeken"},"surprised":{"body":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","title":"Welke metingen meetellen"}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16","provider":"NVIDIA","precision":"BF16","parameters":"30B-A3B","provenance":{"modelId":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16","runPath":"results/nemotron-3/nemotron-3-nano-30b-a3b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"not_recorded"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","servedName":"nemotron-3-nano-30b-bf16","generatedAt":"2026-08-09T02:33:29+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"MoE","measuredContextK":128,"benchmarkResults":[{"id":"nemotron-3-nano-30b-a3b-bf16-chat-1k","date":"2026-08-09","runs":3,"metrics":{"ttfrSec":{"mean":1.506,"stddev":0.463},"decodeTokensPerSecondTotal":{"mean":72.26,"stddev":0.68},"prefillTokensPerSecondTotal":{"mean":5096.37,"stddev":42.71},"decodeTokensPerSecondPerUser":{"mean":7.64,"stddev":0.07}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","workloadId":"chat-1k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-bf16-rag-8k","date":"2026-08-09","runs":3,"metrics":{"ttfrSec":{"mean":6.283,"stddev":3.229},"decodeTokensPerSecondTotal":{"mean":67.5,"stddev":0.21},"prefillTokensPerSecondTotal":{"mean":6828.5,"stddev":12.59},"decodeTokensPerSecondPerUser":{"mean":7.29,"stddev":0.31}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","workloadId":"rag-8k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-bf16-long-output-agents","date":"2026-08-09","runs":3,"metrics":{"ttfrSec":{"mean":0.612,"stddev":0.121},"decodeTokensPerSecondTotal":{"mean":66.35,"stddev":2.44},"prefillTokensPerSecondTotal":{"mean":3852.36,"stddev":550.11},"decodeTokensPerSecondPerUser":{"mean":8.43,"stddev":1.13}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","workloadId":"long-output-agents","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-bf16-multi-turn-office","date":"2026-08-09","runs":3,"metrics":{"ttfrSec":{"mean":2.119,"stddev":0.774},"decodeTokensPerSecondTotal":{"mean":74.22,"stddev":0.81},"prefillTokensPerSecondTotal":{"mean":6129.06,"stddev":49.99},"decodeTokensPerSecondPerUser":{"mean":7.63,"stddev":0.1}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","workloadId":"multi-turn-office","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-bf16-large-context-25k","date":"2026-08-09","runs":3,"metrics":{"ttfrSec":{"mean":19.4,"stddev":9.837},"decodeTokensPerSecondTotal":{"mean":40.64,"stddev":0.06},"prefillTokensPerSecondTotal":{"mean":6550.94,"stddev":6.71},"decodeTokensPerSecondPerUser":{"mean":5.74,"stddev":1.2}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","workloadId":"large-context-25k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-bf16-concurrency-stress-25k","date":"2026-08-09","runs":3,"metrics":{"ttfrSec":{"mean":36.554,"stddev":19.83},"decodeTokensPerSecondTotal":{"mean":48.27,"stddev":0.12},"prefillTokensPerSecondTotal":{"mean":6534.2,"stddev":4.64},"decodeTokensPerSecondPerUser":{"mean":3.89,"stddev":1.1}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"nemotron-3-nano-30b-a3b-bf16-office-random-4k","date":"2026-08-09","metrics":{"e2eMs":{"p50":106021.39,"p90":182132.85,"p95":197717.09,"p99":206304.27,"mean":105074.84},"tpotMs":{"p50":220.75,"p90":238.58,"p95":242,"p99":261.76,"mean":216.82},"ttftMs":{"p50":1232.15,"p90":2003.86,"p95":2320.28,"p99":2906.49,"mean":1325.89}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","scenarioId":"office-random-4k","achievedRps":0.258,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1176.33,"peakConcurrentRequests":42},{"id":"nemotron-3-nano-30b-a3b-bf16-sharegpt-replay","date":"2026-08-09","metrics":{"e2eMs":{"p50":13805.76,"p90":59888.8,"p95":77489.04,"p99":102545.69,"mean":24330.48},"tpotMs":{"p50":122.34,"p90":152.56,"p95":156.59,"p99":168.64,"mean":114.7},"ttftMs":{"p50":434.87,"p90":612.14,"p95":643.88,"p99":761.67,"mean":449.38}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.296,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":130.48,"peakConcurrentRequests":17},{"id":"nemotron-3-nano-30b-a3b-bf16-reasoning","date":"2026-08-09","metrics":{"e2eMs":{"p50":550507.89,"p90":730032.57,"p95":786492.06,"p99":823460.31,"mean":526301.68},"tpotMs":{"p50":134.42,"p90":169.18,"p95":181.3,"p99":184.43,"mean":135.2},"ttftMs":{"p50":662.49,"p90":787.73,"p95":843,"p99":885.21,"mean":646.82}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","scenarioId":"reasoning","achievedRps":0.054,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":285.71,"peakConcurrentRequests":49},{"id":"nemotron-3-nano-30b-a3b-bf16-monday-peak-random-4k","date":"2026-08-09","metrics":{"e2eMs":{"p50":99442.99,"p90":179086.48,"p95":184634.92,"p99":192168.34,"mean":100100.53},"tpotMs":{"p50":202.31,"p90":210.51,"p95":214.54,"p99":233.07,"mean":199.87},"ttftMs":{"p50":1113.25,"p90":1769.52,"p95":2149.06,"p99":5136.47,"mean":1259.28}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":0.242,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":1090.41,"peakConcurrentRequests":28}],"rateSweep":{"date":"2026-08-09","capacity":{"slo2000":{"outputTps":47.2,"ttftP95Ms":1755.4,"achievedRps":0.096,"configuredRps":0.1,"peakConcurrent":14},"slo5000":{"outputTps":267.3,"ttftP95Ms":4441,"achievedRps":0.543,"configuredRps":1,"peakConcurrent":198},"slo10000":{"outputTps":267.3,"ttftP95Ms":4441,"achievedRps":0.543,"configuredRps":1,"peakConcurrent":198}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}