{"name":"Nemotron-3-Nano-Omni-30B-A3B-Reasoning","aaUrl":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-30b-a3b","arena":{"id":"nemotron-3-fp8","name":"Nemotron-3-Nano 30B-A3B","vram":33,"params":30,"vendor":"nvidia","quality":{"coding":{"bench":"LiveCodeBench v5","value":63.2},"science":{"bench":"GPQA-Diamond","value":72.2},"knowledge":{"bench":"MMLU-Pro","value":77.3}},"contextK":256,"baseModelId":"nemotron-3-nano-30b-a3b"},"notes":"Model-ID: nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-08T00:08:00+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --trust-remote-code --max-num-batched-tokens 8192. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","order":3,"engine":"vLLM v0.26.0","vramGb":33,"verdict":"Gemeten op 2026-08-07 tot 2026-08-08 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 13,53 tokens/s per gebruiker, met gemiddeld 1,96 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 15,44 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","findings":{"broke":{"body":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 15,44 seconden. Daarna genereert het model gemiddeld 9,16 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.","title":"Wachttijd bij 25k context"},"costly":{"body":"De run verwerkt 0,38 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 1,76 seconden.","title":"Verzoeken en wachttijd bij piekbelasting"},"worked":{"body":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 13,53 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 1,96 seconden.","title":"Chat bij tien gelijktijdige verzoeken"},"surprised":{"body":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","title":"Welke metingen meetellen"}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8","provider":"NVIDIA","precision":"FP8","parameters":"30B-A3B","provenance":{"modelId":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8","runPath":"results/nemotron-3/nemotron-3-nano-30b-a3b/fp8","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"not_recorded"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","servedName":"nemotron-3-nano-30b-fp8","generatedAt":"2026-08-08T00:08:00+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"MoE","measuredContextK":128,"benchmarkResults":[{"id":"nemotron-3-nano-30b-a3b-fp8-chat-1k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":1.959,"stddev":0.427},"decodeTokensPerSecondTotal":{"mean":129.66,"stddev":4.56},"prefillTokensPerSecondTotal":{"mean":4645.98,"stddev":730.33},"decodeTokensPerSecondPerUser":{"mean":13.53,"stddev":0.15}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","workloadId":"chat-1k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 fp8 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-fp8-rag-8k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":5.224,"stddev":2.584},"decodeTokensPerSecondTotal":{"mean":111.14,"stddev":1.72},"prefillTokensPerSecondTotal":{"mean":8309.07,"stddev":29.44},"decodeTokensPerSecondPerUser":{"mean":12.76,"stddev":0.87}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","workloadId":"rag-8k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 fp8 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-fp8-long-output-agents","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":0.733,"stddev":0.179},"decodeTokensPerSecondTotal":{"mean":116.83,"stddev":4.59},"prefillTokensPerSecondTotal":{"mean":3254.79,"stddev":885.58},"decodeTokensPerSecondPerUser":{"mean":15.69,"stddev":2.28}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","workloadId":"long-output-agents","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 fp8 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-fp8-multi-turn-office","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":2.159,"stddev":0.698},"decodeTokensPerSecondTotal":{"mean":128.78,"stddev":1.95},"prefillTokensPerSecondTotal":{"mean":6669.92,"stddev":406.65},"decodeTokensPerSecondPerUser":{"mean":13.79,"stddev":0.62}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","workloadId":"multi-turn-office","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 fp8 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-fp8-large-context-25k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":15.44,"stddev":7.808},"decodeTokensPerSecondTotal":{"mean":59.77,"stddev":0.14},"prefillTokensPerSecondTotal":{"mean":8175.42,"stddev":35.87},"decodeTokensPerSecondPerUser":{"mean":9.16,"stddev":2.47}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","workloadId":"large-context-25k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 fp8 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"nemotron-3-nano-30b-a3b-fp8-concurrency-stress-25k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":29.327,"stddev":15.76},"decodeTokensPerSecondTotal":{"mean":67.55,"stddev":0.09},"prefillTokensPerSecondTotal":{"mean":8173.67,"stddev":34.57},"decodeTokensPerSecondPerUser":{"mean":5.93,"stddev":2.09}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","workloadId":"concurrency-stress-25k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 fp8 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"nemotron-3-nano-30b-a3b-fp8-office-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":43063.8,"p90":78059.53,"p95":86329.56,"p99":96004.5,"mean":44006.64},"tpotMs":{"p50":91.44,"p90":105.28,"p95":110.34,"p99":121.69,"mean":89.11},"ttftMs":{"p50":1021.68,"p90":1790.01,"p95":2116.4,"p99":2635.3,"mean":1150.78}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","scenarioId":"office-random-4k","achievedRps":0.282,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1285.65,"peakConcurrentRequests":24},{"id":"nemotron-3-nano-30b-a3b-fp8-sharegpt-replay","date":"2026-08-07","metrics":{"e2eMs":{"p50":4929.57,"p90":21926.07,"p95":26065.77,"p99":33269.83,"mean":8645.9},"tpotMs":{"p50":38.72,"p90":61.28,"p95":69.25,"p99":78.34,"mean":41.64},"ttftMs":{"p50":217.31,"p90":541.29,"p95":607.71,"p99":922.74,"mean":269.99}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","scenarioId":"sharegpt-replay","achievedRps":0.3,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":131.91,"peakConcurrentRequests":12},{"id":"nemotron-3-nano-30b-a3b-fp8-reasoning","date":"2026-08-07","metrics":{"e2eMs":{"p50":347086.56,"p90":466951.76,"p95":497688.84,"p99":529198.23,"mean":327374.14},"tpotMs":{"p50":81.57,"p90":100.71,"p95":105.16,"p99":109.75,"mean":82.73},"ttftMs":{"p50":619.98,"p90":745.8,"p95":842.88,"p99":1033.76,"mean":598.12}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","scenarioId":"reasoning","achievedRps":0.078,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":412.39,"peakConcurrentRequests":46},{"id":"nemotron-3-nano-30b-a3b-fp8-monday-peak-random-4k","date":"2026-08-08","metrics":{"e2eMs":{"p50":63619.97,"p90":115509.71,"p95":118837.86,"p99":123222.35,"mean":64328.29},"tpotMs":{"p50":130,"p90":135.63,"p95":139.5,"p99":151.75,"mean":127.93},"ttftMs":{"p50":985.62,"p90":1453.01,"p95":1759.37,"p99":3586.08,"mean":1078.37}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","scenarioId":"monday-peak-random-4k","achievedRps":0.376,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":1693.88,"peakConcurrentRequests":28}],"rateSweep":{"date":"2026-08-08","capacity":{"slo2000":{"outputTps":93.2,"ttftP95Ms":1794.2,"achievedRps":0.19,"configuredRps":0.2,"peakConcurrent":14},"slo5000":{"outputTps":139,"ttftP95Ms":3748.1,"achievedRps":0.847,"configuredRps":1,"peakConcurrent":200},"slo10000":{"outputTps":139,"ttftP95Ms":3748.1,"achievedRps":0.847,"configuredRps":1,"peakConcurrent":200}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-30b-a3b/fp8/","abortedAtRps":null,"queueKneeRps":0.7,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}