{"name":"Nemotron-3-Nano-4B","aaUrl":"https://artificialanalysis.ai/models/nvidia-nemotron-3-nano-4b","arena":{"id":"nemotron-3-nano-4b-bf16","name":"Nemotron-3-Nano 4B","vram":8,"params":4,"vendor":"nvidia","quality":{"coding":{"bench":"LiveCodeBench","value":51.8},"science":{"bench":"GPQA-Diamond","value":51.3},"knowledge":{"bench":"MMLU-Pro","value":18.1}},"contextK":256,"baseModelId":"nemotron-3-nano-4b"},"notes":"Model-ID: nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-06T05:29:55+02:00. KV-cache fp8_e4m3; max_model_len 49152; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --trust-remote-code. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","order":8,"engine":"vLLM v0.26.0","verdict":"Gemeten op 2026-08-06 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 24,14 tokens/s per gebruiker, met gemiddeld 0,88 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 17,73 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","findings":{"broke":{"body":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 17,73 seconden. Daarna genereert het model gemiddeld 11,9 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.","title":"Wachttijd bij 25k context"},"costly":{"body":"De run verwerkt 0,57 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 1,84 seconden.","title":"Verzoeken en wachttijd bij piekbelasting"},"worked":{"body":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 24,14 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 0,88 seconden.","title":"Chat bij tien gelijktijdige verzoeken"},"surprised":{"body":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","title":"Welke metingen meetellen"}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16","provider":"NVIDIA","precision":"BF16","parameters":"4B","provenance":{"modelId":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16","runPath":"results/nemotron-3/nemotron-3-nano-4b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"not_recorded"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","servedName":"nemotron-3-nano-4b-bf16","generatedAt":"2026-08-06T05:29:55+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"Dense","measuredContextK":48,"benchmarkResults":[{"id":"nemotron-3-nano-4b-bf16-chat-1k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":0.883,"stddev":0.385},"decodeTokensPerSecondTotal":{"mean":224.49,"stddev":8.29},"prefillTokensPerSecondTotal":{"mean":6903.03,"stddev":142.95},"decodeTokensPerSecondPerUser":{"mean":24.14,"stddev":0.35}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","workloadId":"chat-1k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"nemotron-3-nano-4b-bf16-rag-8k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":5.546,"stddev":2.811},"decodeTokensPerSecondTotal":{"mean":161.25,"stddev":5.47},"prefillTokensPerSecondTotal":{"mean":7459.59,"stddev":12.21},"decodeTokensPerSecondPerUser":{"mean":19.96,"stddev":1.87}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","workloadId":"rag-8k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"nemotron-3-nano-4b-bf16-long-output-agents","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":0.345,"stddev":0.052},"decodeTokensPerSecondTotal":{"mean":158.45,"stddev":2.66},"prefillTokensPerSecondTotal":{"mean":5907.06,"stddev":104.49},"decodeTokensPerSecondPerUser":{"mean":25.22,"stddev":0.52}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","workloadId":"long-output-agents","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"nemotron-3-nano-4b-bf16-multi-turn-office","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":1.458,"stddev":0.746},"decodeTokensPerSecondTotal":{"mean":211.03,"stddev":8.18},"prefillTokensPerSecondTotal":{"mean":7445.39,"stddev":86.37},"decodeTokensPerSecondPerUser":{"mean":23.24,"stddev":0.75}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","workloadId":"multi-turn-office","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"nemotron-3-nano-4b-bf16-large-context-25k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":17.732,"stddev":9.285},"decodeTokensPerSecondTotal":{"mean":62.3,"stddev":0.68},"prefillTokensPerSecondTotal":{"mean":6962.24,"stddev":4.74},"decodeTokensPerSecondPerUser":{"mean":11.9,"stddev":4.59}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","workloadId":"large-context-25k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"nemotron-3-nano-4b-bf16-concurrency-stress-25k","date":"2026-08-06","runs":3,"metrics":{"ttfrSec":{"mean":34.588,"stddev":19.253},"decodeTokensPerSecondTotal":{"mean":65.74,"stddev":0.18},"prefillTokensPerSecondTotal":{"mean":6742.79,"stddev":6.96},"decodeTokensPerSecondPerUser":{"mean":7.49,"stddev":3.86}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16 bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"nemotron-3-nano-4b-bf16-office-random-4k","date":"2026-08-06","metrics":{"e2eMs":{"p50":22720.22,"p90":40290.63,"p95":43175.28,"p99":47619.97,"mean":23208.44},"tpotMs":{"p50":46.07,"p90":53.29,"p95":56.17,"p99":62.7,"mean":46.25},"ttftMs":{"p50":800.46,"p90":1423.28,"p95":1755.35,"p99":2406.02,"mean":847.49}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","scenarioId":"office-random-4k","achievedRps":0.289,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1320.38,"peakConcurrentRequests":15},{"id":"nemotron-3-nano-4b-bf16-sharegpt-replay","date":"2026-08-06","metrics":{"e2eMs":{"p50":4874.36,"p90":17831.83,"p95":22933.76,"p99":29506.8,"mean":7506.78},"tpotMs":{"p50":35.98,"p90":38.77,"p95":39.36,"p99":39.74,"mean":36.16},"ttftMs":{"p50":129.09,"p90":176.14,"p95":192.51,"p99":211.03,"mean":130.41}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.299,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":131.09,"peakConcurrentRequests":10},{"id":"nemotron-3-nano-4b-bf16-reasoning","date":"2026-08-06","metrics":{"e2eMs":{"p50":259735.54,"p90":394346.04,"p95":434184.43,"p99":448196.98,"mean":258619.27},"tpotMs":{"p50":63.49,"p90":69.87,"p95":70.47,"p99":73.03,"mean":62.15},"ttftMs":{"p50":280.71,"p90":383.82,"p95":410.88,"p99":422.41,"mean":285.58}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","scenarioId":"reasoning","achievedRps":0.081,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":430.71,"peakConcurrentRequests":42},{"id":"nemotron-3-nano-4b-bf16-monday-peak-random-4k","date":"2026-08-06","metrics":{"e2eMs":{"p50":40772.7,"p90":73312.95,"p95":76424.93,"p99":80550.89,"mean":41439.07},"tpotMs":{"p50":82.25,"p90":88,"p95":91.57,"p99":96.91,"mean":81.63},"ttftMs":{"p50":823.11,"p90":1556.77,"p95":1843.18,"p99":3996.96,"mean":953.48}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":0.574,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":2590.58,"peakConcurrentRequests":29}],"rateSweep":{"date":"2026-08-06","capacity":{"slo2000":{"outputTps":133.5,"ttftP95Ms":1755.8,"achievedRps":0.272,"configuredRps":0.3,"peakConcurrent":15},"slo5000":{"outputTps":371.9,"ttftP95Ms":4815.1,"achievedRps":0.756,"configuredRps":1,"peakConcurrent":133},"slo10000":{"outputTps":371.9,"ttftP95Ms":4815.1,"achievedRps":0.756,"configuredRps":1,"peakConcurrent":133}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-4b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}