---
title: "Nemotron-3 Nano Omni 30B-A3B (FP8) · DGX Spark Arena"
canonical: "https://djangodevreng.nl/arena/nemotron-3-nano-omni-30b-a3b-reasoning-fp8/"
license: "CC-BY-4.0"
source: "https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/fp8/"
source_revision: "a948cec23b054c62fef595bad3cdb284066922ac"
contract_version: 1
suite_version: "2026-08"
minimum_request_success_rate: 0.99
sanity_status: "not_recorded"
attribution: "Django de Vreng, https://djangodevreng.nl"
---

# Nemotron-3 Nano Omni 30B-A3B (FP8)

Gemeten op 2026-08-06 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 16,85 tokens/s per gebruiker, met gemiddeld 1,42 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 14,32 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt. De piekmeting is uitgesloten omdat minder dan 99% van de verzoeken slaagt. Voor de rate sweep ontbreekt brondata; daaruit volgt geen conclusie over lage capaciteit.

## Specificaties

- Vendor: nvidia
- Architectuur: MoE
- Parameters: 30B-A3B
- Precisie: FP8
- Context: 256K
- Gemeten op: 128K
- VRAM: 33 GB
- Engine: vLLM v0.26.0
- Hardware: DGX Spark, NVIDIA GB10, 128 GB unified memory
- Model card: https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

## Quality (model-cards)

Alleen ter referentie. De harnesses en dekking verschillen per model; deze cijfers tellen niet mee in de hardware-score.

Bron: https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

| Benchmark | Score |
| --- | --- |
| Kennis | niet gepubliceerd |
| Redeneren | niet gepubliceerd |
| Code | niet gepubliceerd |

## Benchmarks op de DGX Spark

Alleen complete runs zonder mislukte sanity-check tellen mee. Open-looptests vereisen minimaal 99% request success. Ruwe resultaten blijven zichtbaar.

| Test | tokens/s p/user | tokens/s totaal | TTFT (ms) | Request success | Ranking |
| --- | --- | --- | --- | --- | --- |
| 01 Chat | 17 | 145 | 1416 | n/a | telt mee |
| 02 RAG · 8k context | 13 | 117 | 5156 | n/a | telt mee |
| 03 Lange output en agents | 19 | 121 | 863 | n/a | telt mee |
| 04 Multi-turn kantoorwerk | 15 | 137 | 1998 | n/a | telt mee |
| 05 Grote context · 25k | 10 | 63 | 14318 | n/a | telt mee |
| 06 Gelijktijdigheid onder druk | 6 | 71 | 26828 | n/a | telt mee |
| 07 Realistische kantoor-baseline | 54 | 1296.56 | 1280 | 100% | telt mee |
| 08 Echte gesprekken · ShareGPT | 13 | 131.46 | 196 | 100% | telt mee |
| 09 Reasoning-workload | 8 | 379.18 | 816 | 100% | telt mee |
| 10 Maandagochtendpiek | 65 | n/a | 1225 | 66% | uitgesloten (request_success_below_threshold) |
| 11 Capaciteit · rate sweep | n/a | n/a | n/a | n/a | uitgesloten (missing) |

## Noten

Model-ID: nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-06T03:41:08+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling uit. Extra serverflags: --trust-remote-code --max-num-seqs 256 --max-num-batched-tokens 8192 --video-pruning-rate 0.5 --reasoning-parser nemotron_v3 --enable-auto-tool-choice --tool-call-parser qwen3_coder. 9 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt. Geen brondata voor: 11-rate-sweep.

---

Licentie: CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/). Django de Vreng, https://djangodevreng.nl.
Volledige arena: https://djangodevreng.nl/arena/ · Ruwe runs (GitHub): https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/fp8/
