---
title: Nemotron-3 Nano Omni 30B-A3B (NVFP4) · DGX Spark Arena
canonical: https://djangodevreng.nl/fr/arena/nemotron-3-nano-omni-30b-a3b-reasoning-nvfp4/
license: CC-BY-4.0
source: https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/nvfp4/
source_revision: a948cec23b054c62fef595bad3cdb284066922ac
contract_version: 1
suite_version: 2026-08
minimum_request_success_rate: 0.99
sanity_status: not_recorded
attribution: Django de Vreng, https://djangodevreng.nl
---

# Nemotron-3 Nano Omni 30B-A3B (NVFP4)

Mesuré le 2026-08-07 avec vLLM v0.26.0. Dans le test de chat avec dix requêtes simultanées, ce profil atteint 23,94 tokens/s par utilisateur, avec en moyenne 1,48 secondes jusqu&#39;au premier token. À 25k de contexte, cette attente moyenne monte à 17,38 secondes. Ces runs mesurent la vitesse et l&#39;attente, pas la qualité des réponses.

## Spécifications

- Fournisseur: nvidia
- Architecture: MoE
- Paramètres: 30B-A3B
- Précision: NVFP4
- Contexte: 256K
- Contexte testé: 128K
- VRAM: 21.0 GB
- Moteur: vLLM v0.26.0
- Matériel: DGX Spark, NVIDIA GB10, 128 GB unified memory
- Fiche modèle: https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4
## Qualité (fiches modèles)

Connaissances : MMLU-Pro ; raisonnement : GPQA-Diamond ; code : LiveCodeBench v6. Chaque chiffre indique son test exact. Les autres tests et les mesures absentes ne permettent pas de score total. Ces chiffres externes ne sont pas notre propre évaluation de cette précision.

https://huggingface.co/nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4

| Benchmark | Score |
| --- | --- |
|  | — |
|  | — |
|  | — |
## Benchmarks sur le DGX Spark

Seules les exécutions complètes sans échec de cohérence comptent. Les tests en boucle ouverte exigent au moins 99 % de réussite. Les résultats bruts restent visibles.

| Test | tokens/s par utilisateur | tokens/s au total | TTFT (ms) | Réussite | Classement |
| --- | --- | --- | --- | --- | --- |
| 01 Translation missing: fr.arena_copy.benches.chat.name | 23.94 | 219.0 | 1475.0 | — | Inclus |
| 02 Translation missing: fr.arena_copy.benches.rag-8k.name | 19.73 | 153.0 | 5974.0 | — | Inclus |
| 03 Translation missing: fr.arena_copy.benches.long-output.name | 29.15 | 159.0 | 821.0 | — | Inclus |
| 04 Translation missing: fr.arena_copy.benches.multi-turn.name | 23.6 | 207.0 | 2143.0 | — | Inclus |
| 05 Translation missing: fr.arena_copy.benches.big-context.name | 11.66 | 62.0 | 17378.0 | — | Inclus |
| 06 Translation missing: fr.arena_copy.benches.concurrency-stress.name | 7.21 | 68.0 | 32651.000000000004 | — | Inclus |
| 07 Translation missing: fr.arena_copy.benches.office-baseline.name | 88.596 | 1328.94 | 1088.79 | 100.0% | Inclus |
| 08 Translation missing: fr.arena_copy.benches.sharegpt.name | 14.586666666666666 | 131.28 | 130.0 | 100.0% | Inclus |
| 09 Translation missing: fr.arena_copy.benches.reasoning.name | 16.12514285714286 | 564.38 | 587.71 | 100.0% | Inclus |
| 10 Translation missing: fr.arena_copy.benches.monday-peak.name | 87.04222222222222 | 2350.14 | 1005.05 | 100.0% | Inclus |
| 11 Translation missing: fr.arena_copy.benches.rate-sweep.name | — | — | — | 100.0% | Exécution incomplète |
## Notes

Model-ID: nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Run source: 2026-08-07T12:24:23+02:00. KV-cache auto; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching désactivé; async scheduling désactivé. Options serveur supplémentaires: --trust-remote-code --max-num-seqs 256 --max-num-batched-tokens 8192 --video-pruning-rate 0.5 --reasoning-parser nemotron_v3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --moe-backend marlin. 10 des 11 tests ont une mesure qui compte selon les règles actuelles de l'Arena. Aucun contrôle de cohérence n'a été enregistré pour ce run historique. Cette preuve manque, même lorsque la mesure de vitesse compte selon les règles actuelles. Interrompu : 11-rate-sweep.

---

CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/). Django de Vreng, https://djangodevreng.nl.
Arena complète: https://djangodevreng.nl/fr/arena/
Exécutions brutes (GitHub): https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/nemotron-3/nemotron-3-nano-omni-30b-a3b-reasoning/nvfp4/
Source JSON: https://djangodevreng.nl/fr/arena/nemotron-3-nano-omni-30b-a3b-reasoning-nvfp4/source.json
