---
title: gpt-oss-20b (MXFP4) · DGX Spark Arena
canonical: https://djangodevreng.nl/fr/arena/gpt-oss-20b-mxfp4/
license: CC-BY-4.0
source: https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gpt-oss/gpt-oss-20b/mxfp4/
source_revision: a948cec23b054c62fef595bad3cdb284066922ac
contract_version: 1
suite_version: 2026-08
minimum_request_success_rate: 0.99
sanity_status: passed
attribution: Django de Vreng, https://djangodevreng.nl
---

# gpt-oss-20b (MXFP4)

Vingt et un milliards de paramètres qui se comportent comme un modèle de quatre milliards en débit.

Mesuré le 2026-08-14 avec vLLM v0.26.0. Dans le test de chat avec dix requêtes simultanées, ce profil atteint 24,06 tokens/s par utilisateur, avec en moyenne 0,88 secondes jusqu&#39;au premier token. À 25k de contexte, cette attente moyenne monte à 26,28 secondes. Ces runs mesurent la vitesse et l&#39;attente, pas la qualité des réponses.

## Spécifications

- Fournisseur: OpenAI
- Architecture: MoE
- Paramètres: 21B (3.6B actief)
- Précision: MXFP4
- Contexte: 128K
- Contexte testé: 128K
- VRAM: 14.0 GB
- Moteur: vLLM v0.26.0
- Matériel: DGX Spark, NVIDIA GB10, 128 GB unified memory
- Fiche modèle: https://huggingface.co/openai/gpt-oss-20b
## Qualité (fiches modèles)

Connaissances : MMLU-Pro ; raisonnement : GPQA-Diamond ; code : LiveCodeBench v6. Chaque chiffre indique son test exact. Les autres tests et les mesures absentes ne permettent pas de score total. Ces chiffres externes ne sont pas notre propre évaluation de cette précision.

https://huggingface.co/openai/gpt-oss-20b

| Benchmark | Score |
| --- | --- |
|  | — |
| MMLU | 85.3 |
| GPQA-Diamond | 71.5 |
## Benchmarks sur le DGX Spark

Seules les exécutions complètes sans échec de cohérence comptent. Les tests en boucle ouverte exigent au moins 99 % de réussite. Les résultats bruts restent visibles.

| Test | tokens/s par utilisateur | tokens/s au total | TTFT (ms) | Réussite | Classement |
| --- | --- | --- | --- | --- | --- |
| 01 Translation missing: fr.arena_copy.benches.chat.name | 24.06 | 180.0 | 878.0 | — | Inclus |
| 02 Translation missing: fr.arena_copy.benches.rag-8k.name | 22.03 | 162.0 | 6113.0 | — | Inclus |
| 03 Translation missing: fr.arena_copy.benches.long-output.name | 23.56 | 204.0 | 287.0 | — | Inclus |
| 04 Translation missing: fr.arena_copy.benches.multi-turn.name | 24.98 | 141.0 | 1637.0 | — | Inclus |
| 05 Translation missing: fr.arena_copy.benches.big-context.name | 9.79 | 44.0 | 26283.0 | — | Inclus |
| 06 Translation missing: fr.arena_copy.benches.concurrency-stress.name | 5.76 | 48.0 | 50054.0 | — | Inclus |
| 07 Translation missing: fr.arena_copy.benches.office-baseline.name | 93.94285714285715 | 1315.2 | 764.7 | 100.0% | Inclus |
| 08 Translation missing: fr.arena_copy.benches.sharegpt.name | 15.344444444444443 | 138.1 | 120.18 | 100.0% | Inclus |
| 09 Translation missing: fr.arena_copy.benches.reasoning.name | 12.83235294117647 | 436.3 | 256.27 | 100.0% | Inclus |
| 10 Translation missing: fr.arena_copy.benches.monday-peak.name | 99.01178571428571 | 2772.33 | 748.93 | 100.0% | Inclus |
| 11 Translation missing: fr.arena_copy.benches.rate-sweep.name | — | — | — | 100.0% | Inclus |
## Notes

Poids MXFP4 natifs, pas d'étape de quantisation séparée. MoE avec 3.6B de paramètres actifs sur 21B au total. Cache KV fp8, max_model_len 131072. Le MoE Marlin MXFP4 est choisi automatiquement sur SM121. Le profil diffère volontairement du reste : gpu-util 0.90 au lieu de 0.95, max-num-seqs 16 et max-cudagraph-capture-size 2048, car le pic mémoire pendant la capture du graphe CUDA fait tomber la machine sinon. Async scheduling activé, prefix caching désactivé.

---

CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/). Django de Vreng, https://djangodevreng.nl.
Arena complète: https://djangodevreng.nl/fr/arena/
Exécutions brutes (GitHub): https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/gpt-oss/gpt-oss-20b/mxfp4/
Source JSON: https://djangodevreng.nl/fr/arena/gpt-oss-20b-mxfp4/source.json
