---
title: Qwen-3.5-9B (BF16) · DGX Spark Arena
canonical: https://djangodevreng.nl/fr/arena/qwen-3-5-9b-bf16/
license: CC-BY-4.0
source: https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/
source_revision: a948cec23b054c62fef595bad3cdb284066922ac
contract_version: 1
suite_version: 2026-08
minimum_request_success_rate: 0.99
sanity_status: captured_unreviewed
attribution: Django de Vreng, https://djangodevreng.nl
---

# Qwen-3.5-9B (BF16)

La meilleure qualité par paramètre de cette arène, et cela se paie en débit.

Mesuré le 2026-08-07 avec vLLM v0.26.0. Dans le test de chat avec dix requêtes simultanées, ce profil atteint 12,51 tokens/s par utilisateur, avec en moyenne 1,82 secondes jusqu&#39;au premier token. À 25k de contexte, cette attente moyenne monte à 37,12 secondes. Ces runs mesurent la vitesse et l&#39;attente, pas la qualité des réponses.

## Spécifications

- Fournisseur: Alibaba
- Architecture: Dense
- Paramètres: 9B
- Précision: BF16
- Contexte: 256K
- Contexte testé: 128K
- VRAM: 18.0 GB
- Moteur: vLLM v0.26.0
- Matériel: DGX Spark, NVIDIA GB10, 128 GB unified memory
- Fiche modèle: https://huggingface.co/Qwen/Qwen3.5-9B
## Qualité (fiches modèles)

Connaissances : MMLU-Pro ; raisonnement : GPQA-Diamond ; code : LiveCodeBench v6. Chaque chiffre indique son test exact. Les autres tests et les mesures absentes ne permettent pas de score total. Ces chiffres externes ne sont pas notre propre évaluation de cette précision.

https://huggingface.co/Qwen/Qwen3.5-9B

| Benchmark | Score |
| --- | --- |
| LiveCodeBench v6 | 65.6 |
| MMLU-Pro | 82.5 |
| GPQA-Diamond | 81.7 |
## Benchmarks sur le DGX Spark

Seules les exécutions complètes sans échec de cohérence comptent. Les tests en boucle ouverte exigent au moins 99 % de réussite. Les résultats bruts restent visibles.

| Test | tokens/s par utilisateur | tokens/s au total | TTFT (ms) | Réussite | Classement |
| --- | --- | --- | --- | --- | --- |
| 01 Translation missing: fr.arena_copy.benches.chat.name | 12.51 | 123.0 | 1823.0 | — | Inclus |
| 02 Translation missing: fr.arena_copy.benches.rag-8k.name | 10.25 | 84.0 | 11334.0 | — | Inclus |
| 03 Translation missing: fr.arena_copy.benches.long-output.name | 12.55 | 123.0 | 637.0 | — | Inclus |
| 04 Translation missing: fr.arena_copy.benches.multi-turn.name | 12.07 | 113.0 | 3131.0 | — | Inclus |
| 05 Translation missing: fr.arena_copy.benches.big-context.name | 5.91 | 30.0 | 37117.0 | — | Inclus |
| 06 Translation missing: fr.arena_copy.benches.concurrency-stress.name | 3.82 | 32.0 | 71438.0 | — | Inclus |
| 07 Translation missing: fr.arena_copy.benches.office-baseline.name | 37.56666666666667 | 1239.7 | 1865.02 | 100.0% | Inclus |
| 08 Translation missing: fr.arena_copy.benches.sharegpt.name | 9.161428571428571 | 128.26 | 250.96 | 100.0% | Inclus |
| 09 Translation missing: fr.arena_copy.benches.reasoning.name | 6.092826086956522 | 280.27 | 530.55 | 100.0% | Inclus |
| 10 Translation missing: fr.arena_copy.benches.monday-peak.name | 49.33896551724138 | 1430.83 | 1650.73 | 100.0% | Inclus |
| 11 Translation missing: fr.arena_copy.benches.rate-sweep.name | — | — | — | 100.0% | Inclus |
## Notes

BF16 sans quantisation, dense 9B, environ 18 GB de poids. Cache KV fp8, max_model_len 131072 (natif 256k). Async scheduling activé, prefix caching désactivé, gpu-util 0.95. Tourne sur vLLM v0.20.1, plus ancien que les runs v23 ailleurs dans cette arène, donc comparez les chiffres de débit en gardant cela à l'esprit.

---

CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/). Django de Vreng, https://djangodevreng.nl.
Arena complète: https://djangodevreng.nl/fr/arena/
Exécutions brutes (GitHub): https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/
Source JSON: https://djangodevreng.nl/fr/arena/qwen-3-5-9b-bf16/source.json
