---
title: "Qwen-3.5-0.8B (BF16) · DGX Spark Arena"
canonical: "https://djangodevreng.nl/arena/qwen-3-5-0-8b-bf16/"
license: "CC-BY-4.0"
source: "https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/"
source_revision: "a948cec23b054c62fef595bad3cdb284066922ac"
contract_version: 1
suite_version: "2026-08"
minimum_request_success_rate: 0.99
sanity_status: "captured_unreviewed"
attribution: "Django de Vreng, https://djangodevreng.nl"
---

# Qwen-3.5-0.8B (BF16)

Gemeten op 2026-08-07 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 102,13 tokens/s per gebruiker, met gemiddeld 0,23 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 5,85 seconden. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.

## Specificaties

- Vendor: Alibaba
- Architectuur: Hybrid
- Parameters: 0.8B
- Precisie: BF16
- Context: 256K
- Gemeten op: 128K
- VRAM: 2 GB
- Engine: vLLM v0.26.0
- Hardware: DGX Spark, NVIDIA GB10, 128 GB unified memory
- Model card: https://huggingface.co/Qwen/Qwen3.5-0.8B

## Quality (model-cards)

Alleen ter referentie. De harnesses en dekking verschillen per model; deze cijfers tellen niet mee in de hardware-score.

Bron: https://huggingface.co/Qwen/Qwen3.5-0.8B

| Benchmark | Score |
| --- | --- |
| MMLU-Pro | 29.7 |
| GPQA | 11.9 |
| Code | niet gepubliceerd |

## Benchmarks op de DGX Spark

Alleen complete runs zonder mislukte sanity-check tellen mee. Open-looptests vereisen minimaal 99% request success. Ruwe resultaten blijven zichtbaar.

| Test | tokens/s p/user | tokens/s totaal | TTFT (ms) | Request success | Ranking |
| --- | --- | --- | --- | --- | --- |
| 01 Chat | 102 | 564 | 234 | n/a | telt mee |
| 02 RAG · 8k context | 74 | 585 | 1630 | n/a | telt mee |
| 03 Lange output en agents | 106 | 484 | 119 | n/a | telt mee |
| 04 Multi-turn kantoorwerk | 96 | 757 | 417 | n/a | telt mee |
| 05 Grote context · 25k | 36 | 182 | 5854 | n/a | telt mee |
| 06 Gelijktijdigheid onder druk | 23 | 196 | 11497 | n/a | telt mee |
| 07 Realistische kantoor-baseline | 227 | 1361.87 | 213 | 100% | telt mee |
| 08 Echte gesprekken · ShareGPT | 22 | 129.14 | 36 | 100% | telt mee |
| 09 Reasoning-workload | 63 | 880.37 | 82 | 100% | telt mee |
| 10 Maandagochtendpiek | 294 | 6473.57 | 252 | 100% | telt mee |
| 11 Capaciteit · rate sweep | n/a | n/a | n/a | 100% | telt mee |

## Toelichting op deze run

**Chat: Chat bij tien gelijktijdige verzoeken**

Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 102,13 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 0,23 seconden.

**Lange context: Wachttijd bij 25k context**

Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 5,85 seconden. Daarna genereert het model gemiddeld 35,85 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.

**Piekbelasting: Verzoeken en wachttijd bij piekbelasting**

De run verwerkt 1,44 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 0,45 seconden.

**Meetdekking: Welke metingen meetellen**

11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.

## Noten

Model-ID: Qwen/Qwen3.5-0.8B. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-07T09:22:46+02:00. KV-cache fp8_e4m3; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling uit. Extra serverflags: --language-model-only --reasoning-parser qwen3 --trust-remote-code. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.

---

Licentie: CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/). Django de Vreng, https://djangodevreng.nl.
Volledige arena: https://djangodevreng.nl/arena/ · Ruwe runs (GitHub): https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/
