{"name":"Qwen-3.5-9B","arena":{"id":"qwen-3.5-9b-bf16","name":"Qwen-3.5 9B","vram":18,"params":9,"vendor":"alibaba","quality":{"coding":{"bench":"LiveCodeBench v6","value":65.6},"science":{"bench":"GPQA-Diamond","value":81.7},"knowledge":{"bench":"MMLU-Pro","value":82.5}},"contextK":256},"notes":{"en":"BF16 without quantisation, dense 9B, roughly 18 GB of weights. KV cache fp8, max_model_len 131072 (model-native 256k). Async scheduling on, prefix caching off, gpu-util 0.95. Runs on vLLM v0.20.1, older than the v23 runs elsewhere in this arena, so compare throughput figures with that in mind.","fr":"BF16 sans quantisation, dense 9B, environ 18 GB de poids. Cache KV fp8, max_model_len 131072 (natif 256k). Async scheduling activé, prefix caching désactivé, gpu-util 0.95. Tourne sur vLLM v0.20.1, plus ancien que les runs v23 ailleurs dans cette arène, donc comparez les chiffres de débit en gardant cela à l'esprit.","nl":"Model-ID: Qwen/Qwen3.5-9B. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-07T19:26:30+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --language-model-only --reasoning-parser qwen3 --trust-remote-code. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd."},"order":20,"engine":"vLLM v0.26.0","vramGb":18,"verdict":{"en":"The best quality per parameter in this arena, and you pay for it in throughput. MMLU-Pro 82.5 and GPQA-Diamond 81.7 out of nine billion parameters beats Nemotron-3-Nano 30B-A3B (77.3) and comes close to Gemma-4 26B, while this model is a third of the size. The bill arrives at decode: dense BF16 means all nine billion parameters take part in every token, so you sit at 12.7 tokens per user on chat where the MoE models clear twenty. On the office baseline the queue grows to twenty-six and the median TTFT reaches 1.7 seconds. At 25k context with ten concurrent users it gets genuinely heavy: 6.2 tokens per user and 35 seconds to first token. Interesting when quality matters more than speed and your user count stays low, or as a stepping stone before you move to a quantised variant.","fr":"Le meilleur rapport qualité par paramètre de cette arène, et vous le payez en débit. MMLU-Pro 82.5 et GPQA-Diamond 81.7 pour neuf milliards de paramètres dépasse Nemotron-3-Nano 30B-A3B (77.3) et s'approche de Gemma-4 26B, alors que ce modèle fait un tiers de la taille. La facture arrive au decode : le BF16 dense signifie que les neuf milliards de paramètres participent à chaque token, donc vous êtes à 12.7 tokens par utilisateur en chat là où les MoE dépassent vingt. Sur la baseline bureau la file monte à vingt-six et la médiane TTFT atteint 1.7 seconde. À 25k de contexte avec dix utilisateurs simultanés cela devient vraiment lourd : 6.2 tokens par utilisateur et 35 secondes jusqu'au premier token. Intéressant quand la qualité compte plus que la vitesse et que votre nombre d'utilisateurs reste bas, ou comme étape avant de passer à une variante quantisée.","nl":"Gemeten op 2026-08-07 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 12,51 tokens/s per gebruiker, met gemiddeld 1,82 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 37,12 seconden. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd."},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/Qwen/Qwen3.5-9B","provider":"Alibaba","precision":"BF16","parameters":"9B","provenance":{"modelId":"Qwen/Qwen3.5-9B","runPath":"results/qwen-3.5/qwen-3.5-9b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"captured_unreviewed"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","servedName":"qwen3.5-9b-bf16","generatedAt":"2026-08-07T19:26:30+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"Dense","measuredContextK":128,"benchmarkResults":[{"id":"qwen-3-5-9b-bf16-chat-1k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":1.823,"stddev":0.924},"decodeTokensPerSecondTotal":{"mean":122.57,"stddev":0.67},"prefillTokensPerSecondTotal":{"mean":3180.06,"stddev":426.1},"decodeTokensPerSecondPerUser":{"mean":12.51,"stddev":0.13}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","workloadId":"chat-1k","sourceLabel":"Qwen/Qwen3.5-9B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"qwen-3-5-9b-bf16-rag-8k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":11.334,"stddev":5.693},"decodeTokensPerSecondTotal":{"mean":84.2,"stddev":0.57},"prefillTokensPerSecondTotal":{"mean":3679.23,"stddev":19.8},"decodeTokensPerSecondPerUser":{"mean":10.25,"stddev":1}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","workloadId":"rag-8k","sourceLabel":"Qwen/Qwen3.5-9B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"qwen-3-5-9b-bf16-long-output-agents","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.637,"stddev":0.169},"decodeTokensPerSecondTotal":{"mean":123.09,"stddev":1.77},"prefillTokensPerSecondTotal":{"mean":3016.74,"stddev":41.64},"decodeTokensPerSecondPerUser":{"mean":12.55,"stddev":0.02}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","workloadId":"long-output-agents","sourceLabel":"Qwen/Qwen3.5-9B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"qwen-3-5-9b-bf16-multi-turn-office","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":3.131,"stddev":1.539},"decodeTokensPerSecondTotal":{"mean":113.14,"stddev":0.1},"prefillTokensPerSecondTotal":{"mean":3582.87,"stddev":222.57},"decodeTokensPerSecondPerUser":{"mean":12.07,"stddev":0.36}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","workloadId":"multi-turn-office","sourceLabel":"Qwen/Qwen3.5-9B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"qwen-3-5-9b-bf16-large-context-25k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":37.117,"stddev":19.314},"decodeTokensPerSecondTotal":{"mean":30.44,"stddev":0.15},"prefillTokensPerSecondTotal":{"mean":3354.25,"stddev":4.07},"decodeTokensPerSecondPerUser":{"mean":5.91,"stddev":2.35}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","workloadId":"large-context-25k","sourceLabel":"Qwen/Qwen3.5-9B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"qwen-3-5-9b-bf16-concurrency-stress-25k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":71.438,"stddev":39.733},"decodeTokensPerSecondTotal":{"mean":32.35,"stddev":0.05},"prefillTokensPerSecondTotal":{"mean":3288.25,"stddev":4.03},"decodeTokensPerSecondPerUser":{"mean":3.82,"stddev":2.07}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"Qwen/Qwen3.5-9B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"qwen-3-5-9b-bf16-office-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":67495.67,"p90":115984.57,"p95":130975.08,"p99":141732.26,"mean":68105.8},"tpotMs":{"p50":140.74,"p90":159.77,"p95":172.77,"p99":193.33,"mean":137.95},"ttftMs":{"p50":1865.02,"p90":3803.38,"p95":4280.11,"p99":5143.46,"mean":2061.18}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","scenarioId":"office-random-4k","achievedRps":0.272,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1239.7,"peakConcurrentRequests":33},{"id":"qwen-3-5-9b-bf16-sharegpt-replay","date":"2026-08-07","metrics":{"e2eMs":{"p50":10726.82,"p90":38349.06,"p95":49610.17,"p99":62852.06,"mean":16248.35},"tpotMs":{"p50":75.73,"p90":78.29,"p95":80.21,"p99":92.06,"mean":76.37},"ttftMs":{"p50":250.96,"p90":371.59,"p95":412.76,"p99":448.68,"mean":268.41}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.291,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":128.26,"peakConcurrentRequests":14},{"id":"qwen-3-5-9b-bf16-reasoning","date":"2026-08-07","metrics":{"e2eMs":{"p50":448958.87,"p90":699329.48,"p95":761223.16,"p99":782337.38,"mean":460885.23},"tpotMs":{"p50":111.57,"p90":118.19,"p95":118.77,"p99":120.44,"mean":110.87},"ttftMs":{"p50":530.55,"p90":679.41,"p95":719.19,"p99":835.97,"mean":524.06}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","scenarioId":"reasoning","achievedRps":0.053,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":280.27,"peakConcurrentRequests":46},{"id":"qwen-3-5-9b-bf16-monday-peak-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":72840.69,"p90":133020.2,"p95":138382.44,"p99":146652.15,"mean":75454.28},"tpotMs":{"p50":148.67,"p90":160.75,"p95":169.32,"p99":196.61,"mean":148.53},"ttftMs":{"p50":1650.73,"p90":2992.42,"p95":5591.39,"p99":14331.86,"mean":2118.73}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":0.318,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":1430.83,"peakConcurrentRequests":29}],"rateSweep":{"date":"2026-08-07","capacity":{"slo2000":null,"slo5000":{"outputTps":120.1,"ttftP95Ms":4512.1,"achievedRps":0.244,"configuredRps":0.3,"peakConcurrent":26},"slo10000":{"outputTps":229.3,"ttftP95Ms":9335.3,"achievedRps":0.469,"configuredRps":0.7,"peakConcurrent":129}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-9b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}