{"name":"Qwen-3.5-0.8B","aaUrl":"https://artificialanalysis.ai/models/qwen3-5-0-8b","arena":{"id":"qwen-3.5-0.8b-bf16","name":"Qwen-3.5 0.8B","vram":2,"params":0.8,"vendor":"alibaba","quality":{"coding":null,"science":{"bench":"GPQA","value":11.9},"knowledge":{"bench":"MMLU-Pro","value":29.7}},"contextK":256},"notes":"Model-ID: Qwen/Qwen3.5-0.8B. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-07T09:22:46+02:00. KV-cache fp8_e4m3; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling uit. Extra serverflags: --language-model-only --reasoning-parser qwen3 --trust-remote-code. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","order":7,"engine":"vLLM v0.26.0","verdict":"Gemeten op 2026-08-07 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 102,13 tokens/s per gebruiker, met gemiddeld 0,23 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 5,85 seconden. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","findings":{"broke":{"body":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 5,85 seconden. Daarna genereert het model gemiddeld 35,85 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.","title":"Wachttijd bij 25k context"},"costly":{"body":"De run verwerkt 1,44 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 0,45 seconden.","title":"Verzoeken en wachttijd bij piekbelasting"},"worked":{"body":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 102,13 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 0,23 seconden.","title":"Chat bij tien gelijktijdige verzoeken"},"surprised":{"body":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","title":"Welke metingen meetellen"}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/Qwen/Qwen3.5-0.8B","provider":"Alibaba","precision":"BF16","parameters":"0.8B","provenance":{"modelId":"Qwen/Qwen3.5-0.8B","runPath":"results/qwen-3.5/qwen-3.5-0.8b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"captured_unreviewed"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","servedName":"qwen3.5-0.8b-bf16","generatedAt":"2026-08-07T09:22:46+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"Hybrid","measuredContextK":128,"benchmarkResults":[{"id":"qwen-3-5-0-8b-bf16-chat-1k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.234,"stddev":0.1},"decodeTokensPerSecondTotal":{"mean":563.69,"stddev":95.41},"prefillTokensPerSecondTotal":{"mean":25275.46,"stddev":92.37},"decodeTokensPerSecondPerUser":{"mean":102.13,"stddev":11.34}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","workloadId":"chat-1k","sourceLabel":"Qwen/Qwen3.5-0.8B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"qwen-3-5-0-8b-bf16-rag-8k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":1.63,"stddev":0.821},"decodeTokensPerSecondTotal":{"mean":585.46,"stddev":14.38},"prefillTokensPerSecondTotal":{"mean":25630.23,"stddev":67.65},"decodeTokensPerSecondPerUser":{"mean":73.74,"stddev":9.22}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","workloadId":"rag-8k","sourceLabel":"Qwen/Qwen3.5-0.8B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"qwen-3-5-0-8b-bf16-long-output-agents","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.119,"stddev":0.022},"decodeTokensPerSecondTotal":{"mean":484.16,"stddev":133.75},"prefillTokensPerSecondTotal":{"mean":17603.93,"stddev":1483.51},"decodeTokensPerSecondPerUser":{"mean":105.89,"stddev":3.61}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","workloadId":"long-output-agents","sourceLabel":"Qwen/Qwen3.5-0.8B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"qwen-3-5-0-8b-bf16-multi-turn-office","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.417,"stddev":0.205},"decodeTokensPerSecondTotal":{"mean":756.71,"stddev":19.93},"prefillTokensPerSecondTotal":{"mean":26510.42,"stddev":55.88},"decodeTokensPerSecondPerUser":{"mean":95.6,"stddev":4.98}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","workloadId":"multi-turn-office","sourceLabel":"Qwen/Qwen3.5-0.8B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"qwen-3-5-0-8b-bf16-large-context-25k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":5.854,"stddev":3.052},"decodeTokensPerSecondTotal":{"mean":181.65,"stddev":7.3},"prefillTokensPerSecondTotal":{"mean":21216.42,"stddev":44.41},"decodeTokensPerSecondPerUser":{"mean":35.85,"stddev":17}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","workloadId":"large-context-25k","sourceLabel":"Qwen/Qwen3.5-0.8B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"qwen-3-5-0-8b-bf16-concurrency-stress-25k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":11.497,"stddev":6.47},"decodeTokensPerSecondTotal":{"mean":195.74,"stddev":3.4},"prefillTokensPerSecondTotal":{"mean":20262.35,"stddev":18.36},"decodeTokensPerSecondPerUser":{"mean":22.56,"stddev":12.46}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"Qwen/Qwen3.5-0.8B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"qwen-3-5-0-8b-bf16-office-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":4543.96,"p90":7913.53,"p95":8395.82,"p99":8814.11,"mean":4586.04},"tpotMs":{"p50":8.85,"p90":9.86,"p95":10.33,"p99":11.42,"mean":9.04},"ttftMs":{"p50":213.17,"p90":354.52,"p95":381.62,"p99":500.7,"mean":219.19}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","scenarioId":"office-random-4k","achievedRps":0.299,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1361.87,"peakConcurrentRequests":6},{"id":"qwen-3-5-0-8b-bf16-sharegpt-replay","date":"2026-08-07","metrics":{"e2eMs":{"p50":1103.98,"p90":4142.98,"p95":5470.4,"p99":6789.68,"mean":1703.93},"tpotMs":{"p50":8.49,"p90":8.74,"p95":8.83,"p99":9.24,"mean":8.45},"ttftMs":{"p50":35.69,"p90":48.48,"p95":51.4,"p99":69.59,"mean":35.83}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.3,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":129.14,"peakConcurrentRequests":6},{"id":"qwen-3-5-0-8b-bf16-reasoning","date":"2026-08-07","metrics":{"e2eMs":{"p50":41743.47,"p90":69155,"p95":73056.27,"p99":80462.97,"mean":43059.91},"tpotMs":{"p50":10.44,"p90":11.1,"p95":11.22,"p99":11.39,"mean":10.31},"ttftMs":{"p50":82.11,"p90":110.81,"p95":115,"p99":116.56,"mean":80.36}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","scenarioId":"reasoning","achievedRps":0.166,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":880.37,"peakConcurrentRequests":14},{"id":"qwen-3-5-0-8b-bf16-monday-peak-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":7034.11,"p90":12566.26,"p95":13706.77,"p99":14858.65,"mean":7260.5},"tpotMs":{"p50":14.12,"p90":16.83,"p95":17.94,"p99":20.61,"mean":14.13},"ttftMs":{"p50":251.92,"p90":406.47,"p95":447.72,"p99":558.5,"mean":256.09}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":1.436,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":6473.57,"peakConcurrentRequests":22}],"rateSweep":{"date":"2026-08-07","capacity":{"slo2000":{"outputTps":477.4,"ttftP95Ms":520.6,"achievedRps":0.97,"configuredRps":1,"peakConcurrent":14},"slo5000":{"outputTps":477.4,"ttftP95Ms":520.6,"achievedRps":0.97,"configuredRps":1,"peakConcurrent":14},"slo10000":{"outputTps":477.4,"ttftP95Ms":520.6,"achievedRps":0.97,"configuredRps":1,"peakConcurrent":14}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-0.8b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}