{"name":"Qwen-3.5-2B","arena":{"id":"qwen-3.5-2b-bf16","name":"Qwen-3.5 2B","vram":4,"params":2,"vendor":"alibaba","quality":{"coding":null,"science":{"bench":"SuperGPQA","value":30.4},"knowledge":{"bench":"MMLU-Pro","value":55.3}},"contextK":256},"notes":"Model-ID: Qwen/Qwen3.5-2B. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-07T14:29:47+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --language-model-only --reasoning-parser qwen3 --trust-remote-code. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","order":12,"engine":"vLLM v0.26.0","vramGb":4,"verdict":"Gemeten op 2026-08-07 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 50,02 tokens/s per gebruiker, met gemiddeld 0,43 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 9,2 seconden. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","findings":{"broke":{"body":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 9,2 seconden. Daarna genereert het model gemiddeld 21,52 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.","title":"Wachttijd bij 25k context"},"costly":{"body":"De run verwerkt 1,18 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 0,78 seconden.","title":"Verzoeken en wachttijd bij piekbelasting"},"worked":{"body":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 50,02 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 0,43 seconden.","title":"Chat bij tien gelijktijdige verzoeken"},"surprised":{"body":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","title":"Welke metingen meetellen"}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/Qwen/Qwen3.5-2B","provider":"Alibaba","precision":"BF16","parameters":"2B","provenance":{"modelId":"Qwen/Qwen3.5-2B","runPath":"results/qwen-3.5/qwen-3.5-2b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"captured_unreviewed"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","servedName":"qwen3.5-2b-bf16","generatedAt":"2026-08-07T14:29:47+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"Hybrid","measuredContextK":128,"benchmarkResults":[{"id":"qwen-3-5-2b-bf16-chat-1k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.435,"stddev":0.173},"decodeTokensPerSecondTotal":{"mean":321.02,"stddev":32.52},"prefillTokensPerSecondTotal":{"mean":14109.39,"stddev":186.89},"decodeTokensPerSecondPerUser":{"mean":50.02,"stddev":1.63}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","workloadId":"chat-1k","sourceLabel":"Qwen/Qwen3.5-2B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"qwen-3-5-2b-bf16-rag-8k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":2.738,"stddev":1.373},"decodeTokensPerSecondTotal":{"mean":285.94,"stddev":11.29},"prefillTokensPerSecondTotal":{"mean":15252.82,"stddev":30.56},"decodeTokensPerSecondPerUser":{"mean":38.29,"stddev":9.37}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","workloadId":"rag-8k","sourceLabel":"Qwen/Qwen3.5-2B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"qwen-3-5-2b-bf16-long-output-agents","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.199,"stddev":0.037},"decodeTokensPerSecondTotal":{"mean":245.19,"stddev":23.02},"prefillTokensPerSecondTotal":{"mean":10190.99,"stddev":241.39},"decodeTokensPerSecondPerUser":{"mean":51.62,"stddev":1}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","workloadId":"long-output-agents","sourceLabel":"Qwen/Qwen3.5-2B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"qwen-3-5-2b-bf16-multi-turn-office","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":0.712,"stddev":0.353},"decodeTokensPerSecondTotal":{"mean":379.25,"stddev":41.99},"prefillTokensPerSecondTotal":{"mean":15449.62,"stddev":29.94},"decodeTokensPerSecondPerUser":{"mean":47.9,"stddev":2.22}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","workloadId":"multi-turn-office","sourceLabel":"Qwen/Qwen3.5-2B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"qwen-3-5-2b-bf16-large-context-25k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":9.198,"stddev":4.749},"decodeTokensPerSecondTotal":{"mean":106.24,"stddev":10.13},"prefillTokensPerSecondTotal":{"mean":13579.09,"stddev":11.71},"decodeTokensPerSecondPerUser":{"mean":21.52,"stddev":9.91}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","workloadId":"large-context-25k","sourceLabel":"Qwen/Qwen3.5-2B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"qwen-3-5-2b-bf16-concurrency-stress-25k","date":"2026-08-07","runs":3,"metrics":{"ttfrSec":{"mean":17.847,"stddev":9.926},"decodeTokensPerSecondTotal":{"mean":118.21,"stddev":1.85},"prefillTokensPerSecondTotal":{"mean":13159.56,"stddev":49.55},"decodeTokensPerSecondPerUser":{"mean":14.29,"stddev":7.8}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"Qwen/Qwen3.5-2B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"qwen-3-5-2b-bf16-office-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":10205.85,"p90":18055.49,"p95":19268.22,"p99":20516.79,"mean":10433.82},"tpotMs":{"p50":20.55,"p90":22.69,"p95":23.67,"p99":24.74,"mean":20.72},"ttftMs":{"p50":371.26,"p90":648.08,"p95":732.38,"p99":906.84,"mean":390.75}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","scenarioId":"office-random-4k","achievedRps":0.297,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1354.58,"peakConcurrentRequests":10},{"id":"qwen-3-5-2b-bf16-sharegpt-replay","date":"2026-08-07","metrics":{"e2eMs":{"p50":2687.85,"p90":9665.64,"p95":13109.16,"p99":17150.59,"mean":4069.74},"tpotMs":{"p50":18.91,"p90":23.32,"p95":23.48,"p99":23.65,"mean":19.79},"ttftMs":{"p50":73.05,"p90":106.6,"p95":115.38,"p99":178.28,"mean":75.33}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.299,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":129.93,"peakConcurrentRequests":7},{"id":"qwen-3-5-2b-bf16-reasoning","date":"2026-08-07","metrics":{"e2eMs":{"p50":99751.1,"p90":166180.81,"p95":182824.51,"p99":192682.17,"mean":103766.06},"tpotMs":{"p50":25.52,"p90":27.08,"p95":27.17,"p99":27.26,"mean":24.78},"ttftMs":{"p50":141.85,"p90":191.3,"p95":194.4,"p99":210.93,"mean":143.56}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","scenarioId":"reasoning","achievedRps":0.127,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":671.48,"peakConcurrentRequests":24},{"id":"qwen-3-5-2b-bf16-monday-peak-random-4k","date":"2026-08-07","metrics":{"e2eMs":{"p50":19366.15,"p90":35142.08,"p95":36529.36,"p99":37990.85,"mean":19642.26},"tpotMs":{"p50":39.08,"p90":41.4,"p95":42.65,"p99":45.53,"mean":38.49},"ttftMs":{"p50":432.44,"p90":681.42,"p95":780.18,"p99":983.67,"mean":438.12}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":1.182,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":5328.18,"peakConcurrentRequests":29}],"rateSweep":{"date":"2026-08-07","capacity":{"slo2000":{"outputTps":457,"ttftP95Ms":1041.8,"achievedRps":0.929,"configuredRps":1,"peakConcurrent":26},"slo5000":{"outputTps":457,"ttftP95Ms":1041.8,"achievedRps":0.929,"configuredRps":1,"peakConcurrent":26},"slo10000":{"outputTps":457,"ttftP95Ms":1041.8,"achievedRps":0.929,"configuredRps":1,"peakConcurrent":26}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.5/qwen-3.5-2b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}