{"name":"Qwen-3.6-35B-A3B","aaUrl":"https://artificialanalysis.ai/models/qwen3-6-35b-a3b","arena":{"id":"qwen-3.6-35b-a3b-bf16","name":"Qwen-3.6 35B-A3B","vram":70,"params":35,"vendor":"alibaba","quality":{"coding":{"bench":"LiveCodeBench v6","value":80.4},"science":{"bench":"GPQA-Diamond","value":86},"knowledge":{"bench":"MMLU-Pro","value":85.2}},"contextK":256,"baseModelId":"qwen-3-6-35b-a3b"},"notes":"Model-ID: Qwen/Qwen3.6-35B-A3B. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-08T11:40:01+02:00. KV-cache fp8; max_model_len 131072; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --language-model-only --reasoning-parser qwen3 --trust-remote-code. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","order":10,"engine":"vLLM v0.26.0","verdict":"Gemeten op 2026-08-08 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 8,63 tokens/s per gebruiker, met gemiddeld 1,9 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 38,28 seconden. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","findings":{"broke":{"body":"Bij 25000 inputtokens en 256 outputtokens met tien gelijktijdige verzoeken is de gemiddelde wachttijd voor het eerste token 38,28 seconden. Daarna genereert het model gemiddeld 5,34 tokens/s per gebruiker. De meting alleen toont niet of geheugen, promptverwerking of scheduling de oorzaak van vertraging is.","title":"Wachttijd bij 25k context"},"costly":{"body":"De run verwerkt 0,23 verzoeken/s bij een ingestelde aankomstsnelheid van 1,5 verzoeken/s. 300 van de 300 verzoeken slagen. De p95-wachttijd voor het eerste token is 5,86 seconden.","title":"Verzoeken en wachttijd bij piekbelasting"},"worked":{"body":"Bij 1024 input- en 1024 outputtokens met tien gelijktijdige verzoeken meet ik gemiddeld 8,63 tokens/s per gebruiker. De gemiddelde wachttijd voor het eerste token is 1,9 seconden.","title":"Chat bij tien gelijktijdige verzoeken"},"surprised":{"body":"11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Er is output voor de sanity-check opgeslagen, maar die is nog niet beoordeeld. De huidige telling betekent dus niet dat die controle is geslaagd.","title":"Welke metingen meetellen"}},"hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/Qwen/Qwen3.6-35B-A3B","provider":"Alibaba","precision":"BF16","parameters":"35B (3B active)","provenance":{"modelId":"Qwen/Qwen3.6-35B-A3B","runPath":"results/qwen-3.6/qwen-3.6-35b-a3b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"captured_unreviewed"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","servedName":"qwen3.6-35b-a3b-bf16","generatedAt":"2026-08-08T11:40:01+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"MoE","measuredContextK":128,"benchmarkResults":[{"id":"qwen-3-6-35b-a3b-bf16-chat-1k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":1.903,"stddev":0.707},"decodeTokensPerSecondTotal":{"mean":84.61,"stddev":0.82},"prefillTokensPerSecondTotal":{"mean":3279.72,"stddev":29.82},"decodeTokensPerSecondPerUser":{"mean":8.63,"stddev":0.19}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","workloadId":"chat-1k","sourceLabel":"Qwen/Qwen3.6-35B-A3B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"qwen-3-6-35b-a3b-bf16-rag-8k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":11.775,"stddev":5.908},"decodeTokensPerSecondTotal":{"mean":68.44,"stddev":2.63},"prefillTokensPerSecondTotal":{"mean":3558.83,"stddev":4.69},"decodeTokensPerSecondPerUser":{"mean":7.99,"stddev":0.74}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","workloadId":"rag-8k","sourceLabel":"Qwen/Qwen3.6-35B-A3B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"qwen-3-6-35b-a3b-bf16-long-output-agents","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":0.844,"stddev":0.138},"decodeTokensPerSecondTotal":{"mean":79.15,"stddev":2.16},"prefillTokensPerSecondTotal":{"mean":2460.53,"stddev":104.06},"decodeTokensPerSecondPerUser":{"mean":9.97,"stddev":1.19}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","workloadId":"long-output-agents","sourceLabel":"Qwen/Qwen3.6-35B-A3B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"qwen-3-6-35b-a3b-bf16-multi-turn-office","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":3.178,"stddev":1.506},"decodeTokensPerSecondTotal":{"mean":82.36,"stddev":1.34},"prefillTokensPerSecondTotal":{"mean":3546.42,"stddev":16.79},"decodeTokensPerSecondPerUser":{"mean":8.61,"stddev":0.24}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","workloadId":"multi-turn-office","sourceLabel":"Qwen/Qwen3.6-35B-A3B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"qwen-3-6-35b-a3b-bf16-large-context-25k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":38.277,"stddev":19.796},"decodeTokensPerSecondTotal":{"mean":28.92,"stddev":0.08},"prefillTokensPerSecondTotal":{"mean":3272.19,"stddev":3.17},"decodeTokensPerSecondPerUser":{"mean":5.34,"stddev":2.04}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","workloadId":"large-context-25k","sourceLabel":"Qwen/Qwen3.6-35B-A3B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"qwen-3-6-35b-a3b-bf16-concurrency-stress-25k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":73.974,"stddev":40.709},"decodeTokensPerSecondTotal":{"mean":31.28,"stddev":0.03},"prefillTokensPerSecondTotal":{"mean":3215.6,"stddev":0.36},"decodeTokensPerSecondPerUser":{"mean":3.56,"stddev":1.85}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"Qwen/Qwen3.6-35B-A3B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"qwen-3-6-35b-a3b-bf16-office-random-4k","date":"2026-08-08","metrics":{"e2eMs":{"p50":112658.09,"p90":194567.02,"p95":208586.82,"p99":223181.57,"mean":111815.09},"tpotMs":{"p50":234.27,"p90":254.49,"p95":262.38,"p99":295.35,"mean":229.65},"ttftMs":{"p50":2315.87,"p90":4021.68,"p95":4519.16,"p99":5859.98,"mean":2393.02}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","scenarioId":"office-random-4k","achievedRps":0.259,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1180.07,"peakConcurrentRequests":46},{"id":"qwen-3-6-35b-a3b-bf16-sharegpt-replay","date":"2026-08-08","metrics":{"e2eMs":{"p50":11041.68,"p90":48322.07,"p95":65325.91,"p99":85668.55,"mean":19592.97},"tpotMs":{"p50":89.06,"p90":128.86,"p95":130.59,"p99":142.77,"mean":90.71},"ttftMs":{"p50":389.33,"p90":567.08,"p95":605.34,"p99":722.62,"mean":401.23}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.298,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":131.05,"peakConcurrentRequests":16},{"id":"qwen-3-6-35b-a3b-bf16-reasoning","date":"2026-08-08","metrics":{"e2eMs":{"p50":803042.52,"p90":1162839.63,"p95":1246215.85,"p99":1281821.93,"mean":796299.18},"tpotMs":{"p50":194.99,"p90":218.67,"p95":219.79,"p99":223.49,"mean":194.46},"ttftMs":{"p50":698.41,"p90":907.39,"p95":929.75,"p99":1105.02,"mean":710.09}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","scenarioId":"reasoning","achievedRps":0.036,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":190.97,"peakConcurrentRequests":49},{"id":"qwen-3-6-35b-a3b-bf16-monday-peak-random-4k","date":"2026-08-08","metrics":{"e2eMs":{"p50":103852.06,"p90":188843.2,"p95":195927.77,"p99":206628.24,"mean":106518.69},"tpotMs":{"p50":212.24,"p90":222.4,"p95":228.02,"p99":243.51,"mean":210.62},"ttftMs":{"p50":1849.48,"p90":3162.23,"p95":5856.33,"p99":14857.21,"mean":2318}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":0.227,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":1022.33,"peakConcurrentRequests":28}],"rateSweep":{"date":"2026-08-08","capacity":{"slo2000":null,"slo5000":{"outputTps":114.7,"ttftP95Ms":4686.7,"achievedRps":0.233,"configuredRps":0.3,"peakConcurrent":42},"slo10000":{"outputTps":158.7,"ttftP95Ms":6835.3,"achievedRps":0.324,"configuredRps":0.5,"peakConcurrent":86}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/qwen-3.6/qwen-3.6-35b-a3b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}