{"name":"LFM2.5 2.6B","arena":{"id":"lfm2-5-2-6b-bf16","name":"LFM2.5 2.6B","vram":5,"params":2.7,"vendor":"liquidai","quality":{"coding":{"bench":"LiveCodeBench v6","value":59.41},"science":null,"knowledge":null},"contextK":32},"notes":"Model-ID: LiquidAI/LFM2.5-2.6B. Container: vllm/vllm-openai:v0.26.0-aarch64-cu129-ubuntu2404. llama-benchy 0.4.0. Bronrun: 2026-08-08T16:02:15+02:00. KV-cache fp8; max_model_len 32768; gpu_memory_utilization 0,9. Prefix caching uit; async scheduling aan. Extra serverflags: --max-num-batched-tokens 8192. 11 van de 11 tests hebben een meting die volgens de huidige Arena-regels meetelt. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","order":120,"engine":"vLLM v0.26.0","verdict":"Gemeten op 2026-08-08 met vLLM v0.26.0. In de chattest met tien gelijktijdige verzoeken haalt dit profiel 37,87 tokens/s per gebruiker, met gemiddeld 0,75 seconden tot het eerste token. Bij 25k context stijgt die gemiddelde wachttijd naar 11 seconden. Bij deze historische run is geen sanity-check vastgelegd. Dat bewijs ontbreekt, ook wanneer de snelheidsmeting volgens de huidige regels meetelt.","hardware":"DGX Spark, NVIDIA GB10, 128 GB unified memory","modelUrl":"https://huggingface.co/LiquidAI/LFM2.5-2.6B","provider":"LiquidAI","precision":"BF16","parameters":"2.7B","provenance":{"modelId":"LiquidAI/LFM2.5-2.6B","runPath":"results/lfm2.5/lfm2.5-2.6b/bf16","validity":{"tests":{"01-chat":"complete","02-rag-8k":"complete","08-sharegpt":"complete","09-reasoning":"complete","04-multi-turn":"complete","11-rate-sweep":"complete","03-long-output":"complete","05-big-context":"complete","10-monday-peak":"complete","07-office-baseline":"complete","06-concurrency-stress":"complete"},"sanity":"not_recorded"},"sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","servedName":"lfm2-5-2-6b-bf16","generatedAt":"2026-08-08T16:02:15+02:00","runRevision":"a948cec23b054c62fef595bad3cdb284066922ac","vllmVersion":"0.26.0","suiteVersion":"2026-08","repositoryUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks","contractVersion":1,"contractRevision":"a948cec23b054c62fef595bad3cdb284066922ac","commandProvenance":"reconstructed_from_raw_artifacts","llamaBenchyVersion":"0.4.0"},"architecture":"Hybrid","measuredContextK":32,"benchmarkResults":[{"id":"lfm2-5-2-6b-bf16-chat-1k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":0.75,"stddev":0.398},"decodeTokensPerSecondTotal":{"mean":369.81,"stddev":8.71},"prefillTokensPerSecondTotal":{"mean":10236.95,"stddev":2970.88},"decodeTokensPerSecondPerUser":{"mean":37.87,"stddev":0.7}},"sourceRun":"Test 01","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","workloadId":"chat-1k","sourceLabel":"LiquidAI/LFM2.5-2.6B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"01-chat","prefixCaching":false},{"id":"lfm2-5-2-6b-bf16-rag-8k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":3.345,"stddev":1.728},"decodeTokensPerSecondTotal":{"mean":254.87,"stddev":3.89},"prefillTokensPerSecondTotal":{"mean":12986.66,"stddev":39.52},"decodeTokensPerSecondPerUser":{"mean":30.01,"stddev":2.96}},"sourceRun":"Test 02","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","workloadId":"rag-8k","sourceLabel":"LiquidAI/LFM2.5-2.6B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"02-rag-8k","prefixCaching":false},{"id":"lfm2-5-2-6b-bf16-long-output-agents","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":0.214,"stddev":0.055},"decodeTokensPerSecondTotal":{"mean":242.59,"stddev":2.3},"prefillTokensPerSecondTotal":{"mean":10131.93,"stddev":74.05},"decodeTokensPerSecondPerUser":{"mean":38.63,"stddev":0.19}},"sourceRun":"Test 03","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","workloadId":"long-output-agents","sourceLabel":"LiquidAI/LFM2.5-2.6B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"03-long-output","prefixCaching":false},{"id":"lfm2-5-2-6b-bf16-multi-turn-office","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":1.044,"stddev":0.405},"decodeTokensPerSecondTotal":{"mean":345.22,"stddev":6.89},"prefillTokensPerSecondTotal":{"mean":13106,"stddev":17.82},"decodeTokensPerSecondPerUser":{"mean":36.76,"stddev":1.28}},"sourceRun":"Test 04","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","workloadId":"multi-turn-office","sourceLabel":"LiquidAI/LFM2.5-2.6B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"04-multi-turn","prefixCaching":false},{"id":"lfm2-5-2-6b-bf16-large-context-25k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":10.998,"stddev":5.659},"decodeTokensPerSecondTotal":{"mean":96.18,"stddev":1.21},"prefillTokensPerSecondTotal":{"mean":11607.51,"stddev":252.46},"decodeTokensPerSecondPerUser":{"mean":16.59,"stddev":5.98}},"sourceRun":"Test 05","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","workloadId":"large-context-25k","sourceLabel":"LiquidAI/LFM2.5-2.6B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"05-big-context","prefixCaching":false},{"id":"lfm2-5-2-6b-bf16-concurrency-stress-25k","date":"2026-08-08","runs":3,"metrics":{"ttfrSec":{"mean":21.23,"stddev":11.585},"decodeTokensPerSecondTotal":{"mean":102.14,"stddev":0.91},"prefillTokensPerSecondTotal":{"mean":11436.62,"stddev":22.89},"decodeTokensPerSecondPerUser":{"mean":10.06,"stddev":4.54}},"sourceRun":"Test 06","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","workloadId":"concurrency-stress-25k","sourceLabel":"LiquidAI/LFM2.5-2.6B bf16 op de DGX Spark","sourceStatus":"complete","sourceTestId":"06-concurrency-stress","prefixCaching":false}],"openLoopResults":[{"id":"lfm2-5-2-6b-bf16-office-random-4k","date":"2026-08-08","metrics":{"e2eMs":{"p50":14203.3,"p90":24993.55,"p95":26831.1,"p99":29251.93,"mean":14670.36},"tpotMs":{"p50":29.1,"p90":32.27,"p95":33.5,"p99":36.43,"mean":29.25},"ttftMs":{"p50":467.12,"p90":829.43,"p95":934.33,"p99":1409.39,"mean":494.69}},"sourceRun":"Test 07","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","scenarioId":"office-random-4k","achievedRps":0.294,"sourceStatus":"complete","sourceTestId":"07-office-baseline","configuredRps":0.3,"prefixCaching":false,"totalRequests":200,"successfulRequests":200,"totalTokenThroughput":1340.83,"peakConcurrentRequests":11},{"id":"lfm2-5-2-6b-bf16-sharegpt-replay","date":"2026-08-08","metrics":{"e2eMs":{"p50":3591.96,"p90":12904.04,"p95":16824.94,"p99":20651.13,"mean":5408.06},"tpotMs":{"p50":25.03,"p90":29.8,"p95":30.33,"p99":30.56,"mean":25.88},"ttftMs":{"p50":85.8,"p90":112.56,"p95":123.28,"p99":142.18,"mean":86.52}},"sourceRun":"Test 08","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","scenarioId":"sharegpt-replay","achievedRps":0.298,"sourceStatus":"complete","sourceTestId":"08-sharegpt","configuredRps":0.3,"prefixCaching":false,"totalRequests":250,"successfulRequests":250,"totalTokenThroughput":129.89,"peakConcurrentRequests":7},{"id":"lfm2-5-2-6b-bf16-reasoning","date":"2026-08-08","metrics":{"e2eMs":{"p50":128325.79,"p90":212356.15,"p95":233295.1,"p99":242677.43,"mean":133696.17},"tpotMs":{"p50":32.45,"p90":34.08,"p95":34.32,"p99":34.4,"mean":31.86},"ttftMs":{"p50":173.73,"p90":223.16,"p95":227.53,"p99":240.03,"mean":166.81}},"sourceRun":"Test 09","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","scenarioId":"reasoning","achievedRps":0.112,"sourceStatus":"complete","sourceTestId":"09-reasoning","configuredRps":0.2,"prefixCaching":false,"totalRequests":50,"successfulRequests":50,"totalTokenThroughput":593.82,"peakConcurrentRequests":27},{"id":"lfm2-5-2-6b-bf16-monday-peak-random-4k","date":"2026-08-08","metrics":{"e2eMs":{"p50":24051.74,"p90":43474.9,"p95":44880.75,"p99":46925.91,"mean":24360.15},"tpotMs":{"p50":48.55,"p90":51.88,"p95":54.14,"p99":60.93,"mean":48.13},"ttftMs":{"p50":454.18,"p90":728.76,"p95":956.49,"p99":1503.43,"mean":482.61}},"sourceRun":"Test 10","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","scenarioId":"monday-peak-random-4k","achievedRps":0.962,"sourceStatus":"complete","sourceTestId":"10-monday-peak","configuredRps":1.5,"prefixCaching":false,"totalRequests":300,"successfulRequests":300,"totalTokenThroughput":4331.87,"peakConcurrentRequests":29}],"rateSweep":{"date":"2026-08-08","capacity":{"slo2000":{"outputTps":447.3,"ttftP95Ms":1356.9,"achievedRps":0.909,"configuredRps":1,"peakConcurrent":35},"slo5000":{"outputTps":447.3,"ttftP95Ms":1356.9,"achievedRps":0.909,"configuredRps":1,"peakConcurrent":35},"slo10000":{"outputTps":447.3,"ttftP95Ms":1356.9,"achievedRps":0.909,"configuredRps":1,"peakConcurrent":35}},"sourceRun":"Test 11","sourceUrl":"https://github.com/djangodevreng/dgx-spark-benchmarks/tree/a948cec23b054c62fef595bad3cdb284066922ac/results/lfm2.5/lfm2.5-2.6b/bf16/","abortedAtRps":null,"queueKneeRps":null,"sourceStatus":"complete","sourceTestId":"11-rate-sweep","totalRequests":850,"successfulRequests":850}}