Mesuré le 2026-08-09 avec vLLM v0.26.0. Dans le test de chat avec dix requêtes simultanées, ce profil atteint 42,31 tokens/s par utilisateur, avec en moyenne 0,86 secondes jusqu'au premier token. À 25k de contexte, cette attente moyenne monte à 15,14 secondes. Ces runs mesurent la vitesse et l'attente, pas la qualité des réponses.
—
Score d’adéquation (indicatif)
—
Throughput tok/s
8 GB
VRAM
0/11
Benches fiables
Hugging Face →·vLLM v0.26.0·DGX Spark, NVIDIA GB10, 128 GB unified memory·Mesuré avec un contexte de 128K·Dernière mesure 9 août 2026
02Vendor quality · référence uniquement
Connaissances : MMLU-Pro ; raisonnement : GPQA-Diamond ; code : LiveCodeBench v6. Chaque chiffre indique son test exact. Les autres tests et les mesures absentes ne permettent pas de score total. Ces chiffres externes ne sont pas notre propre évaluation de cette précision. Source : fiche modèle du fournisseur ↗
3/3
Couverture
70,7
MMLU
53,4
GPQA-Diamond
54,8
LiveCodeBench
03Performance · BF16
Decode throughput · total t/s · c=10
■ BF16
1k ctx BF16—
8k ctx BF16—
4k+turn BF16—
25k ctx BF16—
04Test suite · 11 benchmarks
6 tests closed-loop avec llama-benchy et 5 tests open-loop avec vllm bench serve. Seules les exécutions complètes sans échec des contrôles de cohérence sont retenues ; les tests open-loop exigent au moins 99 % de requêtes réussies. Les résultats bruts restent visibles. Déplie « view command » pour la commande reconstruite. Méthodologie →
01 · llama-benchyclosed-loop
Chat
Invite courte, réponse longue. La forme qui doit ressembler à une conversation normale ; le TTFT décide si cela paraît réactif.
pp (prompt)
1024
tg (gen)
1024
depth
0
concurrency
1 · 5 · 10
repeats
3
Tokens/sec · par utilisateur
42,3t/s
TTFT · mean
864ms
Échec du contrôle de cohérence
3 repeats · mean ± stddevview command →hide command ↑
Test de résistance avec de grandes invites. Pas forcément du matériel de chat, mais exactement là où le mur du préremplissage apparaît et où le TTFT s'effondre.
pp (prompt)
4096 · 8192 · 16384 · 25000
tg (gen)
256
depth
0
concurrency
1 · 5 · 10
repeats
3
Tokens/sec · par utilisateur
6,3t/s
TTFT · mean
15,14s
Échec du contrôle de cohérence
3 repeats · mean ± stddevview command →hide command ↑
ShareGPT V3, en moyenne 228 tokens par tour, variant naturellement selon la conversation. Ce que font les vrais utilisateurs, pas une distribution synthétique.
dataset
sharegpt
rate (req/s)
0.3
prompts
250
burstiness
0.7
Tokens/sec · par utilisateur
18,1t/s
TTFT · p50
69ms
Request success 100% · Échec du contrôle de cohérence
Longues chaînes de pensée, 1k en entrée et 4k en sortie, taux d'arrivée lent de 0,2 car chaque requête coûte beaucoup de budget de décodage. Vérifie si le TTFT reste stable.
dataset
random
input / output
1024 / 4096
rate (req/s)
0.2
prompts
50
burstiness
1
Tokens/sec · par utilisateur
11,4t/s
TTFT · p50
423ms
Request success 100% · Échec du contrôle de cohérence
Aléatoire, 4000 en entrée et 500 en sortie, taux d'arrivée de 1,5 par seconde avec une irrégularité de 1,0 et 25 en parallèle au maximum. Un flux de requêtes indépendant et soutenu.
dataset
random
input / output
4000 / 500
rate (req/s)
1.5
prompts
300
burstiness
1
max parallel
25
Tokens/sec · par utilisateur
80,5t/s
TTFT · p50
803ms
Request success 100% · Échec du contrôle de cohérence
La mesure de chat est exclue car le contrôle de cohérence a échoué. Les tokens/s présents ne prouvent donc aucune sortie de modèle utilisable.
Contexte long
Attente à 25k de contexte
Le test avec 25k tokens d'entrée est également exclu. Les résultats bruts figurent avec le test, mais ne constituent pas une base valable pour une recommandation de performance.
Charge de pointe
Requêtes et attente en charge de pointe
La mesure de pointe est exclue par l'échec du contrôle de cohérence. Une requête HTTP réussie n'est pas la même chose qu'une réponse utilisable.
Couverture des mesures
Quelles mesures comptent
0 des 11 tests ont une mesure qui compte selon les règles actuelles de l'Arena. Le contrôle de cohérence a échoué. Ce run est donc exclu du classement ; les chiffres bruts restent visibles à titre d'inspection uniquement. Interrompu : 11-rate-sweep.