L' Arena.
38 modèles.
1 DGX Spark.

Compare les modèles ouverts sur DGX Spark avec un score indicatif : 70% de qualité externe, 20% de débit et 10% d’efficacité mémoire. Choisis une charge et consulte les mesures. Des données de qualité incomplètes ne donnent aucun score total.

Classe de taille

Comparaison active : Score d’adéquation (indicatif) · Agrégat

Le score indicatif donne le plus de poids à la qualité. Un petit modèle rapide ne réalise pas forcément bien ta tâche. Les tests externes ne sont pas interchangeables et ne valident pas ta précision locale.

Sélectionner # Model Size Context VRAM Connaissances Raisonnement Code Throughput Score d’adéquation (indicatif) Détails
11 Nemotron-Cascade-2 30B-A3B nvidia · MoE · BF16 30B 1000K 60 GB 79,8MMLU-Pro 76,1GPQA-Diamond 87,2LiveCodeBench v6 62t/s 62,8
12 Qwen-3.6 27B alibaba · Hybrid · BF16 27B 256K 54 GB 86,2MMLU-Pro 87,8GPQA-Diamond 83,9LiveCodeBench v6 26t/s 62,7
13 Qwen-3.5 9B alibaba · Dense · BF16 9B 256K 18 GB 82,5MMLU-Pro 81,7GPQA-Diamond 65,6LiveCodeBench v6 84t/s 62,6
14 Gemma-4 31B google · Dense · NVFP4 31B 256K 22 GB 85,2MMLU-Pro 84,3GPQA-Diamond 80LiveCodeBench v6 26t/s 60,9
15 Gemma-4 31B google · Dense · BF16 31B 256K 62 GB 85,2MMLU-Pro 84,3GPQA-Diamond 80LiveCodeBench v6 15t/s 59,7
16 Gemma-4 E4B google · Dense · BF16 4,5B 128K 9 GB 69,4MMLU-Pro 58,6GPQA-Diamond 52LiveCodeBench v6 101t/s 54,1
gpt-oss-20b openai · MoE · MXFP4 21B 128K 14 GB 85,3MMLU 71,5GPQA-Diamond 130t/s Non disponible
Granite-4.1 8B ibm · Dense · BF16 8B 128K 16 GB 56MMLU-Pro 42GPQA 85,4HumanEval 59t/s Non disponible
KAT-Coder V2.5 kwaipilot · MoE · BF16 35B 256K 70 GB 60t/s Non disponible
LFM2.5 2.6B liquidai · Hybrid · BF16 2,7B 32K 5 GB 59,4LiveCodeBench v6 235t/s Non disponible

L’axe horizontal indique le débit total pour la charge choisie. L’axe vertical indique la qualité externe moyenne de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur une échelle fixe de 0 à 100. Seuls les modèles disposant de ces tests, d’une mesure pour la charge et de données mémoire valides apparaissent. La frontière bleue montre les modèles pour lesquels aucun autre modèle filtré n’est au moins aussi rapide et aussi bien noté, avec une amélioration stricte sur un axe. Ce n’est pas le score total : l’efficacité mémoire intervient aussi dans ce dernier.

Affichés : 16 sur 38 modèles.

Sur la frontière de Pareto Dominé VRAM (petit → grand)

Chaque bulle représente un profil de modèle. Le bleu marque la frontière de Pareto. Pour un modèle gris, un autre modèle filtré est au moins aussi bon en vitesse et en qualité externe, et meilleur sur l’un de ces axes. Une bulle plus grande indique davantage de mémoire pour les poids. Ouvre les explications de la légende pour les définitions précises.

Valeurs du graphique en tableau
Model t/s Qualité externe GB Score d’adéquation
Qwen-3.6 35B-A3B · NVFP4 130,8 83,9 24 72,3
Qwen-3.6 35B-A3B · FP8 100,2 83,9 38 68,8
Gemma-4 26B-A4B · NVFP4 110,5 81,5 24 68,5
Gemma-4 26B-A4B · NVFP4 111,2 80,7 18 68,4
Qwen-3.5 4B · BF16 146 70,4 8 67,3
Qwen-3.6 35B-A3B · BF16 62,3 83,9 70 64,8
Gemma-4 E2B · BF16 212,3 49,1 5 64,4
Qwen-3.6 27B · FP8 35,5 86 31 63,8
Gemma-4 26B-A4B · BF16 65,7 80,7 52 62,9
Gemma-4 26B-A4B · BF16 64,5 80,7 52 62,8
Nemotron-Cascade-2 30B-A3B · BF16 62,3 81 60 62,8
Qwen-3.6 27B · BF16 25,7 86 54 62,7
Qwen-3.5 9B · BF16 84,2 76,6 18 62,6
Gemma-4 31B · NVFP4 25,7 83,2 22 60,9
Gemma-4 31B · BF16 15 83,2 62 59,7
Gemma-4 E4B · BF16 100,5 60 9 54,1

Score d’adéquation (indicatif)

70% qualité + 20% débit + 10% débit par Go. La qualité est la moyenne non pondérée de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur leurs échelles originales de 0 à 100. Les trois tests sont requis ; une mesure absente ou un autre test ne donne aucun score total. Débit et efficacité sont normalisés sur tous les modèles ayant ces données de qualité et une mesure pour la charge choisie, indépendamment du filtre. L’agrégat exige les six tests closed-loop. Cette pondération éditoriale n’est pas notre propre évaluation : les paramètres des fournisseurs peuvent différer et ne valident pas ta précision. Non disponible signifie données comparables insuffisantes, pas mauvais modèle.

Explication du score matériel

Le score matériel optionnel utilise seulement le débit et le débit par Go, avec des poids propres à chaque charge. Cette ancienne mesure technique n’évalue pas la qualité des réponses et sa normalisation diffère du score d’adéquation.

Explication