L' Arena.
38 modèles.
1 DGX Spark.

Compare les modèles ouverts sur DGX Spark avec un score indicatif : 70% de qualité externe, 20% de débit et 10% d’efficacité mémoire. Choisis une charge et consulte les mesures. Des données de qualité incomplètes ne donnent aucun score total.

Classe de taille

Comparaison active : Score d’adéquation (indicatif) · Agrégat

Le score indicatif donne le plus de poids à la qualité. Un petit modèle rapide ne réalise pas forcément bien ta tâche. Les tests externes ne sont pas interchangeables et ne valident pas ta précision locale.

Sélectionner # Model Size Context VRAM Connaissances Raisonnement Code Throughput Score d’adéquation (indicatif) Détails
Ministral-3 3B mistral · Dense · BF16 3B 256K 8 GB 70,7MMLU 53,4GPQA-Diamond 54,8LiveCodeBench t/s Non disponible
Ministral-3 8B mistral · Dense · BF16 8B 256K 18 GB 76,1MMLU 66,8GPQA-Diamond 61,6LiveCodeBench 119t/s Non disponible
Mistral-Small 4 119B mistral · MoE · NVFP4 119B 256K 83 GB 71,2GPQA-Diamond 60t/s Non disponible
Muse-Glimmer 30B meta · Dense · BF16 30B 128K 60 GB 83,5GPQA-Diamond 29t/s Non disponible
Muse-Glimmer 30B meta · Dense · BF16 30B 128K 60 GB 83,5GPQA-Diamond 52t/s Non disponible
Nemotron-3-Nano 30B-A3B nvidia · MoE · BF16 30B 256K 62 GB 77,3MMLU-Pro 72,2GPQA-Diamond 63,2LiveCodeBench v5 62t/s Non disponible
Nemotron-3-Nano 30B-A3B nvidia · MoE · FP8 30B 256K 33 GB 77,3MMLU-Pro 72,2GPQA-Diamond 63,2LiveCodeBench v5 103t/s Non disponible
Nemotron-3-Nano 4B nvidia · Dense · BF16 4B 256K 8 GB 18,1MMLU-Pro 51,3GPQA-Diamond 51,8LiveCodeBench 147t/s Non disponible
Nemotron-3-Nano 4B nvidia · Dense · FP8 4B 256K 4 GB 18,1MMLU-Pro 51,3GPQA-Diamond 51,8LiveCodeBench 201t/s Non disponible
Nemotron-3 Nano Omni 30B-A3B nvidia · MoE · BF16 30B 256K 60 GB 60t/s Non disponible

L’axe horizontal indique le débit total pour la charge choisie. L’axe vertical indique la qualité externe moyenne de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur une échelle fixe de 0 à 100. Seuls les modèles disposant de ces tests, d’une mesure pour la charge et de données mémoire valides apparaissent. La frontière bleue montre les modèles pour lesquels aucun autre modèle filtré n’est au moins aussi rapide et aussi bien noté, avec une amélioration stricte sur un axe. Ce n’est pas le score total : l’efficacité mémoire intervient aussi dans ce dernier.

Affichés : 16 sur 38 modèles.

Sur la frontière de Pareto Dominé VRAM (petit → grand)

Chaque bulle représente un profil de modèle. Le bleu marque la frontière de Pareto. Pour un modèle gris, un autre modèle filtré est au moins aussi bon en vitesse et en qualité externe, et meilleur sur l’un de ces axes. Une bulle plus grande indique davantage de mémoire pour les poids. Ouvre les explications de la légende pour les définitions précises.

Valeurs du graphique en tableau
Model t/s Qualité externe GB Score d’adéquation
Qwen-3.6 35B-A3B · NVFP4 130,8 83,9 24 72,3
Qwen-3.6 35B-A3B · FP8 100,2 83,9 38 68,8
Gemma-4 26B-A4B · NVFP4 110,5 81,5 24 68,5
Gemma-4 26B-A4B · NVFP4 111,2 80,7 18 68,4
Qwen-3.5 4B · BF16 146 70,4 8 67,3
Qwen-3.6 35B-A3B · BF16 62,3 83,9 70 64,8
Gemma-4 E2B · BF16 212,3 49,1 5 64,4
Qwen-3.6 27B · FP8 35,5 86 31 63,8
Gemma-4 26B-A4B · BF16 65,7 80,7 52 62,9
Gemma-4 26B-A4B · BF16 64,5 80,7 52 62,8
Nemotron-Cascade-2 30B-A3B · BF16 62,3 81 60 62,8
Qwen-3.6 27B · BF16 25,7 86 54 62,7
Qwen-3.5 9B · BF16 84,2 76,6 18 62,6
Gemma-4 31B · NVFP4 25,7 83,2 22 60,9
Gemma-4 31B · BF16 15 83,2 62 59,7
Gemma-4 E4B · BF16 100,5 60 9 54,1

Score d’adéquation (indicatif)

70% qualité + 20% débit + 10% débit par Go. La qualité est la moyenne non pondérée de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur leurs échelles originales de 0 à 100. Les trois tests sont requis ; une mesure absente ou un autre test ne donne aucun score total. Débit et efficacité sont normalisés sur tous les modèles ayant ces données de qualité et une mesure pour la charge choisie, indépendamment du filtre. L’agrégat exige les six tests closed-loop. Cette pondération éditoriale n’est pas notre propre évaluation : les paramètres des fournisseurs peuvent différer et ne valident pas ta précision. Non disponible signifie données comparables insuffisantes, pas mauvais modèle.

Explication du score matériel

Le score matériel optionnel utilise seulement le débit et le débit par Go, avec des poids propres à chaque charge. Cette ancienne mesure technique n’évalue pas la qualité des réponses et sa normalisation diffère du score d’adéquation.

Explication