L' Arena.
38 modèles.
1 DGX Spark.

Compare les modèles ouverts sur DGX Spark avec un score indicatif : 70% de qualité externe, 20% de débit et 10% d’efficacité mémoire. Choisis une charge et consulte les mesures. Des données de qualité incomplètes ne donnent aucun score total.

Classe de taille

Comparaison active : Score d’adéquation (indicatif) · Agrégat

Le score indicatif donne le plus de poids à la qualité. Un petit modèle rapide ne réalise pas forcément bien ta tâche. Les tests externes ne sont pas interchangeables et ne valident pas ta précision locale.

Sélectionner # Model Size Context VRAM Connaissances Raisonnement Code Throughput Score d’adéquation (indicatif) Détails
Nemotron-3 Nano Omni 30B-A3B nvidia · MoE · FP8 30B 256K 33 GB 109t/s Non disponible
Nemotron-3 Nano Omni 30B-A3B nvidia · MoE · NVFP4 30B 256K 21 GB 145t/s Non disponible
Nemotron-3-Nano 30B-A3B nvidia · MoE · NVFP4 30B 256K 21 GB 77,3MMLU-Pro 72,2GPQA-Diamond 63,2LiveCodeBench v5 144t/s Non disponible
Nemotron-3-Super 120B-A12B nvidia · MoE · NVFP4 120B 256K 60 GB 83,7MMLU-Pro 79,2GPQA 81,2LiveCodeBench v5 45t/s Non disponible
Qwen-3.8 27B alibaba · Dense · BF16 27B 256K 54 GB 89,2GPQA-Diamond 90,3LiveCodeBench v6 27t/s Non disponible
Qwen-3.8 27B alibaba · Dense · FP8 27B 256K 30 GB 89,2GPQA-Diamond 90,3LiveCodeBench v6 38t/s Non disponible
Qwen-3.5 0.8B alibaba · Hybrid · BF16 0,8B 256K 2 GB 29,7MMLU-Pro 11,9GPQA 461t/s Non disponible
Qwen-3.5 2B alibaba · Hybrid · BF16 2B 256K 4 GB 55,3MMLU-Pro 30,4SuperGPQA 243t/s Non disponible

L’axe horizontal indique le débit total pour la charge choisie. L’axe vertical indique la qualité externe moyenne de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur une échelle fixe de 0 à 100. Seuls les modèles disposant de ces tests, d’une mesure pour la charge et de données mémoire valides apparaissent. La frontière bleue montre les modèles pour lesquels aucun autre modèle filtré n’est au moins aussi rapide et aussi bien noté, avec une amélioration stricte sur un axe. Ce n’est pas le score total : l’efficacité mémoire intervient aussi dans ce dernier.

Affichés : 16 sur 38 modèles.

Sur la frontière de Pareto Dominé VRAM (petit → grand)

Chaque bulle représente un profil de modèle. Le bleu marque la frontière de Pareto. Pour un modèle gris, un autre modèle filtré est au moins aussi bon en vitesse et en qualité externe, et meilleur sur l’un de ces axes. Une bulle plus grande indique davantage de mémoire pour les poids. Ouvre les explications de la légende pour les définitions précises.

Valeurs du graphique en tableau
Model t/s Qualité externe GB Score d’adéquation
Qwen-3.6 35B-A3B · NVFP4 130,8 83,9 24 72,3
Qwen-3.6 35B-A3B · FP8 100,2 83,9 38 68,8
Gemma-4 26B-A4B · NVFP4 110,5 81,5 24 68,5
Gemma-4 26B-A4B · NVFP4 111,2 80,7 18 68,4
Qwen-3.5 4B · BF16 146 70,4 8 67,3
Qwen-3.6 35B-A3B · BF16 62,3 83,9 70 64,8
Gemma-4 E2B · BF16 212,3 49,1 5 64,4
Qwen-3.6 27B · FP8 35,5 86 31 63,8
Gemma-4 26B-A4B · BF16 65,7 80,7 52 62,9
Gemma-4 26B-A4B · BF16 64,5 80,7 52 62,8
Nemotron-Cascade-2 30B-A3B · BF16 62,3 81 60 62,8
Qwen-3.6 27B · BF16 25,7 86 54 62,7
Qwen-3.5 9B · BF16 84,2 76,6 18 62,6
Gemma-4 31B · NVFP4 25,7 83,2 22 60,9
Gemma-4 31B · BF16 15 83,2 62 59,7
Gemma-4 E4B · BF16 100,5 60 9 54,1

Score d’adéquation (indicatif)

70% qualité + 20% débit + 10% débit par Go. La qualité est la moyenne non pondérée de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur leurs échelles originales de 0 à 100. Les trois tests sont requis ; une mesure absente ou un autre test ne donne aucun score total. Débit et efficacité sont normalisés sur tous les modèles ayant ces données de qualité et une mesure pour la charge choisie, indépendamment du filtre. L’agrégat exige les six tests closed-loop. Cette pondération éditoriale n’est pas notre propre évaluation : les paramètres des fournisseurs peuvent différer et ne valident pas ta précision. Non disponible signifie données comparables insuffisantes, pas mauvais modèle.

Explication du score matériel

Le score matériel optionnel utilise seulement le débit et le débit par Go, avec des poids propres à chaque charge. Cette ancienne mesure technique n’évalue pas la qualité des réponses et sa normalisation diffère du score d’adéquation.

Explication