L' Arena.
38 modèles.
1 DGX Spark.
Compare les modèles ouverts sur DGX Spark avec un score indicatif : 70% de qualité externe, 20% de débit et 10% d’efficacité mémoire. Choisis une charge et consulte les mesures. Des données de qualité incomplètes ne donnent aucun score total.
Comparaison active : Score d’adéquation (indicatif) · Agrégat
Le score indicatif donne le plus de poids à la qualité. Un petit modèle rapide ne réalise pas forcément bien ta tâche. Les tests externes ne sont pas interchangeables et ne valident pas ta précision locale.
| Sélectionner | # | Model | Size | Context | VRAM | Connaissances | Raisonnement | Code | Throughput | Score d’adéquation (indicatif) | Détails |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 01 | Qwen-3.6 35B-A3B alibaba · MoE · NVFP4 | 35B | 256K | 24 GB | 85,2MMLU-Pro | 86GPQA-Diamond | 80,4LiveCodeBench v6 | 131t/s | 72,3 | ||
| 02 | Qwen-3.6 35B-A3B alibaba · MoE · FP8 | 35B | 256K | 38 GB | 85,2MMLU-Pro | 86GPQA-Diamond | 80,4LiveCodeBench v6 | 100t/s | 68,8 | ||
| 03 | Gemma-4 26B-A4B google · MoE · NVFP4 | 26B | 256K | 24 GB | 84,8MMLU-Pro | 79,9GPQA-Diamond | 79,8LiveCodeBench v6 | 111t/s | 68,5 | ||
| 04 | Gemma-4 26B-A4B google · MoE · NVFP4 | 26B | 256K | 18 GB | 82,6MMLU-Pro | 82,3GPQA-Diamond | 77,1LiveCodeBench v6 | 111t/s | 68,4 | ||
| 05 | Qwen-3.5 4B alibaba · Hybrid · BF16 | 4B | 256K | 8 GB | 79,1MMLU-Pro | 76,2GPQA-Diamond | 55,8LiveCodeBench v6 | 146t/s | 67,3 | ||
| 06 | Qwen-3.6 35B-A3B alibaba · MoE · BF16 | 35B | 256K | 70 GB | 85,2MMLU-Pro | 86GPQA-Diamond | 80,4LiveCodeBench v6 | 62t/s | 64,8 | ||
| 07 | Gemma-4 E2B google · Dense · BF16 | 2,3B | 128K | 5 GB | 60MMLU-Pro | 43,4GPQA-Diamond | 44LiveCodeBench v6 | 212t/s | 64,4 | ||
| 08 | Qwen-3.6 27B alibaba · Hybrid · FP8 | 27B | 256K | 31 GB | 86,2MMLU-Pro | 87,8GPQA-Diamond | 83,9LiveCodeBench v6 | 36t/s | 63,8 | ||
| 09 | Gemma-4 26B-A4B google · MoE · BF16 | 26B | 256K | 52 GB | 82,6MMLU-Pro | 82,3GPQA-Diamond | 77,1LiveCodeBench v6 | 66t/s | 62,9 | ||
| 10 | Gemma-4 26B-A4B google · MoE · BF16 | 26B | 256K | 52 GB | 82,6MMLU-Pro | 82,3GPQA-Diamond | 77,1LiveCodeBench v6 | 65t/s | 62,8 |
L’axe horizontal indique le débit total pour la charge choisie. L’axe vertical indique la qualité externe moyenne de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur une échelle fixe de 0 à 100. Seuls les modèles disposant de ces tests, d’une mesure pour la charge et de données mémoire valides apparaissent. La frontière bleue montre les modèles pour lesquels aucun autre modèle filtré n’est au moins aussi rapide et aussi bien noté, avec une amélioration stricte sur un axe. Ce n’est pas le score total : l’efficacité mémoire intervient aussi dans ce dernier.
Affichés : 16 sur 38 modèles.
Chaque bulle représente un profil de modèle. Le bleu marque la frontière de Pareto. Pour un modèle gris, un autre modèle filtré est au moins aussi bon en vitesse et en qualité externe, et meilleur sur l’un de ces axes. Une bulle plus grande indique davantage de mémoire pour les poids. Ouvre les explications de la légende pour les définitions précises.
Valeurs du graphique en tableau
| Model | t/s | Qualité externe | GB | Score d’adéquation |
|---|---|---|---|---|
| Qwen-3.6 35B-A3B · NVFP4 | 130,8 | 83,9 | 24 | 72,3 |
| Qwen-3.6 35B-A3B · FP8 | 100,2 | 83,9 | 38 | 68,8 |
| Gemma-4 26B-A4B · NVFP4 | 110,5 | 81,5 | 24 | 68,5 |
| Gemma-4 26B-A4B · NVFP4 | 111,2 | 80,7 | 18 | 68,4 |
| Qwen-3.5 4B · BF16 | 146 | 70,4 | 8 | 67,3 |
| Qwen-3.6 35B-A3B · BF16 | 62,3 | 83,9 | 70 | 64,8 |
| Gemma-4 E2B · BF16 | 212,3 | 49,1 | 5 | 64,4 |
| Qwen-3.6 27B · FP8 | 35,5 | 86 | 31 | 63,8 |
| Gemma-4 26B-A4B · BF16 | 65,7 | 80,7 | 52 | 62,9 |
| Gemma-4 26B-A4B · BF16 | 64,5 | 80,7 | 52 | 62,8 |
| Nemotron-Cascade-2 30B-A3B · BF16 | 62,3 | 81 | 60 | 62,8 |
| Qwen-3.6 27B · BF16 | 25,7 | 86 | 54 | 62,7 |
| Qwen-3.5 9B · BF16 | 84,2 | 76,6 | 18 | 62,6 |
| Gemma-4 31B · NVFP4 | 25,7 | 83,2 | 22 | 60,9 |
| Gemma-4 31B · BF16 | 15 | 83,2 | 62 | 59,7 |
| Gemma-4 E4B · BF16 | 100,5 | 60 | 9 | 54,1 |
Score d’adéquation (indicatif)
70% qualité + 20% débit + 10% débit par Go. La qualité est la moyenne non pondérée de MMLU-Pro, GPQA-Diamond et LiveCodeBench v6 sur leurs échelles originales de 0 à 100. Les trois tests sont requis ; une mesure absente ou un autre test ne donne aucun score total. Débit et efficacité sont normalisés sur tous les modèles ayant ces données de qualité et une mesure pour la charge choisie, indépendamment du filtre. L’agrégat exige les six tests closed-loop. Cette pondération éditoriale n’est pas notre propre évaluation : les paramètres des fournisseurs peuvent différer et ne valident pas ta précision. Non disponible signifie données comparables insuffisantes, pas mauvais modèle.
Explication du score matériel
Le score matériel optionnel utilise seulement le débit et le débit par Go, avec des poids propres à chaque charge. Cette ancienne mesure technique n’évalue pas la qualité des réponses et sa normalisation diffère du score d’adéquation.